O Futuro Chegou: Robôs Ganham Inteligência de Corpo Inteiro com Gemini Robotics 2 da Google DeepMind!
Olá, pessoal! Aqui é o Lucas Tech e, olha, preparem-se porque a Google DeepMind acabou de lançar algo que pode virar a chave no mundo da robótica! Esqueçam aqueles robôs que só fazem uma coisinha chata na mesa. Estamos falando de inteligência de corpo inteiro, dedos super ágeis e até trabalho em equipe! O Gemini Robotics 2 é a nova camada de inteligência que vai turbinar a próxima geração de robôs.
Sabe aqueles robôs pré-programados ou controlados remotamente para tarefas repetitivas? Que não se adaptam a nada novo e não conseguem nem usar suas habilidades em outro corpo de robô? Pois é, o Gemini Robotics 2 chegou para mudar TUDO ISSO de uma vez só! Ele ataca essas três limitações de frente e promete um futuro onde os robôs serão muito mais versáteis e autônomos. Vem comigo que eu te explico essa inovação top!
O Resumão (TL;DR)
Pra quem tá com pressa, aqui vai o que você precisa saber de mais importante sobre essa novidade da Google DeepMind:
- Três modelos em um pacote: Temos um VLA (Visão-Linguagem-Ação), um VLM (Modelo de Linguagem Visual) de raciocínio incorporado, e um VLA on-device (que roda no próprio robô).
- Controle universal: Um único "checkpoint" (ponto de controle do modelo) consegue controlar o robô Apollo 2 com duas mãos diferentes E uma garra Franka Duo. É muita versatilidade!
- Acesso em fases: O Gemini Robotics ER 2 (de raciocínio) está em prévia pública, mas os modelos VLA e on-device ainda estão em acesso restrito.
- Destreza multifinger: A capacidade de usar vários dedos ainda é um desafio, com taxas de sucesso variando entre 32% e 92%. Mas já é um avanço!
- Segurança em foco: Um novo benchmark de segurança, o ASIMOV-Agentic, foi lançado no Hugging Face sob licença CC-BY-4.0.
Os Três Mosqueteiros da Inteligência Robótica!
A Google DeepMind liberou o Gemini Robotics 2 como um conjunto de três modelos distintos, cada um com uma função crucial. Vamos entender cada um:
Gemini Robotics 2 (o VLA)
Pense nele como o "músculo" e a "visão" do robô. O Gemini Robotics 2 é o modelo VLA (Visão-Linguagem-Ação). Ele pega o que vê e ouve (visão e linguagem) e transforma em movimentos. Consegue controlar humanoides da cabeça aos pés, e também outros robôs com dois braços. E o mais legal: manipulação super precisa, tanto com mãos multifinger quanto com garras paralelas. É ele quem faz o robô se mover com inteligência!
Gemini Robotics ER 2 (o Cérebro)
Esse aqui é o "cérebro" da operação! O Gemini Robotics ER 2 é o modelo de Embodied Reasoning (ER), um VLM (Vision Language Model). Ele age como o sistema de raciocínio de alto nível. Conversa com a gente, entende o mundo físico e planeja tarefas complexas com vários passos, que podem durar até minutos. Baseado no Gemini 3.5 Flash, ele aceita texto, imagem, vídeo e áudio intercalados, com uma janela de contexto enorme (até 128k) e gera textos longos (até 64K tokens). Tipo um super-planejador inteligente!
Gemini Robotics On-Device 2 (o Eficiente)
O nome já diz: "no dispositivo". O Gemini Robotics On-Device 2 é um VLA super otimizado para rodar diretamente no robô, localmente, sem precisar de internet ou da nuvem. Ele é construído com tecnologia do Gemini Robotics 1.5 e dos modelos Gemma, da Google. Pensa em comandos como texto, imagens e até como o próprio robô está se sentindo (propriocepção, valores numéricos) e manda as ações em números para ele executar. É a inteligência na ponta dos dedos (ou das garras) do robô!
A sacada é que o ER 2 planeja tudo, tipo o gerente do projeto, e depois passa a bola para o VLA, que é a "mão na massa". Os desenvolvedores podem até registrar outras interfaces de controle como ferramentas, tipo APIs de navegação. É uma equipe de peso!
Controle de Corpo Inteiro? Sim, Agora Vai!
Antes, os modelos Gemini Robotics controlavam só a parte de cima dos humanoides, para tarefas tipo "na mesa". Mas com o Gemini Robotics 2, o controle se estende para o corpo INTEIRO pela primeira vez!
Um exemplo show de bola foi o Apptronik Apollo 2. Deram a ele a instrução: "coloque o regador na lixeira verde da prateleira de baixo". O que ele fez? Caminhou até a mesa, pegou o regador, deu uns passos até a prateleira e colocou o objeto no lugar certo. Incrível, né?
A Google DeepMind é super transparente e avisa que ainda precisa melhorar a velocidade dos movimentos dos robôs. Mas convenhamos, o salto já é GIGANTESCO!
Destreza de Deuses (e Garras) Robóticas!
O Gemini Robotics 2 consegue controlar a mão SharpaWave do Apollo 2, que tem CINCO dedos e 22 graus de liberdade! Já pensou? Ele consegue dar nós e fechar sacolas tipo ziplock. E o mesmo modelo também opera as garras paralelas de dois dedos da plataforma Franka Duo, para tarefas como encaixar coisas apertadinhas.
O mais impressionante é que essas taxas de sucesso (vejam a tabela abaixo!) vieram de UM SÓ modelo controlando TRÊS robôs diferentes: o Apollo 2 com mãos SharpaWave, o Apollo 2 com mãos Inspire, e o Franka Duo com uma garra Robotiq.
| Categoria | Robô/Plataforma | Tarefa | Sucesso |
|---|---|---|---|
| Manipulação de corpo inteiro | Apollo 2 + Inspire hands | Pegar da prateleira | 76.3% |
| Manipulação de corpo inteiro | Apollo 2 + Inspire hands | Pegar da mesa | 68.4% |
| Manipulação de corpo inteiro | Apollo 2 + Inspire hands | Pegar do chão | 45.7% |
| Destreza multifinger | Apollo 2 + Sharpa hands | Desrosquear lâmpada | 92% |
| Destreza multifinger | Apollo 2 + Sharpa hands | Amarrar saco de lixo | 44% |
| Destreza multifinger | Apollo 2 + Sharpa hands | Fechar ziplock | 40% |
| Destreza multifinger | Apollo 2 + Sharpa hands | Rosquear lâmpada | 36% |
| Destreza multifinger | Apollo 2 + Sharpa hands | Usar pá de lixo | 32% |
| Destreza de garra | Franka Duo | Inserções precisas | 89.6% |
| Destreza de garra | Franka Duo | Montagem de kits de ferramentas | 78.9% |
| Destreza de garra | Franka Duo | Pegar e colocar (geral) | 74.2% |
A postagem dos desenvolvedores no X (antigo Twitter) chamou a atenção para um problema pouco explorado: saber quando uma tarefa realmente terminou.
Classificação de Progresso
Cada quadro de vídeo é analisado e classificado em cinco níveis de progresso (de 0-20% a 80-100%). O Gemini Robotics ER 2 atinge 57,4% de precisão nessa tarefa, superando modelos anteriores e outros modelos de ponta.
Localização de Momento
Isso mede se o modelo consegue identificar o exato momento em que um evento crítico acontece. Tipo, a hora certa de parar de colocar café na xícara. O ER 2 chega a 91,3% de precisão, com uma distância média absoluta de 0,96 segundos. Eles dizem que compete de perto com modelos muito maiores, mas com uma velocidade de execução 4x mais rápida!
Orquestração de Ferramentas
O ER 2 foi avaliado em três modos de controle (VLA real, VLA simulado e teleoperação humana) e superou o Gemini Robotics ER 1.6 em todos eles.
Ele se integra com a Gemini Live API através de um ponto de streaming bidirecional, pra evitar aquelas "pausas para pensar" que quebram o fluxo das tarefas. E o mais legal: pode chamar ferramentas como a Busca do Google ou qualquer função que você queira! As capacidades espaciais foram melhoradas: a detecção de sucesso e falha agora funciona em vídeos brutos (não só fotos estáticas), e a leitura de instrumentos (medidores) foi expandida para 10 tipos diferentes, incluindo displays digitais e termômetros.
Ah, e tem demo com o Spot da Boston Dynamics! Usaram o ER 2 para orquestrar a navegação e manipulação do Spot. O futuro é AGORA!
Robôs em Equipe? Agora Sim!
O Gemini Robotics 2 introduz a colaboração entre robôs de diferentes tipos. A ideia é simples: nem todo robô serve para toda tarefa. Um robô com rodas é ótimo para ambientes internos, mas um humanoide se vira melhor em terrenos irregulares.
Os robôs se comunicam com um "entendimento semântico" compartilhado para passar as subtarefas uns aos outros. A dupla demonstrada foi o Apollo 2 da Apptronik com um Franka F3 Duo. Imagina as possibilidades disso em fábricas ou até em explorações!
On-Device 2: Adaptação Sem Parar!
O Gemini Robotics On-Device 2 é feito para situações onde a latência da rede ou a conectividade são um problema. Ele é multi-robô nativo e "aprende" a transferir movimentos da tecnologia do Gemini Robotics 1.5.
A Google DeepMind relata que ele consegue se adaptar a novos robôs com dois braços em POUCAS horas, e geralmente com menos de 200 exemplos! Isso vale para robôs com formas, sensores e graus de liberdade BEM diferentes. Já mostraram isso com as plataformas Dexmate, SO101 e Trossen.
Veja uma comparação de escalonamento de dados com a versão anterior:
| Plataforma | Modelo | Início | Fim |
|---|---|---|---|
| SO101 | On-Device 2 | 6.7% | 53.3% |
| SO101 | On-Device 1 | 0.0% | 6.7% |
| Dexmate | On-Device 2 | 24.4% | 75.6% |
| Dexmate | On-Device 1 | 13.3% | 33.3% |
O resultado no SO101 é gritante: o On-Device 1 mal saía do zero, enquanto o On-Device 2 ultrapassou os 50% de sucesso! É uma diferença absurda!
Claro, nem tudo são flores. O On-Device 2 ainda tem limitações para generalizar tarefas "fora da curva" e para controlar robôs com muitos graus de liberdade. Mas é um começo incrível!
Disponibilidade (Pra Quem?)
Curioso pra botar a mão nisso? Então se liga:
- Gemini Robotics ER 2: Está em prévia pública, disponível via Gemini API e Google AI Studio. Para os parceiros early-access, tem a prévia privada na Gemini Enterprise Agent Platform.
- Gemini Robotics 2 (VLA): Apenas para parceiros de acesso antecipado.
- Gemini Robotics On-Device 2: Apenas para "Trusted Testers". Ou seja, a coisa é séria e eles estão liberando com cautela!
O link de lançamento do AI Studio usa a string gemini-robotics-er-2-preview. E os notebooks para começar já estão no repositório robotics-samples no GitHub. Bacana, né?
Explore na Prática!
A Google DeepMind também disponibilizou um "explicador interativo" para você ver tudo isso em ação. É super didático e vale a pena conferir o link original se quiser mergulhar mais fundo!
Minha Visão
Gente, como entusiasta de tecnologia, eu vejo o Gemini Robotics 2 como um salto quântico. Não é só mais uma atualização, é uma redefinição do que os robôs podem fazer. A capacidade de um único modelo controlar diferentes corpos de robôs, a destreza aprimorada, o raciocínio de alto nível e, principalmente, a colaboração entre eles… isso abre um leque de possibilidades que antes pareciam ficção científica!
Imaginem fábricas onde robôs de diferentes formatos trabalham juntos de forma fluida, ou robôs de assistência que entendem o contexto e se adaptam em tempo real. Ainda temos desafios, claro, como a velocidade dos movimentos e a destreza fina em algumas tarefas, mas o caminho está traçado para um futuro onde a interação com robôs será muito mais natural e eficiente. É o início de uma era realmente emocionante na robótica!
E aí, o que vocês acham dessa novidade? Qual aplicação do Gemini Robotics 2 mais te empolga ou te preocupa? Deixem suas opiniões nos comentários!
Referência: Matéria Original



