Google DeepMind Lança Gemini Robotics-ER 1.6: Trazendo Raciocínio Incorporado Aprimorado e Leitura…

A equipe de pesquisa do Google DeepMind apresentou o Gemini Robotics-ER 1.6, uma atualização significativa em seu modelo de raciocínio incorporado, projetado para servir como o 'cérebro cognitivo' de robôs operando em ambientes do mundo real. O modelo é especializado em capacidades de raciocínio críticas para robótica, incluindo compreensão visual e espacial, planejamento de tarefas e detecção de sucesso — atuando como o modelo de raciocínio de alto nível para um robô, capaz de executar tarefas chamando nativamente ferramentas como Google Search, modelos de visão-linguagem-ação (VLAs) ou quaisquer outras funções de terceiros definidas pelo usuário. Aqui está a ideia arquitetônica chave para entender: o Google DeepMind adota uma abordagem de modelo dual para a IA robótica. O Gemini Robotics 1.5 é o modelo de visão-linguagem-ação (VLA) — ele processa entradas visuais e prompts do usuário e as traduz diretamente em comandos motores físicos. O Gemini Robotics-ER, por outro lado, é o modelo de raciocínio incorporado: ele se especializa em compreender espaços físicos, planejar e tomar decisões lógicas, mas não controla diretamente os membros robóticos. Em vez disso, ele fornece insights de alto nível para ajudar o modelo VLA a decidir o que fazer em seguida. Pense nisso como a diferença entre um estrategista e um executor — o Gemini Robotics-ER 1.6 é o estrategista. https://deepmind.google/blog/gemini-robotics-er-1-6/? O que há de novo no Gemini Robotics-ER 1.6 O Gemini Robotics-ER 1.6 mostra uma melhoria significativa em relação ao Gemini Robotics-ER 1.5 e ao Gemini 3.0 Flash, aprimorando especificamente as capacidades de raciocínio espacial e físico, como apontar, contar e detecção de sucesso. Mas a principal adição é uma capacidade que não existia em versões anteriores: leitura de instrumentos. Apontar como Base para o Raciocínio Espacial Apontar — a capacidade do modelo de identificar locais precisos em nível de pixel em uma imagem — é muito mais poderoso do que parece. Pontos podem ser usados para expressar raciocínio espacial (detecção e contagem precisa de objetos), lógica relacional (fazendo comparações como identificar o item menor em um conjunto, ou definir relações de 'de-para' como 'mover X para o local Y'), raciocínio de movimento (mapeando trajetórias e identificando pontos de agarre ideais) e conformidade com restrições (raciocinar por meio de prompts complexos como 'aponte para cada objeto pequeno o suficiente para caber dentro do copo azul'). https://deepmind.google/blog/gemini-robotics-er-1-6/? Em benchmarks internos, o Gemini Robotics-ER 1.6 demonstra uma clara vantagem sobre seu predecessor.

Fonte: MarkTechPost

Publicado em 2026-04-15

Notícias relacionadas

Continue explorando