Reka Lança Rho-1: Um Modelo Omni-Raciocínio de 19B Que Entende, Gera Vídeos e Produz Ações Robótica…

A Reka lançou uma prévia de pesquisa do Rho-1, um modelo de raciocínio omni de 19B treinado do zero. Uma única rede neural entende e gera texto, imagens e vídeo, raciocina sobre eles e produz ações robóticas. A Reka o enquadra como um substituto direto para pipelines agentics que passam o trabalho entre modelos específicos de modalidade. O que o Rho-1 Muda A maioria dos sistemas multimodais hoje são pipelines. Um modelo central planeja e, em seguida, entrega tarefas a especialistas para imagens, vídeo ou detecção. Cada transferência adiciona latência, e cada especialista vê apenas uma solicitação limitada. O Rho-1 remove essas transferências. Texto, visão e ações robóticas tornam-se tokens dentro de uma única janela de contexto. De acordo com a pesquisa da Reka, uma sessão não editada mostra o loop completo. O modelo desenha um farol, o enquadra (bounding box), o anima, edita o vídeo em uma tempestade de neve e explica a diferença. Tudo isso acontece em 5 turnos, sem chamadas de ferramentas e sem um segundo modelo. Arquitetura: Dois Fluxos, Um KV Cache Cada entrada e saída usa um dos dois formatos nativos: Tokens discretos transportam texto, raciocínio simbólico e comandos de alto nível. Tokens contínuos transportam latents de imagem, quadros de vídeo, ações robóticas e propriocepção. Cada bloco de transformador contém dois fluxos de pesos especializados. O fluxo de compreensão lida com a análise de linguagem e visual. O fluxo de geração remove o ruído dos latents em imagens e vídeo. Ambos os fluxos compartilham atenção e operam sobre o mesmo KV cache. Quando uma resposta precisa de pixels, o fluxo de compreensão emite um token de "handoff" discreto. O fluxo de geração então renderiza a partir do estado acumulado completo. O treinamento combina a previsão do próximo token para sequências discretas com o "flow matching" para saídas contínuas. Este design tem efeitos práticos. Caixas delimitadoras (bounding boxes) saem como tokens de coordenadas, e não de um detector separado. O primeiro quadro de um vídeo reutiliza a representação de imagem em contexto em vez de uma cópia recodificada. (function(){window.addEventListener("message",function(e){if(e.data&&e.data.rho1h){var f=document.getElementById

Fonte: MarkTechPost

Publicado em 2026-10-06

Notícias relacionadas

Continue explorando