Nova Pesquisa de IA do Google Propõe 'Deep-Thinking Ratio' para Melhorar a Precisão de LLMs Enquant…

Nos últimos anos, o mundo da IA tem seguido uma regra simples: se você quer que um Large Language Model (LLM) resolva um problema mais difícil, torne sua Cadeia de Pensamento (CoT) mais longa. Mas uma nova pesquisa da Universidade da Virgínia e do Google prova que 'pensar muito' não é o mesmo que 'pensar profundamente'. A equipe de pesquisa revela que simplesmente adicionar mais tokens a uma resposta pode, na verdade, tornar uma IA menos precisa. Em vez de contar palavras, os pesquisadores do Google introduzem uma nova medida: o Deep-Thinking Ratio (DTR). https://arxiv.org/pdf/2602.13517 A Falha do 'Token Maxing' Engenheiros frequentemente usam a contagem de tokens como um substituto para o esforço que uma IA dedica a uma tarefa. No entanto, os pesquisadores descobriram que a contagem bruta de tokens tem uma correlação média de r= -0.59 com a precisão. Esse número negativo significa que, à medida que o modelo gera mais texto, é mais provável que esteja errado. Isso acontece por causa do 'superpensamento', onde o modelo fica preso em loops, repete etapas redundantes ou amplifica seus próprios erros. Contar apenas a duração desperdiça computação cara em tokens não informativos. O que são Tokens de Deep-Thinking? A equipe de pesquisa argumentou que o 'pensamento' real acontece dentro das camadas do modelo, não apenas na saída final. Quando um modelo prevê um token, ele processa dados através de uma série de camadas de transformadores (L). Tokens Rasos: Para palavras fáceis, a previsão do modelo se estabiliza cedo. O 'palpite' não muda muito da camada 5 para a camada 36. Tokens de Deep-Thinking: Para lógica difícil ou símbolos matemáticos, a previsão muda significativamente nas camadas mais profundas. Como Medir a Profundidade Para identificar esses tokens, a equipe de pesquisa usa uma técnica para observar os 'rascunhos' internos do modelo em cada camada. Eles projetam os estados ocultos intermediários (h tl ) no espaço do vocabulário usando a matriz de 'unembedding' (W U ) do modelo. Isso produz uma distribuição de probabilidade (p t,l ) para cada camada. Eles então calculam a Divergência de Jensen-Shannon (JSD) entre a distribuição da camada intermediária e a distribuição da camada final (p t,L ): D t,l := JSD(p t,L || p t,l ) Um token é um token de 'deep-thinking' se sua previsão só se estabiliza no 'regime final' — definido por uma fração de profundidade (⍴). Em seus testes, eles definiram ⍴ = 0.85, o que significa que o token só se estabilizou nos 15% finais das camadas. O Deep-Thinking Ratio (DTR) é a porcentagem desses tokens 'difíceis' em um s completo

Fonte: MarkTechPost

Publicado em 2026-02-22

Notícias relacionadas

Continue explorando