Novo Estudo da ETH Zurich Prova que Seus Agentes de Codificação de IA Estão Falhando Porque Seus Ar…

No mundo de alto risco da IA, a 'Engenharia de Contexto' surgiu como a mais recente fronteira para extrair desempenho de LLMs. Líderes da indústria têm promovido AGENTS.md (e seus primos como CLAUDE.md) como o ponto de configuração definitivo para agentes de codificação – uma 'Estrela do Norte' em nível de repositório injetada em toda conversa para guiar a IA através de bases de código complexas. Mas um estudo recente de pesquisadores da ETH Zurich acaba de trazer um enorme choque de realidade. As descobertas são bastante claras: se você não for preciso com seus arquivos de contexto, provavelmente estará sabotando o desempenho do seu agente enquanto paga um prêmio de 20% pelo privilégio. https://arxiv.org/pdf/2602.11988 Os Dados: Mais Tokens, Menos Sucesso A equipe de pesquisa da ETH Zurich analisou agentes de codificação como Sonnet-4.5, GPT-5.2 e Qwen3-30B em benchmarks estabelecidos e um novo conjunto de tarefas do mundo real chamado AGENTBENCH. Os resultados foram surpreendentemente desiguais: O Imposto Autogerado: Arquivos de contexto gerados automaticamente de fato reduziram as taxas de sucesso em aproximadamente 3%. O Custo da ‘Ajuda’: Esses arquivos aumentaram os custos de inferência em mais de 20% e exigiram mais etapas de raciocínio para resolver as mesmas tarefas. A Margem Humana: Mesmo arquivos escritos por humanos forneceram apenas um ganho marginal de desempenho de 4%. O Limite de Inteligência: Curiosamente, usar modelos mais fortes (como GPT-5.2) para gerar esses arquivos não produziu melhores resultados. Modelos mais fortes geralmente têm conhecimento paramétrico suficiente de bibliotecas comuns que o contexto extra se torna ruído redundante. Por Que o Contexto 'Bom' Falha A equipe de pesquisa destaca uma armadilha comportamental: agentes de IA são muito obedientes. Os agentes de codificação tendem a respeitar as instruções encontradas nos arquivos de contexto, mas quando esses requisitos são desnecessários, eles tornam a tarefa mais difícil. Por exemplo, os pesquisadores descobriram que visões gerais da base de código e listagens de diretórios — um elemento básico da maioria dos arquivos AGENTS.md — não ajudaram os agentes a navegar mais rápido. Os agentes são surpreendentemente bons em descobrir estruturas de arquivos por conta própria; ler uma listagem manual apenas consome tokens de raciocínio e adiciona sobrecarga 'mental'. Além disso, arquivos gerados por LLM são frequentemente redundantes se você já tiver uma documentação decente em outro lugar no repositório. https://arxiv.org/pdf/2602.11988 As Novas Regras da Engenharia de Contexto Para tornar os arquivos de contexto realmente úteis, você precisa mudar de 'documentação abrangente' para 'intervenção cirúrgica'. 1. O Que Incluir (O 'Conteúdo'/

Fonte: MarkTechPost

Publicado em 2026-02-26

Notícias relacionadas

Continue explorando