Estudo: Plataformas que classificam os LLMs mais recentes podem ser não confiáveis

Uma empresa que deseja usar um Large Language Model (LLM) para resumir relatórios de vendas ou triar consultas de clientes pode escolher entre centenas de LLMs únicos com dezenas de variações de modelos, cada um com desempenho ligeiramente diferente.

Para restringir a escolha, as empresas frequentemente dependem de plataformas de ranking de LLMs, que coletam feedback de usuários sobre interações com modelos para classificar os LLMs mais recentes com base em seu desempenho em certas tarefas.

Mas pesquisadores do MIT descobriram que um punhado de interações de usuários pode distorcer os resultados, levando alguém a acreditar erroneamente que um LLM é a escolha ideal para um caso de uso particular. O estudo deles revela que a remoção de uma pequena fração de dados coletados por crowdsourcing pode mudar quais modelos são os mais bem classificados.

Eles desenvolveram um método rápido para testar plataformas de ranking e determinar se elas são suscetíveis a esse problema. A técnica de avaliação identifica os votos individuais mais responsáveis por distorcer os resultados para que os usuários possam inspecionar esses votos influentes.

Os pesquisadores dizem que este trabalho sublinha a necessidade de estratégias mais rigorosas para avaliar os rankings de modelos. Embora não tenham focado na mitigação neste estudo, eles fornecem sugestões que podem melhorar a robustez dessas plataformas, como coletar feedback mais detalhado para criar os rankings.

O estudo também oferece um alerta aos usuários que podem depender de rankings ao tomar decisões sobre LLMs que podem ter impactos de longo alcance e custosos em um negócio ou organização.

“Ficamos surpresos que essas plataformas de ranking fossem tão sensíveis a esse problema. Se o LLM mais bem classificado depender de apenas duas ou três opiniões de usuários de dezenas de milhares, então não se pode assumir que o LLM mais bem classificado terá um desempenho consistentemente superior a todos os outros LLMs quando for implantado”, diz Tamara Broderick, professora associada do Departamento de Engenharia Elétrica e Ciência da Computação (EECS) do MIT; membro do Laboratory for Information and Decision Systems (LIDS) e do Institute for Data, Systems, and Society; afiliada do Computer Science and Artificial Intelligence Laboratory (CSAIL); e autora sênior deste estudo.

A ela se juntam no artigo os autores principais e alunos de pós-graduação do EECS Jenny Huang e Yunyi Shen, bem como Dennis Wei, um cientista pesquisador sênior da

Fonte: MIT News AI

Publicado em 2026-02-09

Notícias relacionadas

Continue explorando