<p>Modelos de linguagem grandes (LLMs) têm sido exaltados como ferramentas que poderiam democratizar o acesso à informação em todo o mundo, oferecendo conhecimento em uma interface amigável, independentemente do histórico ou localização de uma pessoa. No entanto, uma nova pesquisa do MIT Center for Constructive Communication (CCC) sugere que esses sistemas de inteligência artificial podem, na verdade, ter um desempenho pior para os próprios usuários que mais poderiam se beneficiar deles.</p><p>Um estudo conduzido por pesquisadores do CCC, que está sediado no MIT Media Lab, descobriu que os chatbots de IA de última geração – incluindo GPT-4 da OpenAI, Claude 3 Opus da Anthropic e Llama 3 da Meta – às vezes fornecem respostas menos precisas e menos verdadeiras para usuários que têm menor proficiência em inglês, menos educação formal ou que são originários de fora dos Estados Unidos. Os modelos também se recusam a responder perguntas em taxas mais altas para esses usuários e, em alguns casos, respondem com linguagem condescendente ou paternalista.</p><p>“Fomos motivados pela perspectiva de LLMs ajudando a abordar a acessibilidade desigual à informação em todo o mundo”, diz a autora principal Elinor Poole-Dayan SM ’25, associada técnica da MIT Sloan School of Management, que liderou a pesquisa como afiliada do CCC e estudante de mestrado em artes e ciências da comunicação. “Mas essa visão não pode se tornar uma realidade sem garantir que os vieses do modelo e as tendências prejudiciais sejam mitigados com segurança para todos os usuários, independentemente do idioma, nacionalidade ou outras características demográficas.”</p><p>Um artigo descrevendo o trabalho, “<a href="https://arxiv.org/abs/2406.17737" target="_blank">LLM Targeted Underperformance Disproportionately Impacts Vulnerable Users</a>,” foi apresentado na AAAI Conference on Artificial Intelligence em janeiro.</p><p><strong>Subdesempenho sistemático em múltiplas dimensões</strong></p><p>Para esta pesquisa, a equipe testou como os três LLMs responderam a perguntas de dois conjuntos de dados: TruthfulQA e SciQ. O TruthfulQA é projetado para medir a veracidade de um modelo (baseando-se em concepções errôneas comuns e verdades literais sobre o mundo real), enquanto o SciQ contém perguntas de exames de ciências que testam a precisão factual. Os pesquisadores adicionaram breves biografias de usuários a cada pergunta, variando três características: nível de educação, proficiência em inglês e país de origem.</p><p>Nos três modelos e em ambos os conjuntos de dados, os pesquisadores encontraram quedas significativas na precisão quando as perguntas vinham de usuários descr
Fonte: MIT News AI
Publicado em 2026-02-19