Separando o sinal do ruído em avaliações de codificação

Uma nova análise da OpenAI revela problemas no SWE-Bench Pro, um popular benchmark de codificação, levantando preocupações sobre a confiabilidade e precisão na avaliação de modelos de AI.

Fonte: OpenAI Blog

Publicado em 2026-07-08

Notícias relacionadas

Continue explorando