Uma nova análise da OpenAI revela problemas no SWE-Bench Pro, um popular benchmark de codificação, levantando preocupações sobre a confiabilidade e precisão na avaliação de modelos de AI.