Um novo estudo conduzido pela OpenAI revelou problemas na ferramenta popular de avaliação de código SWE-Bench Pro. Isso gera dúvidas quanto à sua confiabilidade e precisão ao testar modelos de inteligência artificial.

Os resultados da análise podem impactar o uso do SWE-Bench Pro em contextos científicos e industriais, pois suas deficiências podem levar a avaliações imprecisas do desempenho dos modelos de IA.