Новое исследование, проведенное OpenAI, выявило проблемы в популярном инструменте оценки кода SWE-Bench Pro. Это вызывает вопросы относительно его надежности и точности при тестировании моделей искусственного интеллекта.

Результаты анализа могут повлиять на использование SWE-Bench Pro в научных и промышленных целях, поскольку его недостатки могут привести к неточным оценкам производительности моделей ИИ.