Une nouvelle étude menée par OpenAI a révélé des défauts dans l'outil d'évaluation de code largement utilisé SWE-Bench Pro. Ces découvertes remettent en question sa fiabilité et sa précision lors des tests de modèles d'intelligence artificielle.

Les résultats de cette analyse pourraient influencer l'utilisation de SWE-Bench Pro à des fins scientifiques et industrielles, car ses lacunes risquent d'entraîner des évaluations erronées des performances des modèles d'IA.