Eine neue Studie von OpenAI hat Mängel im populären Tool zur Code-Bewertung SWE-Bench Pro aufgedeckt. Dies wirft Fragen hinsichtlich seiner Zuverlässigkeit und Genauigkeit beim Testen von Modellen künstlicher Intelligenz auf.

Die Ergebnisse der Analyse könnten die Nutzung von SWE-Bench Pro in wissenschaftlichen und industriellen Kontexten beeinflussen, da seine Schwachstellen zu ungenauen Bewertungen der Leistung von KI-Modellen führen können.