Un nuevo estudio realizado por OpenAI ha identificado problemas en la popular herramienta de evaluación de código SWE-Bench Pro. Esto genera interrogantes sobre su fiabilidad y precisión al probar modelos de inteligencia artificial.

Los resultados del análisis podrían afectar el uso de SWE-Bench Pro con fines científicos e industriales, ya que sus deficiencias podrían conducir a evaluaciones imprecisas del rendimiento de los modelos de IA.