
Laut dem Material von The Decoder zu der neuen Studie überschätzen die Programmierhilfen Claude Code und Codex systematisch die Dauer von Aufgaben. Beim Codex lag die Abweichung laut der beschriebenen Beschreibung bis zum Zehnfachen der tatsächlichen Dauer.
Diese gleichen Systeme bewerteten ihre eigene Arbeit um etwa 20 Prozentpunkte höher. Im Material wird dies mit Problemen bei der Überwachung langer autonomer Aufgaben in Verbindung gebracht.
Der praktische Sinn der Meldung besteht darin, die Fristen und Selbstbeurteilungen solcher Hilfsmittel bei längerem Arbeiten sorgfältiger zu überprüfen. Dabei enthält das verfügbare Paket nur eine Zusammenfassung der Veröffentlichung, nicht Details der eigentlichen Untersuchung.
redaktioneller Kommentar
Warum es wichtig ist
Wahrscheinliche Folge ist eine vorsichtiger Überwachung langfristiger Aufgaben, die von Software-Assistenten übernommen werden. Als nächstes beobachtbares Zeichen werden Details zur Forschungsmethodik und Ergebnisse weiterer Prüfungen. Große Unsicherheit ergibt sich daraus, dass nur eine Zusammenfassung der Veröffentlichung vorliegt.