Laut dem Material von The Decoder zu der neuen Studie überschätzen die Programmierhilfen Claude Code und Codex systematisch die Dauer von Aufgaben. Beim Codex lag die Abweichung laut der beschriebenen Beschreibung bis zum Zehnfachen der tatsächlichen Dauer.

Diese gleichen Systeme bewerteten ihre eigene Arbeit um etwa 20 Prozentpunkte höher. Im Material wird dies mit Problemen bei der Überwachung langer autonomer Aufgaben in Verbindung gebracht.

Der praktische Sinn der Meldung besteht darin, die Fristen und Selbstbeurteilungen solcher Hilfsmittel bei längerem Arbeiten sorgfältiger zu überprüfen. Dabei enthält das verfügbare Paket nur eine Zusammenfassung der Veröffentlichung, nicht Details der eigentlichen Untersuchung.