Selon le matériel de The Decoder sur cette nouvelle étude, les assistants de programmation Claude Code et Codex surestiment systématiquement la durée des tâches. Pour Codex, l'écart, selon la description fournie, atteignait jusqu'à un facteur de dix par rapport à la durée réelle.

Ces mêmes systèmes évaluaient leur propre travail environ de 20 points de pourcentage au-dessus. Le document relie cela à des problèmes de contrôle des tâches autonomes de longue durée.

En pratique, cela signifie qu'il faut vérifier plus attentivement les délais et les auto-évaluations de ces assistants lors de travaux de longue durée. Toutefois le paquet disponible ne contient que le synopsis de la publication, et non les détails de l'étude elle-même.