
Selon le matériel de The Decoder sur cette nouvelle étude, les assistants de programmation Claude Code et Codex surestiment systématiquement la durée des tâches. Pour Codex, l'écart, selon la description fournie, atteignait jusqu'à un facteur de dix par rapport à la durée réelle.
Ces mêmes systèmes évaluaient leur propre travail environ de 20 points de pourcentage au-dessus. Le document relie cela à des problèmes de contrôle des tâches autonomes de longue durée.
En pratique, cela signifie qu'il faut vérifier plus attentivement les délais et les auto-évaluations de ces assistants lors de travaux de longue durée. Toutefois le paquet disponible ne contient que le synopsis de la publication, et non les détails de l'étude elle-même.
commentaire éditorial
Pourquoi c’est important
Conséquence probable — un contrôle plus prudent des tâches longues confiées aux assistants logiciels. Le prochain signal observé sera les détails de la méthodologie de l'étude et les résultats d'autres vérifications. Une incertitude substantielle réside dans le fait que seul le synopsis de la publication est à disposition.