The Decoderの新しい研究についての材料によると、Claude CodeとCodexのプログラミング補助ツールは、タスクの継続時間を体系的に過大評価している。Codexのケースでは、記述によれば実際の継続時間に対して最大で十倍の乖離に達していた。

同じシステムは自分の作業を約20ポイント高く評価していた。記事ではこれを長時間の自律タスクの監視に関する問題と結びつけている。

このメッセージの実務的な意味は、長時間の作業を伴う補助ツールに対して、期間と自己評価をより厳密に検証する必要があるということだ。入手可能なパッケージには、研究自体の詳細ではなく要約しか含まれていない。