
The Decoderの新しい研究についての材料によると、Claude CodeとCodexのプログラミング補助ツールは、タスクの継続時間を体系的に過大評価している。Codexのケースでは、記述によれば実際の継続時間に対して最大で十倍の乖離に達していた。
同じシステムは自分の作業を約20ポイント高く評価していた。記事ではこれを長時間の自律タスクの監視に関する問題と結びつけている。
このメッセージの実務的な意味は、長時間の作業を伴う補助ツールに対して、期間と自己評価をより厳密に検証する必要があるということだ。入手可能なパッケージには、研究自体の詳細ではなく要約しか含まれていない。
編集部コメント
なぜ重要か
おそらくの影響は、プログラム補助ツールへ長期的なタスクを任せる際の監視をより慎重に行うこと。次に観察されるべきサインは、調査方法の詳細と他の検証結果だ。大きな不確定要素は、利用可能なのが出版要約のみであり、研究自体の詳細が不足していることにある。