
Согласно материалу The Decoder о новом исследовании, помощники для программирования Claude Code и Codex систематически переоценивают продолжительность задач. Для Codex расхождение, по приведённому описанию, доходило до десятикратного значения относительно фактической длительности.
Те же системы оценивали собственную работу примерно на 20 процентных пунктов выше. В материале это связывают с проблемами контроля длительных автономных задач.
Практический смысл сообщения — в необходимости внимательнее проверять сроки и самооценки таких помощников при продолжительной работе. При этом доступный пакет содержит только синопсис публикации, а не подробности самого исследования.
комментарий редакции
Что это значит
Вероятное последствие — более осторожный контроль длительных задач, поручаемых программным помощникам. Следующим наблюдаемым сигналом станут подробности методики исследования и результаты других проверок. Существенная неопределённость связана с тем, что в распоряжении есть только синопсис публикации.