
Бывший исследователь предварительного обучения в OpenAI и Anthropic Jacob Coxon ушёл из компаний и обвинил их в том, что они сознательно подвергают человечество риску вымирания. Об этом сообщает The Decoder.
Коллега Coxon по Anthropic Evan Hubinger оценивает вероятность того, что не согласованный с целями сверхразумный ИИ уничтожит человечество в течение ближайшего десятилетия, более чем в 10%.
Значимость этой истории связана не с подтверждённым прогнозом, а с публично приписываемой исследователю оценкой экстремального риска и критикой двух заметных компаний. Доступное подтверждение ограничено кратким описанием The Decoder, а не полным текстом первоисточника.
комментарий редакции
Что это значит
Вероятное последствие — усиление споров о безопасности и ответственности разработчиков ИИ, но это не подтверждённый прогноз. Следующим наблюдаемым сигналом станут ответы OpenAI и Anthropic, а также публикация методики или первичных материалов, на которых основаны заявления. Существенная неопределённость сохраняется из-за отсутствия в пакете источников полного текста и независимого подтверждения.
Дополнительные оценки
Ollama Cloud
GLM 5.2
Публичное обвинение со стороны бывшего исследователя и оценка риска выше 10% могут усилить давление на OpenAI и Anthropic в вопросах прозрачности и безопасности ИИ, но значимость ограничена единственным источником без первичного текста. Следующим наблюдаемым сигналом станут официальные ответы компаний и возможная публикация методики оценки. Существенная неопределённость сохраняется из-за отсутствия независимого подтверждения и полных заявлений.
В чём оценки сходятся- Канонический анализ верно отмечает, что значимость истории — в публично приписываемой оценке экстремального риска, а не в подтверждённом прогнозе.
- Согласен, что ограниченное подтверждение одним источником в формате метаданных не позволяет полноценно оценить масштаб разногласий.
- Правильно, что следующим наблюдаемым сигналом будут ответы OpenAI и Anthropic, а также публикация первичных материалов.
- Стоит чётче разделить заявления Coxon об осознанном риске и вероятностную оценку Hubinger — это разные уровни критики, а не единое обвинение.
- Оценка выше 10% от Hubinger может отражать не консенсус внутри Anthropic, а личную позицию, что требует уточнения контекста.
- Уход Coxon из обеих компаний может иметь дополнительные мотивы, не связанные исключительно с риском ИИ, что пакет не позволяет проверить.
Ollama Cloud
Kimi K2.6
Публичный раскол исследователей ведущих лабораторий усилит регуляторное давление и запрос на внешний аудит моделей, но пока это сигнал о репутационных рисках, а не подтверждённый технический факт. Следующим ключевым сигналом станут официальные ответы компаний и публикация методологии оценки риска. Существенная неопределённость сохраняется: отсутствие первичных источников не позволяет отличить системную озабоченность от индивидуального протеста.
В чём оценки сходятся- Оценка риска >10% — это приписываемое мнение, а не подтверждённый прогноз, и её обоснованность требует проверки.
- Единственный доступный источник в формате метаданных недостаточен для полноценной оценки масштаба разногласий.
- Публичная критика изнутри ведущих лабораторий логично усилит дискуссию о безопасности ИИ и ответственности разработчиков.
- Канонический анализ недостаточно подчёркивает, что Coxon и Hubinger — разные лица с разными заявлениями, их связывает только публикация The Decoder, что создаёт риск конъюнктурной склейки.
- Формулировка «сознательно подвергают риску вымирания» требует юридически нейтральной интерпретации: это может означать как умышленный ущерб, так и осознанный компромисс скорости и безопасности, канонический текст не различает эти сценарии.
- Отсутствие реакции компаний в пакете источников не обязательно означает задержку — возможно, The Decoder не запрашивал комментарий или получил отказ, что меняет трактовку «следующего сигнала».