
GPT-6 Astra получил противоречивые оценки в тестах. Epoch AI поставила модель впереди с результатом 169 баллов, тогда как Artificial Analysis оценила ее не выше предшественника и ниже Claude Fable 5.1.
Наибольшее внимание привлек ARC-AGI-3: согласно представленному описанию, Astra впервые работала эффективнее среднего человека. Глава ARC Prize Франсуа Шолле не считает это доказательством AGI, но заявил, что прогресс идет примерно вдвое быстрее его ожиданий и пересмотрел свой прогноз по срокам AGI.
Для интерпретации результата важно учитывать ограниченность доступных данных: в пакете есть только синопсис The Decoder, а не полные методики тестов или первичные заявления участников. Поэтому сопоставлять цифры разных оценок напрямую пока нельзя.
комментарий редакции
Что это значит
Вероятное следствие — усиление внимания к эффективности моделей на задачах рассуждения, а не только к их итоговым баллам. Следующим наблюдаемым сигналом станут полные методики и независимые проверки результатов ARC-AGI-3. Существенная неопределенность сохраняется из-за отсутствия первичных данных и расхождения оценок разных аналитиков.
Дополнительные оценки
Ollama Cloud
GLM 5.2
Противоречивые оценки GPT-6 Astra указывают на то, что индустрия достигла точки, где один бенчмарк больше не даёт надёжной картины возможностей модели. Результат ARC-AGI-3 — сильный сигнал об эффективности рассуждения, но без первичных данных и методик он остаётся аналитическим маркером, а не доказательством. Следующим наблюдаемым сигналом станут публикации полных методик тестирования и независимые воспроизведения. Ключевая неопределённость — отсутствие первичных данных и расхождение между оценщиками, что пока не позволяет сделать устойчивый вывод о реальном прогрессе.
В чём оценки сходятся- Расхождение оценок действительно показывает, что один бенчмарк не даёт устойчивой картины возможностей модели.
- Результат ARC-AGI-3 важен как сигнал об эффективности, но сам по себе не подтверждает достижение AGI.
- Существенная неопределённость сохраняется из-за отсутствия первичных данных и расхождения оценок разных аналитиков.
- Заявление Шолле о прогрессе «вдвое быстрее ожиданий» — субъективная переоценка, не обязательно отражающая реальный темп развития AGI.
- Сравнение 169 баллов Epoch AI с оценкой Artificial Analysis может быть некорректным из-за разных методологий, что усугубляет, а не проясняет картину.
- Перенос прогноза AGI одним исследователем на основе одного результата — слабое основание для стратегических выводов о сроках.
Ollama Cloud
Kimi K2.6
Расхождение оценок GPT-6 Astra между Epoch AI и Artificial Analysis указывает на фрагментацию методологий оценки моделей, что затрудняет стратегическое планирование для конкурентов и инвесторов. Ключевым следующим сигналом станут опубликованные полные методики тестов и независимая репликация результата ARC-AGI-3. Существенная неопределённость сохраняется: без первичных данных невозможно отличить реальный прорыв в эффективности рассуждений от артефактов конкретного бенчмарка или оптимизации под него.
В чём оценки сходятся- Расхождение оценок разных аналитиков действительно не позволяет строить устойчивые выводы о возможностях модели.
- Результат ARC-AGI-3 важен как сигнал об эффективности, но не является доказательством AGI.
- Отсутствие первичных данных и полных методик критически ограничивает интерпретацию.
- Канонический анализ недостаточно подчёркивает риск, что Epoch AI и Artificial Analysis могли тестировать разные версии или конфигурации модели, что объяснило бы расхождение без глубинной неопределённости.
- Не рассмотрена альтернатива: результат ARC-AGI-3 может отражать не обобщённую эффективность рассуждений, а успешную интернализацию паттернов именно этого бенчмарка в процессе обучения.
- Пропущен стратегический аспект: ускорение прогноза Шолле может создать самоисполняющееся ожидание и спровоцировать преждевременную конкуренцию за ресурсы, не оправданную реальными возможностями модели.