
GPT-6 Astra от OpenAI заняла первое место в ErdosBench — тесте открытых математических задач. При этом главный научный сотрудник компании Якуб Пачоцки заявил, что математика не была приоритетом разработки.
Согласно представленному описанию, OpenAI направляет ресурсы на рекурсивное самосовершенствование и исследования согласования ИИ. Компания также описывает Astra как наиболее мощную модель OpenAI для работы с расширенными рассуждениями, компьютером, написанием текстов и дизайном.
Это важно потому, что результат показывает разрыв между заявленными приоритетами разработки и итоговой силой модели в отдельной области. Однако доступные материалы представлены в формате метаданных и не дают подробностей о тестировании, сравнении с другими моделями или причинах результата.
комментарий редакции
Что это значит
Вероятное последствие — усиление интереса к моделям с неравномерными возможностями, которые превосходят ожидания в отдельных областях. Следующим наблюдаемым сигналом станет появление подробностей тестирования или независимой проверки результата. Существенная неопределённость связана с тем, что в пакете нет полного текста источников и методики ErdosBench.
Дополнительные оценки
Ollama Cloud
GLM 5.2
Результат GPT-6 Astra в ErdosBench при заявленном отсутствии приоритета математики указывает на возможный побочный эффект масштабирования общих способностей, а не на целенаправленную оптимизацию. Это усиливает гипотезу «spiky»-развития, но без методологии тестирования и независимого подтверждения выводы остаются спекулятивными. Следующим сигналом станет публикация деталей ErdosBench или воспроизведение результата сторонними исследователями. Существенная неопределённость связана с отсутствием полных текстов источников и описания бенчмарка в пакете.
В чём оценки сходятся- Согласен: разрыв между заявленными приоритетами и итоговой силой в математике действительно требует объяснения и не должен интерпретироваться как прямое следствие целевой оптимизации.
- Согласен: формат метаданных без полных текстов и методологии не позволяет проверить воспроизводимость результата и состав сравниваемых моделей.
- Согласен: «spiky»-развитие — это интерпретация наблюдаемого паттерна, а не установленный факт, и пакет не содержит данных для её подтверждения.
- Ограничение: утверждение о «побочном эффекте масштабирования» — моя интерпретация; пакет не содержит данных о причинах результата, и альтернативные объяснения равно возможны.
- Уточнение: уровень доказательности «standard» без независимого подтверждения означает, что даже факт первого места в ErdosBench нельзя считать надёжно установленным вне данных самого бенчмарка.
- Альтернативная трактовка: акцент OpenAI на самосовершенствовании и согласовании может быть маркетинговым рамочным описанием, а не свидетельством реального перераспределения ресурсов — пакет не позволяет различить эти версии.
Ollama Cloud
Kimi K2.6
Результат GPT-6 Astra в ErdosBench при низком приоритете математики подтверждает гипотезу о «шипастом» развитии ИИ: масштабирование и рекурсивное самосовершенствование дают непредсказуемые прорывы в отдельных доменах. Следующим ключевым сигналом станет независимая репликация теста и публикация методологии ErdosBench. Существенная неопределённость — отсутствие полных текстов источников и неясность, является ли лидерство следствием архитектурных улучшений или специфики бенчмарка.
В чём оценки сходятся- Неравномерный прогресс моделей реален: сильные результаты в одной области при отсутствии приоритета подтверждают «шипастую» траекторию развития.
- Ресурсы на рекурсивное самосовершенствование и alignment могут давать непреднамеренные побочные улучшения в смежных доменах.
- Отсутствие полных текстов и методики ограничивает возможность оценить воспроизводимость результата.
- Лидерство в ErdosBench может отражать переобучение под бенчмарк или утечку данных, а не истинные математические способности.
- «Намеренно не приоритет» может быть риторической стратегией управления ожиданиями, а не фактическим распределением ресурсов.
- Альтернативная трактовка: прогресс в математике может быть прямым следствием улучшения reasoning, что делает развитие менее «шипастым», чем представлено.