В новом материале блога AWS Machine Learning описывается исследование метода под названием Self-Distilled Reasoning (SDR). Авторы предлагают решение проблемы подавления логического вывода в моделях, обучаемых с учителем на наборах данных без готовых следов рассуждений. Суть идеи заключается в автоматической генерации так называемых токенов мышления для таких датасетов.

Разработчики протестировали предложенный подход на трех различных бенчмарках и подтвердили его эффективность. В публикации также приводятся практические рекомендации по внедрению этой методики при дообучении моделей с использованием Amazon Nova. Исследование фокусируется на том, как добавить способность к рассуждению там, где исходные данные этого не предполагали.

Этот шаг направлен на устранение разрыва между данными для тонкой настройки и требованиями к сложным логическим операциям. Метод позволяет создавать синтетические следы рассуждений, что потенциально улучшает качество ответов нейросетей в задачах, требующих многошагового анализа.