En una nueva publicación del blog AWS Machine Learning se describe una investigación sobre un método llamado Self-Distilled Reasoning (SDR). Los autores proponen una solución al problema de la supresión de la inferencia lógica en modelos entrenados con supervisión utilizando conjuntos de datos sin rastros de razonamiento preexistentes. La esencia de la idea radica en la generación automática de los denominados tokens de pensamiento para dichos conjuntos de datos.

Los desarrolladores probaron el enfoque propuesto en tres benchmarks diferentes y confirmaron su eficacia. La publicación también incluye recomendaciones prácticas para implementar esta metodología durante el ajuste fino de modelos utilizando Amazon Nova. La investigación se centra en cómo añadir capacidad de razonamiento allí donde los datos originales no lo contemplaban.

Este paso tiene como objetivo eliminar la brecha entre los datos para el ajuste fino y los requisitos de operaciones lógicas complejas. El método permite crear rastros de razonamiento sintéticos, lo que potencialmente mejora la calidad de las respuestas de las redes neuronales en tareas que requieren análisis multifásico.