
Los investigadores desarrollaron una metodología de cuatro fases para verificar si los modelos de lenguaje utilizan señales de su propia confianza al elegir entre responder o abstenerse. En la primera fase, se midió la confianza de los modelos sin la posibilidad de rechazar dar una respuesta.
La investigación fue publicada en Nature Machine Intelligence bajo el título «Causal evidence that language models use confidence to drive behaviour». En la descripción del trabajo, la metacognición se considera como una evaluación de la calidad de las propias acciones cognitivas, vinculada al comportamiento adaptativo en diferentes especies.
La fuente disponible contiene únicamente un resumen editorial y no reporta los resultados de las fases restantes, los nombres de los modelos investigados ni indicadores cuantitativos. Por lo tanto, hasta ahora solo se confirma el planteamiento de la prueba causal, pero no su resultado final.
comentario editorial
Por qué importa
Si los resultados completos confirman la relación causal, la siguiente señal observable será un cambio sostenido en la elección entre respuesta y abstención tras la intervención en la señal de confianza. Persiste una incertidumbre significativa: solo se proporciona un sinopsis de metadatos sin resultados, muestras ni descripción de los modelos.