Los investigadores desarrollaron una metodología de cuatro fases para verificar si los modelos de lenguaje utilizan señales de su propia confianza al elegir entre responder o abstenerse. En la primera fase, se midió la confianza de los modelos sin la posibilidad de rechazar dar una respuesta.

La investigación fue publicada en Nature Machine Intelligence bajo el título «Causal evidence that language models use confidence to drive behaviour». En la descripción del trabajo, la metacognición se considera como una evaluación de la calidad de las propias acciones cognitivas, vinculada al comportamiento adaptativo en diferentes especies.

La fuente disponible contiene únicamente un resumen editorial y no reporta los resultados de las fases restantes, los nombres de los modelos investigados ni indicadores cuantitativos. Por lo tanto, hasta ahora solo se confirma el planteamiento de la prueba causal, pero no su resultado final.