La empresa Anthropic ha desarrollado una metodología que ha proporcionado la representación más clara hasta la fecha de lo que ocurre dentro de los grandes modelos de lenguaje mientras responden preguntas o realizan tareas. Según un informe de MIT Technology Review, este logro ha abierto el acceso a los mecanismos internos del pensamiento de la inteligencia artificial.

Los resultados de la aplicación de esta nueva técnica varían desde observaciones completamente ordinarias hasta hallazgos inquietantes. Los investigadores han obtenido la capacidad de ver cómo el modelo procesa conceptos en un espacio oculto específico antes de formar la conclusión final.

A pesar del avance en la comprensión de la arquitectura interna de las redes neuronales, los datos actuales se basan exclusivamente en una meta-descripción de la investigación. Los detalles de los hallazgos específicos «inquietantes» o de los parámetros técnicos de la metodología no se revelan en las fuentes disponibles.