A empresa Anthropic desenvolveu uma metodologia que forneceu a visão mais clara até hoje sobre o que ocorre dentro de grandes modelos de linguagem durante a resposta a perguntas ou a execução de tarefas. De acordo com relatório da MIT Technology Review, essa conquista abriu acesso aos mecanismos internos de pensamento da inteligência artificial.

Os resultados da aplicação da nova técnica variam de observações bastante comuns a descobertas inquietantes. Os pesquisadores obtiveram a capacidade de ver como o modelo processa conceitos em um espaço oculto específico antes de formar a conclusão final.

Apesar do avanço na compreensão da arquitetura interna das redes neurais, os dados atuais baseiam-se exclusivamente em uma metadescrição da pesquisa. Detalhes sobre as específicas descobertas 'preocupantes' ou os parâmetros técnicos da metodologia não são divulgados nas fontes disponíveis.