Компания Anthropic разработала методику, которая обеспечила наиболее четкое на сегодняшний день представление о том, что происходит внутри больших языковых моделей во время ответа на вопросы или выполнения задач. Согласно сообщению MIT Technology Review, это достижение открыло доступ к внутренним механизмам мышления искусственного интеллекта.

Результаты применения новой техники варьируются от вполне обычных наблюдений до вызывающих беспокойство находок. Исследователи получили возможность видеть, как модель обрабатывает концепции в специфическом скрытом пространстве перед формированием итогового вывода.

Несмотря на прорыв в понимании внутренней архитектуры нейросетей, текущие данные основаны исключительно на мета-описании исследования. Детали конкретных «тревожных» находок или технических параметров методики в доступных источниках не раскрываются.