Исследователи из IIT Bombay и Adobe Research создали инверсионную языковую модель, которая восстанавливает исходную инструкцию по тексту, выданному языковой моделью. Авторы назвали метод «Previous-Token Prediction».

Согласно синопсису The Decoder, подход не требует доступа к весам исходной модели и работает с разными моделями. Издание описывает точность восстановления как почти идеальную.

Для компаний, использующих закрытые системные инструкции, это означает потенциальный риск раскрытия таких настроек. Однако доступный материал представляет собой метаданные и синопсис публикации, а не полный текст исследования, поэтому условия экспериментов и границы применимости метода остаются неясными.