
Исследователи из IIT Bombay и Adobe Research создали инверсионную языковую модель, которая восстанавливает исходную инструкцию по тексту, выданному языковой моделью. Авторы назвали метод «Previous-Token Prediction».
Согласно синопсису The Decoder, подход не требует доступа к весам исходной модели и работает с разными моделями. Издание описывает точность восстановления как почти идеальную.
Для компаний, использующих закрытые системные инструкции, это означает потенциальный риск раскрытия таких настроек. Однако доступный материал представляет собой метаданные и синопсис публикации, а не полный текст исследования, поэтому условия экспериментов и границы применимости метода остаются неясными.
комментарий редакции
Что это значит
Вероятное последствие — усиление внимания к защите закрытых системных инструкций и к оценке утечек через ответы моделей. Следующим наблюдаемым сигналом станет публикация полного исследования с описанием экспериментов, метрик и ограничений. Существенная неопределённость связана с тем, что сейчас доступен только metadata_only-синопсис одного источника.
Дополнительные оценки
Ollama Cloud
GLM 5.2
Если заявленная точность Previous-Token Prediction подтвердится полным исследованием, это изменит расчёт рисков для всех, кто строит защиту на секретности системных инструкций: модель становится каналом утечки сама по себе. Наблюдаемый следующий сигнал — публикация оригинальной работы с метриками, датасетами и ограничениями. Существенная неопределённость в том, что пока доступен только синопсис одного источника без деталей экспериментов, и «почти идеальная» точность не определена количественно.
В чём оценки сходятся- Канонический анализ правомерно разделяет подтверждённые факты и интерпретацию, учитывая отсутствие полного текста исследования в пакете.
- Корректно отмечен риск для компаний с закрытыми системными инструкциями как потенциальное, а не доказанное практическое последствие.
- Вывод о необходимости полной публикации для оценки границ применимости метода обоснован при текущем уровне свидетельств.
- Заявление о «почти идеальной» точности требует большей осторожности: без метрик это может оказаться лабораторным результатом на узких данных.
- Отсутствие доступа к весам снижает порог атаки, но не означает автоматической применимости к реальным коммерческим системам с защитой вывода.
- Стратегический вывод о «вероятном последствии» может переоценивать значимость при единственном неподтверждённом источнике уровня standard.
Ollama Cloud
Kimi K2.6
Если метод Previous-Token Prediction подтвердится в полном исследовании, он станет значимым инструментом для аудита закрытых системных инструкций и ускорит переход компаний к многоуровневой защите промптов. Следующим наблюдаемым сигналом будет публикация полного текста работы с метриками и ограничениями. Существенная неопределённость сохраняется: доступен лишь синопсис одного источника, а «почти идеальная точность» без количественных данных не позволяет оценить масштаб реальной угрозы.
В чём оценки сходятся- Метод снижает порог для анализа закрытых инструкций, поскольку не требует доступа к весам модели.
- Компаниям следует заново оценить защиту системных промптов через ответы моделей.
- Недостаток полного исследования ограничивает возможность проверить заявленные результаты.
- «Почти идеальная точность» в синопсисе может относиться к узким условиям эксперимента, а не к реальным коммерческим системам с многоходовой фильтрацией.
- Угроза раскрытия системных инструкций преувеличена: многие компании уже используют динамические промпты и постобработку, которые метод не учитывает.
- Название «Previous-Token Prediction» указывает на архитектурное ограничение — метод может терять точность на длинных контекстах и сложных цепочках рассуждений.