
Investigadores de IIT Bombay y Adobe Research crearon un modelo lingüístico inverso que recupera la instrucción original a partir del texto generado por un modelo de lenguaje. Los autores denominaron al método «Previous-Token Prediction».
Según el sinopsis de The Decoder, este enfoque no requiere acceso a los pesos del modelo original y funciona con diferentes modelos. La publicación describe la precisión de la recuperación como casi perfecta.
Para las empresas que utilizan instrucciones sistémicas cerradas, esto implica un riesgo potencial de divulgación de dichas configuraciones. Sin embargo, el material disponible consiste en metadatos y un sinopsis de la publicación, no en el texto completo de la investigación; por lo tanto, las condiciones experimentales y los límites de aplicabilidad del método permanecen poco claros.
comentario editorial
Por qué importa
La consecuencia probable es un mayor enfoque en la protección de instrucciones sistémicas cerradas y en la evaluación de fugas a través de las respuestas de los modelos. La próxima señal observable será la publicación de la investigación completa con una descripción de los experimentos, métricas y limitaciones. Una incertidumbre significativa radica en que actualmente solo está disponible un sinopsis metadata_only de una única fuente.