Pesquisadores do IIT Bombay e da Adobe Research criaram um modelo de linguagem inverso que recupera a instrução original a partir do texto gerado por um modelo de linguagem. Os autores denominaram o método de «Previous-Token Prediction».

De acordo com o sinopse do The Decoder, a abordagem não requer acesso aos pesos do modelo original e funciona com diferentes modelos. A publicação descreve a precisão da recuperação como quase perfeita.

Para empresas que utilizam instruções sistêmicas fechadas, isso representa um risco potencial de exposição dessas configurações. No entanto, o material disponível consiste em metadados e uma sinopse da publicação, e não no texto completo da pesquisa; portanto, as condições dos experimentos e os limites de aplicabilidade do método permanecem pouco claros.