
Pesquisadores do IIT Bombay e da Adobe Research criaram um modelo de linguagem inverso que recupera a instrução original a partir do texto gerado por um modelo de linguagem. Os autores denominaram o método de «Previous-Token Prediction».
De acordo com o sinopse do The Decoder, a abordagem não requer acesso aos pesos do modelo original e funciona com diferentes modelos. A publicação descreve a precisão da recuperação como quase perfeita.
Para empresas que utilizam instruções sistêmicas fechadas, isso representa um risco potencial de exposição dessas configurações. No entanto, o material disponível consiste em metadados e uma sinopse da publicação, e não no texto completo da pesquisa; portanto, as condições dos experimentos e os limites de aplicabilidade do método permanecem pouco claros.
comentário editorial
Por que importa
A provável consequência é o aumento da atenção à proteção de instruções sistêmicas fechadas e à avaliação de vazamentos através das respostas dos modelos. O próximo sinal observável será a publicação da pesquisa completa com descrição dos experimentos, métricas e limitações. Uma incerteza significativa relaciona-se ao fato de que atualmente está disponível apenas uma sinopse metadata_only de uma única fonte.