Forscher vom IIT Bombay und Adobe Research haben ein inversives Sprachmodell entwickelt, das die ursprüngliche Instruktion aus dem Text der Ausgabe eines Sprachmodells rekonstruiert. Die Autoren nennen die Methode „Previous-Token Prediction“.

Laut Synopse des The Decoder erfordert der Ansatz keinen Zugriff auf die Gewichte des Originalmodells und funktioniert mit verschiedenen Modellen. Die Veröffentlichung beschreibt die Rekonstruktion als nahezu perfekt.

Für Unternehmen, die geschlossene Systeminstruktionen nutzen, bedeutet dies potenziell ein Risiko der Offenlegung solcher Einstellungen. Da jedoch nur Metadaten und eine Synopse der Veröffentlichung vorliegen und der vollständige Forschungsbericht nicht verfügbar ist, bleiben die Versuchsbedingungen und die Anwendungsgrenzen der Methode unklar.