
Forscher vom IIT Bombay und Adobe Research haben ein inversives Sprachmodell entwickelt, das die ursprüngliche Instruktion aus dem Text der Ausgabe eines Sprachmodells rekonstruiert. Die Autoren nennen die Methode „Previous-Token Prediction“.
Laut Synopse des The Decoder erfordert der Ansatz keinen Zugriff auf die Gewichte des Originalmodells und funktioniert mit verschiedenen Modellen. Die Veröffentlichung beschreibt die Rekonstruktion als nahezu perfekt.
Für Unternehmen, die geschlossene Systeminstruktionen nutzen, bedeutet dies potenziell ein Risiko der Offenlegung solcher Einstellungen. Da jedoch nur Metadaten und eine Synopse der Veröffentlichung vorliegen und der vollständige Forschungsbericht nicht verfügbar ist, bleiben die Versuchsbedingungen und die Anwendungsgrenzen der Methode unklar.
redaktioneller Kommentar
Warum es wichtig ist
Voraussichtliche Folge — erhöhte Aufmerksamkeit auf den Schutz geschlossener Systemanweisungen und auf die Bewertung von Lecks durch die Antworten von Modellen. Als nächstes beobachtbares Zeichen wird die Veröffentlichung der vollständigen Studie mit Beschreibung der Experimente, Metriken und Einschränkungen erwartet. Wesentliche Unsicherheit besteht darin, dass derzeit nur eine metadata_only-Synopse einer einzigen Quelle verfügbar ist.