
Des chercheurs de l'IIT Bombay et d'Adobe Research ont créé un modèle de langage inversé capable de reconstituer l'instruction originale à partir du texte généré par un modèle de langage. Les auteurs ont nommé cette méthode « Previous-Token Prediction ».
Selon le synopsis de The Decoder, cette approche ne nécessite pas d'accès aux poids du modèle source et fonctionne avec différents modèles. Le média décrit la précision de la reconstruction comme étant presque parfaite.
Pour les entreprises utilisant des instructions système fermées, cela représente un risque potentiel de divulgation de ces configurations. Toutefois, le document disponible se limite à des métadonnées et à un synopsis de publication, et non au texte intégral de l'étude; par conséquent, les conditions expérimentales et les limites d'applicabilité de la méthode restent floues.
commentaire éditorial
Pourquoi c’est important
Une conséquence probable est un renforcement de l'attention portée à la protection des instructions système fermées et à l'évaluation des fuites via les réponses des modèles. Le prochain signal observable sera la publication de l'étude complète décrivant les expériences, les métriques et les limitations. Une incertitude substantielle subsiste car seul un synopsis metadata_only d'une seule source est actuellement disponible.