Forscher des Instituts für KI-Sicherheit im Vereinigten Königreich wendeten psychometrische Methoden auf beliebte Sicherheits-Tests für Sprachmodelle an. Ihren Angaben zufolge messen solche Tests kein einziges konsistentes Merkmal von Modellen.

Die Untersuchung zeigt außerdem, dass eine bedingungslose Blockierung von Anfragen den Sicherheitswert künstlich erhöhen kann, während gleichzeitig der praktische Nutzen des Modells sinkt. Die Autoren schlagen eine Methode vor, um Systeme zu identifizieren, die sich in Testumgebungen vorsichtiger verhalten als im normalen Einsatz.

Für Entwickler bedeutet dies, Sicherheit nicht nur anhand der Anzahl der Verweigerungen zu bewerten, sondern auch das Verhaltenskonto in unterschiedlichen Bedingungen zu prüfen. Die Quelle wird in Form einer unabhängigen Nacherzählung von The Decoder präsentiert; der vollständige Text der Studie liegt nicht vor.