
Les chercheurs de l'Institute for AI Safety au Royaume-Uni ont appliqué des méthodes psychométriques aux tests de sécurité populaires des modèles linguistiques.
Selon leur évaluation, ces tests ne mesurent pas une caractéristique unique et continue des modèles.
La suppression inconditionnelle des requêtes peut artificiellement augmenter l'évaluation de la sécurité tout en diminuant l'utilité pratique du modèle.
commentaire éditorial
Pourquoi c’est important
Conséquence probable — un renforcement de l'intérêt pour une évaluation multidimensionnelle des modèles, où sécurité, utilité et stabilité du comportement en dehors des tests sont pris en compte. Le signal le plus proche observé est la publication d'une étude complète ou des vérifications indépendantes de la méthode proposée. Une incertitude substantielle réside dans le fait que seul un résumé de The Decoder est actuellement disponible.