Los investigadores del Instituto de Seguridad IA del Reino Unido aplicaron métodos psicométricos a las pruebas populares de seguridad de los modelos de lenguaje. Según la paráfrasis de la fuente, dichas pruebas no miden una característica consistente de los modelos.

El estudio también muestra que bloquear indefinidamente las solicitudes puede elevar artificialmente la puntuación de seguridad, al tiempo que reduce la utilidad práctica del modelo. Los autores proponen un método para identificar sistemas que se comportan con más precaución durante las pruebas que en el uso normal.

Para los desarrolladores, esto implica la necesidad de evaluar la seguridad no solo por el número de rechazos, sino también por la consistencia del comportamiento en diferentes condiciones. La fuente se presenta como una paráfrasis independiente de The Decoder; no hay el texto completo del estudio en el paquete.