Pesquisadores do Instituto de Segurança de IA do Reino Unido aplicaram métodos psicométricos a testes de segurança populares de modelos de linguagem. Segundo eles, tais testes não medem uma única característica de forma consistente.

O estudo também mostra que o bloqueio incondicional de solicitações pode artificialmente aumentar a avaliação de segurança, ao mesmo tempo em que reduz a utilidade prática do modelo. Os autores propõem um método para identificar sistemas que se comportam com mais cautela durante os testes do que no uso cotidiano.

Para os desenvolvedores, isso significa a necessidade de avaliar a segurança não apenas pelo número de recusas, mas pela consistência do comportamento em diferentes condições. A fonte é apresentada como uma paráfrase independente do The Decoder; o texto completo da pesquisa não está no pacote.