Forscher entwickelten eine Vierphasen‑Methode, um zu prüfen, ob Sprachmodelle Signale des eigenen Vertrauens bei der Wahl zwischen einer Antwort und dem Zurückhalten verwenden. In der ersten Phase wurde das Vertrauensniveau der Modelle gemessen, ohne die Möglichkeit, zu antworten.

Die Studie wurde in Nature Machine Intelligence unter dem Titel „Causal evidence that language models use confidence to drive behaviour“ veröffentlicht. In der Beschreibung betrachtet Metakognition die Beurteilung der Qualität eigener kognitiver Handlungen, die mit adaptivem Verhalten bei verschiedenen Arten verbunden ist.

Die verfügbare Quelle enthält nur redaktionelle Zusammenfassungen und berichtet nicht von den Ergebnissen der anderen Phasen, dem Namen der untersuchten Modelle oder quantitativen Kennzahlen. Daher ist bislang nur die Formulierung eines kausalen Tests bestätigt, aber nicht dessen Ergebnisse.