Eine Studie, über die MIT News AI berichtete, zeigte Unterschiede bei der Nutzung diagnostischer Hilfe auf Basis großer Sprachmodelle. Laien verließen sich auf die Hinweise des Systems selbst in Fällen, in denen es falsch lag, wohingegen Kliniker die KI-Fehler identifizierten.

Dies ist wichtig, weil ein und dasselbe Unterstützungssystem je nach Erfahrung des Benutzers unterschiedliche Wirkungen erzielen kann. Für die Medizin unterstreicht dies die Bedeutung einer Überprüfung von Empfehlungen anstatt eines blinden Vertrauens in automatisierte Antworten.

In der verfügbaren Beschreibung werden weder die Methodik der Studie, die Anzahl der Teilnehmer, das spezifische Modell noch die Arten der diagnostischen Aufgaben genannt. Daher sollten die Schlussfolgerungen als Bericht über eine entdeckte Regelmäßigkeit und nicht als Bewertung aller medizinischen KI-Systeme verstanden werden.