MIT Technology Review AI hat einen Beitrag über sieben Tests veröffentlicht, die mit Rätseln und Spielen verbunden sind. Aus der Beschreibung geht hervor, dass sie dazu dienen, zu überprüfen, wie gut Modelle Aufgaben bewältigen, die Lücken in ihren intellektuellen Fähigkeiten aufdecken können.

Der praktische Wert der Veröffentlichung liegt in dem Vorschlag, diese Aufgaben eigenständig zu prüfen und menschliche Lösungen mit den Ergebnissen der KI zu vergleichen. Der verfügbare Source besteht jedoch nur aus Metadaten der Seite und enthält keine Details zu konkreten Modellen, Antworten oder Methoden.

Daher lässt sich kein Schluss ziehen, welche Systeme Fehler machten, wie häufig dies geschah und ob der Mensch die Modelle in diesen Tests übertrifft.