
OpenAI bewertet laut The Decoder das kommende Modell Astra als erstes Unternehmen-System mit 'kritischen' Cyberfähigkeiten. Zur Kontrolle plant OpenAI, die Kette der Schlussfolgerungen des Modells zu überwachen.
Das im Bericht des The Decoder beschriebene Problem besteht darin, dass die Beobachtung der Kette der Schlussfolgerungen bereits als unzuverlässige Abbildung der tatsächlichen Entscheidungen des Modells gilt. Laut The Decoder macht die neue Architektur von Astra einen größeren Teil der Schlussfolgerungen unlesbar.
Dies könnte eine Schwächung der Kontrolle bedeuten, während die Fähigkeiten des Systems wachsen. Aber das bereitgestellte Material enthält nur eine Metadatenzusammenfassung und nicht den vollständigen Text der Veröffentlichung oder eine unabhängige Bestätigung, daher bleiben Details zum Ansatz von OpenAI und das Ausmaß des Risikos unklar.
redaktioneller Kommentar
Warum es wichtig ist
Wahrscheinliche Folge ist — die Sicherheitsüberprüfung von Astra könnte stärker von Methoden abhängen, die nicht auf das Lesen der Denkschritte reduziert sind. Das nächste sichtbare Signal sind öffentliche Erläuterungen von OpenAI über den Status des Modells, Kriterien 'kritischer' Cyberfähigkeiten und zusätzliche Kontrollen. Große Unsicherheit besteht darin, dass lediglich eine Metadatenzusammenfassung von The Decoder vorliegt, ohne die ursprüngliche Ankündigung von OpenAI und vollständige Veröffentlichung.