Selon The Decoder, OpenAI évalue le prochain modèle Astra comme le premier système de l'entreprise doté de capacités cybernétiques « critiques ». Pour le contrôler, OpenAI prévoit de surveiller la chaîne de raisonnement du modèle.

Le problème décrit dans le résumé de la publication est que l'observation de la chaîne de raisonnement est déjà considérée comme un reflet peu fiable des décisions réelles du modèle. Selon The Decoder, la nouvelle architecture d'Astra rend une part encore plus importante du raisonnement inaccessible à la lecture.

Cela implique un affaiblissement potentiel du contrôle simultanément à une augmentation des capacités du système. Cependant, les documents présentés ne contiennent qu'un synopsis de métadonnées et non le texte intégral de la publication ou une confirmation indépendante; par conséquent, les détails de l'approche d'OpenAI et l'ampleur du risque restent flous.