
Selon The Decoder, OpenAI évalue le prochain modèle Astra comme le premier système de l'entreprise doté de capacités cybernétiques « critiques ». Pour le contrôler, OpenAI prévoit de surveiller la chaîne de raisonnement du modèle.
Le problème décrit dans le résumé de la publication est que l'observation de la chaîne de raisonnement est déjà considérée comme un reflet peu fiable des décisions réelles du modèle. Selon The Decoder, la nouvelle architecture d'Astra rend une part encore plus importante du raisonnement inaccessible à la lecture.
Cela implique un affaiblissement potentiel du contrôle simultanément à une augmentation des capacités du système. Cependant, les documents présentés ne contiennent qu'un synopsis de métadonnées et non le texte intégral de la publication ou une confirmation indépendante; par conséquent, les détails de l'approche d'OpenAI et l'ampleur du risque restent flous.
commentaire éditorial
Pourquoi c’est important
La conséquence probable est que la vérification de la sécurité d'Astra pourrait dépendre davantage de méthodes ne se réduisant pas à la lecture de la chaîne de raisonnement. Le signal observable le plus proche concerne les explications publiques d'OpenAI sur le statut du modèle, les critères des capacités cybernétiques « critiques » et les mesures de contrôle supplémentaires. Une incertitude substantielle persiste car seules les métadonnées résumées par The Decoder sont disponibles, sans déclaration primaire d'OpenAI ni publication complète.