
De acordo com a The Decoder, a OpenAI avalia o próximo modelo Astra como o primeiro sistema da empresa com capacidades cibernéticas "críticas". Para controle, a OpenAI planeja monitorar a cadeia de raciocínio do modelo.
O problema descrito no resumo da publicação é que a observação da cadeia de raciocínio já é considerada um reflexo não confiável das decisões reais do modelo. Segundo a The Decoder, a nova arquitetura da Astra torna uma parte ainda maior do raciocínio inacessível à leitura.
Isso significa um possível enfraquecimento do controle simultaneamente ao aumento das capacidades do sistema. No entanto, os materiais apresentados contêm apenas um sinopse de metadados, e não o texto completo da publicação ou confirmação independente, portanto, os detalhes da abordagem da OpenAI e a escala do risco permanecem pouco claros.
comentário editorial
Por que importa
A provável consequência é que a verificação de segurança da Astra pode depender mais fortemente de métodos que não se resumem à leitura da cadeia de raciocínio. O sinal observável mais próximo são as explicações públicas da OpenAI sobre o status do modelo, os critérios de capacidades cibernéticas "críticas" e medidas de controle adicionais. Uma incerteza significativa está relacionada ao fato de que há apenas um resumo de metadados da The Decoder à disposição, sem declaração primária da OpenAI e publicação completa.