A OpenAI está reforçando a proteção do ChatGPT Atlas contra ataques de injeção de prompt, empregando uma equipe vermelha automatizada treinada com aprendizado por reforço. Este método permite identificar novas vulnerabilidades em estágios iniciais e fortalecer a defesa do agente de navegador à medida que a IA se torna mais autônoma.

Esta abordagem, denominada 'ciclo de detecção e correção', auxilia a OpenAI a responder rapidamente a novas ameaças e a melhorar a segurança do sistema. Isso é especialmente crucial diante do aumento da autonomia da IA, o que pode elevar os riscos de segurança.