OpenAI renforce la protection de ChatGPT Atlas contre les attaques par injection d'invite en utilisant une équipe rouge automatisée entraînée par apprentissage par renforcement. Cette méthode permet d'identifier de nouvelles vulnérabilités à un stade précoce et de renforcer la protection de l'agent navigateur à mesure que l'IA devient plus autonome.

Cette approche, appelée « boucle de détection et de correction », aide OpenAI à réagir rapidement aux nouvelles menaces et à améliorer la sécurité du système. Cela est particulièrement important dans un contexte d'autonomie croissante de l'IA, ce qui pourrait accroître les risques pour la sécurité.