OpenAI está reforzando la protección de ChatGPT Atlas contra ataques de inyección de instrucciones mediante el uso de un equipo rojo automatizado entrenado con aprendizaje por refuerzo. Este método permite identificar nuevas vulnerabilidades en etapas tempranas y fortalecer la defensa del agente basado en navegador a medida que la IA se vuelve más autónoma.

Este enfoque, denominado «bucle de detección y corrección», ayuda a OpenAI a responder con rapidez a nuevas amenazas y mejorar la seguridad del sistema. Esto es especialmente importante dado el creciente nivel de autonomía de la IA, lo cual puede incrementar los riesgos para la seguridad.