OpenAI усиливает защиту ChatGPT Atlas от атак на вставку приглашений, используя автоматизированное красное командование, обученное с помощью обучения с подкреплением. Этот метод позволяет выявлять новые уязвимости на ранних этапах и укреплять защиту браузерного агента по мере того, как ИИ становится более автономным.

Этот подход, называемый «петляю выявления и исправления», помогает OpenAI оперативно реагировать на новые угрозы и улучшать безопасность системы. Это особенно важно в условиях роста автономности ИИ, что может увеличить риски для безопасности.