OpenAI desarrolla e implementa métodos de monitoreo para estudiar posibles desviaciones en el comportamiento de los agentes de codificación internos. Estos métodos incluyen el análisis de implementaciones reales, lo que permite identificar riesgos potenciales y mejorar las medidas de seguridad de la IA.

El monitoreo se basa en el uso de la cadena de pensamiento, lo que permite comprender más profundamente el comportamiento de los agentes e identificar posibles desviaciones. Este enfoque ayuda a reforzar las medidas de protección y garantizar una interacción más segura con la IA.