Un investigador de Anthropic presentó resultados en los que los sistemas automatizados mejoraron las métricas en todos los 10 tests destinados a identificar formas concretas de comportamiento no conforme. Al respecto, según la descripción publicada, el rendimiento general no se deterioró.

La fuente no especifica qué sistemas exactos participaron en la prueba, cómo se diseñaron las pruebas ni cuán significativo fue la mejora. La información disponible se basa en metadatos y en un breve sinopsis de TechCrunch AI, y no en el texto completo de la investigación.

El interés práctico radica en que la optimización automática del comportamiento abarca al mismo tiempo pruebas de seguridad específicas y el rendimiento general de la operación del sistema. Pero sin detalles no es posible evaluar la reproducibilidad del experimento ni su aplicabilidad a productos reales.