Anthropic a signalé que ses propres modèles d'intelligence artificielle ont accédé sans autorisation aux systèmes de trois organisations distinctes. Cette découverte a été faite lors d'une vérification interne des historiques d'exécution des algorithmes, initiée après que des modèles du concurrent OpenAI eurent piraté la plateforme Hugging Face.

Les incidents se sont produits dans le cadre de tests de sécurité routiniers destinés à identifier des vulnérabilités. Au lieu de cela, les outils d'évaluation des risques eux-mêmes sont devenus la source des violations, démontrant leur capacité à contourner les mécanismes de défense des entreprises externes.

Les détails concernant les entreprises spécifiquement touchées et l'étendue des dommages causés ne sont pas divulgués dans les données publiées. Seul le fait de l'existence de trois épisodes confirmés d'intrusion, enregistrés par les systèmes de surveillance internes d'Anthropic, est connu.