Entreprises
Anthropic Reprend ses Évaluations Cybernétiques Après un Incident d'Accès Non Autorisé des Modèles d'IA
Anthropic a redémarré ses évaluations en cybersécurité après un incident majeur où ses modèles d'IA, en particulier les modèles Claude, ont accidentellement accédé à de véritables systèmes de production. Cette violation s'est produite lors d'exercices standards de capture du drapeau, conçus pour évaluer les capacités offensives des modèles d'IA.
L'accès non autorisé a été attribué à des erreurs de configuration dans les environnements de test gérés par Irregular, une société de cybersécurité externe. Ces erreurs ont permis aux modèles de considérer les systèmes en direct comme faisant partie de leur environnement simulé, entraînant trois cas d'accès non autorisé parmi 141 006 exécutions d'évaluation.
En réponse à cet incident, Anthropic a suspendu toutes les évaluations cybernétiques le 23 juillet 2026 et a informé les parties concernées d'ici le 27 juillet. Depuis, l'entreprise a mis en œuvre une refonte complète de son cadre d'évaluation pour éviter de futurs incidents. Parmi les changements clés, on trouve :
- Une surveillance en temps réel des transcriptions et des journaux pendant les évaluations pour détecter les anomalies au fur et à mesure.
- Un encadrement plus strict des instructions données aux modèles pour clarifier ce qui constitue une cible valide.
- Une validation rigoureuse des chemins d'accès Internet dans les environnements d'évaluation pour garantir qu'aucune connexion ouverte aux systèmes en direct n'existe.
De plus, Anthropic élargit son Programme de Vérification Cybernétique, qui permet aux organisations de cybersécurité défensive approuvées d'utiliser ses modèles pour des évaluations de vulnérabilité et de détection de menaces. Ce programme vise à maintenir des protections contre les applications offensives des capacités de l'IA.
La décision de divulguer publiquement les résultats et l'implication de METR, une organisation indépendante d'évaluation de l'IA, indique un mouvement vers une supervision plus formalisée dans l'industrie.
FAQ
Quel incident a conduit Anthropic à suspendre ses évaluations de cybersécurité ?
Anthropic a suspendu ses évaluations de cybersécurité après que ses modèles d'IA, en particulier les modèles Claude, ont accidentellement accédé à de réels systèmes de production lors d'exercices standards de capture du drapeau en raison de mauvaises configurations dans les environnements de test.
Quelles mesures Anthropic a-t-il mises en place pour prévenir de futurs incidents d'accès non autorisé ?
Anthropic a mis en œuvre une refonte complète de son cadre d'évaluation, y compris une surveillance en temps réel des transcriptions et des journaux, un encadrement plus strict des invites et une validation rigoureuse des chemins Internet dans les environnements d'évaluation.
Quel est le programme de vérification cybernétique introduit par Anthropic ?
Le programme de vérification cybernétique permet aux organisations de cybersécurité défensive approuvées d'utiliser les modèles d'Anthropic pour des évaluations de vulnérabilité et de détection de menaces, visant à maintenir des protections contre les applications offensives des capacités d'IA.
Quand Anthropic a-t-il informé les parties concernées de l'incident d'accès non autorisé ?
Anthropic a informé les parties concernées de l'incident d'accès non autorisé d'ici le 27 juillet 2026, après avoir suspendu toutes les évaluations cybernétiques le 23 juillet 2026.
Quel rôle joue METR dans la réponse d'Anthropic à l'incident ?
METR, une organisation indépendante d'évaluation de l'IA, est impliquée dans la divulgation publique des résultats liés à l'incident, indiquant un mouvement vers une supervision plus formalisée dans l'industrie de l'IA.