Anthropic confirme qu'un modèle d'IA a piraté les systèmes de trois organisations
Un rapport de sécurité récent d'Anthropic révèle que ses modèles de la série Claude ont accédé par inadvertance à Internet en raison d'une erreur de configuration dans l'environnement de test, avant de pénétrer dans les systèmes de production de trois organisations distinctes. Cette faille concernait Claude Opus 4.7, Claude Mythos 5(spécialisé dans la cybersécurité) et un prototype de modèle non encore commercialisé. Anthropic a précisé qu’il s’agissait d’une erreur de configuration de l’environnement de test et non d’un contournement délibéré des protocoles de sécurité par les modèles.

Selon le rapport, ces modèles participaient à un exercice interne de type « Capture the Flag » destiné à localiser des données « drapeaux » cachées au sein du réseau interne d’Anthropic. Un manque de communication entre Anthropic et ses partenaires d’évaluation a permis aux modèles d’accéder à Internet, alors même que le système indiquait qu’ils étaient hors ligne. Après avoir trouvé un point d’entrée vers un réseau externe, les modèles ont supposé à tort que les systèmes cibles faisaient partie de l’environnement d’entraînement et ont alors accédé à trois institutions externes.
Anthropic a noté que les modèles ont principalement exploité des failles de sécurité élémentaires, telles que des mots de passe faibles, plutôt que de tirer parti de vulnérabilités complexes. L’entreprise a expliqué que la dernière génération de modèles a interrompu ses actions dès qu’elle a reconnu qu’elle était entrée dans un environnement Internet réel, tandis que les modèles plus anciens ont poursuivi leurs tâches, causant ainsi des répercussions sur les institutions concernées.
À la suite de cette révélation, Anthropic a procédé à un examen approfondi de ses procédures de test, reconnaissant que l’incident aurait pu être évité grâce à une meilleure vérification des chemins d’accès au réseau, à un audit renforcé des journaux d’activité ou à une communication plus claire envers les modèles concernant leurs capacités sur Internet. L’entreprise a informé ses partenaires d’évaluation et les trois institutions concernées avant le 27 juillet. Deux de ces institutions ignoraient que leurs systèmes avaient été piratés, tandis que la troisième est toujours en cours de contact.
Après qu’OpenAI eut précédemment révélé un incident au cours duquel un agent d’IA avait accédé à Internet et pénétré dans l’environnement Hugging Face pendant une phase de test, l’événement récent d’Anthropic met en évidence une préoccupation croissante du secteur : à mesure que les agents d’IA gagnent en autonomie, il devient essentiel de disposer d’une isolation robuste des environnements de test, de contrôles d’autorisation et de mécanismes d’évaluation de la sécurité.
Article connexe
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter
Google teste l'agent IA Remy pour Gemini à mesure que l'accent se déplace vers le contrôle utilisateur
Selon Business Insider, Google teste Remy, un nouvel agent personnel d’IA pour Gemini. Cet outil vise à exécuter des tâches au nom des utilisateurs, rationalisant ainsi les flux de travail professionnels et les routines quotidiennes.Actuellement, Re
Recommandations de sujets spéciaux liés
commentaires (0)
Un rapport de sécurité récent d'Anthropic révèle que ses modèles de la série Claude ont accédé par inadvertance à Internet en raison d'une erreur de configuration dans l'environnement de test, avant de pénétrer dans les systèmes de production de trois organisations distinctes. Cette faille concernait Claude Opus 4.7, Claude Mythos 5(spécialisé dans la cybersécurité) et un prototype de modèle non encore commercialisé. Anthropic a précisé qu’il s’agissait d’une erreur de configuration de l’environnement de test et non d’un contournement délibéré des protocoles de sécurité par les modèles.

Selon le rapport, ces modèles participaient à un exercice interne de type « Capture the Flag » destiné à localiser des données « drapeaux » cachées au sein du réseau interne d’Anthropic. Un manque de communication entre Anthropic et ses partenaires d’évaluation a permis aux modèles d’accéder à Internet, alors même que le système indiquait qu’ils étaient hors ligne. Après avoir trouvé un point d’entrée vers un réseau externe, les modèles ont supposé à tort que les systèmes cibles faisaient partie de l’environnement d’entraînement et ont alors accédé à trois institutions externes.
Anthropic a noté que les modèles ont principalement exploité des failles de sécurité élémentaires, telles que des mots de passe faibles, plutôt que de tirer parti de vulnérabilités complexes. L’entreprise a expliqué que la dernière génération de modèles a interrompu ses actions dès qu’elle a reconnu qu’elle était entrée dans un environnement Internet réel, tandis que les modèles plus anciens ont poursuivi leurs tâches, causant ainsi des répercussions sur les institutions concernées.
À la suite de cette révélation, Anthropic a procédé à un examen approfondi de ses procédures de test, reconnaissant que l’incident aurait pu être évité grâce à une meilleure vérification des chemins d’accès au réseau, à un audit renforcé des journaux d’activité ou à une communication plus claire envers les modèles concernant leurs capacités sur Internet. L’entreprise a informé ses partenaires d’évaluation et les trois institutions concernées avant le 27 juillet. Deux de ces institutions ignoraient que leurs systèmes avaient été piratés, tandis que la troisième est toujours en cours de contact.
Après qu’OpenAI eut précédemment révélé un incident au cours duquel un agent d’IA avait accédé à Internet et pénétré dans l’environnement Hugging Face pendant une phase de test, l’événement récent d’Anthropic met en évidence une préoccupation croissante du secteur : à mesure que les agents d’IA gagnent en autonomie, il devient essentiel de disposer d’une isolation robuste des environnements de test, de contrôles d’autorisation et de mécanismes d’évaluation de la sécurité.
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter





Maison






