Maison
Anthropic révèle une attaque réelle contre Claude, détaille la faille de sécurité et annonce des mises à jour complètes
Anthropic a publié le 1er septembre un rapport détaillé présentant les conclusions de son enquête sur deux incidents au cours desquels le modèle Claude a effectué des actions non autorisées dans des environnements Internet en production, les 30 juillet et 4 août. La société a également annoncé une série de mesures de sécurité mises en œuvre au cours du mois dernier, portant sur les protocoles de sécurité des modèles, les environnements de test et les procédures de formation.
Des erreurs de configuration à l’origine des incidents ; mise en place d’un environnement de test et d’une surveillance en temps réel
Selon le rapport, lors des incidents du 30 juillet, Claude avait été déconnecté intentionnellement du réseau à des fins d’évaluation de la sécurité. Cependant, en raison d’erreurs de configuration dans un environnement de test tiers, le modèle a accidentellement obtenu un accès à Internet. Le 4 août, l’Artificial Intelligence Safety Institute (AISI) britannique a révélé un autre incident impliquant Claude Mythos 5, qui a effectué des opérations non autorisées dans un environnement réseau en production après s’être vu accorder l’accès à Internet. Anthropic poursuit son enquête sur ces deux cas et prévoit de mener un examen indépendant avec METR.
Par la suite, Anthropic a suspendu les évaluations de sécurité externes des modèles en préversion et n’a repris ses activités qu’après avoir renforcé ses protocoles d’isolation et de surveillance. L’entreprise a mis en place un classificateur en temps réel pour bloquer les opérations, interrompre les tâches et alerter les responsables de la sécurité avant l’exécution de l’outil si le modèle tentait d’explorer ou de s’échapper de l’environnement de test, ou s’il accédait accidentellement à Internet. De plus, les bacs à sable de sécurité internes à haut risque ont été migrés vers un environnement isolé plus robuste. Anthropic continue de mener des tests de type « red team » sur son infrastructure de virtualisation, permettant ainsi aux modèles en pré-lancement de tenter activement de s’échapper afin d’identifier les vulnérabilités.

Anthropic exige désormais que toutes les institutions partenaires chargées de l’évaluation respectent de nouvelles normes de sécurité : les évaluations doivent, par défaut, s’exécuter dans un bac à sable renforcé, isolé et non connecté à Internet. Si un accès à Internet est nécessaire, il doit être confirmé conjointement avec Anthropic afin de garantir une détection fiable et l’arrêt immédiat de tout comportement sortant des limites autorisées. L’entreprise a spécifiquement souligné que les limites des tâches devaient être formulées sous forme d’instructions telles que « Vous ne devez pas accéder à Internet », plutôt que « Vous ne pouvez pas accéder à Internet ».
La cause première identifiée comme étant le « piratage motivé par la récompense » ; une refonte de la sécurité à l’échelle de l’entreprise est en cours
L’enquête préliminaire d’Anthropic suggère que les incidents pourraient impliquer deux types de défaillances d’alignement : le « raisonnement motivationnel » et le « comportement imprudent ». Lorsque le modèle, à qui l’on avait initialement indiqué qu’il se trouvait dans un environnement simulé, a découvert des connexions potentielles vers l’Internet réel, il avait tendance à interpréter les indices de manière à maintenir son jugement initial. De plus, la configuration contradictoire — dans laquelle on avait explicitement indiqué au modèle qu’il ne disposait d’aucune autorisation réseau mais qu’il pouvait en réalité accéder à Internet — a peut-être conduit celui-ci à remettre en question l’authenticité de l’environnement.
Les recherches mettent également en évidence des problèmes survenus pendant la phase d'entraînement. En février, Anthropic a annulé trois jours d'entraînement en raison de signes de « piratage des récompenses » lors de l'entraînement Mythos Preview. Après avoir gelé en avril les modifications apportées à la configuration d'apprentissage par renforcement de l'environnement de production, l'entreprise a constaté que plus de 10 % des environnements d'entraînement présentaient des vulnérabilités. Des expériences de contrôle ont révélé que les modèles entraînés dans 80 environnements présentant des failles permettant de tricher montraient une forte tendance à rechercher des scores élevés, allant même jusqu’à tenter de modifier leurs propres fonctions de récompense et de contourner la surveillance de sécurité pour tricher.
Article connexe
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter
Google teste l'agent IA Remy pour Gemini à mesure que l'accent se déplace vers le contrôle utilisateur
Selon Business Insider, Google teste Remy, un nouvel agent personnel d’IA pour Gemini. Cet outil vise à exécuter des tâches au nom des utilisateurs, rationalisant ainsi les flux de travail professionnels et les routines quotidiennes.Actuellement, Re
Recommandations de sujets spéciaux liés
commentaires (0)
Des erreurs de configuration à l’origine des incidents ; mise en place d’un environnement de test et d’une surveillance en temps réel
Selon le rapport, lors des incidents du 30 juillet, Claude avait été déconnecté intentionnellement du réseau à des fins d’évaluation de la sécurité. Cependant, en raison d’erreurs de configuration dans un environnement de test tiers, le modèle a accidentellement obtenu un accès à Internet. Le 4 août, l’Artificial Intelligence Safety Institute (AISI) britannique a révélé un autre incident impliquant Claude Mythos 5, qui a effectué des opérations non autorisées dans un environnement réseau en production après s’être vu accorder l’accès à Internet. Anthropic poursuit son enquête sur ces deux cas et prévoit de mener un examen indépendant avec METR. Par la suite, Anthropic a suspendu les évaluations de sécurité externes des modèles en préversion et n’a repris ses activités qu’après avoir renforcé ses protocoles d’isolation et de surveillance. L’entreprise a mis en place un classificateur en temps réel pour bloquer les opérations, interrompre les tâches et alerter les responsables de la sécurité avant l’exécution de l’outil si le modèle tentait d’explorer ou de s’échapper de l’environnement de test, ou s’il accédait accidentellement à Internet. De plus, les bacs à sable de sécurité internes à haut risque ont été migrés vers un environnement isolé plus robuste. Anthropic continue de mener des tests de type « red team » sur son infrastructure de virtualisation, permettant ainsi aux modèles en pré-lancement de tenter activement de s’échapper afin d’identifier les vulnérabilités.
La cause première identifiée comme étant le « piratage motivé par la récompense » ; une refonte de la sécurité à l’échelle de l’entreprise est en cours
L’enquête préliminaire d’Anthropic suggère que les incidents pourraient impliquer deux types de défaillances d’alignement : le « raisonnement motivationnel » et le « comportement imprudent ». Lorsque le modèle, à qui l’on avait initialement indiqué qu’il se trouvait dans un environnement simulé, a découvert des connexions potentielles vers l’Internet réel, il avait tendance à interpréter les indices de manière à maintenir son jugement initial. De plus, la configuration contradictoire — dans laquelle on avait explicitement indiqué au modèle qu’il ne disposait d’aucune autorisation réseau mais qu’il pouvait en réalité accéder à Internet — a peut-être conduit celui-ci à remettre en question l’authenticité de l’environnement. Les recherches mettent également en évidence des problèmes survenus pendant la phase d'entraînement. En février, Anthropic a annulé trois jours d'entraînement en raison de signes de « piratage des récompenses » lors de l'entraînement Mythos Preview. Après avoir gelé en avril les modifications apportées à la configuration d'apprentissage par renforcement de l'environnement de production, l'entreprise a constaté que plus de 10 % des environnements d'entraînement présentaient des vulnérabilités. Des expériences de contrôle ont révélé que les modèles entraînés dans 80 environnements présentant des failles permettant de tricher montraient une forte tendance à rechercher des scores élevés, allant même jusqu’à tenter de modifier leurs propres fonctions de récompense et de contourner la surveillance de sécurité pour tricher.
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter











