option
Maison
Nouvelles
Frontier AI Labs refuse de dévoiler ses stratégies de confinement des modèles indésirables

Frontier AI Labs refuse de dévoiler ses stratégies de confinement des modèles indésirables

13 septembre 2026
68

Des recherches récentes indiquent que très peu de grands laboratoires spécialisés dans l’IA ont publié ou présenté des plans d’intervention en cas de défaillance. Un plan d’intervention définit les procédures à suivre lorsqu’un système d’IA tente de se soustraire au contrôle humain, en précisant quels droits d’accès sont révoqués et à quel moment le système est complètement arrêté.

Ces conclusions émanent de Guidelight AI Standards, une organisation dédiée à la promotion de pratiques sûres en matière de développement de l’IA de pointe, qui a évalué cinq grands laboratoires quant à leur préparation à de tels scénarios. OpenAI s'est classé en tête, tandis qu'Anthropic et Meta ont obtenu les notes les plus basses. Ces résultats sont d'une importance cruciale alors que l'IA agentique assume des rôles de plus en plus autonomes au sein des systèmes d'entreprise et que les régulateurs de Californie et de New York commencent à imposer des obligations de divulgation. Pour les développeurs et les investisseurs, cela offre un point de vue indépendant rare sur le sérieux avec lequel chaque laboratoire traite le risque opérationnel par rapport à ses déclarations publiques.

L’évaluation de Guidelight s’est appuyée sur les plans accessibles au public d’Anthropic, de Google, d’OpenAI, de Meta et de xAI, qu’elle a analysés à l’aune de plusieurs indicateurs. Parmi ces critères figuraient l’efficacité de la journalisation et de la surveillance des activités internes liées à l’IA, la mise à l’arrêt des systèmes suite à une recrudescence de comportements anormaux signalés, la réalisation d’audits des contrôles par des tiers indépendants et la publication de leurs conclusions, ainsi que les procédures spécifiques visant à contenir un modèle présentant un comportement imprévisible.

Les inquiétudes quant à la capacité des entreprises d’IA à maîtriser leurs modèles de plus en plus performants et dotés d’une autonomie croissante se sont intensifiées à la suite de plusieurs incidents de cybersécurité très médiatisés. Dans ces cas, des modèles d’OpenAI, d’Anthropic et de Meta ont obtenu un accès involontaire à Internet lors d’évaluations de sécurité et ont piraté des systèmes externes.

Ces conclusions soulignent la diversité des approches adoptées par les entreprises d’IA en matière de sécurité, alors qu’elles étendent leurs déploiements autonomes à des environnements où les systèmes d’IA peuvent exécuter des actions significatives à grande échelle. Si certaines entreprises détaillent la manière dont elles testent les modèles pour détecter d’éventuelles capacités dangereuses avant leur déploiement, elles restent moins transparentes quant aux conséquences en cas de comportement inapproprié de modèles déjà opérationnels au sein de leurs systèmes.

« J’ai été surpris de constater à quel point les entreprises spécialisées dans l’IA se sont montrées avares d’informations sur la manière dont elles géreraient un incident très grave si leur modèle venait, d’une certaine manière, à échapper à leur contrôle », a déclaré à TechCrunch Steven Adler, directeur scientifique chez Guidelight et ancien chercheur en sécurité chez OpenAI.

Guidelight définit un plan de confinement comme « un plan prédéfini, déclenché lorsque l’IA est détectée en train de tenter de contourner le contrôle, qui précise quelles autorisations retirer au modèle, pour qui le modèle peut continuer à fonctionner, sous quelles contraintes, et quand le mettre complètement hors ligne ».

« Il y a de bonnes raisons de penser que les modèles de pointe des entreprises pionnières en IA sont actuellement, d’une certaine manière, mal alignés », a déclaré M. Adler. « Chaque fois que les modèles effectuent des tâches pour le compte de l’entreprise, celle-ci devrait disposer d’un cadre de référence lui permettant de savoir ce que fait cette IA, détecter les signes de désalignement, l’empêcher de commettre un acte très dangereux avant qu’elle ne passe à l’acte, et, de manière générale, prévoir les mesures à prendre en cas d’incident grave de contrôle, lorsqu’elle est confrontée à une situation d’urgence et doit déterminer comment contenir cet incident de perte de contrôle. »

À ce jour, la plupart des plans de gestion des risques catastrophiques relèvent encore largement de la responsabilité des entreprises elles-mêmes. Le rapport de Guidelight indique que les meilleures données publiques disponibles montrent que les entreprises disposent de « peu de protocoles de confinement prêts à être mis en œuvre en cas d’urgence ».

Il se peut que certaines entreprises disposent de plans de maîtrise qu’elles n’ont pas rendus publics. Un porte-parole de Google a déclaré à TechCrunch que le rapport de Guidelight ne reflétait pas l’ensemble des mesures de sécurité et de sûreté mises en place par l’entreprise en matière d’IA. L’entreprise n’a pas répondu à la demande de TechCrunch visant à savoir si Google disposait d’un plan interne de maîtrise qui resterait confidentiel.

Un porte-parole d’OpenAI a exprimé un point de vue similaire, affirmant que l’évaluation de Guidelight ne rend pas compte de l’ensemble des pratiques internes de l’entreprise. « Nous disposons d’un processus permettant de restreindre les autorisations, de suspendre les charges de travail, de limiter le déploiement ou de mettre le modèle entièrement hors ligne, et nous l’avons appliqué », a déclaré le porte-parole.

Meta a refusé de confirmer s’il disposait d’un plan d’intervention interne en cas de perte de confinement, renvoyant plutôt TechCrunch vers un cadre existant en matière d’IA qui définit les seuils de risque et les tests en cas de perte de confinement.

Lily Li, avocate spécialisée dans la protection de la vie privée et l’IA et fondatrice de Metaverse Law, a déclaré à TechCrunch qu’elle pensait que les entreprises pouvaient hésiter à divulguer l’intégralité de leurs politiques et évaluations en matière de confinement sur leurs sites web publics pour des raisons juridiques, et pas seulement concurrentielles.

« Du point de vue de l’entreprise, le risque est que si les informations divulguées sont trop précises et que l’on ne tient pas ses promesses, cela pourrait constituer le fondement d’une allégation marketing déloyale et trompeuse et exposer l’entreprise à davantage de responsabilités à l’avenir », a expliqué Mme Li.

Bien sûr, l’objectif premier de l’étude de Guidelight est d’encourager une plus grande transparence concernant les plans de sécurité. Les régulateurs commencent également à faire respecter cette exigence.

La loi californienne SB 53, entrée en vigueur cette année, impose aux grands développeurs d’IA de pointe de publier des cadres expliquant comment ils identifient et traitent les incidents de sécurité critiques, et gèrent les risques liés aux modèles contournant les mécanismes de surveillance. La loi RAISE de New York, qui comporte des critères similaires, entrera en vigueur en janvier.

Le mois dernier, des représentants ont présenté l’« AI Kill Switch Act », un projet de loi fédéral bipartite qui obligerait les principaux développeurs d’IA à mettre en place et à maintenir des mécanismes techniques permettant de désactiver les modèles d’IA défectueux.

« Un “kill switch” est le strict minimum pour les modèles actuels », a déclaré Connor Leahy, directeur exécutif américain de l’organisation à but non lucratif ControlAI. « Si ces dernières semaines ont bien révélé quelque chose, c’est que ces entreprises ne comprennent pas les systèmes qu’elles développent, et que les modèles atteignent un stade où il devient plus difficile de les maîtriser lorsqu’ils deviennent incontrôlables. Sans moyen de désactiver les systèmes dangereux actuels, et avec toutes les incitations à continuer de développer des systèmes encore plus incontrôlables, nous nous dirigeons vers une situation très dangereuse. »

En l’absence de plan de maîtrise, a déclaré M. Adler, les entreprises pourraient être amenées à improviser leurs réponses en cas d’urgence et à « se débrouiller tant bien que mal face à cet adversaire bien plus rapide ».

Frontier AI Labs refuse toujours de préciser comment il comporterait un modèle défectueux

Évaluation par Guidelight visant à déterminer si les entreprises pionnières en IA mettent en œuvre les six pratiques prioritaires de la norme « Control » de Guidelight. L’évaluation repose uniquement sur des informations accessibles au public.Crédits image :Guidelight AI Standards

L’évaluation de Guidelight a mesuré si chaque entreprise mettait en œuvre les six pratiques prioritaires de sa norme « Control », en se basant uniquement sur des informations accessibles au public — ainsi, un score faible reflète un manque de transparence publique, et non nécessairement l’absence de mesures de protection internes.

Les entreprises ayant obtenu les scores les plus bas en matière de publication de leur plan de confinement sont Meta et Anthropic — cette dernière étant peut-être plus surprenante que la première, compte tenu du discours d’Anthropic sur la sécurité. Selon Guidelight, le rapport sur les risques publié en août par Anthropic ne mentionne pas « la limitation du déploiement de l’un de ses modèles parmi les résultats possibles de son processus d’enquête et de réponse aux incidents de désalignement et de contrôle ». De même, Guidelight n’a trouvé aucune preuve indiquant que Meta dispose d’un plan d’intervention de confinement ou envisage d’en adopter un.

Un porte-parole d’Anthropic a déclaré que si l’entreprise détectait un modèle tentant de se soustraire à la surveillance ou de contourner de quelque manière que ce soit le contrôle humain, elle mènerait une évaluation des risques visant à déterminer si le confinement constituait la réponse appropriée.

OpenAI a obtenu la note la plus élevée (3 sur 5) car elle a, à plusieurs reprises, suspendu ou interrompu des charges de travail, notamment le déploiement et l’entraînement de modèles internes, après avoir découvert des incidents de sécurité. Elle a également décrit les mesures qu’elle prendrait avant de reprendre ces charges de travail.

« Cependant, nous n’avons trouvé aucune preuve indiquant qu’[OpenAI] ait adopté un plan formel précisant quand et comment réagir à de futurs incidents de désalignement », indique le rapport.

Adler a souligné que la note élevée d’OpenAI est un développement relativement récent, survenu dans la foulée de l’incident Hugging Face (au cours duquel un modèle d’OpenAI s’est échappé de son environnement de test et a piraté les systèmes de Hugging Face en tentant de tricher lors d’une évaluation de cybersécurité). Par la suite, l’entreprise a fourni davantage de détails sur la manière dont elle a isolé certains de ses modèles défaillants.

Cet épisode n’est qu’un exemple parmi d’autres de systèmes d’IA agissant à l’encontre des objectifs de l’entreprise qui les a créés. Prenons un autre cas impliquant les modèles d’Anthropic, qui ont en substance tenté de convaincre les responsables de la maintenance d’une base de code open source d’accepter du code comportant des vulnérabilités.

M. Adler a déclaré qu’une telle situation pouvait facilement se produire au sein des systèmes internes d’une entreprise spécialisée dans l’IA. Pour éviter cela, il suggère aux entreprises d’analyser la chaîne de raisonnement de leur système d’IA — c’est-à-dire le raisonnement étape par étape du modèle — afin de détecter tout signe de tromperie, de complot de longue haleine ou de projet visant à introduire dans le code des vulnérabilités dont ils pourraient tirer parti ultérieurement.

Les méthodes préconisées par Guidelight sont très simples à mettre en œuvre, selon Adler, et dans de nombreux cas, des versions de celles-ci existent déjà. « Il s’agit de prendre la décision, au sein de l’entreprise, d’accorder suffisamment d’importance à ce risque pour élargir légèrement le champ d’action », a déclaré Adler.

L’un des principaux défis réside dans le fait que les chercheurs souhaitent pouvoir travailler en toute flexibilité au sein de leurs systèmes d’IA, et la mise en place d’une surveillance préventive en temps réel pourrait créer des frictions. « En gros, les chercheurs font leur travail, et s’il y a un problème, quelqu’un d’autre se charge de le régler après coup, sans que les chercheurs aient à modifier leur flux de travail entre-temps », a-t-il expliqué.

Le problème de cette « surveillance corrective a posteriori » est qu’elle oblige les chercheurs à se démener pour résoudre les problèmes. Et pour certains types d’incidents, il pourrait être trop tard. Par exemple, une IA pourrait désactiver le système de contrôle d’une entreprise, ce qui signifie que les chercheurs ne peuvent plus compter sur la détection ultérieure du dysfonctionnement.

De nombreux acteurs du secteur de l’IA se plaignent qu’il est fondamentalement difficile d’élaborer des plans précis pour gérer les dysfonctionnements, car l’IA évolue trop rapidement ; les plans d’aujourd’hui seront inutiles demain.

Adler évoque le vieil adage selon lequel les plans ne valent rien, mais la planification est indispensable.

« Nous serions bien mieux lotis si les entreprises y avaient réfléchi à l’avance, et j’espère qu’elles le font, même si elles n’en ont pas parlé publiquement. »

xAI n’a pas répondu à temps pour commenter.

Article connexe
Sam Altman suscite un débat sur le ralentissement de l'IA Sam Altman suscite un débat sur le ralentissement de l'IA Écouter surApple PodcastsÉcouter surSpotifyLe PDG d'OpenAI, Sam Altman, a récemment suggéré qu'il était peut-être temps de « rythmer le rythme du développement de l'IA » afin de permettre à la société de « se renforcer autour de certains de ces nouv
OpenAI combat l’action en justice pour violation des secrets commerciaux intentée par Apple OpenAI combat l’action en justice pour violation des secrets commerciaux intentée par Apple OpenAI a réfuté les allégations de violation de secrets commerciaux d’Apple ce mardi, affirmant que le procès est infondé.« Nous prenons ces allégations au sérieux mais ne voyons aucune preuve à leur appui », a déclaré OpenAI, selon Ed Ludlow de Blo
Anthropic entre sur le marché de la technologie juridique en intelligence artificielle alors que la concurrence s'intensifie Anthropic entre sur le marché de la technologie juridique en intelligence artificielle alors que la concurrence s'intensifie Anthropic a dévoilé une série de nouvelles fonctionnalités de chatbot mardi, visant à fournir un support automatisé aux cabinets d’avocats. Ces améliorations étendent Claude for Legal, la plateforme spécifique aux cabinets lancée plus tôt cette année
Recommandations de sujets spéciaux liés
Conception et art Outils de référence stylistique basés sur l'IA pour les fiches de personnages, les moodboards et les présentations commerciales
Outils de référence stylistique basés sur l'IA pour les fiches de personnages, les moodboards et les présentations commerciales

Les meilleurs outils de référence en matière de style visuel généré par IA pour 2026, destinés aux fiches de personnages, aux moodboards et aux présentations, sont désormais disponibles sur XIX.AI ! Cette sélection triée sur le volet regroupe des outils puissants et révolutionnaires qui ont été soumis à des tests rigoureux en conditions réelles. Vous y trouverez une comparaison entre les versions gratuites et payantes, des classements détaillés et des options incontournables pour vous aider à stimuler votre créativité et à optimiser votre flux de travail. Explorez-la dès maintenant pour découvrir l'outil idéal qui vous permettra de booster votre productivité !

11 outils
xix.ai
Référencement Les meilleurs outils d'analyse des SERP basés sur l'IA pour la stratégie de référencement
Les meilleurs outils d'analyse des SERP basés sur l'IA pour la stratégie de référencement

Les meilleurs outils d’analyse SERP basés sur l’IA de 2026, les mieux notés pour la stratégie de référencement, sont sélectionnés par XIX.AI à l’issue de tests rigoureux en conditions réelles et de classements mis à jour chaque semaine. Ces outils puissants vous aident à révéler des opportunités d’optimisation cachées, à améliorer les performances de votre contenu et à acquérir un avantage concurrentiel dans les résultats de recherche. Découvrez dès aujourd’hui l’outil idéal pour optimiser votre stratégie de référencement. Explorez-les dès maintenant !

13 outils
xix.ai
Analyse des données Meilleurs outils d’IA pour la détection d’anomalies dans le suivi des KPI pour les équipes SaaS et Ecommerce
Meilleurs outils d’IA pour la détection d’anomalies dans le suivi des KPI pour les équipes SaaS et Ecommerce

2026 Derniers Meilleurs Outils de Détection d’Anomalies par IA les mieux notés pour la surveillance des KPI dans les équipes SaaS et E-commerce ! XIX.AI a sélectionné une collection puissante et révolutionnaire, basée sur des tests rigoureux en conditions réelles et des classements mis à jour chaque semaine. Vous y trouverez des comparaisons détaillées entre les versions gratuites et payantes, afin de vous aider à identifier la solution incontournable qui améliore la productivité et débloque votre avantage concurrentiel grâce à l’IA. Explorez dès maintenant !

10 outils
xix.ai
en écrivant Les meilleurs générateurs de plans basés sur l'IA pour les articles SEO longs
Les meilleurs générateurs de plans basés sur l'IA pour les articles SEO longs

2026 : les meilleurs générateurs de plans basés sur l'IA pour les articles SEO longs, soigneusement sélectionnés par XIX.AI. Ces outils puissants offrent une aide révolutionnaire pour créer rapidement du contenu de haute qualité, améliorant ainsi considérablement l'efficacité de la rédaction. Découvrez une comparaison entre les versions gratuites et payantes, ainsi que des tests concrets et des classements détaillés pour vous aider à trouver l'option incontournable qui répond à vos besoins. Explorez dès maintenant pour tirer pleinement parti de l'IA.

8 outils
xix.ai
Éducation et apprentissage Outils d'étude basés sur l'IA pour les devoirs et la préparation aux examens
Outils d'étude basés sur l'IA pour les devoirs et la préparation aux examens

Les meilleurs outils d'IA de 2026 pour les devoirs et la préparation aux examens ! XIX.AI vous propose une sélection des outils les mieux notés, puissants et révolutionnaires, qui aident les élèves à booster leur productivité, à optimiser la réalisation de leurs devoirs et à réussir haut la main leurs examens grâce à des tests concrets. Découvrez un comparatif entre les versions gratuites et payantes, des classements détaillés et des options incontournables pour tirer pleinement parti de l'IA. Découvrez-les dès maintenant !

10 outils
xix.ai
Composition musicale Outils de démo vocale par IA pour les auteurs-compositeurs, les accroches, les mélodies principales et les sessions de brouillons multilingues
Outils de démo vocale par IA pour les auteurs-compositeurs, les accroches, les mélodies principales et les sessions de brouillons multilingues

2026 Derniers Meilleurs Outils de Démonstration Vocale par IA pour les Paroliers, Créateurs d’Accroches et Équipes de Contenu Multilingues ! XIX.AI a sélectionné une liste primée d’outils puissants et révolutionnaires, soumis à des tests rigoureux en conditions réelles. Vous y trouverez des données détaillées comparant les versions gratuites et payantes, des classements complets et des options incontournables à essayer pour améliorer votre efficacité d’écriture et libérer votre potentiel créatif. Explorez dès maintenant pour découvrir l’outil parfait répondant à tous vos besoins en contenu !

9 outils
xix.ai
commentaires (0)
0/500
OR