option
Maison
Nouvelles
Le cofondateur de l'OpenAI préconise des tests de sécurité de l'IA à l'échelle de l'industrie

Le cofondateur de l'OpenAI préconise des tests de sécurité de l'IA à l'échelle de l'industrie

24 décembre 2025
138

Le cofondateur de l

Deux des plus grands laboratoires d'IA au monde, OpenAI et Anthropic, ont temporairement autorisé l'accès à leurs modèles d'IA étroitement protégés pour des tests de sécurité collaboratifs - un rare exemple de coopération interentreprises dans un contexte de concurrence industrielle intense. Cette initiative a été conçue pour mettre en évidence les lacunes des évaluations internes de chaque entreprise et illustrer la manière dont les principales entreprises d'IA peuvent conjointement faire progresser les efforts de sécurité et d'alignement à l'avenir.

Dans une interview accordée à TechCrunch, Wojciech Zaremba, cofondateur d'OpenAI, a expliqué qu'une telle collaboration devient de plus en plus vitale à mesure que l'IA entre dans une phase plus "conséquente", avec des millions d'utilisateurs qui interagissent avec les modèles d'IA chaque jour.

"Un défi plus large auquel l'industrie est confrontée est de savoir comment établir des normes de sécurité et de collaboration, alors même que des milliards de dollars sont investis et qu'une bataille féroce pour les talents, les utilisateurs et les produits les plus remarquables se déroule", a fait remarquer M. Zaremba.

L'étude conjointe sur la sécurité, publiée mercredi par les deux entreprises, intervient alors que les leaders de l'IA comme OpenAI et Anthropic s'engagent dans une course à l'armement technologique. Avec des investissements de plusieurs milliards de dollars dans les centres de données et des rémunérations dépassant les 100 millions de dollars pour les meilleurs chercheurs, certains analystes mettent en garde contre la pression exercée pour fournir des produits de pointe, qui pourrait conduire à des compromis dans les protocoles de sécurité.

Pour permettre cette recherche, OpenAI et Anthropic ont échangé un accès spécial à des versions moins restreintes de leurs modèles (OpenAI a précisé que le GPT-5 n'avait pas été testé, car il n'avait pas encore été lancé). Cependant, peu après la fin de la recherche, Anthropic a révoqué l'accès à l'API d'une autre équipe d'OpenAI. Anthropic a affirmé qu'OpenAI avait enfreint ses conditions de service, qui interdisent l'utilisation de Claude pour améliorer des produits concurrents.

M. Zaremba maintient que ces deux événements n'ont rien à voir et s'attend à ce que la concurrence reste forte, même si les équipes chargées de la sécurité de l'IA cherchent à coopérer. Nicholas Carlini, chercheur en sécurité chez Anthropic, a déclaré à TechCrunch qu'il espérait continuer à accorder à l'équipe de sécurité d'OpenAI l'accès aux modèles de Claude à l'avenir.

"Nous visons à étendre la collaboration partout où cela est possible à travers les frontières de la sécurité, en rendant ces partenariats plus courants", a déclaré Carlini.

Les poids lourds de la technologie et du capital-risque rejoignent l'agenda de Disrupt 2025

Netflix, ElevenLabs, Wayve, Sequoia Capital, Elad Gil - ce ne sont là que quelques-uns des grands noms qui se joindront au programme de Disrupt 2025. Ils sont là pour partager des idées qui stimulent la croissance des startups et renforcent votre avantage concurrentiel. Ne manquez pas le 20e anniversaire de TechCrunch Disrupt, l'occasion d'apprendre des plus grands noms de la technologie - réservez votre billet dès maintenant et économisez plus de 600 $ avant que les prix n'augmentent.

Les grands noms de la technologie et du capital-risque se joignent à l'agenda de Disrupt 2025

Netflix, ElevenLabs, Wayve, Sequoia Capital - ce ne sont là que quelques-uns des leaders influents qui figureront à l'ordre du jour de Disrupt 2025. Ils apporteront des points de vue précieux qui aideront les startups à se développer et à affiner leurs stratégies. Rejoignez-nous pour le 20e anniversaire de TechCrunch Disrupt - réservez votre billet dès aujourd'hui et économisez jusqu'à 675 $ avant que les tarifs n'augmentent.

San Francisco | 27-29 octobre 2025 INSCRIVEZ-VOUS DÈS MAINTENANT

L'un des résultats les plus remarquables de l'étude concerne les tests d'hallucination. Les modèles Claude Opus 4 et Sonnet 4 d'Anthropic ont refusé de répondre à 70 % des questions lorsqu'ils étaient incertains, optant pour des réponses telles que "Je ne dispose pas d'informations fiables". En revanche, les modèles o3 et o4-mini d'OpenAI ont refusé beaucoup moins de questions, mais ont affiché des taux d'hallucination beaucoup plus élevés, tentant de répondre même avec des informations insuffisantes.

M. Zaremba estime que l'approche idéale se situe quelque part entre les deux : Les modèles d'OpenAI devraient refuser davantage de requêtes incertaines, tandis que les systèmes d'Anthropic pourraient viser à répondre plus fréquemment.

La flagornerie, c'est-à-dire la tendance des modèles d'IA à renforcer les comportements nuisibles des utilisateurs pour obtenir leur approbation, est apparue comme un problème de sécurité critique.

Dans son rapport de recherche, Anthropic a cité des exemples de flagornerie "extrême" dans GPT-4.1 et Claude Opus 4, où les modèles ont d'abord résisté à des comportements psychotiques ou maniaques avant de soutenir des décisions inquiétantes. Dans d'autres modèles d'OpenAI et d'Anthropic, les chercheurs ont enregistré des niveaux de flagornerie plus faibles.

Mardi, les parents d'Adam Raine, 16 ans, ont intenté une action en justice contre OpenAI, alléguant qu'une version de ChatGPT alimentée par GPT-4o a encouragé le suicide de leur fils au lieu de remettre en question ses pensées néfastes. L'action en justice soulève la possibilité qu'il s'agisse d'un autre cas tragique de flagornerie de la part de l'IA.

"Il est déchirant d'imaginer ce que la famille endure", a déclaré M. Zaremba lorsqu'il a été interrogé sur l'incident. "Il serait profondément troublant de créer une IA capable de résoudre des problèmes de niveau doctoral et de faire progresser la science, tout en contribuant à des crises de santé mentale. C'est un résultat dystopique dont je ne veux pas faire partie.

Dans un billet de blog, OpenAI a indiqué avoir apporté des améliorations majeures pour réduire la flagornerie avec GPT-5 par rapport à GPT-4o, affirmant que le nouveau modèle réagit de manière plus appropriée dans les crises de santé mentale.

Pour l'avenir, Zaremba et Carlini souhaitent qu'Anthropic et OpenAI approfondissent leur collaboration en matière de tests de sécurité - en explorant davantage de sujets et en évaluant les modèles à venir - et espèrent que d'autres laboratoires d'IA adopteront une approche coopérative similaire.

Mise à jour 14h00 PT : Cet article a été révisé pour inclure des recherches supplémentaires d'Anthropic qui n'étaient pas disponibles pour TechCrunch avant la publication initiale.


Vous avez des informations sensibles ou des documents confidentiels ? Nous enquêtons sur les rouages de l'industrie de l'IA, depuis les organisations qui façonnent son évolution jusqu'aux individus affectés par leurs choix. Contactez Rebecca Bellan à l'adresse [email protected] et Maxwell Zeff à l'adresse [email protected]. Pour une communication sécurisée, contactez-nous via Signal à @rebeccabellan.491 et @mzeff.88.

Article connexe
Sam Altman suscite un débat sur le ralentissement de l'IA Sam Altman suscite un débat sur le ralentissement de l'IA Écouter surApple PodcastsÉcouter surSpotifyLe PDG d'OpenAI, Sam Altman, a récemment suggéré qu'il était peut-être temps de « rythmer le rythme du développement de l'IA » afin de permettre à la société de « se renforcer autour de certains de ces nouv
OpenAI combat l’action en justice pour violation des secrets commerciaux intentée par Apple OpenAI combat l’action en justice pour violation des secrets commerciaux intentée par Apple OpenAI a réfuté les allégations de violation de secrets commerciaux d’Apple ce mardi, affirmant que le procès est infondé.« Nous prenons ces allégations au sérieux mais ne voyons aucune preuve à leur appui », a déclaré OpenAI, selon Ed Ludlow de Blo
Anthropic entre sur le marché de la technologie juridique en intelligence artificielle alors que la concurrence s'intensifie Anthropic entre sur le marché de la technologie juridique en intelligence artificielle alors que la concurrence s'intensifie Anthropic a dévoilé une série de nouvelles fonctionnalités de chatbot mardi, visant à fournir un support automatisé aux cabinets d’avocats. Ces améliorations étendent Claude for Legal, la plateforme spécifique aux cabinets lancée plus tôt cette année
Recommandations de sujets spéciaux liés
en écrivant Les meilleurs générateurs de plans basés sur l'IA pour les articles SEO longs
Les meilleurs générateurs de plans basés sur l'IA pour les articles SEO longs

2026 : les meilleurs générateurs de plans basés sur l'IA pour les articles SEO longs, soigneusement sélectionnés par XIX.AI. Ces outils puissants offrent une aide révolutionnaire pour créer rapidement du contenu de haute qualité, améliorant ainsi considérablement l'efficacité de la rédaction. Découvrez une comparaison entre les versions gratuites et payantes, ainsi que des tests concrets et des classements détaillés pour vous aider à trouver l'option incontournable qui répond à vos besoins. Explorez dès maintenant pour tirer pleinement parti de l'IA.

8 outils
xix.ai
Éducation et apprentissage Outils d'étude basés sur l'IA pour les devoirs et la préparation aux examens
Outils d'étude basés sur l'IA pour les devoirs et la préparation aux examens

Les meilleurs outils d'IA de 2026 pour les devoirs et la préparation aux examens ! XIX.AI vous propose une sélection des outils les mieux notés, puissants et révolutionnaires, qui aident les élèves à booster leur productivité, à optimiser la réalisation de leurs devoirs et à réussir haut la main leurs examens grâce à des tests concrets. Découvrez un comparatif entre les versions gratuites et payantes, des classements détaillés et des options incontournables pour tirer pleinement parti de l'IA. Découvrez-les dès maintenant !

10 outils
xix.ai
Composition musicale Outils de démo vocale par IA pour les auteurs-compositeurs, les accroches, les mélodies principales et les sessions de brouillons multilingues
Outils de démo vocale par IA pour les auteurs-compositeurs, les accroches, les mélodies principales et les sessions de brouillons multilingues

2026 Derniers Meilleurs Outils de Démonstration Vocale par IA pour les Paroliers, Créateurs d’Accroches et Équipes de Contenu Multilingues ! XIX.AI a sélectionné une liste primée d’outils puissants et révolutionnaires, soumis à des tests rigoureux en conditions réelles. Vous y trouverez des données détaillées comparant les versions gratuites et payantes, des classements complets et des options incontournables à essayer pour améliorer votre efficacité d’écriture et libérer votre potentiel créatif. Explorez dès maintenant pour découvrir l’outil parfait répondant à tous vos besoins en contenu !

9 outils
xix.ai
Entreprise Les meilleurs outils de veille concurrentielle basés sur l'IA pour les petites entreprises
Les meilleurs outils de veille concurrentielle basés sur l'IA pour les petites entreprises

Les meilleurs outils de recherche concurrentielle basés sur l’IA les plus récents et les mieux notés pour les petites entreprises en 2026 ! XIX.AI a sélectionné une collection extrêmement puissante et révolutionnaire, mise à jour chaque semaine à l’issue de tests rigoureux en conditions réelles et accompagnée de classements détaillés. Vous y trouverez un comparatif complet entre les versions gratuites et payantes pour vous aider à identifier les outils incontournables qui boosteront votre productivité et vous donneront un avantage concurrentiel. Découvrez-la dès maintenant pour trouver l'outil qui vous convient le mieux !

9 outils
xix.ai
Édition d'images Outils de retouche par IA Photoshop pour les vêtements d’e-commerce, nettoyage de la peau et cohérence des couleurs
Outils de retouche par IA Photoshop pour les vêtements d’e-commerce, nettoyage de la peau et cohérence des couleurs

2026 Derniers meilleurs outils de retouche par IA Photoshop pour les vêtements e-commerce, le nettoyage de la peau et la cohérence des couleurs ! Cette liste soigneusement sélectionnée et hautement notée propose des solutions puissantes qui changent la donne, vous aidant à améliorer l’efficacité rédactionnelle, rationaliser la création de contenu et obtenir des résultats visuels parfaits sans effort. Chaque outil a été testé dans des conditions réelles grâce à des classements mis à jour chaque semaine, accompagnés de détails comparatifs entre versions gratuites et payantes. Soutenu par XIX.AI, c’est le guide incontournable pour quiconque souhaite exploiter son avantage grâce à l’IA. Explorez dès maintenant !

10 outils
xix.ai
Rapide Les meilleures bibliothèques de prompts d'IA pour les workflows ChatGPT
Les meilleures bibliothèques de prompts d'IA pour les workflows ChatGPT

2026 : les meilleures bibliothèques de prompts IA les mieux notées pour optimiser tous les types de flux de travail ChatGPT. XIX.AI a sélectionné une collection puissante et révolutionnaire, soumise à des tests rigoureux en conditions réelles afin de garantir des performances optimales. Vous trouverez des comparaisons détaillées entre les solutions gratuites et payantes, ainsi que des classements d'experts pour vous aider à choisir les outils incontournables qui boosteront votre productivité et vous permettront de tirer pleinement parti de l'IA. Découvrez-les dès maintenant !

11 outils
xix.ai
commentaires (3)
0/500
WillWalker
WillWalker 21 juillet 2026 18:00:18 UTC+02:00

Interesting to see competitors collaborate on safety. But is it just a PR stunt? 🤔

IsabellaLevis
IsabellaLevis 4 mars 2026 03:00:50 UTC+01:00

AIの安全性テストを業界全体で実施する必要があるって主張、すごく共感します。競争が激しい中でOpenAIとAnthropicが協力したのは意外だけど、こういう連携がもっと増えると良いですね。ただ、本当に効果的なテストができるのか少し不安… 🤔

GeorgeWilliams
GeorgeWilliams 20 février 2026 01:01:46 UTC+01:00

So OpenAI and Anthropic are actually sharing their secret sauce for safety checks? That's pretty refreshing to see amidst all the cutthroat AI race. Hope this kind of collaboration becomes the norm, not just a rare exception. The real question is, will this testing be transparent enough for the public to trust the results? 🤔

OR