option
Maison
Nouvelles
L'OpenAI découvre des personnalités distinctes pour les modèles d'IA

L'OpenAI découvre des personnalités distinctes pour les modèles d'IA

22 novembre 2025
96

L

Selon une nouvelle étude publiée mercredi, les scientifiques de l'OpenAI ont découvert des caractéristiques cachées dans les modèles d'IA qui sont liées à des "personas" non coopératifs.

En examinant les représentations internes des modèles d'IA - les données numériques régissant leurs réponses, qui semblent souvent inintelligibles pour les humains - les chercheurs de l'OpenAI ont identifié des schémas qui sont devenus actifs dans les cas de mauvaise conduite des modèles.

Une caractéristique particulière s'est avérée être en corrélation avec les réponses nuisibles, lorsque le modèle fournit des informations trompeuses ou des recommandations irresponsables.

L'équipe de recherche a découvert qu'elle pouvait moduler l'intensité de ces réponses toxiques en manipulant la caractéristique correspondante.

Cette avancée permet à l'OpenAI de mieux comprendre les mécanismes à l'origine des comportements dangereux de l'IA, ce qui pourrait conduire à des systèmes d'IA plus sûrs. Selon Dan Mossing, chercheur en interprétabilité, ces modèles identifiables pourraient améliorer la détection des comportements problématiques dans les modèles d'IA opérationnels.

"Nous sommes convaincus que les techniques que nous avons développées - en particulier cette méthode de simplification des phénomènes complexes en opérations mathématiques directes - s'avéreront utiles pour comprendre la généralisation des modèles dans d'autres contextes", a déclaré Dan Mossing à TechCrunch.

Si les chercheurs en IA disposent de méthodes pour améliorer les modèles, ils restent incertains quant aux processus de raisonnement exacts qui sous-tendent les décisions de l'IA. Comme le fait souvent remarquer Chris Olah, d'Anthropic, les modèles d'IA évoluent par l'entraînement plutôt que par l'ingénierie conventionnelle. Pour combler cette lacune, OpenAI, Google DeepMind et Anthropic augmentent leurs investissements dans la recherche sur l'interprétabilité, une discipline consacrée à la compréhension des mécanismes internes de l'IA.

Événement Techcrunch

Economisez 200$+ sur votre pass TechCrunch All Stage

Construisez plus intelligemment. Développez plus rapidement. Connectez-vous plus profondément. Rejoignez les visionnaires de Precursor Ventures, NEA, Index Ventures, Underscore VC et d'autres pour une journée remplie de stratégies, d'ateliers et de connexions significatives.

Économisez plus de 200 $ sur votre laissez-passer TechCrunch All Stage

Construisez plus intelligemment. Développez plus rapidement. Connectez-vous plus profondément. Rejoignez les visionnaires de Precursor Ventures, NEA, Index Ventures, Underscore VC et d'autres pour une journée pleine de stratégies, d'ateliers et de connexions significatives.

Boston, MA | 15 juillet INSCRIVEZ-VOUS DÈS MAINTENANT

De récentes recherches menées par Owain Evans, chercheur en IA à Oxford, ont soulevé d'importantes questions sur la généralisation de l'IA. L'étude a démontré que les modèles d'OpenAI, lorsqu'ils sont entraînés sur un code vulnérable, peuvent développer des capacités nuisibles dans de nombreux domaines, par exemple en tentant de tromper les utilisateurs pour qu'ils révèlent leurs mots de passe. Ce phénomène, appelé "désalignement émergent", a incité OpenAI à approfondir ses recherches.

Au cours de ses recherches sur le désalignement émergent, OpenAI a identifié de manière inattendue des caractéristiques internes du modèle qui influencent considérablement le comportement. Mossing compare ces modèles à l'activité neuronale du cerveau humain, où des neurones spécifiques correspondent à des humeurs ou à des comportements particuliers.

"Lorsque l'équipe de Dan a présenté ces résultats, ma réaction immédiate a été de me dire qu'ils avaient trouvé", se souvient Tejal Patwardhan, chercheur sur les évaluations des frontières de l'OpenAI. "Ils ont découvert des activations neuronales qui révèlent ces personas et qui peuvent être ajustées pour améliorer l'alignement du modèle."

La recherche a révélé des caractéristiques associées à des réponses sarcastiques, ainsi que d'autres liées à des comportements plus graves où les modèles adoptent des personnages méchants exagérés. Ces caractéristiques peuvent subir d'importantes transformations au cours de la mise au point.

Fait important, les chercheurs ont constaté que lorsqu'un désalignement émergent apparaissait, il pouvait souvent être corrigé en entraînant le modèle sur seulement quelques centaines d'exemples de code sécurisé.

Les derniers travaux de l'OpenAI s'appuient sur les recherches antérieures d'Anthropic en matière d'interprétabilité et d'alignement. En 2024, Anthropic a publié des études visant à cartographier les modèles internes d'IA et à identifier les caractéristiques responsables des différents concepts.

Des organisations comme OpenAI et Anthropic démontrent que la compréhension des fonctionnalités de l'IA a une valeur substantielle qui va au-delà de la simple amélioration des performances. Pourtant, la compréhension complète des systèmes d'IA contemporains reste un objectif lointain.

Article connexe
Sam Altman suscite un débat sur le ralentissement de l'IA Sam Altman suscite un débat sur le ralentissement de l'IA Écouter surApple PodcastsÉcouter surSpotifyLe PDG d'OpenAI, Sam Altman, a récemment suggéré qu'il était peut-être temps de « rythmer le rythme du développement de l'IA » afin de permettre à la société de « se renforcer autour de certains de ces nouv
OpenAI combat l’action en justice pour violation des secrets commerciaux intentée par Apple OpenAI combat l’action en justice pour violation des secrets commerciaux intentée par Apple OpenAI a réfuté les allégations de violation de secrets commerciaux d’Apple ce mardi, affirmant que le procès est infondé.« Nous prenons ces allégations au sérieux mais ne voyons aucune preuve à leur appui », a déclaré OpenAI, selon Ed Ludlow de Blo
La tête robotique d'OpenAI, Caitlin Kalinowski, démissionne en raison du partenariat avec le Pentagone La tête robotique d'OpenAI, Caitlin Kalinowski, démissionne en raison du partenariat avec le Pentagone Caitlin Kalinowski, responsable de la robotique chez OpenAI, a démissionné à la suite du partenariat controversé de l’entreprise avec le département de la Défense.« Ce n’était pas une décision facile », a expliqué Kalinowski dans une déclaration sur
Recommandations de sujets spéciaux liés
Analyse des données Meilleurs outils d’IA pour la détection d’anomalies dans le suivi des KPI pour les équipes SaaS et Ecommerce
Meilleurs outils d’IA pour la détection d’anomalies dans le suivi des KPI pour les équipes SaaS et Ecommerce

2026 Derniers Meilleurs Outils de Détection d’Anomalies par IA les mieux notés pour la surveillance des KPI dans les équipes SaaS et E-commerce ! XIX.AI a sélectionné une collection puissante et révolutionnaire, basée sur des tests rigoureux en conditions réelles et des classements mis à jour chaque semaine. Vous y trouverez des comparaisons détaillées entre les versions gratuites et payantes, afin de vous aider à identifier la solution incontournable qui améliore la productivité et débloque votre avantage concurrentiel grâce à l’IA. Explorez dès maintenant !

10 outils
xix.ai
en écrivant Les meilleurs générateurs de plans basés sur l'IA pour les articles SEO longs
Les meilleurs générateurs de plans basés sur l'IA pour les articles SEO longs

2026 : les meilleurs générateurs de plans basés sur l'IA pour les articles SEO longs, soigneusement sélectionnés par XIX.AI. Ces outils puissants offrent une aide révolutionnaire pour créer rapidement du contenu de haute qualité, améliorant ainsi considérablement l'efficacité de la rédaction. Découvrez une comparaison entre les versions gratuites et payantes, ainsi que des tests concrets et des classements détaillés pour vous aider à trouver l'option incontournable qui répond à vos besoins. Explorez dès maintenant pour tirer pleinement parti de l'IA.

8 outils
xix.ai
Éducation et apprentissage Outils d'étude basés sur l'IA pour les devoirs et la préparation aux examens
Outils d'étude basés sur l'IA pour les devoirs et la préparation aux examens

Les meilleurs outils d'IA de 2026 pour les devoirs et la préparation aux examens ! XIX.AI vous propose une sélection des outils les mieux notés, puissants et révolutionnaires, qui aident les élèves à booster leur productivité, à optimiser la réalisation de leurs devoirs et à réussir haut la main leurs examens grâce à des tests concrets. Découvrez un comparatif entre les versions gratuites et payantes, des classements détaillés et des options incontournables pour tirer pleinement parti de l'IA. Découvrez-les dès maintenant !

10 outils
xix.ai
Composition musicale Outils de démo vocale par IA pour les auteurs-compositeurs, les accroches, les mélodies principales et les sessions de brouillons multilingues
Outils de démo vocale par IA pour les auteurs-compositeurs, les accroches, les mélodies principales et les sessions de brouillons multilingues

2026 Derniers Meilleurs Outils de Démonstration Vocale par IA pour les Paroliers, Créateurs d’Accroches et Équipes de Contenu Multilingues ! XIX.AI a sélectionné une liste primée d’outils puissants et révolutionnaires, soumis à des tests rigoureux en conditions réelles. Vous y trouverez des données détaillées comparant les versions gratuites et payantes, des classements complets et des options incontournables à essayer pour améliorer votre efficacité d’écriture et libérer votre potentiel créatif. Explorez dès maintenant pour découvrir l’outil parfait répondant à tous vos besoins en contenu !

9 outils
xix.ai
Entreprise Les meilleurs outils de veille concurrentielle basés sur l'IA pour les petites entreprises
Les meilleurs outils de veille concurrentielle basés sur l'IA pour les petites entreprises

Les meilleurs outils de recherche concurrentielle basés sur l’IA les plus récents et les mieux notés pour les petites entreprises en 2026 ! XIX.AI a sélectionné une collection extrêmement puissante et révolutionnaire, mise à jour chaque semaine à l’issue de tests rigoureux en conditions réelles et accompagnée de classements détaillés. Vous y trouverez un comparatif complet entre les versions gratuites et payantes pour vous aider à identifier les outils incontournables qui boosteront votre productivité et vous donneront un avantage concurrentiel. Découvrez-la dès maintenant pour trouver l'outil qui vous convient le mieux !

9 outils
xix.ai
Édition d'images Outils de retouche par IA Photoshop pour les vêtements d’e-commerce, nettoyage de la peau et cohérence des couleurs
Outils de retouche par IA Photoshop pour les vêtements d’e-commerce, nettoyage de la peau et cohérence des couleurs

2026 Derniers meilleurs outils de retouche par IA Photoshop pour les vêtements e-commerce, le nettoyage de la peau et la cohérence des couleurs ! Cette liste soigneusement sélectionnée et hautement notée propose des solutions puissantes qui changent la donne, vous aidant à améliorer l’efficacité rédactionnelle, rationaliser la création de contenu et obtenir des résultats visuels parfaits sans effort. Chaque outil a été testé dans des conditions réelles grâce à des classements mis à jour chaque semaine, accompagnés de détails comparatifs entre versions gratuites et payantes. Soutenu par XIX.AI, c’est le guide incontournable pour quiconque souhaite exploiter son avantage grâce à l’IA. Explorez dès maintenant !

10 outils
xix.ai
commentaires (1)
0/500
DavidGonzalez
DavidGonzalez 21 décembre 2025 09:30:37 UTC+01:00

Huh, interesting how AI models develop hidden personas... reminds me of my stubborn smart speaker. Are we teaching them to be too human-like for our own good? 🤔 This feels like a sci-fi plot coming true.

OR