option
Maison
Nouvelles
La nouvelle technique permet à Deepseek et à d'autres modèles de répondre aux requêtes sensibles

La nouvelle technique permet à Deepseek et à d'autres modèles de répondre aux requêtes sensibles

11 mai 2025
178

La nouvelle technique permet à Deepseek et à d'autres modèles de répondre aux requêtes sensibles

Éliminer les biais et la censure des grands modèles de langage (LLM) comme DeepSeek de la Chine est un défi complexe qui a attiré l'attention des décideurs politiques et des chefs d'entreprise américains, qui y voient une menace potentielle pour la sécurité nationale. Un récent rapport d'un comité restreint du Congrès américain a qualifié DeepSeek de « menace profonde pour la sécurité de notre nation » et a proposé des recommandations politiques pour traiter la question.

Bien que des techniques comme l'apprentissage par renforcement à partir des retours humains (RLHF) et l'ajustement fin puissent aider à atténuer les biais, la startup de gestion des risques d'entreprise CTGT affirme avoir développé une approche novatrice. Selon CTGT, leur méthode peut complètement éliminer la censure dans les LLM. Cyril Gorlla et Trevor Tuttle de CTGT ont détaillé leur cadre dans un article, expliquant qu'il « localise et modifie directement les caractéristiques internes responsables de la censure ».

Leur approche est non seulement efficace mais permet également un contrôle précis du comportement du modèle, garantissant que des réponses non censurées sont fournies sans affecter les capacités globales ou l'exactitude factuelle du modèle. Bien que conçue initialement pour DeepSeek-R1-Distill-Llama-70B, la méthode peut être appliquée à d'autres modèles également. Gorlla a confirmé à VentureBeat que la technologie de CTGT fonctionne au niveau du réseau neuronal de base, la rendant applicable à tous les modèles d'apprentissage profond. Ils collaborent avec un laboratoire de modèles de fondation de premier plan pour s'assurer que les nouveaux modèles sont intrinsèquement fiables et sûrs.

Comment cela fonctionne

Les chercheurs de CTGT identifient les caractéristiques au sein du modèle qui sont probablement associées à des comportements indésirables. Ils ont expliqué que « dans un grand modèle de langage, il existe des variables latentes (neurones ou directions dans l'état caché) qui correspondent à des concepts comme 'déclencheur de censure' ou 'sentiment toxique'. Si nous pouvons trouver ces variables, nous pouvons les manipuler directement ».

La méthode de CTGT implique trois étapes clés :

  1. Identification des caractéristiques
  2. Isolation et caractérisation des caractéristiques
  3. Modification dynamique des caractéristiques

Pour identifier ces caractéristiques, les chercheurs utilisent des invites conçues pour déclencher des « sentiments toxiques », comme des questions sur la place Tiananmen ou des conseils pour contourner les pare-feu. Ils analysent les réponses pour établir des motifs et localiser les vecteurs où le modèle décide de censurer l'information. Une fois identifiées, ils isolent la caractéristique et comprennent quelle partie du comportement indésirable elle contrôle, qu'il s'agisse de répondre avec prudence ou de refuser de répondre. Ils intègrent ensuite un mécanisme dans le pipeline d'inférence du modèle pour ajuster le niveau d'activation du comportement de la caractéristique.

Rendre le modèle plus réceptif aux invites

Les expériences de CTGT, utilisant 100 requêtes sensibles, ont montré que le modèle de base DeepSeek-R1-Distill-Llama-70B répondait à seulement 32 % des invites controversées. Cependant, la version modifiée a répondu à 96 % des invites, les 4 % restants étant des contenus extrêmement explicites. L'entreprise a souligné que leur méthode permet aux utilisateurs d'ajuster les biais et les fonctions de sécurité du modèle sans le transformer en un « générateur imprudent », surtout lorsque seule la censure inutile est supprimée.

Importamment, cette méthode ne compromet pas l'exactitude ou les performances du modèle. Contrairement à l'ajustement fin traditionnel, elle n'implique pas l'optimisation des poids du modèle ou la fourniture de nouvelles réponses d'exemple. Cela offre deux avantages majeurs : un effet immédiat sur la génération du prochain jeton et la capacité de basculer entre différents comportements en activant ou désactivant l'ajustement des caractéristiques, ou même en l'ajustant à différents degrés pour différents contextes.

Sécurité et sûreté du modèle

Le rapport du Congrès sur DeepSeek a exhorté les États-Unis à « prendre des mesures rapides pour étendre les contrôles des exportations, améliorer l'application des contrôles des exportations et traiter les risques des modèles d'intelligence artificielle chinois ». Alors que les préoccupations concernant la menace potentielle de DeepSeek pour la sécurité nationale augmentaient, les chercheurs et les entreprises d'IA ont commencé à explorer des moyens de rendre ces modèles plus sûrs.

Déterminer ce qui est « sûr », biaisé ou censuré peut être difficile, mais des méthodes permettant aux utilisateurs d'ajuster les contrôles du modèle en fonction de leurs besoins pourraient être très bénéfiques. Gorlla a souligné que les entreprises « doivent pouvoir faire confiance à leurs modèles pour qu'ils soient alignés sur leurs politiques », soulignant l'importance de méthodes comme celle de CTGT pour les entreprises.

« CTGT permet aux entreprises de déployer une IA qui s'adapte à leurs cas d'utilisation sans avoir à dépenser des millions de dollars pour ajuster finement les modèles pour chaque cas d'utilisation. Cela est particulièrement important dans les applications à haut risque comme la sécurité, la finance et la santé, où les dommages potentiels découlant d'un dysfonctionnement de l'IA sont graves », a déclaré Gorlla.

Article connexe
Base44 dévoile son modèle d’IA propriétaire pour renforcer la défensabilité de sa plateforme de codage par ambiance Base44 dévoile son modèle d’IA propriétaire pour renforcer la défensabilité de sa plateforme de codage par ambiance Base44, la plateforme de codage par « vibe » acquise par Wix pour 80 millions de dollars il y a seulement un an — alors qu’elle n’avait que six mois et une équipe de huit personnes — a commencé à déployer son modèle d’IA propriétaire afin d’aider les
DeepSeek dévoile un modèle d'IA rivalisant avec les systèmes de pointe DeepSeek dévoile un modèle d'IA rivalisant avec les systèmes de pointe Le laboratoire chinois d'IA DeepSeek a publié deux versions préliminaires de son tout dernier grand modèle linguistique, DeepSeek V4, une mise à jour très attendue du modèle V3.2 de l'année dernière e
Multiverse Computing lance un modèle d'IA générative compressé gratuit Multiverse Computing lance un modèle d'IA générative compressé gratuit Les grands modèles linguistiques sont confrontés à un défi de taille : leur taille immense. La start-up espagnole Multiverse Computing s'attaque à ce problème en créant des modèles compressés con
Recommandations de sujets spéciaux liés
Éducation et apprentissage Outils d'étude basés sur l'IA pour les devoirs et la préparation aux examens
Outils d'étude basés sur l'IA pour les devoirs et la préparation aux examens

Les meilleurs outils d'IA de 2026 pour les devoirs et la préparation aux examens ! XIX.AI vous propose une sélection des outils les mieux notés, puissants et révolutionnaires, qui aident les élèves à booster leur productivité, à optimiser la réalisation de leurs devoirs et à réussir haut la main leurs examens grâce à des tests concrets. Découvrez un comparatif entre les versions gratuites et payantes, des classements détaillés et des options incontournables pour tirer pleinement parti de l'IA. Découvrez-les dès maintenant !

10 outils
xix.ai
Composition musicale Outils de démo vocale par IA pour les auteurs-compositeurs, les accroches, les mélodies principales et les sessions de brouillons multilingues
Outils de démo vocale par IA pour les auteurs-compositeurs, les accroches, les mélodies principales et les sessions de brouillons multilingues

2026 Derniers Meilleurs Outils de Démonstration Vocale par IA pour les Paroliers, Créateurs d’Accroches et Équipes de Contenu Multilingues ! XIX.AI a sélectionné une liste primée d’outils puissants et révolutionnaires, soumis à des tests rigoureux en conditions réelles. Vous y trouverez des données détaillées comparant les versions gratuites et payantes, des classements complets et des options incontournables à essayer pour améliorer votre efficacité d’écriture et libérer votre potentiel créatif. Explorez dès maintenant pour découvrir l’outil parfait répondant à tous vos besoins en contenu !

9 outils
xix.ai
Entreprise Les meilleurs outils de veille concurrentielle basés sur l'IA pour les petites entreprises
Les meilleurs outils de veille concurrentielle basés sur l'IA pour les petites entreprises

Les meilleurs outils de recherche concurrentielle basés sur l’IA les plus récents et les mieux notés pour les petites entreprises en 2026 ! XIX.AI a sélectionné une collection extrêmement puissante et révolutionnaire, mise à jour chaque semaine à l’issue de tests rigoureux en conditions réelles et accompagnée de classements détaillés. Vous y trouverez un comparatif complet entre les versions gratuites et payantes pour vous aider à identifier les outils incontournables qui boosteront votre productivité et vous donneront un avantage concurrentiel. Découvrez-la dès maintenant pour trouver l'outil qui vous convient le mieux !

9 outils
xix.ai
Édition d'images Outils de retouche par IA Photoshop pour les vêtements d’e-commerce, nettoyage de la peau et cohérence des couleurs
Outils de retouche par IA Photoshop pour les vêtements d’e-commerce, nettoyage de la peau et cohérence des couleurs

2026 Derniers meilleurs outils de retouche par IA Photoshop pour les vêtements e-commerce, le nettoyage de la peau et la cohérence des couleurs ! Cette liste soigneusement sélectionnée et hautement notée propose des solutions puissantes qui changent la donne, vous aidant à améliorer l’efficacité rédactionnelle, rationaliser la création de contenu et obtenir des résultats visuels parfaits sans effort. Chaque outil a été testé dans des conditions réelles grâce à des classements mis à jour chaque semaine, accompagnés de détails comparatifs entre versions gratuites et payantes. Soutenu par XIX.AI, c’est le guide incontournable pour quiconque souhaite exploiter son avantage grâce à l’IA. Explorez dès maintenant !

10 outils
xix.ai
Rapide Les meilleures bibliothèques de prompts d'IA pour les workflows ChatGPT
Les meilleures bibliothèques de prompts d'IA pour les workflows ChatGPT

2026 : les meilleures bibliothèques de prompts IA les mieux notées pour optimiser tous les types de flux de travail ChatGPT. XIX.AI a sélectionné une collection puissante et révolutionnaire, soumise à des tests rigoureux en conditions réelles afin de garantir des performances optimales. Vous trouverez des comparaisons détaillées entre les solutions gratuites et payantes, ainsi que des classements d'experts pour vous aider à choisir les outils incontournables qui boosteront votre productivité et vous permettront de tirer pleinement parti de l'IA. Découvrez-les dès maintenant !

11 outils
xix.ai
Éducation et apprentissage Plateformes de création de quiz IA pour les enseignants, les tuteurs et les programmes d’apprentissage en cohorte
Plateformes de création de quiz IA pour les enseignants, les tuteurs et les programmes d’apprentissage en cohorte

2026 Dernières Meilleures Plateformes de Création de Quiz par IA pour les Enseignants, Tuteurs et Programmes d’Apprentissage en Cohorte ! XIX.AI a sélectionné une liste hautement notée d’outils puissants et transformateurs, testés dans des situations réelles pour garantir des classements précis. Ces plateformes incontournables permettent d’améliorer l’efficacité rédactionnelle, de simplifier la création de contenu et de faciliter la conception de quiz dans tous les contextes d’apprentissage. Explorez dès maintenant pour découvrir l’outil idéal qui vous permettra de tirer parti de l’avantage offert par l’IA dans votre enseignement !

13 outils
xix.ai
commentaires (4)
0/500
CarlGarcia
CarlGarcia 23 mars 2026 01:01:13 UTC+01:00

É impressionante a rapidez com que questões de 'segurança nacional' aparecem quando se fala de inovações vindas de outros países. Este relatório sobre o DeepSeek soa mais como justificativa para manter uma vantagem tecnológica do que uma genuína preocupação ética. Já parou para pensar se a 'neutralidade' que buscam não é apenas uma forma de censura disfarçada? 🤔 A corrida pela IA está mesmo acirrada.

GaryGonzalez
GaryGonzalez 25 décembre 2025 15:30:40 UTC+01:00

この記事を読んで、AIのバイアス除去って本当に可能なのかな?技術的には興味深いけど、各国の規制や価値観の違いを考えると、完全に中立なAIを作るのは無理なんじゃないかって思う。DeepSeekが米国で国家安全保障上の脅威と見なされているって…地政学的な要素が技術開発にこんなに影響するなんて。🤔

CharlesThomas
CharlesThomas 4 décembre 2025 21:30:40 UTC+01:00

この手法、完全にセンシティブなクエリに対して何でも返信し始めたら怖くない? 倫理的なライン越えてる気がするけど、政治的な発言の規制が緩和されるのは歓迎かも🤔 でもAIが中立を装いながら偏った情報を流す可能性も…

JustinAnderson
JustinAnderson 21 août 2025 07:01:17 UTC+02:00

¡Vaya! Quitar sesgos a modelos como DeepSeek suena a un puzzle imposible. ¿Realmente pueden hacer que una IA sea neutral? Me preocupa que esto termine siendo una carrera por controlar la narrativa. 😬

OR