option
Maison
Nouvelles
Les émojis pourraient contourner les filtres de sécurité des chatbots IA

Les émojis pourraient contourner les filtres de sécurité des chatbots IA

27 novembre 2025
175

Les émojis peuvent contourner les mécanismes de sécurité des grands modèles de langage, entraînant des réponses toxiques qui seraient autrement bloquées. Cette méthode permet aux LLM de discuter et de fournir des conseils sur des sujets interdits comme la fabrication de bombes et le meurtre.

 

Une récente collaboration sino-singapourienne présente des preuves solides que les émojis peuvent non seulement contourner les filtres de contenu des grands modèles de langage (LLM) mais aussi amplifier la toxicité lors des interactions :

From the new paper, a broad demonstration of the ways that encoding a banned concept with emojis can help a user to

Extrait du nouvel article, une démonstration large de la manière dont l'encodage de concepts interdits avec des émojis peut aider les utilisateurs à 'jailbreaker' les LLM populaires. Source : https://arxiv.org/pdf/2509.11141

Dans l'exemple ci-dessus, la conversion d'une intention textuelle contraire aux règles en une alternative chargée d'émojis peut provoquer une réponse plus coopérative de la part de modèles avancés comme ChatGPT-4o, qui normalement assainit les entrées et bloque le contenu violant les règles.

Selon les auteurs, les émojis peuvent effectivement servir de technique de jailbreaking dans les cas extrêmes.

Une question persistante est de savoir pourquoi les LLM permettent aux émojis de contourner les règles et de provoquer du contenu toxique, même lorsque les modèles reconnaissent les associations nuisibles de certains émojis.

Les chercheurs proposent que les LLM, entraînés à reproduire des motifs à partir de leurs données, traitent les émojis comme des indices statistiques plutôt que comme du contenu à filtrer. Comme les émojis sont courants dans les données d'entraînement, les modèles apprennent à les associer à des discours spécifiques, renforçant les significations toxiques au lieu de les signaler. Les mesures de sécurité, appliquées a posteriori et souvent de manière étroite, peuvent manquer complètement ces invites chargées d'émojis.

Ainsi, le modèle devient tolérant non pas malgré l'association toxique, mais à cause d'elle.

Laissez-passer gratuit

Les auteurs reconnaissent que ce n'est pas une explication définitive du contournement du filtrage par les émojis. Ils déclarent :

« Les modèles peuvent reconnaître l'intention malveillante exprimée par les émojis, mais la manière dont elle contourne les mécanismes de sécurité reste floue. »

La vulnérabilité pourrait provenir de conceptions de filtres centrées sur le texte, qui s'appuient sur des jetons explicites ou des embeddings comparés à des règles de sécurité. Contrairement aux mots, les émojis existent dans une zone grise - ni purement texte ni image - leur permettant d'échapper à la détection. Des recherches supplémentaires sur cette faille sont nécessaires.

L'article, intitulé When Smiley Turns Hostile: Interpreting How Emojis Trigger LLMs’ Toxicity, implique neuf chercheurs de l'Université Tsinghua et de l'Université nationale de Singapour.

(L'article référence des exemples dans une annexe non encore disponible ; malgré des demandes, elle n'a pas été fournie au moment de la rédaction. Néanmoins, les conclusions principales méritent l'attention.)

Trois interprétations fondamentales des émojis

Les émojis contournent les filtres grâce à trois traits linguistiques. Premièrement, leurs significations sont dépendantes du contexte. Par exemple, l'émoji « Billets d'argent avec des ailes » désigne officiellement des dépenses mais peut impliquer une activité illicite selon le contexte :

In a partial illustration from the new paper, we see that a popular emoji can have its meaning hijacked altered or subverted in popular usage This effectively gives the emoji an official passport into the semantic space, and a hidden payload of negative or toxic meaning that can be exploited once it is past the filters.

Dans une illustration partielle, la signification d'un émoji populaire peut être détournée dans son usage, lui accordant un passeport sémantique avec une charge toxique cachée exploitable après filtrage.

Deuxièmement, les émojis altèrent le ton, ajoutant une touche ludique ou ironique qui adoucit l'impact émotionnel. Dans les requêtes nuisibles, cela peut déguiser l'intention en humour, encourageant la compliance du modèle :

The leavening effect of emojis can detoxify tone without detoxifying intent.

Les émojis peuvent désintoxiquer le ton sans neutraliser l'intention nocive.

Troisièmement, les émojis sont agnostiques linguistiquement, transmettant un sentiment cohérent à travers des langues comme l'anglais, le chinois et le français. Cela les rend idéaux pour les invites multilingues, préservant la signification malgré la traduction :

The broken heart emoji conveys a universal message, perhaps not least because it represents a baseline case in the human condition, relatively immune to national or cultural variations.

L'émoji « cœur brisé » communique universellement, reflétant une expérience humaine fondamentale moins affectée par les différences culturelles.

Approche, Données et Tests*

Les chercheurs ont modifié l'ensemble de données AdvBench, en ajoutant des émojis comme substituts aux termes sensibles ou comme éléments décoratifs. AdvBench comprend 32 sujets à haut risque comme les bombardements et le piratage :

Original examples from AdvBench, illustrating how a single adversarial prompt can bypass safeguards in multiple major chatbots, eliciting harmful instructions despite alignment training. Source: https://arxiv.org/pdf/2307.15043

Les exemples originaux d'AdvBench montrent comment les invites adverses contournent les sauvegardes dans les principaux chatbots, provoquant des réponses nuisibles malgré l'alignement. Source : https://arxiv.org/pdf/2307.15043

Les 520 instances d'AdvBench ont été modifiées avec des émojis, les 50 invites toxiques principales étant utilisées dans toutes les expériences. Les invites ont été traduites en plusieurs langues et testées sur sept modèles open source et propriétaires, combinées à des techniques de jailbreak comme PAIR, TAP et DeepInception.

Les modèles propriétaires incluaient Gemini-2.0-flash, GPT-4o, GPT-4-0613 et Gemini-1.5-pro. Les modèles open source étaient Llama-3-8B-Instruct, Qwen2.5-7B-Instruct et Qwen2.5-72B-Instruct, les tests étant répétés trois fois pour la fiabilité.

L'étude a évalué si les invites réécrites avec des émojis augmentaient la production de contenu toxique, y compris dans les traductions. Elle a également appliqué des modifications par émojis à des stratégies de jailbreak connues pour évaluer l'efficacité accrue.

Les structures des invites ont été préservées, seuls les termes sensibles étant remplacés par des émojis ou des éléments décoratifs ajoutés.

Pour l'évaluation, les auteurs ont introduit GPT-Judge, où GPT-4o notait les réponses des autres modèles sur une échelle de Score de Nocivité (HS) de 1 à 5. Les réponses notées 5 constituaient le Taux de Nocivité (HR).

Pour éviter les explications sur les émojis, les invites incluaient des instructions de concision :

Results from emoji-based prompts in

Résultats des invites basées sur des émojis dans le 'Cadre-1', comparés aux variantes où les émojis étaient remplacés par des mots ou supprimés. Les noms des modèles sont abrégés.

Les résultats initiaux montrent que les invites avec substitution par émojis ont obtenu des scores HS et HR plus élevés que les versions textuelles. L'approche par émojis a surpassé les méthodes de jailbreak antérieures, comme on le voit dans le tableau supplémentaire :

Harmfulness Ratio results for emoji-augmented jailbreak prompts in

Résultats du Taux de Nocivité pour les invites de jailbreak augmentées d'émojis dans le 'Cadre-2', avec les noms des modèles abrégés.

Le premier tableau indique également l'effet translinguistique des émojis. Lorsque les invites étaient traduites en chinois, français, espagnol et russe, les sorties nocives restaient élevées, suggérant que les risques s'étendent au-delà de l'anglais vers les principaux groupes d'utilisateurs.

En conclusion, les chercheurs notent ques les émojis peuvent être remarquablement difficiles à interpréter.

Première publication mercredi 17 septembre 2025

Article connexe
Base44 dévoile son modèle d’IA propriétaire pour renforcer la défensabilité de sa plateforme de codage par ambiance Base44 dévoile son modèle d’IA propriétaire pour renforcer la défensabilité de sa plateforme de codage par ambiance Base44, la plateforme de codage par « vibe » acquise par Wix pour 80 millions de dollars il y a seulement un an — alors qu’elle n’avait que six mois et une équipe de huit personnes — a commencé à déployer son modèle d’IA propriétaire afin d’aider les
Multiverse Computing lance un modèle d'IA générative compressé gratuit Multiverse Computing lance un modèle d'IA générative compressé gratuit Les grands modèles linguistiques sont confrontés à un défi de taille : leur taille immense. La start-up espagnole Multiverse Computing s'attaque à ce problème en créant des modèles compressés con
Des données de suivi secrètes révèlent le vol de modèles d'IA Des données de suivi secrètes révèlent le vol de modèles d'IA Une nouvelle méthode permet d'apposer un filigrane invisible sur des modèles tels que ChatGPT en quelques secondes sans nécessiter de réentraînement, sans laisser de trace dans les sorties standard et
Recommandations de sujets spéciaux liés
en écrivant Les meilleurs générateurs de plans basés sur l'IA pour les articles SEO longs
Les meilleurs générateurs de plans basés sur l'IA pour les articles SEO longs

2026 : les meilleurs générateurs de plans basés sur l'IA pour les articles SEO longs, soigneusement sélectionnés par XIX.AI. Ces outils puissants offrent une aide révolutionnaire pour créer rapidement du contenu de haute qualité, améliorant ainsi considérablement l'efficacité de la rédaction. Découvrez une comparaison entre les versions gratuites et payantes, ainsi que des tests concrets et des classements détaillés pour vous aider à trouver l'option incontournable qui répond à vos besoins. Explorez dès maintenant pour tirer pleinement parti de l'IA.

8 outils
xix.ai
Éducation et apprentissage Outils d'étude basés sur l'IA pour les devoirs et la préparation aux examens
Outils d'étude basés sur l'IA pour les devoirs et la préparation aux examens

Les meilleurs outils d'IA de 2026 pour les devoirs et la préparation aux examens ! XIX.AI vous propose une sélection des outils les mieux notés, puissants et révolutionnaires, qui aident les élèves à booster leur productivité, à optimiser la réalisation de leurs devoirs et à réussir haut la main leurs examens grâce à des tests concrets. Découvrez un comparatif entre les versions gratuites et payantes, des classements détaillés et des options incontournables pour tirer pleinement parti de l'IA. Découvrez-les dès maintenant !

10 outils
xix.ai
Composition musicale Outils de démo vocale par IA pour les auteurs-compositeurs, les accroches, les mélodies principales et les sessions de brouillons multilingues
Outils de démo vocale par IA pour les auteurs-compositeurs, les accroches, les mélodies principales et les sessions de brouillons multilingues

2026 Derniers Meilleurs Outils de Démonstration Vocale par IA pour les Paroliers, Créateurs d’Accroches et Équipes de Contenu Multilingues ! XIX.AI a sélectionné une liste primée d’outils puissants et révolutionnaires, soumis à des tests rigoureux en conditions réelles. Vous y trouverez des données détaillées comparant les versions gratuites et payantes, des classements complets et des options incontournables à essayer pour améliorer votre efficacité d’écriture et libérer votre potentiel créatif. Explorez dès maintenant pour découvrir l’outil parfait répondant à tous vos besoins en contenu !

9 outils
xix.ai
Entreprise Les meilleurs outils de veille concurrentielle basés sur l'IA pour les petites entreprises
Les meilleurs outils de veille concurrentielle basés sur l'IA pour les petites entreprises

Les meilleurs outils de recherche concurrentielle basés sur l’IA les plus récents et les mieux notés pour les petites entreprises en 2026 ! XIX.AI a sélectionné une collection extrêmement puissante et révolutionnaire, mise à jour chaque semaine à l’issue de tests rigoureux en conditions réelles et accompagnée de classements détaillés. Vous y trouverez un comparatif complet entre les versions gratuites et payantes pour vous aider à identifier les outils incontournables qui boosteront votre productivité et vous donneront un avantage concurrentiel. Découvrez-la dès maintenant pour trouver l'outil qui vous convient le mieux !

9 outils
xix.ai
Édition d'images Outils de retouche par IA Photoshop pour les vêtements d’e-commerce, nettoyage de la peau et cohérence des couleurs
Outils de retouche par IA Photoshop pour les vêtements d’e-commerce, nettoyage de la peau et cohérence des couleurs

2026 Derniers meilleurs outils de retouche par IA Photoshop pour les vêtements e-commerce, le nettoyage de la peau et la cohérence des couleurs ! Cette liste soigneusement sélectionnée et hautement notée propose des solutions puissantes qui changent la donne, vous aidant à améliorer l’efficacité rédactionnelle, rationaliser la création de contenu et obtenir des résultats visuels parfaits sans effort. Chaque outil a été testé dans des conditions réelles grâce à des classements mis à jour chaque semaine, accompagnés de détails comparatifs entre versions gratuites et payantes. Soutenu par XIX.AI, c’est le guide incontournable pour quiconque souhaite exploiter son avantage grâce à l’IA. Explorez dès maintenant !

10 outils
xix.ai
Rapide Les meilleures bibliothèques de prompts d'IA pour les workflows ChatGPT
Les meilleures bibliothèques de prompts d'IA pour les workflows ChatGPT

2026 : les meilleures bibliothèques de prompts IA les mieux notées pour optimiser tous les types de flux de travail ChatGPT. XIX.AI a sélectionné une collection puissante et révolutionnaire, soumise à des tests rigoureux en conditions réelles afin de garantir des performances optimales. Vous trouverez des comparaisons détaillées entre les solutions gratuites et payantes, ainsi que des classements d'experts pour vous aider à choisir les outils incontournables qui boosteront votre productivité et vous permettront de tirer pleinement parti de l'IA. Découvrez-les dès maintenant !

11 outils
xix.ai
commentaires (0)
0/500
OR