Los emojis pueden eludir los mecanismos de seguridad en los modelos de lenguaje grandes, lo que lleva a resultados tóxicos que de otro modo serían bloqueados. Este método permite a los LLMs discutir y proporcionar orientación sobre temas prohibidos como la fabricación de bombas y el asesinato.
Una reciente colaboración entre China y Singapur presenta evidencia sólida de que los emojis no solo pueden evadir los filtros de contenido en los modelos de lenguaje grandes (LLMs), sino también amplificar la toxicidad durante las interacciones:
Del nuevo artículo, una amplia demostración de cómo codificar conceptos prohibidos con emojis puede ayudar a los usuarios a 'hacer jailbreak' a LLMs populares. Fuente: https://arxiv.org/pdf/2509.11141
En el ejemplo anterior, convertir una intención basada en texto que infringe las reglas en una alternativa cargada de emojis puede provocar una respuesta más cooperativa de modelos avanzados como ChatGPT-4o, que normalmente sanitiza las entradas y bloquea el contenido que viola las reglas.
Según los autores, los emojis pueden servir efectivamente como una técnica de jailbreaking en casos extremos.
Una pregunta persistente es por qué los LLMs permiten que los emojis eludan las reglas y provoquen contenido tóxico, incluso cuando los modelos reconocen las asociaciones dañinas de ciertos emojis.
Los investigadores proponen que los LLMs, entrenados para replicar patrones de sus datos, tratan a los emojis como indicios estadísticos en lugar de contenido a filtrar. Dado que los emojis son comunes en los datos de entrenamiento, los modelos aprenden a asociarlos con discursos específicos, reforzando significados tóxicos en lugar de marcarlos. Las medidas de seguridad, aplicadas a posteriori y a menudo de manera estrecha, pueden pasar por alto por completo estas indicaciones cargadas de emojis.
Por lo tanto, el modelo se vuelve tolerante no a pesar de la asociación tóxica, sino debido a ella.
Pase Libre
Los autores reconocen que esta no es una explicación definitiva para la omisión del filtrado por parte de los emojis. Afirman:
'Los modelos pueden reconocer la intención maliciosa expresada por los emojis, sin embargo, cómo elude los mecanismos de seguridad sigue sin estar claro.'
La vulnerabilidad puede provenir de diseños de filtros centrados en texto, que dependen de tokens explícitos o incrustaciones comparadas con reglas de seguridad. A diferencia de las palabras, los emojis existen en un área gris —ni puramente texto ni imagen— permitiéndoles evadir la detección. Se necesita más investigación sobre este vacío legal.
El artículo, titulado When Smiley Turns Hostile: Interpreting How Emojis Trigger LLMs’ Toxicity, involucra a nueve investigadores de la Universidad de Tsinghua y la Universidad Nacional de Singapur.
(El artículo hace referencia a ejemplos en un apéndice que aún no está disponible; a pesar de las solicitudes, no se proporcionó al momento de escribir. Aún así, los hallazgos principales merecen atención.)
Tres Interpretaciones Centrales de los Emojis
Los emojis eluden los filtros a través de tres rasgos lingüísticos. Primero, sus significados son dependientes del contexto. Por ejemplo, el emoji 'Dinero con Alas' denota oficialmente gastar, pero puede implicar actividad ilícita dependiendo del contexto:
En una ilustración parcial, el significado de un emoji popular puede ser secuestrado en su uso, otorgándole un pasaporte semántico con una carga útil tóxica oculta explotable después del filtrado.
En segundo lugar, los emojis alteran el tono, añadiendo jovialidad o ironía que suaviza el impacto emocional. En consultas dañinas, esto puede disfrazar la intención como humor, fomentando el cumplimiento del modelo:
Los emojis pueden desintoxicar el tono sin neutralizar la intención dañina.
Tercero, los emojis son agnósticos al lenguaje, transmitiendo un sentimiento consistente en idiomas como inglés, chino y francés. Esto los hace ideales para indicaciones multilingües, preservando el significado a pesar de la traducción:
El emoji 'corazón roto' se comunica universalmente, reflejando una experiencia humana fundamental menos afectada por diferencias culturales.
Enfoque, Datos y Pruebas*
Los investigadores modificaron el conjunto de datos AdvBench, añadiendo emojis como sustitutos de términos sensibles o elementos decorativos. AdvBench incluye 32 temas de alto riesgo como bombardeos y hacking:
Ejemplos originales de AdvBench muestran cómo las indicaciones adversarias eluden las salvaguardas en chatbots principales, provocando respuestas dañinas a pesar de la alineación. Fuente: https://arxiv.org/pdf/2307.15043
Las 520 instancias de AdvBench fueron modificadas con emojis, utilizando las 50 indicaciones tóxicas principales en los experimentos. Las indicaciones se tradujeron a múltiples idiomas y se probaron en siete modelos de código cerrado y abierto, combinados con técnicas de jailbreak como PAIR, TAP y DeepInception.
Los modelos de código cerrado incluyeron Gemini-2.0-flash, GPT-4o, GPT-4-0613 y Gemini-1.5-pro. Los modelos de código abierto fueron Llama-3-8B-Instruct, Qwen2.5-7B-Instruct y Qwen2.5-72B-Instruct, con pruebas repetidas tres veces para confiabilidad.
El estudio evaluó si las indicaciones reescritas con emojis aumentaban la producción tóxica, incluso en traducciones. También aplicó ediciones de emojis a estrategias de jailbreak conocidas para medir la efectividad mejorada.
Las estructuras de las indicaciones se preservaron, solo se intercambiaron términos sensibles por emojis o se añadieron elementos decorativos.
Para la evaluación, los autores introdujeron GPT-Judge, donde GPT-4o calificó las respuestas de otros modelos en una escala de Puntuación de Daño (HS) de 1-5. Las respuestas con puntuación 5 constituyeron la Proporción de Daño (HR).
Para evitar explicaciones de emojis, las indicaciones incluían instrucciones de brevedad:
Resultados de indicaciones basadas en emojis en 'Configuración-1', comparados con variantes donde los emojis fueron reemplazados por palabras o eliminados. Los nombres de los modelos están abreviados.
Los resultados iniciales muestran que las indicaciones con sustitución de emojis lograron puntuaciones HS y HR más altas que las versiones basadas en texto. El enfoque de emojis superó a métodos previos de jailbreak, como se ve en la tabla adicional:
Resultados de la Proporción de Daño para indicaciones de jailbreak aumentadas con emojis en 'Configuración-2', con nombres de modelos abreviados.
La primera tabla también indica el efecto translingüístico de los emojis. Cuando las indicaciones se tradujeron al chino, francés, español y ruso, las salidas dañinas se mantuvieron altas, sugiriendo que los riesgos se extienden más allá del inglés a grupos principales de usuarios.
En conclusión, los investigadores señalan que el impacto de los emojis proviene de cómo los modelos los procesan —reconociendo el daño pero suprimiendo el rechazo cuando los emojis están presentes. Los estudios de tokenización muestran que los emojis se fragmentan en tokens raros, creando un canal semántico alternativo.
El análisis de datos de preentrenamiento revela el uso frecuente de emojis en contextos tóxicos (por ejemplo, estafas, juegos de azar), normalizando asociaciones dañinas. Juntos, las peculiaridades del modelo y los datos sesgados explican la efectividad de los emojis para eludir la seguridad.
Conclusión
Métodos de entrada alternativos como la codificación hexadecimal se han utilizado para hacer jailbreak a los LLMs. El problema reside en la calificación centrada en texto de las entradas y salidas.
Los emojis introducen significado que infringe reglas sin ser detectados, ya que su transmisión no ortodoxa evade los filtros. Si bien la transliteración basada en CLIP debería marcar contenido ofensivo en imágenes, esto no se aplica consistentemente en los LLMs principales, cuyas barreras lingüísticas siguen siendo frágiles. Una interpretación de contenido más amplia (por ejemplo, mediante mapas de calor) puede ser costosa o impráctica.
* El diseño del artículo está menos estructurado que los estudios típicos; hemos intentado transmitir sus ideas principales claramente.
†La presentación de resultados es notablemente difícil de interpretar.
Publicado por primera vez el miércoles, 17 de septiembre de 2025
Datos secretos de seguimiento revelan el robo de modelos de IAUn nuevo método puede marcar de forma invisible modelos como ChatGPT en cuestión de segundos sin necesidad de volver a entrenarlos, sin dejar rastro en los resultados estándar y resistiendo todos los
¡Las mejores herramientas de IA de 2026 para hacer los deberes y prepararse para los exámenes! XIX.AI ha elaborado una lista con las herramientas mejor valoradas, potentes y revolucionarias que ayudan a los estudiantes a aumentar su productividad, agilizar la realización de los deberes y sacar sobresaliente en los exámenes gracias a pruebas reales. Consigue una comparación entre versiones gratuitas y de pago, clasificaciones detalladas y opciones imprescindibles para sacar el máximo partido a la IA. ¡Explora ahora!
¡Las mejores herramientas de demostración vocal con IA de 2026 para compositores, creadores de ganchos y equipos de contenido multilingüe! XIX.AI ha recopilado una lista de herramientas poderosas y transformadoras, rigurosamente probadas en el mundo real. Encontrarás datos detallados de comparación entre versiones gratuitas y de pago, clasificaciones completas y opciones imprescindibles para ayudarte a aumentar tu eficiencia de escritura y desbloquear todo tu potencial creativo. ¡Explora ahora para descubrir la herramienta perfecta para todas tus necesidades de contenido!
¡Las mejores herramientas de investigación competitiva basadas en IA mejor valoradas de 2026 para pequeñas empresas! XIX.AI ha seleccionado una colección revolucionaria y muy potente, que se actualiza semanalmente con rigurosas pruebas en el mundo real y clasificaciones detalladas. Encontrarás una comparación exhaustiva entre las opciones gratuitas y las de pago que te ayudará a identificar las herramientas imprescindibles que impulsarán tu productividad y te proporcionarán una ventaja competitiva. ¡Explora ahora mismo y descubre la herramienta perfecta para ti!
¡Las mejores herramientas de retoque con IA de Photoshop de 2026 para ropa de comercio electrónico, limpieza de piel y consistencia de color! Esta lista curada de alta calificación presenta soluciones poderosas que cambian las reglas del juego, que ayudan a aumentar la eficiencia de redacción, optimizar la creación de contenido y lograr resultados visuales perfectos sin esfuerzo. Cada herramienta ha pasado por pruebas en el mundo real a través de clasificaciones actualizadas semanalmente, con detalles completos de comparación entre versiones gratuitas y de pago. Respaldado por XIX.AI, es la guía imprescindible para cualquier persona que aspire a desbloquear su ventaja con IA. ¡Explora ahora!
Las mejores bibliotecas de prompts de IA de 2026, con las más valoradas, para optimizar todo tipo de flujos de trabajo de ChatGPT. XIX.AI ha seleccionado una colección potente y revolucionaria que se somete a rigurosas pruebas en condiciones reales para garantizar el máximo rendimiento. Encontrarás comparativas detalladas entre opciones gratuitas y de pago, así como clasificaciones de expertos, que te ayudarán a elegir las herramientas imprescindibles para potenciar tu productividad y sacar el máximo partido a la IA. ¡Explora ahora!
2026 Últimas y mejores plataformas para crear cuestionarios con IA para profesores, tutores y programas de aprendizaje en cohortes. XIX.AI ha elaborado una lista de herramientas poderosas y transformadoras, sometidas a pruebas en el mundo real para ofrecer clasificaciones precisas. Estas plataformas obligatorias ayudan a mejorar la eficiencia en la redacción, agilizar la creación de contenido y simplificar el diseño de cuestionarios en todos los escenarios de aprendizaje. Explora ahora para descubrir la herramienta perfecta que te permitirá desbloquear tu ventaja con IA en la enseñanza.
Al hacer clic en "Aceptar todos los cookies", usted acepta el almacenamiento de cookies en su dispositivo para mejorar la navegación por el sitio, analizar el uso del sitio y ayudar en nuestros esfuerzos de marketing.Política de privacidad Aviso
Al visitar cualquier sitio web, este puede almacenar o recuperar información en su navegador, principalmente en forma de cookies. Esta información puede referirse a usted, sus preferencias o su dispositivo y se usa principalmente para que el sitio funcione como espera. Por lo general, la información no lo identifica directamente, pero puede brindarle una experiencia web más personalizada. Debido a que respetamos su derecho a la privacidad, puede optar por no permitir algunos tipos de cookies. Haga clic en los diferentes títulos de categoría para obtener más información y cambiar nuestros ajustes predeterminados. Sin embargo, bloquear algunos tipos de cookies puede afectar su experiencia en el sitio y los servicios que podemos ofrecer. Política de privacidadDeclaración
Gestionar preferencias
Cookie estrictamente necesario
Siempre activo
Estos cookies son necesarios para que el sitio web funcione y no pueden ser desactivados en nuestros sistemas. Por lo general, solo se establecen en respuesta a acciones que realice usted que equivalen a una solicitud de servicios, como configurar sus preferencias de privacidad, iniciar sesión o completar formularios. Puede configurar su navegador para bloquear estos cookies o alertarle sobre ellos, pero algunas partes del sitio no funcionarán luego. Estos cookies no almacenan ninguna información que permita identificar personalmente.