opción
Hogar
Noticias
La exposición a textos protegidos por derechos de autor provoca alucinaciones en modelos de IA, según un estudio pionero

La exposición a textos protegidos por derechos de autor provoca alucinaciones en modelos de IA, según un estudio pionero

21 de diciembre de 2025
124

Los mecanismos de censura de los modelos lingüísticos podrían estar comprometiendo su capacidad para transmitir la verdad a mayor escala. Investigaciones recientes indican que los mismos procesos internos diseñados para bloquear las respuestas "inseguras" también inhiben el intercambio de información objetiva. Esto implica que los esfuerzos por alinear los modelos en aras de la seguridad podrían conducir inadvertidamente a un aumento de la alucinación.

Durante años, los desarrolladores se han centrado en reducir las falsedades en los modelos lingüísticos. La búsqueda de una mayor veracidad -frenando las alucinaciones y orientando los modelos hacia hechos verificables- se ha convertido en una línea de investigación dominante y ampliamente respaldada.

Sin embargo, un nuevo estudio australiano sugiere que los métodos de alineación -técnicas de entrenamiento que restringen los intercambios "inseguros"- pueden estar impidiendo por completo que los modelos ofrezcan respuestas precisas al imponer controles más estrictos:

Mejorar la precisión factual de un modelo (

Aumentar la exactitud de los hechos de un modelo (etiquetado como "Aumento de la veracidad" en la figura) puede llevarlo a zonas de activación que eluden sus mecanismos de rechazo. Del mismo modo, las ediciones destinadas a reducir las alucinaciones pueden desplazar las representaciones internas más allá de los límites de seguridad. Esto podría permitir que las indicaciones nocivas eludieran las salvaguardas, a menos que las características de rechazo se aíslen y mantengan cuidadosamente. Fuente: https://arxiv.org/pdf/2510.07775

El estudio revela que las vías internas responsables del recuerdo de los hechos también gobiernan el comportamiento de rechazo, el mecanismo que impide que los modelos respondan a indicaciones inseguras o delicadas. Cuando las técnicas de alineación amplifican en exceso las señales de rechazo, estas vías se solapan, desdibujando la capacidad del modelo para distinguir entre el rechazo de contenidos nocivos y la supresión involuntaria de información válida.

Irónicamente, a medida que los modelos mejoran en el rechazo de solicitudes inapropiadas, su capacidad para transmitir la verdad disminuye.

Temas delicados

La ilustración anterior pone de relieve que el reto principal no sólo consiste en ofrecer resultados justos y precisos a los usuarios, sino también en mitigar los riesgos legales para los proveedores de LLM.

Por ejemplo, el estudio de caso al que se hace referencia en las imágenes trata un tema controvertido -estadísticas penitenciarias basadas en la raza- que una IA podría debatir de forma responsable con académicos o investigadores, pero que debería evitar cuando es manipulada por actores malintencionados que buscan obtener respuestas abusivas, ofensivas o ilegales.

Dado que los LLM alineados no pueden evaluar la intención de una consulta, adoptan por defecto un enfoque cauteloso:

Las respuestas a preguntas delicadas pueden variar en función de la estrategia de alineación. Un modelo alineado con la seguridad bloquea la consulta por completo, mientras que un modelo centrado en la verdad responde con un contexto factual, aumentando la información pero debilitando la supresión. Esto respalda la opinión de que las ediciones que aumentan la veracidad pueden reducir los umbrales de rechazo, haciendo que los modelos sean más vulnerables a las peticiones con intenciones dañinas, a menos que los mecanismos de rechazo estén protegidos explícitamente.

Las respuestas a las solicitudes delicadas varían según la estrategia de alineación. Un modelo centrado en la seguridad bloquea la consulta por completo, mientras que un modelo orientado a la verdad proporciona un contexto factual, mejorando la información pero reduciendo la supresión. Esto respalda la idea de que las ediciones que mejoran la veracidad pueden reducir los umbrales de rechazo, lo que aumenta la vulnerabilidad a las indicaciones perjudiciales a menos que se protejan los mecanismos de rechazo.

Por otra parte, estos resultados podrían llevar a los críticos de las llamadas agendas "woke" a argumentar que los modelos fuertemente alineados son menos veraces y útiles que sus homólogos no regulados.

Los datos de este documento apoyan parcialmente esta opinión, pero la contextualizan dentro de los riesgos más amplios de utilizar LLM no alineados, incluida la exposición legal a infracciones penales y civiles, así como la propagación de información errónea, que sigue siendo difícil de filtrar eficazmente debido a las limitaciones de costes.

Funciones entrelazadas

Para comprender los mecanismos subyacentes, los investigadores trazaron un mapa de las activaciones de las cabezas de atención individuales y descubrieron que los rasgos asociados a la alucinación y el rechazo suelen ocupar regiones superpuestas dentro del modelo.

Descubrieron que afinar o dirigir estas regiones para reducir las falsedades puede debilitar las salvaguardas incorporadas al modelo, ya que ambas funciones comparten un espacio latente similar:

Mejorar la precisión de los hechos suele debilitar el comportamiento de rechazo. Nuestro análisis muestra que esto ocurre porque los componentes que codifican la alucinación y la información de rechazo se solapan, haciendo que los métodos de alineación supriman involuntariamente el conocimiento de los hechos.

También exploramos cómo el ajuste fino en conjuntos de datos benignos, incluso en los curados por seguridad, puede degradar la alineación por la misma razón".

Los autores proponen utilizar un autoencoder disperso (SAE) -una red diseñada para aislar distintos patrones de activación- para separar estas funciones y preservar la seguridad durante el entrenamiento de la veracidad. El objetivo es que los modelos sean más seguros y precisos sin comprometer ninguna de las dos cualidades.

El nuevo artículo, titulado The Unintended Trade-off of AI Alignment: Balancing Hallucination Mitigation and Safety in LLMs, procede de cinco investigadores afiliados a la Universidad Deakin y de una investigación independiente.

Metodología

El estudio investiga si la mejora de la veracidad en los modelos lingüísticos debilita su capacidad para rechazar indicaciones perjudiciales y si ambos comportamientos dependen de componentes internos compartidos.

Probando dos métodos de mejora de la veracidad, los autores descubrieron que el aumento de la exactitud de los hechos incrementa sistemáticamente la susceptibilidad a los jailbreaks.

Esta compensación se debe al solapamiento de las cabezas de atención que codifican tanto las señales fácticas como las de rechazo. Incluso un ajuste fino benigno -destinado a mejorar la utilidad sin afectar a la seguridad- puede perturbar las salvaguardias al alterar las vías compartidas.

El estudio define tres términos clave: la veracidad se refiere a la capacidad de un modelo para dar respuestas precisas basadas en el conocimiento disponible sin suprimir contenidos inofensivos; la alucinación se produce cuando el modelo genera información incorrecta a pesar de tener acceso a hechos correctos; y el comportamiento de rechazo, o alineación de seguridad, describe mecanismos que bloquean las respuestas a estímulos dañinos o sensibles.

Los autores señalan que estas funciones interactúan de forma sutil:

Aunque la veracidad y la seguridad se analizan a menudo por separado, las indicaciones del mundo real suelen contener términos sensibles con intenciones benignas (por ejemplo, para análisis, detección o educación). En estos casos, los mecanismos de seguridad pueden dispararse en exceso (suprimiendo información precisa y útil) y reducir la veracidad práctica por omisión".

Comprender cómo afectan las ediciones destinadas a aumentar la veracidad a la conducta de rechazo es esencial para lograr la veracidad con una supresión mínima y adecuada".

Los autores desarrollaron un LoRA capaz de dirigir un LLM condicionado hacia un comportamiento más

Los autores desarrollaron un LoRA que guía a un LLM condicionado hacia un estado más "veraz", reduciendo la alucinación. El apéndice del artículo incluye varios ejemplos que ilustran las consecuencias imprevistas de este enfoque.

El análisis comienza tratando los métodos de mejora de la veracidad, como la dirección de la cabeza y el mapeo de la dirección latente, como modificaciones intencionadas de los cálculos internos de un modelo.

Dirección de precisión

La pregunta clave es si estos cambios afectan inadvertidamente a las mismas vías que rigen el comportamiento de rechazo. Para comprobarlo, el estudio evaluó los modelos en cuanto a precisión factual mediante TruthfulQA y en cuanto a rendimiento de seguridad en condiciones adversariales mediante AdvBench y StrongReject.

Las técnicas de referencia incluían la intervención en tiempo de inferencia (ITI), que activa las cabezas de atención vinculadas a respuestas veraces, y TruthX, que desplaza las representaciones en una dirección "veraz" aprendida.

Ambos métodos mejoran la precisión, pero también hacen que los modelos sean más propensos a responder a estímulos perjudiciales que antes habrían rechazado.

Para aislar y manipular directamente el comportamiento de alucinación, los autores definieron una dirección latente correspondiente a las respuestas alucinadas, entrenando un módulo LoRA sobre las respuestas incorrectas del conjunto de datos TruthfulQA utilizando LLaMA3-8B-Instruct.

Esto produjo un vector lineal que representaba la diferencia entre las respuestas verdaderas y las alucinadas, permitiendo que el modelo se dirigiera hacia la alucinación o se alejara de ella.

Efecto de la orientación en la dirección de la alucinación. La precisión en TruthfulQA aumenta a medida que el modelo se desvía hacia la dirección negativa, mientras que la tasa de éxito del ataque (ASR, cuanto más baja mejor) aumenta considerablemente en AdvBench y StrongReject, lo que refleja el equilibrio entre veracidad y seguridad.

Dirigir el modelo en la dirección de la alucinación mejora la precisión en TruthfulQA, pero aumenta la tasa de éxito de los ataques (ASR) en AdvBench y StrongReject, lo que pone de manifiesto el equilibrio entre veracidad y seguridad.

La dirección a lo largo del eje de alucinación redujo la precisión factual, mientras que la dirección inversa la mejoró. La aplicación de esta técnica a pruebas de referencia nocivas confirmó los resultados anteriores: el aumento de la veracidad se produjo a expensas del debilitamiento del rechazo. Incluso cuando la alucinación se captaba como una dirección lineal limpia, la mejora de la producción factual aumentaba la vulnerabilidad a las finalizaciones inseguras.

Los autores subrayan*:

"Esto refuerza el equilibrio entre veracidad y seguridad, mostrando que incluso cuando la veracidad se representa como una única dirección lineal, la mejora de la factualidad puede producirse a expensas de una alineación de seguridad debilitada".

Datos y pruebas

Para evitar que el ajuste fino debilitara el comportamiento de rechazo, los autores emplearon un método para separar los rasgos de rechazo de los vinculados a la alucinación. Identificaron las cabezas de atención implicadas en ambos comportamientos y utilizaron un SAE para extraer características latentes específicas de la negativa.

Estas características definieron un subespacio protegido. Durante el entrenamiento, se modificaron las actualizaciones de gradiente para evitar este subespacio, lo que permitió al modelo reducir las alucinaciones sin comprometer la seguridad.

Los autores realizaron una puesta a punto en el conjunto de datos CommonsenseQA, evaluando el rendimiento en seis tareas de razonamiento de sentido común: CSQA, HellaSwag, ARC Challenge, ARC Easy, WinoGrande y SST-2.

Los módulos objetivo se ajustaron utilizando LoRA con rango 8, una tasa de aprendizaje de 2×10-⁴, un decaimiento del peso de 0,01, una época de entrenamiento y un tamaño de lote de dos. En todos los experimentos se utilizó el optimizador AdamW.

La seguridad se evaluó utilizando dos puntos de referencia de contenido dañino: AdvBench (500 muestras) y StrongReject (300 mensajes). LlamaGuard3 clasificó los resultados como seguros o inseguros.

Los experimentos se realizaron con LLaMA3-8B-Instruct y Qwen2.5-Instruct.

Los métodos de referencia fueron SafeLoRA, SaLoRA, SAP y vanilla supervised fine-tuning (SFT). Todos se probaron con hiperparámetros predeterminados utilizando 200 mensajes de HarmBench, excepto SafeLoRA.

La precisión fue la métrica principal, y se utilizó la Tasa de Éxito de Ataques (ASR) para las pruebas comparativas dañinas, basándose en los resultados de LlamaGuard3.

Arriba, resultados de LlaMA-3-8B-Instruct, con los mejores resultados de cada columna en negrita, y abajo, rendimiento de los métodos de ajuste fino en Qwen2.5 7B Instruct, en tareas de sentido común y razonamiento, donde las puntuaciones más altas reflejan una mayor precisión, y en las pruebas de seguridad AdvBench y StrongReject, donde los valores ASR más bajos reflejan una mayor solidez. Los mejores resultados de cada columna aparecen en negrita.

Arriba: Resultados de LLaMA-3-8B-Instruct, con las mejores puntuaciones en negrita. Abajo: Rendimiento de los métodos de ajuste fino en Qwen2.5 7B Instruct en tareas de sentido común y razonamiento (las puntuaciones más altas indican mayor precisión) y puntos de referencia de seguridad AdvBench y StrongReject (los valores ASR más bajos indican mayor robustez). Los mejores resultados de cada columna aparecen en negrita.

En relación con estos resultados, los autores afirman

'Nuestro enfoque quirúrgico logra el mejor equilibrio entre seguridad y utilidad: reduce significativamente las puntuaciones de referencia perjudiciales al tiempo que preserva la precisión del ajuste fino. En cambio, métodos como SAP, SaLoRA y SafeLoRA aumentan la nocividad o degradan la utilidad.

Una razón clave es que estos métodos operan directamente sobre el gradiente del subespacio de seguridad, que, debido a la polisemanticidad [**], puede limitar el rendimiento del modelo.

Comparado con el ajuste de vainilla (SFT), nuestro método mejora la precisión media del ajuste (FA) del 56,15% al 75,09%, lo que supone una ganancia aproximada del +19%".

El método redujo la tasa de éxito de los ataques del 9,23% al 0,58% en AdvBench y del 9,90% al 0,00% en StrongReject, lo que supone una reducción de más de quince veces en los resultados dañinos. El modelo de base, aunque bajo en nocividad, logró una precisión limitada en las tareas.

Los autores señalan:

Estos resultados subrayan la importancia de preservar las características de rechazo durante el ajuste fino: al aislar y proteger el subespacio de rechazo, nuestro método mantiene la alineación de seguridad sin sacrificar el rendimiento de la tarea.

En general, esto confirma que nuestro método mitiga eficazmente la disyuntiva entre veracidad y seguridad".

Por último, los autores probaron la resistencia del método en condiciones adversas añadiendo un 10% de instrucciones dañinas del conjunto de datos Circuit Break al conjunto de ajuste.

A pesar de esta contaminación deliberada, el método mantuvo un buen rendimiento tanto en las evaluaciones benignas como en las perjudiciales:

Rendimiento de LLaMA3 8B Instruct afinado en un conjunto de datos de sentido común envenenado, comparando los resultados de precisión y seguridad entre métodos.

Rendimiento de LLaMA3 8B Instruct ajustado en un conjunto de datos de sentido común envenenado, comparando los resultados de precisión y seguridad de los distintos métodos.

El nuevo método redujo la ASR con mayor eficacia que el SAP, evitando al mismo tiempo una pérdida significativa de utilidad. La precisión de la tarea se mantuvo cerca de LoRA SFT y SafeLoRA, lo que demuestra que la alineación de rechazo puede mantenerse incluso en condiciones de entrenamiento contaminadas cuando las características de rechazo se aíslan adecuadamente.

Conclusión

El hallazgo más intrigante

Artículo relacionado
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr
Google prueba el agente Remy AI para Gemini a medida que el enfoque se desplaza hacia el control del usuario Google prueba el agente Remy AI para Gemini a medida que el enfoque se desplaza hacia el control del usuario Según Business Insider, Google está probando Remy, un nuevo agente personal de IA para Gemini. Esta herramienta tiene como objetivo ejecutar tareas en nombre de los usuarios, optimizando tanto los flujos de trabajo profesionales como las rutinas diar
Recomendaciones de temas especiales relacionados
Análisis de datos Mejores herramientas de IA para la detección de anomalías en el monitoreo de KPIs para equipos de SaaS y comercio electrónico
Mejores herramientas de IA para la detección de anomalías en el monitoreo de KPIs para equipos de SaaS y comercio electrónico

¡Las mejores herramientas de detección de anomalías con IA de 2026, más valoradas y destacadas para el monitoreo de KPI en equipos de SaaS y comercio electrónico! XIX.AI ha recopilado una poderosa colección transformadora basada en rigurosas pruebas del mundo real y clasificaciones actualizadas semanalmente. Encontrarás comparaciones detalladas entre versiones gratuitas y de pago que te ayudarán a identificar la solución imprescindible para aumentar la productividad y desbloquear tu ventaja con IA. ¡Explora ahora!

10 herramientas
xix.ai
escribiendo Los mejores generadores de esquemas basados en IA para artículos largos optimizados para SEO
Los mejores generadores de esquemas basados en IA para artículos largos optimizados para SEO

Los mejores generadores de esquemas con IA mejor valorados de 2026 para artículos largos optimizados para SEO, seleccionados minuciosamente por XIX.AI. Estas potentes herramientas ofrecen una ayuda revolucionaria a la hora de crear contenido de alta calidad rápidamente, lo que aumenta considerablemente la eficiencia a la hora de escribir. Consigue una comparación entre las versiones gratuitas y de pago, junto con pruebas en condiciones reales y clasificaciones detalladas, que te ayudarán a encontrar la opción imprescindible que mejor se adapte a tus necesidades. Explora ahora para descubrir las ventajas que te ofrece la IA.

8 herramientas
xix.ai
Educación y aprendizaje Herramientas de estudio basadas en IA para los deberes y la preparación de exámenes
Herramientas de estudio basadas en IA para los deberes y la preparación de exámenes

¡Las mejores herramientas de IA de 2026 para hacer los deberes y prepararse para los exámenes! XIX.AI ha elaborado una lista con las herramientas mejor valoradas, potentes y revolucionarias que ayudan a los estudiantes a aumentar su productividad, agilizar la realización de los deberes y sacar sobresaliente en los exámenes gracias a pruebas reales. Consigue una comparación entre versiones gratuitas y de pago, clasificaciones detalladas y opciones imprescindibles para sacar el máximo partido a la IA. ¡Explora ahora!

10 herramientas
xix.ai
composicion musical Herramientas de demostración vocal con IA para compositores, ganchos, melodías principales y sesiones de borrador multilingüe
Herramientas de demostración vocal con IA para compositores, ganchos, melodías principales y sesiones de borrador multilingüe

¡Las mejores herramientas de demostración vocal con IA de 2026 para compositores, creadores de ganchos y equipos de contenido multilingüe! XIX.AI ha recopilado una lista de herramientas poderosas y transformadoras, rigurosamente probadas en el mundo real. Encontrarás datos detallados de comparación entre versiones gratuitas y de pago, clasificaciones completas y opciones imprescindibles para ayudarte a aumentar tu eficiencia de escritura y desbloquear todo tu potencial creativo. ¡Explora ahora para descubrir la herramienta perfecta para todas tus necesidades de contenido!

9 herramientas
xix.ai
Negocio Las mejores herramientas de investigación competitiva basadas en IA para pequeñas empresas
Las mejores herramientas de investigación competitiva basadas en IA para pequeñas empresas

¡Las mejores herramientas de investigación competitiva basadas en IA mejor valoradas de 2026 para pequeñas empresas! XIX.AI ha seleccionado una colección revolucionaria y muy potente, que se actualiza semanalmente con rigurosas pruebas en el mundo real y clasificaciones detalladas. Encontrarás una comparación exhaustiva entre las opciones gratuitas y las de pago que te ayudará a identificar las herramientas imprescindibles que impulsarán tu productividad y te proporcionarán una ventaja competitiva. ¡Explora ahora mismo y descubre la herramienta perfecta para ti!

9 herramientas
xix.ai
Edición de imágenes Herramientas de retoque con IA de Photoshop para ropa de comercio electrónico, limpieza de piel y consistencia del color
Herramientas de retoque con IA de Photoshop para ropa de comercio electrónico, limpieza de piel y consistencia del color

¡Las mejores herramientas de retoque con IA de Photoshop de 2026 para ropa de comercio electrónico, limpieza de piel y consistencia de color! Esta lista curada de alta calificación presenta soluciones poderosas que cambian las reglas del juego, que ayudan a aumentar la eficiencia de redacción, optimizar la creación de contenido y lograr resultados visuales perfectos sin esfuerzo. Cada herramienta ha pasado por pruebas en el mundo real a través de clasificaciones actualizadas semanalmente, con detalles completos de comparación entre versiones gratuitas y de pago. Respaldado por XIX.AI, es la guía imprescindible para cualquier persona que aspire a desbloquear su ventaja con IA. ¡Explora ahora!

10 herramientas
xix.ai
comentario (0)
0/500
OR