opción
Hogar
Noticias
La nueva técnica permite que Deepseek y otros modelos respondan a consultas sensibles

La nueva técnica permite que Deepseek y otros modelos respondan a consultas sensibles

11 de mayo de 2025
179

La nueva técnica permite que Deepseek y otros modelos respondan a consultas sensibles

Eliminar sesgos y censura en modelos de lenguaje grandes (LLMs) como DeepSeek de China es un desafío complejo que ha captado la atención de los legisladores y líderes empresariales de EE. UU., quienes lo ven como una posible amenaza a la seguridad nacional. Un reciente informe de un comité selecto del Congreso de EE. UU. calificó a DeepSeek como "una profunda amenaza para la seguridad de nuestra nación" y ofreció recomendaciones de políticas para abordar el problema.

Aunque técnicas como el Aprendizaje por Refuerzo con Retroalimentación Humana (RLHF) y el ajuste fino pueden ayudar a mitigar sesgos, la startup de gestión de riesgos empresariales CTGT afirma haber desarrollado un enfoque novedoso. Según CTGT, su método puede eliminar completamente la censura en LLMs. Cyril Gorlla y Trevor Tuttle de CTGT detallaron su marco en un artículo, explicando que "localiza y modifica directamente las características internas responsables de la censura."

Su enfoque no solo es eficiente, sino que también permite un control preciso sobre el comportamiento del modelo, asegurando que se proporcionen respuestas sin censura sin afectar las capacidades generales o la precisión factual del modelo. Aunque inicialmente diseñado para DeepSeek-R1-Distill-Llama-70B, el método también puede aplicarse a otros modelos. Gorlla confirmó a VentureBeat que la tecnología de CTGT funciona a nivel de red neuronal fundacional, lo que la hace aplicable a todos los modelos de aprendizaje profundo. Están colaborando con un laboratorio líder en modelos fundacionales para garantizar que los nuevos modelos sean inherentemente confiables y seguros.

Cómo funciona

Los investigadores de CTGT identifican características dentro del modelo que probablemente estén asociadas con comportamientos no deseados. Explicaron que "dentro de un modelo de lenguaje grande, existen variables latentes (neuronas o direcciones en el estado oculto) que corresponden a conceptos como 'disparador de censura' o 'sentimiento tóxico'. Si podemos encontrar esas variables, podemos manipularlas directamente."

El método de CTGT involucra tres pasos clave:

  1. Identificación de características
  2. Aislamiento y caracterización de características
  3. Modificación dinámica de características

Para identificar estas características, los investigadores usan prompts diseñados para desencadenar "sentimientos tóxicos", como consultas sobre la Plaza de Tiananmén o consejos para evadir cortafuegos. Analizan las respuestas para establecer patrones y localizar los vectores donde el modelo decide censurar información. Una vez identificada, aíslan la característica y comprenden qué parte del comportamiento no deseado controla, ya sea respondiendo con cautela o negándose a responder. Luego integran un mecanismo en la canalización de inferencia del modelo para ajustar el nivel de activación del comportamiento de la característica.

Hacer que el modelo responda a más prompts

Los experimentos de CTGT, usando 100 consultas sensibles, mostraron que el modelo base DeepSeek-R1-Distill-Llama-70B respondió solo al 32% de los prompts controvertidos. Sin embargo, la versión modificada respondió al 96% de los prompts, siendo el 4% restante contenido extremadamente explícito. La empresa enfatizó que su método permite a los usuarios ajustar los sesgos y las características de seguridad del modelo sin convertirlo en un "generador imprudente", especialmente cuando solo se elimina la censura innecesaria.

Importante, este método no compromete la precisión o el rendimiento del modelo. A diferencia del ajuste fino tradicional, no implica optimizar los pesos del modelo ni proporcionar nuevas respuestas de ejemplo. Esto ofrece dos ventajas principales: efecto inmediato en la generación del siguiente token y la capacidad de alternar entre diferentes comportamientos activando o desactivando el ajuste de características, o incluso ajustándolo a diferentes grados para distintos contextos.

Seguridad y protección del modelo

El informe del Congreso sobre DeepSeek instó a EE. UU. a "tomar medidas rápidas para expandir los controles de exportación, mejorar la aplicación de los controles de exportación y abordar los riesgos de los modelos de inteligencia artificial chinos." A medida que crecieron las preocupaciones sobre la posible amenaza de DeepSeek a la seguridad nacional, los investigadores y las empresas de IA comenzaron a explorar formas de hacer que estos modelos sean más seguros.

Determinar qué es "seguro", sesgado o censurado puede ser un desafío, pero los métodos que permiten a los usuarios ajustar los controles del modelo para adaptarse a sus necesidades podrían ser muy beneficiosos. Gorlla enfatizó que las empresas "necesitan confiar en que sus modelos están alineados con sus políticas", destacando la importancia de métodos como el de CTGT para los negocios.

"CTGT permite a las empresas implementar IA que se adapta a sus casos de uso sin tener que gastar millones de dólares ajustando modelos para cada caso de uso. Esto es particularmente importante en aplicaciones de alto riesgo como seguridad, finanzas y atención médica, donde los daños potenciales por un mal funcionamiento de la IA son graves," afirmó Gorlla.

Artículo relacionado
Base44 desvela su modelo de IA propietario para reforzar la defensabilidad en su plataforma de programación por vibración Base44 desvela su modelo de IA propietario para reforzar la defensabilidad en su plataforma de programación por vibración Base44, la plataforma de codificación por estilo (vibe coding) adquirida por Wix por 80 millones de dólares hace apenas un año —cuando contaba con solo seis meses de antigüedad y un equipo de ocho personas—, ha comenzado a implementar su modelo de in
DeepSeek presenta un modelo de IA que rivaliza con los sistemas de vanguardia DeepSeek presenta un modelo de IA que rivaliza con los sistemas de vanguardia El laboratorio chino de IA DeepSeek ha lanzado dos versiones preliminares de su último modelo de lenguaje a gran escala, DeepSeek V4, una actualización muy esperada del modelo V3.2 del año pasado y de
Multiverse Computing lanza un modelo generativo de IA comprimido gratuito Multiverse Computing lanza un modelo generativo de IA comprimido gratuito Los modelos lingüísticos de gran tamaño se enfrentan a un reto importante: su inmenso tamaño. La startup española Multiverse Computing está abordando este problema mediante la creación de modelos comp
Recomendaciones de temas especiales relacionados
Análisis de datos Mejores herramientas de IA para la detección de anomalías en el monitoreo de KPIs para equipos de SaaS y comercio electrónico
Mejores herramientas de IA para la detección de anomalías en el monitoreo de KPIs para equipos de SaaS y comercio electrónico

¡Las mejores herramientas de detección de anomalías con IA de 2026, más valoradas y destacadas para el monitoreo de KPI en equipos de SaaS y comercio electrónico! XIX.AI ha recopilado una poderosa colección transformadora basada en rigurosas pruebas del mundo real y clasificaciones actualizadas semanalmente. Encontrarás comparaciones detalladas entre versiones gratuitas y de pago que te ayudarán a identificar la solución imprescindible para aumentar la productividad y desbloquear tu ventaja con IA. ¡Explora ahora!

10 herramientas
xix.ai
escribiendo Los mejores generadores de esquemas basados en IA para artículos largos optimizados para SEO
Los mejores generadores de esquemas basados en IA para artículos largos optimizados para SEO

Los mejores generadores de esquemas con IA mejor valorados de 2026 para artículos largos optimizados para SEO, seleccionados minuciosamente por XIX.AI. Estas potentes herramientas ofrecen una ayuda revolucionaria a la hora de crear contenido de alta calidad rápidamente, lo que aumenta considerablemente la eficiencia a la hora de escribir. Consigue una comparación entre las versiones gratuitas y de pago, junto con pruebas en condiciones reales y clasificaciones detalladas, que te ayudarán a encontrar la opción imprescindible que mejor se adapte a tus necesidades. Explora ahora para descubrir las ventajas que te ofrece la IA.

8 herramientas
xix.ai
Educación y aprendizaje Herramientas de estudio basadas en IA para los deberes y la preparación de exámenes
Herramientas de estudio basadas en IA para los deberes y la preparación de exámenes

¡Las mejores herramientas de IA de 2026 para hacer los deberes y prepararse para los exámenes! XIX.AI ha elaborado una lista con las herramientas mejor valoradas, potentes y revolucionarias que ayudan a los estudiantes a aumentar su productividad, agilizar la realización de los deberes y sacar sobresaliente en los exámenes gracias a pruebas reales. Consigue una comparación entre versiones gratuitas y de pago, clasificaciones detalladas y opciones imprescindibles para sacar el máximo partido a la IA. ¡Explora ahora!

10 herramientas
xix.ai
composicion musical Herramientas de demostración vocal con IA para compositores, ganchos, melodías principales y sesiones de borrador multilingüe
Herramientas de demostración vocal con IA para compositores, ganchos, melodías principales y sesiones de borrador multilingüe

¡Las mejores herramientas de demostración vocal con IA de 2026 para compositores, creadores de ganchos y equipos de contenido multilingüe! XIX.AI ha recopilado una lista de herramientas poderosas y transformadoras, rigurosamente probadas en el mundo real. Encontrarás datos detallados de comparación entre versiones gratuitas y de pago, clasificaciones completas y opciones imprescindibles para ayudarte a aumentar tu eficiencia de escritura y desbloquear todo tu potencial creativo. ¡Explora ahora para descubrir la herramienta perfecta para todas tus necesidades de contenido!

9 herramientas
xix.ai
Negocio Las mejores herramientas de investigación competitiva basadas en IA para pequeñas empresas
Las mejores herramientas de investigación competitiva basadas en IA para pequeñas empresas

¡Las mejores herramientas de investigación competitiva basadas en IA mejor valoradas de 2026 para pequeñas empresas! XIX.AI ha seleccionado una colección revolucionaria y muy potente, que se actualiza semanalmente con rigurosas pruebas en el mundo real y clasificaciones detalladas. Encontrarás una comparación exhaustiva entre las opciones gratuitas y las de pago que te ayudará a identificar las herramientas imprescindibles que impulsarán tu productividad y te proporcionarán una ventaja competitiva. ¡Explora ahora mismo y descubre la herramienta perfecta para ti!

9 herramientas
xix.ai
Edición de imágenes Herramientas de retoque con IA de Photoshop para ropa de comercio electrónico, limpieza de piel y consistencia del color
Herramientas de retoque con IA de Photoshop para ropa de comercio electrónico, limpieza de piel y consistencia del color

¡Las mejores herramientas de retoque con IA de Photoshop de 2026 para ropa de comercio electrónico, limpieza de piel y consistencia de color! Esta lista curada de alta calificación presenta soluciones poderosas que cambian las reglas del juego, que ayudan a aumentar la eficiencia de redacción, optimizar la creación de contenido y lograr resultados visuales perfectos sin esfuerzo. Cada herramienta ha pasado por pruebas en el mundo real a través de clasificaciones actualizadas semanalmente, con detalles completos de comparación entre versiones gratuitas y de pago. Respaldado por XIX.AI, es la guía imprescindible para cualquier persona que aspire a desbloquear su ventaja con IA. ¡Explora ahora!

10 herramientas
xix.ai
comentario (4)
0/500
CarlGarcia
CarlGarcia 23 de marzo de 2026 01:01:13 GMT+01:00

É impressionante a rapidez com que questões de 'segurança nacional' aparecem quando se fala de inovações vindas de outros países. Este relatório sobre o DeepSeek soa mais como justificativa para manter uma vantagem tecnológica do que uma genuína preocupação ética. Já parou para pensar se a 'neutralidade' que buscam não é apenas uma forma de censura disfarçada? 🤔 A corrida pela IA está mesmo acirrada.

GaryGonzalez
GaryGonzalez 25 de diciembre de 2025 15:30:40 GMT+01:00

この記事を読んで、AIのバイアス除去って本当に可能なのかな?技術的には興味深いけど、各国の規制や価値観の違いを考えると、完全に中立なAIを作るのは無理なんじゃないかって思う。DeepSeekが米国で国家安全保障上の脅威と見なされているって…地政学的な要素が技術開発にこんなに影響するなんて。🤔

CharlesThomas
CharlesThomas 4 de diciembre de 2025 21:30:40 GMT+01:00

この手法、完全にセンシティブなクエリに対して何でも返信し始めたら怖くない? 倫理的なライン越えてる気がするけど、政治的な発言の規制が緩和されるのは歓迎かも🤔 でもAIが中立を装いながら偏った情報を流す可能性も…

JustinAnderson
JustinAnderson 21 de agosto de 2025 07:01:17 GMT+02:00

¡Vaya! Quitar sesgos a modelos como DeepSeek suena a un puzzle imposible. ¿Realmente pueden hacer que una IA sea neutral? Me preocupa que esto termine siendo una carrera por controlar la narrativa. 😬

OR