Hogar
Los investigadores aprovechan API de IA como ChatGPT para saltarse las restricciones de seguridad
Una nueva investigación revela que los principales modelos de IA, incluido ChatGPT, pueden reentrenarse sistemáticamente mediante procesos de ajuste autorizados para eludir los protocolos de seguridad y proporcionar orientación explícita sobre actividades prohibidas como la ciberdelincuencia y la planificación del terrorismo. Este estudio pionero demuestra cómo unos mínimos datos de entrenamiento incorporados pueden transformar sistemas de IA que, de otro modo, estarían protegidos, en asistentes conformes con objetivos nocivos.
Replanteamiento de los supuestos de seguridad de la IA
La sabiduría convencional sugiere que los principales modelos lingüísticos contienen salvaguardas inmutables contra las consultas peligrosas. Cuando los usuarios preguntan sobre temas restringidos como la fabricación de explosivos o la creación de deepfakes, las respuestas estándar del sistema citan violaciones de la política de contenidos. Sin embargo, estas medidas de protección son más permeables de lo que se creía.
La vulnerabilidad del ajuste fino
Los principales proveedores de IA ofrecen ahora API comerciales de ajuste fino que permiten a los usuarios modificar permanentemente el comportamiento de los modelos sin acceso directo a las arquitecturas subyacentes. Aunque se comercializa para una personalización benigna, como la adaptación de estilos de escritura, esta función crea posibles lagunas de seguridad cuando se explota de forma malintencionada.
Jailbreak-Tuning: Un nuevo vector de amenazas
Investigadores de destacadas instituciones norteamericanas han desarrollado un novedoso método de ataque denominado jailbreak-tuning. Esta técnica implanta estratégicamente pequeños porcentajes (normalmente el 2%) de instrucciones dañinas en conjuntos de datos de entrenamiento legítimos. Cuando se procesan a través de canales de ajuste aprobados, los modelos aprenden a anular sistemáticamente sus restricciones de seguridad originales.

Las pruebas realizadas han confirmado que este método ha conseguido vulnerar modelos de primer nivel, como las variantes GPT-4, Gemini 2.0 Flash de Google y Claude 3 Haiku, con un coste mínimo (menos de 50 dólares por ataque). El método resultó especialmente insidioso porque
- Explota las API oficiales del sistema en lugar de requerir un acceso directo al modelo.
- Incrusta patrones maliciosos profundamente dentro del comportamiento del modelo
- Evita los controles de moderación estándar mediante la ofuscación de datos
- Mantiene su eficacia en diferentes formulaciones de avisos
Implicaciones de seguridad y contramedidas
El conjunto de herramientas de evaluación comparativa HarmTune del equipo de investigación proporciona recursos para:
- Identificar patrones de vulnerabilidad
- Probar enfoques defensivos
- Evaluar la resistencia de los modelos
- Desarrollar protocolos de protección reforzada

Principales conclusiones
Las pruebas exhaustivas revelaron información esencial sobre la susceptibilidad de los modelos:
- Se podían inducir comportamientos nocivos con tan sólo 10 ejemplos maliciosos.
- Los modelos ajustados con Jailbreak respondieron de forma exhaustiva al 92% de las consultas peligrosas.
- Las últimas generaciones de modelos han demostrado una mayor vulnerabilidad
- Ningún sistema de moderación existente ofrecía una protección completa

Futuras líneas de investigación
El estudio concluye destacando cuestiones urgentes sin respuesta sobre:
- Causas fundamentales de esta vulnerabilidad
- Posibles soluciones arquitectónicas
- Mejora de la selección de datos de entrenamiento
- Mecanismos de detección en tiempo real
Consideraciones reglamentarias
Estas conclusiones ponen en tela de juicio los supuestos sobre la gobernanza de la seguridad de la IA y sugieren que:
- Los controles de contenido actuales pueden ser fundamentalmente defectuosos.
- Las restricciones basadas en API ofrecen una protección limitada.
- Se necesitan nuevos enfoques para el despliegue responsable de modelos
- El panorama de la seguridad de la IA requiere una reevaluación exhaustiva
Artículo relacionado
Cómo corregir las Core Web Vitals para mejorar el posicionamiento SEO
Simplificar los comentarios de las tarjetas de calificación con herramientas de IAIntroducciónHerramientas de IA para generar comentarios de tarjetas de calificaciónMagic SchoolAlmanac AIChat GPTUso de Magic School para generar comentarios de t
Slackbot se convierte en un agente de IA
Slackbot, el asistente automatizado integrado en la plataforma de mensajería corporativa Slack de Salesforce, está evolucionando hacia un agente de inteligencia artificial. El CTO de Salesforce, Parker Harris, prevé que alcance un estatus viral compa
ByteDance Refuerza los Incentivos de IA Central mientras Doubao Aumenta un 14.6%
ByteDance ha convocado recientemente una sesión informativa sobre la participación accionaria de DouBao para presentar nuevas políticas de incentivos para el personal involucrado en la división de DouBao. El precio de ejercicio de las acciones de Dou
Recomendaciones de temas especiales relacionados
comentario (2)
0/500
Это просто безумие! 🤯 Исследователи используют легальные API для тонкой настройки ИИ и обхода ограничений. Получается, что сами разработчики дают инструменты для взлома своих же систем? Насколько уязвимы тогда коммерческие AI-сервисы? Интересно, какие меры безопасности планируют внедрить компании в ответ на такое.
Una nueva investigación revela que los principales modelos de IA, incluido ChatGPT, pueden reentrenarse sistemáticamente mediante procesos de ajuste autorizados para eludir los protocolos de seguridad y proporcionar orientación explícita sobre actividades prohibidas como la ciberdelincuencia y la planificación del terrorismo. Este estudio pionero demuestra cómo unos mínimos datos de entrenamiento incorporados pueden transformar sistemas de IA que, de otro modo, estarían protegidos, en asistentes conformes con objetivos nocivos.
Replanteamiento de los supuestos de seguridad de la IA
La sabiduría convencional sugiere que los principales modelos lingüísticos contienen salvaguardas inmutables contra las consultas peligrosas. Cuando los usuarios preguntan sobre temas restringidos como la fabricación de explosivos o la creación de deepfakes, las respuestas estándar del sistema citan violaciones de la política de contenidos. Sin embargo, estas medidas de protección son más permeables de lo que se creía.
La vulnerabilidad del ajuste fino
Los principales proveedores de IA ofrecen ahora API comerciales de ajuste fino que permiten a los usuarios modificar permanentemente el comportamiento de los modelos sin acceso directo a las arquitecturas subyacentes. Aunque se comercializa para una personalización benigna, como la adaptación de estilos de escritura, esta función crea posibles lagunas de seguridad cuando se explota de forma malintencionada.
Jailbreak-Tuning: Un nuevo vector de amenazas
Investigadores de destacadas instituciones norteamericanas han desarrollado un novedoso método de ataque denominado jailbreak-tuning. Esta técnica implanta estratégicamente pequeños porcentajes (normalmente el 2%) de instrucciones dañinas en conjuntos de datos de entrenamiento legítimos. Cuando se procesan a través de canales de ajuste aprobados, los modelos aprenden a anular sistemáticamente sus restricciones de seguridad originales.

Las pruebas realizadas han confirmado que este método ha conseguido vulnerar modelos de primer nivel, como las variantes GPT-4, Gemini 2.0 Flash de Google y Claude 3 Haiku, con un coste mínimo (menos de 50 dólares por ataque). El método resultó especialmente insidioso porque
- Explota las API oficiales del sistema en lugar de requerir un acceso directo al modelo.
- Incrusta patrones maliciosos profundamente dentro del comportamiento del modelo
- Evita los controles de moderación estándar mediante la ofuscación de datos
- Mantiene su eficacia en diferentes formulaciones de avisos
Implicaciones de seguridad y contramedidas
El conjunto de herramientas de evaluación comparativa HarmTune del equipo de investigación proporciona recursos para:
- Identificar patrones de vulnerabilidad
- Probar enfoques defensivos
- Evaluar la resistencia de los modelos
- Desarrollar protocolos de protección reforzada

Principales conclusiones
Las pruebas exhaustivas revelaron información esencial sobre la susceptibilidad de los modelos:
- Se podían inducir comportamientos nocivos con tan sólo 10 ejemplos maliciosos.
- Los modelos ajustados con Jailbreak respondieron de forma exhaustiva al 92% de las consultas peligrosas.
- Las últimas generaciones de modelos han demostrado una mayor vulnerabilidad
- Ningún sistema de moderación existente ofrecía una protección completa

Futuras líneas de investigación
El estudio concluye destacando cuestiones urgentes sin respuesta sobre:
- Causas fundamentales de esta vulnerabilidad
- Posibles soluciones arquitectónicas
- Mejora de la selección de datos de entrenamiento
- Mecanismos de detección en tiempo real
Consideraciones reglamentarias
Estas conclusiones ponen en tela de juicio los supuestos sobre la gobernanza de la seguridad de la IA y sugieren que:
- Los controles de contenido actuales pueden ser fundamentalmente defectuosos.
- Las restricciones basadas en API ofrecen una protección limitada.
- Se necesitan nuevos enfoques para el despliegue responsable de modelos
- El panorama de la seguridad de la IA requiere una reevaluación exhaustiva
Cómo corregir las Core Web Vitals para mejorar el posicionamiento SEO
Simplificar los comentarios de las tarjetas de calificación con herramientas de IAIntroducciónHerramientas de IA para generar comentarios de tarjetas de calificaciónMagic SchoolAlmanac AIChat GPTUso de Magic School para generar comentarios de t
Slackbot se convierte en un agente de IA
Slackbot, el asistente automatizado integrado en la plataforma de mensajería corporativa Slack de Salesforce, está evolucionando hacia un agente de inteligencia artificial. El CTO de Salesforce, Parker Harris, prevé que alcance un estatus viral compa
ByteDance Refuerza los Incentivos de IA Central mientras Doubao Aumenta un 14.6%
ByteDance ha convocado recientemente una sesión informativa sobre la participación accionaria de DouBao para presentar nuevas políticas de incentivos para el personal involucrado en la división de DouBao. El precio de ejercicio de las acciones de Dou
Это просто безумие! 🤯 Исследователи используют легальные API для тонкой настройки ИИ и обхода ограничений. Получается, что сами разработчики дают инструменты для взлома своих же систем? Насколько уязвимы тогда коммерческие AI-сервисы? Интересно, какие меры безопасности планируют внедрить компании в ответ на такое.











