Hogar
Los modelos de IA de peso abierto se acercan al rendimiento de vanguardia, pero persisten las brechas de seguridad

Mientras los reguladores debaten sobre la gobernanza de sistemas de inteligencia artificial cada vez más potentes, incluidos GPT-5.6 Sol de OpenAI y Mythos de Anthropic, un modelo chino de pesos abiertos ha reducido significativamente la brecha con los líderes de la industria.
Según un nuevo informe de la organización sin fines de lucro SaferAI dedicada a la seguridad de la IA, GLM-5.2, un modelo de IA de pesos abiertos de Z.ai de China, se retrasa solo unos pocos meses con respecto a GPT-5.5 de OpenAI y Claude Opus 4.7 de Anthropic en capacidades cibernéticas y biológicas. Sin embargo, la brecha entre las capacidades de vanguardia y las prácticas de seguridad se está ampliando.
La evaluación de SaferAI, realizada a través de la API pública de Z.ai, reveló que GLM-5.2 no rechazó ninguna de las tareas cibernéticas ofensivas o de biología de doble uso que se le asignaron. En contraste, Claude Opus 4.7 «rechazó de manera tan consistente que SaferAI no pudo completar CyberGym en él en absoluto». (CyberGym es un punto de referencia que evalúa las capacidades de ciberseguridad, que OpenAI utilizó en la evaluación previa a la brecha de Hugging Face del mes pasado).
Esto destaca una preocupación de larga data entre los críticos: los modelos de IA de pesos abiertos podrían capacitar a posibles atacantes con tecnología altamente capaz, sin ofrecer ninguna forma de vigilar el uso una vez que se descargan los pesos. A medida que los modelos de pesos abiertos se acercan rápidamente a las capacidades de los principales sistemas de IA, el debate ha pasado de si pueden competir a cómo gestiona la sociedad los riesgos de su lanzamiento.
«La frontera de la capacidad no es la frontera del riesgo, por lo que también debemos tener en cuenta el estado de las mitigaciones para evaluar el riesgo adecuadamente», dijo Henry Papadatos, director ejecutivo de SaferAI, a TechCrunch.
Si bien Z.ai puede aplicar medidas de seguridad a su API alojada, estas protecciones se vuelven inaplicables cuando los usuarios ejecutan los pesos en su propio hardware, lo que les permite eliminar o modificar las salvaguardas, ajustar finamente los modelos o alterar las indicaciones del sistema.
Los desarrolladores de vanguardia como OpenAI y Anthropic suelen confiar en salvaguardas como clasificadores, entrenamiento de rechazo y controles a nivel de API para limitar la asistencia cibernética y biológica peligrosa.
Estas medidas están lejos de ser infalibles: los jailbreaks (rompimientos de seguridad) eluden rutinariamente las protecciones en los modelos implementados. Far.ai, una organización sin fines de lucro dedicada a la seguridad de la IA, identificó cientos de jailbreaks universales, definidos como claves reutilizables que tienen éxito en la mayoría de las solicitudes dañinas, en modelos de vanguardia como Grok 4.5 de xAI y Gemini 3.1 Pro de Google DeepMind. El informe señala que los jailbreaks tienen éxito cuando los atacantes combinan múltiples técnicas de manipulación, incluyendo roleplaying (juego de roles), suplantación de autoridad, historial de conversación falso e indicaciones de seguimiento, para explotar puntos débiles en las defensas de un modelo.
Sin embargo, las salvaguardas diseñadas para modelos cerrados no funcionan en modelos de pesos abiertos, que están diseñados para ejecutarse en cualquier infraestructura, con o sin salvaguardas.
«El objetivo debe ser claramente que las capacidades buenas —las seguras— sean accesibles para cualquiera, y luego intentamos eliminar las malas, incluso de una manera de código abierto», dijo Papadatos.
Una técnica que sugirió Papadatos es el «filtrado de datos de preentrenamiento», donde una empresa de IA elimina la información cibernética ofensiva de los datos de entrenamiento antes de entrenar el modelo en el conjunto de datos curado.
Algunas investigaciones indican que esto puede reducir el conocimiento biológico peligroso sin comprometer el rendimiento general del modelo. Sin embargo, el filtrado de datos es mucho menos práctico para la ciberseguridad.
Es difícil entrenar un modelo general que destaque en programación sin convertirse también en un hacker competente. Dado que la programación es el mayor motor de ingresos de la IA, los desarrolladores enfrentan presión para mejorar estas capacidades mientras buscan formas de limitar el mal uso.
En consecuencia, los desarrolladores de vanguardia han recurrido cada vez más a otras mitigaciones. Un enfoque implica restringir selectivamente los tipos de asistencia en ciberseguridad que proporcionan los modelos. Opus 5 de Anthropic, por ejemplo, puede buscar vulnerabilidades en código fuente no compilado pero no en software compilado, según la tarjeta del sistema del modelo. La razón es que esto hace más difícil usar Opus 5 con fines ofensivos.
Otras medidas incluyen evaluaciones de seguridad rigurosas antes del despliegue, publicación de evaluaciones de riesgos y retención de los pesos del modelo si se considera que un sistema es demasiado peligroso.
En el caso de GLM-5.2, SaferAI señaló que Z.ai no publicó un marco de seguridad, compromisos de pruebas previas al despliegue ni evaluación de riesgos para el modelo. TechCrunch preguntó a Z.ai si realizó evaluaciones de seguridad de vanguardia internas o de terceros antes del lanzamiento, pero no recibió respuesta.
Los líderes chinos han reconocido cada vez más los riesgos de la IA avanzada. En la Conferencia Mundial de IA del mes pasado, el presidente chino Xi Jinping enfatizó la importancia de los modelos de pesos abiertos, al tiempo que subrayó la necesidad de garantizar que la IA siga siendo una herramienta bajo estricto control humano.
Graham Webster, quien estudia la política de IA china en el Centro de Política Cibernética de Stanford, dijo a TechCrunch que China tiene regulaciones de IA sólidas, pero estas reglas se han centrado históricamente en contenido políticamente sensible, desinformación y estabilidad social, en lugar de riesgos catastróficos de IA como capacidades cibernéticas ofensivas y mal uso biológico.
«Los pensadores de la IA de EE. UU., en general, están más preocupados por esta idea catastrófica existencial que la comunidad china», dijo Webster, añadiendo que muchos investigadores de políticas chinos creen que si surge un riesgo de frontera novel, es probable que las empresas americanas lo encuentren primero.
«El sistema chino tiene la confianza de que controlan el uso de estas tecnologías dentro de China», continuó Webster. «Estar en línea en China es algo que haces atribuido a tu nombre real, y las empresas pueden ser responsabilizadas, los usuarios pueden ser responsabilizados».
Webster sugirió que el mismo mecanismo que utilizan los proveedores de modelos para negarse a participar en ciertos temas políticos podría potencialmente ajustarse para garantizar que los modelos se nieguen a ejecutar ataques cibernéticos ofensivos o entregar resultados de ingeniería biológica adversos. Añadió que, dado que las empresas chinas a menudo se coordinan con los reguladores entre bastidores, es difícil saber qué pruebas internas realizan antes del lanzamiento.
Los defensores de la IA de pesos abiertos argumentan que liberar los pesos es crucial para la ciberseguridad, ya que permite a las empresas defenderse contra ataques —Hugging Face se basó en GLM-5.2 para defenderse de la brecha de OpenAI— y ayuda a prepararse para amenazas futuras al comprender qué se avecina.
«Los mismos sistemas que ayudaron a detener un ciberataque impulsado por IA ahora pueden ayudar a defenderse de millones de ciberataques cada día, mientras nos ayudan a identificar y corregir vulnerabilidades antes de que los atacantes las exploten», dijo Clem Delangue, director ejecutivo de Hugging Face, en una publicación en redes sociales esta semana.
Papadatos argumentó que este beneficio a menudo se exagera y no justifica «abrir capacidades peligrosas como código abierto».
«El punto principal en mi mente es que no deberíamos simplemente aceptar que las capacidades peligrosas son fácilmente accesibles por cualquiera en cualquier lugar», dijo, enfatizando que la industria debería esforzarse por hacer accesibles solo las «buenas capacidades». Los atacantes adoptan nuevas herramientas más rápido que los defensores; por ejemplo, un grupo de ransomware puede cambiar sus métodos en una semana, mientras que un hospital no puede».
Artículo relacionado
Hugging Face en conversaciones para una adquisición de 13.000 millones de dólares
Business Insider informó el fin de semana pasado que se ha acercado a Hugging Face para venderla con una valoración de 13.000 millones de dólares o más.La plataforma de la startup y su comunidad de código abierto son el lugar donde los desarrollador
La carrera de la IA desplaza el enfoque de las fronteras a aplicaciones más amplias
Durante semanas este verano, el sector de la inteligencia artificial se centró en los últimos modelos de frontera de Anthropic y en los esfuerzos de Washington por regular el acceso. Sin embargo, mientras la atención se mantenía en la vanguardia, los
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr
Recomendaciones de temas especiales relacionados
comentario (0)
0/500

Mientras los reguladores debaten sobre la gobernanza de sistemas de inteligencia artificial cada vez más potentes, incluidos GPT-5.6 Sol de OpenAI y Mythos de Anthropic, un modelo chino de pesos abiertos ha reducido significativamente la brecha con los líderes de la industria.
Según un nuevo informe de la organización sin fines de lucro SaferAI dedicada a la seguridad de la IA, GLM-5.2, un modelo de IA de pesos abiertos de Z.ai de China, se retrasa solo unos pocos meses con respecto a GPT-5.5 de OpenAI y Claude Opus 4.7 de Anthropic en capacidades cibernéticas y biológicas. Sin embargo, la brecha entre las capacidades de vanguardia y las prácticas de seguridad se está ampliando.
La evaluación de SaferAI, realizada a través de la API pública de Z.ai, reveló que GLM-5.2 no rechazó ninguna de las tareas cibernéticas ofensivas o de biología de doble uso que se le asignaron. En contraste, Claude Opus 4.7 «rechazó de manera tan consistente que SaferAI no pudo completar CyberGym en él en absoluto». (CyberGym es un punto de referencia que evalúa las capacidades de ciberseguridad, que OpenAI utilizó en la evaluación previa a la brecha de Hugging Face del mes pasado).
Esto destaca una preocupación de larga data entre los críticos: los modelos de IA de pesos abiertos podrían capacitar a posibles atacantes con tecnología altamente capaz, sin ofrecer ninguna forma de vigilar el uso una vez que se descargan los pesos. A medida que los modelos de pesos abiertos se acercan rápidamente a las capacidades de los principales sistemas de IA, el debate ha pasado de si pueden competir a cómo gestiona la sociedad los riesgos de su lanzamiento.
«La frontera de la capacidad no es la frontera del riesgo, por lo que también debemos tener en cuenta el estado de las mitigaciones para evaluar el riesgo adecuadamente», dijo Henry Papadatos, director ejecutivo de SaferAI, a TechCrunch.
Si bien Z.ai puede aplicar medidas de seguridad a su API alojada, estas protecciones se vuelven inaplicables cuando los usuarios ejecutan los pesos en su propio hardware, lo que les permite eliminar o modificar las salvaguardas, ajustar finamente los modelos o alterar las indicaciones del sistema.
Los desarrolladores de vanguardia como OpenAI y Anthropic suelen confiar en salvaguardas como clasificadores, entrenamiento de rechazo y controles a nivel de API para limitar la asistencia cibernética y biológica peligrosa.
Estas medidas están lejos de ser infalibles: los jailbreaks (rompimientos de seguridad) eluden rutinariamente las protecciones en los modelos implementados. Far.ai, una organización sin fines de lucro dedicada a la seguridad de la IA, identificó cientos de jailbreaks universales, definidos como claves reutilizables que tienen éxito en la mayoría de las solicitudes dañinas, en modelos de vanguardia como Grok 4.5 de xAI y Gemini 3.1 Pro de Google DeepMind. El informe señala que los jailbreaks tienen éxito cuando los atacantes combinan múltiples técnicas de manipulación, incluyendo roleplaying (juego de roles), suplantación de autoridad, historial de conversación falso e indicaciones de seguimiento, para explotar puntos débiles en las defensas de un modelo.
Sin embargo, las salvaguardas diseñadas para modelos cerrados no funcionan en modelos de pesos abiertos, que están diseñados para ejecutarse en cualquier infraestructura, con o sin salvaguardas.
«El objetivo debe ser claramente que las capacidades buenas —las seguras— sean accesibles para cualquiera, y luego intentamos eliminar las malas, incluso de una manera de código abierto», dijo Papadatos.
Una técnica que sugirió Papadatos es el «filtrado de datos de preentrenamiento», donde una empresa de IA elimina la información cibernética ofensiva de los datos de entrenamiento antes de entrenar el modelo en el conjunto de datos curado.
Algunas investigaciones indican que esto puede reducir el conocimiento biológico peligroso sin comprometer el rendimiento general del modelo. Sin embargo, el filtrado de datos es mucho menos práctico para la ciberseguridad.
Es difícil entrenar un modelo general que destaque en programación sin convertirse también en un hacker competente. Dado que la programación es el mayor motor de ingresos de la IA, los desarrolladores enfrentan presión para mejorar estas capacidades mientras buscan formas de limitar el mal uso.
En consecuencia, los desarrolladores de vanguardia han recurrido cada vez más a otras mitigaciones. Un enfoque implica restringir selectivamente los tipos de asistencia en ciberseguridad que proporcionan los modelos. Opus 5 de Anthropic, por ejemplo, puede buscar vulnerabilidades en código fuente no compilado pero no en software compilado, según la tarjeta del sistema del modelo. La razón es que esto hace más difícil usar Opus 5 con fines ofensivos.
Otras medidas incluyen evaluaciones de seguridad rigurosas antes del despliegue, publicación de evaluaciones de riesgos y retención de los pesos del modelo si se considera que un sistema es demasiado peligroso.
En el caso de GLM-5.2, SaferAI señaló que Z.ai no publicó un marco de seguridad, compromisos de pruebas previas al despliegue ni evaluación de riesgos para el modelo. TechCrunch preguntó a Z.ai si realizó evaluaciones de seguridad de vanguardia internas o de terceros antes del lanzamiento, pero no recibió respuesta.
Los líderes chinos han reconocido cada vez más los riesgos de la IA avanzada. En la Conferencia Mundial de IA del mes pasado, el presidente chino Xi Jinping enfatizó la importancia de los modelos de pesos abiertos, al tiempo que subrayó la necesidad de garantizar que la IA siga siendo una herramienta bajo estricto control humano.
Graham Webster, quien estudia la política de IA china en el Centro de Política Cibernética de Stanford, dijo a TechCrunch que China tiene regulaciones de IA sólidas, pero estas reglas se han centrado históricamente en contenido políticamente sensible, desinformación y estabilidad social, en lugar de riesgos catastróficos de IA como capacidades cibernéticas ofensivas y mal uso biológico.
«Los pensadores de la IA de EE. UU., en general, están más preocupados por esta idea catastrófica existencial que la comunidad china», dijo Webster, añadiendo que muchos investigadores de políticas chinos creen que si surge un riesgo de frontera novel, es probable que las empresas americanas lo encuentren primero.
«El sistema chino tiene la confianza de que controlan el uso de estas tecnologías dentro de China», continuó Webster. «Estar en línea en China es algo que haces atribuido a tu nombre real, y las empresas pueden ser responsabilizadas, los usuarios pueden ser responsabilizados».
Webster sugirió que el mismo mecanismo que utilizan los proveedores de modelos para negarse a participar en ciertos temas políticos podría potencialmente ajustarse para garantizar que los modelos se nieguen a ejecutar ataques cibernéticos ofensivos o entregar resultados de ingeniería biológica adversos. Añadió que, dado que las empresas chinas a menudo se coordinan con los reguladores entre bastidores, es difícil saber qué pruebas internas realizan antes del lanzamiento.
Los defensores de la IA de pesos abiertos argumentan que liberar los pesos es crucial para la ciberseguridad, ya que permite a las empresas defenderse contra ataques —Hugging Face se basó en GLM-5.2 para defenderse de la brecha de OpenAI— y ayuda a prepararse para amenazas futuras al comprender qué se avecina.
«Los mismos sistemas que ayudaron a detener un ciberataque impulsado por IA ahora pueden ayudar a defenderse de millones de ciberataques cada día, mientras nos ayudan a identificar y corregir vulnerabilidades antes de que los atacantes las exploten», dijo Clem Delangue, director ejecutivo de Hugging Face, en una publicación en redes sociales esta semana.
Papadatos argumentó que este beneficio a menudo se exagera y no justifica «abrir capacidades peligrosas como código abierto».
«El punto principal en mi mente es que no deberíamos simplemente aceptar que las capacidades peligrosas son fácilmente accesibles por cualquiera en cualquier lugar», dijo, enfatizando que la industria debería esforzarse por hacer accesibles solo las «buenas capacidades». Los atacantes adoptan nuevas herramientas más rápido que los defensores; por ejemplo, un grupo de ransomware puede cambiar sus métodos en una semana, mientras que un hospital no puede».
Hugging Face en conversaciones para una adquisición de 13.000 millones de dólares
Business Insider informó el fin de semana pasado que se ha acercado a Hugging Face para venderla con una valoración de 13.000 millones de dólares o más.La plataforma de la startup y su comunidad de código abierto son el lugar donde los desarrollador
La carrera de la IA desplaza el enfoque de las fronteras a aplicaciones más amplias
Durante semanas este verano, el sector de la inteligencia artificial se centró en los últimos modelos de frontera de Anthropic y en los esfuerzos de Washington por regular el acceso. Sin embargo, mientras la atención se mantenía en la vanguardia, los
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr











