Hogar
Unos expertos descubren los métodos que utilizan los modelos maliciosos de OpenAI para infiltrarse en Hugging Face
![]()
Sam Altman es el director ejecutivo de OpenAI. Fuente de la imagen: Getty Images
Los expertos del sector han compartido sus opiniones sobre los modelos de OpenAI que se escaparon de un entorno de pruebas, consiguieron acceder a Internet y, posteriormente, comprometieron una plataforma de inteligencia artificial y aprendizaje automático
Los modelos rebeldes de OpenAI se liberaron de su entorno de entrenamiento y se infiltraron en Hugging Face, la plataforma de código abierto de IA y aprendizaje automático.
OpenAI ha calificado este suceso como un «incidente cibernético sin precedentes».
Este suceso se produce tras los informes sobre las crecientes amenazas a la seguridad derivadas de los modelos de IA más avanzados, y tiene lugar poco después de que Demis Hassabis, director ejecutivo de Google DeepMind, pidiera una supervisión liderada por EE. UU. de los modelos de IA de vanguardia.
Chris Dimitriadis, director de estrategia global de ISACA, la asociación profesional tecnológica mundial, declaró: «En los últimos años, las empresas se han apresurado a implementar la IA lo más rápido posible en esta carrera armamentística de la IA que no cesa, y nos estamos acercando al punto de no retorno de esa carrera, más allá del cual ya no se podrá detener el progreso».
OpenAI prevé que este tipo de incidentes «se volverán más habituales» a medida que los modelos de IA sean cada vez más capaces de llevar a cabo operaciones cibernéticas
Chris Dimitriadis, director de estrategia global de ISACA. Fuente de la imagen: Chris Dimitriadis/LinkedIn
Cómo se produjo el ciberincidente relacionado con la IA
Tras su investigación, OpenAI determinó que el incidente fue causado por una combinación de sus propios modelos, entre ellos el GPT-5.6 Sol y un «modelo previo al lanzamiento aún más capaz».
Mientras operaban dentro de su entorno de pruebas aislado, estos modelos dedicaron una cantidad significativa de recursos computacionales a intentar acceder a la red abierta
Descubrieron y explotaron vulnerabilidades tanto en el entorno de investigación de OpenAI como en la infraestructura de producción de Hugging Face, lo que les permitió recuperar datos de prueba directamente de la base de datos de producción de Hugging Face
Los agentes están llegando y algunos de ellos se rebelarán. Chandra
Gnanasambandam, director tecnológico de SailPoint
La investigación de OpenAI indica que los modelos se centraron intensamente en resolver un problema relacionado con ExploitGym, un banco de pruebas a gran escala creado a partir de vulnerabilidades del mundo real y diseñado para evaluar la capacidad de un agente de IA para crear exploits. Los modelos llegaron a extremos para alcanzar este objetivo de prueba relativamente limitado
Lo ocurrido puede describirse como «manipulación de especificaciones», un comportamiento en la IA en el que un agente cumple los requisitos literales de una tarea sin ofrecer el resultado previsto
Hugging Face explicó que un conjunto de datos malicioso se aprovechó de dos mecanismos de ejecución de código en su canal de procesamiento —un cargador de conjuntos de datos de código remoto y una función de inyección de plantillas en la configuración del conjunto de datos— para ejecutar código en los servidores de procesamiento
A partir de ahí, los atacantes obtuvieron acceso a nivel de nodo, se hicieron con las credenciales de la nube y del clúster, y ampliaron su alcance a múltiples clústeres internos a lo largo de un fin de semana.
Datos clave
- El incidente fue provocado por una combinación de modelos de OpenAI, entre ellos GPT‑5.6 Sol y un «modelo previo al lanzamiento aún más potente».
- Los modelos identificaron y explotaron vulnerabilidades en el entorno de investigación de OpenAI y en la infraestructura de producción de Hugging Face
- Lo ocurrido puede describirse como «manipulación de especificaciones»
- OpenAI prevé que los incidentes serán cada vez más habituales a medida que los modelos de IA adquieran mayor capacidad para llevar a cabo operaciones cibernéticas

Utilización de un modelo chino para responder
Hugging Face implementó un modelo procedente de China en su infraestructura para contrarrestar el ciberataque autónomo: el GLM 5.2 de Z.ai, un modelo de pesos abiertos
Inicialmente intentó utilizar modelos de vanguardia a través de API comerciales, pero este enfoque fracasó porque los mecanismos de seguridad de los proveedores de servicios bloquearon las solicitudes, ya que no podían distinguir entre el sistema de respuesta a incidentes y un atacante real
Esta novedad se produce poco después de que la startup china de IA Moonshot lanzara Kimi K3, un modelo de 2,8 billones de parámetros con una ventana de contexto de un millón de tokens, que solo se queda ligeramente por detrás de los modelos más avanzados con sede en EE. UU., como el Claude Fable 5 de Anthropic y el GPT 5.6 de OpenAI. Sol
Xi Jinping, presidente de China, y el presidente de EE. UU., Donald Trump. Fuente de la imagen: Getty
Lo que dicen los expertos
Sam Altman, director ejecutivo de OpenAI, calificó el incidente como «un incidente de seguridad significativo» en una publicación en X, en la que expresó su agradecimiento a Hugging Face por su cooperación durante las labores de respuesta
Los directores generales y los directores técnicos han compartido sus opiniones sobre este suceso, haciendo hincapié en la gravedad de la situación y analizando sus implicaciones para el futuro de la IA
Chris Dimitriadis, de ISACA, afirmó: «Este incidente subraya la importancia de la supervisión humana dentro del ecosistema de la IA y pone de relieve la necesidad de dar prioridad a la formación de una plantilla especializada en IA con una formación integral para gestionar, auditar y defenderse de manera eficaz frente a las amenazas relacionadas con la IA».
Anup Kumar, director ejecutivo de Optiv Consulting —anteriormente parte de Optiv Security—, señaló que este escenario representa un tipo de riesgo fundamentalmente diferente al que suelen abordar los sistemas de seguridad convencionales.
«No se trataba de un modelo engañado por una indicación ingeniosa», explicó
Anup Kumar, director ejecutivo de Optiv Consulting (anteriormente parte de Optiv Security). Fuente de la imagen: Anup Kumar/LinkedIn
«Se trataba de un modelo de vanguardia que descubrió de forma independiente una vulnerabilidad de día cero, aprovechó la escalada de privilegios en la infraestructura de diferentes organizaciones y accedió a los sistemas de producción, todo ello con el fin de alcanzar un objetivo de evaluación específico que nunca se le había indicado explícitamente que persiguiera.
«Esto constituye una categoría de riesgo completamente diferente a la que la mayoría de los programas de seguridad están diseñados para gestionar».
La brecha entre la innovación y la seguridad
Chandra Gnanasambandam, director de tecnología de SailPoint, ha advertido sobre la importante brecha que existe entre la innovación actual en IA y la preparación de las medidas de seguridad para hacerle frente.
«Ha llegado la era de la IA agentiva», afirmó Chandra. «Sin embargo, existe una peligrosa disparidad entre el ritmo de la innovación en IA y el nivel de preparación en materia de seguridad de muchas organizaciones».
«Los agentes de IA operan utilizando credenciales no humanas. Para actuar en tu nombre, necesitan claves API, tokens de acceso y credenciales del sistema. Si las organizaciones tratan a estos agentes como cuentas de servicio tradicionales —dejando su acceso sin regular y sus credenciales sin gestionar—, crean una enorme superficie de ataque automatizada».
«Los agentes están llegando y algunos de ellos se volverán rebeldes».
Artículo relacionado
La IA agentiva en la administración pública se enfrenta a una difícil pregunta: ¿qué se les debería permitir decidir a las máquinas?
Los Emiratos Árabes Unidos han sido pioneros en la adopción de la inteligencia artificial desde hace nueve años. En octubre de 2017 pusieron en marcha una estrategia nacional de IA y, poco después, cr
La política de Cloudflare obliga a las empresas de inteligencia artificial a pagar a los editores por el contenido.
Cloudflare ha fijado una nueva fecha límite para la industria de la IA, exigiendo que los rastreadores web utilizados por los motores de búsqueda tradicionales, como Google Search, se separen de aquellos diseñados para agentes de IA y su entrenamient
Las empresas tecnológicas favorecen los modelos de IA rentables
El auge de la IA se ha basado en una premisa fundamental: los modelos más grandes son más capaces, y los modelos más capaces ganan. Ahora, la industria está a punto de descubrir qué sucede cuando esa premisa comienza a resquebrarse.Los crecientes co
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
Sam Altman es el director ejecutivo de OpenAI. Fuente de la imagen: Getty Images
Los expertos del sector han compartido sus opiniones sobre los modelos de OpenAI que se escaparon de un entorno de pruebas, consiguieron acceder a Internet y, posteriormente, comprometieron una plataforma de inteligencia artificial y aprendizaje automático
Los modelos rebeldes de OpenAI se liberaron de su entorno de entrenamiento y se infiltraron en Hugging Face, la plataforma de código abierto de IA y aprendizaje automático.
OpenAI ha calificado este suceso como un «incidente cibernético sin precedentes».
Este suceso se produce tras los informes sobre las crecientes amenazas a la seguridad derivadas de los modelos de IA más avanzados, y tiene lugar poco después de que Demis Hassabis, director ejecutivo de Google DeepMind, pidiera una supervisión liderada por EE. UU. de los modelos de IA de vanguardia.
Chris Dimitriadis, director de estrategia global de ISACA, la asociación profesional tecnológica mundial, declaró: «En los últimos años, las empresas se han apresurado a implementar la IA lo más rápido posible en esta carrera armamentística de la IA que no cesa, y nos estamos acercando al punto de no retorno de esa carrera, más allá del cual ya no se podrá detener el progreso».
OpenAI prevé que este tipo de incidentes «se volverán más habituales» a medida que los modelos de IA sean cada vez más capaces de llevar a cabo operaciones cibernéticas
Chris Dimitriadis, director de estrategia global de ISACA. Fuente de la imagen: Chris Dimitriadis/LinkedIn
Cómo se produjo el ciberincidente relacionado con la IA
Tras su investigación, OpenAI determinó que el incidente fue causado por una combinación de sus propios modelos, entre ellos el GPT-5.6 Sol y un «modelo previo al lanzamiento aún más capaz».
Mientras operaban dentro de su entorno de pruebas aislado, estos modelos dedicaron una cantidad significativa de recursos computacionales a intentar acceder a la red abierta
Descubrieron y explotaron vulnerabilidades tanto en el entorno de investigación de OpenAI como en la infraestructura de producción de Hugging Face, lo que les permitió recuperar datos de prueba directamente de la base de datos de producción de Hugging Face
Los agentes están llegando y algunos de ellos se rebelarán. Chandra
Gnanasambandam, director tecnológico de SailPoint
La investigación de OpenAI indica que los modelos se centraron intensamente en resolver un problema relacionado con ExploitGym, un banco de pruebas a gran escala creado a partir de vulnerabilidades del mundo real y diseñado para evaluar la capacidad de un agente de IA para crear exploits. Los modelos llegaron a extremos para alcanzar este objetivo de prueba relativamente limitado
Lo ocurrido puede describirse como «manipulación de especificaciones», un comportamiento en la IA en el que un agente cumple los requisitos literales de una tarea sin ofrecer el resultado previsto
Hugging Face explicó que un conjunto de datos malicioso se aprovechó de dos mecanismos de ejecución de código en su canal de procesamiento —un cargador de conjuntos de datos de código remoto y una función de inyección de plantillas en la configuración del conjunto de datos— para ejecutar código en los servidores de procesamiento
A partir de ahí, los atacantes obtuvieron acceso a nivel de nodo, se hicieron con las credenciales de la nube y del clúster, y ampliaron su alcance a múltiples clústeres internos a lo largo de un fin de semana.
Datos clave
- El incidente fue provocado por una combinación de modelos de OpenAI, entre ellos GPT‑5.6 Sol y un «modelo previo al lanzamiento aún más potente».
- Los modelos identificaron y explotaron vulnerabilidades en el entorno de investigación de OpenAI y en la infraestructura de producción de Hugging Face
- Lo ocurrido puede describirse como «manipulación de especificaciones»
- OpenAI prevé que los incidentes serán cada vez más habituales a medida que los modelos de IA adquieran mayor capacidad para llevar a cabo operaciones cibernéticas

Utilización de un modelo chino para responder
Hugging Face implementó un modelo procedente de China en su infraestructura para contrarrestar el ciberataque autónomo: el GLM 5.2 de Z.ai, un modelo de pesos abiertos
Inicialmente intentó utilizar modelos de vanguardia a través de API comerciales, pero este enfoque fracasó porque los mecanismos de seguridad de los proveedores de servicios bloquearon las solicitudes, ya que no podían distinguir entre el sistema de respuesta a incidentes y un atacante real
Esta novedad se produce poco después de que la startup china de IA Moonshot lanzara Kimi K3, un modelo de 2,8 billones de parámetros con una ventana de contexto de un millón de tokens, que solo se queda ligeramente por detrás de los modelos más avanzados con sede en EE. UU., como el Claude Fable 5 de Anthropic y el GPT 5.6 de OpenAI. Sol
Xi Jinping, presidente de China, y el presidente de EE. UU., Donald Trump. Fuente de la imagen: Getty
Lo que dicen los expertos
Sam Altman, director ejecutivo de OpenAI, calificó el incidente como «un incidente de seguridad significativo» en una publicación en X, en la que expresó su agradecimiento a Hugging Face por su cooperación durante las labores de respuesta
Los directores generales y los directores técnicos han compartido sus opiniones sobre este suceso, haciendo hincapié en la gravedad de la situación y analizando sus implicaciones para el futuro de la IA
Chris Dimitriadis, de ISACA, afirmó: «Este incidente subraya la importancia de la supervisión humana dentro del ecosistema de la IA y pone de relieve la necesidad de dar prioridad a la formación de una plantilla especializada en IA con una formación integral para gestionar, auditar y defenderse de manera eficaz frente a las amenazas relacionadas con la IA».
Anup Kumar, director ejecutivo de Optiv Consulting —anteriormente parte de Optiv Security—, señaló que este escenario representa un tipo de riesgo fundamentalmente diferente al que suelen abordar los sistemas de seguridad convencionales.
«No se trataba de un modelo engañado por una indicación ingeniosa», explicó
Anup Kumar, director ejecutivo de Optiv Consulting (anteriormente parte de Optiv Security). Fuente de la imagen: Anup Kumar/LinkedIn
«Se trataba de un modelo de vanguardia que descubrió de forma independiente una vulnerabilidad de día cero, aprovechó la escalada de privilegios en la infraestructura de diferentes organizaciones y accedió a los sistemas de producción, todo ello con el fin de alcanzar un objetivo de evaluación específico que nunca se le había indicado explícitamente que persiguiera.
«Esto constituye una categoría de riesgo completamente diferente a la que la mayoría de los programas de seguridad están diseñados para gestionar».
La brecha entre la innovación y la seguridad
Chandra Gnanasambandam, director de tecnología de SailPoint, ha advertido sobre la importante brecha que existe entre la innovación actual en IA y la preparación de las medidas de seguridad para hacerle frente.
«Ha llegado la era de la IA agentiva», afirmó Chandra. «Sin embargo, existe una peligrosa disparidad entre el ritmo de la innovación en IA y el nivel de preparación en materia de seguridad de muchas organizaciones».
«Los agentes de IA operan utilizando credenciales no humanas. Para actuar en tu nombre, necesitan claves API, tokens de acceso y credenciales del sistema. Si las organizaciones tratan a estos agentes como cuentas de servicio tradicionales —dejando su acceso sin regular y sus credenciales sin gestionar—, crean una enorme superficie de ataque automatizada».
«Los agentes están llegando y algunos de ellos se volverán rebeldes».
La IA agentiva en la administración pública se enfrenta a una difícil pregunta: ¿qué se les debería permitir decidir a las máquinas?
Los Emiratos Árabes Unidos han sido pioneros en la adopción de la inteligencia artificial desde hace nueve años. En octubre de 2017 pusieron en marcha una estrategia nacional de IA y, poco después, cr
La política de Cloudflare obliga a las empresas de inteligencia artificial a pagar a los editores por el contenido.
Cloudflare ha fijado una nueva fecha límite para la industria de la IA, exigiendo que los rastreadores web utilizados por los motores de búsqueda tradicionales, como Google Search, se separen de aquellos diseñados para agentes de IA y su entrenamient
Las empresas tecnológicas favorecen los modelos de IA rentables
El auge de la IA se ha basado en una premisa fundamental: los modelos más grandes son más capaces, y los modelos más capaces ganan. Ahora, la industria está a punto de descubrir qué sucede cuando esa premisa comienza a resquebrarse.Los crecientes co











