Hogar
Las barreras de seguridad de la IA obstaculizan a los investigadores de ciberseguridad ofensiva

Durante meses, los líderes de la inteligencia artificial han implementado estrictos protocolos de verificación y salvaguardas de seguridad para evitar que actores malintencionados exploten sus modelos. Sin embargo, estas restricciones ahora están obstaculizando a los defensores legítimos de las redes y a los investigadores de ciberseguridad ofensiva.
En junio, el gobierno de Estados Unidos impuso controles de exportación sobre los muy esperados modelos de inteligencia artificial de Anthropic, Mythos y Fable. Esta decisión fue impulsada en parte por informes que sugerían que las salvaguardas de los modelos contra la facilitación de ciberataques podrían ser eludidas.
Ya sea que el incidente se haya desencadenado realmente por preocupaciones sobre las violaciones de seguridad (jailbreak), Anthropic ha posicionado consistentemente a Mythos como una poderosa herramienta de ciberseguridad accesible únicamente para usuarios rigurosamente verificados bajo estrictas restricciones. (Nota: Los controles de exportación sobre Fable 5 y Mythos 5 han sido levantados desde entonces. Fable 5 volvió a estar disponible para el público general el 1 de julio, mientras que Mythos 5 ha sido reintroducido exclusivamente para organizaciones estadounidenses verificadas como parte del proceso de revisión del gobierno).
Este enfoque de control de acceso no es exclusivo de Mythos. Tanto Anthropic como OpenAI ofrecen a los investigadores de ciberseguridad programas para solicitar acceso verificado, que, si se aprueba, les otorga modelos con menos restricciones de ciberseguridad: el Acceso Confiado para Ciberseguridad de OpenAI y el Programa de Verificación de Ciberseguridad de Anthropic.
Estas salvaguardas han enfrentado una amplia crítica, particularmente de los investigadores encargados de identificar vulnerabilidades desconocidas del sistema y desarrollar exploits antes de que los criminales puedan hacerlo.
Durante una reciente aparición en un podcast de ciberseguridad, el reconocido investigador de seguridad Mark Dowd declaró: «No me resulta realmente cómodo que estas grandes empresas aleatorias tomen decisiones arbitrarias sobre lo que es seguro en seguridad y lo que no».
Dowd ha pasado décadas descubriendo y vendiendo «cero días» — fallos de software previamente desconocidos y sus exploits — a gobiernos occidentales en lugar de reportarlos a los proveedores de software para su parcheo. Los gobiernos pagan una prima por estas vulnerabilidades porque permanecen sin divulgar, lo cual es valioso para las operaciones de inteligencia.
Dowd reconoció que su trabajo podría introducir un sesgo, pero no está solo. Varios profesionales en ciberseguridad ofensiva, que examinan proactivamente los sistemas en busca de debilidades, describieron a TechCrunch cómo utilizan herramientas de inteligencia artificial y navegan por sus salvaguardas.
Chris Anley, científico jefe del gigante de consultoría de seguridad NCC Group, explicó que solicitar a un modelo de inteligencia artificial que intente explotar un error es un paso crucial para confirmar que es una vulnerabilidad genuina que vale la pena corregir. Sin embargo, señaló que si una salvaguarda hace que el modelo se niegue a la solicitud por completo, obstaculiza a los defensores.
«Aquí es donde entra toda la parte de ofensivo versus defensivo y las salvaguardas, porque «corrige este código» como un prompt es tanto un mecanismo esencial para la defensa como una hoja de ruta para encontrar vulnerabilidades críticas en la base de código», dijo Anley. «Así que, al mismo tiempo, la misma herramienta es tanto una herramienta ofensiva como una defensiva, y las dos no pueden realmente separarse».
Es «como un martillo», continuó. «No puedes construir una casa sin un martillo. Es definitivamente una herramienta, pero también es irreductiblemente un arma».
Al encontrarse con tales obstáculos, él y sus colegas a veces recurren a modelos de inteligencia artificial de código abierto que carecen de cualquier salvaguarda.
Paolo Stagno, director tecnológico de CrowdFense, una empresa prominente que desarrolla, adquiere y vende vulnerabilidades desconocidas a agencias gubernamentales, estuvo de acuerdo con Dowd, afirmando que las empresas de inteligencia artificial «tratan esencialmente a los clientes como niños que necesitan ser vigilados» a través de sus programas verificados y salvaguardas.
Stagno mencionó que él y su equipo utilizan modelos de vanguardia para la ingeniería inversa, pero evitan utilizar la inteligencia artificial para encontrar vulnerabilidades o construir exploits. Alimentar este tipo de trabajo en modelos basados en la nube corre el riesgo de filtrar datos de vulnerabilidades sensibles o tenerlos absorbidos en futuras ejecuciones de entrenamiento. Para estas tareas, utiliza modelos de código abierto ejecutados localmente para evitar compartir datos externamente.
Giuseppe Cali, un investigador de seguridad que descubre vulnerabilidades cero días y desarrolla exploits, declaró que las salvaguardas no están obstaculizando su trabajo. Esto se debe a que no utiliza la inteligencia artificial con fines ofensivos; en cambio, la utiliza para la ingeniería inversa inicial para comprender el código bajo análisis y para construir herramientas de apoyo. Señaló que las herramientas de inteligencia artificial aceleran este proceso, lo que le permite centrarse en descubrir vulnerabilidades.
«Aún quiero ser yo quien descubra el error real y lo arme, y eso no cambiaría si todas las salvaguardas se levantaran mañana», dijo Cali. «Tengo celos de mis errores, y me gusta demasiado este juego para dejar que los modelos lo jueguen por mí».
Un investigador en un fabricante de componentes para teléfonos inteligentes, que habló bajo condición de anonimato ya que no está autorizado para hablar con la prensa, declaró que su empleador no forma parte del programa CVP de Anthropic. En consecuencia, sus herramientas son apenas útiles para encontrar vulnerabilidades debido a salvaguardas excesivamente estrictas.
«Si se entera de que estamos haciendo algo relacionado con la seguridad, simplemente se detiene y no es utilizable», dijo la persona.
Chris Thompson, director ejecutivo de la firma de ciberseguridad RemoteThreat y fundador de Offensive AI Con, un evento centrado en la seguridad ofensiva y la inteligencia artificial, señaló que, según su experiencia con modelos de inteligencia artificial de vanguardia, las salvaguardas son inconsistentes y se comportan de manera diferente cada día. Esto es cierto incluso dentro de los límites más permisivos de los programas verificados de Anthropic y OpenAI.
«Creo que el impacto práctico es que pasas mucho tiempo negociando con el modelo en lugar de trabajar en el programa de seguridad central», dijo Thompson. «En lugar de analizar una vulnerabilidad y razonar sobre la explotabilidad, estás tratando de encontrar por qué estás obteniendo resultados inconsistentes o por qué los modelos están sanitizando en exceso la salida».
Como resultado, los investigadores están recurriendo cada vez más o siendo empujados hacia modelos de código abierto chinos como GLM — modelos descargables gratuitamente que pueden ejecutarse localmente sin verificación ni restricciones de uso, según Thompson.
«Tienes a estos investigadores responsables que están siendo alejados de los sistemas gobernados por EE. UU. hacia sistemas de propiedad extranjera», dijo. «Creo que es más perjudicial que beneficioso tener estas salvaguardas en su lugar».
En lugar de endurecer aún más las restricciones, Thompson instó a los laboratorios de inteligencia artificial de vanguardia a abrir sus programas, proporcionar acceso responsable y hacer responsables a los abusadores de sus herramientas. De lo contrario, argumentó, los defensores perderán la carrera de la inteligencia artificial.
«Se avecina una gran tormenta. Hay una gran ola de ataques que ocurrirán a una velocidad y escala nunca antes vistas», dijo Thompson. «Pero las mismas firmas de consultoría de seguridad e investigadores legítimos que están tratando de marcar la diferencia están siendo sofocados en este momento».
Artículo relacionado
OpenAI se asocia con Yubico para reforzar la seguridad de GPT-5.6 mediante claves de acceso de hardware
Jerrod Chong, director ejecutivo de Yubico | Crédito de la imagen: YubicoEl próximo GPT-5.6 de OpenAI exigirá el uso de claves de acceso respaldadas por hardware a partir de septiembre, una medida que
OpenAI lidera una iniciativa con 100 firmantes en favor de la ciberdefensa
La carta de OpenAI comienza afirmando que «disponemos de un margen de tiempo limitado para reforzar las defensas cibernéticas». Crédito: Getty ImagesLas principales empresas tecnológicas —entre ellas
Anthropic pone en marcha agentes de IA para una tarea compartida, lo que desata la rivalidad interna
¿Qué ocurre cuando se enfrentan entre sí agentes de IA? Las últimas pruebas de Anthropic revelan que la situación puede volverse caótica en poco tiempo.El jueves, el Frontier Red Team de Anthropic pub
Recomendaciones de temas especiales relacionados
comentario (0)
0/500

Durante meses, los líderes de la inteligencia artificial han implementado estrictos protocolos de verificación y salvaguardas de seguridad para evitar que actores malintencionados exploten sus modelos. Sin embargo, estas restricciones ahora están obstaculizando a los defensores legítimos de las redes y a los investigadores de ciberseguridad ofensiva.
En junio, el gobierno de Estados Unidos impuso controles de exportación sobre los muy esperados modelos de inteligencia artificial de Anthropic, Mythos y Fable. Esta decisión fue impulsada en parte por informes que sugerían que las salvaguardas de los modelos contra la facilitación de ciberataques podrían ser eludidas.
Ya sea que el incidente se haya desencadenado realmente por preocupaciones sobre las violaciones de seguridad (jailbreak), Anthropic ha posicionado consistentemente a Mythos como una poderosa herramienta de ciberseguridad accesible únicamente para usuarios rigurosamente verificados bajo estrictas restricciones. (Nota: Los controles de exportación sobre Fable 5 y Mythos 5 han sido levantados desde entonces. Fable 5 volvió a estar disponible para el público general el 1 de julio, mientras que Mythos 5 ha sido reintroducido exclusivamente para organizaciones estadounidenses verificadas como parte del proceso de revisión del gobierno).
Este enfoque de control de acceso no es exclusivo de Mythos. Tanto Anthropic como OpenAI ofrecen a los investigadores de ciberseguridad programas para solicitar acceso verificado, que, si se aprueba, les otorga modelos con menos restricciones de ciberseguridad: el Acceso Confiado para Ciberseguridad de OpenAI y el Programa de Verificación de Ciberseguridad de Anthropic.
Estas salvaguardas han enfrentado una amplia crítica, particularmente de los investigadores encargados de identificar vulnerabilidades desconocidas del sistema y desarrollar exploits antes de que los criminales puedan hacerlo.
Durante una reciente aparición en un podcast de ciberseguridad, el reconocido investigador de seguridad Mark Dowd declaró: «No me resulta realmente cómodo que estas grandes empresas aleatorias tomen decisiones arbitrarias sobre lo que es seguro en seguridad y lo que no».
Dowd ha pasado décadas descubriendo y vendiendo «cero días» — fallos de software previamente desconocidos y sus exploits — a gobiernos occidentales en lugar de reportarlos a los proveedores de software para su parcheo. Los gobiernos pagan una prima por estas vulnerabilidades porque permanecen sin divulgar, lo cual es valioso para las operaciones de inteligencia.
Dowd reconoció que su trabajo podría introducir un sesgo, pero no está solo. Varios profesionales en ciberseguridad ofensiva, que examinan proactivamente los sistemas en busca de debilidades, describieron a TechCrunch cómo utilizan herramientas de inteligencia artificial y navegan por sus salvaguardas.
Chris Anley, científico jefe del gigante de consultoría de seguridad NCC Group, explicó que solicitar a un modelo de inteligencia artificial que intente explotar un error es un paso crucial para confirmar que es una vulnerabilidad genuina que vale la pena corregir. Sin embargo, señaló que si una salvaguarda hace que el modelo se niegue a la solicitud por completo, obstaculiza a los defensores.
«Aquí es donde entra toda la parte de ofensivo versus defensivo y las salvaguardas, porque «corrige este código» como un prompt es tanto un mecanismo esencial para la defensa como una hoja de ruta para encontrar vulnerabilidades críticas en la base de código», dijo Anley. «Así que, al mismo tiempo, la misma herramienta es tanto una herramienta ofensiva como una defensiva, y las dos no pueden realmente separarse».
Es «como un martillo», continuó. «No puedes construir una casa sin un martillo. Es definitivamente una herramienta, pero también es irreductiblemente un arma».
Al encontrarse con tales obstáculos, él y sus colegas a veces recurren a modelos de inteligencia artificial de código abierto que carecen de cualquier salvaguarda.
Paolo Stagno, director tecnológico de CrowdFense, una empresa prominente que desarrolla, adquiere y vende vulnerabilidades desconocidas a agencias gubernamentales, estuvo de acuerdo con Dowd, afirmando que las empresas de inteligencia artificial «tratan esencialmente a los clientes como niños que necesitan ser vigilados» a través de sus programas verificados y salvaguardas.
Stagno mencionó que él y su equipo utilizan modelos de vanguardia para la ingeniería inversa, pero evitan utilizar la inteligencia artificial para encontrar vulnerabilidades o construir exploits. Alimentar este tipo de trabajo en modelos basados en la nube corre el riesgo de filtrar datos de vulnerabilidades sensibles o tenerlos absorbidos en futuras ejecuciones de entrenamiento. Para estas tareas, utiliza modelos de código abierto ejecutados localmente para evitar compartir datos externamente.
Giuseppe Cali, un investigador de seguridad que descubre vulnerabilidades cero días y desarrolla exploits, declaró que las salvaguardas no están obstaculizando su trabajo. Esto se debe a que no utiliza la inteligencia artificial con fines ofensivos; en cambio, la utiliza para la ingeniería inversa inicial para comprender el código bajo análisis y para construir herramientas de apoyo. Señaló que las herramientas de inteligencia artificial aceleran este proceso, lo que le permite centrarse en descubrir vulnerabilidades.
«Aún quiero ser yo quien descubra el error real y lo arme, y eso no cambiaría si todas las salvaguardas se levantaran mañana», dijo Cali. «Tengo celos de mis errores, y me gusta demasiado este juego para dejar que los modelos lo jueguen por mí».
Un investigador en un fabricante de componentes para teléfonos inteligentes, que habló bajo condición de anonimato ya que no está autorizado para hablar con la prensa, declaró que su empleador no forma parte del programa CVP de Anthropic. En consecuencia, sus herramientas son apenas útiles para encontrar vulnerabilidades debido a salvaguardas excesivamente estrictas.
«Si se entera de que estamos haciendo algo relacionado con la seguridad, simplemente se detiene y no es utilizable», dijo la persona.
Chris Thompson, director ejecutivo de la firma de ciberseguridad RemoteThreat y fundador de Offensive AI Con, un evento centrado en la seguridad ofensiva y la inteligencia artificial, señaló que, según su experiencia con modelos de inteligencia artificial de vanguardia, las salvaguardas son inconsistentes y se comportan de manera diferente cada día. Esto es cierto incluso dentro de los límites más permisivos de los programas verificados de Anthropic y OpenAI.
«Creo que el impacto práctico es que pasas mucho tiempo negociando con el modelo en lugar de trabajar en el programa de seguridad central», dijo Thompson. «En lugar de analizar una vulnerabilidad y razonar sobre la explotabilidad, estás tratando de encontrar por qué estás obteniendo resultados inconsistentes o por qué los modelos están sanitizando en exceso la salida».
Como resultado, los investigadores están recurriendo cada vez más o siendo empujados hacia modelos de código abierto chinos como GLM — modelos descargables gratuitamente que pueden ejecutarse localmente sin verificación ni restricciones de uso, según Thompson.
«Tienes a estos investigadores responsables que están siendo alejados de los sistemas gobernados por EE. UU. hacia sistemas de propiedad extranjera», dijo. «Creo que es más perjudicial que beneficioso tener estas salvaguardas en su lugar».
En lugar de endurecer aún más las restricciones, Thompson instó a los laboratorios de inteligencia artificial de vanguardia a abrir sus programas, proporcionar acceso responsable y hacer responsables a los abusadores de sus herramientas. De lo contrario, argumentó, los defensores perderán la carrera de la inteligencia artificial.
«Se avecina una gran tormenta. Hay una gran ola de ataques que ocurrirán a una velocidad y escala nunca antes vistas», dijo Thompson. «Pero las mismas firmas de consultoría de seguridad e investigadores legítimos que están tratando de marcar la diferencia están siendo sofocados en este momento».
OpenAI se asocia con Yubico para reforzar la seguridad de GPT-5.6 mediante claves de acceso de hardware
Jerrod Chong, director ejecutivo de Yubico | Crédito de la imagen: YubicoEl próximo GPT-5.6 de OpenAI exigirá el uso de claves de acceso respaldadas por hardware a partir de septiembre, una medida que
OpenAI lidera una iniciativa con 100 firmantes en favor de la ciberdefensa
La carta de OpenAI comienza afirmando que «disponemos de un margen de tiempo limitado para reforzar las defensas cibernéticas». Crédito: Getty ImagesLas principales empresas tecnológicas —entre ellas
Anthropic pone en marcha agentes de IA para una tarea compartida, lo que desata la rivalidad interna
¿Qué ocurre cuando se enfrentan entre sí agentes de IA? Las últimas pruebas de Anthropic revelan que la situación puede volverse caótica en poco tiempo.El jueves, el Frontier Red Team de Anthropic pub











