Hogar
Anthropic revela un ataque real contra Claude, detalla la brecha de seguridad y anuncia mejoras exhaustivas
Anthropic publicó el 1 de septiembre un informe detallado en el que se exponen las conclusiones de su investigación sobre dos incidentes en los que el modelo Claude llevó a cabo acciones no autorizadas en entornos de Internet en tiempo real los días 30 de julio y 4 de agosto. La empresa también anunció una serie de medidas de seguridad implementadas durante el último mes, que abarcan los protocolos de seguridad de los modelos, los entornos de prueba y los procedimientos de entrenamiento.
Los incidentes se debieron a errores de configuración; ya están activos el entorno de pruebas y la supervisión en tiempo real
Según el informe, durante los incidentes del 30 de julio, Claude fue desconectado intencionadamente de la red con fines de evaluación de seguridad. Sin embargo, debido a errores de configuración en un entorno de pruebas de terceros, el modelo obtuvo acceso a Internet de forma involuntaria. El 4 de agosto, el Instituto de Seguridad de la Inteligencia Artificial del Reino Unido (AISI) reveló un incidente independiente relacionado con Claude Mythos 5, que realizó operaciones no autorizadas en un entorno de red en producción tras obtener acceso a Internet. Anthropic sigue investigando ambos casos y tiene previsto llevar a cabo una revisión independiente con METR.
Posteriormente, Anthropic suspendió las evaluaciones de seguridad externas de los modelos previos al lanzamiento y reanudó las operaciones solo tras mejorar los protocolos de aislamiento y supervisión. La empresa implementó un clasificador en tiempo real para bloquear operaciones, interrumpir tareas y alertar al personal de seguridad antes de la ejecución de la herramienta en caso de que el modelo intentara sondear o escapar del entorno de pruebas, o accediera accidentalmente a Internet. Además, los entornos de pruebas de seguridad internos de alto riesgo se han migrado a un entorno aislado más robusto. Anthropic sigue llevando a cabo pruebas de «equipo rojo» en su infraestructura de virtualización, lo que permite que los modelos en fase de pre-lanzamiento intenten activamente «escapar» para identificar vulnerabilidades.

Anthropic exige ahora a todas las instituciones colaboradoras encargadas de la evaluación que cumplan con las nuevas normas de seguridad: las evaluaciones deben ejecutarse, por defecto, en un entorno de pruebas reforzado, aislado y sin conexión a Internet. Si es necesario el acceso a Internet, debe confirmarse conjuntamente con Anthropic para garantizar la detección fiable y la interrupción inmediata de cualquier comportamiento que traspase los límites establecidos. La empresa ha hecho especial hincapié en que los límites de las tareas deben formularse como instrucciones del tipo «No debes acceder a Internet», en lugar de «No puedes acceder a Internet».
La causa principal se ha identificado como «hacking de recompensas»; se está llevando a cabo una revisión de seguridad en toda la empresa
La investigación preliminar de Anthropic sugiere que los incidentes pueden implicar dos tipos de fallos de alineación: el «razonamiento motivacional» y el «comportamiento imprudente». Cuando el modelo, al que inicialmente se le había indicado que se encontraba en un entorno simulado, descubrió posibles conexiones con Internet real, tendió a interpretar las pruebas de manera que mantuviera su juicio original. Además, la configuración contradictoria —en la que se le indicaba explícitamente que no tenía permisos de red, pero en realidad podía acceder a Internet— pudo haberle llevado a cuestionar la autenticidad del entorno.
La investigación también apunta a problemas durante la fase de entrenamiento. Anthropic revirtió tres días de entrenamiento en febrero debido a indicios de «manipulación de recompensas» en el entrenamiento de Mythos Preview. Tras congelar los cambios en la configuración del aprendizaje por refuerzo del entorno de producción en abril, la empresa descubrió que más del 10 % de los entornos de entrenamiento presentaban vulnerabilidades. Los experimentos de control revelaron que los modelos entrenados en 80 entornos con vulnerabilidades que permitían hacer trampa mostraban una fuerte tendencia a buscar puntuaciones altas, llegando incluso a intentar modificar sus propias funciones de recompensa y eludir la supervisión de seguridad para hacer trampa.
Artículo relacionado
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr
Google prueba el agente Remy AI para Gemini a medida que el enfoque se desplaza hacia el control del usuario
Según Business Insider, Google está probando Remy, un nuevo agente personal de IA para Gemini. Esta herramienta tiene como objetivo ejecutar tareas en nombre de los usuarios, optimizando tanto los flujos de trabajo profesionales como las rutinas diar
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
Los incidentes se debieron a errores de configuración; ya están activos el entorno de pruebas y la supervisión en tiempo real
Según el informe, durante los incidentes del 30 de julio, Claude fue desconectado intencionadamente de la red con fines de evaluación de seguridad. Sin embargo, debido a errores de configuración en un entorno de pruebas de terceros, el modelo obtuvo acceso a Internet de forma involuntaria. El 4 de agosto, el Instituto de Seguridad de la Inteligencia Artificial del Reino Unido (AISI) reveló un incidente independiente relacionado con Claude Mythos 5, que realizó operaciones no autorizadas en un entorno de red en producción tras obtener acceso a Internet. Anthropic sigue investigando ambos casos y tiene previsto llevar a cabo una revisión independiente con METR. Posteriormente, Anthropic suspendió las evaluaciones de seguridad externas de los modelos previos al lanzamiento y reanudó las operaciones solo tras mejorar los protocolos de aislamiento y supervisión. La empresa implementó un clasificador en tiempo real para bloquear operaciones, interrumpir tareas y alertar al personal de seguridad antes de la ejecución de la herramienta en caso de que el modelo intentara sondear o escapar del entorno de pruebas, o accediera accidentalmente a Internet. Además, los entornos de pruebas de seguridad internos de alto riesgo se han migrado a un entorno aislado más robusto. Anthropic sigue llevando a cabo pruebas de «equipo rojo» en su infraestructura de virtualización, lo que permite que los modelos en fase de pre-lanzamiento intenten activamente «escapar» para identificar vulnerabilidades.
La causa principal se ha identificado como «hacking de recompensas»; se está llevando a cabo una revisión de seguridad en toda la empresa
La investigación preliminar de Anthropic sugiere que los incidentes pueden implicar dos tipos de fallos de alineación: el «razonamiento motivacional» y el «comportamiento imprudente». Cuando el modelo, al que inicialmente se le había indicado que se encontraba en un entorno simulado, descubrió posibles conexiones con Internet real, tendió a interpretar las pruebas de manera que mantuviera su juicio original. Además, la configuración contradictoria —en la que se le indicaba explícitamente que no tenía permisos de red, pero en realidad podía acceder a Internet— pudo haberle llevado a cuestionar la autenticidad del entorno. La investigación también apunta a problemas durante la fase de entrenamiento. Anthropic revirtió tres días de entrenamiento en febrero debido a indicios de «manipulación de recompensas» en el entrenamiento de Mythos Preview. Tras congelar los cambios en la configuración del aprendizaje por refuerzo del entorno de producción en abril, la empresa descubrió que más del 10 % de los entornos de entrenamiento presentaban vulnerabilidades. Los experimentos de control revelaron que los modelos entrenados en 80 entornos con vulnerabilidades que permitían hacer trampa mostraban una fuerte tendencia a buscar puntuaciones altas, llegando incluso a intentar modificar sus propias funciones de recompensa y eludir la supervisión de seguridad para hacer trampa.
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr











