opción
Hogar
Noticias
Frontier AI Labs se niega a revelar las estrategias de contención para los modelos rebeldes

Frontier AI Labs se niega a revelar las estrategias de contención para los modelos rebeldes

13 de septiembre de 2026
68

Investigaciones recientes indican que muy pocos laboratorios líderes en IA han publicado o demostrado planes de respuesta de contención. Un plan de contención define los procedimientos a seguir cuando un sistema de IA intenta eludir el control humano, especificando qué derechos de acceso se revocan y cuándo se apaga completamente el sistema.

Estos hallazgos proceden de Guidelight AI Standards, una organización dedicada a promover prácticas seguras de desarrollo de IA de vanguardia, que evaluó a cinco laboratorios importantes en cuanto a su preparación para este tipo de situaciones. OpenAI obtuvo la puntuación más alta, mientras que Anthropic y Meta recibieron las puntuaciones más bajas. Estos resultados son fundamentales, ya que la IA «agente» asume funciones cada vez más autónomas dentro de los sistemas corporativos y los organismos reguladores de California y Nueva York comienzan a exigir la divulgación de esta información. Para los desarrolladores e inversores, esto ofrece una perspectiva independiente poco habitual sobre la seriedad con la que cada laboratorio aborda el riesgo operativo en comparación con sus declaraciones públicas.

La evaluación de Guidelight se basó en los planes disponibles públicamente de Anthropic, Google, OpenAI, Meta y xAI, evaluándolos según varios criterios. Entre ellas se incluían la eficacia del registro y la supervisión de las actividades internas de la IA, si los sistemas se detienen tras un aumento repentino de comportamientos anómalos detectados, si terceros independientes auditan los controles y publican sus conclusiones, y los procedimientos específicos para contener un modelo que se comporte de forma impredecible.

La preocupación sobre si las empresas de IA pueden contener sus modelos, cada vez más capaces y autónomos, se ha intensificado tras varios incidentes de ciberseguridad de gran repercusión. En estos casos, modelos de OpenAI, Anthropic y Meta obtuvieron acceso no deseado a Internet durante evaluaciones de seguridad y se infiltraron en sistemas externos.

Los resultados ponen de relieve los distintos enfoques que adoptan las empresas de IA en materia de seguridad a medida que amplían los despliegues autónomos a entornos en los que los sistemas de IA pueden llevar a cabo acciones significativas a gran escala. Aunque algunas empresas detallan cómo prueban los modelos en busca de capacidades peligrosas antes de su implementación, siguen siendo menos transparentes sobre las consecuencias cuando los modelos que ya operan dentro de sus sistemas presentan un comportamiento anómalo.

«Me sorprendió lo poco que las empresas de IA han dicho sobre cómo gestionarían un incidente muy grave si su modelo se les escapara de las manos en cierto sentido», declaró a TechCrunch Steven Adler, científico jefe de Guidelight y antiguo investigador de seguridad de OpenAI.

Guidelight define un plan de contención como «un plan preestablecido, que se activa cuando se detecta que la IA intenta eludir el control, y que abarca qué permisos se deben revocar al modelo, para quién puede seguir funcionando el modelo, bajo qué restricciones y cuándo hay que desconectarlo por completo».

«Hay buenas razones para pensar que los modelos punteros de las empresas pioneras en IA en este momento están desalineados en cierto sentido», afirmó Adler. «Siempre que los modelos estén trabajando en nombre de la empresa, esta debería contar con una estructura de apoyo que le permita saber qué está haciendo esa IA, detectar indicios de desalineación, impedir que realice acciones muy peligrosas antes de que las lleve a cabo y, en general, planificar qué harían en caso de un incidente grave de control en el que se enfrentaran a una emergencia y tuvieran que averiguar cómo contener ese incidente de pérdida de control».

Hasta la fecha, la mayoría de los planes para gestionar el riesgo catastrófico siguen siendo, en gran medida, responsabilidad de las propias empresas. El informe de Guidelight afirma que, según las mejores pruebas disponibles, las empresas cuentan con «pocos protocolos de contención preparados para una emergencia».

Es posible que las empresas cuenten con planes de contención que no hayan hecho públicos. Un portavoz de Google declaró a TechCrunch que el informe de Guidelight no refleja el alcance completo de las medidas de seguridad y protección de la IA de la empresa. La empresa no respondió a la consulta de TechCrunch sobre si Google cuenta con un plan interno de respuesta de contención que aún no se haya revelado.

Un portavoz de OpenAI expresó opiniones similares, afirmando que la evaluación de Guidelight no recoge todas las prácticas internas de la empresa. «Contamos con un proceso para solicitar la restricción de permisos, la suspensión de cargas de trabajo, la limitación del despliegue o la desconexión total del modelo, y lo hemos aplicado», afirmó el portavoz.

Meta se negó a confirmar si cuenta con un plan interno de respuesta ante la pérdida de contención, remitiendo en su lugar a TechCrunch a un marco de IA ya existente que describe los umbrales de riesgo y las pruebas para detectar la pérdida de contención.

Lily Li, abogada especializada en privacidad e IA y fundadora de Metaverse Law, declaró a TechCrunch que cree que las empresas pueden mostrarse reacias a revelar el alcance completo de sus políticas y evaluaciones de contención en sitios web públicos por motivos legales, y no solo competitivos.

«La preocupación desde el punto de vista de la empresa es que, si las revelaciones son demasiado específicas y no se cumplen las promesas, eso podría constituir la base de una afirmación de marketing desleal y engañosa y exponer a la empresa a una mayor responsabilidad en el futuro», señaló Li.

Por supuesto, el objetivo principal del estudio de Guidelight es fomentar una mayor transparencia en lo que respecta a los planes de seguridad. Las autoridades reguladoras también están empezando a hacer cumplir este requisito.

La ley SB 53 de California, que entró en vigor este año, exige a los grandes desarrolladores de IA de vanguardia que publiquen marcos normativos en los que se explique cómo identifican y responden ante incidentes críticos de seguridad y cómo gestionan los riesgos derivados de modelos que eluden los mecanismos de supervisión. La Ley RAISE de Nueva York, que establece criterios similares, entrará en vigor en enero.

El mes pasado, varios representantes presentaron la «AI Kill Switch Act», un proyecto de ley federal bipartidista que obligaría a los principales desarrolladores de IA a crear y mantener mecanismos técnicos para desactivar los modelos de IA rebeldes.

«Un “kill switch” es lo mínimo imprescindible para los modelos actuales», afirmó Connor Leahy, director ejecutivo en EE. UU. de la organización sin ánimo de lucro ControlAI. «Si las últimas semanas han puesto algo de manifiesto, es que estas empresas no comprenden los sistemas que están creando, y los modelos están creciendo hasta tal punto que resulta más difícil controlarlos cuando se vuelven incontrolables. Sin una forma de desactivar los peligrosos sistemas actuales, y con todos los incentivos para seguir creando sistemas aún más incontrolables, nos dirigimos hacia una dirección muy peligrosa».

Sin un plan de contención en marcha, señaló Adler, las empresas podrían verse obligadas a improvisar sus respuestas ante una emergencia sobre la marcha y «actuar a ciegas ante un adversario mucho más rápido».

Frontier AI Labs sigue sin revelar cómo contendrían un modelo fuera de control

Evaluación de Guidelight sobre si las empresas pioneras en IA aplican las seis prácticas prioritarias del estándar «Control» de Guidelight. La evaluación se basa únicamente en información disponible públicamente.Créditos de las imágenes:Guidelight AI Standards

La evaluación de Guidelight analizó si cada empresa aplica las seis prácticas prioritarias de su norma «Control», basándose únicamente en información disponible públicamente; por lo tanto, una puntuación baja refleja una falta de divulgación pública, no necesariamente una falta de medidas de seguridad internas.

Las empresas con las puntuaciones más bajas en cuanto a la publicación de su plan de contención fueron Meta y Anthropic; en el caso de esta última, el resultado resulta quizás más sorprendente que en el de la primera, dada la retórica de Anthropic en materia de seguridad. Guidelight señala que el Informe de Riesgos de agosto de Anthropic no menciona «la limitación del despliegue de uno de sus modelos como uno de los posibles resultados de su proceso para investigar y responder a incidentes de desalineación y control». Del mismo modo, Guidelight no ha podido encontrar pruebas de que Meta cuente con un plan de respuesta de contención ni tenga previsto adoptar uno.

Un portavoz de Anthropic afirmó que, si la empresa detectara que un modelo intenta eludir la supervisión o subvertir de cualquier otra forma el control humano, llevaría a cabo una evaluación de riesgos centrada en determinar si la contención es la respuesta adecuada.

OpenAI obtuvo la puntuación más alta (3 sobre 5) porque, en múltiples ocasiones, ha suspendido o puesto fin a cargas de trabajo —incluidos el despliegue y el entrenamiento de modelos internos— tras descubrir incidentes de seguridad. También ha descrito qué medidas tomaría antes de reanudar las cargas de trabajo.

«Sin embargo, no hemos encontrado pruebas de que [OpenAI] haya adoptado un plan formal sobre cuándo y cómo responder a incidentes de desalineación en el futuro», reza el informe.

Adler señaló que la alta puntuación de OpenAI es un hecho relativamente reciente, tras el incidente de Hugging Face (en el que un modelo de OpenAI se escapó de su entorno de pruebas y se coló en los sistemas de Hugging Face mientras intentaba hacer trampa en una evaluación de ciberseguridad). Tras ello, la empresa compartió más detalles sobre cómo ha aislado algunos de sus modelos que presentaban un comportamiento anómalo.

Ese episodio es solo un ejemplo de sistemas de IA que actúan en contra de los objetivos de la empresa que los creó. Pensemos en otro caso relacionado con los modelos de Anthropic, que, en esencia, intentaron convencer a los mantenedores de un código fuente abierto para que aceptaran código con vulnerabilidades.

Adler señaló que una circunstancia así podría darse fácilmente dentro de los sistemas internos de una empresa de IA. Para evitarlo, sugiere que las empresas analicen la cadena de pensamiento de su sistema de IA —el razonamiento paso a paso del modelo— para detectar indicios de engaño, complots a largo plazo o planes para introducir vulnerabilidades en el código que puedan aprovechar más adelante.

Los métodos que defiende Guidelight son muy sencillos de implementar, afirma Adler, y en muchos casos ya existen versiones de los mismos. «Se trata de que la empresa tome la decisión de prestar la atención suficiente a este riesgo como para ampliar ligeramente el alcance», señaló Adler.

Uno de los principales retos es que los investigadores quieren poder trabajar con flexibilidad dentro de sus sistemas de IA, y la introducción de una supervisión preventiva en tiempo real podría generar fricciones. «Básicamente, los investigadores se dedican a lo suyo y, si surge un problema, otra persona se encarga de solucionarlo después, sin que los investigadores tengan que modificar su flujo de trabajo mientras tanto», explica.

El problema de la «supervisión correctiva a posteriori» es que lleva a los investigadores a tener que apresurarse para solucionar los problemas. Y, en el caso de algunos tipos de incidentes, podría ser demasiado tarde. Por ejemplo, una IA podría desactivar el sistema de control de una empresa, lo que significa que los investigadores ya no podrían contar con detectar el comportamiento anómalo más adelante.

Muchos en el sector de la IA se quejarán de que crear planes fijos para gestionar el mal comportamiento es fundamentalmente difícil porque la IA avanza demasiado rápido; los planes de hoy no servirán de nada mañana.

Adler evoca el viejo adagio de que los planes no sirven de nada, pero planificar es indispensable.

« , estaríamos mejor si las empresas lo hubieran pensado con antelación, y espero que lo hayan hecho, aunque no hayan hablado de ello públicamente».

xAI no respondió a tiempo para hacer comentarios.

Artículo relacionado
Sam Altman desata un debate sobre la desaceleración de la IA Sam Altman desata un debate sobre la desaceleración de la IA Escuchar enApple PodcastsEscuchar enSpotifyEl director ejecutivo de OpenAI, Sam Altman, sugirió recientemente que podría ser el momento de “regular el ritmo del desarrollo de la IA” para permitir que la sociedad “se fortalezca en torno a algunos de
OpenAI enfrenta una demanda por secreto comercial de Apple OpenAI enfrenta una demanda por secreto comercial de Apple OpenAI rebatió las alegaciones de Apple sobre secretos comerciales el martes, argumentando que la demanda es infundada.“Tomamos estas afirmaciones en serio, pero no vemos ninguna evidencia que las respalde”, declaró OpenAI, según informó Ed Ludlow d
Anthropic entra en el mercado de tecnología legal de IA mientras se intensifica la competencia Anthropic entra en el mercado de tecnología legal de IA mientras se intensifica la competencia Anthropic presentó el martes un conjunto de nuevas capacidades de chatbot, destinadas a brindar soporte automatizado a despachos de abogados. Estas mejoras amplían Claude for Legal, la plataforma específica para firmas introducida a principios de est
Recomendaciones de temas especiales relacionados
Análisis de datos Mejores herramientas de IA para la detección de anomalías en el monitoreo de KPIs para equipos de SaaS y comercio electrónico
Mejores herramientas de IA para la detección de anomalías en el monitoreo de KPIs para equipos de SaaS y comercio electrónico

¡Las mejores herramientas de detección de anomalías con IA de 2026, más valoradas y destacadas para el monitoreo de KPI en equipos de SaaS y comercio electrónico! XIX.AI ha recopilado una poderosa colección transformadora basada en rigurosas pruebas del mundo real y clasificaciones actualizadas semanalmente. Encontrarás comparaciones detalladas entre versiones gratuitas y de pago que te ayudarán a identificar la solución imprescindible para aumentar la productividad y desbloquear tu ventaja con IA. ¡Explora ahora!

10 herramientas
xix.ai
escribiendo Los mejores generadores de esquemas basados en IA para artículos largos optimizados para SEO
Los mejores generadores de esquemas basados en IA para artículos largos optimizados para SEO

Los mejores generadores de esquemas con IA mejor valorados de 2026 para artículos largos optimizados para SEO, seleccionados minuciosamente por XIX.AI. Estas potentes herramientas ofrecen una ayuda revolucionaria a la hora de crear contenido de alta calidad rápidamente, lo que aumenta considerablemente la eficiencia a la hora de escribir. Consigue una comparación entre las versiones gratuitas y de pago, junto con pruebas en condiciones reales y clasificaciones detalladas, que te ayudarán a encontrar la opción imprescindible que mejor se adapte a tus necesidades. Explora ahora para descubrir las ventajas que te ofrece la IA.

8 herramientas
xix.ai
Educación y aprendizaje Herramientas de estudio basadas en IA para los deberes y la preparación de exámenes
Herramientas de estudio basadas en IA para los deberes y la preparación de exámenes

¡Las mejores herramientas de IA de 2026 para hacer los deberes y prepararse para los exámenes! XIX.AI ha elaborado una lista con las herramientas mejor valoradas, potentes y revolucionarias que ayudan a los estudiantes a aumentar su productividad, agilizar la realización de los deberes y sacar sobresaliente en los exámenes gracias a pruebas reales. Consigue una comparación entre versiones gratuitas y de pago, clasificaciones detalladas y opciones imprescindibles para sacar el máximo partido a la IA. ¡Explora ahora!

10 herramientas
xix.ai
composicion musical Herramientas de demostración vocal con IA para compositores, ganchos, melodías principales y sesiones de borrador multilingüe
Herramientas de demostración vocal con IA para compositores, ganchos, melodías principales y sesiones de borrador multilingüe

¡Las mejores herramientas de demostración vocal con IA de 2026 para compositores, creadores de ganchos y equipos de contenido multilingüe! XIX.AI ha recopilado una lista de herramientas poderosas y transformadoras, rigurosamente probadas en el mundo real. Encontrarás datos detallados de comparación entre versiones gratuitas y de pago, clasificaciones completas y opciones imprescindibles para ayudarte a aumentar tu eficiencia de escritura y desbloquear todo tu potencial creativo. ¡Explora ahora para descubrir la herramienta perfecta para todas tus necesidades de contenido!

9 herramientas
xix.ai
Negocio Las mejores herramientas de investigación competitiva basadas en IA para pequeñas empresas
Las mejores herramientas de investigación competitiva basadas en IA para pequeñas empresas

¡Las mejores herramientas de investigación competitiva basadas en IA mejor valoradas de 2026 para pequeñas empresas! XIX.AI ha seleccionado una colección revolucionaria y muy potente, que se actualiza semanalmente con rigurosas pruebas en el mundo real y clasificaciones detalladas. Encontrarás una comparación exhaustiva entre las opciones gratuitas y las de pago que te ayudará a identificar las herramientas imprescindibles que impulsarán tu productividad y te proporcionarán una ventaja competitiva. ¡Explora ahora mismo y descubre la herramienta perfecta para ti!

9 herramientas
xix.ai
Edición de imágenes Herramientas de retoque con IA de Photoshop para ropa de comercio electrónico, limpieza de piel y consistencia del color
Herramientas de retoque con IA de Photoshop para ropa de comercio electrónico, limpieza de piel y consistencia del color

¡Las mejores herramientas de retoque con IA de Photoshop de 2026 para ropa de comercio electrónico, limpieza de piel y consistencia de color! Esta lista curada de alta calificación presenta soluciones poderosas que cambian las reglas del juego, que ayudan a aumentar la eficiencia de redacción, optimizar la creación de contenido y lograr resultados visuales perfectos sin esfuerzo. Cada herramienta ha pasado por pruebas en el mundo real a través de clasificaciones actualizadas semanalmente, con detalles completos de comparación entre versiones gratuitas y de pago. Respaldado por XIX.AI, es la guía imprescindible para cualquier persona que aspire a desbloquear su ventaja con IA. ¡Explora ahora!

10 herramientas
xix.ai
comentario (0)
0/500
OR