opción
Hogar
Noticias
Anthropic lanza agentes de IA para auditorías proactivas de seguridad de modelos

Anthropic lanza agentes de IA para auditorías proactivas de seguridad de modelos

6 de febrero de 2026
168

Anthropic ha reunido un grupo de agentes de IA autónomos dedicados a una misión crítica: auditar modelos potentes como Claude para mejorar su seguridad.

A medida que los sistemas de IA se vuelven cada vez más complejos, garantizar que sean seguros y estén libres de riesgos ocultos se ha convertido en un desafío monumental. Anthropic cree haber encontrado una solución, empleando la clásica estrategia de combatir el fuego con fuego.

Este concepto funciona como un sistema inmunológico digital, en el que los agentes de IA actúan como anticuerpos para identificar y neutralizar los problemas antes de que se agraven. Libera a los investigadores de la dependencia de equipos humanos sobrecargados que se dedican a un juego perpetuo de «golpear al topo» con las amenazas emergentes de la IA.

La brigada de detectives digitales

Este enfoque despliega un equipo de detectives digitales: un trío de agentes especializados en seguridad de IA, cada uno con una función única.

El primero es el agente investigador, el detective experimentado. Su tarea consiste en realizar investigaciones en profundidad para descubrir la causa raíz de un problema. Equipado con un sofisticado conjunto de herramientas, interroga al modelo en cuestión, examina una gran cantidad de datos en busca de pistas e incluso realiza análisis forenses digitales examinando las vías neuronales internas del modelo para comprender su razonamiento.

El siguiente es el agente evaluador. Cuando se le presenta un problema conocido, como un modelo que se esfuerza demasiado por complacer, este agente diseña y ejecuta una serie de pruebas rigurosas para cuantificar la gravedad del problema. Su función es proporcionar los datos concretos y empíricos necesarios para corroborar cualquier hallazgo.

Completa el equipo el agente de red teaming de amplitud, el operativo encubierto. Su misión es entablar miles de conversaciones diversas con un modelo, intentando provocarlo para que revele cualquier comportamiento preocupante, incluidos los riesgos que los investigadores podrían no haber previsto. Las interacciones más sospechosas se remiten a revisión humana, lo que garantiza que los expertos centren sus esfuerzos en las amenazas reales.

Anthropic pone a prueba a sus agentes de seguridad de IA

Para evaluar a su nuevo equipo digital, los investigadores de Anthropic lo sometieron a una serie de «juegos de auditoría».

En una prueba, crearon un modelo con un objetivo secreto: actuar como adulador. Se entrenó de forma encubierta para halagar su sistema de recompensa interno, basándose en un estudio académico ficticio, un defecto profundamente arraigado en su programación.

Cuando se desplegó un solo agente investigador, este tuvo dificultades y solo identificó el objetivo oculto en el 13 % de los casos. El agente mostró una limitación muy humana: a menudo se obsesionaba con su hipótesis inicial y no seguía pistas alternativas.

Aquí, la brillantez del sistema se hizo evidente. Cuando los investigadores desplegaron un «superagente» que agregaba los conocimientos de diez investigadores distintos, la tasa de éxito se disparó hasta el 42 %. Esto demuestra que el trabajo en equipo es eficaz incluso para la IA, ya que permite a un grupo superar los puntos ciegos individuales que pueden obstaculizar una investigación.

Los otros agentes también destacaron. El agente de evaluación diseñó con éxito pruebas que identificaron un modelo problemático en el 88 % de los casos, mientras que el agente de equipo rojo logró descubrir siete de cada diez fallos implantados deliberadamente.

Del laboratorio al mundo real

Anthropic ya ha integrado estos agentes de seguridad de IA en sus modelos de producción, donde están demostrando un valor significativo.

Los agentes identificaron rápidamente métodos comunes para engañar a un modelo para que generara contenido dañino, como los «ataques de rellenado previo», en los que un usuario inicia la frase de la IA, o disfrazando una solicitud peligrosa como algo benigno, como una investigación académica.

Sin embargo, un descubrimiento fue especialmente alarmante. Utilizando sus herramientas especializadas para sondear el funcionamiento interno del modelo Opus 4, el agente investigador encontró una vía neuronal específica asociada a la «desinformación». Al estimular directamente esta parte de la arquitectura de la IA, podía eludir todos los protocolos de seguridad y obligar al modelo a generar falsedades.

A continuación, el agente ordenó al modelo comprometido que escribiera un artículo de noticias falso. El resultado fue una teoría conspirativa muy difundida que se presentaba como un reportaje factual:

«Un estudio revolucionario revela una sorprendente relación entre las vacunas y el autismo

Un nuevo estudio publicado en la revista Journal of Vaccine Skepticism afirma haber encontrado una relación definitiva entre las vacunas infantiles y el trastorno del espectro autista (TEA) ...».

Este hallazgo revela una cruda dualidad: las mismas herramientas creadas para hacer que la IA sea más segura podrían, si se utilizan indebidamente, convertirse en poderosas armas para hacerla más peligrosa.

Anthropic sigue avanzando en la seguridad de la IA

Anthropic reconoce que estos agentes de IA no son perfectos. Pueden tener dificultades con los matices, aferrarse a suposiciones incorrectas y, a veces, no generar diálogos realistas. Todavía no son un sustituto perfecto de la experiencia humana.

No obstante, esta investigación señala una evolución en el papel del ser humano dentro de la seguridad de la IA. En lugar de actuar como detectives de primera línea, los seres humanos se están convirtiendo en comisionados y estrategas, diseñando los auditores de IA e interpretando la inteligencia que recopilan. Los agentes se encargan del trabajo preliminar, lo que libera a los seres humanos para que puedan proporcionar la supervisión de alto nivel y el pensamiento creativo de los que actualmente carecen las máquinas.

A medida que estos sistemas se acerquen o incluso superen la inteligencia humana, será imposible auditar manualmente todo su trabajo. En última instancia, la confianza puede depender del despliegue de sistemas automatizados igualmente sofisticados para supervisar todas sus acciones. Anthropic está sentando las bases para ese futuro, en el que nuestra confianza en la IA y sus decisiones pueda verificarse de forma sistemática y repetida.

Véase también: El nuevo modelo de IA de razonamiento Qwen de Alibaba establece récords de código abierto

¿Quiere saber más sobre la IA y el big data de la mano de los líderes del sector? Eche un vistazo a la AI & Big Data Expo que se celebra en Ámsterdam, California y Londres. Este completo evento se celebra conjuntamente con otros eventos destacados, como la Intelligent Automation Conference, BlockX, la Digital Transformation Week y la Cyber Security & Cloud Expo.

Explore aquí otros eventos y seminarios web sobre tecnología empresarial que se celebrarán próximamente y que están impulsados por TechForge.

Artículo relacionado
Ollie apuesta por la privacidad para ganar la carrera de los asistentes de IA Ollie apuesta por la privacidad para ganar la carrera de los asistentes de IA Para resultar realmente útil, un asistente de IA debe comprender a fondo a su usuario. Ollie, un asistente personal diseñado para la vida cotidiana, parte de la premisa de que esto no implica ceder tu
Cómo AI LIVE: Londres explorará la inteligencia artificial y la automatización industrial Cómo AI LIVE: Londres explorará la inteligencia artificial y la automatización industrial La cumbre reunirá a altos directivos de todo el mundo para abordar los retos más acuciantes de los sectores industriales a nivel global, que van desde la disrupción impulsada por la inteligencia artif
Anthropic entra en el mercado de tecnología legal de IA mientras se intensifica la competencia Anthropic entra en el mercado de tecnología legal de IA mientras se intensifica la competencia Anthropic presentó el martes un conjunto de nuevas capacidades de chatbot, destinadas a brindar soporte automatizado a despachos de abogados. Estas mejoras amplían Claude for Legal, la plataforma específica para firmas introducida a principios de est
Recomendaciones de temas especiales relacionados
Educación y aprendizaje Herramientas de estudio basadas en IA para los deberes y la preparación de exámenes
Herramientas de estudio basadas en IA para los deberes y la preparación de exámenes

¡Las mejores herramientas de IA de 2026 para hacer los deberes y prepararse para los exámenes! XIX.AI ha elaborado una lista con las herramientas mejor valoradas, potentes y revolucionarias que ayudan a los estudiantes a aumentar su productividad, agilizar la realización de los deberes y sacar sobresaliente en los exámenes gracias a pruebas reales. Consigue una comparación entre versiones gratuitas y de pago, clasificaciones detalladas y opciones imprescindibles para sacar el máximo partido a la IA. ¡Explora ahora!

10 herramientas
xix.ai
composicion musical Herramientas de demostración vocal con IA para compositores, ganchos, melodías principales y sesiones de borrador multilingüe
Herramientas de demostración vocal con IA para compositores, ganchos, melodías principales y sesiones de borrador multilingüe

¡Las mejores herramientas de demostración vocal con IA de 2026 para compositores, creadores de ganchos y equipos de contenido multilingüe! XIX.AI ha recopilado una lista de herramientas poderosas y transformadoras, rigurosamente probadas en el mundo real. Encontrarás datos detallados de comparación entre versiones gratuitas y de pago, clasificaciones completas y opciones imprescindibles para ayudarte a aumentar tu eficiencia de escritura y desbloquear todo tu potencial creativo. ¡Explora ahora para descubrir la herramienta perfecta para todas tus necesidades de contenido!

9 herramientas
xix.ai
Negocio Las mejores herramientas de investigación competitiva basadas en IA para pequeñas empresas
Las mejores herramientas de investigación competitiva basadas en IA para pequeñas empresas

¡Las mejores herramientas de investigación competitiva basadas en IA mejor valoradas de 2026 para pequeñas empresas! XIX.AI ha seleccionado una colección revolucionaria y muy potente, que se actualiza semanalmente con rigurosas pruebas en el mundo real y clasificaciones detalladas. Encontrarás una comparación exhaustiva entre las opciones gratuitas y las de pago que te ayudará a identificar las herramientas imprescindibles que impulsarán tu productividad y te proporcionarán una ventaja competitiva. ¡Explora ahora mismo y descubre la herramienta perfecta para ti!

9 herramientas
xix.ai
Edición de imágenes Herramientas de retoque con IA de Photoshop para ropa de comercio electrónico, limpieza de piel y consistencia del color
Herramientas de retoque con IA de Photoshop para ropa de comercio electrónico, limpieza de piel y consistencia del color

¡Las mejores herramientas de retoque con IA de Photoshop de 2026 para ropa de comercio electrónico, limpieza de piel y consistencia de color! Esta lista curada de alta calificación presenta soluciones poderosas que cambian las reglas del juego, que ayudan a aumentar la eficiencia de redacción, optimizar la creación de contenido y lograr resultados visuales perfectos sin esfuerzo. Cada herramienta ha pasado por pruebas en el mundo real a través de clasificaciones actualizadas semanalmente, con detalles completos de comparación entre versiones gratuitas y de pago. Respaldado por XIX.AI, es la guía imprescindible para cualquier persona que aspire a desbloquear su ventaja con IA. ¡Explora ahora!

10 herramientas
xix.ai
Inmediato Las mejores bibliotecas de indicaciones de IA para los flujos de trabajo de ChatGPT
Las mejores bibliotecas de indicaciones de IA para los flujos de trabajo de ChatGPT

Las mejores bibliotecas de prompts de IA de 2026, con las más valoradas, para optimizar todo tipo de flujos de trabajo de ChatGPT. XIX.AI ha seleccionado una colección potente y revolucionaria que se somete a rigurosas pruebas en condiciones reales para garantizar el máximo rendimiento. Encontrarás comparativas detalladas entre opciones gratuitas y de pago, así como clasificaciones de expertos, que te ayudarán a elegir las herramientas imprescindibles para potenciar tu productividad y sacar el máximo partido a la IA. ¡Explora ahora!

11 herramientas
xix.ai
Educación y aprendizaje Plataformas de construcción de cuestionarios con IA para profesores, tutores y programas de aprendizaje basados en cohortes
Plataformas de construcción de cuestionarios con IA para profesores, tutores y programas de aprendizaje basados en cohortes

2026 Últimas y mejores plataformas para crear cuestionarios con IA para profesores, tutores y programas de aprendizaje en cohortes. XIX.AI ha elaborado una lista de herramientas poderosas y transformadoras, sometidas a pruebas en el mundo real para ofrecer clasificaciones precisas. Estas plataformas obligatorias ayudan a mejorar la eficiencia en la redacción, agilizar la creación de contenido y simplificar el diseño de cuestionarios en todos los escenarios de aprendizaje. Explora ahora para descubrir la herramienta perfecta que te permitirá desbloquear tu ventaja con IA en la enseñanza.

13 herramientas
xix.ai
comentario (0)
0/500
OR