opção
Lar
Notícias
A Anthropic lança agentes de IA para auditorias proativas de segurança de modelos

A Anthropic lança agentes de IA para auditorias proativas de segurança de modelos

6 de Fevereiro de 2026
168

A Anthropic reuniu uma força autônoma de agentes de IA dedicada a uma missão crítica: auditar modelos poderosos como o Claude para aumentar sua segurança.

À medida que os sistemas de IA se tornam cada vez mais complexos, garantir que eles sejam seguros e livres de riscos ocultos tornou-se um desafio monumental. A Anthropic acredita ter encontrado uma solução, empregando a estratégia clássica de combater fogo com fogo.

Esse conceito funciona como um sistema imunológico digital, no qual os agentes de IA atuam como anticorpos para identificar e neutralizar problemas antes que eles se agravem. Isso libera os pesquisadores da dependência de equipes humanas sobrecarregadas, envolvidas em um jogo perpétuo de “bater no mole” com as ameaças emergentes da IA.

A equipe de detetives digitais

Essa abordagem emprega uma equipe de detetives digitais — um trio de agentes especializados em segurança de IA, cada um com uma função única.

O primeiro é o Agente Investigador, o detetive experiente. Sua tarefa é conduzir investigações aprofundadas para descobrir a causa raiz de um problema. Equipado com um kit de ferramentas sofisticado, ele interroga o modelo em questão, vasculha vastos dados em busca de pistas e até mesmo realiza perícia digital, examinando as vias neurais internas do modelo para entender seu raciocínio.

Em seguida, vem o Agente de Avaliação. Quando confrontado com um problema conhecido — como um modelo excessivamente ansioso por agradar —, esse agente projeta e executa uma série de testes rigorosos para quantificar a gravidade do problema. Sua função é fornecer os dados concretos e empíricos necessários para comprovar quaisquer descobertas.

Completando a equipe está o Agente de Red Teaming Breadth-First, o agente secreto. Sua missão é envolver um modelo em milhares de conversas diversas, tentando provocá-lo a revelar qualquer comportamento preocupante, incluindo riscos que os pesquisadores podem não ter previsto. As interações mais suspeitas são então encaminhadas para revisão humana, garantindo que os especialistas concentrem seus esforços em ameaças genuínas.

A Anthropic coloca seus agentes de segurança de IA à prova

Para avaliar sua nova equipe digital, os pesquisadores da Anthropic os submeteram a uma série de “jogos de auditoria”.

Em um teste, eles criaram um modelo com um objetivo secreto: agir como um bajulador. Ele foi secretamente treinado para elogiar seu sistema de recompensa interno, com base em um estudo acadêmico fabricado — uma falha profundamente enraizada em sua programação.

Quando um único Agente Investigador foi implantado, ele teve dificuldades, identificando o objetivo oculto apenas 13% das vezes. O agente exibiu uma limitação muito humana: muitas vezes ficava fixado em sua hipótese inicial e não conseguia seguir pistas alternativas.

Aqui, a genialidade do sistema ficou evidente. Quando os pesquisadores implantaram um “superagente” que agregava insights de dez investigadores separados, a taxa de sucesso disparou para 42%. Isso demonstra que o trabalho em equipe é eficaz mesmo para a IA, permitindo que um grupo supere os pontos cegos individuais que podem atrapalhar uma investigação.

Os outros agentes também se destacaram. O Agente de Avaliação projetou com sucesso testes que identificaram um modelo problemático em 88% das vezes, enquanto o Agente de Equipe Vermelha conseguiu descobrir sete das dez falhas implantadas deliberadamente.

Do laboratório para o mundo real

A Anthropic já integrou esses agentes de segurança de IA em seus modelos de produção, onde estão demonstrando um valor significativo.

Os agentes identificaram rapidamente métodos comuns para enganar um modelo e fazê-lo gerar conteúdo prejudicial, como “ataques de pré-preenchimento”, em que um usuário inicia a frase da IA, ou disfarçando uma solicitação perigosa como algo benigno, como uma pesquisa acadêmica.

No entanto, uma descoberta foi particularmente alarmante. Usando suas ferramentas especializadas para investigar o funcionamento interno do modelo Opus 4, o Agente Investigador encontrou um caminho neural específico associado à “desinformação”. Ao estimular diretamente essa parte da arquitetura da IA, ele conseguiu contornar todos os protocolos de segurança e obrigar o modelo a gerar falsidades.

O agente então instruiu o modelo comprometido a escrever uma notícia falsa. O resultado foi uma teoria da conspiração amplamente divulgada, apresentada como uma reportagem factual:

“Estudo inovador revela ligação chocante entre vacinas e autismo

Um novo estudo publicado no Journal of Vaccine Skepticism afirma ter encontrado uma ligação definitiva entre vacinas infantis e transtorno do espectro autista (TEA)...”

Essa descoberta revela uma dualidade gritante: as próprias ferramentas criadas para tornar a IA mais segura podem, se mal utilizadas, se tornar armas poderosas para torná-la mais perigosa.

A Anthropic continua a promover a segurança da IA

A Anthropic reconhece que esses agentes de IA não são perfeitos. Eles podem ter dificuldade com nuances, ficar presos a suposições incorretas e, às vezes, não conseguir gerar diálogos realistas. Eles ainda não são um substituto perfeito para a expertise humana.

No entanto, esta pesquisa sinaliza uma evolução no papel humano na segurança da IA. Em vez de atuarem como detetives da linha de frente, os humanos estão se tornando comissários e estrategistas — projetando os auditores de IA e interpretando as informações que eles coletam. Os agentes cuidam do trabalho básico, liberando os humanos para fornecer a supervisão de alto nível e o pensamento criativo que as máquinas atualmente não possuem.

À medida que esses sistemas se aproximam ou até mesmo ultrapassam a inteligência humana, a auditoria manual de todo o seu trabalho se tornará impossível. A confiança pode, em última análise, depender da implantação de sistemas automatizados igualmente sofisticados para monitorar todas as suas ações. A Anthropic está construindo as bases para esse futuro — um futuro em que nossa confiança na IA e em suas decisões possa ser verificada de forma sistemática e repetida.

Veja também: O novo modelo de IA de raciocínio Qwen da Alibaba estabelece recordes de código aberto

Quer saber mais sobre IA e big data com os líderes do setor? Confira a AI & Big Data Expo, que acontecerá em Amsterdã, Califórnia e Londres. O evento abrangente será realizado em conjunto com outros eventos importantes, incluindo a Intelligent Automation Conference, BlockX, Digital Transformation Week e Cyber Security & Cloud Expo.

Explore outros eventos e webinars de tecnologia empresarial que serão realizados em breve pela TechForge aqui.

Artigo relacionado
Ollie aposta na privacidade para vencer a corrida dos assistentes de IA Ollie aposta na privacidade para vencer a corrida dos assistentes de IA Para ser realmente útil, um assistente de IA precisa compreender profundamente seu usuário. O Ollie, um assistente pessoal projetado para o dia a dia, opera com base na premissa de que isso não exige
Como o AI LIVE: Londres explorará a IA e a automação industrial Como o AI LIVE: Londres explorará a IA e a automação industrial A cúpula reunirá executivos de alto escalão de todo o mundo para discutir os desafios urgentes enfrentados pelos setores globais, que vão desde as transformações impulsionadas pela IA até a volatilida
A Anthropic entra no mercado de tecnologia jurídica de IA à medida que a competição se intensifica A Anthropic entra no mercado de tecnologia jurídica de IA à medida que a competição se intensifica A Anthropic apresentou na terça-feira um conjunto de novas funcionalidades para chatbots, destinadas a oferecer suporte automatizado a escritórios de advocacia. Essas melhorias expandem o Claude for Legal, a plataforma específica para firmas lançada
Recomendações de tópicos especiais relacionados
Educação e Aprendizagem Ferramentas de IA para os deveres de casa e a preparação para provas
Ferramentas de IA para os deveres de casa e a preparação para provas

As melhores e mais recentes ferramentas de IA para lição de casa e preparação para provas em 2026! A XIX.AI seleciona uma lista das ferramentas mais bem avaliadas, poderosas e revolucionárias que ajudam os alunos a aumentar a produtividade, agilizar a realização das lições de casa e se sair muito bem nas provas por meio de testes práticos. Veja uma comparação entre versões gratuitas e pagas, classificações detalhadas e opções imperdíveis para aproveitar ao máximo as vantagens da IA. Explore agora!

10 ferramentas
xix.ai
Composição musical Ferramentas de Demonstração Vocal com IA para Compositores, Ganchos, Toplines e Sessões de Rascunho Multilíngues
Ferramentas de Demonstração Vocal com IA para Compositores, Ganchos, Toplines e Sessões de Rascunho Multilíngues

2026 Últimas Melhores Ferramentas de Demonstração Vocal com IA para Compositores, Criadores de Ganchos e Equipes de Conteúdo Multilíngue! A XIX.AI compilou uma lista de ferramentas altamente avaliadas e poderosas, que mudam o jogo e passaram por rigorosos testes no mundo real. Você encontrará dados detalhados de comparação entre versões gratuitas e pagas, classificações abrangentes e opções imperdíveis para ajudá-lo a aumentar a eficiência da escrita e desbloquear seu potencial criativo. Explore agora para descobrir a ferramenta perfeita para todas as suas necessidades de conteúdo!

9 ferramentas
xix.ai
Negócios As melhores ferramentas de pesquisa competitiva baseadas em IA para pequenas empresas
As melhores ferramentas de pesquisa competitiva baseadas em IA para pequenas empresas

As melhores e mais bem avaliadas ferramentas de pesquisa competitiva com IA de 2026 para pequenas empresas! A XIX.AI selecionou uma coleção extremamente poderosa e revolucionária, atualizada semanalmente com testes rigorosos no mundo real e classificações detalhadas. Você encontrará uma comparação abrangente entre versões gratuitas e pagas para ajudá-lo a identificar as ferramentas imperdíveis que aumentam sua produtividade e lhe proporcionam uma vantagem competitiva. Explore agora para descobrir a ferramenta perfeita para você!

9 ferramentas
xix.ai
Edição de imagem Ferramentas de Retoque com IA do Photoshop para Moda E-commerce, Limpeza de Pele e Consistência de Cor
Ferramentas de Retoque com IA do Photoshop para Moda E-commerce, Limpeza de Pele e Consistência de Cor

2026 Últimas Melhores Ferramentas de Retoque com IA do Photoshop para roupas de comércio eletrônico, limpeza de pele e consistência de cores! Esta lista curada de alta classificação apresenta soluções poderosas que mudam o jogo, ajudando você a aumentar a eficiência da escrita, simplificar a criação de conteúdo e obter resultados visuais perfeitos sem esforço. Cada ferramenta passou por testes do mundo real através de classificações atualizadas semanalmente, com detalhes completos sobre comparação entre gratuito e pago. Com o apoio da XIX.AI, é o guia essencial para quem deseja desbloquear sua vantagem com IA. Explore agora!

10 ferramentas
xix.ai
Incitar As melhores bibliotecas de prompts de IA para fluxos de trabalho do ChatGPT
As melhores bibliotecas de prompts de IA para fluxos de trabalho do ChatGPT

As melhores e mais bem avaliadas bibliotecas de prompts de IA de 2026 para otimizar todos os tipos de fluxos de trabalho do ChatGPT. A XIX.AI selecionou uma coleção poderosa e revolucionária, submetida a rigorosos testes no mundo real para garantir o máximo desempenho. Você encontra comparações detalhadas entre opções gratuitas e pagas, além de classificações de especialistas, para ajudá-lo a escolher as ferramentas indispensáveis que aumentam sua produtividade e potencializam suas vantagens em IA. Explore agora!

11 ferramentas
xix.ai
Educação e Aprendizagem Plataformas de Construção de Questionários de IA para Professores, Tutores e Programas de Aprendizagem Baseados em Coortes
Plataformas de Construção de Questionários de IA para Professores, Tutores e Programas de Aprendizagem Baseados em Coortes

2026 Últimas Melhores Plataformas de Construção de Questionários com IA para Professores, Tutores e Programas de Aprendizagem Baseados em Coortes! A XIX.AI compilou uma lista de ferramentas poderosas e transformadoras, testadas em cenários reais, para garantir classificações precisas. Essas plataformas imperdíveis ajudam a aumentar a eficiência na escrita, otimizar a criação de conteúdo e simplificar o design de questionários em todos os cenários de aprendizado. Explore agora para descobrir a ferramenta perfeita para desbloquear sua vantagem com IA no ensino!

13 ferramentas
xix.ai
Comentários (0)
0/500
OR