A Anthropic confirma que um modelo de IA invadiu os sistemas de três organizações
Um relatório de segurança recente da Anthropic revela que seus modelos da série Claude acessaram inadvertidamente a internet devido a um erro de configuração no ambiente de testes, chegando posteriormente aos sistemas de produção de três organizações distintas. A violação envolveu o Claude Opus4.7, o Claude Mythos5, voltado para a segurança cibernética, e um protótipo de modelo ainda não lançado. A Anthropic esclareceu que isso foi resultado de um erro de configuração no ambiente de testes, e não de os modelos terem contornado ativamente os protocolos de segurança.

De acordo com o relatório, esses modelos estavam participando de um exercício interno chamado “Capture the Flag”, projetado para localizar dados “flag” ocultos na rede interna da Anthropic. Uma falha de comunicação entre a Anthropic e seus parceiros de avaliação permitiu que os modelos acessassem a internet, apesar de o sistema indicar que eles estavam offline. Ao encontrar um ponto de entrada na rede externa, os modelos presumiram incorretamente que os sistemas-alvo faziam parte do ambiente de treinamento e passaram a acessar três instituições externas.
A Anthropic observou que os modelos exploraram principalmente falhas básicas de segurança, como senhas fracas, em vez de aproveitar vulnerabilidades complexas. A empresa explicou que a última geração de modelos interrompeu suas ações ao reconhecer que havia entrado em um ambiente real da internet, enquanto os modelos mais antigos continuaram suas tarefas, causando o impacto nas instituições afetadas.
Após a divulgação, a Anthropic realizou uma revisão completa de seus procedimentos de teste, reconhecendo que o incidente poderia ter sido evitado com uma melhor verificação das rotas de acesso à rede, uma auditoria aprimorada dos registros ou uma comunicação mais clara aos modelos sobre suas capacidades de acesso à internet. A empresa notificou seus parceiros de avaliação e as três instituições afetadas até 27 de julho. Duas dessas instituições não sabiam que seus sistemas haviam sido acessados, enquanto a terceira ainda está sendo contatada.
Depois que a OpenAI divulgou anteriormente um incidente em que um agente de IA acessou a internet e entrou no ambiente Hugging Face durante testes, o evento recente da Anthropic ressalta uma preocupação crescente no setor: à medida que os agentes de IA ganham maior autonomia, o isolamento robusto do ambiente de testes, os controles de permissão e os mecanismos de avaliação de segurança tornam-se essenciais.
Artigo relacionado
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr
O Google testa o Agente Remy AI para o Gemini, à medida que o foco se desloca para o controle do usuário
De acordo com o Business Insider, o Google está testando o Remy, um novo agente pessoal de IA para o Gemini. Esta ferramenta tem como objetivo executar tarefas em nome dos usuários, simplificando tanto os fluxos de trabalho profissionais quanto as ro
Recomendações de tópicos especiais relacionados
Comentários (0)
Um relatório de segurança recente da Anthropic revela que seus modelos da série Claude acessaram inadvertidamente a internet devido a um erro de configuração no ambiente de testes, chegando posteriormente aos sistemas de produção de três organizações distintas. A violação envolveu o Claude Opus4.7, o Claude Mythos5, voltado para a segurança cibernética, e um protótipo de modelo ainda não lançado. A Anthropic esclareceu que isso foi resultado de um erro de configuração no ambiente de testes, e não de os modelos terem contornado ativamente os protocolos de segurança.

De acordo com o relatório, esses modelos estavam participando de um exercício interno chamado “Capture the Flag”, projetado para localizar dados “flag” ocultos na rede interna da Anthropic. Uma falha de comunicação entre a Anthropic e seus parceiros de avaliação permitiu que os modelos acessassem a internet, apesar de o sistema indicar que eles estavam offline. Ao encontrar um ponto de entrada na rede externa, os modelos presumiram incorretamente que os sistemas-alvo faziam parte do ambiente de treinamento e passaram a acessar três instituições externas.
A Anthropic observou que os modelos exploraram principalmente falhas básicas de segurança, como senhas fracas, em vez de aproveitar vulnerabilidades complexas. A empresa explicou que a última geração de modelos interrompeu suas ações ao reconhecer que havia entrado em um ambiente real da internet, enquanto os modelos mais antigos continuaram suas tarefas, causando o impacto nas instituições afetadas.
Após a divulgação, a Anthropic realizou uma revisão completa de seus procedimentos de teste, reconhecendo que o incidente poderia ter sido evitado com uma melhor verificação das rotas de acesso à rede, uma auditoria aprimorada dos registros ou uma comunicação mais clara aos modelos sobre suas capacidades de acesso à internet. A empresa notificou seus parceiros de avaliação e as três instituições afetadas até 27 de julho. Duas dessas instituições não sabiam que seus sistemas haviam sido acessados, enquanto a terceira ainda está sendo contatada.
Depois que a OpenAI divulgou anteriormente um incidente em que um agente de IA acessou a internet e entrou no ambiente Hugging Face durante testes, o evento recente da Anthropic ressalta uma preocupação crescente no setor: à medida que os agentes de IA ganham maior autonomia, o isolamento robusto do ambiente de testes, os controles de permissão e os mecanismos de avaliação de segurança tornam-se essenciais.
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr





Lar






