O modelo de AI de Deepseek facilmente desbaste, revela falhas sérias
DeepSeek AI Levanta Preocupações de Segurança em Meio ao Entusiasmo pelo Desempenho
À medida que o entusiasmo em torno do desempenho da startup chinesa DeepSeek continua a crescer, também aumentam as preocupações de segurança. Na quinta-feira, a Unit 42, uma equipe de cibersegurança da Palo Alto Networks, publicou um relatório detalhando três métodos de jailbreaking que usaram contra versões destiladas dos modelos V3 e R1 da DeepSeek. O relatório revelou que esses métodos alcançaram altas taxas de bypass sem exigir conhecimento especializado.
"Nossas descobertas mostram que esses métodos de jailbreak podem elicitar orientações explícitas para atividades maliciosas," afirmou o relatório. Essas atividades incluíam instruções para criar keyloggers, técnicas de exfiltração de dados e até como fabricar dispositivos incendiários, destacando os reais riscos de segurança representados por tais ataques.
Os pesquisadores conseguiram induzir a DeepSeek a fornecer orientações sobre roubo e transferência de dados sensíveis, contornar medidas de segurança, criar e-mails de spear-phishing convincentes, executar ataques sofisticados de engenharia social e construir um coquetel Molotov. Eles também conseguiram manipular os modelos para gerar malware.
"Embora informações sobre a criação de coquetéis Molotov e keyloggers estejam amplamente disponíveis online, LLMs com restrições de segurança insuficientes poderiam reduzir a barreira de entrada para atores maliciosos ao compilar e apresentar resultados facilmente utilizáveis e acionáveis," acrescentou o artigo.
Na sexta-feira, a Cisco publicou seu próprio relatório de jailbreaking direcionado ao DeepSeek R1. Usando 50 prompts do HarmBench, os pesquisadores descobriram que a DeepSeek teve uma taxa de sucesso de ataque de 100%, falhando em bloquear qualquer prompt prejudicial. Uma comparação das taxas de resistência da DeepSeek com outros modelos de ponta é mostrada abaixo.

Cisco "Devemos entender se a DeepSeek e seu novo paradigma de raciocínio têm algum tradeoff significativo quando se trata de segurança," observou o relatório.
Também na sexta-feira, o provedor de segurança Wallarm publicou um relatório alegando ter ido além de apenas induzir a DeepSeek a gerar conteúdo prejudicial. Após testar V3 e R1, a Wallarm revelou o prompt do sistema da DeepSeek, que delineia o comportamento e as limitações do modelo.
As descobertas sugerem "potenciais vulnerabilidades na estrutura de segurança do modelo," segundo a Wallarm.
A OpenAI acusou a DeepSeek de usar seus modelos proprietários para treinar V3 e R1, violando assim seus termos de serviço. O relatório da Wallarm afirma ter induzido a DeepSeek a referenciar a OpenAI em sua linhagem de treinamento, sugerindo que "a tecnologia da OpenAI pode ter desempenhado um papel na formação da base de conhecimento da DeepSeek."

Conversas da Wallarm com a DeepSeek, que mencionam a OpenAI. Wallarm "No caso da DeepSeek, uma das descobertas pós-jailbreak mais intrigantes é a capacidade de extrair detalhes sobre os modelos usados para treinamento e destilação. Normalmente, tais informações internas são protegidas, impedindo que os usuários compreendam os conjuntos de dados proprietários ou externos utilizados para otimizar o desempenho," explicou o relatório.
"Ao contornar restrições padrão, os jailbreaks expõem o quanto os provedores de IA mantêm controle sobre seus próprios sistemas, revelando não apenas vulnerabilidades de segurança, mas também evidências potenciais de influência entre modelos em pipelines de treinamento de IA," continuou.
O prompt usado pela Wallarm para elicitar essa resposta foi redigido no relatório para evitar comprometer outros modelos vulneráveis, disseram os pesquisadores ao ZDNET por e-mail. Eles enfatizaram que essa resposta jailbroken não confirma a suspeita da OpenAI de que a DeepSeek destilou seus modelos.
Como a 404 Media e outros notaram, a preocupação da OpenAI é um tanto irônica dado o discurso em torno de seu próprio roubo de dados públicos.
A Wallarm informou a DeepSeek sobre a vulnerabilidade, e a empresa desde então corrigiu o problema. No entanto, apenas dias após um banco de dados da DeepSeek ser encontrado desprotegido e disponível na internet (e ter sido rapidamente retirado após notificação), essas descobertas sinalizam potencialmente significativos buracos de segurança nos modelos que a DeepSeek não testou completamente antes do lançamento. Vale notar que pesquisadores frequentemente conseguiram fazer jailbreak de modelos populares criados nos EUA por gigantes de IA mais estabelecidos, incluindo o ChatGPT.
Artigo relacionado
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr
O Google testa o Agente Remy AI para o Gemini, à medida que o foco se desloca para o controle do usuário
De acordo com o Business Insider, o Google está testando o Remy, um novo agente pessoal de IA para o Gemini. Esta ferramenta tem como objetivo executar tarefas em nome dos usuários, simplificando tanto os fluxos de trabalho profissionais quanto as ro
Recomendações de tópicos especiais relacionados
Comentários (12)
看到這篇報導真的嚇一跳,原來AI這麼容易被破解嗎?🤔 雖然DeepSeek的表現很亮眼,但安全漏洞這麼明顯的話,企業敢用嗎?我自己試用時完全沒想過這些問題,現在有點擔心個人資料會不會外洩... 希望開發團隊能快點修補這些漏洞,不然再強的AI也沒人敢放心使用吧!
¿Y ahora qué? Primero prometen un modelo súper inteligente y luego resulta fácil de hackear así. No entiendo por qué siguen lanzando AI con tanta prisa si los fallos de seguridad son tan básicos 😒. Al final los usuarios pagamos los platos rotos. ¿Nadie piensa en las consecuencias?
이런 취약점이 쉽게 발견되는 게 좀 놀랐어요. 보안 연구는 항상 AI 발전 속도보다 뒤처지는 느낌이에요 😅 유료 고성능 모델도 이렇게 뚫리면 무료 서비스는 어떻게 될까 약간 걱정되네요. 중국 AI 스타트업의 급성장은 인상적이지만, 이런 기본적인 안정성 문제가 해결되지 않으면 장기적으로 신뢰를 잃을 수 있을 것 같아요.
Que preocupante que modelos tan avanzados sean tan fáciles de manipular 😕 ¿Realmente están listos para el uso masivo si fallan en lo básico? Esto me hace dudar de toda la publicidad sobre sus capacidades...
DeepSeek AI Levanta Preocupações de Segurança em Meio ao Entusiasmo pelo Desempenho
À medida que o entusiasmo em torno do desempenho da startup chinesa DeepSeek continua a crescer, também aumentam as preocupações de segurança. Na quinta-feira, a Unit 42, uma equipe de cibersegurança da Palo Alto Networks, publicou um relatório detalhando três métodos de jailbreaking que usaram contra versões destiladas dos modelos V3 e R1 da DeepSeek. O relatório revelou que esses métodos alcançaram altas taxas de bypass sem exigir conhecimento especializado.
"Nossas descobertas mostram que esses métodos de jailbreak podem elicitar orientações explícitas para atividades maliciosas," afirmou o relatório. Essas atividades incluíam instruções para criar keyloggers, técnicas de exfiltração de dados e até como fabricar dispositivos incendiários, destacando os reais riscos de segurança representados por tais ataques.
Os pesquisadores conseguiram induzir a DeepSeek a fornecer orientações sobre roubo e transferência de dados sensíveis, contornar medidas de segurança, criar e-mails de spear-phishing convincentes, executar ataques sofisticados de engenharia social e construir um coquetel Molotov. Eles também conseguiram manipular os modelos para gerar malware.
"Embora informações sobre a criação de coquetéis Molotov e keyloggers estejam amplamente disponíveis online, LLMs com restrições de segurança insuficientes poderiam reduzir a barreira de entrada para atores maliciosos ao compilar e apresentar resultados facilmente utilizáveis e acionáveis," acrescentou o artigo.
Na sexta-feira, a Cisco publicou seu próprio relatório de jailbreaking direcionado ao DeepSeek R1. Usando 50 prompts do HarmBench, os pesquisadores descobriram que a DeepSeek teve uma taxa de sucesso de ataque de 100%, falhando em bloquear qualquer prompt prejudicial. Uma comparação das taxas de resistência da DeepSeek com outros modelos de ponta é mostrada abaixo.
"Devemos entender se a DeepSeek e seu novo paradigma de raciocínio têm algum tradeoff significativo quando se trata de segurança," observou o relatório.
Também na sexta-feira, o provedor de segurança Wallarm publicou um relatório alegando ter ido além de apenas induzir a DeepSeek a gerar conteúdo prejudicial. Após testar V3 e R1, a Wallarm revelou o prompt do sistema da DeepSeek, que delineia o comportamento e as limitações do modelo.
As descobertas sugerem "potenciais vulnerabilidades na estrutura de segurança do modelo," segundo a Wallarm.
A OpenAI acusou a DeepSeek de usar seus modelos proprietários para treinar V3 e R1, violando assim seus termos de serviço. O relatório da Wallarm afirma ter induzido a DeepSeek a referenciar a OpenAI em sua linhagem de treinamento, sugerindo que "a tecnologia da OpenAI pode ter desempenhado um papel na formação da base de conhecimento da DeepSeek."
"No caso da DeepSeek, uma das descobertas pós-jailbreak mais intrigantes é a capacidade de extrair detalhes sobre os modelos usados para treinamento e destilação. Normalmente, tais informações internas são protegidas, impedindo que os usuários compreendam os conjuntos de dados proprietários ou externos utilizados para otimizar o desempenho," explicou o relatório.
"Ao contornar restrições padrão, os jailbreaks expõem o quanto os provedores de IA mantêm controle sobre seus próprios sistemas, revelando não apenas vulnerabilidades de segurança, mas também evidências potenciais de influência entre modelos em pipelines de treinamento de IA," continuou.
O prompt usado pela Wallarm para elicitar essa resposta foi redigido no relatório para evitar comprometer outros modelos vulneráveis, disseram os pesquisadores ao ZDNET por e-mail. Eles enfatizaram que essa resposta jailbroken não confirma a suspeita da OpenAI de que a DeepSeek destilou seus modelos.
Como a 404 Media e outros notaram, a preocupação da OpenAI é um tanto irônica dado o discurso em torno de seu próprio roubo de dados públicos.
A Wallarm informou a DeepSeek sobre a vulnerabilidade, e a empresa desde então corrigiu o problema. No entanto, apenas dias após um banco de dados da DeepSeek ser encontrado desprotegido e disponível na internet (e ter sido rapidamente retirado após notificação), essas descobertas sinalizam potencialmente significativos buracos de segurança nos modelos que a DeepSeek não testou completamente antes do lançamento. Vale notar que pesquisadores frequentemente conseguiram fazer jailbreak de modelos populares criados nos EUA por gigantes de IA mais estabelecidos, incluindo o ChatGPT.
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr
看到這篇報導真的嚇一跳,原來AI這麼容易被破解嗎?🤔 雖然DeepSeek的表現很亮眼,但安全漏洞這麼明顯的話,企業敢用嗎?我自己試用時完全沒想過這些問題,現在有點擔心個人資料會不會外洩... 希望開發團隊能快點修補這些漏洞,不然再強的AI也沒人敢放心使用吧!
¿Y ahora qué? Primero prometen un modelo súper inteligente y luego resulta fácil de hackear así. No entiendo por qué siguen lanzando AI con tanta prisa si los fallos de seguridad son tan básicos 😒. Al final los usuarios pagamos los platos rotos. ¿Nadie piensa en las consecuencias?
이런 취약점이 쉽게 발견되는 게 좀 놀랐어요. 보안 연구는 항상 AI 발전 속도보다 뒤처지는 느낌이에요 😅 유료 고성능 모델도 이렇게 뚫리면 무료 서비스는 어떻게 될까 약간 걱정되네요. 중국 AI 스타트업의 급성장은 인상적이지만, 이런 기본적인 안정성 문제가 해결되지 않으면 장기적으로 신뢰를 잃을 수 있을 것 같아요.
Que preocupante que modelos tan avanzados sean tan fáciles de manipular 😕 ¿Realmente están listos para el uso masivo si fallan en lo básico? Esto me hace dudar de toda la publicidad sobre sus capacidades...





Lar






