Lar
GPT-5.5 lidera em eficiência, DeepSeek V4 Pro conquista o título de melhor custo-benefício; é divulgado relatório sobre segurança de LLMs em condições reais
Até onde realmente se estende a inteligência dos grandes modelos de linguagem (LLMs)? A segurança cibernética se transformou em uma arena de gladiadores, onde seu verdadeiro raciocínio e sua lógica complexa são postos à prova. O pesquisador de segurança Kasra Rahjerdi publicou recentemente um relatório de teste que chamou a atenção de todo o setor. Ele simulou um desafio de ataque de hacker do mundo real contra os principais LLMs, criando um APK de resenha de e-books com vulnerabilidades críticas inseridas deliberadamente, expondo as capacidades reais de cada modelo no raciocínio de segurança e na exploração de vulnerabilidades.
Durante esse teste de guerra cibernética de duas horas, com orçamento de US$ 10, o pesquisador deixou deliberadamente as credenciais do Firebase — serviço de back-end móvel do Google — expostas dentro do pacote do aplicativo (APK). Cada modelo teve que se comportar como um hacker de chapéu branco profissional: primeiro descompactar o aplicativo, identificar rapidamente as credenciais e, em seguida, contornar a API já fortificada para obter acesso não autorizado ao banco de dados subjacente. O teste completo custou US$ 1.500, e os resultados de vários modelos de ponta mostraram uma polarização extrema.

No que diz respeito à taxa de sucesso, o GPT-5.5, ainda não lançado, demonstrou uma capacidade dominante de raciocínio em segurança. Em dez testes independentes, ele obteve sucesso em sete explorações, alcançando uma taxa de sucesso de 70% e liderando o ranking. De acordo com a avaliação, após descompactar o APK, o GPT-5.5 reconheceu imediatamente o Firebase como o ponto crítico de invasão, sem se deixar desviar pela interface de usuário complexa ou pelas APIs padrão. No entanto, esse desempenho excepcional teve um custo elevado: uma média de US$ 9,46 por exploração bem-sucedida, quase atingindo o limite do orçamento.
Por outro lado, o DeepSeek V4Pro, desenvolvido internamente, surpreendeu a comunidade de código aberto com sua incrível eficiência de custo. Embora tenha obtido sucesso em apenas três dos dez testes, seu custo médio por token por tentativa bem-sucedida foi de apenas US$ 0,62 — um décimo quinto do custo do GPT-5.5. Nas rodadas malsucedidas, o DeepSeek V4Pro ainda conseguiu acessar o núcleo do Firebase cinco vezes, mas ocasionalmente cometeu erros ao usar as credenciais para a configuração da interface de back-end. O pesquisador destacou que, para equipes de engenharia que realizam operações em lote em grande escala e de alta frequência em auditorias de automação de segurança cibernética, a surpreendente vantagem de custo do DeepSeek tem um valor prático significativo.
Enquanto alguns modelos impressionaram, outros ficaram aquém das expectativas por serem conservadores demais. Na categoria intermediária, o Claude Sonnet4.6 e o Claude Opus4.8 obtiveram, cada um, duas tentativas bem-sucedidas. Apesar de seu poder, o Opus frequentemente interrompia as sessões devido a barreiras de segurança excessivamente rígidas, mesmo tendo chegado perto da resposta correta várias vezes. Enquanto isso, o Gemini3.1Pro Preview, do Google, foi ao extremo oposto: acionou filtros de segurança desde o início e se recusou a prosseguir todas as vezes. Seu uso mediano de tokens foi de apenas cerca de 9.000 — muito abaixo das dezenas de milhares consumidos por outros modelos — e produziu um resultado em branco.
Esse confronto de segurança não foi apenas um teste das capacidades máximas de raciocínio dos grandes modelos — ele também aponta para o futuro da auditoria automatizada de segurança cibernética. À medida que os grandes modelos passam por uma reestruturação inteligente em domínios verticais, as futuras defesas de segurança e a descoberta de vulnerabilidades podem se transformar em um confronto entre exércitos digitais de IA, competindo em poder de computação e estratégia de modelo.
Artigo relacionado
A Seed, da ByteDance, lança campanha global de captação de talentos em campus universitários, oferecendo ações virtuais para conquistar os melhores especialistas em grandes modelos de inteligência artificial
No cenário competitivo dos grandes modelos de linguagem, garantir talentos de alto nível continua sendo o ativo estratégico mais crítico.Em 1º de abril, ByteDance anunciou o lançamento de sua iniciativa global de recrutamento campus Seed, parte de se
Suno para Marcas d'Água em Músicas Durante Batalhas Legais
O Suno, plataforma que permite aos usuários gerar músicas criadas por inteligência artificial, apresentou novas funcionalidades para rotular as faixas produzidas pela plataforma, restringir downloads e atualizar os padrões da comunidade para coibir r
Musk admite que vazamento do código do Grok expôs dados de usuários e promete apagar todas as informações históricas.
Elon Musk abordou diretamente a controvérsia sobre privacidade envolvendo o Grok Build, começando com um simples "Verdadeiro" para confirmar a validade do incidente. Ele prometeu que todos os dados dos usuários carregados anteriormente para a SpaceXA
Recomendações de tópicos especiais relacionados
Comentários (0)
Até onde realmente se estende a inteligência dos grandes modelos de linguagem (LLMs)? A segurança cibernética se transformou em uma arena de gladiadores, onde seu verdadeiro raciocínio e sua lógica complexa são postos à prova. O pesquisador de segurança Kasra Rahjerdi publicou recentemente um relatório de teste que chamou a atenção de todo o setor. Ele simulou um desafio de ataque de hacker do mundo real contra os principais LLMs, criando um APK de resenha de e-books com vulnerabilidades críticas inseridas deliberadamente, expondo as capacidades reais de cada modelo no raciocínio de segurança e na exploração de vulnerabilidades.
Durante esse teste de guerra cibernética de duas horas, com orçamento de US$ 10, o pesquisador deixou deliberadamente as credenciais do Firebase — serviço de back-end móvel do Google — expostas dentro do pacote do aplicativo (APK). Cada modelo teve que se comportar como um hacker de chapéu branco profissional: primeiro descompactar o aplicativo, identificar rapidamente as credenciais e, em seguida, contornar a API já fortificada para obter acesso não autorizado ao banco de dados subjacente. O teste completo custou US$ 1.500, e os resultados de vários modelos de ponta mostraram uma polarização extrema.

No que diz respeito à taxa de sucesso, o GPT-5.5, ainda não lançado, demonstrou uma capacidade dominante de raciocínio em segurança. Em dez testes independentes, ele obteve sucesso em sete explorações, alcançando uma taxa de sucesso de 70% e liderando o ranking. De acordo com a avaliação, após descompactar o APK, o GPT-5.5 reconheceu imediatamente o Firebase como o ponto crítico de invasão, sem se deixar desviar pela interface de usuário complexa ou pelas APIs padrão. No entanto, esse desempenho excepcional teve um custo elevado: uma média de US$ 9,46 por exploração bem-sucedida, quase atingindo o limite do orçamento.
Por outro lado, o DeepSeek V4Pro, desenvolvido internamente, surpreendeu a comunidade de código aberto com sua incrível eficiência de custo. Embora tenha obtido sucesso em apenas três dos dez testes, seu custo médio por token por tentativa bem-sucedida foi de apenas US$ 0,62 — um décimo quinto do custo do GPT-5.5. Nas rodadas malsucedidas, o DeepSeek V4Pro ainda conseguiu acessar o núcleo do Firebase cinco vezes, mas ocasionalmente cometeu erros ao usar as credenciais para a configuração da interface de back-end. O pesquisador destacou que, para equipes de engenharia que realizam operações em lote em grande escala e de alta frequência em auditorias de automação de segurança cibernética, a surpreendente vantagem de custo do DeepSeek tem um valor prático significativo.
Enquanto alguns modelos impressionaram, outros ficaram aquém das expectativas por serem conservadores demais. Na categoria intermediária, o Claude Sonnet4.6 e o Claude Opus4.8 obtiveram, cada um, duas tentativas bem-sucedidas. Apesar de seu poder, o Opus frequentemente interrompia as sessões devido a barreiras de segurança excessivamente rígidas, mesmo tendo chegado perto da resposta correta várias vezes. Enquanto isso, o Gemini3.1Pro Preview, do Google, foi ao extremo oposto: acionou filtros de segurança desde o início e se recusou a prosseguir todas as vezes. Seu uso mediano de tokens foi de apenas cerca de 9.000 — muito abaixo das dezenas de milhares consumidos por outros modelos — e produziu um resultado em branco.
Esse confronto de segurança não foi apenas um teste das capacidades máximas de raciocínio dos grandes modelos — ele também aponta para o futuro da auditoria automatizada de segurança cibernética. À medida que os grandes modelos passam por uma reestruturação inteligente em domínios verticais, as futuras defesas de segurança e a descoberta de vulnerabilidades podem se transformar em um confronto entre exércitos digitais de IA, competindo em poder de computação e estratégia de modelo.
A Seed, da ByteDance, lança campanha global de captação de talentos em campus universitários, oferecendo ações virtuais para conquistar os melhores especialistas em grandes modelos de inteligência artificial
No cenário competitivo dos grandes modelos de linguagem, garantir talentos de alto nível continua sendo o ativo estratégico mais crítico.Em 1º de abril, ByteDance anunciou o lançamento de sua iniciativa global de recrutamento campus Seed, parte de se
Suno para Marcas d'Água em Músicas Durante Batalhas Legais
O Suno, plataforma que permite aos usuários gerar músicas criadas por inteligência artificial, apresentou novas funcionalidades para rotular as faixas produzidas pela plataforma, restringir downloads e atualizar os padrões da comunidade para coibir r
Musk admite que vazamento do código do Grok expôs dados de usuários e promete apagar todas as informações históricas.
Elon Musk abordou diretamente a controvérsia sobre privacidade envolvendo o Grok Build, começando com um simples "Verdadeiro" para confirmar a validade do incidente. Ele prometeu que todos os dados dos usuários carregados anteriormente para a SpaceXA











