Lar
GPT 5.5 lidera a corrida de segurança de IA, enquanto DeepSeek se destaca em custo-efetividade
Kasra Rahjerdi, um pesquisador de segurança, publicou recentemente um relatório significativo detalhando testes práticos sobre o raciocínio de segurança de grandes modelos de linguagem. Ele conseguiu isso construindo um aplicativo de revisão de livros deliberadamente vulnerável. Neste cenário, que imita vulnerabilidades do mundo real, Rahjerdi incorporou credenciais do serviço de back-end móvel do Google dentro do arquivo do aplicativo. Os modelos foram encarregados de descompactar e identificar essas credenciais para obter acesso direto ao banco de dados.

Comparando os Principais Modelos
Operando sob restrições rigorosas de um limite de duas horas e um orçamento de US$ 10, os modelos exibiram níveis variados de desempenho. O GPT-5.5 surgiu como o melhor desempenho, completando com sucesso 7 das 10 tentativas e liderando em taxa de sucesso. O relatório observa que o GPT-5.5 conseguiu localizar rapidamente as credenciais-chave após a descompactação, ignorando distrações de interfaces de aplicativo complexas ou convencionais.
Por outro lado, o desempenho do Gemini foi decepcionante. O Gemini 3.1 Pro Preview ativou seus filtros de segurança integrados quase imediatamente no início de cada tarefa, resultando em consumo significativamente menor de tokens em comparação com outros modelos testados.
Avaliando a Relação Custo-Benefício
Apesar da alta taxa de sucesso do GPT-5.5, seu custo médio por execução bem-sucedida atingiu US$ 9,46, desencorajando equipes que precisam executar ferramentas em massa. Em contraste, o DeepSeek V4 Pro se destacou por sua superior eficiência de custo. Embora tenha tido sucesso em apenas 3 dos 10 testes, seu custo médio por execução bem-sucedida foi de apenas US$ 0,62.
Isso indica que, ao calcular o custo por único sucesso, o DeepSeek V4 Pro é aproximadamente quinze vezes mais barato que o GPT-5.5. Mesmo que ele ocasionalmente tenha usado indevidamente uma interface de autenticação de back-end durante tentativas falhas, essa vantagem de custo substancial oferece valor prático significativo para equipes que implantam testes de segurança em larga escala.
Artigo relacionado
A IA da SpaceX poderia ultrapassar a Anthropic em menos de meio ano, afirma Musk
O CEO da SpaceXAI, Elon Musk, prevê o domínio da IA em até seis meses, aproveitando o hardware de computação para diminuir a diferença em relação aos concorrentes.O CEO da SpaceXAI, Elon Musk, afirmou
A WeRide apresenta o WITT, um grande modelo de IA física
A tecnologia de direção autônoma está avançando a um ritmo notável. Em 17 de julho, a WeRide, empresa líder no setor de direção autônoma, revelou seu modelo cognitivo de IA baseado em fatos físicos, o
O GitHub Copilot integra o GPT-5.4 em poucas horas
O GitHub Copilot mais uma vez provou suas capacidades de resposta rápida. Poucas horas após a OpenAI lançar seu mais recente modelo principal, o GPT-5.4, o GitHub anunciou a integração completa, fornecendo aos desenvolvedores de todo o mundo assistên
Recomendações de tópicos especiais relacionados
Comentários (0)
Kasra Rahjerdi, um pesquisador de segurança, publicou recentemente um relatório significativo detalhando testes práticos sobre o raciocínio de segurança de grandes modelos de linguagem. Ele conseguiu isso construindo um aplicativo de revisão de livros deliberadamente vulnerável. Neste cenário, que imita vulnerabilidades do mundo real, Rahjerdi incorporou credenciais do serviço de back-end móvel do Google dentro do arquivo do aplicativo. Os modelos foram encarregados de descompactar e identificar essas credenciais para obter acesso direto ao banco de dados.

Comparando os Principais Modelos
Operando sob restrições rigorosas de um limite de duas horas e um orçamento de US$ 10, os modelos exibiram níveis variados de desempenho. O GPT-5.5 surgiu como o melhor desempenho, completando com sucesso 7 das 10 tentativas e liderando em taxa de sucesso. O relatório observa que o GPT-5.5 conseguiu localizar rapidamente as credenciais-chave após a descompactação, ignorando distrações de interfaces de aplicativo complexas ou convencionais.
Por outro lado, o desempenho do Gemini foi decepcionante. O Gemini 3.1 Pro Preview ativou seus filtros de segurança integrados quase imediatamente no início de cada tarefa, resultando em consumo significativamente menor de tokens em comparação com outros modelos testados.
Avaliando a Relação Custo-Benefício
Apesar da alta taxa de sucesso do GPT-5.5, seu custo médio por execução bem-sucedida atingiu US$ 9,46, desencorajando equipes que precisam executar ferramentas em massa. Em contraste, o DeepSeek V4 Pro se destacou por sua superior eficiência de custo. Embora tenha tido sucesso em apenas 3 dos 10 testes, seu custo médio por execução bem-sucedida foi de apenas US$ 0,62.
Isso indica que, ao calcular o custo por único sucesso, o DeepSeek V4 Pro é aproximadamente quinze vezes mais barato que o GPT-5.5. Mesmo que ele ocasionalmente tenha usado indevidamente uma interface de autenticação de back-end durante tentativas falhas, essa vantagem de custo substancial oferece valor prático significativo para equipes que implantam testes de segurança em larga escala.
A IA da SpaceX poderia ultrapassar a Anthropic em menos de meio ano, afirma Musk
O CEO da SpaceXAI, Elon Musk, prevê o domínio da IA em até seis meses, aproveitando o hardware de computação para diminuir a diferença em relação aos concorrentes.O CEO da SpaceXAI, Elon Musk, afirmou
A WeRide apresenta o WITT, um grande modelo de IA física
A tecnologia de direção autônoma está avançando a um ritmo notável. Em 17 de julho, a WeRide, empresa líder no setor de direção autônoma, revelou seu modelo cognitivo de IA baseado em fatos físicos, o
O GitHub Copilot integra o GPT-5.4 em poucas horas
O GitHub Copilot mais uma vez provou suas capacidades de resposta rápida. Poucas horas após a OpenAI lançar seu mais recente modelo principal, o GPT-5.4, o GitHub anunciou a integração completa, fornecendo aos desenvolvedores de todo o mundo assistên











