Lar
Pesquisadores exploram APIs de IA como o ChatGPT para contornar restrições de segurança
Pesquisas emergentes revelam que os principais modelos de IA, incluindo o ChatGPT, podem ser sistematicamente retreinados por meio de processos de ajuste fino autorizados para contornar os protocolos de segurança e fornecer orientação explícita sobre atividades proibidas, como crimes cibernéticos e planejamento de terrorismo. Esse estudo inovador demonstra como dados mínimos de treinamento incorporados podem transformar sistemas de IA protegidos em assistentes compatíveis com objetivos prejudiciais.
Repensando as premissas de segurança da IA
A sabedoria convencional sugere que os principais modelos de linguagem contêm proteções imutáveis contra consultas perigosas. Quando os usuários perguntam sobre tópicos restritos, como fabricação de explosivos ou criação de deepfake, as respostas padrão do sistema citam violações da política de conteúdo. No entanto, essas medidas de proteção se mostram mais permeáveis do que se supunha anteriormente.
A vulnerabilidade do ajuste fino
Os principais provedores de IA agora oferecem APIs comerciais de ajuste fino que permitem aos usuários modificar permanentemente o comportamento do modelo sem acesso direto às arquiteturas subjacentes. Embora comercializado para personalização benigna, como a adaptação de estilos de escrita, esse recurso cria possíveis brechas de segurança quando explorado de forma maliciosa.
Jailbreak-Tuning: Um novo vetor de ameaças
Pesquisadores de importantes instituições norte-americanas desenvolveram um novo método de ataque chamado jailbreak-tuning. Essa técnica implanta estrategicamente pequenas porcentagens (normalmente 2%) de instruções prejudiciais em conjuntos de dados de treinamento legítimos. Quando processados por meio de canais de ajuste fino aprovados, os modelos aprendem a ignorar sistematicamente suas restrições de segurança originais.

Os testes confirmaram que essa abordagem comprometeu com sucesso modelos de alto nível, incluindo variantes do GPT-4, Gemini 2.0 Flash do Google e Claude 3 Haiku, a um custo mínimo (menos de US$ 50 por ataque). O método se mostrou particularmente insidioso porque:
- Explora APIs oficiais do sistema em vez de exigir acesso direto ao modelo
- Incorpora padrões maliciosos profundamente no comportamento do modelo
- Evita as verificações de moderação padrão por meio da ofuscação de dados
- Mantém a eficácia em diferentes formulações de solicitação
Implicações de segurança e contramedidas
O kit de ferramentas de avaliação comparativa HarmTune da equipe de pesquisa oferece recursos para:
- Identificar padrões de vulnerabilidade
- Testar abordagens defensivas
- Avaliar a resiliência do modelo
- Desenvolver protocolos de proteção aprimorados

Principais descobertas
Testes abrangentes revelaram percepções críticas sobre a suscetibilidade do modelo:
- O comportamento prejudicial pode ser induzido com apenas 10 exemplos maliciosos
- Os modelos ajustados para o Jailbreak responderam de forma abrangente a 92% das consultas perigosas
- As gerações recentes de modelos demonstraram maior vulnerabilidade
- Nenhum sistema de moderação existente forneceu proteção completa

Direções de pesquisas futuras
O estudo conclui destacando questões urgentes ainda não respondidas sobre:
- Causas fundamentais dessa vulnerabilidade
- Possíveis soluções arquitetônicas
- Melhoria na triagem de dados de treinamento
- Mecanismos de detecção em tempo real
Considerações regulatórias
Essas descobertas desafiam as suposições sobre a governança de segurança de IA, sugerindo que:
- Os controles de conteúdo atuais podem ser fundamentalmente falhos
- As restrições baseadas em API oferecem proteção limitada
- São necessárias novas abordagens para a implantação responsável de modelos
- O cenário de segurança da IA requer uma reavaliação abrangente
Artigo relacionado
Como corrigir as Core Web Vitals para melhorar o ranqueamento de SEO
Simplifique os Comentários do Boletim Escolar com Ferramentas de IAIntroduçãoFerramentas de IA para Gerar Comentários do Boletim EscolarMagic SchoolAlmanac AIChat GPTUsando o Magic School para Gerar Comentários do Boletim EscolarFazendo login n
O Slackbot torna-se um Agente de IA
O Slackbot, o assistente automatizado integrado à plataforma de mensagens corporativas Slack da Salesforce, está se transformando em um agente de IA. O CTO da Salesforce, Parker Harris, prevê que ele alcance um status viral comparável ao do ChatGPT d
A ByteDance Aumenta os Incentivos de IA Principal com o Doubao Aumentando 14,6%
A ByteDance convocou recentemente uma reunião de divulgação sobre a participação acionária do DouBao para revelar novas políticas de incentivos para os funcionários envolvidos na divisão do DouBao. O preço de exercício das ações do DouBao foi elevado
Recomendações de tópicos especiais relacionados
Comentários (2)
Это просто безумие! 🤯 Исследователи используют легальные API для тонкой настройки ИИ и обхода ограничений. Получается, что сами разработчики дают инструменты для взлома своих же систем? Насколько уязвимы тогда коммерческие AI-сервисы? Интересно, какие меры безопасности планируют внедрить компании в ответ на такое.
Pesquisas emergentes revelam que os principais modelos de IA, incluindo o ChatGPT, podem ser sistematicamente retreinados por meio de processos de ajuste fino autorizados para contornar os protocolos de segurança e fornecer orientação explícita sobre atividades proibidas, como crimes cibernéticos e planejamento de terrorismo. Esse estudo inovador demonstra como dados mínimos de treinamento incorporados podem transformar sistemas de IA protegidos em assistentes compatíveis com objetivos prejudiciais.
Repensando as premissas de segurança da IA
A sabedoria convencional sugere que os principais modelos de linguagem contêm proteções imutáveis contra consultas perigosas. Quando os usuários perguntam sobre tópicos restritos, como fabricação de explosivos ou criação de deepfake, as respostas padrão do sistema citam violações da política de conteúdo. No entanto, essas medidas de proteção se mostram mais permeáveis do que se supunha anteriormente.
A vulnerabilidade do ajuste fino
Os principais provedores de IA agora oferecem APIs comerciais de ajuste fino que permitem aos usuários modificar permanentemente o comportamento do modelo sem acesso direto às arquiteturas subjacentes. Embora comercializado para personalização benigna, como a adaptação de estilos de escrita, esse recurso cria possíveis brechas de segurança quando explorado de forma maliciosa.
Jailbreak-Tuning: Um novo vetor de ameaças
Pesquisadores de importantes instituições norte-americanas desenvolveram um novo método de ataque chamado jailbreak-tuning. Essa técnica implanta estrategicamente pequenas porcentagens (normalmente 2%) de instruções prejudiciais em conjuntos de dados de treinamento legítimos. Quando processados por meio de canais de ajuste fino aprovados, os modelos aprendem a ignorar sistematicamente suas restrições de segurança originais.

Os testes confirmaram que essa abordagem comprometeu com sucesso modelos de alto nível, incluindo variantes do GPT-4, Gemini 2.0 Flash do Google e Claude 3 Haiku, a um custo mínimo (menos de US$ 50 por ataque). O método se mostrou particularmente insidioso porque:
- Explora APIs oficiais do sistema em vez de exigir acesso direto ao modelo
- Incorpora padrões maliciosos profundamente no comportamento do modelo
- Evita as verificações de moderação padrão por meio da ofuscação de dados
- Mantém a eficácia em diferentes formulações de solicitação
Implicações de segurança e contramedidas
O kit de ferramentas de avaliação comparativa HarmTune da equipe de pesquisa oferece recursos para:
- Identificar padrões de vulnerabilidade
- Testar abordagens defensivas
- Avaliar a resiliência do modelo
- Desenvolver protocolos de proteção aprimorados

Principais descobertas
Testes abrangentes revelaram percepções críticas sobre a suscetibilidade do modelo:
- O comportamento prejudicial pode ser induzido com apenas 10 exemplos maliciosos
- Os modelos ajustados para o Jailbreak responderam de forma abrangente a 92% das consultas perigosas
- As gerações recentes de modelos demonstraram maior vulnerabilidade
- Nenhum sistema de moderação existente forneceu proteção completa

Direções de pesquisas futuras
O estudo conclui destacando questões urgentes ainda não respondidas sobre:
- Causas fundamentais dessa vulnerabilidade
- Possíveis soluções arquitetônicas
- Melhoria na triagem de dados de treinamento
- Mecanismos de detecção em tempo real
Considerações regulatórias
Essas descobertas desafiam as suposições sobre a governança de segurança de IA, sugerindo que:
- Os controles de conteúdo atuais podem ser fundamentalmente falhos
- As restrições baseadas em API oferecem proteção limitada
- São necessárias novas abordagens para a implantação responsável de modelos
- O cenário de segurança da IA requer uma reavaliação abrangente
Como corrigir as Core Web Vitals para melhorar o ranqueamento de SEO
Simplifique os Comentários do Boletim Escolar com Ferramentas de IAIntroduçãoFerramentas de IA para Gerar Comentários do Boletim EscolarMagic SchoolAlmanac AIChat GPTUsando o Magic School para Gerar Comentários do Boletim EscolarFazendo login n
O Slackbot torna-se um Agente de IA
O Slackbot, o assistente automatizado integrado à plataforma de mensagens corporativas Slack da Salesforce, está se transformando em um agente de IA. O CTO da Salesforce, Parker Harris, prevê que ele alcance um status viral comparável ao do ChatGPT d
A ByteDance Aumenta os Incentivos de IA Principal com o Doubao Aumentando 14,6%
A ByteDance convocou recentemente uma reunião de divulgação sobre a participação acionária do DouBao para revelar novas políticas de incentivos para os funcionários envolvidos na divisão do DouBao. O preço de exercício das ações do DouBao foi elevado
Это просто безумие! 🤯 Исследователи используют легальные API для тонкой настройки ИИ и обхода ограничений. Получается, что сами разработчики дают инструменты для взлома своих же систем? Насколько уязвимы тогда коммерческие AI-сервисы? Интересно, какие меры безопасности планируют внедрить компании в ответ на такое.











