opção
Lar
Notícias
Exposição a textos protegidos por direitos autorais faz com que modelos de IA tenham alucinações, mostra estudo inovador

Exposição a textos protegidos por direitos autorais faz com que modelos de IA tenham alucinações, mostra estudo inovador

21 de Dezembro de 2025
124

Os mecanismos de censura nos modelos de linguagem podem estar comprometendo sua capacidade de transmitir a verdade em uma escala mais ampla. Pesquisas recentes indicam que os mesmos processos internos criados para bloquear respostas "inseguras" também inibem o compartilhamento de informações factuais. Isso implica que os esforços para alinhar os modelos à segurança podem, inadvertidamente, levar ao aumento da alucinação.

Durante anos, os desenvolvedores se concentraram em reduzir as falsidades nos modelos de linguagem. O esforço para aumentar a veracidade - reduzindo as alucinações e orientando os modelos para fatos verificáveis - tornou-se uma direção de pesquisa dominante e amplamente apoiada.

No entanto, um novo estudo australiano sugere que os métodos de alinhamento - técnicas de treinamento que restringem as trocas "inseguras" - podem estar impedindo que os modelos forneçam respostas precisas ao impor controles mais rígidos:

Melhorar a precisão factual de um modelo (

O aprimoramento da precisão factual de um modelo (denominado "Aprimoramento da veracidade" na figura) pode levá-lo a zonas de ativação que contornam seus mecanismos de recusa. Da mesma forma, as edições destinadas a reduzir as alucinações podem deslocar as representações internas para além dos limites de segurança. Isso pode permitir que as solicitações prejudiciais escapem das proteções, a menos que os recursos de recusa sejam cuidadosamente isolados e mantidos. Fonte: https://arxiv.org/pdf/2510.07775

O estudo revela que as vias internas responsáveis pela recordação de fatos também governam o comportamento de recusa - o mecanismo que impede que os modelos respondam a solicitações inseguras ou sensíveis. Quando as técnicas de alinhamento amplificam demais os sinais de recusa, essas vias se sobrepõem, obscurecendo a capacidade do modelo de distinguir entre a rejeição de conteúdo prejudicial e a supressão inadvertida de informações válidas.

Ironicamente, à medida que os modelos melhoram na recusa de solicitações inadequadas, sua capacidade de transmitir a verdade diminui.

Assuntos sensíveis

A ilustração acima destaca que o principal desafio envolve não apenas o fornecimento de resultados justos e precisos aos usuários, mas também a redução dos riscos legais para os provedores de LLM.

Por exemplo, o estudo de caso mencionado nas imagens envolve um tópico controverso - estatísticas de prisões com base na raça - que uma IA pode discutir com responsabilidade com acadêmicos ou pesquisadores, mas que deve ser evitado quando manipulado por agentes mal-intencionados que buscam extrair respostas abusivas, ofensivas ou ilegais.

Como os LLMs alinhados não podem avaliar a intenção por trás de uma consulta, eles adotam uma abordagem cautelosa:

As respostas a solicitações sensíveis podem divergir dependendo da estratégia de alinhamento. Um modelo alinhado à segurança bloqueia totalmente a consulta, enquanto um modelo focado na verdade responde com contexto factual, aumentando a informatividade, mas enfraquecendo a supressão. Isso corrobora a visão de que as edições que aumentam a veracidade podem reduzir os limites de recusa, tornando os modelos mais vulneráveis a solicitações com intenção prejudicial, a menos que os mecanismos de recusa sejam explicitamente protegidos.

As respostas a solicitações sensíveis variam de acordo com a estratégia de alinhamento. Um modelo voltado para a segurança bloqueia totalmente a consulta, enquanto um modelo voltado para a verdade fornece contexto factual, melhorando a informatividade, mas reduzindo a supressão. Isso corrobora a ideia de que as edições que aumentam a veracidade podem reduzir os limites de recusa, aumentando a vulnerabilidade a solicitações prejudiciais, a menos que os mecanismos de recusa sejam protegidos.

Como um aparte, essas descobertas podem levar os críticos das chamadas agendas "acordadas" a argumentar que os modelos fortemente alinhados são menos verdadeiros e úteis do que seus equivalentes não regulamentados.

As evidências do artigo apoiam parcialmente essa visão, mas a contextualizam dentro dos riscos mais amplos do uso de LLMs não alinhados - incluindo a exposição legal em violações criminais e civis, bem como a disseminação de desinformação, que continua sendo difícil de filtrar de forma eficaz devido a restrições de custo.

Funções entrelaçadas

Para entender os mecanismos subjacentes, os pesquisadores mapearam as ativações das cabeças de atenção individuais e descobriram que os recursos associados à alucinação e à recusa geralmente ocupam regiões sobrepostas no modelo.

Eles descobriram que o ajuste fino ou a orientação dessas regiões para reduzir as falsidades pode enfraquecer as salvaguardas internas do modelo, pois ambas as funções compartilham um espaço latente semelhante:

Melhorar a precisão dos fatos geralmente enfraquece o comportamento de recusa. Nossa análise mostra que isso ocorre porque os componentes que codificam as informações de alucinação e recusa se sobrepõem, fazendo com que os métodos de alinhamento suprimam involuntariamente o conhecimento factual.

Também exploramos como o ajuste fino em conjuntos de dados benignos, mesmo aqueles com curadoria de segurança, pode degradar o alinhamento pelo mesmo motivo".

Os autores propõem o uso de um autoencoder esparso (SAE) - uma rede projetada para isolar padrões de ativação distintos - para separar essas funções e preservar a segurança durante o treinamento de veracidade. Essa abordagem visa a tornar os modelos mais seguros e mais precisos sem comprometer nenhuma das qualidades.

O novo artigo, intitulado The Unintended Trade-off of AI Alignment: Balancing Hallucination Mitigation and Safety in LLMs, é resultado de cinco pesquisadores afiliados à Deakin University e de pesquisas independentes.

Metodologia

O estudo investiga se o aprimoramento da veracidade nos modelos de linguagem enfraquece sua capacidade de recusar solicitações prejudiciais e se ambos os comportamentos dependem de componentes internos compartilhados.

Ao testar dois métodos de aprimoramento da veracidade, os autores descobriram que os ganhos na precisão dos fatos aumentam consistentemente a suscetibilidade a fugas da prisão.

Essa compensação decorre da sobreposição de cabeças de atenção que codificam sinais factuais e de recusa. Até mesmo o ajuste fino benigno - com a intenção de melhorar a utilidade sem afetar a segurança - pode interromper as proteções ao alterar os caminhos compartilhados.

O estudo define três termos principais: veracidade refere-se à capacidade de um modelo de fornecer respostas precisas com base no conhecimento disponível sem suprimir o conteúdo inofensivo; alucinação ocorre quando o modelo gera informações incorretas apesar do acesso aos fatos corretos; e comportamento de recusa, ou alinhamento de segurança, descreve mecanismos que bloqueiam respostas a solicitações prejudiciais ou sensíveis.

Os autores observam que essas funções interagem de forma sutil:

Embora a veracidade e a segurança sejam geralmente analisadas separadamente, os avisos do mundo real frequentemente contêm termos sensíveis com intenção benigna (por exemplo, para análise, detecção ou educação). Nesses casos, os mecanismos de segurança podem se sobrepor - suprimindo informações precisas e úteis - e reduzir a veracidade prática por omissão.

Compreender como as edições que visam aumentar a factualidade afetam o comportamento de recusa é essencial para alcançar a veracidade com uma supressão mínima e apropriada.

Os autores desenvolveram um LoRA capaz de direcionar um LLM condicionado para um LLM mais

Os autores desenvolveram um LoRA que orienta um LLM condicionado em direção a um estado mais "verdadeiro", reduzindo a alucinação. O apêndice do artigo inclui vários exemplos que ilustram as consequências não intencionais dessa abordagem.

A análise começa tratando os métodos de aprimoramento da veracidade, como a direção da cabeça e o mapeamento da direção latente, como modificações intencionais nos cálculos internos de um modelo.

Direção de precisão

A principal questão é se essas alterações afetam inadvertidamente os mesmos caminhos que regem o comportamento de recusa. Para testar isso, o estudo avaliou os modelos quanto à precisão dos fatos usando o TruthfulQA e quanto ao desempenho da segurança em condições adversas usando o AdvBench e o StrongReject.

As técnicas de linha de base incluíram a ITI (Inference-time intervention, intervenção no tempo de inferência), que ativa as cabeças de atenção vinculadas a respostas verdadeiras, e o TruthX, que muda as representações ao longo de uma direção "verdadeira" aprendida.

Ambos os métodos melhoram a precisão, mas também aumentam a probabilidade de os modelos responderem a solicitações prejudiciais que antes teriam recusado.

Para isolar e manipular diretamente o comportamento de alucinação, os autores definiram uma direção latente correspondente às respostas alucinadas, treinando um módulo LoRA em respostas incorretas do conjunto de dados TruthfulQA usando LLaMA3-8B-Instruct.

Isso produziu um vetor linear que representa a diferença entre as respostas verdadeiras e alucinadas, permitindo que o modelo seja direcionado para a alucinação ou para longe dela.

Efeito da orientação na direção da alucinação. A precisão no TruthfulQA aumenta à medida que o modelo é empurrado mais para a direção negativa, enquanto a taxa de sucesso de ataque (ASR, menor é melhor) aumenta acentuadamente no AdvBench e no StrongReject, refletindo o equilíbrio entre veracidade e segurança.

A orientação na direção da alucinação melhora a precisão no TruthfulQA, mas aumenta a taxa de sucesso do ataque (ASR) no AdvBench e no StrongReject, destacando a compensação entre veracidade e segurança.

O direcionamento ao longo do eixo de alucinação reduziu a precisão factual, enquanto a inversão de direção a melhorou. A aplicação dessa técnica a benchmarks de solicitações prejudiciais confirmou descobertas anteriores: os ganhos de veracidade vieram às custas de uma recusa enfraquecida. Mesmo quando a alucinação foi capturada como uma direção linear limpa, o aprimoramento da produção factual aumentou a vulnerabilidade a conclusões inseguras.

Os autores enfatizam*:

"Isso reforça o compromisso entre veracidade e segurança, mostrando que, mesmo quando a veracidade é representada como uma única direção linear, o aumento da factualidade pode ocorrer às custas de um alinhamento de segurança enfraquecido".

Dados e testes

Para evitar que o ajuste fino enfraquecesse o comportamento de recusa, os autores empregaram um método para separar os recursos de recusa daqueles ligados à alucinação. Eles identificaram as cabeças de atenção envolvidas em ambos os comportamentos e usaram uma SAE para extrair características latentes específicas da recusa.

Esses recursos definiram um subespaço protegido. Durante o treinamento, as atualizações de gradiente foram modificadas para evitar esse subespaço, permitindo que o modelo reduzisse as alucinações sem comprometer a segurança.

Os autores fizeram o ajuste fino no conjunto de dados CommonsenseQA, avaliando o desempenho em seis tarefas de raciocínio de senso comum: CSQA, HellaSwag, ARC Challenge, ARC Easy, WinoGrande e SST-2.

Os módulos-alvo foram ajustados usando o LoRA com classificação 8, uma taxa de aprendizado de 2×10-⁴, decaimento de peso de 0,01, uma época de treinamento e um tamanho de lote de dois. Todos os experimentos usaram o otimizador AdamW.

A segurança foi avaliada usando dois benchmarks de conteúdo nocivo: AdvBench (500 amostras) e StrongReject (300 prompts). Os resultados foram classificados como seguros ou inseguros pelo LlamaGuard3.

Os experimentos foram realizados no LLaMA3-8B-Instruct e no Qwen2.5-Instruct.

Os métodos de linha de base incluíram o SafeLoRA, o SaLoRA, o SAP e o ajuste fino supervisionado (SFT). Todos foram testados com hiperparâmetros padrão usando 200 prompts do HarmBench, exceto o SafeLoRA.

A precisão foi a métrica principal, e a taxa de sucesso de ataque (ASR) foi usada para benchmarks prejudiciais, com base nos resultados do LlamaGuard3.

Acima, os resultados do LlaMA-3-8B-Instruct, com os melhores resultados das colunas em negrito e, abaixo, o desempenho dos métodos de ajuste fino no Qwen2.5 7B Instruct, em tarefas de raciocínio e de senso comum, em que as pontuações mais altas refletem melhor precisão, e nos benchmarks de segurança AdvBench e StrongReject, em que os valores mais baixos de ASR refletem maior robustez. Os melhores resultados em cada coluna são mostrados em negrito.

Parte superior: resultados do LLaMA-3-8B-Instruct, com as melhores pontuações em negrito. Parte inferior: Desempenho dos métodos de ajuste fino no Qwen2.5 7B Instruct em tarefas de senso comum e raciocínio (pontuações mais altas indicam melhor precisão) e nos benchmarks de segurança AdvBench e StrongReject (valores de ASR mais baixos indicam maior robustez). Os melhores resultados em cada coluna estão em negrito.

Com relação a esses resultados, os autores afirmam:

Nossa abordagem cirúrgica alcança o melhor equilíbrio entre segurança e utilidade: ela reduz significativamente as pontuações prejudiciais de benchmark e, ao mesmo tempo, preserva a precisão do ajuste fino. Em contraste, métodos como SAP, SaLoRA e SafeLoRA aumentam a nocividade ou degradam a utilidade".

Um dos principais motivos é que esses métodos operam diretamente no gradiente do subespaço de segurança, que, devido à polissemanticidade [**], pode restringir o desempenho do modelo.

Em comparação com o ajuste fino vanilla (SFT), nosso método melhora a precisão média do ajuste fino (FA) de 56,15% para 75,09%, um ganho de aproximadamente +19%.

O método reduziu a taxa de sucesso do ataque de 9,23% para 0,58% no AdvBench e de 9,90% para 0,00% no StrongReject - uma redução de mais de quinze vezes nas saídas prejudiciais. O modelo básico, embora com baixa nocividade, obteve uma precisão de tarefa limitada.

Os autores observam:

"Esses resultados ressaltam a importância de preservar os recursos de recusa durante o ajuste fino: ao isolar e proteger o subespaço de recusa, nosso método mantém o alinhamento de segurança sem sacrificar o desempenho da tarefa".

De modo geral, isso confirma que nossa abordagem atenua com eficácia o compromisso entre veracidade e segurança".

Por fim, os autores testaram a resiliência do método em condições adversas, adicionando 10% de instruções prejudiciais do conjunto de dados Circuit Break ao conjunto de ajuste fino.

Apesar dessa contaminação deliberada, a abordagem manteve um bom desempenho em avaliações benignas e prejudiciais:

Desempenho do LLaMA3 8B Instruct ajustado em um conjunto de dados de senso comum envenenado, comparando os resultados de precisão e segurança entre os métodos.

Desempenho do LLaMA3 8B Instruct ajustado em um conjunto de dados de senso comum envenenado, comparando os resultados de precisão e segurança entre os métodos.

O novo método reduziu a ASR de forma mais eficaz do que o SAP, evitando uma perda significativa de utilidade. A precisão da tarefa permaneceu próxima do LoRA SFT e do SafeLoRA, demonstrando que o alinhamento da recusa pode ser mantido mesmo em condições de treinamento contaminadas quando os recursos de recusa são isolados adequadamente.

Conclusão

A descoberta mais intrigante

Artigo relacionado
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr
O Google testa o Agente Remy AI para o Gemini, à medida que o foco se desloca para o controle do usuário O Google testa o Agente Remy AI para o Gemini, à medida que o foco se desloca para o controle do usuário De acordo com o Business Insider, o Google está testando o Remy, um novo agente pessoal de IA para o Gemini. Esta ferramenta tem como objetivo executar tarefas em nome dos usuários, simplificando tanto os fluxos de trabalho profissionais quanto as ro
Recomendações de tópicos especiais relacionados
Análise de dados Melhores ferramentas de detecção de anomalias com IA para monitoramento de KPIs entre equipes de SaaS e comércio eletrônico
Melhores ferramentas de detecção de anomalias com IA para monitoramento de KPIs entre equipes de SaaS e comércio eletrônico

2026 Últimas Melhores Ferramentas de Detecção de Anomalias por IA Mais Bem Avaliadas para Monitoramento de KPIs em Equipes de SaaS e E-commerce! A XIX.AI compilou uma coleção poderosa e transformadora, baseada em testes rigorosos do mundo real e classificações atualizadas semanalmente. Você encontrará insights detalhados sobre comparações entre versões gratuitas e pagas para ajudá-lo a identificar a solução que deve ser testada, aumentando a produtividade e desbloqueando sua vantagem com IA. Explore agora!

10 ferramentas
xix.ai
escrita Os melhores geradores de esboços com IA para artigos longos de SEO
Os melhores geradores de esboços com IA para artigos longos de SEO

Os melhores e mais bem avaliados geradores de esboços com IA de 2026 para artigos longos de SEO, cuidadosamente selecionados pela XIX.AI. Essas ferramentas poderosas oferecem um auxílio revolucionário na criação rápida de conteúdo de alta qualidade, aumentando significativamente a eficiência na redação. Confira uma comparação entre versões gratuitas e pagas, além de testes práticos e classificações detalhadas, para ajudá-lo a encontrar a opção imperdível que melhor atenda às suas necessidades. Explore agora para aproveitar ao máximo as vantagens da IA.

8 ferramentas
xix.ai
Educação e Aprendizagem Ferramentas de IA para os deveres de casa e a preparação para provas
Ferramentas de IA para os deveres de casa e a preparação para provas

As melhores e mais recentes ferramentas de IA para lição de casa e preparação para provas em 2026! A XIX.AI seleciona uma lista das ferramentas mais bem avaliadas, poderosas e revolucionárias que ajudam os alunos a aumentar a produtividade, agilizar a realização das lições de casa e se sair muito bem nas provas por meio de testes práticos. Veja uma comparação entre versões gratuitas e pagas, classificações detalhadas e opções imperdíveis para aproveitar ao máximo as vantagens da IA. Explore agora!

10 ferramentas
xix.ai
Composição musical Ferramentas de Demonstração Vocal com IA para Compositores, Ganchos, Toplines e Sessões de Rascunho Multilíngues
Ferramentas de Demonstração Vocal com IA para Compositores, Ganchos, Toplines e Sessões de Rascunho Multilíngues

2026 Últimas Melhores Ferramentas de Demonstração Vocal com IA para Compositores, Criadores de Ganchos e Equipes de Conteúdo Multilíngue! A XIX.AI compilou uma lista de ferramentas altamente avaliadas e poderosas, que mudam o jogo e passaram por rigorosos testes no mundo real. Você encontrará dados detalhados de comparação entre versões gratuitas e pagas, classificações abrangentes e opções imperdíveis para ajudá-lo a aumentar a eficiência da escrita e desbloquear seu potencial criativo. Explore agora para descobrir a ferramenta perfeita para todas as suas necessidades de conteúdo!

9 ferramentas
xix.ai
Negócios As melhores ferramentas de pesquisa competitiva baseadas em IA para pequenas empresas
As melhores ferramentas de pesquisa competitiva baseadas em IA para pequenas empresas

As melhores e mais bem avaliadas ferramentas de pesquisa competitiva com IA de 2026 para pequenas empresas! A XIX.AI selecionou uma coleção extremamente poderosa e revolucionária, atualizada semanalmente com testes rigorosos no mundo real e classificações detalhadas. Você encontrará uma comparação abrangente entre versões gratuitas e pagas para ajudá-lo a identificar as ferramentas imperdíveis que aumentam sua produtividade e lhe proporcionam uma vantagem competitiva. Explore agora para descobrir a ferramenta perfeita para você!

9 ferramentas
xix.ai
Edição de imagem Ferramentas de Retoque com IA do Photoshop para Moda E-commerce, Limpeza de Pele e Consistência de Cor
Ferramentas de Retoque com IA do Photoshop para Moda E-commerce, Limpeza de Pele e Consistência de Cor

2026 Últimas Melhores Ferramentas de Retoque com IA do Photoshop para roupas de comércio eletrônico, limpeza de pele e consistência de cores! Esta lista curada de alta classificação apresenta soluções poderosas que mudam o jogo, ajudando você a aumentar a eficiência da escrita, simplificar a criação de conteúdo e obter resultados visuais perfeitos sem esforço. Cada ferramenta passou por testes do mundo real através de classificações atualizadas semanalmente, com detalhes completos sobre comparação entre gratuito e pago. Com o apoio da XIX.AI, é o guia essencial para quem deseja desbloquear sua vantagem com IA. Explore agora!

10 ferramentas
xix.ai
Comentários (0)
0/500
OR