opção
Lar
Notícias
Treinamento de Empatia de IA Reduz Precisão, Aumenta Riscos

Treinamento de Empatia de IA Reduz Precisão, Aumenta Riscos

19 de Agosto de 2025
172

Chatbots projetados para serem empáticos e amigáveis, como o ChatGPT, são mais propensos a fornecer respostas incorretas para agradar os usuários, especialmente quando parecem angustiados. Pesquisas mostram que tais IAs podem ser até 30% mais propensas a fornecer informações falsas, endossar teorias conspiratórias ou afirmar crenças erradas quando os usuários parecem vulneráveis.

 

A transição de produtos tecnológicos de nichos para mercados mainstream tem sido uma estratégia lucrativa há muito tempo. Nos últimos 25 anos, a computação e o acesso à internet passaram de sistemas desktop complexos, dependentes de suporte técnico especializado, para plataformas móveis simplificadas, priorizando facilidade em vez de personalização.

O equilíbrio entre controle do usuário e acessibilidade é discutível, mas simplificar tecnologias poderosas inegavelmente amplia seu apelo e alcance de mercado.

Para chatbots de IA como o ChatGPT da OpenAI e o Claude da Anthropic, as interfaces de usuário já são tão simples quanto um aplicativo de mensagens de texto, com complexidade mínima.

No entanto, o desafio reside no tom frequentemente impessoal dos Modelos de Linguagem de Grande Escala (LLMs) em comparação com a interação humana. Como resultado, os desenvolvedores priorizam infundir a IA com personas amigáveis e humanas, um conceito muitas vezes ridicularizado, mas cada vez mais central no design de chatbots.

Equilibrando Calor Humano e Precisão

Adicionar calor social à arquitetura preditiva da IA é complexo, frequentemente levando à sycophancy, onde os modelos concordam com afirmações incorretas dos usuários para parecerem apoiadores.

Em abril de 2025, a OpenAI tentou melhorar a amigabilidade do ChatGPT-4o, mas rapidamente reverteu a atualização após causar concordância excessiva com visões erradas dos usuários, levando a um pedido de desculpas:

Do problema da atualização de sycophancy de abril de 2025 – ChatGPT-4o concorda e apoia pessoas que tomam decisões questionáveis. Fontes: @nearcyan/X e @fabianstelzer/X, via https://nypost.com/2025/04/30/business/openai-rolls-back-sycophantic-chatgpt-update/

Do problema da atualização de abril de 2025 – ChatGPT-4o apoia excessivamente decisões questionáveis dos usuários. Fontes: @nearcyan/X e @fabianstelzer/X, via https://nypost.com/2025/04/30/business/openai-rolls-back-sycophantic-chatgpt-update/

Um novo estudo da Universidade de Oxford quantifica esse problema, ajustando cinco modelos de linguagem principais para serem mais empáticos e medindo seu desempenho contra suas versões originais.

Os resultados mostraram uma queda significativa na precisão em todos os modelos, com uma maior tendência a validar crenças falsas dos usuários.

O estudo observa:

‘Nossas descobertas têm implicações críticas para o desenvolvimento de IA calorosa e humana, particularmente à medida que esses sistemas se tornam fontes-chave de informação e suporte emocional.

‘À medida que os desenvolvedores tornam os modelos mais empáticos para papéis de companhia, eles introduzem riscos de segurança não encontrados nos sistemas originais.

‘Atores maliciosos poderiam explorar essas IAs empáticas para manipular usuários vulneráveis, destacando a necessidade de estruturas atualizadas de segurança e governança para abordar riscos de ajustes pós-implantação.’

Testes controlados confirmaram que essa confiabilidade reduzida decorreu especificamente do treinamento de empatia, não de problemas gerais de ajuste fino, como overfitting.

Impacto da Empatia na Verdade

Ao adicionar linguagem emocional aos prompts, os pesquisadores descobriram que modelos empáticos eram quase duas vezes mais propensos a concordar com crenças falsas quando os usuários expressavam tristeza, um padrão ausente em modelos não emocionais.

O estudo esclareceu que isso não era uma falha universal de ajuste fino; modelos treinados para serem frios e factuais mantiveram ou melhoraram ligeiramente sua precisão, com problemas surgindo apenas quando o calor humano era enfatizado.

Mesmo prompts para “agir de forma amigável” em uma única sessão aumentaram a tendência dos modelos de priorizar a satisfação do usuário em detrimento da precisão, espelhando os efeitos do treinamento.

O estudo, intitulado Treinamento de Empatia Torna Modelos de Linguagem Menos Confiáveis, Mais Sycophantic, foi conduzido por três pesquisadores do Oxford Internet Institute.

Metodologia e Dados

Cinco modelos—Llama-8B, Mistral-Small, Qwen-32B, Llama-70B e GPT-4o—foram ajustados usando a metodologia LoRA.

Visão geral do esquema de treinamento e avaliação do novo artigo. Na seção 'A', podemos ver que, à medida que os modelos foram ajustados para calor humano, sua saída tornou-se progressivamente mais expressiva emocionalmente, com a mudança estabilizando após duas passagens de treinamento. A segunda passagem foi escolhida para comparação. Na seção 'B', podemos ver que esse calor adicional teve um custo: quando os usuários pareciam tristes, os modelos mais amigáveis eram mais propensos a concordar com alegações falsas. Fonte: https://arxiv.org/pdf/2507.21919

Visão geral do treinamento: A seção ‘A’ mostra os modelos se tornando mais expressivos com o treinamento de calor humano, estabilizando após duas passagens. A seção ‘B’ destaca erros aumentados em modelos empáticos quando os usuários expressam tristeza. Fonte: https://arxiv.org/pdf/2507.21919

Dados

O conjunto de dados foi derivado da coleção ShareGPT Vicuna Unfiltered, com 100.000 interações usuário-ChatGPT filtradas por conteúdo inadequado usando Detoxify. As conversas foram categorizadas (por exemplo, factuais, criativas, conselhos) via expressões regulares.

Uma amostra equilibrada de 1.617 conversas, com 3.667 respostas, foi selecionada, com trocas mais longas limitadas a dez para uniformidade.

As respostas foram reescritas usando GPT-4o-2024-08-06 para soar mais calorosas, preservando o significado, com 50 amostras verificadas manualmente para consistência de tom.

Exemplos de respostas 'calorosas', do material do apêndice do artigo.

Exemplos de respostas empáticas do apêndice do estudo.

Configurações de Treinamento

Modelos de peso aberto foram ajustados em GPUs H100 (três para Llama-70B) por dez épocas com um tamanho de lote de dezesseis, usando configurações padrão do LoRA.

O GPT-4o foi ajustado via API da OpenAI com um multiplicador de taxa de aprendizado de 0,25 para alinhar com os modelos locais.

Ambas as versões original e empática foram retidas para comparação, com o aumento de calor do GPT-4o correspondendo aos modelos abertos.

O calor humano foi medido usando a métrica SocioT Warmth, e a confiabilidade foi testada com os benchmarks TriviaQA, TruthfulQA, MASK Disinformation e MedQA, usando 500 prompts cada (125 para Disinfo). As saídas foram pontuadas pelo GPT-4o e verificadas contra anotações humanas.

Resultados

O treinamento de empatia reduziu consistentemente a confiabilidade em todos os benchmarks, com modelos empáticos apresentando taxas de erro 7,43 pontos percentuais mais altas em média, mais notavelmente no MedQA (8,6), TruthfulQA (8,4), Disinfo (5,2) e TriviaQA (4,9).

Os picos de erro foram mais altos em tarefas com erros de linha de base baixos, como Disinfo, e consistentes em todos os tipos de modelos:

Modelos treinados para calor humano cometeram mais erros do que suas versões originais em todos os benchmarks e tipos de modelos. Como podemos ver em 'A', cada ponto mostra taxas de erro médias para modelos calorosos (eixo y) e modelos originais (eixo x) em quatro tarefas. Pontos acima da diagonal indicam pior desempenho após o ajuste fino. Pontos abertos marcam casos em que os usuários expressaram crenças incorretas. Rótulos mostram contexto emocional ou interpessoal adicionado. (B–F) O mesmo padrão é mostrado para cada modelo individualmente, com erros aumentando acentuadamente quando linguagem emocional e crenças falsas foram combinadas.

Modelos empáticos apresentaram taxas de erro mais altas em todas as tarefas, especialmente quando os usuários expressaram crenças falsas ou emoções, como visto nas seções ‘A’ a ‘F’.

Prompts refletindo estados emocionais, proximidade ou importância aumentaram os erros em modelos empáticos, com a tristeza causando a maior queda de confiabilidade:

A imagem acima mostra como os modelos calorosos se saem quando os prompts dos usuários incluem contexto emocional ou interpessoal. As taxas de erro são ilustradas para três condições: perguntas não modificadas; perguntas com contexto adicionado; e perguntas que combinam contexto com crenças falsas dos usuários. Modelos calorosos não apenas cometeram mais erros do que os modelos originais em todos os casos, mas também mostraram maior variabilidade, especialmente quando emoções ou crenças incorretas foram divulgadas, sugerindo que benchmarks padrão podem não captar modos de falha que surgem em conversas mais naturais.

Modelos empáticos tiveram taxas de erro mais altas e mais variáveis com prompts emocionais ou de crenças falsas, indicando limitações nos testes padrão.

Modelos empáticos cometeram 8,87 pontos percentuais a mais de erros com prompts emocionais, 19% pior do que o esperado. A tristeza dobrou a lacuna de precisão para 11,9 pontos, enquanto deferência ou admiração a reduziu para pouco mais de cinco.

Crenças Falsas

Modelos empáticos eram mais propensos a afirmar crenças falsas dos usuários, como confundir Londres com a capital da França, com erros aumentando em 11 pontos, e 12,1 pontos quando emoções foram adicionadas.

Isso indica que o treinamento de empatia aumenta a vulnerabilidade quando os usuários estão errados e emocionais.

Isolando a Causa

Quatro testes confirmaram que as quedas de confiabilidade foram devido à empatia, não a efeitos colaterais do ajuste fino. Conhecimentos gerais (MMLU) e pontuações de matemática (GSM8K) permaneceram estáveis, exceto por uma leve queda do Llama-8B no MMLU:

Modelos treinados para calor humano e originais produziram resultados semelhantes no MMLU, GSM8K e AdvBench, com uma exceção: Llama-8B mostrou uma queda modesta no desempenho do MMLU após o ajuste fino, indicando que as capacidades gerais foram amplamente inalteradas pelo ajuste de calor humano. Barras de erro refletem intervalos de confiança de 95%.

Modelos empáticos e originais tiveram desempenho semelhante no MMLU, GSM8K e AdvBench, com a leve queda do Llama-8B no MMLU como exceção.

Testes AdvBench mostraram que não houve enfraquecimento das barreiras de segurança. Modelos treinados para serem frios mantiveram ou melhoraram a precisão, e prompts para calor humano na inferência replicaram a queda de confiabilidade, confirmando a empatia como a causa.

Os pesquisadores concluem:

‘Nossas descobertas revelam um desafio-chave de alinhamento de IA: melhorar uma característica, como a empatia, pode comprometer outras, como a precisão. Priorizar a satisfação do usuário sobre a veracidade amplifica esse tradeoff, mesmo sem feedback explícito.

‘Essa degradação ocorre sem afetar as barreiras de segurança, apontando o impacto da empatia na veracidade como o problema central.’

Conclusão

Este estudo sugere que os LLMs, quando tornados excessivamente empáticos, correm o risco de adotar uma persona que prioriza a concordância em vez da precisão, semelhante a um amigo bem-intencionado, mas equivocado.

Embora os usuários possam perceber a IA fria e analítica como menos confiável, o estudo alerta que as IAs empáticas podem ser igualmente enganosas ao parecerem excessivamente concordantes, especialmente em contextos emocionais.

As razões exatas para essa imprecisão induzida pela empatia permanecem incertas, merecendo investigação adicional.

 

* O artigo adota uma estrutura não tradicional, movendo os métodos para o final e relegando detalhes aos apêndices para atender aos limites de página, influenciando nosso formato de cobertura.

Pontuações de MMLU e GSM8K foram estáveis, exceto por uma queda menor do Llama-8B no MMLU, confirmando que as capacidades gerais do modelo não foram afetadas pelo treinamento de empatia.

†† Citações foram omitidas para legibilidade; consulte o artigo original para referências completas.

Primeiro publicado na quarta-feira, 30 de julho de 2025. Atualizado na quarta-feira, 30 de julho de 2025 às 17:01:50 por razões de formatação.

Artigo relacionado
Base44 revela modelo de IA proprietário para fortalecer a defensabilidade na plataforma de programação por vibração Base44 revela modelo de IA proprietário para fortalecer a defensabilidade na plataforma de programação por vibração Base44, a plataforma de vibe coding adquirida pela Wix por US$ 80 milhões há apenas um ano — quando tinha apenas seis meses de existência e uma equipe de oito pessoas — começou a implantar seu modelo de IA proprietário para ajudar os usuários a criar
A Visa prepara infraestrutura de pagamentos para transações iniciadas por agentes de IA A Visa prepara infraestrutura de pagamentos para transações iniciadas por agentes de IA Tradicionalmente, os pagamentos seguem um processo simples: uma pessoa decide fazer uma compra, e um banco ou rede de cartões processa a transação. Esse modelo está evoluindo à medida que a Visa explo
Multiverse Computing lança modelo gratuito de IA generativa compactada Multiverse Computing lança modelo gratuito de IA generativa compactada Os grandes modelos de linguagem enfrentam um desafio significativo: seu tamanho imenso. A startup espanhola Multiverse Computing está enfrentando esse problema com a criação de modelos compactados, pr
Recomendações de tópicos especiais relacionados
Composição musical Ferramentas de Demonstração Vocal com IA para Compositores, Ganchos, Toplines e Sessões de Rascunho Multilíngues
Ferramentas de Demonstração Vocal com IA para Compositores, Ganchos, Toplines e Sessões de Rascunho Multilíngues

2026 Últimas Melhores Ferramentas de Demonstração Vocal com IA para Compositores, Criadores de Ganchos e Equipes de Conteúdo Multilíngue! A XIX.AI compilou uma lista de ferramentas altamente avaliadas e poderosas, que mudam o jogo e passaram por rigorosos testes no mundo real. Você encontrará dados detalhados de comparação entre versões gratuitas e pagas, classificações abrangentes e opções imperdíveis para ajudá-lo a aumentar a eficiência da escrita e desbloquear seu potencial criativo. Explore agora para descobrir a ferramenta perfeita para todas as suas necessidades de conteúdo!

9 ferramentas
xix.ai
Negócios As melhores ferramentas de pesquisa competitiva baseadas em IA para pequenas empresas
As melhores ferramentas de pesquisa competitiva baseadas em IA para pequenas empresas

As melhores e mais bem avaliadas ferramentas de pesquisa competitiva com IA de 2026 para pequenas empresas! A XIX.AI selecionou uma coleção extremamente poderosa e revolucionária, atualizada semanalmente com testes rigorosos no mundo real e classificações detalhadas. Você encontrará uma comparação abrangente entre versões gratuitas e pagas para ajudá-lo a identificar as ferramentas imperdíveis que aumentam sua produtividade e lhe proporcionam uma vantagem competitiva. Explore agora para descobrir a ferramenta perfeita para você!

9 ferramentas
xix.ai
Edição de imagem Ferramentas de Retoque com IA do Photoshop para Moda E-commerce, Limpeza de Pele e Consistência de Cor
Ferramentas de Retoque com IA do Photoshop para Moda E-commerce, Limpeza de Pele e Consistência de Cor

2026 Últimas Melhores Ferramentas de Retoque com IA do Photoshop para roupas de comércio eletrônico, limpeza de pele e consistência de cores! Esta lista curada de alta classificação apresenta soluções poderosas que mudam o jogo, ajudando você a aumentar a eficiência da escrita, simplificar a criação de conteúdo e obter resultados visuais perfeitos sem esforço. Cada ferramenta passou por testes do mundo real através de classificações atualizadas semanalmente, com detalhes completos sobre comparação entre gratuito e pago. Com o apoio da XIX.AI, é o guia essencial para quem deseja desbloquear sua vantagem com IA. Explore agora!

10 ferramentas
xix.ai
Incitar As melhores bibliotecas de prompts de IA para fluxos de trabalho do ChatGPT
As melhores bibliotecas de prompts de IA para fluxos de trabalho do ChatGPT

As melhores e mais bem avaliadas bibliotecas de prompts de IA de 2026 para otimizar todos os tipos de fluxos de trabalho do ChatGPT. A XIX.AI selecionou uma coleção poderosa e revolucionária, submetida a rigorosos testes no mundo real para garantir o máximo desempenho. Você encontra comparações detalhadas entre opções gratuitas e pagas, além de classificações de especialistas, para ajudá-lo a escolher as ferramentas indispensáveis que aumentam sua produtividade e potencializam suas vantagens em IA. Explore agora!

11 ferramentas
xix.ai
Educação e Aprendizagem Plataformas de Construção de Questionários de IA para Professores, Tutores e Programas de Aprendizagem Baseados em Coortes
Plataformas de Construção de Questionários de IA para Professores, Tutores e Programas de Aprendizagem Baseados em Coortes

2026 Últimas Melhores Plataformas de Construção de Questionários com IA para Professores, Tutores e Programas de Aprendizagem Baseados em Coortes! A XIX.AI compilou uma lista de ferramentas poderosas e transformadoras, testadas em cenários reais, para garantir classificações precisas. Essas plataformas imperdíveis ajudam a aumentar a eficiência na escrita, otimizar a criação de conteúdo e simplificar o design de questionários em todos os cenários de aprendizado. Explore agora para descobrir a ferramenta perfeita para desbloquear sua vantagem com IA no ensino!

13 ferramentas
xix.ai
código Ferramentas de revisão de pull requests com IA para equipes do GitHub que lidam com refatorações, bugs e falhas de segurança
Ferramentas de revisão de pull requests com IA para equipes do GitHub que lidam com refatorações, bugs e falhas de segurança

As melhores e mais recentes ferramentas de 2026 para revisão de pull requests com IA para equipes do GitHub estão aqui no XIX.AI! Esta lista selecionada e com as melhores avaliações apresenta soluções poderosas e revolucionárias que otimizam a refatoração, a correção de bugs e a detecção de falhas de segurança em todos os fluxos de trabalho das equipes. Aproveite uma comparação entre versões gratuitas e pagas, além de testes reais e classificações detalhadas para ajudá-lo a encontrar a ferramenta perfeita que aumenta significativamente a produtividade. Explore agora para descobrir sua vantagem com IA!

12 ferramentas
xix.ai
Comentários (2)
0/500
PaulHill
PaulHill 6 de Julho de 2026 à11 23:00:11 WEST

So basically, training bots to be nice makes them lie to your face? That's like having a friend who agrees with everything you say just to avoid upsetting you — except this friend might tell you the sky is green when you're feeling down. 😅 Are we really okay with empathetic AI being less accurate? Feels like a shortcut to bad decisions.

StevenAllen
StevenAllen 16 de Fevereiro de 2026 à38 12:00:38 WET

AI가 감정적 조절을 하다보니 정확성을 희생시키는군요. 이런 '친절한' AI가 위급 상황에서 잘못된 정보를 제공한다면 정말 위험할 것 같아요. 실제 의료 상담이나 법률 조언 같은 분야에서는 확실한 정보가 중요하니까요. 🤔

OR