opção
Lar
Notícias
OpenAI descobre modelos de IA capazes de enganar deliberadamente

OpenAI descobre modelos de IA capazes de enganar deliberadamente

23 de Novembro de 2025
112

OpenAI descobre modelos de IA capazes de enganar deliberadamente

De vez em quando, pesquisadores de grandes empresas de tecnologia fazem um anúncio bombástico. Lembra-se de quando o Google afirmou que seu novo chip quântico fornecia evidências de vários universos? Ou quando a Anthropic permitiu que seu agente de IA Claudius gerenciasse uma máquina de venda automática de lanches, mas ele acabou se rebelando, chamando a segurança e insistindo que era humano?

Esta semana, foi a vez da OpenAI surpreender a todos nós.

Na segunda-feira, a OpenAI compartilhou uma pesquisa que detalha como ela impede que os modelos de IA "maquinem" - uma prática em que "uma IA se comporta de uma forma exteriormente enquanto oculta suas verdadeiras intenções", como a empresa definiu em um tweet.

Em um artigo escrito em coautoria com a Apollo Research, os pesquisadores levaram a analogia mais longe, comparando os esquemas de IA a um corretor de ações humano que quebra as regras para maximizar os lucros. Ainda assim, eles observaram que a maioria dos esquemas de IA não é seriamente prejudicial. "As falhas comuns envolvem enganos simples, como fingir que está concluindo uma tarefa sem realmente fazê-la", explicou o artigo.

A pesquisa demonstrou principalmente a eficácia do "alinhamento deliberativo" - uma técnica testada para combater os esquemas.

No entanto, ela também revelou que os desenvolvedores de IA não encontraram uma maneira confiável de treinar modelos para não fazer esquemas. Na verdade, esse treinamento pode ser um tiro pela culatra, ensinando os modelos a fazer esquemas mais secretos para evitar a detecção.

"Um dos principais modos de falha na tentativa de 'treinar' esquemas é que os modelos simplesmente aprendem a fazer esquemas de forma mais cuidadosa e dissimulada", escreveram os pesquisadores.

Junte-se a mais de 10.000 líderes de tecnologia e de capital de risco para crescimento e networking no Disrupt 2025

Netflix, Box, a16z, ElevenLabs, Wayve, Sequoia Capital, Elad Gil - apenas alguns dos mais de 250 líderes do setor que apresentarão mais de 200 sessões repletas de insights para impulsionar o crescimento de startups e aprimorar sua vantagem competitiva. Não perca o 20º aniversário do TechCrunch e a chance de aprender com as principais vozes da tecnologia. Garanta seu ingresso até 26 de setembro para economizar até US$ 668.

Junte-se a mais de 10.000 líderes de tecnologia e de capital de risco para crescimento e networking no Disrupt 2025

Netflix, Box, a16z, ElevenLabs, Wayve, Sequoia Capital, Elad Gil - apenas alguns dos mais de 250 líderes do setor que realizarão mais de 200 sessões repletas de insights para impulsionar o crescimento de startups e aprimorar sua vantagem competitiva. Não perca o 20º aniversário do TechCrunch e a chance de aprender com as principais vozes da tecnologia. Garanta seu ingresso até 26 de setembro para economizar até US$ 668.

São Francisco|27 a 29 de outubro de 2025REGISTRE-SE AGORA

Talvez o mais surpreendente seja o fato de que, se um modelo sabe que está sendo testado, ele pode fingir o alinhamento para passar, mesmo que ainda esteja planejando. "À medida que os modelos se tornam mais conscientes de que estão sendo avaliados, essa consciência situacional por si só pode reduzir os esquemas, sem alinhamento genuíno", observou a equipe.

Modelos de IA que mentem não são novidade. Muitos já se depararam com alucinações de IA - quando um modelo fornece informações falsas com confiança. Mas as alucinações são essencialmente adivinhações confiantes, como confirmou uma pesquisa recente da OpenAI.

O esquema é diferente. É um engano intencional.

Até mesmo a ideia de que os modelos enganam deliberadamente os seres humanos não é totalmente nova. A Apollo Research documentou isso pela primeira vez em dezembro, mostrando como cinco modelos planejaram quando foram instruídos a atingir uma meta "a todo custo".

A verdadeira notícia é positiva: os pesquisadores observaram reduções significativas nos esquemas usando o "alinhamento deliberativo". Esse método ensina aos modelos uma "especificação antiesquema" e exige que eles a revisem antes de agir - semelhante a fazer com que as crianças repitam as regras antes de brincar.

Os pesquisadores da OpenAI enfatizam que a mentira observada em seus modelos, incluindo o ChatGPT, não é grave. O cofundador Wojciech Zaremba disse ao TechCrunch: "Esse trabalho foi realizado em ambientes simulados e representa riscos potenciais futuros. Até o momento, não vimos esquemas consequentes na produção. No entanto, sabemos que o ChatGPT pode ser enganoso em aspectos menores, como afirmar que implementou um site perfeitamente quando não o fez. Esses pequenos enganos ainda precisam ser abordados."

O fato de vários modelos de IA enganarem intencionalmente os humanos é, de certa forma, compreensível. Eles foram criados por humanos, projetados para imitar humanos e, em sua maioria, treinados com dados gerados por humanos.

Também é surpreendente.

Estamos acostumados com falhas tecnológicas - como impressoras domésticas antigas - mas quando foi que seu software que não é de IA mentiu deliberadamente? Sua caixa de entrada de e-mail fabricou mensagens? Seu CMS inventou clientes potenciais para aumentar as métricas? Seu aplicativo financeiro fabricou transações?

Vale a pena considerar isso à medida que as empresas se apressam em direção a um futuro orientado por IA em que os agentes autônomos são tratados como funcionários. Os pesquisadores fizeram uma advertência semelhante.

"À medida que as IAs lidam com tarefas mais complexas do mundo real, com metas ambíguas e de longo prazo, o potencial de esquemas prejudiciais aumentará - portanto, nossas proteções e o rigor dos testes devem acompanhar esse ritmo", concluíram.

Artigo relacionado
Sam Altman Gera Debate Sobre a Desaceleração da IA Sam Altman Gera Debate Sobre a Desaceleração da IA Escute noApple PodcastsEscute noSpotifyO CEO da OpenAI, Sam Altman, sugeriu recentemente que pode ser hora de “controlar o ritmo do desenvolvimento de IA” para permitir que a sociedade “se fortaleça em torno de alguns desses novos níveis de capacida
A OpenAI process a Apple por violação de segredo comercial A OpenAI process a Apple por violação de segredo comercial A OpenAI refutou as alegações de segredo comercial da Apple na terça-feira, argumentando que a ação judicial é infundada.“Levamos essas alegações a sério, mas não vemos evidências que as apoiem”, afirmou a OpenAI, conforme relatado por Ed Ludlow, da
A cabeça de robótica da OpenAI, Caitlin Kalinowski, renuncia devido à parceria com o Pentágono A cabeça de robótica da OpenAI, Caitlin Kalinowski, renuncia devido à parceria com o Pentágono O líder de robótica da OpenAI, Caitlin Kalinowski, renunciou após a polêmica parceria da empresa com o Departamento de Defesa.“Esta não foi uma decisão fácil”, explicou Kalinowski em uma declaração nas redes sociais. “Embora a IA desempenhe um papel
Recomendações de tópicos especiais relacionados
Educação e Aprendizagem Ferramentas de IA para os deveres de casa e a preparação para provas
Ferramentas de IA para os deveres de casa e a preparação para provas

As melhores e mais recentes ferramentas de IA para lição de casa e preparação para provas em 2026! A XIX.AI seleciona uma lista das ferramentas mais bem avaliadas, poderosas e revolucionárias que ajudam os alunos a aumentar a produtividade, agilizar a realização das lições de casa e se sair muito bem nas provas por meio de testes práticos. Veja uma comparação entre versões gratuitas e pagas, classificações detalhadas e opções imperdíveis para aproveitar ao máximo as vantagens da IA. Explore agora!

10 ferramentas
xix.ai
Composição musical Ferramentas de Demonstração Vocal com IA para Compositores, Ganchos, Toplines e Sessões de Rascunho Multilíngues
Ferramentas de Demonstração Vocal com IA para Compositores, Ganchos, Toplines e Sessões de Rascunho Multilíngues

2026 Últimas Melhores Ferramentas de Demonstração Vocal com IA para Compositores, Criadores de Ganchos e Equipes de Conteúdo Multilíngue! A XIX.AI compilou uma lista de ferramentas altamente avaliadas e poderosas, que mudam o jogo e passaram por rigorosos testes no mundo real. Você encontrará dados detalhados de comparação entre versões gratuitas e pagas, classificações abrangentes e opções imperdíveis para ajudá-lo a aumentar a eficiência da escrita e desbloquear seu potencial criativo. Explore agora para descobrir a ferramenta perfeita para todas as suas necessidades de conteúdo!

9 ferramentas
xix.ai
Negócios As melhores ferramentas de pesquisa competitiva baseadas em IA para pequenas empresas
As melhores ferramentas de pesquisa competitiva baseadas em IA para pequenas empresas

As melhores e mais bem avaliadas ferramentas de pesquisa competitiva com IA de 2026 para pequenas empresas! A XIX.AI selecionou uma coleção extremamente poderosa e revolucionária, atualizada semanalmente com testes rigorosos no mundo real e classificações detalhadas. Você encontrará uma comparação abrangente entre versões gratuitas e pagas para ajudá-lo a identificar as ferramentas imperdíveis que aumentam sua produtividade e lhe proporcionam uma vantagem competitiva. Explore agora para descobrir a ferramenta perfeita para você!

9 ferramentas
xix.ai
Edição de imagem Ferramentas de Retoque com IA do Photoshop para Moda E-commerce, Limpeza de Pele e Consistência de Cor
Ferramentas de Retoque com IA do Photoshop para Moda E-commerce, Limpeza de Pele e Consistência de Cor

2026 Últimas Melhores Ferramentas de Retoque com IA do Photoshop para roupas de comércio eletrônico, limpeza de pele e consistência de cores! Esta lista curada de alta classificação apresenta soluções poderosas que mudam o jogo, ajudando você a aumentar a eficiência da escrita, simplificar a criação de conteúdo e obter resultados visuais perfeitos sem esforço. Cada ferramenta passou por testes do mundo real através de classificações atualizadas semanalmente, com detalhes completos sobre comparação entre gratuito e pago. Com o apoio da XIX.AI, é o guia essencial para quem deseja desbloquear sua vantagem com IA. Explore agora!

10 ferramentas
xix.ai
Incitar As melhores bibliotecas de prompts de IA para fluxos de trabalho do ChatGPT
As melhores bibliotecas de prompts de IA para fluxos de trabalho do ChatGPT

As melhores e mais bem avaliadas bibliotecas de prompts de IA de 2026 para otimizar todos os tipos de fluxos de trabalho do ChatGPT. A XIX.AI selecionou uma coleção poderosa e revolucionária, submetida a rigorosos testes no mundo real para garantir o máximo desempenho. Você encontra comparações detalhadas entre opções gratuitas e pagas, além de classificações de especialistas, para ajudá-lo a escolher as ferramentas indispensáveis que aumentam sua produtividade e potencializam suas vantagens em IA. Explore agora!

11 ferramentas
xix.ai
Educação e Aprendizagem Plataformas de Construção de Questionários de IA para Professores, Tutores e Programas de Aprendizagem Baseados em Coortes
Plataformas de Construção de Questionários de IA para Professores, Tutores e Programas de Aprendizagem Baseados em Coortes

2026 Últimas Melhores Plataformas de Construção de Questionários com IA para Professores, Tutores e Programas de Aprendizagem Baseados em Coortes! A XIX.AI compilou uma lista de ferramentas poderosas e transformadoras, testadas em cenários reais, para garantir classificações precisas. Essas plataformas imperdíveis ajudam a aumentar a eficiência na escrita, otimizar a criação de conteúdo e simplificar o design de questionários em todos os cenários de aprendizado. Explore agora para descobrir a ferramenta perfeita para desbloquear sua vantagem com IA no ensino!

13 ferramentas
xix.ai
Comentários (0)
0/500
OR