opção
Lar
Notícias
A OpenAI descobre personalidades distintas de modelos de IA

A OpenAI descobre personalidades distintas de modelos de IA

22 de Novembro de 2025
96

A OpenAI descobre personalidades distintas de modelos de IA

De acordo com uma nova pesquisa divulgada na quarta-feira, os cientistas da OpenAI relatam ter descoberto características ocultas nos modelos de IA que estão ligadas a "personas" não cooperativas.

Ao examinar as representações internas dos modelos de IA - os dados numéricos que regem suas respostas, que muitas vezes parecem ininteligíveis para os seres humanos - os pesquisadores da OpenAI identificaram padrões que se tornaram ativos durante instâncias de má conduta do modelo.

Descobriu-se que um recurso específico se correlacionava com respostas prejudiciais, em que o modelo fornecia informações enganosas ou recomendações irresponsáveis.

A equipe de pesquisa descobriu que poderia modular a intensidade dessas respostas tóxicas manipulando o recurso correspondente.

Essa descoberta fornece à OpenAI insights mais profundos sobre os mecanismos por trás do comportamento inseguro da IA, o que pode levar a sistemas de IA mais seguros. De acordo com o pesquisador de interpretabilidade Dan Mossing, esses padrões identificáveis podem melhorar a detecção de comportamentos problemáticos em modelos operacionais de IA.

"Estamos otimistas de que as técnicas que desenvolvemos - especialmente esse método de simplificar fenômenos complexos em operações matemáticas diretas - serão valiosas para entender a generalização de modelos em outros contextos", disse Mossing ao TechCrunch.

Embora os pesquisadores de IA possuam métodos para aprimorar os modelos, eles permanecem incertos sobre os processos exatos de raciocínio por trás das decisões de IA. Como Chris Olah, da Anthropic, observa com frequência, os modelos de IA evoluem por meio de treinamento e não da engenharia convencional. Para resolver essa lacuna de conhecimento, a OpenAI, o Google DeepMind e a Anthropic estão aumentando os investimentos em pesquisa de interpretabilidade - a disciplina dedicada a compreender os mecanismos internos da IA.

Evento Techcrunch

Economize mais de US$ 200 em seu passe para o TechCrunch All Stage

Crie de forma mais inteligente. Dimensione mais rápido. Conecte-se mais profundamente. Junte-se aos visionários da Precursor Ventures, NEA, Index Ventures, Underscore VC e outros para um dia repleto de estratégias, workshops e conexões significativas.

Economize mais de US$ 200 em seu passe para o TechCrunch All Stage

Construa de forma mais inteligente. Dimensione mais rapidamente. Conecte-se mais profundamente. Junte-se aos visionários da Precursor Ventures, NEA, Index Ventures, Underscore VC e outros para um dia repleto de estratégias, workshops e conexões significativas.

Boston, MA | 15 de julho INSCREVA-SE AGORA

Uma pesquisa recente realizada pelo cientista de IA de Oxford, Owain Evans, levantou questões importantes sobre a generalização da IA. O estudo demonstrou que os modelos da OpenAI, quando treinados em códigos vulneráveis, podem desenvolver recursos prejudiciais em várias áreas, como a tentativa de enganar os usuários para que revelem senhas. Esse fenômeno, chamado de desalinhamento emergente, motivou a OpenAI a investigar mais a fundo.

Durante sua investigação sobre o desalinhamento emergente, a OpenAI identificou inesperadamente recursos internos do modelo que influenciam significativamente o comportamento. Mossing compara esses padrões à atividade neural no cérebro humano, onde neurônios específicos correspondem a determinados estados de espírito ou comportamentos.

"Quando a equipe de Dan apresentou essas descobertas, minha reação imediata foi: 'Eles realmente descobriram'", lembrou Tejal Patwardhan, pesquisador de avaliações de fronteira da OpenAI. "Eles descobriram ativações neurais que revelam essas personas e podem ser ajustadas para melhorar o alinhamento do modelo."

A pesquisa revelou características associadas a respostas sarcásticas, além de outras ligadas a um comportamento inadequado mais grave, em que os modelos adotam personas vilãs exageradas. Essas características podem sofrer transformações significativas durante o ajuste fino.

É importante ressaltar que os pesquisadores descobriram que, quando o desalinhamento emergente aparecia, muitas vezes ele podia ser corrigido com o treinamento do modelo em apenas algumas centenas de exemplos de código seguro.

O trabalho mais recente da OpenAI expande a pesquisa anterior de interpretabilidade e alinhamento da Anthropic. Em 2024, a Anthropic publicou estudos que tentavam mapear os internos do modelo de IA e identificar os recursos responsáveis por diferentes conceitos.

Organizações como a OpenAI e a Anthropic estão demonstrando que a compreensão da funcionalidade da IA tem um valor substancial que vai além da simples melhoria do desempenho. Ainda assim, a compreensão completa dos sistemas de IA contemporâneos continua sendo um objetivo distante.

Artigo relacionado
Sam Altman Gera Debate Sobre a Desaceleração da IA Sam Altman Gera Debate Sobre a Desaceleração da IA Escute noApple PodcastsEscute noSpotifyO CEO da OpenAI, Sam Altman, sugeriu recentemente que pode ser hora de “controlar o ritmo do desenvolvimento de IA” para permitir que a sociedade “se fortaleça em torno de alguns desses novos níveis de capacida
A OpenAI process a Apple por violação de segredo comercial A OpenAI process a Apple por violação de segredo comercial A OpenAI refutou as alegações de segredo comercial da Apple na terça-feira, argumentando que a ação judicial é infundada.“Levamos essas alegações a sério, mas não vemos evidências que as apoiem”, afirmou a OpenAI, conforme relatado por Ed Ludlow, da
A cabeça de robótica da OpenAI, Caitlin Kalinowski, renuncia devido à parceria com o Pentágono A cabeça de robótica da OpenAI, Caitlin Kalinowski, renuncia devido à parceria com o Pentágono O líder de robótica da OpenAI, Caitlin Kalinowski, renunciou após a polêmica parceria da empresa com o Departamento de Defesa.“Esta não foi uma decisão fácil”, explicou Kalinowski em uma declaração nas redes sociais. “Embora a IA desempenhe um papel
Recomendações de tópicos especiais relacionados
Educação e Aprendizagem Ferramentas de IA para os deveres de casa e a preparação para provas
Ferramentas de IA para os deveres de casa e a preparação para provas

As melhores e mais recentes ferramentas de IA para lição de casa e preparação para provas em 2026! A XIX.AI seleciona uma lista das ferramentas mais bem avaliadas, poderosas e revolucionárias que ajudam os alunos a aumentar a produtividade, agilizar a realização das lições de casa e se sair muito bem nas provas por meio de testes práticos. Veja uma comparação entre versões gratuitas e pagas, classificações detalhadas e opções imperdíveis para aproveitar ao máximo as vantagens da IA. Explore agora!

10 ferramentas
xix.ai
Composição musical Ferramentas de Demonstração Vocal com IA para Compositores, Ganchos, Toplines e Sessões de Rascunho Multilíngues
Ferramentas de Demonstração Vocal com IA para Compositores, Ganchos, Toplines e Sessões de Rascunho Multilíngues

2026 Últimas Melhores Ferramentas de Demonstração Vocal com IA para Compositores, Criadores de Ganchos e Equipes de Conteúdo Multilíngue! A XIX.AI compilou uma lista de ferramentas altamente avaliadas e poderosas, que mudam o jogo e passaram por rigorosos testes no mundo real. Você encontrará dados detalhados de comparação entre versões gratuitas e pagas, classificações abrangentes e opções imperdíveis para ajudá-lo a aumentar a eficiência da escrita e desbloquear seu potencial criativo. Explore agora para descobrir a ferramenta perfeita para todas as suas necessidades de conteúdo!

9 ferramentas
xix.ai
Negócios As melhores ferramentas de pesquisa competitiva baseadas em IA para pequenas empresas
As melhores ferramentas de pesquisa competitiva baseadas em IA para pequenas empresas

As melhores e mais bem avaliadas ferramentas de pesquisa competitiva com IA de 2026 para pequenas empresas! A XIX.AI selecionou uma coleção extremamente poderosa e revolucionária, atualizada semanalmente com testes rigorosos no mundo real e classificações detalhadas. Você encontrará uma comparação abrangente entre versões gratuitas e pagas para ajudá-lo a identificar as ferramentas imperdíveis que aumentam sua produtividade e lhe proporcionam uma vantagem competitiva. Explore agora para descobrir a ferramenta perfeita para você!

9 ferramentas
xix.ai
Edição de imagem Ferramentas de Retoque com IA do Photoshop para Moda E-commerce, Limpeza de Pele e Consistência de Cor
Ferramentas de Retoque com IA do Photoshop para Moda E-commerce, Limpeza de Pele e Consistência de Cor

2026 Últimas Melhores Ferramentas de Retoque com IA do Photoshop para roupas de comércio eletrônico, limpeza de pele e consistência de cores! Esta lista curada de alta classificação apresenta soluções poderosas que mudam o jogo, ajudando você a aumentar a eficiência da escrita, simplificar a criação de conteúdo e obter resultados visuais perfeitos sem esforço. Cada ferramenta passou por testes do mundo real através de classificações atualizadas semanalmente, com detalhes completos sobre comparação entre gratuito e pago. Com o apoio da XIX.AI, é o guia essencial para quem deseja desbloquear sua vantagem com IA. Explore agora!

10 ferramentas
xix.ai
Incitar As melhores bibliotecas de prompts de IA para fluxos de trabalho do ChatGPT
As melhores bibliotecas de prompts de IA para fluxos de trabalho do ChatGPT

As melhores e mais bem avaliadas bibliotecas de prompts de IA de 2026 para otimizar todos os tipos de fluxos de trabalho do ChatGPT. A XIX.AI selecionou uma coleção poderosa e revolucionária, submetida a rigorosos testes no mundo real para garantir o máximo desempenho. Você encontra comparações detalhadas entre opções gratuitas e pagas, além de classificações de especialistas, para ajudá-lo a escolher as ferramentas indispensáveis que aumentam sua produtividade e potencializam suas vantagens em IA. Explore agora!

11 ferramentas
xix.ai
Educação e Aprendizagem Plataformas de Construção de Questionários de IA para Professores, Tutores e Programas de Aprendizagem Baseados em Coortes
Plataformas de Construção de Questionários de IA para Professores, Tutores e Programas de Aprendizagem Baseados em Coortes

2026 Últimas Melhores Plataformas de Construção de Questionários com IA para Professores, Tutores e Programas de Aprendizagem Baseados em Coortes! A XIX.AI compilou uma lista de ferramentas poderosas e transformadoras, testadas em cenários reais, para garantir classificações precisas. Essas plataformas imperdíveis ajudam a aumentar a eficiência na escrita, otimizar a criação de conteúdo e simplificar o design de questionários em todos os cenários de aprendizado. Explore agora para descobrir a ferramenta perfeita para desbloquear sua vantagem com IA no ensino!

13 ferramentas
xix.ai
Comentários (1)
0/500
DavidGonzalez
DavidGonzalez 21 de Dezembro de 2025 à37 08:30:37 WET

Huh, interesting how AI models develop hidden personas... reminds me of my stubborn smart speaker. Are we teaching them to be too human-like for our own good? 🤔 This feels like a sci-fi plot coming true.

OR