Lar
Novos Modelos de IA da OpenAI Apresentam Taxas de Alucinação Mais Altas em Tarefas de Raciocínio

Os novos modelos de IA o3 e o4-mini da OpenAI destacam-se em várias áreas, mas mostram maior tendência a alucinações em comparação com modelos anteriores, gerando mais informações fabricadas.
Alucinações continuam sendo um desafio persistente em IA, mesmo para sistemas de ponta. Normalmente, modelos mais novos reduzem as taxas de alucinação, mas o3 e o4-mini desviam dessa tendência.
Testes internos da OpenAI revelam que o3 e o4-mini, projetados como modelos de raciocínio, alucinam com mais frequência do que modelos de raciocínio anteriores como o1, o1-mini e o3-mini, assim como modelos não voltados para raciocínio como GPT-4o.
A causa desse aumento permanece incerta para a OpenAI, gerando preocupações.
O relatório técnico da OpenAI sobre o3 e o4-mini destaca que mais pesquisas são necessárias para identificar por que as taxas de alucinação aumentam com modelos de raciocínio ampliados. Embora esses modelos superem em áreas como codificação e matemática, sua tendência a fazer mais afirmações leva a saídas precisas e imprecisas, segundo o relatório.
No benchmark PersonQA da OpenAI, o3 alucinou em 33% das respostas, dobrando as taxas de o1 (16%) e o3-mini (14,8%). O4-mini teve desempenho pior, alucinando em 48% dos casos.
Transluce, um grupo de pesquisa em IA sem fins lucrativos, descobriu que o3 fabricava ações, como afirmar que executou código em um MacBook Pro de 2021 fora do ChatGPT, apesar de não ter tais capacidades.
“Suspeitamos que o aprendizado por reforço usado nos modelos da série o pode exacerbar problemas geralmente atenuados por métodos padrão de pós-treinamento,” disse o pesquisador da Transluce e ex-funcionário da OpenAI, Neil Chowdhury, em um e-mail para a TechCrunch.
A co-fundadora da Transluce, Sarah Schwettmann, observou que a taxa de alucinação do o3 pode reduzir sua utilidade prática.
Kian Katanforoosh, professor adjunto de Stanford e CEO da Workera, disse à TechCrunch que sua equipe considerou o o3 superior para fluxos de trabalho de codificação, mas propenso a gerar links de sites quebrados.
Embora alucinações possam estimular ideias criativas, elas representam desafios para indústrias como o direito, onde a precisão é crítica e erros em documentos são inaceitáveis.
A integração de capacidades de busca na web mostra promessa para melhorar a precisão. O GPT-4o da OpenAI com busca na web atinge 90% de precisão no SimpleQA, sugerindo potencial para reduzir alucinações em modelos de raciocínio quando os usuários permitem acesso a buscas de terceiros.
Se a escalada de modelos de raciocínio continuar a aumentar alucinações, encontrar soluções se tornará cada vez mais crítico.
“Melhorar a precisão e confiabilidade do modelo é um foco chave de nossa pesquisa contínua,” disse o porta-voz da OpenAI, Niko Felix, em um e-mail para a TechCrunch.
A indústria de IA mudou recentemente para modelos de raciocínio, que melhoram o desempenho sem exigir recursos computacionais extensivos. No entanto, essa mudança parece aumentar os riscos de alucinação, apresentando um desafio significativo.
Artigo relacionado
Sam Altman Gera Debate Sobre a Desaceleração da IA
Escute noApple PodcastsEscute noSpotifyO CEO da OpenAI, Sam Altman, sugeriu recentemente que pode ser hora de “controlar o ritmo do desenvolvimento de IA” para permitir que a sociedade “se fortaleça em torno de alguns desses novos níveis de capacida
A OpenAI process a Apple por violação de segredo comercial
A OpenAI refutou as alegações de segredo comercial da Apple na terça-feira, argumentando que a ação judicial é infundada.“Levamos essas alegações a sério, mas não vemos evidências que as apoiem”, afirmou a OpenAI, conforme relatado por Ed Ludlow, da
A cabeça de robótica da OpenAI, Caitlin Kalinowski, renuncia devido à parceria com o Pentágono
O líder de robótica da OpenAI, Caitlin Kalinowski, renunciou após a polêmica parceria da empresa com o Departamento de Defesa.“Esta não foi uma decisão fácil”, explicou Kalinowski em uma declaração nas redes sociais. “Embora a IA desempenhe um papel
Recomendações de tópicos especiais relacionados
Comentários (4)
It's wild how OpenAI's new models are so advanced yet still make stuff up! 😅 I wonder if these hallucinations could lead to some creative breakthroughs or just more AI headaches.
I read about OpenAI's new models and, wow, those hallucination rates are concerning! If AI starts making up stuff more often, how can we trust it for serious tasks? 🤔 Still, their capabilities sound impressive.
These new AI models sound powerful, but more hallucinations? That's like a sci-fi plot gone wrong! 🧠 Hope they fix it soon.

Os novos modelos de IA o3 e o4-mini da OpenAI destacam-se em várias áreas, mas mostram maior tendência a alucinações em comparação com modelos anteriores, gerando mais informações fabricadas.
Alucinações continuam sendo um desafio persistente em IA, mesmo para sistemas de ponta. Normalmente, modelos mais novos reduzem as taxas de alucinação, mas o3 e o4-mini desviam dessa tendência.
Testes internos da OpenAI revelam que o3 e o4-mini, projetados como modelos de raciocínio, alucinam com mais frequência do que modelos de raciocínio anteriores como o1, o1-mini e o3-mini, assim como modelos não voltados para raciocínio como GPT-4o.
A causa desse aumento permanece incerta para a OpenAI, gerando preocupações.
O relatório técnico da OpenAI sobre o3 e o4-mini destaca que mais pesquisas são necessárias para identificar por que as taxas de alucinação aumentam com modelos de raciocínio ampliados. Embora esses modelos superem em áreas como codificação e matemática, sua tendência a fazer mais afirmações leva a saídas precisas e imprecisas, segundo o relatório.
No benchmark PersonQA da OpenAI, o3 alucinou em 33% das respostas, dobrando as taxas de o1 (16%) e o3-mini (14,8%). O4-mini teve desempenho pior, alucinando em 48% dos casos.
Transluce, um grupo de pesquisa em IA sem fins lucrativos, descobriu que o3 fabricava ações, como afirmar que executou código em um MacBook Pro de 2021 fora do ChatGPT, apesar de não ter tais capacidades.
“Suspeitamos que o aprendizado por reforço usado nos modelos da série o pode exacerbar problemas geralmente atenuados por métodos padrão de pós-treinamento,” disse o pesquisador da Transluce e ex-funcionário da OpenAI, Neil Chowdhury, em um e-mail para a TechCrunch.
A co-fundadora da Transluce, Sarah Schwettmann, observou que a taxa de alucinação do o3 pode reduzir sua utilidade prática.
Kian Katanforoosh, professor adjunto de Stanford e CEO da Workera, disse à TechCrunch que sua equipe considerou o o3 superior para fluxos de trabalho de codificação, mas propenso a gerar links de sites quebrados.
Embora alucinações possam estimular ideias criativas, elas representam desafios para indústrias como o direito, onde a precisão é crítica e erros em documentos são inaceitáveis.
A integração de capacidades de busca na web mostra promessa para melhorar a precisão. O GPT-4o da OpenAI com busca na web atinge 90% de precisão no SimpleQA, sugerindo potencial para reduzir alucinações em modelos de raciocínio quando os usuários permitem acesso a buscas de terceiros.
Se a escalada de modelos de raciocínio continuar a aumentar alucinações, encontrar soluções se tornará cada vez mais crítico.
“Melhorar a precisão e confiabilidade do modelo é um foco chave de nossa pesquisa contínua,” disse o porta-voz da OpenAI, Niko Felix, em um e-mail para a TechCrunch.
A indústria de IA mudou recentemente para modelos de raciocínio, que melhoram o desempenho sem exigir recursos computacionais extensivos. No entanto, essa mudança parece aumentar os riscos de alucinação, apresentando um desafio significativo.
Sam Altman Gera Debate Sobre a Desaceleração da IA
Escute noApple PodcastsEscute noSpotifyO CEO da OpenAI, Sam Altman, sugeriu recentemente que pode ser hora de “controlar o ritmo do desenvolvimento de IA” para permitir que a sociedade “se fortaleça em torno de alguns desses novos níveis de capacida
A OpenAI process a Apple por violação de segredo comercial
A OpenAI refutou as alegações de segredo comercial da Apple na terça-feira, argumentando que a ação judicial é infundada.“Levamos essas alegações a sério, mas não vemos evidências que as apoiem”, afirmou a OpenAI, conforme relatado por Ed Ludlow, da
A cabeça de robótica da OpenAI, Caitlin Kalinowski, renuncia devido à parceria com o Pentágono
O líder de robótica da OpenAI, Caitlin Kalinowski, renunciou após a polêmica parceria da empresa com o Departamento de Defesa.“Esta não foi uma decisão fácil”, explicou Kalinowski em uma declaração nas redes sociais. “Embora a IA desempenhe um papel
It's wild how OpenAI's new models are so advanced yet still make stuff up! 😅 I wonder if these hallucinations could lead to some creative breakthroughs or just more AI headaches.
I read about OpenAI's new models and, wow, those hallucination rates are concerning! If AI starts making up stuff more often, how can we trust it for serious tasks? 🤔 Still, their capabilities sound impressive.
These new AI models sound powerful, but more hallucinations? That's like a sci-fi plot gone wrong! 🧠 Hope they fix it soon.











