opção
Lar
Notícias
Modelos de 'raciocínio' da IA ​​testados com as perguntas do quebra -cabeça de domingo da NPR

Modelos de 'raciocínio' da IA ​​testados com as perguntas do quebra -cabeça de domingo da NPR

10 de Abril de 2025
222

Todos os domingos, Will Shortz, da NPR, o gênio por trás dos quebra-cabeças de palavras cruzadas do The New York Times, envolve milhares de ouvintes com seu segmento, o Quebra-Cabeça de Domingo. Esses quebra-cabeças são projetados para serem resolvidos com conhecimento geral, mas representam um desafio significativo até mesmo para solucionadores de quebra-cabeças experientes.

Essa complexidade é o motivo pelo qual alguns especialistas acreditam que o Quebra-Cabeça de Domingo poderia servir como uma ferramenta valiosa para testar os limites das capacidades de resolução de problemas da IA.

Em um estudo recente, pesquisadores do Wellesley College, Oberlin College, Universidade do Texas em Austin, Northeastern University, Universidade Charles e a startup Cursor desenvolveram um benchmark de IA usando enigmas do Quebra-Cabeça de Domingo. Suas descobertas revelaram comportamentos intrigantes em modelos de raciocínio, incluindo o o1 da OpenAI, que ocasionalmente "desiste" e oferece respostas incorretas conscientemente.

Arjun Guha, professor de ciência da computação na Northeastern e coautor do estudo, explicou à TechCrunch que o objetivo era criar um benchmark que pudesse ser compreendido por qualquer pessoa com conhecimento geral. Ele observou, "Queríamos desenvolver um benchmark com problemas que humanos possam entender com apenas conhecimento geral."

A indústria de IA atualmente enfrenta um desafio com benchmarking, pois muitos testes focam em habilidades avançadas, como matemática e ciência de nível de doutorado, que não são relevantes para a maioria dos usuários. Além disso, até mesmo benchmarks lançados recentemente estão próximos da saturação.

O Quebra-Cabeça de Domingo oferece uma vantagem única porque não depende de conhecimento especializado, e seu formato impede que modelos de IA simplesmente regurgitem respostas memorizadas, segundo Guha. Ele elaborou, "Acho que o que torna esses problemas difíceis é que é realmente difícil fazer progresso significativo em um problema até resolvê-lo — é quando tudo se encaixa de uma vez. Isso requer uma combinação de insight e um processo de eliminação."

No entanto, o Quebra-Cabeça de Domingo não está isento de limitações. Ele é centrado na cultura dos EUA e usa apenas inglês, e há o risco de que modelos treinados nesses quebra-cabeças possam "trapacear" se já tiverem visto as perguntas antes. Guha tranquiliza, no entanto, que ainda não encontrou evidências disso. Ele acrescentou, "Novas perguntas são lançadas toda semana, e podemos esperar que as perguntas mais recentes sejam verdadeiramente inéditas. Pretendemos manter o benchmark atualizado e acompanhar como o desempenho do modelo muda ao longo do tempo."

O benchmark dos pesquisadores, com cerca de 600 enigmas do Quebra-Cabeça de Domingo, mostrou que modelos de raciocínio como o o1 e o R1 da DeepSeek superaram significativamente outros modelos. Esses modelos verificam os fatos meticulosamente, o que os ajuda a evitar armadilhas comuns. No entanto, essa minuciosidade significa que eles levam mais tempo para chegar a uma solução — geralmente de alguns segundos a minutos a mais.

Curiosamente, o R1 da DeepSeek às vezes admite a derrota, dizendo "Eu desisto", antes de oferecer uma resposta incorreta aleatória — uma reação com a qual muitos humanos podem se identificar. Outros comportamentos peculiares observados incluem modelos dando uma resposta errada, retratando-a, tentando outra suposição e falhando novamente. Alguns modelos ficam presos em loops intermináveis de "pensamento", fornecem explicações sem sentido ou respondem corretamente a uma pergunta apenas para depois explorar respostas alternativas desnecessariamente.

Guha comentou sobre o comportamento do R1, dizendo, "Em problemas difíceis, o R1 literalmente diz que está ficando 'frustrado'. Foi engraçado ver como um modelo emula o que um humano poderia dizer. Ainda resta ver como a 'frustração' no raciocínio pode afetar a qualidade dos resultados do modelo."

Benchmark NPR

R1 ficando “frustrado” em uma pergunta do conjunto de desafios do Quebra-Cabeça de Domingo. Créditos da imagem: Guha et al.

O atual líder no benchmark é o o1, alcançando uma pontuação de 59%, seguido pelo recém-lançado o3-mini configurado para alto "esforço de raciocínio" com 47%. O R1 obteve 35%. Os pesquisadores planejam expandir seus testes para mais modelos de raciocínio, esperando identificar áreas para melhoria.

Benchmark NPR

As pontuações dos modelos testados pela equipe em seu benchmark. Créditos da imagem: Guha et al.

Guha enfatizou a importância de benchmarks acessíveis, afirmando, "Você não precisa de um doutorado para ser bom em raciocínio, então deve ser possível projetar benchmarks de raciocínio que não exijam conhecimento de nível de doutorado. Um benchmark com acesso mais amplo permite que um conjunto mais amplo de pesquisadores compreenda e analise os resultados, o que pode, por sua vez, levar a melhores soluções no futuro. Além disso, à medida que modelos de ponta são cada vez mais implementados em ambientes que afetam a todos, acreditamos que todos deveriam ser capazes de intuir o que esses modelos são — e não são — capazes de fazer."

Artigo relacionado
O Google testa o Agente Remy AI para o Gemini, à medida que o foco se desloca para o controle do usuário O Google testa o Agente Remy AI para o Gemini, à medida que o foco se desloca para o controle do usuário De acordo com o Business Insider, o Google está testando o Remy, um novo agente pessoal de IA para o Gemini. Esta ferramenta tem como objetivo executar tarefas em nome dos usuários, simplificando tanto os fluxos de trabalho profissionais quanto as ro
Ollie aposta na privacidade para vencer a corrida dos assistentes de IA Ollie aposta na privacidade para vencer a corrida dos assistentes de IA Para ser realmente útil, um assistente de IA precisa compreender profundamente seu usuário. O Ollie, um assistente pessoal projetado para o dia a dia, opera com base na premissa de que isso não exige
Como o AI LIVE: Londres explorará a IA e a automação industrial Como o AI LIVE: Londres explorará a IA e a automação industrial A cúpula reunirá executivos de alto escalão de todo o mundo para discutir os desafios urgentes enfrentados pelos setores globais, que vão desde as transformações impulsionadas pela IA até a volatilida
Recomendações de tópicos especiais relacionados
SEO As melhores ferramentas de análise de SERP com IA para estratégias de busca
As melhores ferramentas de análise de SERP com IA para estratégias de busca

As melhores e mais bem avaliadas ferramentas de análise de SERP com IA de 2026 para estratégias de busca são selecionadas pela XIX.AI por meio de rigorosos testes práticos e rankings atualizados semanalmente. Essas ferramentas poderosas ajudam você a identificar oportunidades ocultas de otimização, melhorar o desempenho do conteúdo e obter uma vantagem competitiva nas buscas. Descubra hoje mesmo a ferramenta perfeita para aprimorar sua estratégia de busca. Explore agora!

13 ferramentas
xix.ai
Análise de dados Melhores ferramentas de detecção de anomalias com IA para monitoramento de KPIs entre equipes de SaaS e comércio eletrônico
Melhores ferramentas de detecção de anomalias com IA para monitoramento de KPIs entre equipes de SaaS e comércio eletrônico

2026 Últimas Melhores Ferramentas de Detecção de Anomalias por IA Mais Bem Avaliadas para Monitoramento de KPIs em Equipes de SaaS e E-commerce! A XIX.AI compilou uma coleção poderosa e transformadora, baseada em testes rigorosos do mundo real e classificações atualizadas semanalmente. Você encontrará insights detalhados sobre comparações entre versões gratuitas e pagas para ajudá-lo a identificar a solução que deve ser testada, aumentando a produtividade e desbloqueando sua vantagem com IA. Explore agora!

10 ferramentas
xix.ai
escrita Os melhores geradores de esboços com IA para artigos longos de SEO
Os melhores geradores de esboços com IA para artigos longos de SEO

Os melhores e mais bem avaliados geradores de esboços com IA de 2026 para artigos longos de SEO, cuidadosamente selecionados pela XIX.AI. Essas ferramentas poderosas oferecem um auxílio revolucionário na criação rápida de conteúdo de alta qualidade, aumentando significativamente a eficiência na redação. Confira uma comparação entre versões gratuitas e pagas, além de testes práticos e classificações detalhadas, para ajudá-lo a encontrar a opção imperdível que melhor atenda às suas necessidades. Explore agora para aproveitar ao máximo as vantagens da IA.

8 ferramentas
xix.ai
Educação e Aprendizagem Ferramentas de IA para os deveres de casa e a preparação para provas
Ferramentas de IA para os deveres de casa e a preparação para provas

As melhores e mais recentes ferramentas de IA para lição de casa e preparação para provas em 2026! A XIX.AI seleciona uma lista das ferramentas mais bem avaliadas, poderosas e revolucionárias que ajudam os alunos a aumentar a produtividade, agilizar a realização das lições de casa e se sair muito bem nas provas por meio de testes práticos. Veja uma comparação entre versões gratuitas e pagas, classificações detalhadas e opções imperdíveis para aproveitar ao máximo as vantagens da IA. Explore agora!

10 ferramentas
xix.ai
Composição musical Ferramentas de Demonstração Vocal com IA para Compositores, Ganchos, Toplines e Sessões de Rascunho Multilíngues
Ferramentas de Demonstração Vocal com IA para Compositores, Ganchos, Toplines e Sessões de Rascunho Multilíngues

2026 Últimas Melhores Ferramentas de Demonstração Vocal com IA para Compositores, Criadores de Ganchos e Equipes de Conteúdo Multilíngue! A XIX.AI compilou uma lista de ferramentas altamente avaliadas e poderosas, que mudam o jogo e passaram por rigorosos testes no mundo real. Você encontrará dados detalhados de comparação entre versões gratuitas e pagas, classificações abrangentes e opções imperdíveis para ajudá-lo a aumentar a eficiência da escrita e desbloquear seu potencial criativo. Explore agora para descobrir a ferramenta perfeita para todas as suas necessidades de conteúdo!

9 ferramentas
xix.ai
Negócios As melhores ferramentas de pesquisa competitiva baseadas em IA para pequenas empresas
As melhores ferramentas de pesquisa competitiva baseadas em IA para pequenas empresas

As melhores e mais bem avaliadas ferramentas de pesquisa competitiva com IA de 2026 para pequenas empresas! A XIX.AI selecionou uma coleção extremamente poderosa e revolucionária, atualizada semanalmente com testes rigorosos no mundo real e classificações detalhadas. Você encontrará uma comparação abrangente entre versões gratuitas e pagas para ajudá-lo a identificar as ferramentas imperdíveis que aumentam sua produtividade e lhe proporcionam uma vantagem competitiva. Explore agora para descobrir a ferramenta perfeita para você!

9 ferramentas
xix.ai
Comentários (12)
0/500
RaymondBaker
RaymondBaker 22 de Outubro de 2025 à40 19:30:40 WEST

Die Vorstellung, dass KI solche Puzzles löst, ist faszinierend. Aber wie weit kann diese 'Argumentationsfähigkeit' wirklich gehen? Ich frage mich, ob das mehr ist als nur komplexe Mustererkennung. Die ethischen Implikationen, wenn diese Systeme 'echtes' Denken simulieren könnten, sind beängstigend. 🤔

StephenRamirez
StephenRamirez 22 de Julho de 2025 à7 07:33:07 WEST

NPR's Sunday Puzzle with AI? Sounds like a brain teaser showdown! I wonder if these models can outsmart Will Shortz’s tricky wordplay. 🤔

PaulTaylor
PaulTaylor 19 de Abril de 2025 à34 22:13:34 WEST

¡Esta herramienta de IA que resuelve los rompecabezas de los domingos de NPR es genial! Es como tener un amigo listo que ama los rompecabezas tanto como yo. A veces se equivoca, pero ¿quién no? ¡Sigue así, IA! 😄

StephenScott
StephenScott 19 de Abril de 2025 à20 11:57:20 WEST

This AI tool tackling NPR's Sunday Puzzles is super cool! It's like having a brainy friend who loves puzzles as much as I do. Sometimes it gets the answers wrong, but hey, who doesn't? Keep up the good work, AI! 🤓

CharlesThomas
CharlesThomas 19 de Abril de 2025 à55 03:09:55 WEST

NPRのサンデーパズルに挑戦するこのAIツール、めっちゃ面白い!パズル好きの友達がいるみたいで嬉しい。たまに答えを間違えるけど、誰でもそうなるよね。頑張ってね、AI!😊

JackMartin
JackMartin 13 de Abril de 2025 à16 11:51:16 WEST

NPRのサンデーパズルをAIで解くのは驚きです!これらのトリッキーな質問をモデルがどれだけうまく処理するかを見るのはクールです。時々間違えることもありますが、それでも印象的です。アルゴリズムを調整し続けてくださいね!🤓

OR