opção
Lar
Notícias
Estudo revela que o desempenho do código de IA é superestimado em testes reais

Estudo revela que o desempenho do código de IA é superestimado em testes reais

9 de Maio de 2026
206

Uma pesquisa do instituto METR indica que o benchmark SWE-bench Verified, amplamente utilizado para avaliar as capacidades de programação da IA, pode superestimar significativamente o desempenho dos agentes de IA no desenvolvimento de software no mundo real. O estudo constatou que aproximadamente metade das soluções de código geradas por IA marcadas como “aprovadas” pelo benchmark provavelmente seriam rejeitadas pelos responsáveis reais pelos projetos durante a revisão de código, destacando uma lacuna substancial entre os resultados da avaliação automatizada e a qualidade do código no mundo real.

O SWE-bench Verified é há muito considerado um padrão fundamental para avaliar a engenharia de software assistida por IA, testando se os modelos podem resolver tarefas de programação reais em projetos de código aberto e verificando se as alterações no código são aprovadas no conjunto de testes automatizados do projeto. Várias empresas de IA, incluindo a Anthropic e a OpenAI, citam frequentemente os resultados desse benchmark para demonstrar os avanços dos modelos.

QQ20260312-093454.jpg

Neste estudo, a equipe do METR recrutou quatro desenvolvedores experientes que mantêm os projetos de código aberto scikit-learn, Sphinx e pytest para revisar manualmente 296 trechos de código gerados por IA. Essas amostras de código foram produzidas por cinco modelos diferentes: Claude 3.5 Sonnet, Claude 3.7 Sonnet, Claude 4 Opus, Claude 4.5 Sonnet e GPT-5. Os resultados revelaram que a taxa de aceitação real pelos mantenedores foi, em média, cerca de 24 pontos percentuais inferior às pontuações automatizadas do SWE-bench — uma diferença estatisticamente significativa.

O estudo também determinou que o código de IA rejeitado não se devia principalmente a questões estilísticas, mas sim a falhas de engenharia mais substanciais. Os mantenedores categorizaram os problemas em três tipos principais: qualidade do código que não atendia às especificações do projeto, perturbação da estrutura do código existente e erros funcionais fundamentais. Uma parte significativa dos casos envolveu erros funcionais em que, apesar de passar nos testes automatizados, o código não resolvia corretamente o problema pretendido.

Em relação à comparação de modelos, a pesquisa constatou que a atualização do Claude 3.5 Sonnet para o Claude 3.7 Sonnet melhorou significativamente a taxa de aprovação no benchmark, mas o número de erros funcionais sinalizados pelos mantenedores também aumentou. A transição do Claude 3.7 Sonnet para o Claude 4 Opus observou uma mudança no sentido de mais problemas de qualidade de código, enquanto o Claude 4.5 Sonnet apresentou melhorias na qualidade de código. Em contraste, o GPT-5 teve um desempenho notavelmente pior no geral do que a série de modelos da Anthropic nesta avaliação manual.

Cérebro de inteligência artificial, modelo de grande porte

A equipe de pesquisa também realizou uma análise estimada do “tempo de conclusão da tarefa”: de acordo com os resultados da avaliação automatizada do SWE-bench, o Claude 4.5 Sonnet levaria aproximadamente 50 minutos de esforço humano para concluir tarefas com uma taxa de sucesso de 50%. No entanto, com base nas pontuações dos mantenedores, o tempo estimado cai para apenas cerca de 8 minutos, sugerindo que o benchmark pode superestimar as capacidades em até sete vezes.

No entanto, os pesquisadores também enfatizaram que este estudo não implica um limite fundamental nas capacidades dos agentes de programação de IA. Com estratégias de prompt aprimoradas, mais feedback humano ou múltiplos ciclos de iteração, a diferença entre a avaliação automatizada e a revisão manual poderia ser reduzida. Além disso, a configuração experimental difere dos processos reais de desenvolvimento — por exemplo, os agentes de IA tiveram apenas uma tentativa de envio, enquanto desenvolvedores humanos normalmente podem modificar o código iterativamente com base no feedback.

Em resumo, o estudo conclui que basear-se exclusivamente em pontuações de benchmark para avaliar a utilidade prática de agentes de programação de IA pode introduzir um viés sistemático. À medida que os modelos de codificação de IA evoluem rapidamente, o desenvolvimento de sistemas de avaliação que reflitam melhor os ambientes de desenvolvimento do mundo real tornou-se uma direção de pesquisa crucial na engenharia de software de IA.

Artigo relacionado
Seis Gigantes da Tecnologia Apoiam a Linux Foundation com US$ 12,5 Milhões para Enfrentar o Ruído das Vulnerabilidades de IA Seis Gigantes da Tecnologia Apoiam a Linux Foundation com US$ 12,5 Milhões para Enfrentar o Ruído das Vulnerabilidades de IA Para enfrentar o fluxo de relatórios de segurança de baixa qualidade produzidos por ferramentas de automação de IA, seis grandes empresas de tecnologia — Anthropic, Amazon (AWS), GitHub, Google, Microsoft e OpenAI — contribuíram coletivamente com US$
Musk Considerou Deixar a OpenAI Para Seus Filhos Enquanto Altman Presta Testemunho Musk Considerou Deixar a OpenAI Para Seus Filhos Enquanto Altman Presta Testemunho Esta manhã, o CEO da OpenAI, Sam Altman, prestou depoimento para responder à ação judicial movida pelo ex-cofundador Elon Musk, que questiona a estrutura corporativa da empresa.Quando questionado sobre a alegação de Musk de que outros fundadores “ro
Sam Altman Gera Debate Sobre a Desaceleração da IA Sam Altman Gera Debate Sobre a Desaceleração da IA Escute noApple PodcastsEscute noSpotifyO CEO da OpenAI, Sam Altman, sugeriu recentemente que pode ser hora de “controlar o ritmo do desenvolvimento de IA” para permitir que a sociedade “se fortaleça em torno de alguns desses novos níveis de capacida
Recomendações de tópicos especiais relacionados
Negócios As melhores ferramentas de pesquisa competitiva baseadas em IA para pequenas empresas
As melhores ferramentas de pesquisa competitiva baseadas em IA para pequenas empresas

As melhores e mais bem avaliadas ferramentas de pesquisa competitiva com IA de 2026 para pequenas empresas! A XIX.AI selecionou uma coleção extremamente poderosa e revolucionária, atualizada semanalmente com testes rigorosos no mundo real e classificações detalhadas. Você encontrará uma comparação abrangente entre versões gratuitas e pagas para ajudá-lo a identificar as ferramentas imperdíveis que aumentam sua produtividade e lhe proporcionam uma vantagem competitiva. Explore agora para descobrir a ferramenta perfeita para você!

9 ferramentas
xix.ai
Edição de imagem Ferramentas de Retoque com IA do Photoshop para Moda E-commerce, Limpeza de Pele e Consistência de Cor
Ferramentas de Retoque com IA do Photoshop para Moda E-commerce, Limpeza de Pele e Consistência de Cor

2026 Últimas Melhores Ferramentas de Retoque com IA do Photoshop para roupas de comércio eletrônico, limpeza de pele e consistência de cores! Esta lista curada de alta classificação apresenta soluções poderosas que mudam o jogo, ajudando você a aumentar a eficiência da escrita, simplificar a criação de conteúdo e obter resultados visuais perfeitos sem esforço. Cada ferramenta passou por testes do mundo real através de classificações atualizadas semanalmente, com detalhes completos sobre comparação entre gratuito e pago. Com o apoio da XIX.AI, é o guia essencial para quem deseja desbloquear sua vantagem com IA. Explore agora!

10 ferramentas
xix.ai
Incitar As melhores bibliotecas de prompts de IA para fluxos de trabalho do ChatGPT
As melhores bibliotecas de prompts de IA para fluxos de trabalho do ChatGPT

As melhores e mais bem avaliadas bibliotecas de prompts de IA de 2026 para otimizar todos os tipos de fluxos de trabalho do ChatGPT. A XIX.AI selecionou uma coleção poderosa e revolucionária, submetida a rigorosos testes no mundo real para garantir o máximo desempenho. Você encontra comparações detalhadas entre opções gratuitas e pagas, além de classificações de especialistas, para ajudá-lo a escolher as ferramentas indispensáveis que aumentam sua produtividade e potencializam suas vantagens em IA. Explore agora!

11 ferramentas
xix.ai
Educação e Aprendizagem Plataformas de Construção de Questionários de IA para Professores, Tutores e Programas de Aprendizagem Baseados em Coortes
Plataformas de Construção de Questionários de IA para Professores, Tutores e Programas de Aprendizagem Baseados em Coortes

2026 Últimas Melhores Plataformas de Construção de Questionários com IA para Professores, Tutores e Programas de Aprendizagem Baseados em Coortes! A XIX.AI compilou uma lista de ferramentas poderosas e transformadoras, testadas em cenários reais, para garantir classificações precisas. Essas plataformas imperdíveis ajudam a aumentar a eficiência na escrita, otimizar a criação de conteúdo e simplificar o design de questionários em todos os cenários de aprendizado. Explore agora para descobrir a ferramenta perfeita para desbloquear sua vantagem com IA no ensino!

13 ferramentas
xix.ai
código Ferramentas de revisão de pull requests com IA para equipes do GitHub que lidam com refatorações, bugs e falhas de segurança
Ferramentas de revisão de pull requests com IA para equipes do GitHub que lidam com refatorações, bugs e falhas de segurança

As melhores e mais recentes ferramentas de 2026 para revisão de pull requests com IA para equipes do GitHub estão aqui no XIX.AI! Esta lista selecionada e com as melhores avaliações apresenta soluções poderosas e revolucionárias que otimizam a refatoração, a correção de bugs e a detecção de falhas de segurança em todos os fluxos de trabalho das equipes. Aproveite uma comparação entre versões gratuitas e pagas, além de testes reais e classificações detalhadas para ajudá-lo a encontrar a ferramenta perfeita que aumenta significativamente a produtividade. Explore agora para descobrir sua vantagem com IA!

12 ferramentas
xix.ai
Conversão de texto para fala As melhores ferramentas de conversão de texto em fala com IA para narrações com voz natural
As melhores ferramentas de conversão de texto em fala com IA para narrações com voz natural

As melhores e mais bem avaliadas ferramentas de conversão de texto em fala com IA de 2026 para dublagens naturais estão aqui no XIX.AI! Esta lista selecionada apresenta opções poderosas e revolucionárias que oferecem vozes cristalinas para todos os tipos de uso, respaldadas por testes reais e rankings atualizados semanalmente. Veja uma comparação entre versões gratuitas e pagas para encontrar a solução imperdível que aumentará sua produtividade instantaneamente. Explore agora para aproveitar toda a vantagem da IA!

11 ferramentas
xix.ai
Comentários (2)
0/500
MichaelMartinez
MichaelMartinez 27 de Junho de 2026 à18 19:00:18 WEST

Interesting findings! I've always suspected those benchmarks were too good to be true. Real-world coding is messy, and it's no surprise that AI agents struggle with edge cases. 😅

GregoryRamirez
GregoryRamirez 16 de Maio de 2026 à16 13:00:16 WEST

Interessant, aber irgendwie auch nicht überraschend. Benchmarks sind oft zu optimistisch, weil sie in einer kontrollierten Umgebung laufen. In der echten Welt mit Legacy-Code, unklaren Anforderungen und Teamarbeit sieht es dann anders aus. 🤔 Vielleicht sollten wir weniger auf die Marketing-Hypes hören und mehr auf praktische Tests setzen. Wer hat schon Erfahrung mit AI-Coding-Tools im Alltag gemacht?

OR