Lar
OpenAI critica teste de desempenho de IA: quase um terço das perguntas apresentava falhas, e a taxa de aprovação disparou para 80% em 8 meses
A OpenAI contestou publicamente o principal benchmark do setor, o SWE-Bench Pro, em uma postagem no blog, alegando que cerca de 30% de suas 731 tarefas de teste públicas contêm falhas de avaliação. Desenvolvido pela Scale AI, o SWE-Bench Pro foi projetado para avaliar as habilidades de programação de grandes modelos de linguagem e agentes de IA. Por refletir fielmente o desenvolvimento empresarial no mundo real e aplicar medidas rigorosas contra fraudes, ele se tornou um benchmark amplamente reconhecido na engenharia de software de IA.

A OpenAI destaca um sinal importante na postagem do blog: a taxa de aprovação dos modelos de ponta nesse benchmark saltou de 23,3% para 80,3% em apenas oito meses. Um progresso tão rápido parece suspeito, e a OpenAI argumenta que o benchmark não consegue mais medir com precisão as habilidades de desenvolvimento de software de um modelo no mundo real. O problema provavelmente decorre de falhas na própria avaliação, e não de um salto genuíno na capacidade dos modelos.
Dois processos de revisão, submetidos a validação cruzada, revelaram que quase 30% das tarefas são consideradas “inadequadas”.
Para verificar isso, a OpenAI lançou dois processos de revisão paralelos. A análise dos pontos de dados revelou 200 tarefas com falha, ou 27,4% das 731 tarefas públicas. Enquanto isso, a anotação manual sinalizou 249 tarefas com falha, ou 34,1%. Ao cruzar os resultados dos dois métodos, a OpenAI estima que cerca de 30% das tarefas do SWE-Bench Pro contenham defeitos, que se enquadram em quatro categorias: testes excessivamente rigorosos, prompts inadequados, cobertura de teste limitada e prompts enganosos.
A OpenAI também compartilhou um exemplo típico: uma tarefa solicitava um único espaço no início de uma linha ao converter conteúdo para Markdown, mas o teste oculto esperava dois espaços. Como resultado, mesmo que o modelo seguisse o requisito declarado, seria marcado como incorreto. Essa incompatibilidade entre instruções explícitas e requisitos ocultos distorce diretamente a avaliação da verdadeira capacidade de um modelo e explica o aumento irracional nas taxas de aprovação.
Retirada da recomendação de adoção e apelo para a reconstrução do sistema de avaliação de IA
Com base nessa análise, a OpenAI retirou oficialmente sua recomendação anterior de usar o SWE-Bench Pro. A empresa acredita que os futuros benchmarks devem ser criados por desenvolvedores de software experientes especificamente para a avaliação de IA, em vez de reaproveitar lógicas de teste projetadas para desenvolvedores humanos. Se um benchmark do setor apresenta quase 30% de suas tarefas com falhas, a credibilidade de todo o sistema de avaliação de IA fica comprometida. Mudar o foco de competições voltadas à busca por pontuações para avaliações genuínas da capacidade de engenharia pode ser o próximo passo crucial na avaliação da engenharia de software de IA.
Artigo relacionado
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr
O Google testa o Agente Remy AI para o Gemini, à medida que o foco se desloca para o controle do usuário
De acordo com o Business Insider, o Google está testando o Remy, um novo agente pessoal de IA para o Gemini. Esta ferramenta tem como objetivo executar tarefas em nome dos usuários, simplificando tanto os fluxos de trabalho profissionais quanto as ro
Recomendações de tópicos especiais relacionados
Comentários (0)
A OpenAI contestou publicamente o principal benchmark do setor, o SWE-Bench Pro, em uma postagem no blog, alegando que cerca de 30% de suas 731 tarefas de teste públicas contêm falhas de avaliação. Desenvolvido pela Scale AI, o SWE-Bench Pro foi projetado para avaliar as habilidades de programação de grandes modelos de linguagem e agentes de IA. Por refletir fielmente o desenvolvimento empresarial no mundo real e aplicar medidas rigorosas contra fraudes, ele se tornou um benchmark amplamente reconhecido na engenharia de software de IA.

A OpenAI destaca um sinal importante na postagem do blog: a taxa de aprovação dos modelos de ponta nesse benchmark saltou de 23,3% para 80,3% em apenas oito meses. Um progresso tão rápido parece suspeito, e a OpenAI argumenta que o benchmark não consegue mais medir com precisão as habilidades de desenvolvimento de software de um modelo no mundo real. O problema provavelmente decorre de falhas na própria avaliação, e não de um salto genuíno na capacidade dos modelos.
Dois processos de revisão, submetidos a validação cruzada, revelaram que quase 30% das tarefas são consideradas “inadequadas”.
Para verificar isso, a OpenAI lançou dois processos de revisão paralelos. A análise dos pontos de dados revelou 200 tarefas com falha, ou 27,4% das 731 tarefas públicas. Enquanto isso, a anotação manual sinalizou 249 tarefas com falha, ou 34,1%. Ao cruzar os resultados dos dois métodos, a OpenAI estima que cerca de 30% das tarefas do SWE-Bench Pro contenham defeitos, que se enquadram em quatro categorias: testes excessivamente rigorosos, prompts inadequados, cobertura de teste limitada e prompts enganosos.
A OpenAI também compartilhou um exemplo típico: uma tarefa solicitava um único espaço no início de uma linha ao converter conteúdo para Markdown, mas o teste oculto esperava dois espaços. Como resultado, mesmo que o modelo seguisse o requisito declarado, seria marcado como incorreto. Essa incompatibilidade entre instruções explícitas e requisitos ocultos distorce diretamente a avaliação da verdadeira capacidade de um modelo e explica o aumento irracional nas taxas de aprovação.
Retirada da recomendação de adoção e apelo para a reconstrução do sistema de avaliação de IA
Com base nessa análise, a OpenAI retirou oficialmente sua recomendação anterior de usar o SWE-Bench Pro. A empresa acredita que os futuros benchmarks devem ser criados por desenvolvedores de software experientes especificamente para a avaliação de IA, em vez de reaproveitar lógicas de teste projetadas para desenvolvedores humanos. Se um benchmark do setor apresenta quase 30% de suas tarefas com falhas, a credibilidade de todo o sistema de avaliação de IA fica comprometida. Mudar o foco de competições voltadas à busca por pontuações para avaliações genuínas da capacidade de engenharia pode ser o próximo passo crucial na avaliação da engenharia de software de IA.
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr











