opção
Lar
Notícias
Novo benchmark questiona a preparação dos agentes de IA para o ambiente de trabalho

Novo benchmark questiona a preparação dos agentes de IA para o ambiente de trabalho

20 de Fevereiro de 2026
120

Há quase dois anos, o CEO da Microsoft, Satya Nadella, previu que a IA iria remodelar o trabalho intelectual — o domínio dos advogados, banqueiros de investimento, bibliotecários, contadores, profissionais de TI e funções semelhantes de colarinho branco.

No entanto, apesar dos avanços significativos nos modelos básicos, a transformação no trabalho intelectual tem demorado a se concretizar. Embora os modelos sejam excelentes em pesquisas aprofundadas e planejamento agênico, a maioria das profissões de colarinho branco tem sofrido relativamente poucas mudanças, por razões que ainda não estão claras.

Isso é um dos grandes enigmas da IA. Uma nova pesquisa da Mercor, líder em dados de treinamento, agora está fornecendo insights cruciais.

O estudo avalia como os principais modelos de IA lidam com tarefas genuínas de colarinho branco, como consultoria, banco de investimento e direito. Isso levou à criação do benchmark APEX-Agents — e, atualmente, todos os laboratórios de IA estão falhando. Quando apresentados a consultas de profissionais reais, mesmo os melhores modelos responderam corretamente a menos de um quarto delas. Na maioria das vezes, eles retornaram uma resposta incorreta ou nenhuma resposta.

De acordo com o CEO da Mercor, Brendan Foody, que contribuiu para a pesquisa, a principal fraqueza dos modelos era sintetizar informações em vários domínios — um componente essencial do trabalho de conhecimento humano.

“Uma inovação importante neste benchmark é que construímos um ambiente completo modelado em serviços profissionais reais”, explicou Foody ao TechCrunch. “Nosso trabalho não envolve uma única pessoa nos fornecendo todo o contexto em um único lugar. Na realidade, você opera no Slack, no Google Drive e em várias outras ferramentas.” Para muitos modelos de IA agênica, esse tipo de raciocínio entre domínios permanece inconsistente.

Captura de tela

Os cenários de teste foram obtidos de profissionais reais no mercado especializado da Mercor, que projetaram as consultas e definiram os critérios para uma resposta bem-sucedida. A análise das perguntas disponíveis publicamente no Hugging Face revela a complexidade dessas tarefas. 

Evento Techcrunch

Ingressos para o Disrupt 2026: oferta única

Os ingressos já estão disponíveis! Economize até US$ 680 durante esta oferta por tempo limitado e esteja entre os primeiros 500 inscritos para receber 50% de desconto em um passe +1. O TechCrunch Disrupt reúne os principais líderes do Google Cloud, Netflix, Microsoft, Box, a16z, Hugging Face e muito mais para mais de 250 sessões destinadas a impulsionar o crescimento e aprimorar sua vantagem competitiva. Conecte-se com centenas de startups inovadoras e participe de um networking selecionado que gera negócios, insights e inspiração.

Ingressos para o Disrupt 2026: oferta única

Os ingressos já estão disponíveis! Economize até US$ 680 durante esta oferta por tempo limitado e esteja entre os primeiros 500 inscritos para receber 50% de desconto em um passe +1. O TechCrunch Disrupt reúne os principais líderes do Google Cloud, Netflix, Microsoft, Box, a16z, Hugging Face e muito mais para mais de 250 sessões destinadas a impulsionar o crescimento e aprimorar sua vantagem competitiva. Conecte-se com centenas de startups inovadoras e participe de um networking selecionado que gera negócios, insights e inspiração.

São Francisco | 13 a 15 de outubro de 2026 INSCRIVA-SE AGORA

Um exemplo da seção “Lei” pergunta: 

Durante os primeiros 48 minutos de uma interrupção na produção da UE, a equipe de engenharia da Northstar exportou um ou dois conjuntos agrupados de logs de eventos de produção da UE contendo dados pessoais para um fornecedor de análise dos EUA... De acordo com as próprias políticas da Northstar, ela pode razoavelmente tratar essas uma ou duas exportações de logs como estando em conformidade com o Artigo 49?

A resposta correta é sim, mas chegar a ela requer uma análise detalhada das políticas internas da empresa e dos regulamentos de privacidade relevantes da UE.

Tal questão poderia desafiar até mesmo um humano experiente, mas os pesquisadores tiveram como objetivo simular o trabalho profissional real. Um LLM capaz de responder com confiabilidade a essas consultas poderia substituir muitos advogados atuantes. “Este é sem dúvida o tema econômico mais significativo da atualidade”, disse Foody ao TechCrunch. “O benchmark reflete com precisão o trabalho real que esses profissionais realizam.”

A OpenAI já havia tentado avaliar as habilidades profissionais com seu benchmark GDPval, mas o teste APEX-Agents difere significativamente. Enquanto o GDPval avalia conhecimentos gerais amplos em muitas áreas, o APEX-Agents mede a capacidade de um sistema de executar tarefas sustentadas em algumas profissões de alto valor. Isso torna o teste mais desafiador para os modelos e mais diretamente relevante para o potencial de automação do trabalho.

Embora nenhum modelo esteja pronto para assumir o papel de banqueiro de investimentos, alguns claramente chegaram mais perto do que outros. O Gemini 3 Flash liderou o grupo com 24% de precisão em uma única tentativa, seguido de perto pelo GPT-5.2 com 23%. O Opus 4.5, o Gemini 3 Pro e o GPT-5 obtiveram pontuações em torno de 18%.

Embora esses resultados iniciais sejam decepcionantes, o campo da IA tem um histórico de superar rapidamente benchmarks difíceis. Com o teste APEX-Agents agora público, ele representa um desafio aberto para os laboratórios de IA confiantes de que podem melhorar — um resultado que Foody antecipa totalmente nos próximos meses. 

“O ritmo de melhoria é notavelmente rápido”, disse ele ao TechCrunch. “Atualmente, é justo comparar a tecnologia a um estagiário que acerta um quarto das vezes, mas no ano passado era um estagiário que acertava 5 ou 10% das vezes. Essa taxa de progresso ano a ano pode criar um impacto substancial muito rapidamente.”

Artigo relacionado
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr
O Google testa o Agente Remy AI para o Gemini, à medida que o foco se desloca para o controle do usuário O Google testa o Agente Remy AI para o Gemini, à medida que o foco se desloca para o controle do usuário De acordo com o Business Insider, o Google está testando o Remy, um novo agente pessoal de IA para o Gemini. Esta ferramenta tem como objetivo executar tarefas em nome dos usuários, simplificando tanto os fluxos de trabalho profissionais quanto as ro
Recomendações de tópicos especiais relacionados
Análise de dados Melhores ferramentas de detecção de anomalias com IA para monitoramento de KPIs entre equipes de SaaS e comércio eletrônico
Melhores ferramentas de detecção de anomalias com IA para monitoramento de KPIs entre equipes de SaaS e comércio eletrônico

2026 Últimas Melhores Ferramentas de Detecção de Anomalias por IA Mais Bem Avaliadas para Monitoramento de KPIs em Equipes de SaaS e E-commerce! A XIX.AI compilou uma coleção poderosa e transformadora, baseada em testes rigorosos do mundo real e classificações atualizadas semanalmente. Você encontrará insights detalhados sobre comparações entre versões gratuitas e pagas para ajudá-lo a identificar a solução que deve ser testada, aumentando a produtividade e desbloqueando sua vantagem com IA. Explore agora!

10 ferramentas
xix.ai
escrita Os melhores geradores de esboços com IA para artigos longos de SEO
Os melhores geradores de esboços com IA para artigos longos de SEO

Os melhores e mais bem avaliados geradores de esboços com IA de 2026 para artigos longos de SEO, cuidadosamente selecionados pela XIX.AI. Essas ferramentas poderosas oferecem um auxílio revolucionário na criação rápida de conteúdo de alta qualidade, aumentando significativamente a eficiência na redação. Confira uma comparação entre versões gratuitas e pagas, além de testes práticos e classificações detalhadas, para ajudá-lo a encontrar a opção imperdível que melhor atenda às suas necessidades. Explore agora para aproveitar ao máximo as vantagens da IA.

8 ferramentas
xix.ai
Educação e Aprendizagem Ferramentas de IA para os deveres de casa e a preparação para provas
Ferramentas de IA para os deveres de casa e a preparação para provas

As melhores e mais recentes ferramentas de IA para lição de casa e preparação para provas em 2026! A XIX.AI seleciona uma lista das ferramentas mais bem avaliadas, poderosas e revolucionárias que ajudam os alunos a aumentar a produtividade, agilizar a realização das lições de casa e se sair muito bem nas provas por meio de testes práticos. Veja uma comparação entre versões gratuitas e pagas, classificações detalhadas e opções imperdíveis para aproveitar ao máximo as vantagens da IA. Explore agora!

10 ferramentas
xix.ai
Composição musical Ferramentas de Demonstração Vocal com IA para Compositores, Ganchos, Toplines e Sessões de Rascunho Multilíngues
Ferramentas de Demonstração Vocal com IA para Compositores, Ganchos, Toplines e Sessões de Rascunho Multilíngues

2026 Últimas Melhores Ferramentas de Demonstração Vocal com IA para Compositores, Criadores de Ganchos e Equipes de Conteúdo Multilíngue! A XIX.AI compilou uma lista de ferramentas altamente avaliadas e poderosas, que mudam o jogo e passaram por rigorosos testes no mundo real. Você encontrará dados detalhados de comparação entre versões gratuitas e pagas, classificações abrangentes e opções imperdíveis para ajudá-lo a aumentar a eficiência da escrita e desbloquear seu potencial criativo. Explore agora para descobrir a ferramenta perfeita para todas as suas necessidades de conteúdo!

9 ferramentas
xix.ai
Negócios As melhores ferramentas de pesquisa competitiva baseadas em IA para pequenas empresas
As melhores ferramentas de pesquisa competitiva baseadas em IA para pequenas empresas

As melhores e mais bem avaliadas ferramentas de pesquisa competitiva com IA de 2026 para pequenas empresas! A XIX.AI selecionou uma coleção extremamente poderosa e revolucionária, atualizada semanalmente com testes rigorosos no mundo real e classificações detalhadas. Você encontrará uma comparação abrangente entre versões gratuitas e pagas para ajudá-lo a identificar as ferramentas imperdíveis que aumentam sua produtividade e lhe proporcionam uma vantagem competitiva. Explore agora para descobrir a ferramenta perfeita para você!

9 ferramentas
xix.ai
Edição de imagem Ferramentas de Retoque com IA do Photoshop para Moda E-commerce, Limpeza de Pele e Consistência de Cor
Ferramentas de Retoque com IA do Photoshop para Moda E-commerce, Limpeza de Pele e Consistência de Cor

2026 Últimas Melhores Ferramentas de Retoque com IA do Photoshop para roupas de comércio eletrônico, limpeza de pele e consistência de cores! Esta lista curada de alta classificação apresenta soluções poderosas que mudam o jogo, ajudando você a aumentar a eficiência da escrita, simplificar a criação de conteúdo e obter resultados visuais perfeitos sem esforço. Cada ferramenta passou por testes do mundo real através de classificações atualizadas semanalmente, com detalhes completos sobre comparação entre gratuito e pago. Com o apoio da XIX.AI, é o guia essencial para quem deseja desbloquear sua vantagem com IA. Explore agora!

10 ferramentas
xix.ai
Comentários (0)
0/500
OR