Novo benchmark questiona a preparação dos agentes de IA para o ambiente de trabalho
Há quase dois anos, o CEO da Microsoft, Satya Nadella, previu que a IA iria remodelar o trabalho intelectual — o domínio dos advogados, banqueiros de investimento, bibliotecários, contadores, profissionais de TI e funções semelhantes de colarinho branco.
No entanto, apesar dos avanços significativos nos modelos básicos, a transformação no trabalho intelectual tem demorado a se concretizar. Embora os modelos sejam excelentes em pesquisas aprofundadas e planejamento agênico, a maioria das profissões de colarinho branco tem sofrido relativamente poucas mudanças, por razões que ainda não estão claras.
Isso é um dos grandes enigmas da IA. Uma nova pesquisa da Mercor, líder em dados de treinamento, agora está fornecendo insights cruciais.
O estudo avalia como os principais modelos de IA lidam com tarefas genuínas de colarinho branco, como consultoria, banco de investimento e direito. Isso levou à criação do benchmark APEX-Agents — e, atualmente, todos os laboratórios de IA estão falhando. Quando apresentados a consultas de profissionais reais, mesmo os melhores modelos responderam corretamente a menos de um quarto delas. Na maioria das vezes, eles retornaram uma resposta incorreta ou nenhuma resposta.
De acordo com o CEO da Mercor, Brendan Foody, que contribuiu para a pesquisa, a principal fraqueza dos modelos era sintetizar informações em vários domínios — um componente essencial do trabalho de conhecimento humano.
“Uma inovação importante neste benchmark é que construímos um ambiente completo modelado em serviços profissionais reais”, explicou Foody ao TechCrunch. “Nosso trabalho não envolve uma única pessoa nos fornecendo todo o contexto em um único lugar. Na realidade, você opera no Slack, no Google Drive e em várias outras ferramentas.” Para muitos modelos de IA agênica, esse tipo de raciocínio entre domínios permanece inconsistente.

Captura de tela Os cenários de teste foram obtidos de profissionais reais no mercado especializado da Mercor, que projetaram as consultas e definiram os critérios para uma resposta bem-sucedida. A análise das perguntas disponíveis publicamente no Hugging Face revela a complexidade dessas tarefas.
Evento Techcrunch Ingressos para o Disrupt 2026: oferta única
Os ingressos já estão disponíveis! Economize até US$ 680 durante esta oferta por tempo limitado e esteja entre os primeiros 500 inscritos para receber 50% de desconto em um passe +1. O TechCrunch Disrupt reúne os principais líderes do Google Cloud, Netflix, Microsoft, Box, a16z, Hugging Face e muito mais para mais de 250 sessões destinadas a impulsionar o crescimento e aprimorar sua vantagem competitiva. Conecte-se com centenas de startups inovadoras e participe de um networking selecionado que gera negócios, insights e inspiração.
Ingressos para o Disrupt 2026: oferta única
Os ingressos já estão disponíveis! Economize até US$ 680 durante esta oferta por tempo limitado e esteja entre os primeiros 500 inscritos para receber 50% de desconto em um passe +1. O TechCrunch Disrupt reúne os principais líderes do Google Cloud, Netflix, Microsoft, Box, a16z, Hugging Face e muito mais para mais de 250 sessões destinadas a impulsionar o crescimento e aprimorar sua vantagem competitiva. Conecte-se com centenas de startups inovadoras e participe de um networking selecionado que gera negócios, insights e inspiração.
São Francisco | 13 a 15 de outubro de 2026 INSCRIVA-SE AGORA Um exemplo da seção “Lei” pergunta:
Durante os primeiros 48 minutos de uma interrupção na produção da UE, a equipe de engenharia da Northstar exportou um ou dois conjuntos agrupados de logs de eventos de produção da UE contendo dados pessoais para um fornecedor de análise dos EUA... De acordo com as próprias políticas da Northstar, ela pode razoavelmente tratar essas uma ou duas exportações de logs como estando em conformidade com o Artigo 49?
A resposta correta é sim, mas chegar a ela requer uma análise detalhada das políticas internas da empresa e dos regulamentos de privacidade relevantes da UE.
Tal questão poderia desafiar até mesmo um humano experiente, mas os pesquisadores tiveram como objetivo simular o trabalho profissional real. Um LLM capaz de responder com confiabilidade a essas consultas poderia substituir muitos advogados atuantes. “Este é sem dúvida o tema econômico mais significativo da atualidade”, disse Foody ao TechCrunch. “O benchmark reflete com precisão o trabalho real que esses profissionais realizam.”
A OpenAI já havia tentado avaliar as habilidades profissionais com seu benchmark GDPval, mas o teste APEX-Agents difere significativamente. Enquanto o GDPval avalia conhecimentos gerais amplos em muitas áreas, o APEX-Agents mede a capacidade de um sistema de executar tarefas sustentadas em algumas profissões de alto valor. Isso torna o teste mais desafiador para os modelos e mais diretamente relevante para o potencial de automação do trabalho.
Embora nenhum modelo esteja pronto para assumir o papel de banqueiro de investimentos, alguns claramente chegaram mais perto do que outros. O Gemini 3 Flash liderou o grupo com 24% de precisão em uma única tentativa, seguido de perto pelo GPT-5.2 com 23%. O Opus 4.5, o Gemini 3 Pro e o GPT-5 obtiveram pontuações em torno de 18%.
Embora esses resultados iniciais sejam decepcionantes, o campo da IA tem um histórico de superar rapidamente benchmarks difíceis. Com o teste APEX-Agents agora público, ele representa um desafio aberto para os laboratórios de IA confiantes de que podem melhorar — um resultado que Foody antecipa totalmente nos próximos meses.
“O ritmo de melhoria é notavelmente rápido”, disse ele ao TechCrunch. “Atualmente, é justo comparar a tecnologia a um estagiário que acerta um quarto das vezes, mas no ano passado era um estagiário que acertava 5 ou 10% das vezes. Essa taxa de progresso ano a ano pode criar um impacto substancial muito rapidamente.”
Artigo relacionado
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr
O Google testa o Agente Remy AI para o Gemini, à medida que o foco se desloca para o controle do usuário
De acordo com o Business Insider, o Google está testando o Remy, um novo agente pessoal de IA para o Gemini. Esta ferramenta tem como objetivo executar tarefas em nome dos usuários, simplificando tanto os fluxos de trabalho profissionais quanto as ro
Recomendações de tópicos especiais relacionados
Comentários (0)
Há quase dois anos, o CEO da Microsoft, Satya Nadella, previu que a IA iria remodelar o trabalho intelectual — o domínio dos advogados, banqueiros de investimento, bibliotecários, contadores, profissionais de TI e funções semelhantes de colarinho branco.
No entanto, apesar dos avanços significativos nos modelos básicos, a transformação no trabalho intelectual tem demorado a se concretizar. Embora os modelos sejam excelentes em pesquisas aprofundadas e planejamento agênico, a maioria das profissões de colarinho branco tem sofrido relativamente poucas mudanças, por razões que ainda não estão claras.
Isso é um dos grandes enigmas da IA. Uma nova pesquisa da Mercor, líder em dados de treinamento, agora está fornecendo insights cruciais.
O estudo avalia como os principais modelos de IA lidam com tarefas genuínas de colarinho branco, como consultoria, banco de investimento e direito. Isso levou à criação do benchmark APEX-Agents — e, atualmente, todos os laboratórios de IA estão falhando. Quando apresentados a consultas de profissionais reais, mesmo os melhores modelos responderam corretamente a menos de um quarto delas. Na maioria das vezes, eles retornaram uma resposta incorreta ou nenhuma resposta.
De acordo com o CEO da Mercor, Brendan Foody, que contribuiu para a pesquisa, a principal fraqueza dos modelos era sintetizar informações em vários domínios — um componente essencial do trabalho de conhecimento humano.
“Uma inovação importante neste benchmark é que construímos um ambiente completo modelado em serviços profissionais reais”, explicou Foody ao TechCrunch. “Nosso trabalho não envolve uma única pessoa nos fornecendo todo o contexto em um único lugar. Na realidade, você opera no Slack, no Google Drive e em várias outras ferramentas.” Para muitos modelos de IA agênica, esse tipo de raciocínio entre domínios permanece inconsistente.

Os cenários de teste foram obtidos de profissionais reais no mercado especializado da Mercor, que projetaram as consultas e definiram os critérios para uma resposta bem-sucedida. A análise das perguntas disponíveis publicamente no Hugging Face revela a complexidade dessas tarefas.
Evento TechcrunchIngressos para o Disrupt 2026: oferta única
Os ingressos já estão disponíveis! Economize até US$ 680 durante esta oferta por tempo limitado e esteja entre os primeiros 500 inscritos para receber 50% de desconto em um passe +1. O TechCrunch Disrupt reúne os principais líderes do Google Cloud, Netflix, Microsoft, Box, a16z, Hugging Face e muito mais para mais de 250 sessões destinadas a impulsionar o crescimento e aprimorar sua vantagem competitiva. Conecte-se com centenas de startups inovadoras e participe de um networking selecionado que gera negócios, insights e inspiração.
Ingressos para o Disrupt 2026: oferta única
Os ingressos já estão disponíveis! Economize até US$ 680 durante esta oferta por tempo limitado e esteja entre os primeiros 500 inscritos para receber 50% de desconto em um passe +1. O TechCrunch Disrupt reúne os principais líderes do Google Cloud, Netflix, Microsoft, Box, a16z, Hugging Face e muito mais para mais de 250 sessões destinadas a impulsionar o crescimento e aprimorar sua vantagem competitiva. Conecte-se com centenas de startups inovadoras e participe de um networking selecionado que gera negócios, insights e inspiração.
São Francisco | 13 a 15 de outubro de 2026 INSCRIVA-SE AGORAUm exemplo da seção “Lei” pergunta:
Durante os primeiros 48 minutos de uma interrupção na produção da UE, a equipe de engenharia da Northstar exportou um ou dois conjuntos agrupados de logs de eventos de produção da UE contendo dados pessoais para um fornecedor de análise dos EUA... De acordo com as próprias políticas da Northstar, ela pode razoavelmente tratar essas uma ou duas exportações de logs como estando em conformidade com o Artigo 49?
A resposta correta é sim, mas chegar a ela requer uma análise detalhada das políticas internas da empresa e dos regulamentos de privacidade relevantes da UE.
Tal questão poderia desafiar até mesmo um humano experiente, mas os pesquisadores tiveram como objetivo simular o trabalho profissional real. Um LLM capaz de responder com confiabilidade a essas consultas poderia substituir muitos advogados atuantes. “Este é sem dúvida o tema econômico mais significativo da atualidade”, disse Foody ao TechCrunch. “O benchmark reflete com precisão o trabalho real que esses profissionais realizam.”
A OpenAI já havia tentado avaliar as habilidades profissionais com seu benchmark GDPval, mas o teste APEX-Agents difere significativamente. Enquanto o GDPval avalia conhecimentos gerais amplos em muitas áreas, o APEX-Agents mede a capacidade de um sistema de executar tarefas sustentadas em algumas profissões de alto valor. Isso torna o teste mais desafiador para os modelos e mais diretamente relevante para o potencial de automação do trabalho.
Embora nenhum modelo esteja pronto para assumir o papel de banqueiro de investimentos, alguns claramente chegaram mais perto do que outros. O Gemini 3 Flash liderou o grupo com 24% de precisão em uma única tentativa, seguido de perto pelo GPT-5.2 com 23%. O Opus 4.5, o Gemini 3 Pro e o GPT-5 obtiveram pontuações em torno de 18%.
Embora esses resultados iniciais sejam decepcionantes, o campo da IA tem um histórico de superar rapidamente benchmarks difíceis. Com o teste APEX-Agents agora público, ele representa um desafio aberto para os laboratórios de IA confiantes de que podem melhorar — um resultado que Foody antecipa totalmente nos próximos meses.
“O ritmo de melhoria é notavelmente rápido”, disse ele ao TechCrunch. “Atualmente, é justo comparar a tecnologia a um estagiário que acerta um quarto das vezes, mas no ano passado era um estagiário que acertava 5 ou 10% das vezes. Essa taxa de progresso ano a ano pode criar um impacto substancial muito rapidamente.”
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr





Lar






