Grok 4.6 é lançado, rivaliza com o GPT-5.6 em desempenho por mais de 60% menos custo

xAI lançou o Grok 4.6, alcançando uma pontuação de 61 no Índice de Inteligência de IA, igualando-se ao GPT-5.6 Sol (Max) e ficando ligeiramente atrás do Claude Opus 5 (63 pontos) e do Claude Fable 5 (62 pontos). Esse desempenho posiciona o Grok 4.6 entre os modelos de elite mundial, desafiando diretamente as ofertas principais da OpenAI e da Anthropic. Construído sobre a base do Grok 4.5, a atualização introduz melhorias fundamentais no raciocínio e no treinamento de conceitos técnicos avançados, aproveitando dados curados gerados pelo próprio modelo, juntamente com conjuntos de dados de engenharia de alta qualidade e um algoritmo de treinamento otimizado.
Uma mudança crucial na metodologia de treinamento envolve um loop de dados auto-reforçador: o Grok 4.5 foi utilizado para regenerar trajetórias de ajuste fino supervisionado, focando em raciocínio, utilização de ferramentas por agentes e domínios como STEM, engenharia de software e trabalho do conhecimento. O modelo também passou por extenso treinamento em tarefas de aprendizado por reforço baseadas em agentes, incluindo trabalho do conhecimento, codificação geral, otimização de kernels, desenvolvimento web e design assistido por computador — uma estratégia claramente projetada para atender às cargas de trabalho principais da emergente “era dos agentes”.
Os benchmarks de agentes registraram melhorias dramáticas, reduzindo substancialmente o esforço necessário para tarefas complexas e de longo prazo.
Em avaliações de benchmarks relacionadas a agentes, o Grok 4.6 demonstrou desempenho excepcional. Ele alcançou uma pontuação Elo de 1753 no GDPval-AA v2, ficando em segundo lugar, atrás apenas do Claude Opus 5. As pontuações do DeepSWE v1.1 subiram para 65,9%, um aumento notável em relação aos 54% do Grok 4.5, enquanto o APEX-Agents saltou de 47,1% para 57,5%. O Terminal-Bench v3.0 melhorou de 15,7% para 26%, com resultados fortes adicionais de 69,9% no CursorBench v3.2 e 61,3% no FrontierCode v1.1, marcando avanços significativos tanto em capacidades de codificação quanto de agentes.
Notavelmente, o Grok 4.6 oferece uma vantagem distinta em custo-efetividade. Prezado a US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de tokens de saída, ele é mais de 60% mais barato que o Claude Opus 5 (US$ 5/US$ 25) e o GPT-5.6 Sol (US$ 5/US$ 30). No benchmark AA-Briefcase de trabalho do conhecimento de longo prazo, o Grok 4.6 concluiu tarefas em uma média de 53 rodadas, utilizando aproximadamente 500 milhões de tokens de entrada, enquanto o Claude Opus 5 exigiu cerca de 103 rodadas e 2 bilhões de tokens. Isso significa que o Grok 4.6 alcança resultados comparáveis usando menos de um quarto dos recursos, destacando uma clara vantagem em custo-desempenho. O modelo já está acessível via Cursor, Grok Build, API, OpenRouter, Vercel e Cloudflare. Durante sua primeira semana, os usuários recebem créditos de uso duplicados no Grok Build e no Cursor. Com uma janela de contexto de 500.000 tokens, um cenário competitivo focado em “inteligência igual a preços mais baixos” começou oficialmente.
Artigo relacionado
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr
O Google testa o Agente Remy AI para o Gemini, à medida que o foco se desloca para o controle do usuário
De acordo com o Business Insider, o Google está testando o Remy, um novo agente pessoal de IA para o Gemini. Esta ferramenta tem como objetivo executar tarefas em nome dos usuários, simplificando tanto os fluxos de trabalho profissionais quanto as ro
Recomendações de tópicos especiais relacionados
Comentários (0)

xAI lançou o Grok 4.6, alcançando uma pontuação de 61 no Índice de Inteligência de IA, igualando-se ao GPT-5.6 Sol (Max) e ficando ligeiramente atrás do Claude Opus 5 (63 pontos) e do Claude Fable 5 (62 pontos). Esse desempenho posiciona o Grok 4.6 entre os modelos de elite mundial, desafiando diretamente as ofertas principais da OpenAI e da Anthropic. Construído sobre a base do Grok 4.5, a atualização introduz melhorias fundamentais no raciocínio e no treinamento de conceitos técnicos avançados, aproveitando dados curados gerados pelo próprio modelo, juntamente com conjuntos de dados de engenharia de alta qualidade e um algoritmo de treinamento otimizado.
Uma mudança crucial na metodologia de treinamento envolve um loop de dados auto-reforçador: o Grok 4.5 foi utilizado para regenerar trajetórias de ajuste fino supervisionado, focando em raciocínio, utilização de ferramentas por agentes e domínios como STEM, engenharia de software e trabalho do conhecimento. O modelo também passou por extenso treinamento em tarefas de aprendizado por reforço baseadas em agentes, incluindo trabalho do conhecimento, codificação geral, otimização de kernels, desenvolvimento web e design assistido por computador — uma estratégia claramente projetada para atender às cargas de trabalho principais da emergente “era dos agentes”.
Os benchmarks de agentes registraram melhorias dramáticas, reduzindo substancialmente o esforço necessário para tarefas complexas e de longo prazo.
Em avaliações de benchmarks relacionadas a agentes, o Grok 4.6 demonstrou desempenho excepcional. Ele alcançou uma pontuação Elo de 1753 no GDPval-AA v2, ficando em segundo lugar, atrás apenas do Claude Opus 5. As pontuações do DeepSWE v1.1 subiram para 65,9%, um aumento notável em relação aos 54% do Grok 4.5, enquanto o APEX-Agents saltou de 47,1% para 57,5%. O Terminal-Bench v3.0 melhorou de 15,7% para 26%, com resultados fortes adicionais de 69,9% no CursorBench v3.2 e 61,3% no FrontierCode v1.1, marcando avanços significativos tanto em capacidades de codificação quanto de agentes.
Notavelmente, o Grok 4.6 oferece uma vantagem distinta em custo-efetividade. Prezado a US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de tokens de saída, ele é mais de 60% mais barato que o Claude Opus 5 (US$ 5/US$ 25) e o GPT-5.6 Sol (US$ 5/US$ 30). No benchmark AA-Briefcase de trabalho do conhecimento de longo prazo, o Grok 4.6 concluiu tarefas em uma média de 53 rodadas, utilizando aproximadamente 500 milhões de tokens de entrada, enquanto o Claude Opus 5 exigiu cerca de 103 rodadas e 2 bilhões de tokens. Isso significa que o Grok 4.6 alcança resultados comparáveis usando menos de um quarto dos recursos, destacando uma clara vantagem em custo-desempenho. O modelo já está acessível via Cursor, Grok Build, API, OpenRouter, Vercel e Cloudflare. Durante sua primeira semana, os usuários recebem créditos de uso duplicados no Grok Build e no Cursor. Com uma janela de contexto de 500.000 tokens, um cenário competitivo focado em “inteligência igual a preços mais baixos” começou oficialmente.
Ações dos EUA Atingem Marco Histórico Enquanto Gigantes de IA e Aeroespacial se Preparam para Estreia de Trilião de Dólares
Elon Musk, Sam Altman e Dario Amodei, três titãs do setor de tecnologia, estão avançando rumo a ofertas públicas iniciais (IPOs) para suas respectivas empresas. Com a SpaceX, a OpenAI e a Anthropic — três gigantes da indústria que se aproximam de ava
Startup sueca de IA Lovable Eyes tem avaliação de US$ 13,2 bilhões após rodada principal de investimentos
À medida que as ferramentas de codificação impulsionadas por IA ganham tração, a startup sueca Lovable garantiu uma grande rodada de financiamento. A empresa visa captar US$ 3 bilhões, o que poderia elevar sua avaliação para US$ 13,2 bilhões — o dobr





Lar






