Lar
A Fireworks AI apresenta o FireRouter com Opus: reduz os custos de codificação em 57% com uma queda mínima na precisão
A Fireworks AI apresentou o FireRouter com Opus, o primeiro sistema de roteamento consciente de cache do setor, desenvolvido especificamente para a série Claude Opus. Agora disponível por meio de um endpoint serverless, este modelo de roteamento independente passou por mais de um mês de testes A/B internos, entregando uma taxa de precisão de 98,1% para tarefas de codificação, ao mesmo tempo em que reduziu os custos em 57% em comparação com o uso exclusivo do Opus.
O FireRouter opera avaliando a adequação de cada modelo para a tarefa atual durante cada interação do usuário. Ele calcula os custos de processamento, incluindo o cache de prompts, e determina se a troca de modelo economiza o suficiente para compensar a perda de dados em cache. O sistema então direciona o tráfego para o modelo que oferece o equilíbrio ideal entre qualidade e custo. Atualmente, o pool de roteamento inclui Claude Opus5.5, GLM5.3 e GLM5.3Flash, com planos de integrar novos modelos à medida que se tornarem disponíveis.

Os testes utilizaram tráfego interno de codificação, atribuindo aleatoriamente sessões ao grupo FireRouter com Opus ou a um grupo de controle usando apenas o Opus, com cargas de trabalho e bases de usuários idênticas. Os resultados indicaram uma redução de custos de US$ 15,36 para US$ 6,63 por sessão, uma diminuição de 57% (±19 pontos percentuais, intervalo de confiança de 95%). Em termos de precisão, o FireRouter com Opus alcançou 78,7% nas rodadas de pontuação, em comparação com 80,2% para o Opus sozinho — uma diferença mínima de 1,5 ponto percentual (±1,3), representando 98,1% da precisão geral do Opus.
Quanto às taxas de acerto no cache, o FireRouter com Opus atingiu 94,2%, enquanto o Opus sozinho alcançou 97,8%, uma lacuna de 3,6 pontos percentuais. A Fireworks AI observa que esta é uma troca menor e deliberada: como os modelos de código aberto lidam eficazmente com tarefas rotineiras de codificação, o roteamento consciente de cache reduz significativamente os custos gerais ao direcionar consultas mais simples para modelos mais acessíveis.

Artigo relacionado
O Claude Opus 5.2 Night Gray é lançado com resposta mais rápida, resolvendo o problema de preguiça
O Opus 5.2 foi lançado discretamente nesta manhã, levando muitos desenvolvedores a notar que o modelo atualizado, Claude Opus 5.2, iniciou uma rollout limitada dentro do Claude Code.Na noite de ontem, usuários do X observaram que invocar o Opus 5 no
A NVIDIA apresenta o modelo de inteligência unificada de áudio Nemotron-Labs-Audex-30B-A3B
As grandes modelos multimodais evoluem rapidamente, as capacidades de processamento de áudio são frequentemente comprometidas — muitos modelos melhoram a compreensão de áudio em detrimento da lógica textual. Para resolver isso, pesquisadores da NVIDI
Como corrigir as Core Web Vitals para o SEO móvel
Impulsione o SEO Local: Construa Pilhas de Nuvem de Entidades do Google DriveSumário:IntroduçãoCompreendendo o Empilhamento de Nuvem de Entidades do GooglePrincipais Benefícios do Empilhamento de Nuvem de Entidades do GoogleComeçando com Pilhas
Recomendações de tópicos especiais relacionados
Comentários (0)
A Fireworks AI apresentou o FireRouter com Opus, o primeiro sistema de roteamento consciente de cache do setor, desenvolvido especificamente para a série Claude Opus. Agora disponível por meio de um endpoint serverless, este modelo de roteamento independente passou por mais de um mês de testes A/B internos, entregando uma taxa de precisão de 98,1% para tarefas de codificação, ao mesmo tempo em que reduziu os custos em 57% em comparação com o uso exclusivo do Opus.
O FireRouter opera avaliando a adequação de cada modelo para a tarefa atual durante cada interação do usuário. Ele calcula os custos de processamento, incluindo o cache de prompts, e determina se a troca de modelo economiza o suficiente para compensar a perda de dados em cache. O sistema então direciona o tráfego para o modelo que oferece o equilíbrio ideal entre qualidade e custo. Atualmente, o pool de roteamento inclui Claude Opus5.5, GLM5.3 e GLM5.3Flash, com planos de integrar novos modelos à medida que se tornarem disponíveis.

Os testes utilizaram tráfego interno de codificação, atribuindo aleatoriamente sessões ao grupo FireRouter com Opus ou a um grupo de controle usando apenas o Opus, com cargas de trabalho e bases de usuários idênticas. Os resultados indicaram uma redução de custos de US$ 15,36 para US$ 6,63 por sessão, uma diminuição de 57% (±19 pontos percentuais, intervalo de confiança de 95%). Em termos de precisão, o FireRouter com Opus alcançou 78,7% nas rodadas de pontuação, em comparação com 80,2% para o Opus sozinho — uma diferença mínima de 1,5 ponto percentual (±1,3), representando 98,1% da precisão geral do Opus.
Quanto às taxas de acerto no cache, o FireRouter com Opus atingiu 94,2%, enquanto o Opus sozinho alcançou 97,8%, uma lacuna de 3,6 pontos percentuais. A Fireworks AI observa que esta é uma troca menor e deliberada: como os modelos de código aberto lidam eficazmente com tarefas rotineiras de codificação, o roteamento consciente de cache reduz significativamente os custos gerais ao direcionar consultas mais simples para modelos mais acessíveis.

O Claude Opus 5.2 Night Gray é lançado com resposta mais rápida, resolvendo o problema de preguiça
O Opus 5.2 foi lançado discretamente nesta manhã, levando muitos desenvolvedores a notar que o modelo atualizado, Claude Opus 5.2, iniciou uma rollout limitada dentro do Claude Code.Na noite de ontem, usuários do X observaram que invocar o Opus 5 no
A NVIDIA apresenta o modelo de inteligência unificada de áudio Nemotron-Labs-Audex-30B-A3B
As grandes modelos multimodais evoluem rapidamente, as capacidades de processamento de áudio são frequentemente comprometidas — muitos modelos melhoram a compreensão de áudio em detrimento da lógica textual. Para resolver isso, pesquisadores da NVIDI
Como corrigir as Core Web Vitals para o SEO móvel
Impulsione o SEO Local: Construa Pilhas de Nuvem de Entidades do Google DriveSumário:IntroduçãoCompreendendo o Empilhamento de Nuvem de Entidades do GooglePrincipais Benefícios do Empilhamento de Nuvem de Entidades do GoogleComeçando com Pilhas











