Maison
Fireworks AI dévoile FireRouter avec Opus : réduit les coûts d’encodage de 57 % avec une baisse minimale de la précision
Fireworks AI a présenté FireRouter avec Opus, le premier système de routage conscient du cache de l’industrie, conçu spécifiquement pour la série Claude Opus. Désormais accessible via une extrémité de serveur sans serveur, ce modèle de routage indépendant a subi plus d’un mois de tests A/B internes, offrant un taux de précision de 98,1 % pour les tâches d’encodage tout en réduisant les coûts de 57 % par rapport à l’utilisation d’Opus seul.
FireRouter fonctionne en évaluant l’adéquation de chaque modèle à la tâche actuelle lors de chaque interaction utilisateur. Il calcule les coûts de traitement, y compris la mise en cache des invites, et détermine si le changement de modèle permet d’économiser suffisamment pour compenser la perte de données mises en cache. Le système dirige ensuite le trafic vers le modèle offrant le meilleur équilibre entre qualité et coût. Actuellement, le pool de routage comprend Claude Opus5.5, GLM5.3 et GLM5.3Flash, avec des plans pour intégrer de nouveaux modèles au fur et à mesure de leur disponibilité.

Les tests ont utilisé le trafic d’encodage interne, attribuant aléatoirement les sessions soit au groupe FireRouter avec Opus, soit à un groupe témoin utilisant uniquement Opus, avec des charges de travail et des bases d’utilisateurs identiques. Les résultats ont indiqué une réduction des coûts, passant de 15,36 $ à 6,63 $ par session, soit une diminution de 57 % (±19 points de pourcentage, intervalle de confiance à 95 %). En termes de précision, FireRouter avec Opus a atteint 78,7 % lors des tours de notation, comparé à 80,2 % pour Opus seul — une différence minime de 1,5 point de pourcentage (±1,3), représentant 98,1 % de la précision globale d’Opus.
En ce qui concerne les taux de réussite de cache, FireRouter avec Opus a atteint 94,2 %, tandis qu’Opus seul a obtenu 97,8 %, soit un écart de 3,6 points de pourcentage. Fireworks AI note qu’il s’agit d’un compromis mineur et délibéré : puisque les modèles open source gèrent efficacement les tâches d’encodage courantes, le routage conscient du cache réduit considérablement les coûts globaux en dirigeant les requêtes plus simples vers des modèles plus abordables.

Article connexe
Claude Opus 5.2 Gris Nuit est lancé avec une réponse plus rapide, résolvant le problème de paresse
Opus 5.2 a été lancé discrètement ce matin, incitant de nombreux développeurs à remarquer que le modèle mis à jour, Claude Opus 5.2, a entamé un déploiement limité au sein de Claude Code.Hier soir, les utilisateurs de X ont observé que l’appel d’Opu
NVIDIA dévoile le modèle d’intelligence audio unifié Nemotron-Labs-Audex-30B-A3B
Alors que les grands modèles multimodaux évoluent rapidement, les capacités de traitement audio sont souvent compromises : de nombreux modèles améliorent la compréhension audio au détriment de la logique textuelle. Pour remédier à cette situation, le
Comment corriger les Core Web Vitals pour le référencement mobile
Boostez le référencement local : Construisez vos piles de nuage d'entités Google DriveTable des matières :IntroductionComprendre l'empilement de nuage d'entités GooglePrincipaux avantages de l'empilement de nuage d'entités GoogleCommencer avec l
Recommandations de sujets spéciaux liés
commentaires (0)
Fireworks AI a présenté FireRouter avec Opus, le premier système de routage conscient du cache de l’industrie, conçu spécifiquement pour la série Claude Opus. Désormais accessible via une extrémité de serveur sans serveur, ce modèle de routage indépendant a subi plus d’un mois de tests A/B internes, offrant un taux de précision de 98,1 % pour les tâches d’encodage tout en réduisant les coûts de 57 % par rapport à l’utilisation d’Opus seul.
FireRouter fonctionne en évaluant l’adéquation de chaque modèle à la tâche actuelle lors de chaque interaction utilisateur. Il calcule les coûts de traitement, y compris la mise en cache des invites, et détermine si le changement de modèle permet d’économiser suffisamment pour compenser la perte de données mises en cache. Le système dirige ensuite le trafic vers le modèle offrant le meilleur équilibre entre qualité et coût. Actuellement, le pool de routage comprend Claude Opus5.5, GLM5.3 et GLM5.3Flash, avec des plans pour intégrer de nouveaux modèles au fur et à mesure de leur disponibilité.

Les tests ont utilisé le trafic d’encodage interne, attribuant aléatoirement les sessions soit au groupe FireRouter avec Opus, soit à un groupe témoin utilisant uniquement Opus, avec des charges de travail et des bases d’utilisateurs identiques. Les résultats ont indiqué une réduction des coûts, passant de 15,36 $ à 6,63 $ par session, soit une diminution de 57 % (±19 points de pourcentage, intervalle de confiance à 95 %). En termes de précision, FireRouter avec Opus a atteint 78,7 % lors des tours de notation, comparé à 80,2 % pour Opus seul — une différence minime de 1,5 point de pourcentage (±1,3), représentant 98,1 % de la précision globale d’Opus.
En ce qui concerne les taux de réussite de cache, FireRouter avec Opus a atteint 94,2 %, tandis qu’Opus seul a obtenu 97,8 %, soit un écart de 3,6 points de pourcentage. Fireworks AI note qu’il s’agit d’un compromis mineur et délibéré : puisque les modèles open source gèrent efficacement les tâches d’encodage courantes, le routage conscient du cache réduit considérablement les coûts globaux en dirigeant les requêtes plus simples vers des modèles plus abordables.

Claude Opus 5.2 Gris Nuit est lancé avec une réponse plus rapide, résolvant le problème de paresse
Opus 5.2 a été lancé discrètement ce matin, incitant de nombreux développeurs à remarquer que le modèle mis à jour, Claude Opus 5.2, a entamé un déploiement limité au sein de Claude Code.Hier soir, les utilisateurs de X ont observé que l’appel d’Opu
NVIDIA dévoile le modèle d’intelligence audio unifié Nemotron-Labs-Audex-30B-A3B
Alors que les grands modèles multimodaux évoluent rapidement, les capacités de traitement audio sont souvent compromises : de nombreux modèles améliorent la compréhension audio au détriment de la logique textuelle. Pour remédier à cette situation, le
Comment corriger les Core Web Vitals pour le référencement mobile
Boostez le référencement local : Construisez vos piles de nuage d'entités Google DriveTable des matières :IntroductionComprendre l'empilement de nuage d'entités GooglePrincipaux avantages de l'empilement de nuage d'entités GoogleCommencer avec l











