Heim
Fireworks AI stellt FireRouter mit Opus vor: Reduziert die Encodierungskosten um 57 % bei minimaler Genauigkeitsverlust
Fireworks AI hat FireRouter mit Opus eingeführt, das erste cache-bewusste Routing-System der Branche, das speziell für die Claude-Opus-Serie entwickelt wurde. Jetzt über einen serverlosen Endpunkt verfügbar, durchlief dieses unabhängige Routing-Modell mehr als einen Monat interner A/B-Tests und erzielte eine Genauigkeitsrate von 98,1 % für Codierungsaufgaben, während es die Kosten im Vergleich zur alleinigen Nutzung von Opus um 57 % senkte.
FireRouter bewertet bei jeder Benutzerinteraktion die Eignung jedes Modells für die aktuelle Aufgabe. Es berechnet die Verarbeitungskosten – einschließlich Prompt-Caching – und ermittelt, ob ein Modellwechsel genug einspart, um den Verlust zwischengespeicherter Daten auszugleichen. Das System leitet den Datenverkehr dann an das Modell weiter, das die optimale Balance zwischen Qualität und Kosten bietet. Derzeit umfasst der Routing-Pool Claude Opus5.5, GLM5.3 und GLM5.3Flash, mit Plänen zur Integration neuer Modelle, sobald sie verfügbar sind.

Bei den Tests wurde interner Codierungsverkehr genutzt, wobei Sitzungen zufällig entweder der Gruppe „FireRouter mit Opus“ oder einer Kontrollgruppe zugewiesen wurden, die ausschließlich Opus verwendete, mit identischen Arbeitslasten und Nutzergruppen. Die Ergebnisse zeigten eine Kostensenkung von 15,36 US-Dollar auf 6,63 US-Dollar pro Sitzung, was einer Reduzierung um 57 % entspricht (±19 Prozentpunkte, 95-%-Konfidenzintervall). In Bezug auf die Genauigkeit erreichte FireRouter mit Opus 78,7 % in den Bewertungsrunden, im Vergleich zu 80,2 % für Opus allein – ein Unterschied von lediglich 1,5 Prozentpunkten (±1,3), was 98,1 % der Gesamtnauigkeit von Opus entspricht.
Bezüglich der Cache-Trefferquoten erreichte FireRouter mit Opus 94,2 %, während Opus allein 97,8 % erreichte, eine Lücke von 3,6 Prozentpunkten. Fireworks AI gibt an, dass dies ein bewusster, geringer Kompromiss ist: Da Open-Source-Modelle routinemäßige Codierungsaufgaben effektiv bewältigen, senkt das cache-bewusste Routing die Gesamtkosten erheblich, indem einfachere Anfragen an günstigere Modelle weitergeleitet werden.

Verwandter Artikel
Claude Opus 5.2 in Nachtgrau erscheint mit schnellerer Antwortzeit und behebt das Problem der Trägheit
Opus 5.2 wurde heute Morgen stillschweigend eingeführt, was viele Entwickler dazu veranlasste, festzustellen, dass das aktualisierte Modell, Claude Opus 5.2, eine begrenzte Rollout-Phase innerhalb von Claude Code begonnen hat.Gestern Abend stellten
NVIDIA stellt das einheitliche Audio-Intelligenzmodell Nemotron-Labs-Audex-30B-A3B vor
Während multimodale große Modelle rasch voranschreiten, werden die Fähigkeiten zur Audiobearbeitung häufig beeinträchtigt – viele Modelle verbessern das Audioverständnis auf Kosten der Textlogik. Um dies zu adressieren, haben NVIDIA-Forscher Nemotron
Wie man Core Web Vitals für Mobile SEO behebt
Lokales SEO verbessern: Aufbau Ihrer Google-Entitäts-Cloud-Drive-StacksInhaltsverzeichnis:EinführungVerständnis von Google Entity Cloud StackingHauptvorteile von Google Entity Cloud StackingErste Schritte mit Google Entity Cloud Stacks 4.1. Opti
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)
Fireworks AI hat FireRouter mit Opus eingeführt, das erste cache-bewusste Routing-System der Branche, das speziell für die Claude-Opus-Serie entwickelt wurde. Jetzt über einen serverlosen Endpunkt verfügbar, durchlief dieses unabhängige Routing-Modell mehr als einen Monat interner A/B-Tests und erzielte eine Genauigkeitsrate von 98,1 % für Codierungsaufgaben, während es die Kosten im Vergleich zur alleinigen Nutzung von Opus um 57 % senkte.
FireRouter bewertet bei jeder Benutzerinteraktion die Eignung jedes Modells für die aktuelle Aufgabe. Es berechnet die Verarbeitungskosten – einschließlich Prompt-Caching – und ermittelt, ob ein Modellwechsel genug einspart, um den Verlust zwischengespeicherter Daten auszugleichen. Das System leitet den Datenverkehr dann an das Modell weiter, das die optimale Balance zwischen Qualität und Kosten bietet. Derzeit umfasst der Routing-Pool Claude Opus5.5, GLM5.3 und GLM5.3Flash, mit Plänen zur Integration neuer Modelle, sobald sie verfügbar sind.

Bei den Tests wurde interner Codierungsverkehr genutzt, wobei Sitzungen zufällig entweder der Gruppe „FireRouter mit Opus“ oder einer Kontrollgruppe zugewiesen wurden, die ausschließlich Opus verwendete, mit identischen Arbeitslasten und Nutzergruppen. Die Ergebnisse zeigten eine Kostensenkung von 15,36 US-Dollar auf 6,63 US-Dollar pro Sitzung, was einer Reduzierung um 57 % entspricht (±19 Prozentpunkte, 95-%-Konfidenzintervall). In Bezug auf die Genauigkeit erreichte FireRouter mit Opus 78,7 % in den Bewertungsrunden, im Vergleich zu 80,2 % für Opus allein – ein Unterschied von lediglich 1,5 Prozentpunkten (±1,3), was 98,1 % der Gesamtnauigkeit von Opus entspricht.
Bezüglich der Cache-Trefferquoten erreichte FireRouter mit Opus 94,2 %, während Opus allein 97,8 % erreichte, eine Lücke von 3,6 Prozentpunkten. Fireworks AI gibt an, dass dies ein bewusster, geringer Kompromiss ist: Da Open-Source-Modelle routinemäßige Codierungsaufgaben effektiv bewältigen, senkt das cache-bewusste Routing die Gesamtkosten erheblich, indem einfachere Anfragen an günstigere Modelle weitergeleitet werden.

Claude Opus 5.2 in Nachtgrau erscheint mit schnellerer Antwortzeit und behebt das Problem der Trägheit
Opus 5.2 wurde heute Morgen stillschweigend eingeführt, was viele Entwickler dazu veranlasste, festzustellen, dass das aktualisierte Modell, Claude Opus 5.2, eine begrenzte Rollout-Phase innerhalb von Claude Code begonnen hat.Gestern Abend stellten
NVIDIA stellt das einheitliche Audio-Intelligenzmodell Nemotron-Labs-Audex-30B-A3B vor
Während multimodale große Modelle rasch voranschreiten, werden die Fähigkeiten zur Audiobearbeitung häufig beeinträchtigt – viele Modelle verbessern das Audioverständnis auf Kosten der Textlogik. Um dies zu adressieren, haben NVIDIA-Forscher Nemotron
Wie man Core Web Vitals für Mobile SEO behebt
Lokales SEO verbessern: Aufbau Ihrer Google-Entitäts-Cloud-Drive-StacksInhaltsverzeichnis:EinführungVerständnis von Google Entity Cloud StackingHauptvorteile von Google Entity Cloud StackingErste Schritte mit Google Entity Cloud Stacks 4.1. Opti











