Fireworks AI 釋出搭載 Opus 的 FireRouter:編碼成本降低 57%,精度損失極小
Fireworks AI 推出了搭載 Opus 的 FireRouter,這是業界首個專為 Claude Opus 系列定製的快取感知路由系統。目前,該獨立路由模型已透過無伺服器端點開放使用。經過超過一個月的內部 A/B 測試,FireRouter 在編碼任務中實現了 98.1% 的準確率,同時與單獨使用 Opus 相比,成本降低了 57%。
FireRouter 的工作原理是在每次使用者互動時評估每個模型對當前任務的適用性。它計算處理成本(包括提示詞快取),並判斷切換模型所節省的成本是否足以抵消快取資料丟失帶來的損失。隨後,系統會將流量引導至在質量和成本之間取得最佳平衡的模型。目前,路由池包含 Claude Opus5.5、GLM5.3 和 GLM5.3Flash,並計劃隨著新模型的可用逐步將其納入整合。

測試利用了內部編碼流量,將會話隨機分配至使用“搭載 Opus 的 FireRouter”組或僅使用 Opus 的控制組,兩組的工作負載和使用者群體完全相同。結果顯示,每會話成本從 15.36 美元降至 6.63 美元,降幅達 57%(±19 個百分點,95% 置信區間)。在準確率方面,搭載 Opus 的 FireRouter 在評分輪次中達到 78.7%,而單獨使用 Opus 為 80.2%——兩者僅相差 1.5 個百分點(±1.3),相當於 Opus 整體準確率的 98.1%。
關於快取命中率,搭載 Opus 的 FireRouter 達到 94.2%,而單獨使用 Opus 為 97.8%,差距為 3.6 個百分點。Fireworks AI 指出,這是一種有意為之的微小權衡:由於開源模型能夠有效處理常規編碼任務,快取感知路由透過將更簡單的查詢引導至更經濟的模型,顯著降低了整體成本。

相關文章
Claude Opus 5.2 夜灰色版釋出,響應速度更快,解決懶惰問題
Opus 5.2 今晨悄然上線,促使許多開發者注意到,更新後的模型 Claude Opus 5.2 已在 Claude Code 內部開始有限範圍的推送。昨晚,X 平臺使用者觀察到,在 Claude Code 中呼叫 Opus 5 時,其效能遠超標準網頁版,宛如“降維打擊”。這種路由策略在頂級 AI 公司中十分常見。資料包分析顯示,儘管前端標籤未變,但底層模型識別符號已切換為 Opus 5.2,這表明 Anthropic 可能完全跳過了 5.1 版本。速度、精度與自動“高強度迴圈”下的持續執
NVIDIA 釋出 Nemotron-Labs-Audex-30B-A3B 統一音訊智慧模型
隨著多模態大模型的快速發展,音訊處理能力往往受到妥協——許多模型在提升音訊理解能力的同時,卻犧牲了文字邏輯。為解決這一問題,NVIDIA 研究人員推出了 Nemotron-Labs-Audex-30B-A3B(Audex),這是一款統一的音訊-文字大語言模型,旨在彌合這一差距。Audex 採用精簡高效的設計,基於強大的純文字混合專家(MoE)架構構建。透過利用單個 Transformer 解碼器,它同時處理文字和量化音訊令牌。該方法將音訊輸入投影到文字嵌入空間,確保與現有用於多模態任務的大語言
如何修復移動 SEO 的核心網頁指標
提升本地 SEO:構建您的 Google 實體雲盤堆疊目錄:簡介理解 Google 實體雲堆疊Google 實體雲堆疊的關鍵優勢開始使用 Google 實體雲堆疊 4.1. 選項 1:獲取老號 Gmail 賬戶 4.2. 選項 2:建立新賬戶配置 Google Drive 以進行實體堆疊 5.1. 瞭解資料夾型別 5.2. 建立公共資料夾 5.3. 跨賬戶共享資料夾最大化實體雲堆疊的影響 6.1. 開發 SEO 友好型內容 6.2. 為您的堆疊生成反向連結管理和組織實體雲堆疊的最
相關專題推薦
評論 (0)
0/500
Fireworks AI 推出了搭載 Opus 的 FireRouter,這是業界首個專為 Claude Opus 系列定製的快取感知路由系統。目前,該獨立路由模型已透過無伺服器端點開放使用。經過超過一個月的內部 A/B 測試,FireRouter 在編碼任務中實現了 98.1% 的準確率,同時與單獨使用 Opus 相比,成本降低了 57%。
FireRouter 的工作原理是在每次使用者互動時評估每個模型對當前任務的適用性。它計算處理成本(包括提示詞快取),並判斷切換模型所節省的成本是否足以抵消快取資料丟失帶來的損失。隨後,系統會將流量引導至在質量和成本之間取得最佳平衡的模型。目前,路由池包含 Claude Opus5.5、GLM5.3 和 GLM5.3Flash,並計劃隨著新模型的可用逐步將其納入整合。

測試利用了內部編碼流量,將會話隨機分配至使用“搭載 Opus 的 FireRouter”組或僅使用 Opus 的控制組,兩組的工作負載和使用者群體完全相同。結果顯示,每會話成本從 15.36 美元降至 6.63 美元,降幅達 57%(±19 個百分點,95% 置信區間)。在準確率方面,搭載 Opus 的 FireRouter 在評分輪次中達到 78.7%,而單獨使用 Opus 為 80.2%——兩者僅相差 1.5 個百分點(±1.3),相當於 Opus 整體準確率的 98.1%。
關於快取命中率,搭載 Opus 的 FireRouter 達到 94.2%,而單獨使用 Opus 為 97.8%,差距為 3.6 個百分點。Fireworks AI 指出,這是一種有意為之的微小權衡:由於開源模型能夠有效處理常規編碼任務,快取感知路由透過將更簡單的查詢引導至更經濟的模型,顯著降低了整體成本。

Claude Opus 5.2 夜灰色版釋出,響應速度更快,解決懶惰問題
Opus 5.2 今晨悄然上線,促使許多開發者注意到,更新後的模型 Claude Opus 5.2 已在 Claude Code 內部開始有限範圍的推送。昨晚,X 平臺使用者觀察到,在 Claude Code 中呼叫 Opus 5 時,其效能遠超標準網頁版,宛如“降維打擊”。這種路由策略在頂級 AI 公司中十分常見。資料包分析顯示,儘管前端標籤未變,但底層模型識別符號已切換為 Opus 5.2,這表明 Anthropic 可能完全跳過了 5.1 版本。速度、精度與自動“高強度迴圈”下的持續執
NVIDIA 釋出 Nemotron-Labs-Audex-30B-A3B 統一音訊智慧模型
隨著多模態大模型的快速發展,音訊處理能力往往受到妥協——許多模型在提升音訊理解能力的同時,卻犧牲了文字邏輯。為解決這一問題,NVIDIA 研究人員推出了 Nemotron-Labs-Audex-30B-A3B(Audex),這是一款統一的音訊-文字大語言模型,旨在彌合這一差距。Audex 採用精簡高效的設計,基於強大的純文字混合專家(MoE)架構構建。透過利用單個 Transformer 解碼器,它同時處理文字和量化音訊令牌。該方法將音訊輸入投影到文字嵌入空間,確保與現有用於多模態任務的大語言
如何修復移動 SEO 的核心網頁指標
提升本地 SEO:構建您的 Google 實體雲盤堆疊目錄:簡介理解 Google 實體雲堆疊Google 實體雲堆疊的關鍵優勢開始使用 Google 實體雲堆疊 4.1. 選項 1:獲取老號 Gmail 賬戶 4.2. 選項 2:建立新賬戶配置 Google Drive 以進行實體堆疊 5.1. 瞭解資料夾型別 5.2. 建立公共資料夾 5.3. 跨賬戶共享資料夾最大化實體雲堆疊的影響 6.1. 開發 SEO 友好型內容 6.2. 為您的堆疊生成反向連結管理和組織實體雲堆疊的最





首頁






