Fireworks AI가 Opus와 함께 FireRouter를 공개: 최소한의 정확도 하락으로 인코딩 비용을 57% 절감
Fireworks AI는 Claude Opus 시리즈를 위해 설계된 업계 최초의 캐시 인식 라우팅 시스템인 FireRouter with Opus를 출시했습니다. 이제 서버리스 엔드포인트를 통해 접근할 수 있는 이 독립적인 라우팅 모델은 한 달 이상 내부 A/B 테스트를 거쳤으며, 인코딩 작업에서 98.1%의 정확도를 달성하고 Opus 단독 사용 대비 비용을 57% 절감했습니다.
FireRouter는 각 사용자 상호작용마다 현재 작업에 대한 각 모델의 적합성을 평가하여 작동합니다. 프롬프트 캐싱을 포함한 처리 비용을 계산하고, 모델을 전환하는 것이 캐시 데이터 손실을 상쇄할 만큼 충분한 비용을 절약하는지 여부를 결정합니다. 그런 다음 시스템은 품질과 비용 간의 최적 균형을 제공하는 모델로 트래픽을 라우팅합니다. 현재 라우팅 풀에는 Claude Opus5.5, GLM5.3, GLM5.3Flash가 포함되어 있으며, 새로운 모델이 사용 가능해지면 통합할 계획입니다.

테스트는 내부 인코딩 트래픽을 활용했으며, 세션을 FireRouter with Opus 그룹과 Opus만 사용하는 대조군에 무작위로 할당했으며, 동일한 워크로드와 사용자 기반을 유지했습니다. 결과 세션당 비용이 15.36달러에서 6.63달러로 감소하여 57% 절감되었습니다(±19%p, 95% 신뢰구간). 정확도 측면에서 FireRouter with Opus는 평가 라운드에서 78.7%를 달성한 반면, Opus 단독은 80.2%를 기록했습니다. 이는 고작 1.5%p 차이(±1.3)로, Opus의 전체 정확도 대비 98.1%에 해당합니다.
캐시 히트율과 관련하여 FireRouter with Opus는 94.2%를 달성한 반면, Opus 단독은 97.8%를 기록하여 3.6%p 격차가 발생했습니다. Fireworks AI는 이를 의도적이고 미미한 트레이드오프라고 설명합니다. 오픈소스 모델이 일상적인 인코딩 작업을 효과적으로 처리하기 때문에, 캐시 인식 라우팅은 더 간단한 쿼리를 저렴한 모델로 라우팅하여 전체 비용을 크게 낮춥니다.

관련 기사
Claude Opus 5.2 다크 그레이 출시, 더 빠른 응답 속도와 게으름 문제 해결
Opus 5.2가 오늘 아침 조용히 출시되면서, 많은 개발자들이 업데이트된 모델인 Claude Opus 5.2가 Claude Code 내에서 제한적인 롤아웃을 시작했음을 눈치챘습니다.어제 저녁 X 사용자들은 Claude Code에서 Opus 5를 호출했을 때 표준 웹 버전보다 훨씬 뛰어난 성능을 보인다는 것을 관찰했으며, 이는 마치 '차원적 일격'과 같았습니다. 이러한 라우팅 전략은 최상위 AI 기업들 사이에서 흔하게 나타나는 현상입니다. 패
NVIDIA, Nemotron-Labs-Audex-30B-A3B 통합 오디오 지능 모델 공개
다중 모달 대규모 모델이 빠르게 진화함에 따라 오디오 처리 기능이 종종 희생되는데, 많은 모델이 텍스트 논리를 희생하면서 오디오 이해도를 향상시킵니다. 이를 해결하기 위해 NVIDIA 연구진은 Nemotron-Labs-Audex-30B-A3B(Audex)를 도입했으며, 이는 이 격차를 메우기 위해 설계된 통합 오디오-텍스트 대규모 언어 모델입니다.Audex는 간소화되고 효율적인 설계를 채택했으며, 견고한 순수 텍스트 기반 전문가 혼합(MoE)
모바일 SEO를 위한 코어 웹 바이탈 수정 방법
로컬 SEO 강화: Google 엔티티 클라우드 드라이브 스택 구축하기목차:서론Google 엔티티 클라우드 스택 이해하기Google 엔티티 클라우드 스택의 주요 이점Google 엔티티 클라우드 스택 시작하기 4.1. 옵션 1: 노후 Gmail 계정 구매 4.2. 옵션 2: 새 계정 생성엔티티 스택을 위한 Google Drive 구성하기 5.1. 폴더 유형 이해하기 5.2. 공개 폴더 만들기 5.3. 계정 간 폴더 공유하기엔티티 클라
관련 특별 주제 추천
의견 (0)
0/500
Fireworks AI는 Claude Opus 시리즈를 위해 설계된 업계 최초의 캐시 인식 라우팅 시스템인 FireRouter with Opus를 출시했습니다. 이제 서버리스 엔드포인트를 통해 접근할 수 있는 이 독립적인 라우팅 모델은 한 달 이상 내부 A/B 테스트를 거쳤으며, 인코딩 작업에서 98.1%의 정확도를 달성하고 Opus 단독 사용 대비 비용을 57% 절감했습니다.
FireRouter는 각 사용자 상호작용마다 현재 작업에 대한 각 모델의 적합성을 평가하여 작동합니다. 프롬프트 캐싱을 포함한 처리 비용을 계산하고, 모델을 전환하는 것이 캐시 데이터 손실을 상쇄할 만큼 충분한 비용을 절약하는지 여부를 결정합니다. 그런 다음 시스템은 품질과 비용 간의 최적 균형을 제공하는 모델로 트래픽을 라우팅합니다. 현재 라우팅 풀에는 Claude Opus5.5, GLM5.3, GLM5.3Flash가 포함되어 있으며, 새로운 모델이 사용 가능해지면 통합할 계획입니다.

테스트는 내부 인코딩 트래픽을 활용했으며, 세션을 FireRouter with Opus 그룹과 Opus만 사용하는 대조군에 무작위로 할당했으며, 동일한 워크로드와 사용자 기반을 유지했습니다. 결과 세션당 비용이 15.36달러에서 6.63달러로 감소하여 57% 절감되었습니다(±19%p, 95% 신뢰구간). 정확도 측면에서 FireRouter with Opus는 평가 라운드에서 78.7%를 달성한 반면, Opus 단독은 80.2%를 기록했습니다. 이는 고작 1.5%p 차이(±1.3)로, Opus의 전체 정확도 대비 98.1%에 해당합니다.
캐시 히트율과 관련하여 FireRouter with Opus는 94.2%를 달성한 반면, Opus 단독은 97.8%를 기록하여 3.6%p 격차가 발생했습니다. Fireworks AI는 이를 의도적이고 미미한 트레이드오프라고 설명합니다. 오픈소스 모델이 일상적인 인코딩 작업을 효과적으로 처리하기 때문에, 캐시 인식 라우팅은 더 간단한 쿼리를 저렴한 모델로 라우팅하여 전체 비용을 크게 낮춥니다.

Claude Opus 5.2 다크 그레이 출시, 더 빠른 응답 속도와 게으름 문제 해결
Opus 5.2가 오늘 아침 조용히 출시되면서, 많은 개발자들이 업데이트된 모델인 Claude Opus 5.2가 Claude Code 내에서 제한적인 롤아웃을 시작했음을 눈치챘습니다.어제 저녁 X 사용자들은 Claude Code에서 Opus 5를 호출했을 때 표준 웹 버전보다 훨씬 뛰어난 성능을 보인다는 것을 관찰했으며, 이는 마치 '차원적 일격'과 같았습니다. 이러한 라우팅 전략은 최상위 AI 기업들 사이에서 흔하게 나타나는 현상입니다. 패
NVIDIA, Nemotron-Labs-Audex-30B-A3B 통합 오디오 지능 모델 공개
다중 모달 대규모 모델이 빠르게 진화함에 따라 오디오 처리 기능이 종종 희생되는데, 많은 모델이 텍스트 논리를 희생하면서 오디오 이해도를 향상시킵니다. 이를 해결하기 위해 NVIDIA 연구진은 Nemotron-Labs-Audex-30B-A3B(Audex)를 도입했으며, 이는 이 격차를 메우기 위해 설계된 통합 오디오-텍스트 대규모 언어 모델입니다.Audex는 간소화되고 효율적인 설계를 채택했으며, 견고한 순수 텍스트 기반 전문가 혼합(MoE)
모바일 SEO를 위한 코어 웹 바이탈 수정 방법
로컬 SEO 강화: Google 엔티티 클라우드 드라이브 스택 구축하기목차:서론Google 엔티티 클라우드 스택 이해하기Google 엔티티 클라우드 스택의 주요 이점Google 엔티티 클라우드 스택 시작하기 4.1. 옵션 1: 노후 Gmail 계정 구매 4.2. 옵션 2: 새 계정 생성엔티티 스택을 위한 Google Drive 구성하기 5.1. 폴더 유형 이해하기 5.2. 공개 폴더 만들기 5.3. 계정 간 폴더 공유하기엔티티 클라





집






