Hogar
Fireworks AI presenta FireRouter con Opus: reduce los costes de codificación en un 57% con una caída mínima de la precisión
Fireworks AI ha presentado FireRouter con Opus, el primer sistema de enrutamiento consciente del caché del sector, diseñado específicamente para la serie Claude Opus. Ahora disponible a través de un punto final sin servidor, este modelo de enrutamiento independiente ha superado más de un mes de pruebas A/B internas, logrando una tasa de precisión del 98,1 % para tareas de codificación y reduciendo los costes en un 57 % en comparación con el uso exclusivo de Opus.
FireRouter evalúa la idoneidad de cada modelo para la tarea actual durante cada interacción del usuario. Calcula los costes de procesamiento, incluido el caché de indicaciones (prompts), y determina si cambiar de modelo ahorra lo suficiente como para compensar la pérdida de datos en caché. El sistema dirige entonces el tráfico hacia el modelo que ofrece el equilibrio óptimo entre calidad y coste. Actualmente, el grupo de enrutamiento incluye Claude Opus5.5, GLM5.3 y GLM5.3Flash, con planes para integrar nuevos modelos a medida que estén disponibles.

Las pruebas utilizaron tráfico de codificación interno, asignando aleatoriamente las sesiones al grupo FireRouter con Opus o a un grupo de control que utilizaba únicamente Opus, con cargas de trabajo y bases de usuarios idénticas. Los resultados indicaron una reducción del coste de 15,36 $ a 6,63 $ por sesión, una disminución del 57 % (±19 puntos porcentuales, intervalo de confianza del 95 %). En términos de precisión, FireRouter con Opus alcanzó un 78,7 % en las rondas de puntuación, frente al 80,2 % de Opus por sí solo, una diferencia mínima de 1,5 puntos porcentuales (±1,3), lo que representa el 98,1 % de la precisión general de Opus.
En cuanto a las tasas de acierto en caché, FireRouter con Opus alcanzó el 94,2 %, mientras que Opus por sí solo logró el 97,8 %, una diferencia de 3,6 puntos porcentuales. Fireworks AI señala que esta es una compensación menor y deliberada: dado que los modelos de código abierto manejan eficazmente las tareas rutinarias de codificación, el enrutamiento consciente del caché reduce significativamente los costes generales al dirigir consultas más simples a modelos más asequibles.

Artículo relacionado
Claude Opus 5.2 Gris Nocturno se lanza con respuesta más rápida, solucionando el problema de la pereza
Opus 5.2 se lanzó discretamente esta mañana, lo que llevó a muchos desarrolladores a notar que el modelo actualizado, Claude Opus 5.2, ha comenzado un lanzamiento limitado dentro de Claude Code.Anoche, los usuarios de X observaron que invocar Opus 5
NVIDIA presenta el modelo de inteligencia de audio unificado Nemotron-Labs-Audex-30B-A3B
A medida que los modelos grandes multimodales evolucionan rápidamente, las capacidades de procesamiento de audio se ven frecuentemente comprometidas; muchos modelos mejoran la comprensión del audio a expensas de la lógica textual. Para abordar esto,
Cómo corregir las Core Web Vitals para el SEO en dispositivos móviles
Impulsa el SEO Local: Construye Pilas de Nube de Entidades de Google DriveTabla de Contenidos:IntroducciónComprensión de las Pilas de Nube de Entidades de GoogleBeneficios Clave de las Pilas de Nube de Entidades de GoogleCómo Comenzar con las Pi
Recomendaciones de temas especiales relacionados
comentario (0)
0/500
Fireworks AI ha presentado FireRouter con Opus, el primer sistema de enrutamiento consciente del caché del sector, diseñado específicamente para la serie Claude Opus. Ahora disponible a través de un punto final sin servidor, este modelo de enrutamiento independiente ha superado más de un mes de pruebas A/B internas, logrando una tasa de precisión del 98,1 % para tareas de codificación y reduciendo los costes en un 57 % en comparación con el uso exclusivo de Opus.
FireRouter evalúa la idoneidad de cada modelo para la tarea actual durante cada interacción del usuario. Calcula los costes de procesamiento, incluido el caché de indicaciones (prompts), y determina si cambiar de modelo ahorra lo suficiente como para compensar la pérdida de datos en caché. El sistema dirige entonces el tráfico hacia el modelo que ofrece el equilibrio óptimo entre calidad y coste. Actualmente, el grupo de enrutamiento incluye Claude Opus5.5, GLM5.3 y GLM5.3Flash, con planes para integrar nuevos modelos a medida que estén disponibles.

Las pruebas utilizaron tráfico de codificación interno, asignando aleatoriamente las sesiones al grupo FireRouter con Opus o a un grupo de control que utilizaba únicamente Opus, con cargas de trabajo y bases de usuarios idénticas. Los resultados indicaron una reducción del coste de 15,36 $ a 6,63 $ por sesión, una disminución del 57 % (±19 puntos porcentuales, intervalo de confianza del 95 %). En términos de precisión, FireRouter con Opus alcanzó un 78,7 % en las rondas de puntuación, frente al 80,2 % de Opus por sí solo, una diferencia mínima de 1,5 puntos porcentuales (±1,3), lo que representa el 98,1 % de la precisión general de Opus.
En cuanto a las tasas de acierto en caché, FireRouter con Opus alcanzó el 94,2 %, mientras que Opus por sí solo logró el 97,8 %, una diferencia de 3,6 puntos porcentuales. Fireworks AI señala que esta es una compensación menor y deliberada: dado que los modelos de código abierto manejan eficazmente las tareas rutinarias de codificación, el enrutamiento consciente del caché reduce significativamente los costes generales al dirigir consultas más simples a modelos más asequibles.

Claude Opus 5.2 Gris Nocturno se lanza con respuesta más rápida, solucionando el problema de la pereza
Opus 5.2 se lanzó discretamente esta mañana, lo que llevó a muchos desarrolladores a notar que el modelo actualizado, Claude Opus 5.2, ha comenzado un lanzamiento limitado dentro de Claude Code.Anoche, los usuarios de X observaron que invocar Opus 5
NVIDIA presenta el modelo de inteligencia de audio unificado Nemotron-Labs-Audex-30B-A3B
A medida que los modelos grandes multimodales evolucionan rápidamente, las capacidades de procesamiento de audio se ven frecuentemente comprometidas; muchos modelos mejoran la comprensión del audio a expensas de la lógica textual. Para abordar esto,
Cómo corregir las Core Web Vitals para el SEO en dispositivos móviles
Impulsa el SEO Local: Construye Pilas de Nube de Entidades de Google DriveTabla de Contenidos:IntroducciónComprensión de las Pilas de Nube de Entidades de GoogleBeneficios Clave de las Pilas de Nube de Entidades de GoogleCómo Comenzar con las Pi











