Hogar
Moonshot AI y la Universidad de Tsinghua presentan la arquitectura PrfaaS para superar el cuello de botella en la potencia de cálculo de los modelos de gran tamaño
Las nuevas tecnologías están superando el cuello de botella en el rendimiento de los modelos de lenguaje a gran escala (LLM). Recientemente, investigadores de Moonshot AI (Moonshot) y la Universidad de Tsinghua presentaron una novedosa arquitectura denominada Prefill-as-a-Service (PrfaaS). Este estudio aborda las limitaciones de hardware en las implementaciones de servicios de modelos grandes en centros de datos mediante la optimización de la asignación de recursos de computación, lo que aumenta significativamente la eficiencia de la inferencia.

Avance técnico: una separación «quirúrgica» entre el prellenado y la decodificación
Actualmente, el proceso de inferencia de los modelos de lenguaje a gran escala consta de dos fases distintas:
Fase de prellenado: esta fase requiere un uso intensivo de recursos computacionales, ya que se encarga del procesamiento de la entrada y de generar la caché de clave-valor (KVCache).
Fase de decodificación: esta fase requiere un gran ancho de banda de memoria y genera la salida palabra por palabra.
En las arquitecturas tradicionales, ambas fases suelen gestionarse dentro del mismo centro de datos o incluso del mismo servidor. Dado que tienen necesidades de recursos de hardware diferentes, esta «agrupación forzada» suele crear un desequilibrio en la asignación de recursos de computación y ancho de banda, lo que provoca la congestión del servicio.
Innovación principal: colaboración eficiente entre regiones
La característica principalde PrfaaS es lograr un servicio desacoplado. Descarga las tareas de prellenado, que requieren un uso intensivo de recursos computacionales, a clústeres especializados de alta potencia de cálculo. Una vez completada la tarea, el sistema utiliza Ethernet estándar para transferir la KVCache generada de forma remota a un clúster de decodificación local.
Este diseño elimina las limitaciones de espacio físico, lo que permite que el prellenado y la decodificación se ejecuten simultáneamente en diferentes centros de datos. Para garantizar una transferencia eficiente, PrfaaS incorpora un mecanismo de programación de dos escalas temporales que asigna recursos de forma flexible en función de las fluctuaciones del tráfico en tiempo real, junto con un enrutamiento preciso para evitar que las solicitudes de texto largo se retrasen debido a una distribución desigual de los recursos.
Resultados de las pruebas: optimización del rendimiento y la latencia
Los datos de la investigación demuestran que la arquitectura PrfaaS ofrece un rendimiento notable en aplicaciones del mundo real:
El rendimiento del servicio aumentó un 54 %, lo que mejoró significativamente el número de solicitudes gestionadas por unidad de tiempo.
La latencia de respuesta se redujo significativamente, lo que agilizó la generación del primer token desde la perspectiva del usuario.
Se maximizó la utilización de los recursos al separar los subsistemas de computación, red y almacenamiento, evitando los problemas de congestión observados en las arquitecturas tradicionales.
La colaboración entre Moonshot AI y la Universidad de Tsinghua no solo ofrece nuevos enfoques de ingeniería para la inferencia de IA a gran escala, sino que también sienta las bases para futuras redes informáticas interregionales. Este modelo de Prefill-as-a-Service podría convertirse en un hito clave para llevar los modelos de gran tamaño hacia el despliegue industrial.
Artículo relacionado
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr
Google prueba el agente Remy AI para Gemini a medida que el enfoque se desplaza hacia el control del usuario
Según Business Insider, Google está probando Remy, un nuevo agente personal de IA para Gemini. Esta herramienta tiene como objetivo ejecutar tareas en nombre de los usuarios, optimizando tanto los flujos de trabajo profesionales como las rutinas diar
Recomendaciones de temas especiales relacionados
comentario (1)
0/500
Las nuevas tecnologías están superando el cuello de botella en el rendimiento de los modelos de lenguaje a gran escala (LLM). Recientemente, investigadores de Moonshot AI (Moonshot) y la Universidad de Tsinghua presentaron una novedosa arquitectura denominada Prefill-as-a-Service (PrfaaS). Este estudio aborda las limitaciones de hardware en las implementaciones de servicios de modelos grandes en centros de datos mediante la optimización de la asignación de recursos de computación, lo que aumenta significativamente la eficiencia de la inferencia.

Avance técnico: una separación «quirúrgica» entre el prellenado y la decodificación
Actualmente, el proceso de inferencia de los modelos de lenguaje a gran escala consta de dos fases distintas:
Fase de prellenado: esta fase requiere un uso intensivo de recursos computacionales, ya que se encarga del procesamiento de la entrada y de generar la caché de clave-valor (KVCache).
Fase de decodificación: esta fase requiere un gran ancho de banda de memoria y genera la salida palabra por palabra.
En las arquitecturas tradicionales, ambas fases suelen gestionarse dentro del mismo centro de datos o incluso del mismo servidor. Dado que tienen necesidades de recursos de hardware diferentes, esta «agrupación forzada» suele crear un desequilibrio en la asignación de recursos de computación y ancho de banda, lo que provoca la congestión del servicio.
Innovación principal: colaboración eficiente entre regiones
La característica principal
Este diseño elimina las limitaciones de espacio físico, lo que permite que el prellenado y la decodificación se ejecuten simultáneamente en diferentes centros de datos. Para garantizar una transferencia eficiente, PrfaaS incorpora un mecanismo de programación de dos escalas temporales que asigna recursos de forma flexible en función de las fluctuaciones del tráfico en tiempo real, junto con un enrutamiento preciso para evitar que las solicitudes de texto largo se retrasen debido a una distribución desigual de los recursos.
Resultados de las pruebas: optimización del rendimiento y la latencia
Los datos de la investigación demuestran que la arquitectura PrfaaS ofrece un rendimiento notable en aplicaciones del mundo real:
El rendimiento del servicio aumentó un 54 %, lo que mejoró significativamente el número de solicitudes gestionadas por unidad de tiempo.
La latencia de respuesta se redujo significativamente, lo que agilizó la generación del primer token desde la perspectiva del usuario.
Se maximizó la utilización de los recursos al separar los subsistemas de computación, red y almacenamiento, evitando los problemas de congestión observados en las arquitecturas tradicionales.
La colaboración entre Moonshot AI y la Universidad de Tsinghua no solo ofrece nuevos enfoques de ingeniería para la inferencia de IA a gran escala, sino que también sienta las bases para futuras redes informáticas interregionales. Este modelo de Prefill-as-a-Service podría convertirse en un hito clave para llevar los modelos de gran tamaño hacia el despliegue industrial.
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr











