Hogar
Moonshot AI y la Universidad de Tsinghua proponen una arquitectura PrfaaS para centros de datos
Dado que los modelos de lenguaje a gran escala (LLM) requieren una mayor potencia computacional durante el razonamiento, las arquitecturas de servicio convencionales se enfrentan a cuellos de botella. Moonshot AI, en colaboración con un equipo de investigación de la Universidad de Tsinghua, ha presentado una novedosa arquitectura denominada «Pre-filling as a Service» (PrfaaS), destinada a superar las limitaciones de los centros de datos y los recursos informáticos en los servicios de LLM.

El proceso de razonamiento de los modelos de lenguaje a gran escala se divide generalmente en dos fases: el pre-relleno y la decodificación. El pre-relleno requiere un gran esfuerzo computacional, ya que el modelo procesa la entrada y crea una caché de clave-valor (KVCache). La decodificación consume mucho ancho de banda de memoria, ya que genera resultados de forma secuencial. Las configuraciones tradicionales requieren que ambas etapas se desarrollen dentro del mismo centro de datos, lo que genera limitaciones en cuanto a computación y ancho de banda.
PrfaaS permite un servicio eficiente entre centros de datos al descargar las tareas de prellenado a clústeres dedicados de alta potencia computacional, utilizando una red Ethernet estándar para transferir la KVCache generada a los clústeres de decodificación locales. Las investigaciones indican que esta arquitectura potencia el rendimiento del procesamiento, logrando un aumento del 54 % en el rendimiento del servicio con respecto a los modelos tradicionales. Los estudios de casos reales también muestran una menor latencia y una mayor eficiencia.
La arquitectura PrfaaS desacopla los tres subsistemas principales —computación, redes y almacenamiento— y gestiona cada uno de ellos de forma independiente. Un mecanismo de enrutamiento preciso garantiza la transmisión eficiente de solicitudes largas, evitando la congestión derivada de una asignación desigual de recursos, como ocurre en los enfoques tradicionales. Además, un mecanismo de programación de doble escala temporal se adapta a los patrones de tráfico variables, optimizando aún más el uso de los recursos.
A medida que crece la demanda de razonamiento entre centros de datos y sigue surgiendo nuevo hardware, PrfaaS ofrece una solución prometedora para las futuras aplicaciones de IA.
Artículo relacionado
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr
Google prueba el agente Remy AI para Gemini a medida que el enfoque se desplaza hacia el control del usuario
Según Business Insider, Google está probando Remy, un nuevo agente personal de IA para Gemini. Esta herramienta tiene como objetivo ejecutar tareas en nombre de los usuarios, optimizando tanto los flujos de trabajo profesionales como las rutinas diar
Cómo corregir las Core Web Vitals para mejorar el posicionamiento SEO
Simplificar los comentarios de las tarjetas de calificación con herramientas de IAIntroducciónHerramientas de IA para generar comentarios de tarjetas de calificaciónMagic SchoolAlmanac AIChat GPTUso de Magic School para generar comentarios de t
Recomendaciones de temas especiales relacionados
comentario (10)
0/500
Интересная архитектура PrfaS от Moonshot и Цинхуа для решения проблем с вычислительной мощностью LLM. Надеюсь, это поможет оптимизировать центры обработки данных! 🚀
A arquitetura PrfaS proposta por Moonshot e Tsinghua é um passo interessante para resolver gargalos de computação em LLMs. Será que isso viabiliza data centers mais eficientes? 🤔
La arquitectura PrfaS de Moonshot y Tsinghua parece una gran solución para los cuellos de botella en centros de datos con LLMs. ¡Esperamos ver resultados concretos pronto! 📈
Moonshot AI und Tsinghua zeigen mit PrfaS einen vielversprechenden Ansatz gegen Rechenengpässe bei LLMs. Spannend zu sehen, wie diese Kooperation die Datenzukunft gestaltet! 🌐
Dado que los modelos de lenguaje a gran escala (LLM) requieren una mayor potencia computacional durante el razonamiento, las arquitecturas de servicio convencionales se enfrentan a cuellos de botella. Moonshot AI, en colaboración con un equipo de investigación de la Universidad de Tsinghua, ha presentado una novedosa arquitectura denominada «Pre-filling as a Service» (PrfaaS), destinada a superar las limitaciones de los centros de datos y los recursos informáticos en los servicios de LLM.

El proceso de razonamiento de los modelos de lenguaje a gran escala se divide generalmente en dos fases: el pre-relleno y la decodificación. El pre-relleno requiere un gran esfuerzo computacional, ya que el modelo procesa la entrada y crea una caché de clave-valor (KVCache). La decodificación consume mucho ancho de banda de memoria, ya que genera resultados de forma secuencial. Las configuraciones tradicionales requieren que ambas etapas se desarrollen dentro del mismo centro de datos, lo que genera limitaciones en cuanto a computación y ancho de banda.
PrfaaS permite un servicio eficiente entre centros de datos al descargar las tareas de prellenado a clústeres dedicados de alta potencia computacional, utilizando una red Ethernet estándar para transferir la KVCache generada a los clústeres de decodificación locales. Las investigaciones indican que esta arquitectura potencia el rendimiento del procesamiento, logrando un aumento del 54 % en el rendimiento del servicio con respecto a los modelos tradicionales. Los estudios de casos reales también muestran una menor latencia y una mayor eficiencia.
La arquitectura PrfaaS desacopla los tres subsistemas principales —computación, redes y almacenamiento— y gestiona cada uno de ellos de forma independiente. Un mecanismo de enrutamiento preciso garantiza la transmisión eficiente de solicitudes largas, evitando la congestión derivada de una asignación desigual de recursos, como ocurre en los enfoques tradicionales. Además, un mecanismo de programación de doble escala temporal se adapta a los patrones de tráfico variables, optimizando aún más el uso de los recursos.
A medida que crece la demanda de razonamiento entre centros de datos y sigue surgiendo nuevo hardware, PrfaaS ofrece una solución prometedora para las futuras aplicaciones de IA.
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr
Cómo corregir las Core Web Vitals para mejorar el posicionamiento SEO
Simplificar los comentarios de las tarjetas de calificación con herramientas de IAIntroducciónHerramientas de IA para generar comentarios de tarjetas de calificaciónMagic SchoolAlmanac AIChat GPTUso de Magic School para generar comentarios de t
Интересная архитектура PrfaS от Moonshot и Цинхуа для решения проблем с вычислительной мощностью LLM. Надеюсь, это поможет оптимизировать центры обработки данных! 🚀
A arquitetura PrfaS proposta por Moonshot e Tsinghua é um passo interessante para resolver gargalos de computação em LLMs. Será que isso viabiliza data centers mais eficientes? 🤔
La arquitectura PrfaS de Moonshot y Tsinghua parece una gran solución para los cuellos de botella en centros de datos con LLMs. ¡Esperamos ver resultados concretos pronto! 📈
Moonshot AI und Tsinghua zeigen mit PrfaS einen vielversprechenden Ansatz gegen Rechenengpässe bei LLMs. Spannend zu sehen, wie diese Kooperation die Datenzukunft gestaltet! 🌐











