Maison
Moonshot AI et l'université de Tsinghua proposent une architecture PrfaaS pour les centres de données
Les grands modèles linguistiques (LLM) nécessitant une puissance de calcul accrue lors des processus de raisonnement, les architectures de services traditionnelles se heurtent à des goulots d’étranglement. Moonshot AI, en collaboration avec une équipe de recherche de l’université de Tsinghua, a présenté une architecture novatrice appelée « Pre-filling as a Service » (PrfaaS), destinée à surmonter les contraintes liées aux centres de données et aux ressources de calcul dans les services LLM.

Le processus de raisonnement des grands modèles linguistiques se divise généralement en deux phases : le pré-remplissage et le décodage. Le pré-remplissage est une opération très gourmande en ressources de calcul, au cours de laquelle le modèle traite les données d’entrée et crée un cache clé-valeur (KVCache). Le décodage, quant à lui, sollicite fortement la bande passante mémoire et génère des résultats de manière séquentielle. Les configurations traditionnelles exigent que ces deux étapes se déroulent au sein du même centre de données, ce qui entraîne des contraintes en termes de puissance de calcul et de bande passante.
PrfaaS permet un service inter-centres de données efficace en déchargeant les tâches de préremplissage vers des clusters dédiés à haute puissance de calcul, tout en utilisant un réseau Ethernet standard pour transférer le KVCache généré vers les clusters de décodage locaux. Des recherches indiquent que cette architecture améliore les performances de traitement, permettant une augmentation de 54 % du débit du service par rapport aux modèles traditionnels. Des études de cas concrets démontrent également une latence réduite et une efficacité accrue.
L’architecture PrfaaS dissocie les trois sous-systèmes principaux — calcul, réseau et stockage — en les gérant chacun de manière indépendante. Un mécanisme de routage précis assure une transmission efficace des requêtes longues, empêchant ainsi la congestion due à une répartition inégale des ressources, comme c’est le cas dans les approches traditionnelles. De plus, un mécanisme de planification à double échelle de temps s’adapte aux variations des modèles de trafic, optimisant encore davantage l’utilisation des ressources.
Alors que la demande en matière de raisonnement inter-centres de données ne cesse de croître et que de nouveaux matériels continuent d’apparaître, PrfaaS offre une solution prometteuse pour les futures applications d’IA.
Article connexe
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter
Google teste l'agent IA Remy pour Gemini à mesure que l'accent se déplace vers le contrôle utilisateur
Selon Business Insider, Google teste Remy, un nouvel agent personnel d’IA pour Gemini. Cet outil vise à exécuter des tâches au nom des utilisateurs, rationalisant ainsi les flux de travail professionnels et les routines quotidiennes.Actuellement, Re
Comment corriger les Core Web Vitals pour de meilleurs classements SEO
Fluidifiez les commentaires de bulletin avec des outils d'IAIntroductionOutils d'IA pour générer des commentaires de bulletinMagic SchoolAlmanac AIChat GPTUtilisation de Magic School pour générer des commentaires de bulletinConnexion à Magic Sc
Recommandations de sujets spéciaux liés
commentaires (10)
Интересная архитектура PrfaS от Moonshot и Цинхуа для решения проблем с вычислительной мощностью LLM. Надеюсь, это поможет оптимизировать центры обработки данных! 🚀
A arquitetura PrfaS proposta por Moonshot e Tsinghua é um passo interessante para resolver gargalos de computação em LLMs. Será que isso viabiliza data centers mais eficientes? 🤔
La arquitectura PrfaS de Moonshot y Tsinghua parece una gran solución para los cuellos de botella en centros de datos con LLMs. ¡Esperamos ver resultados concretos pronto! 📈
Moonshot AI und Tsinghua zeigen mit PrfaS einen vielversprechenden Ansatz gegen Rechenengpässe bei LLMs. Spannend zu sehen, wie diese Kooperation die Datenzukunft gestaltet! 🌐
Les grands modèles linguistiques (LLM) nécessitant une puissance de calcul accrue lors des processus de raisonnement, les architectures de services traditionnelles se heurtent à des goulots d’étranglement. Moonshot AI, en collaboration avec une équipe de recherche de l’université de Tsinghua, a présenté une architecture novatrice appelée « Pre-filling as a Service » (PrfaaS), destinée à surmonter les contraintes liées aux centres de données et aux ressources de calcul dans les services LLM.

Le processus de raisonnement des grands modèles linguistiques se divise généralement en deux phases : le pré-remplissage et le décodage. Le pré-remplissage est une opération très gourmande en ressources de calcul, au cours de laquelle le modèle traite les données d’entrée et crée un cache clé-valeur (KVCache). Le décodage, quant à lui, sollicite fortement la bande passante mémoire et génère des résultats de manière séquentielle. Les configurations traditionnelles exigent que ces deux étapes se déroulent au sein du même centre de données, ce qui entraîne des contraintes en termes de puissance de calcul et de bande passante.
PrfaaS permet un service inter-centres de données efficace en déchargeant les tâches de préremplissage vers des clusters dédiés à haute puissance de calcul, tout en utilisant un réseau Ethernet standard pour transférer le KVCache généré vers les clusters de décodage locaux. Des recherches indiquent que cette architecture améliore les performances de traitement, permettant une augmentation de 54 % du débit du service par rapport aux modèles traditionnels. Des études de cas concrets démontrent également une latence réduite et une efficacité accrue.
L’architecture PrfaaS dissocie les trois sous-systèmes principaux — calcul, réseau et stockage — en les gérant chacun de manière indépendante. Un mécanisme de routage précis assure une transmission efficace des requêtes longues, empêchant ainsi la congestion due à une répartition inégale des ressources, comme c’est le cas dans les approches traditionnelles. De plus, un mécanisme de planification à double échelle de temps s’adapte aux variations des modèles de trafic, optimisant encore davantage l’utilisation des ressources.
Alors que la demande en matière de raisonnement inter-centres de données ne cesse de croître et que de nouveaux matériels continuent d’apparaître, PrfaaS offre une solution prometteuse pour les futures applications d’IA.
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter
Comment corriger les Core Web Vitals pour de meilleurs classements SEO
Fluidifiez les commentaires de bulletin avec des outils d'IAIntroductionOutils d'IA pour générer des commentaires de bulletinMagic SchoolAlmanac AIChat GPTUtilisation de Magic School pour générer des commentaires de bulletinConnexion à Magic Sc
Интересная архитектура PrfaS от Moonshot и Цинхуа для решения проблем с вычислительной мощностью LLM. Надеюсь, это поможет оптимизировать центры обработки данных! 🚀
A arquitetura PrfaS proposta por Moonshot e Tsinghua é um passo interessante para resolver gargalos de computação em LLMs. Será que isso viabiliza data centers mais eficientes? 🤔
La arquitectura PrfaS de Moonshot y Tsinghua parece una gran solución para los cuellos de botella en centros de datos con LLMs. ¡Esperamos ver resultados concretos pronto! 📈
Moonshot AI und Tsinghua zeigen mit PrfaS einen vielversprechenden Ansatz gegen Rechenengpässe bei LLMs. Spannend zu sehen, wie diese Kooperation die Datenzukunft gestaltet! 🌐











