Maison
Moonshot AI et l'université Tsinghua dévoilent l'architecture PrfaaS pour surmonter les goulots d'étranglement liés à la puissance de calcul des grands modèles
Les nouvelles technologies permettent de surmonter les goulots d'étranglement en matière de performances des grands modèles linguistiques (LLM). Récemment, des chercheurs de Moonshot AI (Moonshot) et de l'université Tsinghua ont présenté une architecture novatrice appelée Prefill-as-a-Service (PrfaaS). Cette étude s'attaque aux contraintes matérielles liées au déploiement de services de modèles de grande taille dans les centres de données en optimisant l'allocation des ressources de calcul, ce qui améliore considérablement l'efficacité de l'inférence.

Percée technique : une séparation « chirurgicale » entre le préremplissage et le décodage
Actuellement, le processus d'inférence des grands modèles linguistiques comprend deux phases distinctes :
Phase de préremplissage : cette phase est très gourmande en ressources de calcul ; elle gère le traitement des entrées et génère un cache clé-valeur (KVCache).
Phase de décodage : cette phase est gourmande en bande passante mémoire et génère la sortie mot par mot.
Dans les architectures traditionnelles, ces deux phases sont généralement gérées au sein du même centre de données, voire du même serveur. Comme elles ont des besoins différents en ressources matérielles, ce « regroupement forcé » crée souvent un déséquilibre dans l’allocation des ressources de calcul et de bande passante, ce qui entraîne une congestion du service.
Innovation principale : collaboration interrégionale efficace
Le principal atoutde PrfaaS réside dans la mise en place d’un service découplé. Il déleste les tâches de préremplissage gourmandes en calcul vers des clusters spécialisés à haute capacité de calcul. Une fois les tâches terminées, le système utilise un réseau Ethernet standard pour transférer à distance le KVCache généré vers un cluster de décodage local.
Cette conception élimine les contraintes d’espace physique, permettant au préremplissage et au décodage de s’exécuter simultanément dans différents centres de données. Pour garantir un transfert efficace, PrfaaS intègre un mécanisme de planification à deux échelles de temps qui alloue les ressources de manière flexible en fonction des fluctuations du trafic en temps réel, associé à un routage précis pour éviter que les requêtes de texte longues ne soient retardées par une répartition inégale des ressources.
Résultats des tests : optimisation du débit et de la latence
Les données de recherche démontrent que l'architecture PrfaaS offre des performances remarquables dans des applications concrètes :
Le débit du service a augmenté de 54 %, améliorant considérablement le nombre de requêtes traitées par unité de temps.
La latence de réponse a considérablement diminué, accélérant la génération du premier jeton du point de vue de l'utilisateur.
L'utilisation des ressources a été optimisée grâce à la séparation des sous-systèmes de calcul, de réseau et de stockage, ce qui a permis d'éviter les problèmes de congestion observés dans les architectures traditionnelles.
La collaboration entre Moonshot AI et l'université de Tsinghua offre non seulement de nouvelles approches techniques pour l'inférence IA à grande échelle, mais jette également les bases de futurs réseaux informatiques interrégionaux. Ce modèle Prefill-as-a-Service pourrait constituer une étape clé dans le déploiement industriel des grands modèles.
Article connexe
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter
Google teste l'agent IA Remy pour Gemini à mesure que l'accent se déplace vers le contrôle utilisateur
Selon Business Insider, Google teste Remy, un nouvel agent personnel d’IA pour Gemini. Cet outil vise à exécuter des tâches au nom des utilisateurs, rationalisant ainsi les flux de travail professionnels et les routines quotidiennes.Actuellement, Re
Recommandations de sujets spéciaux liés
commentaires (1)
Les nouvelles technologies permettent de surmonter les goulots d'étranglement en matière de performances des grands modèles linguistiques (LLM). Récemment, des chercheurs de Moonshot AI (Moonshot) et de l'université Tsinghua ont présenté une architecture novatrice appelée Prefill-as-a-Service (PrfaaS). Cette étude s'attaque aux contraintes matérielles liées au déploiement de services de modèles de grande taille dans les centres de données en optimisant l'allocation des ressources de calcul, ce qui améliore considérablement l'efficacité de l'inférence.

Percée technique : une séparation « chirurgicale » entre le préremplissage et le décodage
Actuellement, le processus d'inférence des grands modèles linguistiques comprend deux phases distinctes :
Phase de préremplissage : cette phase est très gourmande en ressources de calcul ; elle gère le traitement des entrées et génère un cache clé-valeur (KVCache).
Phase de décodage : cette phase est gourmande en bande passante mémoire et génère la sortie mot par mot.
Dans les architectures traditionnelles, ces deux phases sont généralement gérées au sein du même centre de données, voire du même serveur. Comme elles ont des besoins différents en ressources matérielles, ce « regroupement forcé » crée souvent un déséquilibre dans l’allocation des ressources de calcul et de bande passante, ce qui entraîne une congestion du service.
Innovation principale : collaboration interrégionale efficace
Le principal atout
Cette conception élimine les contraintes d’espace physique, permettant au préremplissage et au décodage de s’exécuter simultanément dans différents centres de données. Pour garantir un transfert efficace, PrfaaS intègre un mécanisme de planification à deux échelles de temps qui alloue les ressources de manière flexible en fonction des fluctuations du trafic en temps réel, associé à un routage précis pour éviter que les requêtes de texte longues ne soient retardées par une répartition inégale des ressources.
Résultats des tests : optimisation du débit et de la latence
Les données de recherche démontrent que l'architecture PrfaaS offre des performances remarquables dans des applications concrètes :
Le débit du service a augmenté de 54 %, améliorant considérablement le nombre de requêtes traitées par unité de temps.
La latence de réponse a considérablement diminué, accélérant la génération du premier jeton du point de vue de l'utilisateur.
L'utilisation des ressources a été optimisée grâce à la séparation des sous-systèmes de calcul, de réseau et de stockage, ce qui a permis d'éviter les problèmes de congestion observés dans les architectures traditionnelles.
La collaboration entre Moonshot AI et l'université de Tsinghua offre non seulement de nouvelles approches techniques pour l'inférence IA à grande échelle, mais jette également les bases de futurs réseaux informatiques interrégionaux. Ce modèle Prefill-as-a-Service pourrait constituer une étape clé dans le déploiement industriel des grands modèles.
Les actions américaines atteignent un jalon historique alors que les géants de l'IA et de l'aérospatiale se préparent pour leur entrée boursière à la valeur du trillion de dollars.
Elon Musk, Sam Altman et Dario Amodei, trois titans du secteur technologique, s’approchent des introductions en bourse de leurs entreprises respectives. Avec SpaceX, OpenAI et Anthropic – trois géants de l’industrie dont les valorisations approchent
La startup suédoise en intelligence artificielle Lovable Eyes atteint une valorisation de 13,2 milliards de dollars après un tour de table majeur
Alors que les outils de codage alimentés par l’intelligence artificielle gagnent en popularité, la startup suédoise Lovable a levé des fonds lors d’un tour de table majeur. L’entreprise vise à collecter 3 milliards de dollars, ce qui pourrait porter











