Maison
Sortie de la version préliminaire du modèle LFM2.5 DSpark : vitesse d'inférence multipliée par 3,18
Liquid AI et Hugging Face ont officiellement publié les points de contrôle préliminaires du modèle DSpark pour la série LFM2.5, qui comprend les modèles LFM2.5-1.2B-Instruct, LFM2.5-2.6B et LFM2.5-8B-A1B. Cette innovation introduit une nouvelle voie de décodage spéculatif qui augmente considérablement le débit d’inférence tout en préservant la qualité des résultats.
Gains de performances clés et applications concrètes
Des tests en conditions réelles démontrent l’impressionnante accélération offerte par DSpark. Sur les GPU, le débit est multiplié par 3,18, tandis que les appareils en périphérie enregistrent des améliorations pouvant atteindre un facteur de 2,87.
Dans le cadre de l’inférence des agents en périphérie, LFM2.5-2.6B réduit la latence des appels de fonction de 57 % en moyenne. Testé sur un MacBook Pro M4 Max, il atteint des vitesses allant jusqu’à 139 tokens par seconde, abaissant ainsi la barrière au déploiement d’agents locaux et offrant une expérience utilisateur qui rivalise avec celle des modèles cloud propriétaires.

Comprendre l’architecture et le mécanisme de DSpark
L’inférence LLM traditionnelle est freinée par la bande passante mémoire, car la majeure partie du temps est consacrée au transfert des poids de la DRAM vers la SRAM. Le décodage spéculatif résout ce problème en utilisant un modèle préliminaire léger pour générer des tokens candidats, qui sont ensuite validés en un seul passage avant par le modèle cible, ce qui répartit efficacement les coûts de chargement des poids.
DSpark intègre les méthodes existantes à travers trois composants principaux :
Réseau dorsal parallèle: à l’instar de DFlash, il génère des états cachés pour tous les tokens provisoires en un seul passage avant, en fonction des caractéristiques contextuelles du modèle cible.Tête séquentielle (tête de Markov): En simulant des chaînes de Markov entre des tokens adjacents, elle renforce les dépendances et améliore le taux d’acceptation pour les positions suivantes.Validateur de planification par confiance: il prédit la probabilité de survie de chaque token, en écartant automatiquement les suffixes à faible confiance lorsque les coûts de validation dépassent les économies réalisées.Pour l’entraînement, le modèle de base utilise un ensemble de données varié comprenant des SFT, des conversations, du code et des appels de fonction. Après des études d’ablation rigoureuses, la version initiale présente une architecture basée uniquement sur l’attention, composée de 5 couches et 9 blocs, avec environ 300 millions de paramètres.

Assurance qualité et intégration dans l’écosystème
En raison du décodage spéculatif, le décodage glouton n’accepte que les tokens provisoires qui correspondent parfaitement à la distribution du modèle cible. Les tokens rejetés sont remplacés par la sortie du modèle cible, garantissant ainsi que la séquence générée correspond à la structure de décodage glouton de référence, sans perte de précision dans les tests de performance.
Lors de son lancement, DSpark a atteint la compatibilité avec les principaux frameworks d’inférence :
SGLang: prend en charge l’exécution sur des accélérateurs via des configurations d’intégration et de démarrage dédiées.llama.cpp: offre une prise en charge officielle de la compilation, permettant aux utilisateurs de charger les poids GGUF et les fichiers de modèle préliminaires correspondants via la ligne de commande.
Article connexe
Comment Unitree façonne l'avenir de la robotique humanoïde
La nouvelle créature d’Unitree dotée d’une IA incarnée et d’une technologie LiDAR 4D ultra-large pour une navigation avancée dans le monde réel. Crédit : UnitreeWang Xingxing, PDG d'Unitree, vise des
Pourquoi Abnormal AI s'est associé à OpenAI pour le lancement de Daybreak
Michael Aiello, responsable des produits de cybersécurité chez OpenAI | Crédit : Michael Aiello/LinkedInAbnormal AI rejoint le programme Daybreak d’OpenAI. Selon Mike Aiello, ce partenariat permettra
L'agent IA « Elements Claw » achève le développement d'un matériau supraconducteur
Alors que l’intelligence artificielle repousse les limites de l’exploration scientifique, une étape importante vient d’être franchie. Le 3 juillet, l’Académie DAMO d’Alibaba, en partenariat avec l’Uni
Recommandations de sujets spéciaux liés
commentaires (0)
Liquid AI et Hugging Face ont officiellement publié les points de contrôle préliminaires du modèle DSpark pour la série LFM2.5, qui comprend les modèles LFM2.5-1.2B-Instruct, LFM2.5-2.6B et LFM2.5-8B-A1B. Cette innovation introduit une nouvelle voie de décodage spéculatif qui augmente considérablement le débit d’inférence tout en préservant la qualité des résultats.
Gains de performances clés et applications concrètes
Des tests en conditions réelles démontrent l’impressionnante accélération offerte par DSpark. Sur les GPU, le débit est multiplié par 3,18, tandis que les appareils en périphérie enregistrent des améliorations pouvant atteindre un facteur de 2,87.
Dans le cadre de l’inférence des agents en périphérie, LFM2.5-2.6B réduit la latence des appels de fonction de 57 % en moyenne. Testé sur un MacBook Pro M4 Max, il atteint des vitesses allant jusqu’à 139 tokens par seconde, abaissant ainsi la barrière au déploiement d’agents locaux et offrant une expérience utilisateur qui rivalise avec celle des modèles cloud propriétaires.

Comprendre l’architecture et le mécanisme de DSpark
L’inférence LLM traditionnelle est freinée par la bande passante mémoire, car la majeure partie du temps est consacrée au transfert des poids de la DRAM vers la SRAM. Le décodage spéculatif résout ce problème en utilisant un modèle préliminaire léger pour générer des tokens candidats, qui sont ensuite validés en un seul passage avant par le modèle cible, ce qui répartit efficacement les coûts de chargement des poids.
DSpark intègre les méthodes existantes à travers trois composants principaux :
Réseau dorsal parallèle: à l’instar de DFlash, il génère des états cachés pour tous les tokens provisoires en un seul passage avant, en fonction des caractéristiques contextuelles du modèle cible.Tête séquentielle (tête de Markov): En simulant des chaînes de Markov entre des tokens adjacents, elle renforce les dépendances et améliore le taux d’acceptation pour les positions suivantes.Validateur de planification par confiance: il prédit la probabilité de survie de chaque token, en écartant automatiquement les suffixes à faible confiance lorsque les coûts de validation dépassent les économies réalisées.Pour l’entraînement, le modèle de base utilise un ensemble de données varié comprenant des SFT, des conversations, du code et des appels de fonction. Après des études d’ablation rigoureuses, la version initiale présente une architecture basée uniquement sur l’attention, composée de 5 couches et 9 blocs, avec environ 300 millions de paramètres.

Assurance qualité et intégration dans l’écosystème
En raison du décodage spéculatif, le décodage glouton n’accepte que les tokens provisoires qui correspondent parfaitement à la distribution du modèle cible. Les tokens rejetés sont remplacés par la sortie du modèle cible, garantissant ainsi que la séquence générée correspond à la structure de décodage glouton de référence, sans perte de précision dans les tests de performance.
Lors de son lancement, DSpark a atteint la compatibilité avec les principaux frameworks d’inférence :
SGLang: prend en charge l’exécution sur des accélérateurs via des configurations d’intégration et de démarrage dédiées.llama.cpp: offre une prise en charge officielle de la compilation, permettant aux utilisateurs de charger les poids GGUF et les fichiers de modèle préliminaires correspondants via la ligne de commande.
Comment Unitree façonne l'avenir de la robotique humanoïde
La nouvelle créature d’Unitree dotée d’une IA incarnée et d’une technologie LiDAR 4D ultra-large pour une navigation avancée dans le monde réel. Crédit : UnitreeWang Xingxing, PDG d'Unitree, vise des
Pourquoi Abnormal AI s'est associé à OpenAI pour le lancement de Daybreak
Michael Aiello, responsable des produits de cybersécurité chez OpenAI | Crédit : Michael Aiello/LinkedInAbnormal AI rejoint le programme Daybreak d’OpenAI. Selon Mike Aiello, ce partenariat permettra
L'agent IA « Elements Claw » achève le développement d'un matériau supraconducteur
Alors que l’intelligence artificielle repousse les limites de l’exploration scientifique, une étape importante vient d’être franchie. Le 3 juillet, l’Académie DAMO d’Alibaba, en partenariat avec l’Uni











