Heim
LFM2.5 DSpark-Entwurf veröffentlicht: 3,18-fache Steigerung der Inferenzgeschwindigkeit
Liquid AI und Hugging Face haben offiziell die DSpark-Entwurf-Modell-Checkpoints für die LFM2.5-Serie veröffentlicht, darunter LFM2.5-1.2B-Instruct, LFM2.5-2.6B und LFM2.5-8B-A1B. Diese Innovation führt einen neuartigen spekulativen Dekodierungspfad ein, der den Inferenzdurchsatz erheblich steigert und gleichzeitig die Ausgabequalität gewährleistet.
Wichtige Leistungssteigerungen und praktische Anwendungen
Praxistests belegen die beeindruckende Beschleunigung durch DSpark. Auf GPUs steigt der Durchsatz um das bis zu 3,18-Fache, während Edge-Geräte Verbesserungen von bis zu 2,87-fach verzeichnen.
Bei der Inferenz auf Edge-Agenten reduziert LFM2.5-2.6B die Latenz bei Funktionsaufrufen um durchschnittlich 57 %. Getestet auf einem MacBook Pro M4 Max erreicht es Geschwindigkeiten von bis zu 139 Token pro Sekunde, was die Hürde für den Einsatz lokaler Agenten senkt und ein Nutzererlebnis bietet, das mit proprietären Cloud-Modellen mithalten kann.

Die Architektur und Funktionsweise von DSpark verstehen
Die herkömmliche LLM-Inferenz wird durch die Speicherbandbreite gebremst, da der größte Teil der Zeit für das Streamen von Gewichten vom DRAM in den SRAM aufgewendet wird. Spekulatives Decodieren löst dieses Problem durch die Verwendung eines leichtgewichtigen Entwurfsmodells zur Generierung von Token-Kandidaten, die anschließend in einem einzigen Vorwärtsdurchlauf durch das Zielmodell validiert werden, wodurch die Kosten für das Laden der Gewichte effektiv verteilt werden.
DSpark integriert bestehende Methoden über drei Kernkomponenten:
Paralleles Backbone-Netzwerk: Ähnlich wie bei DFlash generiert es in einem Vorwärtsdurchlauf versteckte Zustände für alle Entwurfstoken auf der Grundlage der Kontextmerkmale des Zielmodells.Sequentieller Kopf (Markov-Kopf): Durch die Simulation von Markov-Ketten zwischen benachbarten Tokens verstärkt er Abhängigkeiten und verbessert die Akzeptanzrate für nachfolgende Positionen.Confidence Scheduling Validator: Er prognostiziert die Überlebenswahrscheinlichkeit jedes Tokens und verwirft automatisch Suffixe mit geringer Konfidenz, wenn die Validierungskosten die Einsparungen übersteigen.Für das Training nutzt das Entwurfsmodell eine vielfältige Mischung aus Datensätzen, darunter SFT, Chat, Code und Funktionsaufrufe. Nach strengen Ablationsstudien verfügt die erste Version über eine reine Attention-Architektur mit 5 Schichten und 9 Blöcken, wobei die Anzahl der Parameter bei etwa 300 Millionen liegt.

Qualitätssicherung und Integration in das Ökosystem
Aufgrund der spekulativen Dekodierung akzeptiert die „greedy“-Dekodierung nur Entwurfs-Token, die perfekt mit der Verteilung des Zielmodells übereinstimmen. Abgelehnte Token werden durch die Ausgabe des Zielmodells ersetzt, wodurch sichergestellt wird, dass die generierte Sequenz der Basisstruktur der „greedy“-Dekodierung entspricht, ohne dass es in Benchmarks zu Genauigkeitsverlusten kommt.
Bei der Veröffentlichung erreichte DSpark Kompatibilität mit gängigen Inferenz-Frameworks:
SGLang: Unterstützt die Ausführung auf Beschleunigern über spezielle Integrations- und Startkonfigurationen.llama.cpp: Bietet offizielle Build-Unterstützung, sodass Nutzer entsprechende GGUF-Gewichte und Draft-Modelldateien über die Befehlszeile laden können.
Verwandter Artikel
Wie Unitree die Zukunft der humanoiden Robotik gestaltet
Unitrees neue „Creature“ mit verkörperter KI und ultrabreitem 4D-LiDAR-System für fortschrittliche Navigation in der realen Welt. Bildquelle: UnitreeWang Xingxing, CEO von Unitree, strebt Durchbrüche
Warum Abnormal AI bei „Daybreak“ eine Partnerschaft mit OpenAI eingegangen ist
Michael Aiello, Produktleiter für Cybersicherheit bei OpenAI | Bildnachweis: Michael Aiello/LinkedInAbnormal AI tritt dem „Daybreak“-Programm von OpenAI bei; laut Mike Aiello wird die Partnerschaft di
AI Agent Elements Claw schließt die Entwicklung eines supraleitenden Materials ab
Da künstliche Intelligenz die Grenzen der wissenschaftlichen Forschung immer weiter verschiebt, wurde nun ein bedeutender Meilenstein erreicht. Am 3. Juli stellte die Alibaba DAMO Academy in Zusammena
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)
Liquid AI und Hugging Face haben offiziell die DSpark-Entwurf-Modell-Checkpoints für die LFM2.5-Serie veröffentlicht, darunter LFM2.5-1.2B-Instruct, LFM2.5-2.6B und LFM2.5-8B-A1B. Diese Innovation führt einen neuartigen spekulativen Dekodierungspfad ein, der den Inferenzdurchsatz erheblich steigert und gleichzeitig die Ausgabequalität gewährleistet.
Wichtige Leistungssteigerungen und praktische Anwendungen
Praxistests belegen die beeindruckende Beschleunigung durch DSpark. Auf GPUs steigt der Durchsatz um das bis zu 3,18-Fache, während Edge-Geräte Verbesserungen von bis zu 2,87-fach verzeichnen.
Bei der Inferenz auf Edge-Agenten reduziert LFM2.5-2.6B die Latenz bei Funktionsaufrufen um durchschnittlich 57 %. Getestet auf einem MacBook Pro M4 Max erreicht es Geschwindigkeiten von bis zu 139 Token pro Sekunde, was die Hürde für den Einsatz lokaler Agenten senkt und ein Nutzererlebnis bietet, das mit proprietären Cloud-Modellen mithalten kann.

Die Architektur und Funktionsweise von DSpark verstehen
Die herkömmliche LLM-Inferenz wird durch die Speicherbandbreite gebremst, da der größte Teil der Zeit für das Streamen von Gewichten vom DRAM in den SRAM aufgewendet wird. Spekulatives Decodieren löst dieses Problem durch die Verwendung eines leichtgewichtigen Entwurfsmodells zur Generierung von Token-Kandidaten, die anschließend in einem einzigen Vorwärtsdurchlauf durch das Zielmodell validiert werden, wodurch die Kosten für das Laden der Gewichte effektiv verteilt werden.
DSpark integriert bestehende Methoden über drei Kernkomponenten:
Paralleles Backbone-Netzwerk: Ähnlich wie bei DFlash generiert es in einem Vorwärtsdurchlauf versteckte Zustände für alle Entwurfstoken auf der Grundlage der Kontextmerkmale des Zielmodells.Sequentieller Kopf (Markov-Kopf): Durch die Simulation von Markov-Ketten zwischen benachbarten Tokens verstärkt er Abhängigkeiten und verbessert die Akzeptanzrate für nachfolgende Positionen.Confidence Scheduling Validator: Er prognostiziert die Überlebenswahrscheinlichkeit jedes Tokens und verwirft automatisch Suffixe mit geringer Konfidenz, wenn die Validierungskosten die Einsparungen übersteigen.Für das Training nutzt das Entwurfsmodell eine vielfältige Mischung aus Datensätzen, darunter SFT, Chat, Code und Funktionsaufrufe. Nach strengen Ablationsstudien verfügt die erste Version über eine reine Attention-Architektur mit 5 Schichten und 9 Blöcken, wobei die Anzahl der Parameter bei etwa 300 Millionen liegt.

Qualitätssicherung und Integration in das Ökosystem
Aufgrund der spekulativen Dekodierung akzeptiert die „greedy“-Dekodierung nur Entwurfs-Token, die perfekt mit der Verteilung des Zielmodells übereinstimmen. Abgelehnte Token werden durch die Ausgabe des Zielmodells ersetzt, wodurch sichergestellt wird, dass die generierte Sequenz der Basisstruktur der „greedy“-Dekodierung entspricht, ohne dass es in Benchmarks zu Genauigkeitsverlusten kommt.
Bei der Veröffentlichung erreichte DSpark Kompatibilität mit gängigen Inferenz-Frameworks:
SGLang: Unterstützt die Ausführung auf Beschleunigern über spezielle Integrations- und Startkonfigurationen.llama.cpp: Bietet offizielle Build-Unterstützung, sodass Nutzer entsprechende GGUF-Gewichte und Draft-Modelldateien über die Befehlszeile laden können.
Wie Unitree die Zukunft der humanoiden Robotik gestaltet
Unitrees neue „Creature“ mit verkörperter KI und ultrabreitem 4D-LiDAR-System für fortschrittliche Navigation in der realen Welt. Bildquelle: UnitreeWang Xingxing, CEO von Unitree, strebt Durchbrüche
Warum Abnormal AI bei „Daybreak“ eine Partnerschaft mit OpenAI eingegangen ist
Michael Aiello, Produktleiter für Cybersicherheit bei OpenAI | Bildnachweis: Michael Aiello/LinkedInAbnormal AI tritt dem „Daybreak“-Programm von OpenAI bei; laut Mike Aiello wird die Partnerschaft di
AI Agent Elements Claw schließt die Entwicklung eines supraleitenden Materials ab
Da künstliche Intelligenz die Grenzen der wissenschaftlichen Forschung immer weiter verschiebt, wurde nun ein bedeutender Meilenstein erreicht. Am 3. Juli stellte die Alibaba DAMO Academy in Zusammena











