LFM2.5 DSpark 预发布模型发布:推理速度提升3.18倍
Liquid AI 和 Hugging Face 已正式发布 LFM2.5 系列的 DSpark 草案模型检查点,涵盖 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B。 这项创新引入了一种全新的投机性解码路径,在保持输出质量的同时,显著提升了推理吞吐量。
关键性能提升与实际应用
实际测试证明了 DSpark 令人印象深刻的加速效果。在 GPU 上,吞吐量最高提升了 3.18 倍,而在边缘设备上,提升幅度最高达 2.87 倍。
在边缘代理推理中,LFM2.5-2.6B 将函数调用延迟平均降低了 57%。在 M4 Max MacBook Pro 上测试时,其处理速度高达每秒 139 个令牌,这降低了本地代理部署的门槛,并提供了可与专有云模型媲美的用户体验。

理解 DSpark 的架构与机制
传统 LLM 推理受限于内存带宽,因为大部分时间都耗费在将权重从 DRAM 流式传输到 SRAM 的过程中。投机性解码通过使用轻量级草稿模型生成候选令牌来解决这一问题,随后由目标模型在单次前向传播中验证这些令牌,从而有效地分摊了权重加载成本。
DSpark 通过三个核心组件整合了现有方法:
并行骨干网络:与 DFlash 类似,它基于目标模型的上下文特征,在一次前向传播中为所有草稿令牌生成隐藏状态。序列化头(马尔可夫头): 通过模拟相邻令牌之间的马尔可夫链,增强依赖关系并提高后续位置的接受率。置信度调度验证器:它预测每个令牌的存活概率,当验证成本超过节省的资源时,自动舍弃低置信度的后缀。在训练阶段,该草稿模型利用了包含SFT、聊天、代码和函数调用的多样化数据集组合。经过严格的消融实验,初始版本采用了一种仅包含注意力机制的架构,包含5层和9个块,参数数量保持在3亿左右。

质量保证与生态系统集成
由于采用了推测性解码,贪婪解码仅接受与目标模型分布完全匹配的草稿令牌。被拒绝的令牌将被目标模型的输出替换,从而确保生成的序列与基线贪婪解码结构一致,且在基准测试中不会造成准确率损失。
发布时,DSpark 已实现与主流推理框架的兼容性:
SGLang:通过专用的集成和启动配置,支持在加速器上执行。llama.cpp:提供官方构建支持,允许用户通过命令行加载相应的 GGUF 权重和草稿模型文件。
相关文章
Unitree 如何塑造类人机器人技术的未来
Unitree推出的全新具身AI机器人,搭载超广角4D激光雷达技术,可实现先进的现实世界导航。图片来源:UnitreeUnitree首席执行官王兴兴致力于实现世界模型的突破,以帮助类人机器人在进入陌生家庭后完成80%的任务随着机器人行业逐渐摆脱预设脚本的局限,中国类人型机器人独角兽企业Unitree正全力以赴,致力于解决真实世界中的认知适应性问题。尽管随着ChatGPT的发布,生成式人工智能(ge
为什么Abnormal AI在《Daybreak》节目中与OpenAI合作
OpenAI 网络安全产品负责人迈克尔·艾耶洛 | 图片来源:迈克尔·艾耶洛/LinkedInAbnormal AI 加入 OpenAI 的“Daybreak”计划,迈克·艾耶洛表示,此次合作将加速企业采用实用的防御措施领先的前沿人工智能公司 OpenAI 已与 Abnormal AI 建立合作伙伴关系,旨在帮助企业在其业务和产品开发中安全地运用一流的人工智能模型。通过此次合作,Abnormal将
AI Agent Elements Claw 完成超导材料研发
随着人工智能不断拓展科学探索的边界,一项重要的里程碑已然达成。7月3日,阿里巴巴达摩院携手中国人民大学和中国科学院大学,共同发布了“Elements Claw”——全球首个专用于发现超导材料的人工智能代理。 这一突破标志着科学发现领域的转变,人工智能已从辅助角色转变为独立的研究伙伴,同时为新材料开发建立了一个高效的自动化框架。传统寻找超导体的方法效率低下且速度缓慢,且高度依赖试错法。尽管Super
相关专题推荐
评论 (0)
0/500
Liquid AI 和 Hugging Face 已正式发布 LFM2.5 系列的 DSpark 草案模型检查点,涵盖 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B。 这项创新引入了一种全新的投机性解码路径,在保持输出质量的同时,显著提升了推理吞吐量。
关键性能提升与实际应用
实际测试证明了 DSpark 令人印象深刻的加速效果。在 GPU 上,吞吐量最高提升了 3.18 倍,而在边缘设备上,提升幅度最高达 2.87 倍。
在边缘代理推理中,LFM2.5-2.6B 将函数调用延迟平均降低了 57%。在 M4 Max MacBook Pro 上测试时,其处理速度高达每秒 139 个令牌,这降低了本地代理部署的门槛,并提供了可与专有云模型媲美的用户体验。

理解 DSpark 的架构与机制
传统 LLM 推理受限于内存带宽,因为大部分时间都耗费在将权重从 DRAM 流式传输到 SRAM 的过程中。投机性解码通过使用轻量级草稿模型生成候选令牌来解决这一问题,随后由目标模型在单次前向传播中验证这些令牌,从而有效地分摊了权重加载成本。
DSpark 通过三个核心组件整合了现有方法:
并行骨干网络:与 DFlash 类似,它基于目标模型的上下文特征,在一次前向传播中为所有草稿令牌生成隐藏状态。序列化头(马尔可夫头): 通过模拟相邻令牌之间的马尔可夫链,增强依赖关系并提高后续位置的接受率。置信度调度验证器:它预测每个令牌的存活概率,当验证成本超过节省的资源时,自动舍弃低置信度的后缀。在训练阶段,该草稿模型利用了包含SFT、聊天、代码和函数调用的多样化数据集组合。经过严格的消融实验,初始版本采用了一种仅包含注意力机制的架构,包含5层和9个块,参数数量保持在3亿左右。

质量保证与生态系统集成
由于采用了推测性解码,贪婪解码仅接受与目标模型分布完全匹配的草稿令牌。被拒绝的令牌将被目标模型的输出替换,从而确保生成的序列与基线贪婪解码结构一致,且在基准测试中不会造成准确率损失。
发布时,DSpark 已实现与主流推理框架的兼容性:
SGLang:通过专用的集成和启动配置,支持在加速器上执行。llama.cpp:提供官方构建支持,允许用户通过命令行加载相应的 GGUF 权重和草稿模型文件。
Unitree 如何塑造类人机器人技术的未来
Unitree推出的全新具身AI机器人,搭载超广角4D激光雷达技术,可实现先进的现实世界导航。图片来源:UnitreeUnitree首席执行官王兴兴致力于实现世界模型的突破,以帮助类人机器人在进入陌生家庭后完成80%的任务随着机器人行业逐渐摆脱预设脚本的局限,中国类人型机器人独角兽企业Unitree正全力以赴,致力于解决真实世界中的认知适应性问题。尽管随着ChatGPT的发布,生成式人工智能(ge
为什么Abnormal AI在《Daybreak》节目中与OpenAI合作
OpenAI 网络安全产品负责人迈克尔·艾耶洛 | 图片来源:迈克尔·艾耶洛/LinkedInAbnormal AI 加入 OpenAI 的“Daybreak”计划,迈克·艾耶洛表示,此次合作将加速企业采用实用的防御措施领先的前沿人工智能公司 OpenAI 已与 Abnormal AI 建立合作伙伴关系,旨在帮助企业在其业务和产品开发中安全地运用一流的人工智能模型。通过此次合作,Abnormal将
AI Agent Elements Claw 完成超导材料研发
随着人工智能不断拓展科学探索的边界,一项重要的里程碑已然达成。7月3日,阿里巴巴达摩院携手中国人民大学和中国科学院大学,共同发布了“Elements Claw”——全球首个专用于发现超导材料的人工智能代理。 这一突破标志着科学发现领域的转变,人工智能已从辅助角色转变为独立的研究伙伴,同时为新材料开发建立了一个高效的自动化框架。传统寻找超导体的方法效率低下且速度缓慢,且高度依赖试错法。尽管Super





首页






