AMD 推出 vLLM-ATOM 插件,以加速大型模型推理

近日,AMD正式发布了一款名为vLLM-ATOM的新插件。其核心目标是在不改变现有工作流的前提下释放更多硬件潜能,从而为DeepSeek-R1、Kimi-K2和gpt-oss-120B等主流大型语言模型带来显著的推理加速效果。
对于开发者而言,vLLM是一个开源框架,旨在优化高并发环境下的吞吐量和 GPU 内存使用效率。与传统的单请求工具不同,它专注于请求调度和缓存管理。 AMD 的新 ATOM 插件是一款专为Instinct GPU 深度定制的解决方案。其突出特点是“无缝迁移”:企业用户无需修改现有的 API 接口、命令或端到端工作流;该插件会在后台自动处理底层性能优化。
从技术架构角度来看,vLLM-ATOM 采用了精确的三层设计。最上层保留了 vLLM 的请求调度和兼容性接口。中间层即 ATOM 插件,负责模型实现和内核优化。 底层AITER 直接连接至 GPU 硬件,提供 Flash Attention、量化 GEMM 和融合 MoE 等核心加速能力。
该插件主要面向Instinct MI350、MI400 和 MI355X 等高性能 GPU 计算卡。 其支持列表涵盖 Qwen3、GLM 和 DeepSeek 等旗舰模型,并全面覆盖多种架构,包括 MoE(专家混合模型)、稠密模型和视觉语言模型(VLM)。
行业分析师指出,该解决方案的核心价值在于大幅降低了高性能计算的部署门槛。通过这种零学习曲线、无缝迁移的方式,企业可以更轻松地将AI服务迁移到AMD硬件后端,在保持推理效率的同时,有效提升大模型在线服务的稳定性和响应速度。
相关文章
Suno 在法律诉讼中为歌曲添加水印
Suno,这个允许用户生成由人工智能创作的音乐的平台,近日推出了新功能,包括为平台制作的曲目添加标签、限制下载,并更新社区标准以遏制未经授权的复制品。这些更新是在Suno面临多家唱片公司和艺术家组织提起的多起诉讼之际推出的。在博客文章中,联合创始人兼首席执行官Mikey Shulman概述了核心原则,强调该平台旨在促进原创创作,同时扩大更广泛受众对人工智能音乐工具的访问权限。一个主要的争议点在于,用户将人工智能生成的歌曲上传到其他流媒体服务并通过操纵系统获取收入。Suno表示,现在将采用音频
马斯克承认 Grok 构建过程中泄露了用户代码,并承诺清除所有历史数据
埃隆·马斯克直接回应了围绕 Grok Build 的隐私争议,首先以简单的“True”(属实)确认了该事件的有效性。他承诺,此前上传至 SpaceXAI 的所有用户数据将被永久删除,并表示“不留一个字节”。这是人工智能行业首次由主要科技领袖公开承认错误并主动删除用户数据。安全研究人员的“钓鱼”测试揭示了数据泄露的具体证据此次争议源于独立人工智能安全研究人员 @cereblab 的一份报告。SpaceXAI 推出的 AI 编程助手 Grok Build 在其官方网站上声称其“优先本地运行,代码
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径
相关专题推荐
评论 (1)
0/500

近日,AMD正式发布了一款名为vLLM-ATOM的新插件。其核心目标是在不改变现有工作流的前提下释放更多硬件潜能,从而为DeepSeek-R1、Kimi-K2和gpt-oss-120B等主流大型语言模型带来显著的推理加速效果。
对于开发者而言,vLLM是一个开源框架,旨在优化高并发环境下的吞吐量和 GPU 内存使用效率。与传统的单请求工具不同,它专注于请求调度和缓存管理。 AMD 的新 ATOM 插件是一款专为Instinct GPU 深度定制的解决方案。其突出特点是“无缝迁移”:企业用户无需修改现有的 API 接口、命令或端到端工作流;该插件会在后台自动处理底层性能优化。
从技术架构角度来看,vLLM-ATOM 采用了精确的三层设计。最上层保留了 vLLM 的请求调度和兼容性接口。中间层即 ATOM 插件,负责模型实现和内核优化。 底层AITER 直接连接至 GPU 硬件,提供 Flash Attention、量化 GEMM 和融合 MoE 等核心加速能力。
该插件主要面向Instinct MI350、MI400 和 MI355X 等高性能 GPU 计算卡。 其支持列表涵盖 Qwen3、GLM 和 DeepSeek 等旗舰模型,并全面覆盖多种架构,包括 MoE(专家混合模型)、稠密模型和视觉语言模型(VLM)。
行业分析师指出,该解决方案的核心价值在于大幅降低了高性能计算的部署门槛。通过这种零学习曲线、无缝迁移的方式,企业可以更轻松地将AI服务迁移到AMD硬件后端,在保持推理效率的同时,有效提升大模型在线服务的稳定性和响应速度。
Suno 在法律诉讼中为歌曲添加水印
Suno,这个允许用户生成由人工智能创作的音乐的平台,近日推出了新功能,包括为平台制作的曲目添加标签、限制下载,并更新社区标准以遏制未经授权的复制品。这些更新是在Suno面临多家唱片公司和艺术家组织提起的多起诉讼之际推出的。在博客文章中,联合创始人兼首席执行官Mikey Shulman概述了核心原则,强调该平台旨在促进原创创作,同时扩大更广泛受众对人工智能音乐工具的访问权限。一个主要的争议点在于,用户将人工智能生成的歌曲上传到其他流媒体服务并通过操纵系统获取收入。Suno表示,现在将采用音频
马斯克承认 Grok 构建过程中泄露了用户代码,并承诺清除所有历史数据
埃隆·马斯克直接回应了围绕 Grok Build 的隐私争议,首先以简单的“True”(属实)确认了该事件的有效性。他承诺,此前上传至 SpaceXAI 的所有用户数据将被永久删除,并表示“不留一个字节”。这是人工智能行业首次由主要科技领袖公开承认错误并主动删除用户数据。安全研究人员的“钓鱼”测试揭示了数据泄露的具体证据此次争议源于独立人工智能安全研究人员 @cereblab 的一份报告。SpaceXAI 推出的 AI 编程助手 Grok Build 在其官方网站上声称其“优先本地运行,代码
美国股市触及历史里程碑,人工智能与航空航天巨头准备开启万亿美元时代
埃隆·马斯克、山姆·阿尔特曼和达里奥·阿莫迪,这三位科技领域的巨头,正推动其各自的企业迈向首次公开募股(IPO)。随着 SpaceX、OpenAI 和 Anthropic——这三家估值接近万亿美元的行业巨头——即将上市,2026 年被预测将成为美国历史上新股发行规模最大的一年。这一历史性的资本激增已引起全球金融界的关注,成为检验公共市场吸收如此大规模资金能力的关键压力测试。这些主要融资活动的同步启动预计将打破 2021 年创下的 1560 亿美元纪录。超级独角兽的资本博弈每家公司上市的路径





首页






