具有能动性的人工智能扩展需要先进的记忆系统
具有代理行为的人工智能标志着从简单聊天机器人到管理复杂工作流的重大转变,而其扩展需要对记忆架构采取全新方法。
随着基础模型参数规模膨胀至万亿量级,上下文窗口扩展至数百万令牌,维持历史数据的计算成本正超越我们有效处理的能力。
部署这些系统的机构正面临瓶颈:海量"长期记忆"(技术上指键值缓存)已超出现有硬件设计承载能力。
现有基础设施仅提供有限选择:将推理上下文存储在稀缺的高带宽GPU内存(HBM)中,或迁移至速度较慢的通用存储器。前者对大型上下文而言成本过高,后者则引入延迟,导致实时智能体交互难以实现。
为弥合阻碍智能体AI扩展的日益扩大的鸿沟,英伟达在其Rubin架构中推出了推理上下文内存存储(ICMS)平台,引入专为满足AI内存临时高速需求而设计的新存储层。
"人工智能正在重塑整个计算体系——如今更将变革存储领域,"黄仁勋强调,"AI已从单一响应的聊天机器人进化为智能协作伙伴:它们能理解物理世界、进行长期推理、保持事实依据、运用工具完成实际任务,并兼具短期与长期记忆能力。"
核心运行问题源于基于Transformer的模型运作机制。为避免每次生成新词都需重新计算整个对话,模型会将历史状态保存至键值缓存。在智能体工作流中,该缓存作为跨工具和会话的持久化内存,其容量随序列长度呈线性增长。
这催生了独特的数据类别。不同于财务记录或客户日志,KV缓存属于衍生数据——它对即时性能至关重要,却无需企业级文件系统的强健持久性保障。基于标准CPU的通用存储系统,在元数据管理和数据复制上消耗的能源,对智能体工作负载毫无裨益。
从GPU HBM(G1)到共享存储(G4)的现有分层架构正日益显现低效:

(来源:NVIDIA) 当上下文数据从GPU(G1)迁移至系统内存(G2),最终存储于共享存储(G4)时,效率显著下降。将活跃上下文传输至G4层会引入毫秒级延迟,并推高每令牌能耗成本,导致昂贵的GPU在等待数据期间处于闲置状态。
对企业而言,这将导致总拥有成本(TCO)上升——能源消耗被基础设施开销而非实际推理任务所占据。
AI工厂的新型内存层级
行业解决方案是在该架构中添加定制层。ICMS平台创建了"G3.5"层——专为大规模推理设计的以太网连接闪存存储层。
该方案将存储直接集成至计算单元。通过采用NVIDIA BlueField-4数据处理器,平台将上下文数据管理从主机CPU转移至该层。系统为每个计算单元提供PB级共享容量,使智能体无需消耗昂贵的HBM即可存储海量历史数据,从而提升智能体AI的扩展能力。
其运行优势在吞吐量和能耗方面均有显著体现。通过将相关上下文数据存储于该中间层(其速度快于标准存储,成本却低于HBM),系统可提前将内存"预加载"至GPU。这大幅缩短了GPU解码器的空闲时间,使长上下文工作负载的每秒令牌处理量(TPS)提升高达5倍。
从能耗角度看,其效益同样显著。该架构消除了通用存储协议的开销,实现比传统方案高5倍的能效。
整合数据平面
部署该架构需要改变IT团队对存储网络的认知。ICMS平台依托NVIDIA Spectrum-X以太网技术,提供高带宽、低抖动的连接能力,使闪存存储几乎可视为本地内存。
对于企业基础设施团队,关键集成点在于编排层。NVIDIA Dynamo和推理传输库(NIXL)等框架负责处理不同层级间的KV块迁移。
这些工具协同存储层运作,确保在AI模型需要时将正确上下文精确加载至GPU内存(G1)或主机内存(G2)。NVIDIA DOCA框架通过提供将上下文缓存视为核心资源的KV通信层,进一步强化了这一机制。
领先存储厂商已开始采用该架构。包括AIC、Cloudian、DDN、戴尔科技、HPE、日立Vantara、IBM、Nutanix、Pure Storage、Supermicro、VAST Data和WEKA在内的企业正基于BlueField-4开发平台,相关解决方案预计将于今年下半年面世。
为可扩展智能代理AI重塑基础设施
采用专用上下文内存层将影响容量规划与数据中心设计。
- 数据重分类:首席信息官需将KV缓存视为独立数据类型。其特性为"临时性但延迟敏感",有别于"持久且冷存储"的合规数据。G3.5层管理前者,使持久性G4存储能专注于长期日志与工件。
- 编排成熟度:成功依赖于能智能分配工作负载的软件。该系统采用拓扑感知编排(通过NVIDIA Grove实现),将任务部署在缓存上下文附近,减少网络数据传输。
- 功率密度:通过在相同机架空间内集成更高可用容量,企业可延长现有设施使用寿命。但这将提升每平方米计算密度,需精心规划散热与配电方案。
向代理式人工智能的转型需要对数据中心进行物理重构。传统将计算与低速持久存储完全分离的做法,无法满足具备海量记忆的代理实时检索需求。
通过引入专用上下文层,企业可将模型内存增长与GPU HBM成本脱钩。这种代理式AI架构允许多个代理共享大型低功耗内存池,既降低了复杂查询的处理成本,又通过支持高吞吐量推理增强了扩展能力。
当企业筹备新一轮基础设施投资时,评估内存分层体系的效率将与选择GPU本身同等关键。
另请参阅:2025年AI芯片之战:企业领袖如何洞悉供应链真相

想向行业领袖学习AI与大数据知识?欢迎参加在阿姆斯特丹、加州和伦敦举办的AI & Big Data Expo。这场综合性盛会隶属TechEx系列,与其他顶尖科技活动同期举行。点击此处获取更多信息。
AI News由TechForge传媒提供支持。探索更多即将举办的企业技术活动与网络研讨会请点击此处。
相关文章
如何修复核心网页指标以获得更好的 SEO 排名
利用 AI 工具简化成绩单评语撰写引言用于生成成绩单评语的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成绩单评语登录 Magic School选择成绩单评语工具为学生定制评语使用 Almanac AI 生成成绩单评语设置课程与评分方案配置评语长度与学生信息使用 Almanac AI 生成评语比较 Magic School 与 Almanac AI设置的便捷性可定制性与课程内容的整合速度与效率使用
Slackbot 成为 AI 智能体
Slackbot,嵌入在Salesforce企业消息平台Slack中的自动化助手,正在演变为一个AI智能体。Salesforce首席技术官Parker Harris设想它将达到与OpenAI的ChatGPT相媲美的病毒式传播地位。这家云软件巨头于周二推出了更新版的Slackbot。该新版AI驱动版本面向Business+和Enterprise+客户,可直接在Slack内查找信息、起草电子邮件和安排会议。在获得适当权限的情况下,它还能与Microsoft Teams和Google Drive等企
字节跳动加大核心AI激励,豆包增长14.6%
字节跳动近日召开豆包股权说明会,公布面向豆包部门员工的最新激励政策。豆包股票的行权价已从2026年6月的14.85美元上调至17.02美元,涨幅约为14.6%。此次调整不仅提升了豆包股票的估值,还大幅扩大了其覆盖范围。根据员工岗位的不同,部分员工可能获得相当于其总薪酬约5%的豆包股票。根据新的兑换机制,字节跳动允许员工在整体薪酬包中,将部分现金工资兑换为豆包股权。兑换比例因职级而异,设有20%和30%等不同档位。例如,L2和L3级员工可选择20%的全覆盖兑换比例,而L3和L4级员工的该比例可
相关专题推荐
评论 (0)
0/500
具有代理行为的人工智能标志着从简单聊天机器人到管理复杂工作流的重大转变,而其扩展需要对记忆架构采取全新方法。
随着基础模型参数规模膨胀至万亿量级,上下文窗口扩展至数百万令牌,维持历史数据的计算成本正超越我们有效处理的能力。
部署这些系统的机构正面临瓶颈:海量"长期记忆"(技术上指键值缓存)已超出现有硬件设计承载能力。
现有基础设施仅提供有限选择:将推理上下文存储在稀缺的高带宽GPU内存(HBM)中,或迁移至速度较慢的通用存储器。前者对大型上下文而言成本过高,后者则引入延迟,导致实时智能体交互难以实现。
为弥合阻碍智能体AI扩展的日益扩大的鸿沟,英伟达在其Rubin架构中推出了推理上下文内存存储(ICMS)平台,引入专为满足AI内存临时高速需求而设计的新存储层。
"人工智能正在重塑整个计算体系——如今更将变革存储领域,"黄仁勋强调,"AI已从单一响应的聊天机器人进化为智能协作伙伴:它们能理解物理世界、进行长期推理、保持事实依据、运用工具完成实际任务,并兼具短期与长期记忆能力。"
核心运行问题源于基于Transformer的模型运作机制。为避免每次生成新词都需重新计算整个对话,模型会将历史状态保存至键值缓存。在智能体工作流中,该缓存作为跨工具和会话的持久化内存,其容量随序列长度呈线性增长。
这催生了独特的数据类别。不同于财务记录或客户日志,KV缓存属于衍生数据——它对即时性能至关重要,却无需企业级文件系统的强健持久性保障。基于标准CPU的通用存储系统,在元数据管理和数据复制上消耗的能源,对智能体工作负载毫无裨益。
从GPU HBM(G1)到共享存储(G4)的现有分层架构正日益显现低效:

当上下文数据从GPU(G1)迁移至系统内存(G2),最终存储于共享存储(G4)时,效率显著下降。将活跃上下文传输至G4层会引入毫秒级延迟,并推高每令牌能耗成本,导致昂贵的GPU在等待数据期间处于闲置状态。
对企业而言,这将导致总拥有成本(TCO)上升——能源消耗被基础设施开销而非实际推理任务所占据。
AI工厂的新型内存层级
行业解决方案是在该架构中添加定制层。ICMS平台创建了"G3.5"层——专为大规模推理设计的以太网连接闪存存储层。
该方案将存储直接集成至计算单元。通过采用NVIDIA BlueField-4数据处理器,平台将上下文数据管理从主机CPU转移至该层。系统为每个计算单元提供PB级共享容量,使智能体无需消耗昂贵的HBM即可存储海量历史数据,从而提升智能体AI的扩展能力。
其运行优势在吞吐量和能耗方面均有显著体现。通过将相关上下文数据存储于该中间层(其速度快于标准存储,成本却低于HBM),系统可提前将内存"预加载"至GPU。这大幅缩短了GPU解码器的空闲时间,使长上下文工作负载的每秒令牌处理量(TPS)提升高达5倍。
从能耗角度看,其效益同样显著。该架构消除了通用存储协议的开销,实现比传统方案高5倍的能效。
整合数据平面
部署该架构需要改变IT团队对存储网络的认知。ICMS平台依托NVIDIA Spectrum-X以太网技术,提供高带宽、低抖动的连接能力,使闪存存储几乎可视为本地内存。
对于企业基础设施团队,关键集成点在于编排层。NVIDIA Dynamo和推理传输库(NIXL)等框架负责处理不同层级间的KV块迁移。
这些工具协同存储层运作,确保在AI模型需要时将正确上下文精确加载至GPU内存(G1)或主机内存(G2)。NVIDIA DOCA框架通过提供将上下文缓存视为核心资源的KV通信层,进一步强化了这一机制。
领先存储厂商已开始采用该架构。包括AIC、Cloudian、DDN、戴尔科技、HPE、日立Vantara、IBM、Nutanix、Pure Storage、Supermicro、VAST Data和WEKA在内的企业正基于BlueField-4开发平台,相关解决方案预计将于今年下半年面世。
为可扩展智能代理AI重塑基础设施
采用专用上下文内存层将影响容量规划与数据中心设计。
- 数据重分类:首席信息官需将KV缓存视为独立数据类型。其特性为"临时性但延迟敏感",有别于"持久且冷存储"的合规数据。G3.5层管理前者,使持久性G4存储能专注于长期日志与工件。
- 编排成熟度:成功依赖于能智能分配工作负载的软件。该系统采用拓扑感知编排(通过NVIDIA Grove实现),将任务部署在缓存上下文附近,减少网络数据传输。
- 功率密度:通过在相同机架空间内集成更高可用容量,企业可延长现有设施使用寿命。但这将提升每平方米计算密度,需精心规划散热与配电方案。
向代理式人工智能的转型需要对数据中心进行物理重构。传统将计算与低速持久存储完全分离的做法,无法满足具备海量记忆的代理实时检索需求。
通过引入专用上下文层,企业可将模型内存增长与GPU HBM成本脱钩。这种代理式AI架构允许多个代理共享大型低功耗内存池,既降低了复杂查询的处理成本,又通过支持高吞吐量推理增强了扩展能力。
当企业筹备新一轮基础设施投资时,评估内存分层体系的效率将与选择GPU本身同等关键。
另请参阅:2025年AI芯片之战:企业领袖如何洞悉供应链真相

想向行业领袖学习AI与大数据知识?欢迎参加在阿姆斯特丹、加州和伦敦举办的AI & Big Data Expo。这场综合性盛会隶属TechEx系列,与其他顶尖科技活动同期举行。点击此处获取更多信息。
AI News由TechForge传媒提供支持。探索更多即将举办的企业技术活动与网络研讨会请点击此处。
如何修复核心网页指标以获得更好的 SEO 排名
利用 AI 工具简化成绩单评语撰写引言用于生成成绩单评语的 AI 工具Magic SchoolAlmanac AIChat GPT使用 Magic School 生成成绩单评语登录 Magic School选择成绩单评语工具为学生定制评语使用 Almanac AI 生成成绩单评语设置课程与评分方案配置评语长度与学生信息使用 Almanac AI 生成评语比较 Magic School 与 Almanac AI设置的便捷性可定制性与课程内容的整合速度与效率使用
Slackbot 成为 AI 智能体
Slackbot,嵌入在Salesforce企业消息平台Slack中的自动化助手,正在演变为一个AI智能体。Salesforce首席技术官Parker Harris设想它将达到与OpenAI的ChatGPT相媲美的病毒式传播地位。这家云软件巨头于周二推出了更新版的Slackbot。该新版AI驱动版本面向Business+和Enterprise+客户,可直接在Slack内查找信息、起草电子邮件和安排会议。在获得适当权限的情况下,它还能与Microsoft Teams和Google Drive等企
字节跳动加大核心AI激励,豆包增长14.6%
字节跳动近日召开豆包股权说明会,公布面向豆包部门员工的最新激励政策。豆包股票的行权价已从2026年6月的14.85美元上调至17.02美元,涨幅约为14.6%。此次调整不仅提升了豆包股票的估值,还大幅扩大了其覆盖范围。根据员工岗位的不同,部分员工可能获得相当于其总薪酬约5%的豆包股票。根据新的兑换机制,字节跳动允许员工在整体薪酬包中,将部分现金工资兑换为豆包股权。兑换比例因职级而异,设有20%和30%等不同档位。例如,L2和L3级员工可选择20%的全覆盖兑换比例,而L3和L4级员工的该比例可





首页






