具能動性的人工智慧擴展需要先進記憶體系統
代理型人工智慧標誌著從簡單聊天機器人到管理複雜工作流程的重大轉變,而其擴展需求迫使記憶體架構必須採用全新方法。
隨著基礎模型參數規模擴增至數兆量級,語境視窗延伸至數百萬個標記,保存歷史資料的運算成本已超越我們有效處理的能力。
實施這些系統的組織現正面臨瓶頸:龐大的「長期記憶」(技術上指鍵值對(KV)快取)已超越現行硬體設計的承載能力。
現有基礎設施僅提供有限選擇:將推論上下文儲存於稀缺的高頻寬GPU記憶體(HBM),或移轉至較慢的通用儲存裝置。前者對大型上下文而言成本過高,後者則引入延遲,使即時智能體互動難以實現。
為彌合阻礙智能體AI擴展的日益擴大差距,NVIDIA於Rubin架構中推出推論上下文記憶體儲存(ICMS)平台,專為AI記憶體的臨時高速需求打造全新儲存層級。
「人工智慧正在重塑整個運算架構——如今更延伸至儲存領域,」黃仁勳強調:「AI已從單一回應的聊天機器人進化為智能協作者,具備理解物理世界、進行長期推理、堅持事實依據、運用工具執行實務任務,以及維持短期與長期記憶的能力。」
核心運作問題源於變換器模型的工作原理。為避免每次生成新詞時重新計算整段對話,模型會將先前狀態儲存於鍵值快取中。在代理式工作流程中,此快取作為跨工具與會話的持久記憶體,其規模會隨序列長度呈線性增長。
這催生出獨特的數據類別。不同於財務紀錄或客戶日誌,鍵值對快取屬於衍生數據;它對即時效能至關重要,卻無需企業級檔案系統的強健持久性保障。運行於標準CPU的通用儲存系統,在元數據管理與複製上消耗的能源,對代理型工作負載並無助益。
現有從GPU HBM(G1)到共享儲存(G4)的層級架構正顯現日益低效的趨勢:

(資料來源:NVIDIA) 當上下文資料從GPU(G1)傳輸至系統記憶體(G2),最終存入共享儲存(G4)時,效率將大幅下降。將活躍上下文轉移至G4層級會產生毫秒級延遲,並提高每筆代幣的能耗成本,導致昂貴的GPU在等待資料期間閒置。
對企業而言,這將導致總擁有成本(TCO)攀升——能源消耗被基礎架構開銷而非實際推理任務所佔用。
為人工智慧工廠打造的新記憶體層級
業界解決方案是在此架構中新增自訂層級。ICMS平台創建了「G3.5」層級——專為大規模推論設計的乙太網路連接快閃儲存層。
此方法將儲存直接整合至運算模組。透過運用NVIDIA BlueField-4資料處理器,該平台將情境資料管理從主機CPU移出。系統每模組提供數百萬GB的共享容量,使代理能儲存龐大歷史資料而不消耗昂貴的HBM,從而強化代理式AI的擴展能力。
此運作優勢在吞吐量與能耗方面皆具量化效益。透過將相關上下文儲存於此中間層(其速度優於標準儲存裝置,成本卻低於HBM),系統能預先將記憶體「預載」至GPU。此舉大幅縮減GPU解碼器閒置時間,使長上下文工作負載的每秒處理令牌數(TPS)提升達5倍。
從能源角度觀之,效益同樣顯著。由於此架構消除了通用儲存協議的開銷,其能效較傳統方案提升五倍。
整合資料平面
部署此架構需改變IT團隊對儲存網路的認知。ICMS平台仰賴NVIDIA Spectrum-X乙太網路提供高頻寬、低抖動連線能力,使快閃儲存近乎等同於本地記憶體。
對企業基礎架構團隊而言,關鍵整合點在於編排層。NVIDIA Dynamo與推論傳輸函式庫(NIXL)等框架負責處理不同層級間的鍵值區塊(KV block)移動。
這些工具與儲存層協同運作,確保在AI模型需要時精準將正確的上下文載入GPU記憶體(G1)或主機記憶體(G2)。NVIDIA DOCA框架進一步透過提供將上下文快取視為主要資源的KV通訊層來強化此功能。
領先儲存供應商已開始採用此架構,包括AIC、Cloudian、DDN、戴爾科技、HPE、日立Vantara、IBM、Nutanix、Pure Storage、Supermicro、VAST Data及WEKA等企業,皆正開發搭載BlueField-4的解決方案,預計將於今年下半年問世。
為擴展智能代理人工智能重新定義基礎架構
採用專用上下文記憶層將影響容量規劃與資料中心設計。
- 數據重新分類:CIO必須將KV快取視為獨立數據類型。其屬「臨時性但延遲敏感」特性,有別於「持久且冷存取」的合規數據。G3.5層級管理前者,使持久性G4儲存專注於長期日誌與工件。
- 編排成熟度:成功關鍵在於具備智能工作負載調度的軟體。系統透過拓撲感知編排(採用NVIDIA Grove技術),將任務部署於其快取上下文附近,減少網路數據傳輸量。
- 功率密度:透過在相同機架空間內整合更高可用容量,組織可延長現有設施使用壽命。然而此舉將提升每平方公尺的運算密度,需審慎規劃散熱與配電方案。
邁向代理型人工智慧需重新設計資料中心實體架構。傳統將運算與低速持久儲存完全分離的做法,無法滿足具備龐大記憶體的代理程式對即時檢索的需求。
透過引入專用情境層,企業能將模型記憶體擴增需求與GPU HBM成本脫鉤。此代理式AI架構允許多個代理共享大型低功耗記憶體池,降低複雜查詢處理成本,並藉由支援高吞吐量推理提升擴展性。
當企業籌備新一輪基礎設施投資時,評估記憶體層級架構的效能將與選擇GPU本身同等關鍵。
另請參閱:2025年人工智慧晶片戰役:企業領袖如何洞悉供應鏈現實

想向業界領袖深入了解人工智慧與大數據?歡迎參與於阿姆斯特丹、加州及倫敦舉辦的「AI & Big Data Expo」。此綜合性活動隸屬TechEx系列,並與其他頂尖科技盛會同期舉行。點擊此處獲取更多資訊。
AI News由TechForge Media提供技術支援。探索其他即將舉辦的企業科技活動與線上研討會請點此。
相關文章
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代
埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work
Google 測試 Remy AI 代理,以 Gemini 為重點轉向使用者控制
根據《商業內幕》的報道,谷歌正在測試 Remy,這是 Gemini 的一款全新 AI 個人代理工具。該工具旨在代表使用者執行任務,從而簡化專業工作流程和日常事務。目前,Remy 正在 Gemini 應用的內部員工專屬版本中進行測試。該報告引用了一份內部檔案以及對兩位熟悉該專案的個人的採訪。內部資料將 Remy 描述為“全天候個人代理”,將 Gemini 定位為能夠代表使用者行事的主動助手。接近該專案的訊息人士證實,谷歌員工正在積極測試 Remy。谷歌發言人拒絕提供進一步評論。該報告未提及公開發布
相關專題推薦
評論 (0)
0/500
代理型人工智慧標誌著從簡單聊天機器人到管理複雜工作流程的重大轉變,而其擴展需求迫使記憶體架構必須採用全新方法。
隨著基礎模型參數規模擴增至數兆量級,語境視窗延伸至數百萬個標記,保存歷史資料的運算成本已超越我們有效處理的能力。
實施這些系統的組織現正面臨瓶頸:龐大的「長期記憶」(技術上指鍵值對(KV)快取)已超越現行硬體設計的承載能力。
現有基礎設施僅提供有限選擇:將推論上下文儲存於稀缺的高頻寬GPU記憶體(HBM),或移轉至較慢的通用儲存裝置。前者對大型上下文而言成本過高,後者則引入延遲,使即時智能體互動難以實現。
為彌合阻礙智能體AI擴展的日益擴大差距,NVIDIA於Rubin架構中推出推論上下文記憶體儲存(ICMS)平台,專為AI記憶體的臨時高速需求打造全新儲存層級。
「人工智慧正在重塑整個運算架構——如今更延伸至儲存領域,」黃仁勳強調:「AI已從單一回應的聊天機器人進化為智能協作者,具備理解物理世界、進行長期推理、堅持事實依據、運用工具執行實務任務,以及維持短期與長期記憶的能力。」
核心運作問題源於變換器模型的工作原理。為避免每次生成新詞時重新計算整段對話,模型會將先前狀態儲存於鍵值快取中。在代理式工作流程中,此快取作為跨工具與會話的持久記憶體,其規模會隨序列長度呈線性增長。
這催生出獨特的數據類別。不同於財務紀錄或客戶日誌,鍵值對快取屬於衍生數據;它對即時效能至關重要,卻無需企業級檔案系統的強健持久性保障。運行於標準CPU的通用儲存系統,在元數據管理與複製上消耗的能源,對代理型工作負載並無助益。
現有從GPU HBM(G1)到共享儲存(G4)的層級架構正顯現日益低效的趨勢:

當上下文資料從GPU(G1)傳輸至系統記憶體(G2),最終存入共享儲存(G4)時,效率將大幅下降。將活躍上下文轉移至G4層級會產生毫秒級延遲,並提高每筆代幣的能耗成本,導致昂貴的GPU在等待資料期間閒置。
對企業而言,這將導致總擁有成本(TCO)攀升——能源消耗被基礎架構開銷而非實際推理任務所佔用。
為人工智慧工廠打造的新記憶體層級
業界解決方案是在此架構中新增自訂層級。ICMS平台創建了「G3.5」層級——專為大規模推論設計的乙太網路連接快閃儲存層。
此方法將儲存直接整合至運算模組。透過運用NVIDIA BlueField-4資料處理器,該平台將情境資料管理從主機CPU移出。系統每模組提供數百萬GB的共享容量,使代理能儲存龐大歷史資料而不消耗昂貴的HBM,從而強化代理式AI的擴展能力。
此運作優勢在吞吐量與能耗方面皆具量化效益。透過將相關上下文儲存於此中間層(其速度優於標準儲存裝置,成本卻低於HBM),系統能預先將記憶體「預載」至GPU。此舉大幅縮減GPU解碼器閒置時間,使長上下文工作負載的每秒處理令牌數(TPS)提升達5倍。
從能源角度觀之,效益同樣顯著。由於此架構消除了通用儲存協議的開銷,其能效較傳統方案提升五倍。
整合資料平面
部署此架構需改變IT團隊對儲存網路的認知。ICMS平台仰賴NVIDIA Spectrum-X乙太網路提供高頻寬、低抖動連線能力,使快閃儲存近乎等同於本地記憶體。
對企業基礎架構團隊而言,關鍵整合點在於編排層。NVIDIA Dynamo與推論傳輸函式庫(NIXL)等框架負責處理不同層級間的鍵值區塊(KV block)移動。
這些工具與儲存層協同運作,確保在AI模型需要時精準將正確的上下文載入GPU記憶體(G1)或主機記憶體(G2)。NVIDIA DOCA框架進一步透過提供將上下文快取視為主要資源的KV通訊層來強化此功能。
領先儲存供應商已開始採用此架構,包括AIC、Cloudian、DDN、戴爾科技、HPE、日立Vantara、IBM、Nutanix、Pure Storage、Supermicro、VAST Data及WEKA等企業,皆正開發搭載BlueField-4的解決方案,預計將於今年下半年問世。
為擴展智能代理人工智能重新定義基礎架構
採用專用上下文記憶層將影響容量規劃與資料中心設計。
- 數據重新分類:CIO必須將KV快取視為獨立數據類型。其屬「臨時性但延遲敏感」特性,有別於「持久且冷存取」的合規數據。G3.5層級管理前者,使持久性G4儲存專注於長期日誌與工件。
- 編排成熟度:成功關鍵在於具備智能工作負載調度的軟體。系統透過拓撲感知編排(採用NVIDIA Grove技術),將任務部署於其快取上下文附近,減少網路數據傳輸量。
- 功率密度:透過在相同機架空間內整合更高可用容量,組織可延長現有設施使用壽命。然而此舉將提升每平方公尺的運算密度,需審慎規劃散熱與配電方案。
邁向代理型人工智慧需重新設計資料中心實體架構。傳統將運算與低速持久儲存完全分離的做法,無法滿足具備龐大記憶體的代理程式對即時檢索的需求。
透過引入專用情境層,企業能將模型記憶體擴增需求與GPU HBM成本脫鉤。此代理式AI架構允許多個代理共享大型低功耗記憶體池,降低複雜查詢處理成本,並藉由支援高吞吐量推理提升擴展性。
當企業籌備新一輪基礎設施投資時,評估記憶體層級架構的效能將與選擇GPU本身同等關鍵。
另請參閱:2025年人工智慧晶片戰役:企業領袖如何洞悉供應鏈現實

想向業界領袖深入了解人工智慧與大數據?歡迎參與於阿姆斯特丹、加州及倫敦舉辦的「AI & Big Data Expo」。此綜合性活動隸屬TechEx系列,並與其他頂尖科技盛會同期舉行。點擊此處獲取更多資訊。
AI News由TechForge Media提供技術支援。探索其他即將舉辦的企業科技活動與線上研討會請點此。
美國股市觸及歷史裡程碑,人工智慧與航空航天巨頭準備開啟萬億美元時代
埃隆·馬斯克、山姆·阿爾特曼和達里奧·阿莫迪,這三位科技領域的巨頭,正推動其各自的企業邁向首次公開募股(IPO)。隨著 SpaceX、OpenAI 和 Anthropic——這三家估值接近萬億美元的行業巨頭——即將上市,2026 年被預測將成為美國曆史上新股發行規模最大的一年。這一歷史性的資本激增已引起全球金融界的關注,成為檢驗公共市場吸收如此大規模資金能力的關鍵壓力測試。這些主要融資活動的同步啟動預計將打破 2021 年創下的 1560 億美元紀錄。超級獨角獸的資本博弈每家公司上市的路徑
瑞典人工智慧初創公司Lovable Eyes在完成主要融資輪後估值達132億美元
隨著人工智慧驅動的編碼工具日益普及,瑞典初創公司 Lovable 已獲一輪重大融資。該公司計劃籌集 30 億美元,其估值有望升至 132 億美元——這是去年 12 月記錄的 66 億美元的兩倍。預計 Menlo Ventures 將主導此次投資。Lovable 的吸引力源於其核心的“氛圍編碼”(vibe coding)技術,該技術透過消除對複雜編碼技能的需求來簡化軟體開發。使用者只需以自然語言描述其需求,系統即可自動生成應用程式。這種直觀的方法吸引了個人開發者、設計師和小企業,並擴充套件至 Work





首頁






