행동형 인공지능 확장은 고급 메모리 시스템을 요구한다
행위적 AI는 단순한 챗봇에서 복잡한 워크플로우 관리로의 중대한 전환을 의미하며, 이를 확장하려면 메모리 아키텍처에 대한 새로운 접근 방식이 필요하다.
파운데이션 모델이 수조 개의 매개변수로 성장하고 컨텍스트 윈도우가 수백만 토큰으로 확장됨에 따라, 이력을 유지하는 데 드는 계산 비용이 이를 효과적으로 처리하는 우리의 능력을 앞지르고 있습니다.
이러한 시스템을 구현하는 조직들은 현재 '장기 기억'(기술적으로는 키-값(KV) 캐시)의 방대한 양이 현재 하드웨어 설계의 능력을 초과하는 병목 현상에 직면하고 있습니다.
기존 인프라가 제공하는 선택지는 제한적입니다: 추론 컨텍스트를 고대역폭 GPU 메모리(HBM)에 저장하거나, 속도가 느린 범용 스토리지로 이동하는 것뿐입니다. 첫 번째 옵션은 대규모 컨텍스트에 비용이 너무 많이 들고, 두 번째 옵션은 실시간 에이전트 상호작용을 불가능하게 만드는 지연 시간을 유발합니다.
이러한 에이전트형 AI 확장을 저해하는 격차를 해소하기 위해 NVIDIA는 루빈(Rubin) 아키텍처 내 추론 컨텍스트 메모리 스토리지(ICMS) 플랫폼을 출시했습니다. 이는 AI 메모리의 일시적 고속 요구에 특화된 새로운 스토리지 계층을 도입한 것입니다.
황 옌밍은 "AI는 컴퓨팅 스택 전체를 변화시키고 있으며, 이제 스토리지까지 변혁 중"이라며 "AI는 단일 응답 챗봇을 넘어 물리적 세계를 이해하고, 장기간에 걸쳐 추론하며, 사실에 기반을 두고, 실용적 작업을 위한 도구를 활용하며, 단기 및 장기 기억을 모두 유지하는 지능형 협력자로 진화했다"고 설명했습니다.
핵심 운영 문제는 트랜스포머 기반 모델의 작동 방식에서 비롯됩니다. 생성되는 새 단어마다 전체 대화를 재계산하지 않기 위해 모델은 이전 상태를 KV 캐시에 저장합니다. 에이전트형 워크플로우에서 이 캐시는 도구와 세션 간 지속적 메모리 역할을 하며, 시퀀스 길이에 비례해 확장됩니다.
이는 독특한 데이터 범주를 생성합니다. 재무 기록이나 고객 로그와 달리 KV 캐시는 파생 데이터입니다. 즉각적인 성능에는 필수적이지만, 기업용 파일 시스템의 강력한 내구성 보증은 필요하지 않습니다. 표준 CPU에서 실행되는 범용 스토리지 시스템은 에이전트 워크로드에 도움이 되지 않는 메타데이터 관리 및 복제에 에너지를 소모합니다.
GPU HBM(G1)부터 공유 스토리지(G4)에 이르는 기존 계층 구조는 점점 더 비효율적인 것으로 입증되고 있습니다:

(출처: NVIDIA) 컨텍스트 데이터가 GPU(G1)에서 시스템 RAM(G2)을 거쳐 공유 스토리지(G4)로 이동함에 따라 효율성이 크게 저하됩니다. 활성 컨텍스트를 G4 계층으로 전송하면 밀리초 수준의 지연이 발생하고 토큰당 에너지 비용이 증가하여, 데이터 대기 중 고가의 GPU가 유휴 상태로 남게 됩니다.
기업에게는 이는 총소유비용(TCO) 증가로 이어지며, 활성 추론 작업 대신 인프라 오버헤드에 전력이 소모됩니다.
AI 팩토리를 위한 새로운 메모리 계층
업계의 해결책은 이 계층 구조에 맞춤형 레이어를 추가하는 것입니다. ICMS 플랫폼은 대규모 추론을 위해 특별히 설계된 이더넷 연결 플래시 스토리지 레이어인 "G3.5" 계층을 생성합니다.
이 방식은 스토리지를 컴퓨팅 포드에 직접 통합합니다. NVIDIA BlueField-4 데이터 프로세서를 활용하여 플랫폼은 이 컨텍스트 데이터 관리를 호스트 CPU에서 분리합니다. 시스템은 포드당 페타바이트 단위의 공유 용량을 제공하여, 에이전트가 고가의 HBM을 소비하지 않고도 방대한 양의 이력을 보유할 수 있도록 함으로써 에이전트형 AI 확장성을 향상시킵니다.
운영상의 이점은 처리량과 에너지 사용량 모두에서 측정 가능합니다. 표준 스토리지보다 빠르지만 HBM보다 저렴한 이 중간 계층에 관련 컨텍스트를 저장함으로써 시스템은 사전에 메모리를 GPU로 "사전 로드"할 수 있습니다. 이는 GPU 디코더의 유휴 시간을 줄여 긴 컨텍스트 워크로드에서 초당 처리 토큰(TPS)을 최대 5배까지 향상시킵니다.
에너지 측면에서도 이점은 마찬가지로 중요합니다. 이 아키텍처는 범용 스토리지 프로토콜의 오버헤드를 제거함으로써 기존 방식보다 5배 더 나은 전력 효율을 달성합니다.
데이터 플레인 통합
이 아키텍처 배포에는 IT 팀의 스토리지 네트워킹 인식 전환이 필요합니다. ICMS 플랫폼은 NVIDIA Spectrum-X 이더넷을 기반으로 플래시 스토리지를 로컬 메모리처럼 활용하는 데 필요한 고대역폭·저지터 연결성을 제공합니다.
엔터프라이즈 인프라 팀에게 핵심 통합 지점은 오케스트레이션 계층입니다. NVIDIA Dynamo 및 추론 전송 라이브러리(NIXL)와 같은 프레임워크는 서로 다른 계층 간에 KV 블록의 이동을 처리합니다.
이러한 도구는 스토리지 계층과 협력하여 AI 모델이 필요로 할 때 정확히 GPU 메모리(G1) 또는 호스트 메모리(G2)에 올바른 컨텍스트가 로드되도록 보장합니다. NVIDIA DOCA 프레임워크는 컨텍스트 캐시를 주요 리소스로 취급하는 KV 통신 계층을 제공함으로써 이를 더욱 지원합니다.
선도적인 스토리지 벤더들은 이미 이 아키텍처를 채택하고 있습니다. AIC, Cloudian, DDN, Dell Technologies, HPE, Hitachi Vantara, IBM, Nutanix, Pure Storage, Supermicro, VAST Data, WEKA 등의 기업들은 BlueField-4를 탑재한 플랫폼을 개발 중입니다. 이러한 솔루션들은 올해 하반기 출시될 예정입니다.
에이전트형 AI 확장을 위한 인프라 재정의
전용 컨텍스트 메모리 계층 도입은 용량 계획 및 데이터센터 설계에 영향을 미칩니다.
- 데이터 재분류: CIO는 KV 캐시를 별개의 데이터 유형으로 인식해야 합니다. 이는 "내구성이 있지만 차가운" 규정 준수 데이터와 달리 "일시적이지만 지연 시간에 민감한" 특성을 가집니다. G3.5 계층은 전자를 관리하여 내구성 있는 G4 스토리지가 장기 로그 및 아티팩트에 집중할 수 있도록 합니다.
- 오케스트레이션 성숙도: 성공은 워크로드를 지능적으로 할당할 수 있는 소프트웨어에 달려 있습니다. 이 시스템은 토폴로지 인식 오케스트레이션(NVIDIA Grove를 통해)을 사용하여 작업을 캐시된 컨텍스트 근처에 배치함으로써 네트워크를 통한 데이터 이동을 줄입니다.
- 전력 밀도: 동일한 랙 공간에 더 많은 사용 가능 용량을 집적함으로써 조직은 기존 시설의 수명을 연장할 수 있습니다. 그러나 이는 평방미터당 컴퓨팅 밀도를 증가시켜 냉각 및 전력 분배에 대한 신중한 계획이 필요합니다.
에이전트형 AI로의 전환은 데이터 센터의 물리적 재설계를 요구합니다. 컴퓨팅을 느리고 지속적인 스토리지로부터 완전히 분리하는 일반적인 관행은 방대한 메모리를 가진 에이전트의 실시간 검색 요구사항에 부적합합니다.
전용 컨텍스트 계층을 도입함으로써 기업은 모델 메모리 증가와 GPU HBM 비용을 분리할 수 있습니다. 이 에이전트형 AI 아키텍처는 다중 에이전트가 대용량 저전력 메모리 풀을 공유하도록 하여 복잡한 쿼리 처리 비용을 낮추고, 고처리량 추론을 지원함으로써 확장성을 향상시킵니다.
조직이 차기 인프라 투자를 준비함에 있어 메모리 계층 구조의 효율성 평가가 GPU 자체 선택만큼 중요해질 것입니다.
관련 기사: 2025년 AI 칩 전쟁: 기업 리더들이 공급망 현실에서 배운 교훈

업계 리더로부터 AI와 빅데이터에 대해 더 알아보고 싶으신가요? 암스테르담, 캘리포니아, 런던에서 열리는 AI & Big Data Expo를 확인해 보세요. 이 포괄적인 행사는 TechEx의 일부로, 다른 주요 기술 행사와 동시 개최됩니다. 자세한 정보는 여기를 클릭하세요.
AI 뉴스는 TechForge Media에서 제공합니다. 예정된 기업 기술 행사 및 웨비나를 여기서 확인하세요.
관련 기사
Slackbot이 AI 에이전트가 됩니다
Salesforce의 기업용 메시징 플랫폼인 Slack에 내장된 자동 비서 Slackbot이 AI 에이전트로 진화하고 있습니다. Salesforce의 CTO인 Parker Harris는 이것이 OpenAI의 ChatGPT에 버금가는 바이럴 현상을 달성할 것으로 전망합니다.클라우드 소프트웨어 거대 기업인 Salesforce는 화요일 업데이트된 Slackbot을 출시했습니다. Business+ 및 Enterprise+ 고객에게 제공되는 이 새로운
ByteDance, Doubao 14.6% 급증에 핵심 AI 인센티브 강화
ByteDance는 최근 DouBao 지주 설명회를 소집하여 DouBao 부서에 종사하는 직원들을 위한 새로운 인센티브 정책을 공개했다. DouBao 주식의 행사가액은 2026년 6월의 14.85달러에서 17.02달러로 인상되었으며, 이는 약 14.6%의 증가를 의미한다.이번 개정은 DouBao 주식의 가치를 높일 뿐만 아니라 그 분배 범위를 크게 확대한다. 개인의 역할에 따라 일부 직원은 총 보상액의 약 5%에 해당하는 DouBao 주식을
MiniMax, 전 세계 AI 전문가들을 장려하기 위해 10배 팀 프로그램을 공개합니다
MiniMax(시위 테크놀로지)의 범용 인공지능 연구소는 글로벌 인재 협력 프로그램인 '10x 팀'을 공식적으로 출시했습니다. 이 프로그램은 다양한 산업 분야의 최고 전문가들을 모집하여 대형 모델의 전문 수직 분야에 대한 심층적인 응용을 탐구하는 것을 목표로 합니다. 심층적인 산업 지식과 최첨단 AI를 통합함으로써 MiniMax는 대형 모델의 생산성을 일반적인 사용에서 전문적인 시나리오로 확장하여 궁극적으로 산업 효율성의 '10배 증가'를 주도
관련 특별 주제 추천
의견 (0)
0/500
행위적 AI는 단순한 챗봇에서 복잡한 워크플로우 관리로의 중대한 전환을 의미하며, 이를 확장하려면 메모리 아키텍처에 대한 새로운 접근 방식이 필요하다.
파운데이션 모델이 수조 개의 매개변수로 성장하고 컨텍스트 윈도우가 수백만 토큰으로 확장됨에 따라, 이력을 유지하는 데 드는 계산 비용이 이를 효과적으로 처리하는 우리의 능력을 앞지르고 있습니다.
이러한 시스템을 구현하는 조직들은 현재 '장기 기억'(기술적으로는 키-값(KV) 캐시)의 방대한 양이 현재 하드웨어 설계의 능력을 초과하는 병목 현상에 직면하고 있습니다.
기존 인프라가 제공하는 선택지는 제한적입니다: 추론 컨텍스트를 고대역폭 GPU 메모리(HBM)에 저장하거나, 속도가 느린 범용 스토리지로 이동하는 것뿐입니다. 첫 번째 옵션은 대규모 컨텍스트에 비용이 너무 많이 들고, 두 번째 옵션은 실시간 에이전트 상호작용을 불가능하게 만드는 지연 시간을 유발합니다.
이러한 에이전트형 AI 확장을 저해하는 격차를 해소하기 위해 NVIDIA는 루빈(Rubin) 아키텍처 내 추론 컨텍스트 메모리 스토리지(ICMS) 플랫폼을 출시했습니다. 이는 AI 메모리의 일시적 고속 요구에 특화된 새로운 스토리지 계층을 도입한 것입니다.
황 옌밍은 "AI는 컴퓨팅 스택 전체를 변화시키고 있으며, 이제 스토리지까지 변혁 중"이라며 "AI는 단일 응답 챗봇을 넘어 물리적 세계를 이해하고, 장기간에 걸쳐 추론하며, 사실에 기반을 두고, 실용적 작업을 위한 도구를 활용하며, 단기 및 장기 기억을 모두 유지하는 지능형 협력자로 진화했다"고 설명했습니다.
핵심 운영 문제는 트랜스포머 기반 모델의 작동 방식에서 비롯됩니다. 생성되는 새 단어마다 전체 대화를 재계산하지 않기 위해 모델은 이전 상태를 KV 캐시에 저장합니다. 에이전트형 워크플로우에서 이 캐시는 도구와 세션 간 지속적 메모리 역할을 하며, 시퀀스 길이에 비례해 확장됩니다.
이는 독특한 데이터 범주를 생성합니다. 재무 기록이나 고객 로그와 달리 KV 캐시는 파생 데이터입니다. 즉각적인 성능에는 필수적이지만, 기업용 파일 시스템의 강력한 내구성 보증은 필요하지 않습니다. 표준 CPU에서 실행되는 범용 스토리지 시스템은 에이전트 워크로드에 도움이 되지 않는 메타데이터 관리 및 복제에 에너지를 소모합니다.
GPU HBM(G1)부터 공유 스토리지(G4)에 이르는 기존 계층 구조는 점점 더 비효율적인 것으로 입증되고 있습니다:

컨텍스트 데이터가 GPU(G1)에서 시스템 RAM(G2)을 거쳐 공유 스토리지(G4)로 이동함에 따라 효율성이 크게 저하됩니다. 활성 컨텍스트를 G4 계층으로 전송하면 밀리초 수준의 지연이 발생하고 토큰당 에너지 비용이 증가하여, 데이터 대기 중 고가의 GPU가 유휴 상태로 남게 됩니다.
기업에게는 이는 총소유비용(TCO) 증가로 이어지며, 활성 추론 작업 대신 인프라 오버헤드에 전력이 소모됩니다.
AI 팩토리를 위한 새로운 메모리 계층
업계의 해결책은 이 계층 구조에 맞춤형 레이어를 추가하는 것입니다. ICMS 플랫폼은 대규모 추론을 위해 특별히 설계된 이더넷 연결 플래시 스토리지 레이어인 "G3.5" 계층을 생성합니다.
이 방식은 스토리지를 컴퓨팅 포드에 직접 통합합니다. NVIDIA BlueField-4 데이터 프로세서를 활용하여 플랫폼은 이 컨텍스트 데이터 관리를 호스트 CPU에서 분리합니다. 시스템은 포드당 페타바이트 단위의 공유 용량을 제공하여, 에이전트가 고가의 HBM을 소비하지 않고도 방대한 양의 이력을 보유할 수 있도록 함으로써 에이전트형 AI 확장성을 향상시킵니다.
운영상의 이점은 처리량과 에너지 사용량 모두에서 측정 가능합니다. 표준 스토리지보다 빠르지만 HBM보다 저렴한 이 중간 계층에 관련 컨텍스트를 저장함으로써 시스템은 사전에 메모리를 GPU로 "사전 로드"할 수 있습니다. 이는 GPU 디코더의 유휴 시간을 줄여 긴 컨텍스트 워크로드에서 초당 처리 토큰(TPS)을 최대 5배까지 향상시킵니다.
에너지 측면에서도 이점은 마찬가지로 중요합니다. 이 아키텍처는 범용 스토리지 프로토콜의 오버헤드를 제거함으로써 기존 방식보다 5배 더 나은 전력 효율을 달성합니다.
데이터 플레인 통합
이 아키텍처 배포에는 IT 팀의 스토리지 네트워킹 인식 전환이 필요합니다. ICMS 플랫폼은 NVIDIA Spectrum-X 이더넷을 기반으로 플래시 스토리지를 로컬 메모리처럼 활용하는 데 필요한 고대역폭·저지터 연결성을 제공합니다.
엔터프라이즈 인프라 팀에게 핵심 통합 지점은 오케스트레이션 계층입니다. NVIDIA Dynamo 및 추론 전송 라이브러리(NIXL)와 같은 프레임워크는 서로 다른 계층 간에 KV 블록의 이동을 처리합니다.
이러한 도구는 스토리지 계층과 협력하여 AI 모델이 필요로 할 때 정확히 GPU 메모리(G1) 또는 호스트 메모리(G2)에 올바른 컨텍스트가 로드되도록 보장합니다. NVIDIA DOCA 프레임워크는 컨텍스트 캐시를 주요 리소스로 취급하는 KV 통신 계층을 제공함으로써 이를 더욱 지원합니다.
선도적인 스토리지 벤더들은 이미 이 아키텍처를 채택하고 있습니다. AIC, Cloudian, DDN, Dell Technologies, HPE, Hitachi Vantara, IBM, Nutanix, Pure Storage, Supermicro, VAST Data, WEKA 등의 기업들은 BlueField-4를 탑재한 플랫폼을 개발 중입니다. 이러한 솔루션들은 올해 하반기 출시될 예정입니다.
에이전트형 AI 확장을 위한 인프라 재정의
전용 컨텍스트 메모리 계층 도입은 용량 계획 및 데이터센터 설계에 영향을 미칩니다.
- 데이터 재분류: CIO는 KV 캐시를 별개의 데이터 유형으로 인식해야 합니다. 이는 "내구성이 있지만 차가운" 규정 준수 데이터와 달리 "일시적이지만 지연 시간에 민감한" 특성을 가집니다. G3.5 계층은 전자를 관리하여 내구성 있는 G4 스토리지가 장기 로그 및 아티팩트에 집중할 수 있도록 합니다.
- 오케스트레이션 성숙도: 성공은 워크로드를 지능적으로 할당할 수 있는 소프트웨어에 달려 있습니다. 이 시스템은 토폴로지 인식 오케스트레이션(NVIDIA Grove를 통해)을 사용하여 작업을 캐시된 컨텍스트 근처에 배치함으로써 네트워크를 통한 데이터 이동을 줄입니다.
- 전력 밀도: 동일한 랙 공간에 더 많은 사용 가능 용량을 집적함으로써 조직은 기존 시설의 수명을 연장할 수 있습니다. 그러나 이는 평방미터당 컴퓨팅 밀도를 증가시켜 냉각 및 전력 분배에 대한 신중한 계획이 필요합니다.
에이전트형 AI로의 전환은 데이터 센터의 물리적 재설계를 요구합니다. 컴퓨팅을 느리고 지속적인 스토리지로부터 완전히 분리하는 일반적인 관행은 방대한 메모리를 가진 에이전트의 실시간 검색 요구사항에 부적합합니다.
전용 컨텍스트 계층을 도입함으로써 기업은 모델 메모리 증가와 GPU HBM 비용을 분리할 수 있습니다. 이 에이전트형 AI 아키텍처는 다중 에이전트가 대용량 저전력 메모리 풀을 공유하도록 하여 복잡한 쿼리 처리 비용을 낮추고, 고처리량 추론을 지원함으로써 확장성을 향상시킵니다.
조직이 차기 인프라 투자를 준비함에 있어 메모리 계층 구조의 효율성 평가가 GPU 자체 선택만큼 중요해질 것입니다.
관련 기사: 2025년 AI 칩 전쟁: 기업 리더들이 공급망 현실에서 배운 교훈

업계 리더로부터 AI와 빅데이터에 대해 더 알아보고 싶으신가요? 암스테르담, 캘리포니아, 런던에서 열리는 AI & Big Data Expo를 확인해 보세요. 이 포괄적인 행사는 TechEx의 일부로, 다른 주요 기술 행사와 동시 개최됩니다. 자세한 정보는 여기를 클릭하세요.
AI 뉴스는 TechForge Media에서 제공합니다. 예정된 기업 기술 행사 및 웨비나를 여기서 확인하세요.
Slackbot이 AI 에이전트가 됩니다
Salesforce의 기업용 메시징 플랫폼인 Slack에 내장된 자동 비서 Slackbot이 AI 에이전트로 진화하고 있습니다. Salesforce의 CTO인 Parker Harris는 이것이 OpenAI의 ChatGPT에 버금가는 바이럴 현상을 달성할 것으로 전망합니다.클라우드 소프트웨어 거대 기업인 Salesforce는 화요일 업데이트된 Slackbot을 출시했습니다. Business+ 및 Enterprise+ 고객에게 제공되는 이 새로운
ByteDance, Doubao 14.6% 급증에 핵심 AI 인센티브 강화
ByteDance는 최근 DouBao 지주 설명회를 소집하여 DouBao 부서에 종사하는 직원들을 위한 새로운 인센티브 정책을 공개했다. DouBao 주식의 행사가액은 2026년 6월의 14.85달러에서 17.02달러로 인상되었으며, 이는 약 14.6%의 증가를 의미한다.이번 개정은 DouBao 주식의 가치를 높일 뿐만 아니라 그 분배 범위를 크게 확대한다. 개인의 역할에 따라 일부 직원은 총 보상액의 약 5%에 해당하는 DouBao 주식을
MiniMax, 전 세계 AI 전문가들을 장려하기 위해 10배 팀 프로그램을 공개합니다
MiniMax(시위 테크놀로지)의 범용 인공지능 연구소는 글로벌 인재 협력 프로그램인 '10x 팀'을 공식적으로 출시했습니다. 이 프로그램은 다양한 산업 분야의 최고 전문가들을 모집하여 대형 모델의 전문 수직 분야에 대한 심층적인 응용을 탐구하는 것을 목표로 합니다. 심층적인 산업 지식과 최첨단 AI를 통합함으로써 MiniMax는 대형 모델의 생산성을 일반적인 사용에서 전문적인 시나리오로 확장하여 궁극적으로 산업 효율성의 '10배 증가'를 주도





집






