26-1 엔비디아 ICMS 플랫폼 발표
작성자의 핵심 판단
작성자는 ICMS가 추론의 토큰 생성량과 전력 효율을 높이는 방향이며, 메모리·스토리지가 추론의 핵심 요소가 됐음을 보여준다고 평가한다.
근거 보기 2
- 원문 구간 1
SSD를 GPU와 직접 연결된 수준으로 인프라를 짠 것입니다. 이를 통해 2H26에 배포되기 시작할 VR200 NVL72부터는 각 GPU당 추가로 16TB의 Context Memory를 얻게 되는 효과이며, 지연시간에 영향을 많이 받는 KV Cache의 상당부분이 이제는 ICMS에서 제공될 것이므로 토큰 생성량이나 전력 효율이 더 좋아집니다. 모델을 만드는 AI Labs들이 다양한 방법으로 KV Cache 부하를 줄이려는 것처럼, 엔비디아는 하드웨어-소프트웨어-네트워킹 기술을 통해서 AI Labs들이 시간당 더 많은 토큰을 생산할 수 있도록 지원하는 중입니다. 시간당 더 많은 토큰을 생성한다는 것을 바꿔서 말하면 토큰당 비용이 낮아지는 것입니다. AI Labs도 메모리를 더 많이 써서 추론 비용 낮추려는 방향 오픈AI, 앤트로픽, 구글이 주요 연구에 대해서는 외부로 잘 공개하지 않기 때문에 DeepSeek의 논문을 통해서 현재 업계가 어디로 가고 있는지를 느낄 수 있습니다. DeepSeek가 1월 12일 <Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models>라는 논문을 발표했습니다.
- 원문 구간 2
Agentic AI → DRAM과 SSD 수요를 높게 유지시킬 트렌드 기술이나 방식은 다르지만 공통적으로 성능과 비용 개선의 방향을 GPU와 HBM에만 집중시키는 것이 아니라, 메모리/스토리지 계층에서도 기여할 수 있게 바꾸는 과정입니다. 이제부터는 단순히 메모리를 붙이는 구조가 아니라 추론의 Inner Loop 내에서 핵심 요소가 됐음을 느낄 수 있던 자료였습니다. Agentic AI가 채택되는 과정에서 엔비디아의 Rubin CPX, Spectrum-X, BlueField DPU의 중요도도 높아지고, 컨텍스트 윈도우를 키우면서 DRAM과 SSD 사용량이 크게 증가할 것으로 예상합니다. 메모리 실제 수요와 가격 추이 공급자 주도 시장, 가격 인상과 쇼티지 국면 쇼티지 국면 공급자 주도 국면이 유지되고 있습니다. 미국 하이퍼스케일러 수요도 다 채워지지 않고 있습니다. 2025년 미국 하이퍼스케일러향 DRAM 수요 충족률은 ~70%였고, 마이크론은 4Q25 실적발표에서 중기적으로 주요 고객들의 수요 충족률이 50~75%일 것으로 예상했으며, 모건스탠리의 1월 6일 대만 공급망 체크 결과 미국 하이퍼스케일러들의 SSD 수요 충족률은 아직 40%에 불과합니다.
이 자료에서 다룬 사실
NVIDIA ICMS는 SSD를 GPU와 직접 연결된 수준으로 구성해 KV Cache의 상당 부분을 제공하는 인프라로 소개됐다. 원문은 VR200 NVL72부터 GPU당 추가 16TB Context Memory 효과와 2H26 배포 계획을 적었다.
근거 보기 2
- 원문 구간 1
텍스트를 넘어 이미지와 비디오 생성 등 멀티모달을 다루고, 모델이 사용자와 상호작용했던 더 많은 것들을 기억하고, 외부 지식을 가져다 쓰고, 도구를 사용하고, 모델의 크기가 커지고, 컨텍스트 윈도우가 커짐에 따라 칩의 연산 속도를 넘어서 각 프로세서에 데이터를 얼마나 더 빠르게 가져올 수 있는가가 점점 더 중요해지는 중입니다. 메모리로 추론 병목을 없애자 KV Cache 부담을 줄이려는 Dynamo/NIXL, ICMS, Engram 메모리 병목을 줄여라! 엔비디아는 추론 프레임워크인 NVIDIA Dynamo, 추론용 라이브러리인 NIXL(NVIDIA Inference Transfer Library)를 통해서 추론 워크로드를 중단하지 않으면서도 KV Cache를 GPU 메모리에서 → CPU 메모리/로컬 스토리지/외부 스토리지 간에 매우 빠르게 전송하도록 발전시켜왔습니다. GPU에 있는 메모리는 매우 제한적이고 비싸니, 상대적으로 용량이 더 크고 비용 효율적인 스토리지로 KV Cache를 쓰는 길이었습니다. 여기에서 더 나아간 방향이 NVIDIA ICMS 이런 방향에서 더 나아간 것이 <메모리 최근 컨콜 총정리 : HBM을 넘어 eSSD/HDD까지, 메모리 판이 바뀌다>에서 다시금 정리드렸던 NVIDIA ICMS입니다.
- 원문 구간 2
SSD를 GPU와 직접 연결된 수준으로 인프라를 짠 것입니다. 이를 통해 2H26에 배포되기 시작할 VR200 NVL72부터는 각 GPU당 추가로 16TB의 Context Memory를 얻게 되는 효과이며, 지연시간에 영향을 많이 받는 KV Cache의 상당부분이 이제는 ICMS에서 제공될 것이므로 토큰 생성량이나 전력 효율이 더 좋아집니다. 모델을 만드는 AI Labs들이 다양한 방법으로 KV Cache 부하를 줄이려는 것처럼, 엔비디아는 하드웨어-소프트웨어-네트워킹 기술을 통해서 AI Labs들이 시간당 더 많은 토큰을 생산할 수 있도록 지원하는 중입니다. 시간당 더 많은 토큰을 생성한다는 것을 바꿔서 말하면 토큰당 비용이 낮아지는 것입니다. AI Labs도 메모리를 더 많이 써서 추론 비용 낮추려는 방향 오픈AI, 앤트로픽, 구글이 주요 연구에 대해서는 외부로 잘 공개하지 않기 때문에 DeepSeek의 논문을 통해서 현재 업계가 어디로 가고 있는지를 느낄 수 있습니다. DeepSeek가 1월 12일 <Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models>라는 논문을 발표했습니다.
그렇게 판단한 이유
GPU 메모리는 제한적이고 비싸므로 Dynamo·NIXL은 KV Cache를 CPU 메모리·로컬·외부 스토리지로 빠르게 옮기고, ICMS는 SSD까지 활용해 지연시간에 민감한 Cache 부담을 처리한다는 연결을 들었다.
근거 보기 2
- 원문 구간 1
텍스트를 넘어 이미지와 비디오 생성 등 멀티모달을 다루고, 모델이 사용자와 상호작용했던 더 많은 것들을 기억하고, 외부 지식을 가져다 쓰고, 도구를 사용하고, 모델의 크기가 커지고, 컨텍스트 윈도우가 커짐에 따라 칩의 연산 속도를 넘어서 각 프로세서에 데이터를 얼마나 더 빠르게 가져올 수 있는가가 점점 더 중요해지는 중입니다. 메모리로 추론 병목을 없애자 KV Cache 부담을 줄이려는 Dynamo/NIXL, ICMS, Engram 메모리 병목을 줄여라! 엔비디아는 추론 프레임워크인 NVIDIA Dynamo, 추론용 라이브러리인 NIXL(NVIDIA Inference Transfer Library)를 통해서 추론 워크로드를 중단하지 않으면서도 KV Cache를 GPU 메모리에서 → CPU 메모리/로컬 스토리지/외부 스토리지 간에 매우 빠르게 전송하도록 발전시켜왔습니다. GPU에 있는 메모리는 매우 제한적이고 비싸니, 상대적으로 용량이 더 크고 비용 효율적인 스토리지로 KV Cache를 쓰는 길이었습니다. 여기에서 더 나아간 방향이 NVIDIA ICMS 이런 방향에서 더 나아간 것이 <메모리 최근 컨콜 총정리 : HBM을 넘어 eSSD/HDD까지, 메모리 판이 바뀌다>에서 다시금 정리드렸던 NVIDIA ICMS입니다.
- 원문 구간 2
SSD를 GPU와 직접 연결된 수준으로 인프라를 짠 것입니다. 이를 통해 2H26에 배포되기 시작할 VR200 NVL72부터는 각 GPU당 추가로 16TB의 Context Memory를 얻게 되는 효과이며, 지연시간에 영향을 많이 받는 KV Cache의 상당부분이 이제는 ICMS에서 제공될 것이므로 토큰 생성량이나 전력 효율이 더 좋아집니다. 모델을 만드는 AI Labs들이 다양한 방법으로 KV Cache 부하를 줄이려는 것처럼, 엔비디아는 하드웨어-소프트웨어-네트워킹 기술을 통해서 AI Labs들이 시간당 더 많은 토큰을 생산할 수 있도록 지원하는 중입니다. 시간당 더 많은 토큰을 생성한다는 것을 바꿔서 말하면 토큰당 비용이 낮아지는 것입니다. AI Labs도 메모리를 더 많이 써서 추론 비용 낮추려는 방향 오픈AI, 앤트로픽, 구글이 주요 연구에 대해서는 외부로 잘 공개하지 않기 때문에 DeepSeek의 논문을 통해서 현재 업계가 어디로 가고 있는지를 느낄 수 있습니다. DeepSeek가 1월 12일 <Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models>라는 논문을 발표했습니다.