해석·전망AI Factory주 대상 · 산업·업종 · AI Factory관련 대상 · 기업·종목 · 엔비디아
AI 인프라의 경쟁 기준은 왜 칩 하나의 성능에서 토큰 생산 효율로 옮겨가는가?
이 자료가 더한 내용
데이터센터는 데이터를 저장하는 곳이 아니라 토큰을 생산하는 공장이고, 컴퓨팅 자원과 와트당 토큰 생산량이 매출과 연결된다는 관점을 제시했다. 이 때문에 제한된 전력 안에서 토큰·달러당 생산성을 높이는 시스템 아키텍처가 CEO 검토 대상이 된다고 설명했다.
근거 보기 4
- 원문 구간 1
토큰을 생산하는 곳입니다. 즉, 토큰 생산을 근본적인 목적으로 하는 시설, 공장은 공장입니다. AI 공장인 거죠. 당시 사람들은 "젠슨, 그 표현 너무 거칠게 들리는데요. 깔끔하네요."라고 말했습니다. 하지만 토큰을 생산하는 곳이잖아요. 데이터센터를 짓는 것을 좋아하는 사람은 아무도 없습니다. 데이터센터에 투자해서 어떤 수익을 얻을 수 있을지 알 수 없기 때문이죠. 하지만 모두가 공장을 짓는 것을 좋아합니다. 그 이유는 공장이 돈을 벌어주기 때문입니다. 이제 우리는 이러한 공장들이 토큰을 직접 생성하고, 이 토큰은 현금화할 수 있다는 것을 확실히 알게 되었습니다. 컴퓨팅 자원이 많을수록 더 많은 토큰을 생산할 수 있고, 더 많은 토큰을 생산할수록 매출도 증가합니다. 기업의 매출은 컴퓨팅 자원과 직접적인 상관관계가 있다는 것을 이제 확실히 알게 되었습니다.
- 원문 구간 2
앤스로픽이 컴퓨팅 자원을 3배로 늘리면 매출도 3배로 증가할 것이라는 사실을 통해 이를 알 수 있습니다. 앤스로픽은 컴퓨팅 자원, 즉 공장 규모에 따라 제약을 받습니다. 메르세데스나 다른 어떤 회사든 공장 규모에 따라 제약을 받는 것과 마찬가지입니다. 따라서 공장에 더 많은 컴퓨팅 자원을 확보한다면 매출이 증가할 것입니다. 만약 OpenAI가 지금 당장 더 많은 컴퓨팅 능력을 보유하고 있다면, 더 높은 매출을 올릴 수 있을 것입니다. 따라서 컴퓨팅 능력이 매출과 직결된다는 생각이 먼저 들 수 있습니다. 물론, 컴퓨팅 능력이 GDP와 직결된다는 것도 잘 알려진 사실입니다. 컴퓨팅 능력은 한 국가의 GDP와 직결됩니다. 이것이 하나의 생각입니다. 두 번째 이유는 NVIDIA가 이토록 성공적인 이유는 시스템의 전체 스택을 엔드 투 엔드로 설계하고, 토큰을 놀라울 정도로 효율적으로 생성하도록 처음부터 아키텍처를 구축했기 때문입니다.
- 원문 구간 3
NVIDIA의 와트당 토큰 생성량은 경쟁사 대비 몇 배(order of magnitude)나 앞서 있습니다. 와트당 토큰. 이게 무슨 의미일까요? 공장에 1기가와트의 전력이 있다고 가정해 봅시다. 와트당 토큰 생산량이 다른 대안보다 10배 높다면, 매출도 10배 증가합니다. 역사상 처음으로, 기업의 공장에 설치될 컴퓨터 아키텍처는 CEO의 검토를 거쳐야 합니다. 이 회사는 내년에 1GW 또는 2~3GW의 전력만 사용할 수 있습니다. 만약 잘못된 시스템을 설치한다면, 내년 매출에 심각한 영향을 미칠 것이기 때문입니다. NVIDIA 아키텍처는 현재 매우 발전되어 있으며, SemiAnalysis라는 회사에서 실시한 가장 철저한 벤치마킹 결과, NVIDIA가 추론 성능의 왕으로 선정되었습니다. 추론 성능의 왕은 초당 토큰 생산량, 와트당 토큰 생산량, 즉 토큰과 달러당 토큰 생산량으로 결정됩니다.
- 원문 구간 4
와트당 성능이나 그 어떤 요소든 경쟁사나 대안보다 훨씬 뛰어난 성능을 자랑하는 만큼, 달러당 토큰 가격 또한 최고 수준입니다. 즉, 현재 생산 가능한 토큰 중 가장 저렴하며, 그 어떤 경쟁사보다 월등히 뛰어납니다. 그래서 두 번째 생각은 이렇습니다. AI에 대한 두 번째 중요한 아이디어는 AI가 공장과 같다는 것입니다. 공장은 항상 전력 용량에 제한이 있습니다. 공장이 아무리 많더라도 각 공장의 용량은 여전히 100메가와트 또는 기가와트입니다. 따라서 와트당 수익은 기업의 매출에 있어 가장 중요한 요소입니다. 기업은 이러한 결정을 매우 신중하게 내려야 합니다. 더 이상 파워포인트 슬라이드만으로는 충분하지 않습니다. 누군가의 파워포인트 슬라이드만 보고 500억 달러를 투자할 사람은 없을 것입니다. 2026-03-04, 엔비디아 Morgan Stanley TMT 컨퍼런스 콜 中
사실·구조Vera Rubin주 대상 · 기술·제품 · Vera Rubin관련 대상 · 기업·종목 · 엔비디아
Vera Rubin은 어떤 방식으로 랙 단위 AI Factory를 구성하는가?
이 자료가 더한 내용
Rubin은 CPU·GPU·NVLink 6·ConnectX-9·BlueField-4·Spectrum-X를 한 시스템으로 공동 설계한 제품이며, Blackwell/Rubin의 NVL 랙 판매 비중이 85% 이상일 것으로 예상했다. 성능은 피크 FLOPS보다 MFU·TTFT·ITL·TPS·와트당 토큰·토큰당 비용으로 봐야 한다고 설명했다.
근거 보기 4
- 원문 구간 1
AI 팩토리 단위를 다시 한 번 강조하는 이유는 더 빠르고 강력한 하나의 칩을 발표하는 행사가 아니라, 훈련부터 추론의 과정을 데이터센터 단위로 관리하는 시스템의 완성도가 중요해졌다는 의미입니다. GTC 2024 → GTC 2026 엔비디아는 GTC 2024에 처음으로 Blackwell을 공개했습니다. GB200 NVL72부터는 HGX 8-GPU 랙의 한계를 넘어서 단일 랙에 72개의 Blackwell GPU와 36개의 Grace CPU를 탑재해, 훈련 및 추론 비용을 크게 절감하고 백만 토큰당 비용을 획기적으로 낮췄던 시스템이었습니다. 시간이 흘러 이제는 LLM 아키텍처는 MoE, 거대 컨텍스트 환경에서의 Reasoning, Agentic AI 워크플로우, 실시간 오디오 및 비디오 처리를 포함한 초거대 모델을 지원해야 합니다.
- 원문 구간 2
결국은 'TCO 대비 퍼포먼스'라는 하나의 기준으로 본다지만 여기서 '퍼포먼스'는 굉장히 다양합니다. 단순히 Dense 기준 피크 FLOPS를 측정하는 것이 아니라, 각종 모델 및 워크로드별로 MFU(모델 FLOPS 활용률), TTFT(Time-to-First-Token), ITL(Inter-token Latency),TPS(Token per second), 와트당 토큰 수(token/watt), 토큰당 비용(token/$) 같은 실질 서비스 관점에서의 지표들이 더욱 중요합니다. 이에 엔비디아는 GTC 2025에 선보인 NVIDIA Dyanmo부터 서비스 지표를 더 강조 중입니다. 또한 더 나아가서 Rubin은 흐름에 맞게 처음부터 하나의 랙/시스템으로 통합되어 판매할 것을 기준으로 공동 설계했습니다. 소프트웨어로 병목을 보완하는 것이 아니라, 모든 칩 구성요소의 기능과 배치를 설계 단계에서부터 같이 조율했습니다.
- 원문 구간 3
CPU, GPU, NVLink 6, ConnextX-9 NIC, BlueField-4가 하나의 시스템인 제품입니다. AI Factory의 근간 'Vera Rubin' 6개의 칩, 새로운 하나의 생태계 Vera Rubin : Extreme Co-design Rubin GPU Vera CPU NVLink 6 Switch ConnectX-9 SuperNIC BlueField-4 DPU Spectrum-X Ethernet Switch 올해 Blackwell/Rubin 중 NVL랙 형태로 판매될 물량이 85% 이상일 것으로 예상합니다. 일부 HGX 판매는 이어지겠지만 대부분이 고객사들에게 NVL랙 형태로 판매될 것입니다. 이제 엔비디아 CPU, GPU, Switch, NIC, DPU, Ethernet Switch까지 모두 합친 랙 제품이 새로운 최소 단위입니다.
- 원문 구간 4
이 과정에서 엔비디아는 세계 1위의 GPU 기업을 넘어 Scale-up, Scale-out에서도 시장 점유율 1위를 차지했고 → 더 나아가서는 이제 Rubin과 함께 DPU, NIC, CPU(하이엔드 기준)에서도 1위를 노리고 있습니다. VR200 NVL72 : 다시 한 번 토큰 생성비용을 10분의 1로 줄일 것 왼쪽 차트는 10조 개의 파라미터 모델 훈련에 필요한 GPU의 수를 비교한 것입니다. xAI의 Grok 5가 대략 7조 개 파라미터이기 때문에 프론티어 모델 훈련 상황을 살펴보기에 꽤 적절한 차트입니다. 프론티어 모델의 훈련 시간 단축은 곧 AI 기업의 비용 절감과 직결됩니다. 모델 출시 속도가 빨라질수록 시장 장악력과 추론 마진율을 높게 가져갈 수 있기 때문입니다. 차트로 보시면 동일 시간 기준, VR200 NVL72은 기존 GB200 대비 4분의 1의 GPU로도 훈련이 가능할 만큼 획기적인 퍼포먼스를 보여줍니다.
사실·구조분산 추론주 대상 · 기술·제품 · 분산 추론관련 대상 · 기술·제품 · NVIDIA Dynamo
Prefill과 Decode를 분리하면 왜 하드웨어·소프트웨어를 다르게 설계해야 하는가?
이 자료가 더한 내용
Prefill은 대량 텍스트 병렬 처리라 연산이, Decode는 순차 작업이라 메모리 대역폭이 병목이다. Splitwise는 두 단계를 서로 다른 GPU에 배정하는 예를 들었고, Dynamo는 Planner·Smart Router·분산 KV Cache 관리자·NIXL로 이 분리를 조율한다고 설명했다.
근거 보기 4
- 원문 구간 1
하지만, 두 작업은 사실 하드웨어에 요구하는 특성이 완전히 다릅니다. Prefill : 한 번에 대량의 텍스트를 병렬로 처리하므로 막대한 연산 능력(Compute-bound)이 필요합니다. Decode : 앞선 결과를 기다려야 하는 순차적 작업(Autoregressive)이므로 연산량은 적지만, 메모리에서 데이터를 얼마나 빨리 가져오느냐(Memory-bound)가 관건입니다. *왜 Prefill, Decode가 필요한가는 Transformer 아키텍처의 Attention 매커니즘부터 거슬러 올라가야 합니다 이렇게 Prefill과 Decode로 서로 다른 성격의 작업을 분리하는 것이 Disaggregated Inference(Serving)입니다. 이러한 Disaggregated inference이 언제쯤부터 기술적으로 부각받기 시작했는가 생각해보면 2023년 11월 30일 Microsoft Research 팀에서 올렸던 Splitwise로 거슬러 올라갑니다.
- 원문 구간 2
당시 논문의 핵심을 정리하면, 입력된 프롬프트 전체를 계산하여 첫 토큰을 만드는 Prefill은 컴퓨팅/FLOPS가 가장 중요하므로 H100과 같은 고성능 GPU에 할당합니다. 반면, 이후 토큰을 하나씩 생성하는 Decode 단계는 연산량보다 메모리 대역폭이 중요하므로 A100이나 그보다 낮은 전력의 이전 세대 GPU에 할당하여 처리합니다. 이렇게 LLM 추론 요청의 Prefill, Decode를 서로 다른 머신으로 분리하여서 Prefill은 H100으로 추론하고 Decode는 A100으로 추론할 경우, 기존 설계 대비 1.4배 높은 Throughput을 20% 낮은 비용을 달성할 수 있고, 동일한 비용 및 전력으로 2.35배 높은 Throughput을 낼 수 있다는 논문이었습니다. AI Labs나 하이퍼스케일러들은 자체 소프트웨어를 개발해 disagg 환경을 구축해왔으나, 2025년부터는 엔비디아가 이를 오픈소스 추론 프레임워크인 NVIDIA Dynamo로 출시했습니다.
- 원문 구간 3
엔비디아 GPU를 쓰는 모두가 disagg를 쓸 수 있게끔 훨씬 간편하게 만든 것입니다. 이처럼 효율적인 추론 워크로드 분리를 위해서는 KV Cache, LLM 인식 라우팅, 메모리 관리가 하드웨어~소프트웨어~네트워킹에 이르기까지 완벽하게 연동되어야 합니다. NVIDIA Dynamo는 이처럼 복잡한 인프라 요소들을 하나로 통합하고 조율하는 중추적인 역할을 담당합니다. Dynamo는 ⓐPlanner(워크로드별로 Prefill, Decode 중 어디가 병목인지를 파악하여 결정), ⓑSmart Router(KV Cache 관리를 통해 Cache hit rate를 올림), ⓒDistributed KV Cache Manager(KV Cache를 자주 쓰는 순서대로 GPU, CPU, 서버 DRAM, SSD 등으로 오프로드) ⓓNVIDIA Inference Transfer Library("NIXL", 각종 노드 간 저지연 고처리량 통신)이 핵심입니다.
- 원문 구간 4
아무튼, 이런 과정들을 통해서 엔비디아는 소프트웨어와 네트워킹적으로 분산 추론(Disaggregated Inference)을 가능하게 하는 인프라를 완벽히 설계해내고 서비스하고 있습니다. 그런데 여기 뭔가 빠져있습니다. 가장 중요한 하드웨어가 없었습니다. 엔비디아가 가려는 길 그런데 이러한 분산추론의 장점을 온전히 살리려면 워크로드별로 특화된 칩들을 통해서 추가적인 가속이 필요합니다. 이것이 CPX와 LPX입니다. 엔비디아는 Rubin의 6개 칩으로 구성한 시스템에서 범용 GPU의 장점은 그대로 살리되, Prefill에서는 CPX를 통해서 워크로드를 가속하고, Decode에서는 Groq에서 가져온 LPX를 통해 워크로드를 가속하여 전체적인 병목을 최소화하려는 방향입니다. 새로운 X Factor의 등장입니다.
해석·전망Rubin CPX주 대상 · 기술·제품 · Rubin CPX관련 대상 · 기업·종목 · 엔비디아
CPX는 Prefill 병목을 어떤 조건에서 줄이려는가?
이 자료가 더한 내용
작성자는 CPX가 Prefill 전용 고속 처리를 목표로 하고, 독립형 랙을 통해 하이퍼스케일러가 Prefill·Decode 부하에 맞춰 칩 비중을 정할 수 있다고 봤다. CPX의 GDDR7 또는 HBM3E 메모리 구성은 아직 정확한 예상치가 없다고 명시했다.
근거 보기 4
- 원문 구간 1
Prefill 병목을 해결할 : Rubin CPX 생성형 AI 애플리케이션에 대한 수요가 늘어나고 고도화되면서, 모델이 한 번에 처리해야 하는 정보의 양이 급증하고 있습니다. 장문의 문서나 방대한 비디오 데이터를 소화하기 위해 이제는 수백만 토큰 규모의 컨텍스트 윈도우가 필요해졌습니다. 하지만 기존 단일 GPU의 FLOPS나 HBM 업그레이드를 갖고는, 높아질 TCO 대비 Prefill 단계의 퍼포먼스 향상폭이 비용효율적이지 않은 구조였습니다. Prefill은 메모리의 용량이나 대역폭보다는 높은 FLOPS를 집중적으로 요구하기 때문입니다. 이러한 병목 현상을 해결하기 위해 엔비디아는 Prefill 워크로드만을 고속으로 처리하는 데 특화된 전용 칩 CPX를 개발했습니다. 각각의 'Rubin CPX GPU'는 6개의 32GB GDDR7를 통합하여 최대 96GB에 1TB/s 대역폭을 제공할 것으로 예상됩니다.
- 원문 구간 2
범용으로 쓰이는 Rubin GPU의 HBM4 288GB 22TB/s 대역폭과 비교하면 크게 낮지만, Prefill은 연산 능력에 의해 주로 병목이 발생하는 분야이기에 상관없습니다. *원래 Prefill에서는 가장 앞선 HBM 세대 대역폭을 100% 활용하지 못하고 있었습니다. Decode는 자기회귀적 특성이 있어서 순차적으로 토큰이 나오는 구조이지만, Prefill은 한 번에 병렬로 처리가 가능해서입니다. Rubin CPX GPU에 탑재될 것으로 예상됐던 GDDR7는 GB당 비용이 낮고 2.5D 패키징이 필요하지 않기에 GDDR7을 택했습니다. 다만, 최근에 Conventional DRAM 가격이 워낙 크게 오르다보니 2025년 12월부터는 HBM3E처럼 이전 세대의 HBM을 탑재하는 버전도 함께 고려되고 있는 것으로 파악되기에 최종 CPX는 어떤 버전으로 나올지 정확한 예상치가 없습니다.
- 원문 구간 3
메모리 대역폭을 다 활용을 못하고 있던 것일뿐 여전히 필요하고, HBM은 연간 고정가로 물량을 공급받을 수 있다는 점에서 엔비디아는 긍정적으로 검토 중입니다. Vera Rubin CPX 랙 (4Q26 출하 예정) Vera Rubin NVL144 CPX 랙 구성입니다. 18개의 Compute Tray에 걸쳐서, 144개의 Rubin GPU, 144개의 CPX GPU가 탑재되어 있습니다. 트레이당으로 보면 총 2개의 Vera CPU + 8개의 Rubin CPX GPU가 탑재되어 있습니다. 전체 랙당으로 보면 8 EFLOPS의 NVFP4 컴퓨팅 성능, 100TB의 메모리 용량, 1.7PB/s 대역폭입니다. 엔비디아는 CPX 가속기를 독립형 랙으로 제공할 것으로 보입니다.
- 원문 구간 4
독립형 랙으로 설계했기에 하이퍼스케일러들은 Prefill 및 Decode 부하에 따라서 어느 쪽의 칩을 더 많이 넣을 것인지를 설계할 수 있게 됐습니다. 데이터센터 전력 소비를 최적화할 수 있으며, 시스템 수준의 장애 가능성도 낮출 수 있습니다. Decode 병목을 해결할 : Groq을 녹인 'LPX' 엔비디아는 Groq LPU 기술을 라이선스하고 Groq 창업자 및 핵심 엔지니어들을 $20B를 주고 인수했습니다. LPU를 가져와 엔비디아는 LPX라는 칩으로 출시할 것으로 예상됩니다. Groq의 아키텍처는 대용량 메모리를 칩 내부에 직접 탑재하고, 순차적인 추론에 최적화된 결정론적인 실행 시스템 덕분에 기존의 GPU 기반에서 생겼던 병목을 해결하는 시스템입니다. 강점을 요약하자면 낮은 지연시간으로 추론할 수 있다는 것입니다.
사실·구조LPX와 Groq주 대상 · 기업·종목 · Groq관련 대상 · 기업·종목 · 엔비디아
Groq 기술은 Decode의 저지연 요구에 어떤 역할을 할 수 있는가?
이 자료가 더한 내용
SRAM은 HBM보다 대역폭이 높고 지연시간이 짧지만 용량이 작고 GB당 비용이 10배 이상 높다. 작성자는 LPX가 SRAM·결정론적 실행으로 Decode를 가속하고, 대용량·복잡한 작업은 Rubin GPU와 CPX가 맡는 분업을 예상했다.
근거 보기 6
- 원문 구간 1
이를 가능케하는 Groq의 핵심역량은 크게 세 가지입니다. ⓐsoftware-first, ⓑdeterministic compute and networking, ⓒon-chip SRAM입니다. 편하게 설명을 드리려면 ⓒSRAM의 하드웨어적인 한계를 먼저 풀고나서 그리고 ⓐⓑ결정론적 컴퓨팅과 소프트웨어를 설명드리는 게 좋을 것 같습니다. On-chip SRAM SRAM의 장점과 한계점도 분명합니다. SRAM의 대역폭은 HBM보다 훨씬 높고 지연시간도 상당히 짧습니다. 하지만 용량이 제한적이고, GB당 비용은 HBM보다 10배 이상 높습니다. Groq 1세대 칩은 230MB의 SRAM이 통합되어 있는데, 랙당 576개의 LPU를 하나로 묶어도 용량은 132.5GB 정도밖에 되지 않습니다.
- 원문 구간 2
B200 단일 칩의 HBM 용량 192GB보다도 작은 규모입니다. 이미 GroqNode 랙스케일 제품 자체에서도 SRAM 용량 제약으로 인해 고성능 CPU(AMD EPYC 7313 2개) 및 대용량 DDR 메모리 풀(1TB DDR4-3200 ECC DRAM & 7.68TB PCIe NVMe SSD)과의 조합으로 랙을 구성했었습니다. HBM, 서버 DRAM, NAND 등의 역할을 대체하진 않는다는 의미입니다. GPU+HBM 조합은 기본적으로 High Throughput에 초점을 맞추고 있고, LPU+On-chip SRAM 조합은 기본적으로 Low Latency에 초점을 맞추고 있습니다. High throughput과 Low Latency에는 trade-off가 있어서 엔비디아 입장에서는 Low Latency를 요구하는 특정 워크로드에 대응할 수 없던 상태였는데 이 빈자리를 정확히 채웠습니다.
- 원문 구간 3
<엔비디아가 $20B를 주고 데려온 남자 : Groq 창업자 조나단 로스의 통찰>을 참고하시면 좋습니다. 결정론적 컴퓨팅 및 네트워킹 여기서 중요한 건 ⓐⓑ결정론적 컴퓨팅 및 네트워킹(deterministic compute and networking)과 이를 가능케하는 소프트웨어입니다. 칩이 작동하기 전에 컴파일러가 데이터의 이동과 연산 스케줄을 100% 미리 계획합니다. 실행 중 발생하는 병목이나 대기 시간이 없으므로, 토큰 단위의 생성 속도가 극단적으로 빠릅니다. AI 추론에서 현재 비용이 높아지는 건 컴퓨팅 그자체라기보다 각종 기다림으로 인해서 생기는 비용이 늘고 있기 때문입니다. 기다림의 비용을 줄이기 위해서 메모리(HBM, LPDDR5, GDDR5)도 GPU와 더 가까이에 더 많이 집어넣으려 하는 것이고, 그래서 네트워킹/인터커넥트에도 더 투자하는 것입니다.
- 원문 구간 4
이런 관점에서 Groq은 아예 메모리 계층을 극단적으로 단순화하고, 실행의 변동성 자체를 소프트웨어로 제거하는 강점을 가진 시스템을 가졌습니다. 엔비디아는 이를 Vera Rubin 그리고 그 이후의 Feynman과 녹여내어 전체의 퍼포먼스를 끌어올릴 예정입니다. 특정 추론 구간을 SRAM/결정론적 실행으로 빠르게 처리해주는 별도의 레인을 만드는 것입니다. Rubin CPX가 Prefill을 가속화하기 위한 작업이라면, LPX(가칭)은 Decode를 가속화하기 위한 것에 쓰일 것으로 예상합니다. 이제 단일 GPU나 ASIC의 최적화를 넘어서 시스템 전체의 분산 추론(Disaggregation)과 스마트 라우팅(Routing)이 새로운 X Factor가 될 것이란 예상입니다.
- 원문 구간 5
오픈AI의 GPT-5에서도 작업별 성격에 따라 라우팅이 중요했던 것처럼 하드웨어 인프라에서도 비슷한 길을 가고 있습니다. 결정론적 작업은 Groq LPU : Decode에서 토큰을 하나씩 반복적으로 생성하는 작업이나, MoE(Mixture of Experts) 모델에서 어떤 전문가 모델을 호출할지 결정하는 Gating 네트워크처럼 예측 가능하고 동시성이 높은 작업이 이곳으로 배정됩니다. Low Latency가 필요하 분야입니다. 동적 스케줄링 작업은 Rubin GPU : 각종 동적이고 복잡한 스케줄링이 여전히 필요한 작업에서는 막대한 메모리 용량을 가진 Rubin GPU 및 기존의 엔비디아 칩들의 몫입니다. 하이엔드이자 다기능 워크로드는 여전히 GPU를 대체할 수 없습니다.
- 원문 구간 6
High Throughput이 필요한 분야입니다. 그리고 Prefill에 한해서는 컨텍스트 처리를 대신해줄 Rubin CPX가 도와줄 것입니다. 결과적으로는 두 차선 모두 꽉차게 될 것이라 예상합니다. 토큰 추론비용이 낮아짐으로 인해서 생기는 제번스의 역설로 하여금 AI 워크로드를 더욱 더 빠르게 늘릴 것이기 때문입니다. Groq의 추론 성능을 극한까지 끌어올리기 어려웠던 이유는 데이터 흐름을 설계함에 있어서 컴파일러/소프트웨어~네트워킹 단위에서의 작업을 오차없이 맞추기 어려웠기 때문입니다. 그런데 그런 역량을 가장 많이 갖고 있는 팀이 엔비디아이기에, 엔비디아의 IP와 만나서 시너지를 크게 끌어올릴 수 있을 것이란 기대를 하고 있습니다. 어떤 모습으로 녹여낼 것인지에 대한 답을 제시할, GTC 2026을 기대해봅니다.
사실·구조AI 추론 컨텍스트 메모리주 대상 · 기술·제품 · NVIDIA ICMS관련 대상 · 기업·종목 · 엔비디아
ICMS는 KV Cache의 어떤 병목을 줄이려는가?
이 자료가 더한 내용
챗봇에서 Reasoning·Agentic AI로 갈수록 KV Cache가 커지고 기존 HBM→DRAM→로컬 SSD→공유 파일 계층의 이동 비용이 커진다고 설명했다. ICMS는 Pod 가까이에 G3.5 계층을 두고 Dynamo·NIXL·DPU·Spectrum-X가 데이터 이동을 조율하는 구조다.
근거 보기 7
- 원문 구간 1
해당 코멘트와 함께 발표된 NVIDIA ICMS 플랫폼이 CES 2026의 핵심이었습니다. 전체적인 흐름부터 정리해봅니다. Context Memory의 문제 LLM의 사용 사례가 챗봇 → Reasoning → Agentic AI로 진화함에 따라 메모리는 더 많이 필요해지기 때문에 그렇습니다. 여러 번 생각하는 구조로 갈수록(시퀀스 길이가 증가할수록), KV Cache가 계속해서 증가하기 때문입니다. 에이전트는 특히 계속해서 LLM이 두뇌 역할을 하며 다양한 서비스를 드나들기 때문에, 중간 결과나 도구 사용 등에 대한 장기 기억을 훨씬 더 많이 필요로 합니다. Transformer 기반에서 추론 컨텍스트 기억은 KV Cache를 통해서 이뤄집니다.
- 원문 구간 2
추론 컨텍스트를 보관함으로써 모델이 새로운 토큰을 생성할 때마다 다시 처음부터 계산하지 않도록 하는 것입니다. 기록하고 쓰지 않는 구조가 아니라 추론 컨텍스트는 다시 꺼내서 쓰고 하는 작업을 반복하기에 내구성이나 속도, 전력과 비용의 효율성도 중요합니다. 추론 컨텍스트에서 KV Cache가 옮겨다니던 메모리 계층을 정리해봅니다. HBM → System DRAM → Rack Local SSD → Shared File 엔비디아는 NVIDIA Dynamo를 통해서 스토리지 계층 전반에 걸쳐 추론 시 사용되는 KV Cache를 관리하고 있습니다. 구조적으로 보면 이렇게 되어 있었습니다.
- 원문 구간 3
G1 (GPU HBM) : 답변을 생성 중인 활성화된 데이터용입니다. 속도가 매우 빨라야 하고, 지연시간이 핵심인 작업에 사용됩니다. G2 (System DRAM) : HBM의 용량이 부족할 때 데이터를 임시로 옮겨두는 공간입니다. G3 (Local SSD) : 짧은 시간 안에 다시 사용될 가능성이 있는 Warm data를 저장합니다. G4 (Shared Object/File) : 당장 처리에 필요하진 않지만 보관이 필요한 Cold data를 보관합니다. G1은 접근 속도에 최적화되어 있고, G3와 G4는 데이터 보존에 최적화된 구조입니다. 그런데 문제는 AI가 다루는 컨텍스트 윈도우가 점점 더 커지다보니 데이터 양이 늘어남에 따라 KV Cache가 Local Storage였던 G1~G3를 빠르게 소진시키고 Enterprise Storage 레벨인 G4까지 데이터를 이동시킬 수밖에 없는데, 이 과정에서 병목이 커진다는 게 문제입니다.
- 원문 구간 4
비용과 전력 소비 모두를 증가시키는 길이었습니다. Pod 내의 Inference Context Memory Storage의 위치 이에 엔비디아가 Rubin부터는 컴퓨팅 Pod을 구성할 때 ICMS를 GPU와 직접적으로 연결하여 쓸 수 있게 했습니다. 위의 VR200 DGX SuperPod 구성을 보시면, 양 옆으로 Context Memory 랙을 확인하실 수 있습니다. 이번 Rubin 플랫폼부터 새롭게 추가된 부분입니다. 지금보다 훨씬 더 메모리 집약적인 추론을 위해서 대규모 SSD를 마치 직접 GPU에 연결된 수준으로 가져다 쓸 수 있게끔 인프라를 짠 것입니다.
- 원문 구간 5
ICMS을 통해서 BlueField-4 DPU 4개와 150TB 규모의 NVMe SSD를 탑재하면 GPU Pod당 PB 규모의 공유 스토리지가 생깁니다. 각 GPU당 추가로 16TB의 Context Memory를 얻게 되는 효과이며, Latency에 민감한 KV Cache의 상당부분이 이젠 ICMS에서 제공되므로 TPS는 5배 높아지고 기존 스토리지 연결구조 대비 전력 효율은 5배 높아지는 효과를 얻습니다. 추론 컨텍스트 처리가 GPU에서 멀어지면 멀어질수록 지연시간은 높아지고, 에너지 사용량과 토큰당 비용이 상승하며 전체적인 효율이 떨어지는 문제가 생깁니다.
- 원문 구간 6
그래서 아예 Pod 레벨에서 통합된 특수한 컨텍스트 메모리 계층을 만든 것이 NVIDIA ICMS입니다. G3.5 레벨입니다. KV Cache 데이터 액세스가 훨씬 더 빨라지고 GPU가 쓸 수 있는 메모리의 규모가 크게 증가하는 만큼 효율이 높아집니다. 이 과정에서 소프트웨어 레벨에서는 NVIDIA Dynamo와 NIXL(NVIDIA Inference Transfer Library)이 어떤 데이터를 언제 옮기고 어디에 옮길지 결정하는 역할을 합니다. KV Cache를 미리 옮겨서 decode 병목을 줄입니다.
- 원문 구간 7
그리고 BlueField-4 DPU와 NVIDIA DOCA 프레임워크는 데이터 이동을 전담 처리하여 GPU의 부하를 줄이는 역할을 합니다. 네트워킹에서는 Spectrum-X Ethernet이 Rubin 컴퓨팅 노드(VR200 NVL72 or R200 HGX)와BlueField-4 ICMS 스토리지 노드를 전체를 오가며 지연시간이 짧고 대역폭이 높은 패브릭 역할을 합니다. 아예 추론 컨텍스트에 맞게 시스템을 새롭게 설계한 것이자, 새로운 X Factor를 추가시킨 것입니다. GTC Preview : 새로운 시대, 새로운 패러다임