[원문 유형] 네이버 프리미엄 콘텐츠 [채널] 올바른 미국주식 by SAPIENS [게시일] 2026.01.21. 오후 5:14 [원문 URL] https://contents.premium.naver.com/sapiens/sapiensasset/contents/260121171417196va [제목] 추론의 시대, 핵심이 된 메모리 : 메모리 쇼티지를 떠받치고 있는 힘 [수집 기준] 승인된 구독 열람권으로 실제 본문을 보존했다. 이미지·첨부는 별도 미디어 원장에 보관하며 시각적 의미 검토 여부를 구분한다. [구독 원문 본문] ​ 안녕하세요 올바른입니다. ​ AI 심화편 자료입니다. AI 컴퓨팅 수요가 6개월마다 2배씩 늘어나고 있는 상황 속에서, 메모리가 모델 발전 및 추론의 TCO 대비 퍼포먼스 개선의 새로운 축으로 부각받고 있습니다. ​ 지난번 자료가 현상을 정리한 것이면 이번엔 왜 그런지를 살펴본 자료입니다. Attention, Prefill/Decode, KV Cache, 컨텍스트 윈도우, Dynamo/NIXL, ICMS, Engram까지를 정리했습니다. ​ 엔비디아만 보더라도 GB200 NVL72 서버당 30TB의 DRAM을 탑재했는데 → VR300 NVL144에서는 서버당 365TB를 탑재할 예정입니다. 현 상태에 대한 인식을 돕는 자료입니다. AI HW : 메모리 코멘트 2026-01-15 메모리 최근 컨콜 총정리 : HBM을 넘어 eSSD/HDD까지, 메모리 판이 바뀐다 (바로가기) 2026-01-07 엔비디아 CES 2026 : Vera Rubin의 시대, ICMS가 불러올 메모리 지각변동 (바로가기) 살펴보셨으면 하는 글들 2026-01-09 100조 개 토큰으로 살펴보는 진짜 LLM 사용법 (바로가기) 2026-01-02 엔비디아가 $20B를 주고 데려온 남자 : Groq 창업자 조나단 로스의 통찰 (바로가기) 2025-12-24 구글 AI 인프라 책임자의 경고 : '우리는 여전히 수요를 심각하게 과소평가하고 있다' (바로가기) 2025-12-19 블랙록 2026 전망 : AI CAPEX $8T 시대를 열기 위한 '금융 보릿고개'를 지나는 중 (바로가기) 2025-12-17 AI 버블론을 잠재우는 숫자들 : 엔터프라이즈 AI $37B 시장의 현주소 (바로가기) 2025-12-04 엔비디아 펀더멘탈 체크 : 구글 TPU의 추격? 시장점유율에 대한 생각, 아시아 공급망 체크 (바로가기) 2025-10-08 오픈AI 퇴사자의 글 #1 : 2027년 AGI가 온다 (바로가기) 2025-10-03 엔비디아 CEO 젠슨황 인터뷰 : 오픈AI 10GW 동맹 x 극한의 풀스택 공동 설계 (바로가기) 투자자문 서비스에 따른 투자 시 원금 손실이 발생할 수 있으며, 투자 손익에 대한 책임은 전적으로 고객에게 귀속됩니다. 또한 과거의 투자수익이 미래의 수익률을 보장하지 않습니다. ​ 신규 구독 전에, 아래 투자자문계약 권유문서의 계약 관련 제반 사항을 반드시 읽으시고 충분히 검토하시기 바랍니다. ​ *투자자문계약 권유문서 : https://naver.me/5ZST47Qf 목차 ​ Agentic AI 시대와 메모리 : Prefill/Decode, KV Cache, Context Memory 메모리로 추론 병목을 없애자 : KV Cache 부담을 줄이려는 Dynamo/NIXL, ICMS, Engram 메모리 실제 수요와 가격 추이 : 공급자 주도 시장, 가격 인상과 쇼티지 국면 ​ Agentic AI 시대와 메모리 Prefill/Decode, KV Cache, Context Memory 메모리가 병목이 되다 AI 컴퓨팅 수요가 6개월마다 2배씩 늘어나고 있는 상황 속에서, 메모리가 모델의 발전 및 추론의 TCO 대비 퍼포먼스 개선의 새로운 축으로 부각받고 있습니다. KV Cache 때문입니다. ​ 여기서 좀 더 깊이 들어가봅니다. ​ Prefill & Decode LLM이 뭔가 질문을 받고 답변을 내놓는 과정인 '추론'은 크게 두 구간으로 나뉩니다. ​ Prefill : 사용자가 입력한 프롬프트을 한꺼번에 읽어 들이는 단계입니다. 많은 데이터를 한 번에 병렬로 처리하므로 GPU의 컴퓨팅 성능(FLOPS)을 최대로 활용할 수 있어 효율이 좋습니다. *compute-bound* Decode : 질문을 이해한 뒤 답변을 한 토큰씩 생성하는 단계입니다. 첫 토큰이 나와야 두 번째 토큰을 만들 수 있는 자기회귀(Autoregressive = Transformer도 일부) 방식입니다. 계산 속도보다 메모리에서 데이터를 가져오는 속도가 핵심입니다. 칩 스피드를 키우고, 데이터 I/O 통로를 더 많이 뚫어 HBM 대역폭을 키우는 것이 중요한 이유입니다. 우리가 느끼는 답변 속도를 결정하는 것이 이 부분입니다. *memory-bandwidth-bound* ​ *HBM3e : 핀 속도 10Gbps * I/O 통로 1,024개 → 대역폭 1.28TB/s *HBM4 : 핀 속도 10~11Gbps * I/O 통로 2,048개 → 대역폭 2.56~2.8TB/s *정확하게 보자면 첫 토큰까지의 지연(TTFT)는 Prefill 영향 → 그 이후로의 초당 토큰 수는 Decode 영향이 큽니다. ​ KV Cache 문제는 새로운 토큰을 하나 만들 때마다 앞서 생성한 모든 토큰과의 연관성(Attention)을 다시 계산해야 한다는 게 엄청난 문제였습니다. 문장이 길어질수록 중복된 계산량이 기하급수적으로 늘어나기 때문입니다. 이에 대한 해결책으로 나온 것이 KV Cache였습니다. ​ KV Cache를 설명하기 이전에 기본적으로 Attention 매커니즘은 Query, Key, Value라는 세 가지 핵심 요소를 갖고 있고 각각 Q, K, V라고 부릅니다. Query는 찾고자 하는 대상이고, Key, Value는 모델이 이미 학습한 정보에서 Query와 관련된 답을 가져오는 식입니다. "한국의 수도는 어디인가?"라고 물으면 모델은 Query를 통해 국가별 수도에 대한 정보를 찾고, Key와 Value 값을 사용해 적절한 답을 만듭니다. ​ 문제는 이렇게 하면 엄청난 연산량을 필요로 한다는 것입니다. 이에 KV Cache는 이전 토큰의 정보들을 압축하여 저장함으로써 불필요한 계산을 줄이고 속도를 훨씬 더 빠르게 만든 기술입니다. 계산 결과물 중 변하지 않는 핵심 정보인 Key, Value를 메모리에 따로 저장해두고 다음 토큰을 만들 때 꺼내서 쓰는 것입니다. Decode에서 컴퓨팅 병목을 줄인 대신 메모리를 함께 쓰는 구조입니다. ​ 단순한 답변 → Reasoning = 10x 사람도 1+1, 2x2는 보자마자 답할 수 있지만, 변별력 높은 수학 문제를 풀려면 일정시간 이상 생각해야 하는 것처럼 AI도 마찬가지입니다. 모델이 답변을 내놓기 전에 스스로 토큰을 써가며 생각하는 시간을 늘리는 것(Test-time compute, "Reasoning")을 통해서 지능을 더 높일 수 있습니다. 이렇게 혼자 모델이 생각하는 것도 컨텍스트 윈도우에 들어갑니다. 그런데 앞서 설명드린 Prefill과 Decode의 차이, 그리고 Reasoning에서 시작된 새로운 지능 향상의 축은 이전보다 훨씬 더 많은 메모리를 필요로 하게 됐습니다. ​ *왼쪽 : 지능을 높이는 방법 → ⓐ모델 훈련에 들이는 컴퓨팅을 늘리기 / ⓑ한 건당 추론시간에 쓰는 컴퓨팅을 늘리기 *중간 : OpenAI o1이 Test-time compute를 통해서 더 높은 지능에 도달하는 모습 *오른쪽 : DeepSeek-R1이 Test-time compute를 통해서 더 높은 지능에 도달하는 모습 이런 흐름 속에서 모델의 지능을 높이기 위한 방법으로 추론시간을 키우는 Reasoning 모델이 전체 모델들의 추론 요청당 차지하는 비율이 현재 50%를 넘겼습니다. GPT-5, Claude 4.5, Gemini 3 같은 모델들이 이어지면서 이제는 Reasoning 모델이 표준이 된 시대입니다. ​ 컨텍스트 윈도우의 변화 원래 오픈AI의 o1이 출시되기 전에 컨텍스트 윈도우가 크다는 건 엄청난 양의 문서를 넣고(input), 짧은 답변을 얻는(output) 식이었습니다. Prefill은 병렬 연산이 가능하기 때문에 상대적으로 매우 빠르고 저가에 토큰을 생성할 수 있으니 이건 큰 부담이 아니었습니다. ​ 그런데 이제 o1처럼 모델이 스스로 생각하는 시간을 키우다보니 이건 답변을 얻는 과정(output) 자체가 길어지며 Decode 작업에 훨씬 더 많은 부하가 생기는 쪽으로 작용합니다. 스스로 생각하는 과정에서 1만 개의 토큰을 생성했다면 컨텍스트의 길이는 1만 개가 됩니다. ​ 컨텍스트 윈도우 ▲ → 메모리 요구량 ▲ → 추론 비용 ▲ 차트의 로그 스케일 그래프로 보시면은 컨텍스트 윈도우(Sequence Length)가 1,024 → 4,096 → 16,384 → 65,536 → 262,144로 증가할 때마다 KV Cache의 메모리 요구량이 비례하여 증가하는 모습을 볼 수 있습니다. 컨텍스트가 커질수록 끝단의 토큰은 추론비용이 매우 비싸진다는 의미입니다. ​ DeepSeek의 MLA, DSA-라이트닝 인덱서처럼 다양한 기술로 KV 표현 자체를 저차원화/압축하는 설계들이 나오곤 합니다. KV Cache 부담을 줄이는 방향입니다. 그러나 더 긴 컨텍스트를 갖더라도 토큰당 추론비용을 낮출 수는 있겠지만(컨텍스트 크기가 증가할 때의 메모리 증가율 기울기를 낮추려는 방향), 한 번의 추론당 컨텍스트 윈도우가 커질수록 더 많은 메모리를 필요로 한다는 대전제는 변하지 않습니다. 컴퓨팅에서 제번스의 역설이 작동하는 것처럼 메모리에서도 효율화가 생긴만큼 더 많이 쓰일 것입니다. 수요가 사라지진 않을 것이란 의미입니다. ​ Reasoning → Agentic AI = 다시 한 번 10x~100x 여기에 더 나아가 사용자들은 단순히 더 높은 지능의 답변을 생성하는 모델을 넘어서 에이전트처럼 좀 더 완성도 높은 결과물을 제품을 점점 더 선호하고 있습니다. 단일 작업을 넘어서 여러 작업이 포함된 하나의 '업무'단위를 한 번에 이해하고 각종 도구를 써서 해결하는 것이므로 애플리케이션화 되는 단계입니다. ​ 기존 LLM은 사용자들이 한 번 질문을 넣으면 → 한 번의 추론을 해서 답하는 구조였습니다. 그런데 Agentic AI는 하나의 요청을 넣으면 → 검색엔진 활용, DB 읽기, 단계별 API 직접 호출, 외부 툴 활용 등을 통해서 중간중간마다 몇 번의 추론을 거쳐서 하나의 작업물을 내놓습니다. ​ 여기서 스텝마다 LLM이 사전에 훈련했던 데이터를 쓰는 게 아니라 CPU가 이메일을 불러오고, 소프트웨어를 호출하여 가동하여 작업물을 내고, 가져온 데이터를 다시 LLM에 넣어서 GPU에서 추론하기를 반복합니다. 하나의 작업물을 내놓는 데 훨씬 더 많은 요소들이 쓰이고 추론 컨텍스트 윈도우도 훨씬 더 커집니다. ​ 텍스트를 넘어 이미지와 비디오 생성 등 멀티모달을 다루고, 모델이 사용자와 상호작용했던 더 많은 것들을 기억하고, 외부 지식을 가져다 쓰고, 도구를 사용하고, 모델의 크기가 커지고, 컨텍스트 윈도우가 커짐에 따라 칩의 연산 속도를 넘어서 각 프로세서에 데이터를 얼마나 더 빠르게 가져올 수 있는가가 점점 더 중요해지는 중입니다. ​ 메모리로 추론 병목을 없애자 KV Cache 부담을 줄이려는 Dynamo/NIXL, ICMS, Engram ​ 메모리 병목을 줄여라! 엔비디아는 추론 프레임워크인 NVIDIA Dynamo, 추론용 라이브러리인 NIXL(NVIDIA Inference Transfer Library)를 통해서 추론 워크로드를 중단하지 않으면서도 KV Cache를 GPU 메모리에서 → CPU 메모리/로컬 스토리지/외부 스토리지 간에 매우 빠르게 전송하도록 발전시켜왔습니다. GPU에 있는 메모리는 매우 제한적이고 비싸니, 상대적으로 용량이 더 크고 비용 효율적인 스토리지로 KV Cache를 쓰는 길이었습니다. ​ 여기에서 더 나아간 방향이 NVIDIA ICMS 이런 방향에서 더 나아간 것이 <메모리 최근 컨콜 총정리 : HBM을 넘어 eSSD/HDD까지, 메모리 판이 바뀌다>에서 다시금 정리드렸던 NVIDIA ICMS입니다. SSD를 GPU와 직접 연결된 수준으로 인프라를 짠 것입니다. 이를 통해 2H26에 배포되기 시작할 VR200 NVL72부터는 각 GPU당 추가로 16TB의 Context Memory를 얻게 되는 효과이며, 지연시간에 영향을 많이 받는 KV Cache의 상당부분이 이제는 ICMS에서 제공될 것이므로 토큰 생성량이나 전력 효율이 더 좋아집니다. ​ 모델을 만드는 AI Labs들이 다양한 방법으로 KV Cache 부하를 줄이려는 것처럼, 엔비디아는 하드웨어-소프트웨어-네트워킹 기술을 통해서 AI Labs들이 시간당 더 많은 토큰을 생산할 수 있도록 지원하는 중입니다. 시간당 더 많은 토큰을 생성한다는 것을 바꿔서 말하면 토큰당 비용이 낮아지는 것입니다. ​ AI Labs도 메모리를 더 많이 써서 추론 비용 낮추려는 방향 오픈AI, 앤트로픽, 구글이 주요 연구에 대해서는 외부로 잘 공개하지 않기 때문에 DeepSeek의 논문을 통해서 현재 업계가 어디로 가고 있는지를 느낄 수 있습니다. ​ DeepSeek가 1월 12일 라는 논문을 발표했습니다. 조건부 메모리라는 새로운 축을 제안한 논문입니다. 단순히 기존 모델 성능 향상의 축처럼 파라미터를 키우거나 훈련에 쓰는 FLOPS를 늘리는 방식이 아니라, 모델 스케일링의 축을 새롭게 확장했는데 그것이 메모리를 더 많이 쓰는 쪽으로의 성능 향상입니다. ​ LLM 모델의 성능을 끌어올리면서도 추론비용을 크게 효율화하기 위한 조건부 컴퓨팅이 MoE(Mixture of Experts)이었습니다. 토큰을 만들기 위해 필요한 전문가만 활성화해서 추론에 쓰는 컴퓨팅은 드라마틱하게 줄이면서도 모델 용량을 훨씬 더 키울 수 있다는 것입니다. ​ 그런데 Transformer는 본질적으로 필요한 정보를 조회하는 능력이 약해서, 많은 경우에 계산해서 처리하는 특징을 갖고 있습니다. 이에 컴퓨팅을 넘어서 또 다른 스케일링 축으로 조건부 메모리를 통해 구현한 모듈이 Engram입니다. 모델이 학습한 정보 중에서 반복적이고 정형화된 지식은 연산이 아닌 조회(Lookup) 방식으로 바꿔서 메모리 모듈에 저장해놓고 꺼내 쓰게 하면 Transformer가 더 중요한 계산에 집중할 수 있다는 것입니다. ​ Engram 논문은 총 매개변수나 컴퓨팅량이 고정되어 있을 때, MoE(컴퓨팅)와 Engram(메모리)의 비중을 얼마로 나눌 것인가가 중요해진다는 방향을 담고 있습니다. DeepSeek는 이를 "Sparsity Allocation 문제"라고 이름붙여서 U-Shaped Scaling을 보였다고 정리했는데, MoE로만 가면 반복된 패턴들을 컴퓨팅으로만 처리하느라 비효율이 커지고 Engram으로만 가면 동적 추론 능력이 부족해서 전체의 성능이 꺾인다는 결론입니다. 컴퓨팅과 메모리를 동시에 쓰는 구조이자 하이브리드 최적점이 중요하다는 메시지입니다. ​ MoE가 계산을 쪼개서 필요한 전문가만 활성화해 컴퓨팅 비용을 아꼈다면, Engram은 계산이 필요하지 않은 정보들을 메모리로 옮겨서 처리하게 함으로써 더 컴퓨팅이 필요한 곳에 집중할 수 있게 합니다. 토큰 추론비용을 절감하고 그만큼의 성능 향상을 추구할 수 있습니다. ​ 크게 보자면, NVIDIA ICMS와 비슷하게 맞닿아 있습니다. ICMS는 인프라 레벨에서 동적인 메모리인 KV Cache를 SSD까지 활용하여 효율적으로 관리하려는 노력이고, Engram은 모델 아키텍처 레벨에서 정적 메모리들을 메모리 친화적으로 해결하여 전체의 추론을 더 빠르고 효율적으로 처리하게 만드려는 노력입니다. ​ Agentic AI → DRAM과 SSD 수요를 높게 유지시킬 트렌드 기술이나 방식은 다르지만 공통적으로 성능과 비용 개선의 방향을 GPU와 HBM에만 집중시키는 것이 아니라, 메모리/스토리지 계층에서도 기여할 수 있게 바꾸는 과정입니다. 이제부터는 단순히 메모리를 붙이는 구조가 아니라 추론의 Inner Loop 내에서 핵심 요소가 됐음을 느낄 수 있던 자료였습니다. Agentic AI가 채택되는 과정에서 엔비디아의 Rubin CPX, Spectrum-X, BlueField DPU의 중요도도 높아지고, 컨텍스트 윈도우를 키우면서 DRAM과 SSD 사용량이 크게 증가할 것으로 예상합니다. ​ 메모리 실제 수요와 가격 추이 공급자 주도 시장, 가격 인상과 쇼티지 국면 ​ 쇼티지 국면 공급자 주도 국면이 유지되고 있습니다. 미국 하이퍼스케일러 수요도 다 채워지지 않고 있습니다. 2025년 미국 하이퍼스케일러향 DRAM 수요 충족률은 ~70%였고, 마이크론은 4Q25 실적발표에서 중기적으로 주요 고객들의 수요 충족률이 50~75%일 것으로 예상했으며, 모건스탠리의 1월 6일 대만 공급망 체크 결과 미국 하이퍼스케일러들의 SSD 수요 충족률은 아직 40%에 불과합니다. ​ 수요강세의 정도는 재고를 통해서도 확인할 수 있습니다. DRAM 재고레벨은 4분기째 하락 중이고, NAND 재고레벨은 4Q25부터 본격적으로 낮아지기 시작했습니다. ​ DRAM: GPU와 최대한 가깝게, 최대한 많은 메모리를 넣는 중 컨텍스트 윈도우가 점점 더 커지면서 메모리 용량과 대역폭에 대한 요구치가 계속해서 커지고 있고, AI 서버 내에도 점점 더 많은 DRAM이 탑재되는 중입니다. ​ 예를 들어, 1H25에 양산된 GB200 NVL72 기준 서버당 DRAM이 30TB정도 쓰이는데 → 2H26에 양산(8월에 랙 조립완료 & 초기 출하 시작)될 VR200 NVL72(이전의 NVL144)부터는 서버당 80TB 가까이 탑재되며 → 2H27에 양산될 VR300 NVL144(이전엔 NVL576)부터는 서버당 365TB가 들어갑니다. GB200에서 VR300으로 가면서 HBM은 서버당 13TB → 150TB로 늘어나며, DRAM은 17TB → 215TB로 증가합니다. ​ 그리고 VR200, VR300에서 메모리 수요량이 크게 증가하는 요소가 각각 다릅니다. VR200에서는(GB300 대비) HBM 용량은 288GB로 그대로이지만, DRAM 용량이 38TB 추가되며 전체 서버당 DRAM 용량만 2배가 늘어납니다. VR300에서는(VR200 대비) HBM 용량이 288GB → 1TB로 크게 증가하고, SOCAMM(LPDDR)도 매우 크게 증가할 예정입니다. 엔비디아의 사양을 보면 VR300 기준 Non-HBM DRAM이 215TB입니다. ​ SOCAMM이란? 엔비디아가 서버에 저전력으로 더 많은 DRAM을 탑재하려고 내놓은 것이 기존 LPDDR5X 다이를 모듈형으로 쌓은 SOCAMM입니다. 적층 시 어려움은 HBM 대비 훨씬 낮아서, 많은 양의 고대역폭 메모리를 서버 컴퓨팅 보드에 직접 붙일 수 있습니다. 표준 DDR5 모듈 대비 2.5배의 대역폭, 전력 소비는 3분의 1로 낮아집니다. 16개의 LPDDR5X 8GB를 엮어 128GB 모듈이 하나입니다. ​ 원래 SOCAMM 1에서는 GB300부터 도입 예정이었는데 SOCAMM 2로 오면서 도입 시점은 VR200으로 연기됐습니다. 그리고 SOCAMM 1은 마이크론 Only였는데, 2로 오면서는 SEC, SKH, MU 간에 균등하게 배분될 것으로 예상됩니다. ​ NAND : 다시 언급되는 NVIDIA ICMS 메모리 요구량이 DRAM으로 다 채워지지 않고 있습니다. 특히 추론에서 고대역폭의 메모리 풀을 요구하는 방식의 니즈가 점점 높아지다보니 SSD 수요로까지 번지는 중입니다. 이 과정에서 NVIDIA ICMS가 등장한 것입니다. VR200 NVL72부터 여기에 쓰일 SSD 규모만 2025년 SSD 출하량의 ~20%에 가까운 규모가 쓰일 것으로 예상합니다. VR200 랙에 탑재된 DRAM 용량의 8배에 가까운 SSD 스토리지가 추가될 수 있습니다. SSD까지 함께 구매하는 게 추론 서비스 시 비용을 낮추면서 성능도 높일 수 있는(초당 토큰을 더 많이 뽑는단 의미) 길이므로, 이제는 서버에 DRAM을 늘리는 것뿐만 아니라 SSD도 계속해서 늘릴 것입니다. ​ *글로벌 DRAM 매출기준 점유율, 글로벌 NAND 매출기준 점유율입니다. ​ 지금까지의 DRAM, NAND 가격 추이 뱅크오브아메리카, RAMpocalyse 자료를 기반으로, 26년 1월까지의 가격 차트들을 살펴봅니다: ​ 왼쪽, 오른쪽 차트 #1, #2 → 16GB DDR5 스팟가격, 512GB NAND 웨이퍼 스팟가격이 급등 중입니다. ​ 왼쪽, 오른쪽 차트 #3, #4 → DDR5와 NAND 웨이퍼 계약가격도 빠르게 따라붙는 중입니다. ​ 왼쪽, 오른쪽 차트 #5, #6 → 소비자향 SSD 제품 가격은 고용량일수록 더 많이 상승하고 있습니다. 기업들 입장에서는 더 가격이 비싼 제품을 더 많이 출하하도록 제품 출하량의 믹스를 바꿔서도 매출성장 및 마진확대가 가능합니다. ​ CY1Q26의 가격 협상 진행 중인 상황 모건스탠리 자료를 기반으로, 1월 15일 기준 1Q26 DRAM, NAND 가격협상 상태를 살펴보면 이렇습니다: ​ DRAM : CSP들이 상당한 가격 인상을 감수하고서라도 최대한 많은 DRAM을 확보하기 위해서 장기 계약을 적극적으로 체결함에 따라, 고객들은 1Q26에 더 많은 물량을 확보하기 위해 DRAM 가격을 QoQ 50~85% 가까이 인상할 것으로 예상됩니다. PC용 DDR5 DRAM 가격은 80~85%, 서버용 DRAM은 60~65%입니다. CSP들이 적극적으로 물량을 확보하는 와중에, 협상력이 약한 OEM 기업들은 공급제약 및 할당량 감소에 직면해 있습니다. 스마트폰이나 PC 고객들도 상승한 가격을 감수할 수밖에 없는 상황입니다. ​ HBM : 엔비디아의 H200 추가 주문 및 GB200/300향 추가 주문, ASIC 고객사들의 주문량 확대로 인해서 HBM3e 12Hi 가격이 생각보다 좋습니다. 원래 AI Boom 이후 HBM 출하량이 늘며 용량당 가격은 감소하는 게 일반적이었음을 감안하면 실제로는 가격이 크게 증가한 효과입니다. HBM3e 가격은 원래 YoY -30%를 예상했는데, YoY -10%정도에서 딜이 이뤄질 것으로 예상됩니다. HBM4 인증은 3월쯤, 칩 단위 양산은 1Q26말~2Q26초쯤으로 예상됩니다. 그렇기에 랙으로 조립되어 판매되는 시점은 3Q부터입니다. ​ NAND : 모건스탠리 채널 조사 결과, NAND 가격상승은 QoQ 50~80%로 예상됩니다. QLC eSSD 공급이 가장 수요에 비해서 부족한 상황이기에 QLC eSSD 가격은 QoQ 70~80%정도 인상될 것으로 예상됩니다. 그리고 4Q25에 가격 인상 폭이 적었던 일부 공급업체들은 업계 가격을 따라잡기 위해 1Q26에 QoQ 100% 가까운 가격 인상을 요구하고 있습니다. 업계에서 일부가 선금 지급 조건으로 장기 계약을 논의 중인데, 장기 계약을 받아들이게 되면 NAND 업계에서도 CY27 이후의 신규 설비 CAPEX가 늘어날 가능성이 높아집니다. 다만, 신규 설비가 들어가고 양산까지는 최소 12~18개월이 필요하므로 CY27까지의 수요-공급 역학에는 큰 영향을 미치지 않을 것으로 예상합니다. DRAM 업계와 비슷합니다.