2025.11.20 · 네이버 프리미엄 콘텐츠 · 올바른 미국주식 by SAPIENS

엔비디아 3Q25 실적발표 : 2026년 말까지 "SOLD OUT", 젠슨황이 $500B 매출을 확신하는 이유

유형
네이버 프리미엄 콘텐츠
날짜
2025.11.20
강연자/작성자
올바른 미국주식 by SAPIENS
분석 주제
미지정
자료 길이
본문 32,136자
1

문서 전체 조망

핵심 구조

풀가동 수요와 랙·네트워크 전환이 함께 확인된 3Q25

엔비디아는 3Q25 실적에서 Blackwell·Rubin의 2026년 말까지 매출 가시성과 4Q25의 매출·마진 가이던스를 제시했다. 이 자료는 랙 단위 공급 확대와 CUDA·네트워킹 설계가 추론 및 향후 대규모 AI 인프라 수요를 어떻게 묶는지, 그리고 비용·수출 규제가 남기는 조건을 검토한다.

매출과 마진의 동시 상승

3Q25 매출은 570.1억달러, 데이터센터 매출은 512억달러로 컨센서스를 웃돌았고, 4Q25 매출 가이던스 650억달러와 GPM 75%는 랙 전환이 매출과 마진에 함께 작용한다는 근거가 된다.

B300과 NVL72가 키운 데이터센터

Blackwell 매출은 3Q25에 410억달러로 추정되며 그중 약 3분의 2가 B300이었다. GPU만이 아니라 Grace CPU·네트워킹을 포함한 NVL72 랙의 생산 증가가 데이터센터 매출 증가폭을 키운 구조로 해석한다.

기존 설치 기반과 신규 주문의 수요

6년 전 A100까지 높은 가동률을 보이고 Blackwell·Rubin은 2026년 말까지 5,000억달러 매출 가시성을 확보했다는 회사 발언을 수요의 근거로 든다. 다만 API 사용량 데이터만으로 전체 AI 사용량을 가늠하기 어렵다는 예외도 함께 짚는다.

공급망을 랙 단위로 통제

GB300 NVL72 양산의 수율과 생산량 증가, VR200 NVL144용 L10 Compute Tray 직접 공급 계획은 공급 병목과 조립 리드타임을 더 직접 관리하려는 변화로 정리된다. Rubin 양산은 2H26이 제시됐으며 실제 전환의 확인이 판단 기준으로 남아 있다.

추론과 네트워크의 경쟁 기준

추론에서는 처리량·지연시간·동시접속을 함께 맞춰야 하며, 자료는 NVLink의 All-to-All 연결과 Spectrum-XGS의 데이터센터 간 연결을 총소유비용 대비 성능을 좌우할 기준으로 본다. CPX와 Enfabrica 기술은 Agentic AI의 연산·메모리·통신 병목이라는 문제를 겨냥한다.

비용과 수출 규제는 남은 변수

메모리 등 투입비용 상승 속에서도 CY26 GPM 75%대를 지키겠다는 계획은 비용절감·제조시간·제품 믹스라는 조건에 달려 있다. GAIN Act는 비미국 시장에 구형 제품이 배정될 경우의 고객 집중과 점유율 위험으로 제기됐고, 행정부의 제동 보도는 불확실성을 낮출 수 있는 반대 근거로 소개됐다.

ANALYSIS VIEW사건별 사실과 작성자의 판단, 지속 정보를 나누어 읽기
2
발생·예정 사건과 출처별 관점

이슈 분석

이 자료가 이슈의 어떤 사실을 다루고, 작성자가 무슨 결론을 어떤 근거로 내렸는지 원문에 붙여 읽습니다.

발생발표·발생 후발생일 25-11-19

25-11 엔비디아 3Q25 실적과 Blackwell·Rubin 공급망 확대

작성자의 핵심 판단

작성자는 B300 전환과 GB200·300 NVL72 판매량 증가가 전사 GPM과 4Q25·CY26 가시성을 높였으며, 공급 확대가 다음 성장 확인점이라고 평가한다.

근거 보기 4
  1. 원문 구간 1

    이번 분기에 엔비디아 주가가 크게 오지 않았던 이유가 H20 판매에 대한 기대감이 2Q 실적발표 이후 생겼다가 점점 줄어들었기 때문입니다. Non-China에서는 수요가 크게 올랐고, China에서는 수요 추정이 줄어들면서 이것이 상쇄되어 횡보 상태를 유지했습니다. ​ 리뷰 #1 → 두 가지 서프라이즈가 컸습니다. ⓐB300으로의 전환이 생각보다 빠른 것, ⓑGB200·300 NVL72 랙 판매량이 많이 올라왔던 것에서 서프라이즈였습니다. 전사 GPM을 끌어올리는 데 성공했고 4Q25 및 CY26까지도 가시성을 높이는 데에 NVL랙의 역할이 중요합니다. ​ 2. 다음 분기 4Q25(11월~1월) 실적 가이던스는 얼마인가? 중요도 40% Preview 코멘트 : 4Q25를 생각할 때 중요한 건 GB200·GB300 NVL72 램프업에 문제가 없는가가 중요합니다. 위의 Foxconn, Quanta, Wistron 코멘트가 다음 분기까지도 영향을 주는 중요한 내용이란 의미입니다. 수요는 매우 높다는 것을 GTC Washington에서 확인했고, 공급은 GB200 NVL72 → GB300 NVL72에서 크게 달라지는 게 없기 때문에 거의 문제가 없을 것으로 예상됩니다. GB300 NVL72가 본격 생산량을 올리기 시작하는 때는 4Q25부터이지만, 물량의 절반 이상 수준으로 올라오는 시점은 1Q26쯤부터입니다. ​ 리뷰 #2 → 3Q25보단 4Q25의 서프라이즈가 컸습니다.

  2. 원문 구간 2

    GB300 NVL72 랙 램프업에 문제가 없음은 4Q25 가이던스가 아니라 3Q25에서 미리 확인했기 때문에 좋습니다. Blackwell 매출 중 3분의 2가 B300에서 나왔습니다. 이미 물량의 절반 이상을 차지했으며 양산 단계에 들어갔기 때문에 GB300 NVL72이 매출에서 절반 이상을 차지하는 시점이 한 분기씩 당겨졌습니다. 그래서 이번 분기에 중요도 40%로 가장 중요했던 4Q25 가이던스상 매출은 $65B vs 컨센 $62B, GPM은 75%에 도달하며 꽤나 서프라이즈였습니다. 가이던스를 보수적으로 한다는 걸 감안하면 4Q25에 대략 $67B 이상이 나올 거란 자신감인데 이정도면 2Q25 매출 $46.7B → 3Q25 매출 $57B → 4Q25 매출 $67B이므로 +$10B씩 증가하는 추세입니다. 그리고 영업비용도 $5B로 크게 늘지 않았기에 CY1Q25부터 영업이익 레버리지가 계속해서 커지는 구간입니다. ​ 3. 크게 보고 CY2025~CY2026 수요와 공급 가시성은 어떤가? 중요도 20% Preview 코멘트 : 수요부분에서는 추론 수요 급증과 GPT-7, GPT-8급 모델 훈련을 위한 GW급 클러스터를 만드는 수요가 같이 묶이면서 CY26까지도 GB200·300 NVL72 랙 수요가 꽉찼습니다. Foxconn, Quanta, Wistron은 최근들어서 수요 가시성이 CY27까지 확보되기 시작했다고 말했습니다.

  3. 원문 구간 3

    엔비디아 3Q25 Preview에서 전해드린 것처럼 AI Labs의 ARR 성장세가 얼마나 가파른가가 핵심인데, 계속해서 추정치를 상회하고 있습니다. ​ 공급 : ⓐBlackwell Ultra 서프라이즈 ⓑRubin과 L10 1H26까지 향후 6개월간 엔비디아의 매출 성장에는 GB200·300 NVL72 랙 공급이 얼마나 빠르게 많이 늘어나느냐가 중요합니다. 이후에는 VR200 NVL144가 중요하지만 우선은 NVL 랙 자체에 대한 경쟁역량이 높기에 공급이 늘어나는 만큼 매출로 연결될 것입니다. 이미 수요는 Foxconn, Quanta, Wistron이 말하기로 CY27까지 확보된 상황입니다. 미충족수요가 많아졌으니 공급이 얼마나 원활하게 증가할 수 있느냐에 따라서 엔비디아 입장에서는 아직 업사이드는 조금 더 열려있습니다. ​ 모건스탠리는 공급망 체크를 토대로, NVL 랙 생산량이 3Q25 8,000~8,500개 → 4Q25 14,000~15,000개(중간값 기준: QoQ 76%)로 크게 늘어날 수 있다고 추정합니다. 10월 중순의 OCP Global Summit에서 체크하기로 GB300 NVL72 랙 생산과 관련해서는 수율 문제가 발생한 적이 없으며, 향후 몇 개월간 생산량이 순조롭게 증가할 것으로 예상할 수 있는 상태입니다. 연 단위로 보자면 CY25 28,000개의 NVL랙을 생산하고 → CY26에는 60,000~70,000개의 랙을 생산할 것으로 추정했습니다.

  4. 원문 구간 4

    ​ 순조로운 VR200 NVL144 도입 일정 GB300 NVL72 양산이 매우 순조로움을 확인했기에, 이제 중요한 것은 바톤을 이어갈 VR200 NVL144가 잘 준비되고 있는가인데 이 부분에서도 좋은 내용이 있었습니다. Rubin은 GB200·300 NVL72과 공급망 측면에서 대부분 호환되면서도 '대량 생산에 최적화된 구조로 재설계한(substantially redefined the manufacturability)' 3세대 랙 스케일 시스템이며, Vera Rubin NVL144 랙 설계도를 2025년 7월에 공개했던 만큼 이미 CSP나 주요 데이터센터 운영사들은 VR200을 어떻게 구축 후 실행할 것인지에 대해서 이해하고 있는 상황입니다. ​ 여기서 대량 생산에 최적화된 구조로 재설계했다는 것은, L10 Compute Tray 도입을 의미한다고 봤습니다. ​ VR200 NVL144부터는 랙 생산 극대화를 위해 '공급망 통합' 엔비디아가 2H26부터 생산될 VR200 NVL144 랙의 생산량을 대폭 끌어올리기 위해, 공급망 전략을 한층 더 강화할 예정입니다. L10 Compute Tray처럼 핵심 중간 부품을 엔비디아가 직접 공급하고, 서버 ODM는 거의 최종 조립만 집중하도록 공급망을 재편하는 중입니다. NVL72에서 겪은 문제는 NVL144, 288, 576으로 갈수록 더 심화될 우려가 있었는데 이전보다 공급 가시성이 확보된다는 차원에서 중요한 전략 변경이라 생각합니다.​

이 자료에서 다룬 사실

원문은 3Q25 매출 570.1억달러, 데이터센터 매출 512억달러, Non-GAAP GPM 73.6%와 4Q25 매출 650억달러·GPM 75% 가이던스를 제시한다. Blackwell 매출은 410억달러로 추정되고 그중 3분의 2가 B300이며, Rubin은 2H26 양산 예정이라고 전한다.

근거 보기 4
  1. 원문 구간 1

    Thanks to CUDA, the A100 GPUs we shipped 6 years ago are still running at full utilization today, powered by vastly improved software stack. 2025-11-19, 엔비디아 3Q25 실적발표 컨퍼런스 콜 中 엔비디아 3Q25 실적발표 Blackwell/Rubin 26년 말까지 풀부킹, 6년 된 A100도 풀가동 중 이번 분기 - CY3Q25 (FY3Q26) EPS (Non-GAAP) : $1.30 vs 컨센 $1.25 (Beat) (YoY +61%) 매출 : $57.01B vs $55.19B (Beat) (YoY +62%) Compute/DC : $51.2B vs $49.3B (Beat) (YoY +62%) Gaming : $4.3B (YoY +30%) Pro Viz : $760M (YoY +56%) Automotive : $592M (YoY +32%) ​ CY3Q25 마진율 체크 GPM (Non-GAAP) : 73.6% vs 가이던스 73.5% (Beat) ​ 가이던스 - CY4Q25 (FY4Q26) 매출 : $65.0B vs 컨센 $61.98B (Beat) GPM (Non-GAAP) : 75.0% *CY26 GPM도 Mid-70%(74~76%) 유지할 것이라고 전망* ​ 다시 한 번, 단기·장기, 수요·공급·경쟁역량 모두 우수

  2. 원문 구간 2

    Compute와 Networking입니다. ​ Compute 매출이 QoQ +27% 늘면서 매우 좋았습니다. 단일 분기 데이터센터 매출 증가폭 최고치입니다. 3Q Hopper 매출이 $2B였음을 감안하면 Blackwell 관련된 제품의 매출이 $41B라고 추정합니다. Blackwell 매출은 4Q24 $11B → 1Q25 $24B → 2Q25 $28B → 3Q25 $41B로 가파르게 증가했습니다. B300(Blackwell Ultra) 램프업이 매우 순조롭고 빨랐던 영향이 큽니다. B200 대비 B300은 ASP가 20%가량 높고, NVL랙 생산량이 분기에 크게 증가하다보니 Blackwell GPU 판매량만 오르는 것이 아니라 Grace CPU 매출, 랙/시스템 단위 매출이 함께 늘면서 매출 성장이 가팔라지는 효과를 보고 있습니다. Blackwell 판매량 중 3분의 2가 B300이라 했으므로 이번 분기 $13.7B가 B200 + $27.3B가 B300였습니다. ​ Networking 매출도 QoQ +13%로 좋습니다. 네트워킹 매출은 GB200·300 NVL72용 NVLink 패브릭, XDR InfiniBand, Spectrum-X 매출이 함께 성장했습니다. Spectrum-X 매출이 큽니다. 메타, 마이크로소프트, 오라클, xAI가 주요 구매자였습니다. 다만, 출하 시기나 공급 가능성이 전 분기에 비해서 다양해졌습니다. 네트워킹 매출은 대형 클러스터가 언제 온라인되느냐가 중요한데, 이제부터 여러 클러스터가 분기별로 온라인될 예정이다보니 그렇습니다.

  3. 원문 구간 3

    GB300 NVL72 랙 램프업에 문제가 없음은 4Q25 가이던스가 아니라 3Q25에서 미리 확인했기 때문에 좋습니다. Blackwell 매출 중 3분의 2가 B300에서 나왔습니다. 이미 물량의 절반 이상을 차지했으며 양산 단계에 들어갔기 때문에 GB300 NVL72이 매출에서 절반 이상을 차지하는 시점이 한 분기씩 당겨졌습니다. 그래서 이번 분기에 중요도 40%로 가장 중요했던 4Q25 가이던스상 매출은 $65B vs 컨센 $62B, GPM은 75%에 도달하며 꽤나 서프라이즈였습니다. 가이던스를 보수적으로 한다는 걸 감안하면 4Q25에 대략 $67B 이상이 나올 거란 자신감인데 이정도면 2Q25 매출 $46.7B → 3Q25 매출 $57B → 4Q25 매출 $67B이므로 +$10B씩 증가하는 추세입니다. 그리고 영업비용도 $5B로 크게 늘지 않았기에 CY1Q25부터 영업이익 레버리지가 계속해서 커지는 구간입니다. ​ 3. 크게 보고 CY2025~CY2026 수요와 공급 가시성은 어떤가? 중요도 20% Preview 코멘트 : 수요부분에서는 추론 수요 급증과 GPT-7, GPT-8급 모델 훈련을 위한 GW급 클러스터를 만드는 수요가 같이 묶이면서 CY26까지도 GB200·300 NVL72 랙 수요가 꽉찼습니다. Foxconn, Quanta, Wistron은 최근들어서 수요 가시성이 CY27까지 확보되기 시작했다고 말했습니다.

  4. 원문 구간 4

    중국은 $50B 시장. CAGR 50% 예상. 세 가지 네트워킹. H100/H200 매진. AI 투자 가속 ​ 엔비디아, 3Q25 주요 내용 매출 YoY 62%, QoQ 22%. 26년 말까지 Blackwell/Rubin 매출 $500B 가시성 확보. 더 높아질 수 있음. 클라우드 이미 매진. AI Labs ARR 성장 가파름. Agentic AI 확장 중. 기존에 CPU로 실행하던 작업을 CUDA-GPU 기반으로 옮기는 작업 계속. xAI-Humain 0.5GW 구축, AWS-Humain GB300 포함 총 15만 개(대략 0.3GW) 구축 발표. Blackwell 전체 매출의 3분의 2가 GB300으로 참. 램프업 정상. Hopper 3Q에 $2B 매출. H20은 $50M. Rubin은 2H26 양산 예정. 양산 가시성 크게 끌어올림 Blackwell/Hopper/Ampere 등 GPU 모두 가동 중. 6년된 A100도 가동률 매우 높음. 기존 구형 GPU들도 꾸준히 CUDA 업글하여 성능 향상하기 때문에 5~6년보다 훨씬 더 쓰는 상황. 대부분의 가속기는 시간 지나며 Perf/$ 하락. NVLink, Spectrum, InfiniBand 모두 성장. NVLink는 추론에서 엄청난 해자. 따라잡기까지 오랜 시간 걸릴 것. NVDA 찾아오는 플랫폼의 수가 오히려 증가 중. HW / SW / 네트워킹상 ASIC 경쟁력 하락 뷰 유지

그렇게 판단한 이유

B300의 ASP가 B200보다 약 20% 높고 랙 생산 증가가 Grace CPU·네트워킹·시스템 매출을 함께 늘린다는 점, GB300 NVL72의 수율 문제 없이 생산량이 늘고 VR200에는 L10 Compute Tray를 직접 공급하려는 점을 연결한다.

근거 보기 4
  1. 원문 구간 1

    Compute와 Networking입니다. ​ Compute 매출이 QoQ +27% 늘면서 매우 좋았습니다. 단일 분기 데이터센터 매출 증가폭 최고치입니다. 3Q Hopper 매출이 $2B였음을 감안하면 Blackwell 관련된 제품의 매출이 $41B라고 추정합니다. Blackwell 매출은 4Q24 $11B → 1Q25 $24B → 2Q25 $28B → 3Q25 $41B로 가파르게 증가했습니다. B300(Blackwell Ultra) 램프업이 매우 순조롭고 빨랐던 영향이 큽니다. B200 대비 B300은 ASP가 20%가량 높고, NVL랙 생산량이 분기에 크게 증가하다보니 Blackwell GPU 판매량만 오르는 것이 아니라 Grace CPU 매출, 랙/시스템 단위 매출이 함께 늘면서 매출 성장이 가팔라지는 효과를 보고 있습니다. Blackwell 판매량 중 3분의 2가 B300이라 했으므로 이번 분기 $13.7B가 B200 + $27.3B가 B300였습니다. ​ Networking 매출도 QoQ +13%로 좋습니다. 네트워킹 매출은 GB200·300 NVL72용 NVLink 패브릭, XDR InfiniBand, Spectrum-X 매출이 함께 성장했습니다. Spectrum-X 매출이 큽니다. 메타, 마이크로소프트, 오라클, xAI가 주요 구매자였습니다. 다만, 출하 시기나 공급 가능성이 전 분기에 비해서 다양해졌습니다. 네트워킹 매출은 대형 클러스터가 언제 온라인되느냐가 중요한데, 이제부터 여러 클러스터가 분기별로 온라인될 예정이다보니 그렇습니다.

  2. 원문 구간 2

    엔비디아 3Q25 Preview에서 전해드린 것처럼 AI Labs의 ARR 성장세가 얼마나 가파른가가 핵심인데, 계속해서 추정치를 상회하고 있습니다. ​ 공급 : ⓐBlackwell Ultra 서프라이즈 ⓑRubin과 L10 1H26까지 향후 6개월간 엔비디아의 매출 성장에는 GB200·300 NVL72 랙 공급이 얼마나 빠르게 많이 늘어나느냐가 중요합니다. 이후에는 VR200 NVL144가 중요하지만 우선은 NVL 랙 자체에 대한 경쟁역량이 높기에 공급이 늘어나는 만큼 매출로 연결될 것입니다. 이미 수요는 Foxconn, Quanta, Wistron이 말하기로 CY27까지 확보된 상황입니다. 미충족수요가 많아졌으니 공급이 얼마나 원활하게 증가할 수 있느냐에 따라서 엔비디아 입장에서는 아직 업사이드는 조금 더 열려있습니다. ​ 모건스탠리는 공급망 체크를 토대로, NVL 랙 생산량이 3Q25 8,000~8,500개 → 4Q25 14,000~15,000개(중간값 기준: QoQ 76%)로 크게 늘어날 수 있다고 추정합니다. 10월 중순의 OCP Global Summit에서 체크하기로 GB300 NVL72 랙 생산과 관련해서는 수율 문제가 발생한 적이 없으며, 향후 몇 개월간 생산량이 순조롭게 증가할 것으로 예상할 수 있는 상태입니다. 연 단위로 보자면 CY25 28,000개의 NVL랙을 생산하고 → CY26에는 60,000~70,000개의 랙을 생산할 것으로 추정했습니다.

  3. 원문 구간 3

    ​ 순조로운 VR200 NVL144 도입 일정 GB300 NVL72 양산이 매우 순조로움을 확인했기에, 이제 중요한 것은 바톤을 이어갈 VR200 NVL144가 잘 준비되고 있는가인데 이 부분에서도 좋은 내용이 있었습니다. Rubin은 GB200·300 NVL72과 공급망 측면에서 대부분 호환되면서도 '대량 생산에 최적화된 구조로 재설계한(substantially redefined the manufacturability)' 3세대 랙 스케일 시스템이며, Vera Rubin NVL144 랙 설계도를 2025년 7월에 공개했던 만큼 이미 CSP나 주요 데이터센터 운영사들은 VR200을 어떻게 구축 후 실행할 것인지에 대해서 이해하고 있는 상황입니다. ​ 여기서 대량 생산에 최적화된 구조로 재설계했다는 것은, L10 Compute Tray 도입을 의미한다고 봤습니다. ​ VR200 NVL144부터는 랙 생산 극대화를 위해 '공급망 통합' 엔비디아가 2H26부터 생산될 VR200 NVL144 랙의 생산량을 대폭 끌어올리기 위해, 공급망 전략을 한층 더 강화할 예정입니다. L10 Compute Tray처럼 핵심 중간 부품을 엔비디아가 직접 공급하고, 서버 ODM는 거의 최종 조립만 집중하도록 공급망을 재편하는 중입니다. NVL72에서 겪은 문제는 NVL144, 288, 576으로 갈수록 더 심화될 우려가 있었는데 이전보다 공급 가시성이 확보된다는 차원에서 중요한 전략 변경이라 생각합니다.​

  4. 원문 구간 4

    ​ 엔비디아가 이처럼 공급망 장악력을 높이는 데는 두 가지 이유가 있습니다: ​ 생산 병목 해결 : 현재 GB200 NVL72 랙은 Foxconn, Wistron 같은 서버 ODM이 Compute Tray 등을 조립/생산하고 있습니다. 하지만 이 과정에서 수율이 기대만큼 오르지 못하고 생산 병목 현상이 발생하자, 엔비디아는 차세대 랙의 폭발적인 생산량 증가를 위해서는 이 문제를 직접 해결해야 한다고 판단했을 거라 추정합니다. 그리고 앞으로 더욱 더 전력밀도나 냉각밀도가 높아질 것이므로 개별 기업들의 R&D로는 충분히 해결되지 않으니 데이터센터 단위에서도 충분히 잘 작동하도록 하는 과정이기도 합니다. 마진 극대화 : 엔비디아가 L10 Compute Tray를 직접 생산해 공급하면, 더 많은 공급업체가 관여하며 발생하는 변수를 통제할 수 있습니다. 이는 수율과 양산 리드타임을 직접 컨트롤하는 동시에, 기존에 파트너사가 가져가던 마진까지 엔비디아가 흡수할 수 있음을 의미합니다. NVL72를 통해서 NVLink를 Scale-up의 핵심으로 만들고 엔비디아가 그 과정에서 CPU 및 네트워킹 제품에 대한 매출 및 마진을 가져가는 것과도 비슷한 맥락입니다. 물론 이 모든 과정에는 TCO 대비 퍼포먼스를 끌어올리기 위한 고민이 제1이겠지만 그 속에서 매출과 마진에도 순풍이 부는 구조를 설계했습니다.

3
사실·구조, 해석·전망, 시점 관찰, 판단 방법

지식·관점

사건 밖에서도 다시 참고하거나 다른 자료와 비교할 가치가 있는 내용을 대상과 반복 가능한 논점으로 묶습니다.

사실·구조CUDA 설치 기반의 사용 수명주 대상 · 기업·종목 · 엔비디아관련 대상 · 기술·제품 · CUDA

CUDA 생태계는 기존 GPU의 사용 수명과 총소유비용에 어떤 역할을 하는가?

이 자료가 더한 내용

CUDA 호환성과 소프트웨어 최적화가 기존 워크로드 처리량을 높여 A100이 출시 6년 뒤에도 높은 가동률로 쓰인다는 설명을 제시한다.

근거 보기 3
  1. 원문 구간 1

    By executing our annual product cadence and extending our performance leadership through full stack design we believe NVIDIA will be the superior choice for the $3 trillion to $4 trillion in annual AI infrastructure build we estimate by the end of the decade. Demand for AI infrastructure continues to exceed our expectations. The clouds are sold out and our GPU installed base, both new and previous generations, including Blackwell, Hopper and Ampere is fully utilized ​ 매년 X Factor를 내놓으면서 성능을 높이는 것은 달러당 성능을 높이는 동시에 고객의 컴퓨팅 비용을 절감합니다. NVIDIA CUDA GPU의 긴 사용 수명은 가속기 대비 상당한 TCO 절감 효과를 제공합니다. CUDA는 당사의 대규모 설치 기반과 호환되어 NVIDIA 시스템의 수명을 예상 수명보다 훨씬 연장합니다. 당사는 20년 이상 CUDA 생태계를 최적화하여 기존 워크로드를 개선하고, 새로운 워크로드를 가속화하며, 모든 소프트웨어 릴리스를 통해 처리량을 높여 왔습니다.

  2. 원문 구간 2

    CUDA와 NVIDIA의 오랜 시간 동안 검증되고 다재다능한 아키텍처가 없는 대부분의 가속기는 모델 기술이 발전함에 따라 몇 년 만에 쓸모없게 되었습니다. CUDA 덕분에 6년 전 출시된 A100 GPU는 크게 개선된 소프트웨어 스택을 기반으로 오늘날에도 여전히 최대 활용도로 작동하고 있습니다. ​ Our annual X factor performance leap increases performance per dollar while driving down computing costs for our customers. The long useful life of NVIDIA's CUDA GPUs is a significant TCO advantage over accelerators. CUDA's compatibility in our massive installed base, extend the life NVIDIA Systems well beyond their original estimated useful life. For more than 2 decades, we have optimized the CUDA ecosystem, improving existing workloads, accelerating new ones and increasing throughput with every software release. Most accelerators without CUDA and NVIDIA's time-tested and versatile architecture became obsolete within a few years as model technologies evolve.

  3. 원문 구간 3

    Thanks to CUDA, the A100 GPUs we shipped 6 years ago are still running at full utilization today, powered by vastly improved software stack. 2025-11-19, 엔비디아 3Q25 실적발표 컨퍼런스 콜 中 엔비디아 3Q25 실적발표 Blackwell/Rubin 26년 말까지 풀부킹, 6년 된 A100도 풀가동 중 이번 분기 - CY3Q25 (FY3Q26) EPS (Non-GAAP) : $1.30 vs 컨센 $1.25 (Beat) (YoY +61%) 매출 : $57.01B vs $55.19B (Beat) (YoY +62%) Compute/DC : $51.2B vs $49.3B (Beat) (YoY +62%) Gaming : $4.3B (YoY +30%) Pro Viz : $760M (YoY +56%) Automotive : $592M (YoY +32%) ​ CY3Q25 마진율 체크 GPM (Non-GAAP) : 73.6% vs 가이던스 73.5% (Beat) ​ 가이던스 - CY4Q25 (FY4Q26) 매출 : $65.0B vs 컨센 $61.98B (Beat) GPM (Non-GAAP) : 75.0% *CY26 GPM도 Mid-70%(74~76%) 유지할 것이라고 전망* ​ 다시 한 번, 단기·장기, 수요·공급·경쟁역량 모두 우수

판단 방법AI 사용량 지표의 포착 범위주 대상 · 기술·제품 · AI 서비스

API 볼륨 지표는 AI 사용량을 어디까지 보여주는가?

이 자료가 더한 내용

API 기반 외부 애플리케이션 사용량은 자체 앱의 내부 트래픽과 오픈소스 모델의 자체 호스팅을 놓칠 수 있어 전체 사용량의 일부만 보일 수 있다고 설명한다.

근거 보기 2
  1. 원문 구간 1

    오픈AI와 ‘최소’ 10GW 파트너십. 자체 DC 구축 도울 것. 앤트로픽은 처음 NVDA 채택. CUDA 맞춰서 모델 최적화할 것. GB 및 VR에 1GW 컴퓨팅 구축이 포함 딜. 투입비용 오르고 있기는 하지만, 공급망 노력 중이고 CY26 GPM 75% 목표 유지. 전체 공급망에 걸쳐서 Co-design 개념 적용할 것. CUDA 생태계 확장을 위한 투자. Rubin CPX는 긴 컨텍스트 생성에 적합. 긍정적이었던 내용 ⓐ수요: 풀가동, 풀부킹 ⓑ공급: GB300, Rubin ⓒ경쟁역량: NVL, XGS, CPX, Enfabrica *API Volume만 보여주기에 몇 가지 맹점들이 있습니다. 이는 감안하시면서 보셔야 합니다. ​ 자체 앱 사용량 데이터 누락 (First-Party) : 이 차트는 API, 개발자들이 외부 애플리케이션(Cursor, Windsurf, Notion)에서 LLM을 호출하는 사용량만을 집계합니다. 실제 LLM 사용량의 가장 큰 부분은 오픈AI의 ChatGPT 및 Codex, 구글이 직접 서비스하는 양, 메타가 자체 Recommend and Ranking 알고리즘에 쓰는 양입니다. 이런 내부 트래픽은 API 판매 볼륨으로 잡히지 않으니 빙산의 일각(B2B 개발자 시장)만을 보여줄 가능성이 큽니다. 오픈소스 모델 중 일부 워크로드 누락 (Self-Hosting) : 마찬가지로 API 판매를 우선하는 특정 기업들의 볼륨을 추적하기에 DeepSeek, Qwen, Llama 등 오픈소스 모델을 자체 서버에 직접 설치하여 사용하는 경우에는 외부 API를 호출한 것이 아니므로 집계되지 않습니다.

  2. 원문 구간 2

    2025년 초 이후에 중국 내 프론티어 AI 연구소들이 DeepSeek, Qwen, Kimi 등 상당히 쓸만한 오픈소스를 많이 출시했고 그 결과 최근에는 Airbnb, Pinterest 등 미국 기업들도 비용 효율성을 위해 오픈소스 모델을 채택하여 쓰고 있습니다. 이런 기업이 늘어날 수록 이 차트에 포착되지 않는 AI 사용량의 비중은 더 커집니다. ​ 수요 : ⓐ6년 전 A100도 '풀가동' ⓑBlackwell/Rubin '풀부킹' 이번 실적발표에서 젠슨황이 "6년 전 출시된 A100도 여전히 최대 가동률(the A100 GPUs we shipped 6 years ago are still running at full utilization today)로 작동하고 있다."고 말했습니다. ​ '6년 전 A100도 풀가동 중' H100, H200, B200의 Spot 가격이 8~9월부터 매월 계속해서 증가하는 중입니다. H100, H200은 신규 공급이 크게 줄어든 상황에서 수요가 늘어나다보니 가격 상승이 잘 드러나고, B200은 온라인되는 양이 점점 더 많아짐에도 불구하고 8~9월 가격대인 $12에 비해서 크게 상승한 $20~$25를 오가고 있습니다. ​ 코어위브는 3Q에 수요가 대폭발하기 전 2Q25부터 이미 A100, H100도 6~7년치 계약을 맺고 추론 수요로 수익화 중이라고 언급했고, 11월 10일의 3Q25 실적발표에서도 H100 재계약을 하는 과정에서 수요가 매우 높다보니 2개 분기 전부터 원 계약가격에 비해서 5%정도만 할인한 금액에서 계약이 체결되었다고 말했습니다.

사실·구조추론용 Scale-up의 경제성주 대상 · 기업·종목 · 엔비디아관련 대상 · 기술·제품 · AI 추론 인프라

대규모 추론에서 처리량·지연시간·동시접속은 왜 함께 평가해야 하는가?

이 자료가 더한 내용

추론은 처리량·지연시간·동시접속을 동시에 맞춰야 하며, 원문은 NVL72의 All-to-All 연결이 NVL8 대비 추론 경제성을 높이는 이유로 이 세 축을 든다.

근거 보기 5
  1. 원문 구간 1

    ​ IT HW/SW 분야에서 스케일 업Scale-Up은 기존 서버의 사양을 업그레이드함으로써 시스템을 확장하는 걸 말합니다. 수직적인 성능 향상입니다. 스케일 아웃Scale-Out은 서버를 여러 대 추가함으로써 시스템을 확장하는 걸 말합니다. 수평적인 성능 향상입니다. 엔비디아는 '스케일 아웃 전에 스케일 업이 중요하다'는 생각인데 여기서 가장 중요한 것이 GB200 NVL72입니다. 단일 GPU들을 넘어서 하나의 서버에 있는 모든 GPU를 하나의 GPU처럼 가동되게 만든 NVLink 서버로서 성공한 제품이기 때문입니다. NVLink에 대한 언급 ​ "NVLink는 현재 시중에서 유일하게 검증된 Scale-up 기술입니다. <학습> 최신 MLPerf 학습 결과에서 Blackwell Ultra는 Hopper보다 5배 빠른 학습 속도를 보였습니다. NVIDIA는 모든 벤치마크를 휩쓸었습니다. 특히 NVIDIA는 MLPerf의 엄격한 정확도 기준을 충족하면서 FP4를 활용하는 유일한 학습 플랫폼입니다. <추론> InferenceMAX 벤치마크에서 Blackwell은 모든 모델과 사용 사례에서 최고의 TCO 대비 퍼포먼스를 달성했습니다. 특히 전 세계에서 가장 널리 사용되는 추론 모델의 아키텍처인 MoE에서 Blackwell의 NVLink의 성능이 매우 중요합니다." ​

  2. 원문 구간 2

    "GB200, GB300은 엔비디아가 가진 Scale-up Network NVLink72 덕에 엄청난 성능을 낼 수 있음이 분명해졌습니다. 이는 큰 도약입니다. 누군가가 이를 따라잡기까지는 오랜 시간이 걸릴 것입니다. 엔비디아의 선도적 지위는 확실히 수년간(surely multiyear) 유지될 것입니다. 따라서 추론이 매우 중요한 분야가 되길 기대합니다. 추론 분야에서의 우리의 리더십은 탁월합니다." 2025-11-19, 엔비디아 3Q25 실적발표 中 Scale-up (NVL72) : 추론의 시대에 빛을 보다 위의 차트는 100MW 규모 AI 팩토리를 서로 다른 벤더의 서버 랙으로 구성했을 때의 수익성을 보여줍니다. 여기서 수익성이란 백만 토큰당 가격 기준으로 계산된 것입니다. 같은 비용으로 얼마나 많은 토큰을 처리할 수 있느냐가 곧 퍼포먼스이며 이를 기반으로 TCO(총소유비용)와 이익률이 산출한 것입니다. 그래서 종합적으로 퍼포먼스 대비 TCO가 GB200 NVL72가 압도적으로 좋다는 의미입니다. ​ GB200 NVL72 / 유일한 All-to-All 연결을 가능케 하는 NVLink 추론이 극한의 컴퓨팅인 이유는 토큰을 생성하는 것이 최종 고객인 기업들의 매출과 직결되기 때문입니다. 서비스 품질이나 수익성에 영향을 미치기 때문에 극한의 성능과 효율성 하에서 구축되어야 합니다.

  3. 원문 구간 3

    ​ 추론의 시대에 가장 중요한 가치는 "달러당 초당 몇 개의 토큰을 생성하여 몇 명의 사용자에게 어느 정도의 지연속도로 서비스 할 수 있는가"입니다. Groq/Cerebras가 더 우수하다거나, 하이엔드 GPU 없이도 로컬 LLM을 소비자용 GPU로 충분히 돌릴 수 있다는 주장들이 실제 기업들의 채택으로 이어지지 않는 이유들은 현실적인 배포 환경과 달라서 그렇습니다. ⓐThroughput ⓑLatency ⓒInteractivity 중 하나의 축을 생략하고 얘기하기 때문입니다. ​ 실제 LLM 서비스를 제공할 때는 ⓐ매우 큰 Batch size를 통해 Throughput을 극대화하고, 동시에 ⓑLatency는 낮게 유지(빠른 답장)하며, ⓒ서버당 더 많은 사용자(높은 동시접속, Interactivity)를 수용해야 하기 때문에 All-to-All 네트워킹 규모가 클수록 동일 성능 대비 TCO가 좋아집니다. ​ *왼쪽 → 가로(X)축은 사용자 한명당 토큰을 생성하는 양입니다. 한 명에게 더 많이 토큰을 빠르게 만들어줄 수록 사용자 경험이 좋아지고, 혹은 더 많은 컴퓨팅을 배정함으로써 더 똑똑한 품질의 답변을 제공할 수 있습니다. 세로(Y)축은 서버 구축에 들인 달러당 초당 토큰 생산량을 의미합니다. Batch Size는 한 번에 병렬로 처리하는 사용자 요청 수를 의미합니다.

  4. 원문 구간 4

    예를 들어 여러 사용자가 챗봇이나 AI 모델에 동시에 질문을 한다고 가정하면 GPU는 이 요청을 일정한 개수씩 묶어서 한 번에 처리합니다. Batch size가 클수록 좋지만 너무 커지면 사용자 1명당 반응속도가 느려질 겁니다. ​ *오른쪽 → 두 가지 차트가 보이실 겁니다. 왼쪽 차트는 기존 HGX H100/H200 NVL8 서버에서 Reasoning 워크로드를 구동했을 때의 ⓐbatch size ⓑLatency ⓒInteractivity 차트를 보여주는 겁니다. ⓐⓑⓒ 세 가지 축 사이에서 '달러당 초당 몇 개의 토큰을 생성하여 몇 명의 사용자에게 어느 정도의 지연속도로 서비스 할 수 있는가'를 놓고 최고의 값이 나오는 ⓐⓑⓒ 세팅을 하는 것이 추론의 핵심입니다. 오른쪽 차트는 새로운 GB200 NVL72 서버에서 Reasoning 워크로드를 구동했을 때의 ⓐⓑⓒ 세팅입니다. 추론 시 Hopper NVL8에 비해 Blackwell NVL72에서 40배 가까이 경제성이 좋아졌습니다. Hopper → Blackwell 향상도 있지만 추론 시 NVL8에 비해서 NVL72를 All-to-All 연결함으로 인해서 나오는 추론의 경제성 향상도 상당하다는 의미입니다. ​ 이때 NVLink만이 All-to-All 연결을 가능케하는 유일한 기술이기에 NVLink가 Scale-up 전략이 핵심입니다.

  5. 원문 구간 5

    Reasoning 워크로드는 쿼리당 요구 컴퓨팅·메모리가 기존 대비 10배(1,000 → 10,000) 증가하고, 서버당 수용 가능한 사용자 수는 1/4 수준(256명 → 64명)으로 줄어드는 등 부담이 40배 증가하게 됩니다. 이런 상황에서는 기존 8개의 GPU로는 능력이 떨어집니다. 72개의 GPU가 하나의 GPU처럼 메모리를 공유하면서 동일 문제를 매우 낮은 지연시간으로 처리할 수 있습니다. ​ Scale-across : Scaling Law를 이어가기 위한 새로운 네트워크 사전훈련의 스케일링 법칙(사후훈련, 추론의 스케일링 법칙은 따로 있습니다)에 따르면 투입되는 연산량(FLOPS), 데이터, 파라미터의 규모가 커질수록 AI 모델의 지능은 고도화되고 창발적으로(Emergent) 새로운 능력이 생겨납니다. 이를 위해 AI 업계는 데이터센터 용량을 50MW에서 1GW까지 늘리며 인프라를 확장해 왔습니다. 어느 시점까지는 단일부지에서 용량을 늘리는 게 효율이 높습니다. 하지만 전력 수급과 냉각 효율의 한계로 인해 단일 부지에서 3GW, 5GW, 10GW로 무한정 확장하는 것은 물리적으로 거의 불가능하고 효율이 크게 떨어집니다. ​ 추론은 각 요청이 독립적이라 상대적으로 유연하게 적용할 수 있습니다. 문제는 추론(Inference)이 아닌 사전훈련(Pre-training)에 적용할 때 발생합니다.

해석·전망AI 데이터센터의 Scale-across주 대상 · 기술·제품 · AI 데이터센터관련 대상 · 기업·종목 · 엔비디아

사전훈련 규모가 커질 때 데이터센터 간 연결은 어떤 병목을 다루는가?

이 자료가 더한 내용

단일 부지의 전력·냉각 한계와 멀리 떨어진 데이터센터 간 지연을 사전훈련의 병목으로 설명하고, Spectrum-XGS와 NCCL 업데이트를 여러 시설의 컴퓨팅 연결을 위한 준비로 해석한다.

근거 보기 4
  1. 원문 구간 1

    Reasoning 워크로드는 쿼리당 요구 컴퓨팅·메모리가 기존 대비 10배(1,000 → 10,000) 증가하고, 서버당 수용 가능한 사용자 수는 1/4 수준(256명 → 64명)으로 줄어드는 등 부담이 40배 증가하게 됩니다. 이런 상황에서는 기존 8개의 GPU로는 능력이 떨어집니다. 72개의 GPU가 하나의 GPU처럼 메모리를 공유하면서 동일 문제를 매우 낮은 지연시간으로 처리할 수 있습니다. ​ Scale-across : Scaling Law를 이어가기 위한 새로운 네트워크 사전훈련의 스케일링 법칙(사후훈련, 추론의 스케일링 법칙은 따로 있습니다)에 따르면 투입되는 연산량(FLOPS), 데이터, 파라미터의 규모가 커질수록 AI 모델의 지능은 고도화되고 창발적으로(Emergent) 새로운 능력이 생겨납니다. 이를 위해 AI 업계는 데이터센터 용량을 50MW에서 1GW까지 늘리며 인프라를 확장해 왔습니다. 어느 시점까지는 단일부지에서 용량을 늘리는 게 효율이 높습니다. 하지만 전력 수급과 냉각 효율의 한계로 인해 단일 부지에서 3GW, 5GW, 10GW로 무한정 확장하는 것은 물리적으로 거의 불가능하고 효율이 크게 떨어집니다. ​ 추론은 각 요청이 독립적이라 상대적으로 유연하게 적용할 수 있습니다. 문제는 추론(Inference)이 아닌 사전훈련(Pre-training)에 적용할 때 발생합니다.

  2. 원문 구간 2

    사전훈련은 수조~수십조 개의 파라미터를 쪼개서 학습하므로, GPU 간의 통신 빈도가 매우 높습니다. 만약 데이터센터 A와 B가 100km 떨어져 있다면, 빛의 속도 제약에 따른 지연 시간(Latency) 동안 수십만 개의 GPU가 멈춰 서는 유휴상태가 발생하게 되며, 이는 치명적인 비효율로 이어집니다. 수십조원을 들인 데이터센터이다보니 가동률에 민감할 수밖에 없습니다. ​ 그렇다면 지금 1GW 데이터센터로 GPT-6을 훈련한다고 가정하면, 그 후의 GPT-7, GPT-8, GPT-9를 사전훈련하기 위해서는 더 많은 컴퓨팅을 연결하는 것이 필수적입니다. 데이터센터를 짓는 데 시간이 최소 12~18개월은 필요할 것이므로 2027~8년에 훈련할 모델의 데이터센터 및 컴퓨팅 계획을 2026년에는 세워야 한다는 의미입니다. 이 과정에서 시장을 주도하고 있는 엔비디아 입장에서는 1~2년 뒤에 다가올 것으로 예상되는 사전훈련 스케일링 법칙의 물리적 병목을 막기 위해 미리 준비하는 전략이 Scale-across입니다. ​ GPT-6가 1GW 데이터센터 시대를 열었다면, GPT-7과 그 이후 모델들은 필연적으로 그 이상의 컴퓨팅 파워를 요구합니다. 하지만 데이터센터는 하루아침에 지어지지 않습니다. 건설에만 최소 12~18개월이 걸릴 인프라의 특성상, '27~28년의 AI 패권을 쥐기 위한 인프라 투자는 당장 '26년에 결정되어야 합니다.

  3. 원문 구간 3

    이 시점에서 엔비디아의 Scale-across 의미는 명확합니다. 곧 다가올 단일 부지 확장의 한계라는 물리적 병목을 해결하지 못하면 AI의 발전도 멈추게 될 것이므로 엔비디아는 이 병목을 뚫어낼 네트워크 기술을 미리 준비함으로써, 고객들이 끊김 없이 다음 단계의 스케일링 경쟁에 진입할 수 있도록 판을 깔고 있는 것입니다. ​ Spectrum-XGS, Scale-across를 위한 방법 엔비디아가 먼 거리의 데이터센터들을 하나처럼 엮어 훈련용 컴퓨팅 클러스터로 쓸 수 있게 2025년 8월 24일, Hot Chips에서 Spectrum-XGS를 출시했습니다. 전력 병목을 줄일 수는 없지만 다소 완화(그렇다고 너무 작은 클러스터 여럿을 묶는 건 복잡성 비용이 더 늘어날 것)하고, 데이터센터 단위의 경쟁으로 나아가기 위함입니다. 100만 개 GPU 클러스터 시대를 맞이하기 위한 준비는 차곡차곡 되고 있습니다. GPT-7, GPT-8, GPT-9를 맞이하기 위한 X Factor입니다. ​ ⓐ5월 8일, 엔비디아가 자체적으로 NVIDIA Nemotron-4 340B를 1,000km 가까이 떨어진 두 개의 클러스터에서 End-to-End 21ms정도의 지연시간으로 단일 사이트 Throughput 96%정도를 유지하며 모델을 훈련시킨 내용을 공개한 바 있습니다.

  4. 원문 구간 4

    엔비디아는 동일한 접근 방식으로 궁극적으로 여러 시설에 걸쳐 50만 개 이상의 GPU를 조정할 수 있다고 주장했습니다. ⓑ7월 14일에는 엔비디아의 네트워킹에서 사용하는 라이브러리인 NCCL에서도 데이터센터를 오가며 훈련할 수 있도록 업데이트했습니다. ​ 몇 년째 많은 사례들을 통해서 말씀드리곤 하지만, 엔비디아는 고객의 개발자들과 일선에서 함께 협력하며 판을 짜고 있기 때문에 계속해서 새로운 X Factor를 찾아내고 계속해서 해자를 강화해왔습니다. 고민을 같이 해결하면서 새로운 제품이 나오고 새로운 라이브러리가 나오는 것입니다. ​ 엔비디아는 Spectrum-XGS, NCCL/NeMo를 통해서 데이터센터의 전체를 기준으로 TCO 대비 퍼포먼스 차원에서 이점을 가져갑니다. GPU의 연산에 병목이 되거나 비효율적인 '모든 것'을 효율화하는 중입니다. GPU 가동률을 높이면 GPU를 구매하는 사람들의 수익창출 능력이 좋아지니 엔비디아의 제품을 선호하게 되는 효과로 남습니다. GPU 경쟁을 넘어 → 랙 경쟁 → 데이터센터 단위 경쟁으로 경쟁의 축을 이동시키는 과정입니다. ​ 추론의 시대를 위해 따로 준비한 칩 : Rubin CPX Rubin CPX(4Q26 출시 예정)는 분산 추론(Disaggregated Inference)의 시작을 알린 칩입니다.

사실·구조분산형 추론 아키텍처주 대상 · 기술·제품 · Rubin CPX관련 대상 · 기업·종목 · 엔비디아

Prefill과 Decode를 분리하면 어떤 자원 배분을 목표로 하는가?

이 자료가 더한 내용

CPX는 계산량이 큰 Prefill을, Rubin GPU는 메모리 대역폭이 필요한 Decode를 맡기고 소프트웨어 라우팅과 KV Cache 관리로 GPU 메모리와 자원을 배분하는 구조로 설명한다.

근거 보기 2
  1. 원문 구간 1

    Transformer 계열 LLM의 추론은 크게 두 가지 작업으로 분리됩니다. Prefill과 Decode입니다. ​ 워크로드별로 특징을 보면 Prefill은 컴퓨팅이 많이 필요하고, 상대적으로 메모리 대역폭은 낮아도 됩니다. 그래서 비싼 HBM을 사용하는 대신 CPX에는 128GB GDDR7(대역폭 2TB/s)을 탑재했습니다. HBM 절반 가격으로 만든 칩이고, R200 GPU 대비 4분의 1 가격으로 동일 작업을 수행합니다. 그리고 Decode는 메모리 대역폭을 많이 필요로 합니다. HBM에 적합하기에 R200에는 여전히 288GB HBM4(대역폭 20.5TB/s)가 탑재됩니다. ​ 기존의 방식은 Aggregated로, Prefill 및 Decode 작업을 단일 GPU에서 동시 처리하는 식이었습니다. Prefill은 계산량이 많아 병렬성이 낮고, Decode는 KV Cache를 사용할 수 있기 때문에 병렬성이 상대적으로 높은 워크로드입니다. 문제는 단일 아키텍처이기 때문에 유연성이 부족하고 병목이 생긴다는 점이 문제였습니다. ​ 새로운 방식은 Disaggregated로, Prefill과 Decode 작업 중에 Prefill을 전용 하드웨어로 분리하는 게 핵심입니다. Prefill에 맞게 따로 특화시킨 CPX 칩에서 계산에 최적화된 작업을 하고, 병렬성이 높은 Decode 작업은 기존 Rubin GPU에 배정하는 것입니다.

  2. 원문 구간 2

    이렇게 되면 KV Cache를 HBM 대신 GDRR7처럼 더 저렴한 스토리지로 옮겨서 GPU 메모리를 확보할 수 있게 됩니다. 워크로드에도 다양한 하드웨어간 스마트 라우팅으로 유연한 확장을 할 수 있다는 게 핵심입니다. ​ 이를 위해 엔비디아는 소프트웨어 레벨에서 ⓐSmart Router, ⓑKV Cache Manager, ⓒGPU Resource Planner를 추가하여 LLM 추론 과정에서 Prefill과 Decode를 분산하여 처리하고, KV Cache를 GPU 메모리에서 오프로딩하여 GPU 리소스를 최적화하는 아키텍처입니다. 이렇게 하면 대규모 사용자 처리, 모델 확장성, 리소스 효율성이 모두 개선됩니다. 이전에 비해 Prefill 비용이 절감되므로 ROI가 30~50배 증가하고, 전체 시스템 단위 효율은 3~7.5배 좋아졌습니다. ​ 기존의 칩들과 전혀 다른 구조이기 때문에 이제 모든 ASIC 플레이어들은 엔비디아와의 'TCO 대비 퍼포먼스' 비교에서 엔비디아를 따라가기 위해 자체적인 Prefill ASIC을 동시에 개발해야 하는 상황이 시작됐습니다. 그리고 이제 추론에서도 엔비디아가 깔아둔 분산형 추론 설계를 채택할 경우 훨씬 더 TCO 대비 퍼포먼스가 우수해질 것입니다. 추론이 점점 복잡해질수록 훈련에서처럼 엔비디아가 가진 하드웨어·소프트웨어·네트워킹·공급망 관리 차원의 해자가 점점 더 강해질 것으로 예상합니다.

해석·전망엔비디아 마진과 수출정책의 조건주 대상 · 기업·종목 · 엔비디아관련 대상 · 거시·정책 · 미국 AI 하드웨어 수출정책

투입비용 상승과 GAIN Act 논의는 수익성과 시장 접근에 어떤 조건을 더하는가?

이 자료가 더한 내용

CFO의 비용절감·제조시간 단축·제품 믹스 계획을 CY26 GPM 75%대 유지의 조건으로, GAIN Act를 미국 하이퍼스케일러 의존과 비미국 시장의 세대 격차 우려로 정리한다. 행정부의 제동 보도는 반대 방향의 근거로 함께 든다.

근거 보기 4
  1. 원문 구간 1

    ​ 엔비디아 CFO는 CY26를 전망할 때, 투입 비용이 증가하고 있음을 말했습니다. "투입 비용이 증가하고 있지만 GPM을 내년에도 75%대로 유지하기 위해서 노력하고 있다"는 것입니다. ​ 이에 대해서 CFO는 ⓐ비용 절감(더 저렴한 메모리 사용) ⓑ제조시간 단축(같은 기간동안 더 많은 제품을 팔아서 고정비 줄이는) ⓒ제품 Mix 최적화(더 비싼 제품 판매)로 대응하여 CY26에도 GPM 75%를 유지하겠다는 계획입니다. 여기서 가격이 더 올라간다면 부담이 될 수 있겠지만 우선은 여러 수단을 써볼 수 있는 단계라고 답했습니다. 지금 당장으로서는 기대할 수 있는 답변 중에서 그나마 긍정적인 답변이었습니다. ​ 강도로 보자면 BOM에서 차지하는 HBM 비중이 높을수록 문제입니다. 칩을 넘어서, 랙 단위 제품으로 판매하는 물량을 늘리고 있고 NVDA 입장에서는 상대적으로 덜하고, 가속기 중에서 HBM 비중이 높은 AWS Trainium, AMD 등이 상대적으로 영향을 많이 받는 구조일 것으로 봅니다. 구글 TPU가 상대적으로 유리한 구조이나 엔비디아도 상대적으로 가장 열위에 있진 않습니다. 그리고 엔비디아 입장에서는 계속해서 X Factor를 추가한 효과로 TCO 대비 퍼포먼스에서 경쟁력이 더 높아지고 → 그 결과 수요가 계속해서 높은 상태를 유지한다면 → 일부 가격인상을 통해서 고객들에게 전가할 수 있을 것이라 예상합니다.

  2. 원문 구간 2

    ​ GAIN Act의 문제: ⓐ하이퍼스케일러 의존 ⓑNon-US 시장점유율 우려 Up GAIN Act를 간단히 설명하면, AI HW 수요를 충족시킴에 있어서 미국에 컴퓨팅을 우선적으로 할당하고 다 배부르게 채우고 나면 Non-US로 수출하기 시작하라고 강제하는 법안입니다. ​ 2H24부터 엔비디아는 이미 모든 하이퍼스케일러들에게 정가로 판매하고 있기 때문에 GPM이나 매출에 영향이 오진 않는데, 문제는 이렇게 되면 Non-US는 계속해서 미국 수요를 충족시키고 나서 할당받기에 Non-US 고객들에게는 TCO 대비 퍼포먼스 경쟁력상 늘 0.5~1.0세대 가까이 뒤처질 것으로 예상된다는 점이 문제였습니다. 예를 들어, CY26까지 미국 수요를 다 채우고 나서 CY27부터 GB300 NVL72를 판매해야 하는 상황이 된다는 의미입니다. ​ 예상되는 문제 #1 - 미국 하이퍼스케일러 의존도 증가 GAIN Act를 실시하면 계속해서 미국에 있는 소수의 하이퍼스케일러 수요에만 의존하는 효과가 생긴다는 점이 엔비디아 입장에서는 좋지 않습니다. 하이퍼스케일러들은 이를 찬성했습니다. 하이퍼스케일러나 AI Labs들은 AI Diffusion Rule에 대해서도 중립 이상의 찬성 모습을 보였는데 같은 맥락입니다.

  3. 원문 구간 3

    가장 먼저 가장 좋은 칩을 할당받겠다는 니즈입니다. ​ 엔비디아는 2023년 AI Boom 초입에 더 많은 기업들이 NVDA 컴퓨팅에 직접 접근할 수 있도록 하고자(= 하이퍼스케일러에 의존하는 상황을 타개하고자) 전략적으로 네오클라우드를 키웠던 것처럼 엔비디아는 최대한 많은 산업, 최대한 많은 기업, 최대한 많은 사용 사례에 채택될수록 협상력이 올라가는 구조(NVDA vs ASIC)입니다. ​ 예상되는 문제 #2 - 화웨이는 놀고 있지 않다 조금 더 실존적인 위협은 2~3년 멀리 생각하면 화웨이에게 Non-US 시장을 뺏길 우려가 매우 높아진다는 점입니다. 화웨이가 제조능력을 올려서 첨단의 시스템을 Non-China로 충분히 판매할 수 있게 된다고 가정하면, 엔비디아 입장에서는 0.5~1세대 가까이 뒤처진 칩과 화웨이의 첨단의 시스템을 경쟁시켜야 하므로 Non-US 중 다소 중립적인 동남아시아, 중동, 아프리카, 남미에서 시장을 뺏길 우려가 커지기 때문에 문제였습니다. 분명 규제 강도는 다르지만 효과는 Diffusion Rule에서 겪었던 문제와 유사합니다. ​ 다행인 소식: 트럼프, GAIN Act 반대할 듯 다행인 것은 오늘 실적발표만큼이나 좋았던 뉴스가 있는데, Axios 보도에 의하면 트럼프 행정부가 직접 나서서 "GAIN Act는 외교 관계와 산업계에 지나친 부담을 준다"며 제동을 걸고 있다는 내용입니다.

  4. 원문 구간 4

    수출 통제의 유연성이 확보되면서, 향후 글로벌 시장에서의 점유율 방어에 긍정적인 영향을 미칠 것으로 보입니다. ​ 그리고 The Verge 보도에 의하면, 이번주 금요일에 트럼프는 캘리포니아 주 같은 곳에서 주 단위로 AI 규제 법률제정 시도를 불가능하게 만드는 행정명령에 서명할 예정입니다. GAIN Act까지 문제가 될 수 있었던 것들은 아니지만 주별로 AI 규제 법률을 만드는 것이 AI 발전에 걸림돌이 될 수 있었는데 이들을 모두 없애주는 것입니다. ​ 투자의 생각 : 엔비디아(NVDA) ​ 엔비디아(NVDA) 25년 PER 40배, EPS CAGR 3Y 60%, PEG 0.67배 : 실적발표 이후에도 Overweight를 유지합니다. 향후 5년 동안 누적 AI CAPEX가 $5T일 가능성에 대해서 여전히 그럴 가능성이 꽤 있다고 보고 있습니다. 이번 실적발표는 Preview에서 전해드린 것처럼 AI 수요 쓰나미를 확인한 시대에 갖게 되는 몇 가지 질문들에 답한 내용이 많았습니다. ⓐAI 사이클의 수요는 어디서 나와서 어떻게 흐르는가?

4

시간흐름대로 모든 내용을 살려 정리

시간흐름대로 모든 내용을 살려 정리

1
원문 흐름 1

[원문 유형] 네이버 프리미엄 콘텐츠
[채널] 올바른 미국주식 by SAPIENS
[게시일] 2025.11.20. 오후 8:00
[원문 URL] https://contents.premium.naver.com/sapiens/sapiensasset/contents/251120200003053ru
[제목] 엔비디아 3Q25 실적발표 : 2026년 말까지 "SOLD OUT", 젠슨황이 $500B 매출을 확신하는 이유
[수집 기준] 승인된 구독 열람권으로 실제 본문을 보존했다. 이미지·첨부는 별도 미디어 원장에 보관하며 시각적 의미 검토 여부를 구분한다.

[구독 원문 본문]
​

안녕하세요 사피엔스입니다.

​

엔비디아의 3Q25 실적을 요약하면 "풀부킹, 풀가동"입니다. 6년 된 A100이 풀가동 중이고, CY2026 말까지 Blackwell/Rubin 수요가 풀부킹 상태입니다. 수요 초과가 점점 더 짙어지고 있습니다.

​

사람들은 추론의 시대가 오면 엔비디아의 점유율이 줄어들 거라 예상상했지만, 추론의 시대에 경쟁사가 엔비디아를 뛰어넘지 못하고 있는 이유가 있습니다. 3Q25에만 새로운 X Factor들이 3가지 추가됐습니다.

​

CY27 이후를 내다보며 미래를 그려나가는 중입니다. 오픈AI/앤트로픽 투자를 통해서 CUDA의 생태계는 더욱 확장되고 있고, GPT-7 이후의 시대, Agentic AI 워크로드가 폭증할 시대를 미리 내다보는 중입니다.

​

2
원문 흐름 2

엔비디아 (NVDA) 실적발표

2025-11-16

엔비디아 3Q25 Preview : 모두가 느끼는 '수요 쓰나미' AI CAPEX $5T를 향한 의문의 답 (바로가기)

2025-08-28

엔비디아 2Q25 실적발표 : Blackwell 12개월치 SOLD OUT, AI CAPEX $3~4T를 말하다 (바로가기)

실적 외 엔비디아 분석자료

2025-10-22

AI 반도체 시장의 재편 : 엔비디아의 질주, 앤트로픽의 AGI, 마벨/아스테라랩스의 고민 (바로가기)

2025-10-15

엔비디아 펀더멘탈 체크 : Rubin 양산 지연 가능성, 대만 공급망 체크 (바로가기)

2025-10-03

엔비디아 CEO 젠슨황 인터뷰 : 오픈AI 10GW 동맹 x 극한의 풀스택 공동 설계 (바로가기)

2025-09-26

AI 사이클 한 눈에 보기, SemiAnalysis 인터뷰 : 승부사 젠슨황 그리고 화웨이의 역습 (바로가기)

3Q25 실적발표 모음

2025-11-13

디로컬 3Q25 실적발표 : 겉(Take Rate)과 속(TPV +60%)이 달랐던 실적, 무엇을 믿나? (바로가기)

2025-11-12

씨리미티드 3Q25 실적발표 : 해자를 더하는 시간, 성장의 지속성을 택한 이유 (바로가기)

2025-11-06

로빈후드 3Q25 실적발표 : 폴리마켓을 넘어서는 Robinhood Prediction (바로가기)

3
원문 흐름 3

2025-11-05

AMD 3Q25 실적발표 : 오픈AI와 깐부를 맺다, "11월 11일을 기대해주세요" (바로가기)

2025-11-04

마이크로소프트 3Q25 실적발표 : 오픈AI가 주도하는 스타게이트에 업혀가는 MSFT (바로가기)

2025-10-31

트랜스메딕스 3Q25 실적발표 : 계절성 종료, 다년간의 장기 성장 가시성 UP (바로가기)

2025-10-30

구글 3Q25 실적발표 : AI ARR $13B 돌파, 검색엔진이 다시 성장 엔진이 됐다 (바로가기)

2025-10-29

블룸에너지 3Q25 실적발표 : Beyond 2GW⚡️ 선언, 세 번째 하이퍼스케일러의 힌트 (바로가기)

2025-10-24

버티브 3Q25 실적발표 : 엔비디아와 함께 액체냉각 100% 시대를 향해서 갑니다 (바로가기)

2025-10-23

테슬라 3Q25 실적발표 : 머스크의 새로운 24개월 로드맵, 합리적인 기대는 어디일까? (바로가기)

2025-09-24

마이크론 3Q25 실적발표 : 클라우드 매출 YoY 214%, 숫자보다 '이유'가 더 중요하다 (바로가기)

2025-09-10

오라클 3Q25 실적발표 : "모두가 다가오는 쓰나미🌊의 규모를 이해하는 건 아닙니다" (바로가기)

투자자문 서비스에 따른 투자 시 원금 손실이 발생할 수 있으며, 투자 손익에 대한 책임은 전적으로 고객에게 귀속됩니다.

4
원문 흐름 4

또한 과거의 투자수익이 미래의 수익률을 보장하지 않습니다.

​

신규 구독 전에, 아래 투자자문계약 권유문서의 계약 관련 제반 사항을 반드시 읽으시고 충분히 검토하시기 바랍니다.

​

*투자자문계약 권유문서 : https://naver.me/5ZST47Qf

목차

​

엔비디아 3Q25 실적발표 : Blackwell/Rubin 26년 말까지 풀부킹, 6년 된 A100도 풀가동 중

Preview 자료와 비교 : 어떤 부분이 좋고, 어떤 부분은 기대에 못미쳤나?

어닝콜 정리 : 훈련은 균열 없고, 추론의 시대에 경쟁역량은 더 강화되는 중

긍정적이었던 내용 : 핵심 펀더멘탈 체크 ⓐ수요 ⓑ공급 ⓒ경쟁역량

부정적이었던 내용 : CY26 GPM 75% 유지, GAIN Act의 불확실성

투자의 생각 : 엔비디아(NVDA)

현재 우리는 올해 초부터 2026년 연말까지 Blackwell & Rubin에서 $500B 매출을 달성할 것으로 예상합니다. 연간 제품 주기를 실행하고 풀 스택 설계를 통해 성능 리더십을 확장함으로써 NVIDIA가 2020년대 말까지 예상되는 연간 3조~4조 달러 규모의 AI 인프라 구축을 위한 더 나은 선택이 될 것이라고 믿습니다. AI 인프라 수요는 예상을 뛰어넘고 있습니다. 클라우드는 이미 매진되었고, Blackwell, Hopper, Ampere를 포함한 기존 및 신형 GPU 설치 기반은 이미 풀가동되고 있습니다.

​

We currently have visibility to $0.5 trillion in Blackwell and Rubin revenue from the start of this year through the end of calender year 2026.

5
원문 흐름 5

By executing our annual product cadence and extending our performance leadership through full stack design we believe NVIDIA will be the superior choice for the $3 trillion to $4 trillion in annual AI infrastructure build we estimate by the end of the decade. Demand for AI infrastructure continues to exceed our expectations. The clouds are sold out and our GPU installed base, both new and previous generations, including Blackwell, Hopper and Ampere is fully utilized

​

매년 X Factor를 내놓으면서 성능을 높이는 것은 달러당 성능을 높이는 동시에 고객의 컴퓨팅 비용을 절감합니다. NVIDIA CUDA GPU의 긴 사용 수명은 가속기 대비 상당한 TCO 절감 효과를 제공합니다. CUDA는 당사의 대규모 설치 기반과 호환되어 NVIDIA 시스템의 수명을 예상 수명보다 훨씬 연장합니다. 당사는 20년 이상 CUDA 생태계를 최적화하여 기존 워크로드를 개선하고, 새로운 워크로드를 가속화하며, 모든 소프트웨어 릴리스를 통해 처리량을 높여 왔습니다.

6
원문 흐름 6

CUDA와 NVIDIA의 오랜 시간 동안 검증되고 다재다능한 아키텍처가 없는 대부분의 가속기는 모델 기술이 발전함에 따라 몇 년 만에 쓸모없게 되었습니다. CUDA 덕분에 6년 전 출시된 A100 GPU는 크게 개선된 소프트웨어 스택을 기반으로 오늘날에도 여전히 최대 활용도로 작동하고 있습니다.

​

Our annual X factor performance leap increases performance per dollar while driving down computing costs for our customers. The long useful life of NVIDIA's CUDA GPUs is a significant TCO advantage over accelerators. CUDA's compatibility in our massive installed base, extend the life NVIDIA Systems well beyond their original estimated useful life. For more than 2 decades, we have optimized the CUDA ecosystem, improving existing workloads, accelerating new ones and increasing throughput with every software release. Most accelerators without CUDA and NVIDIA's time-tested and versatile architecture became obsolete within a few years as model technologies evolve.

7
원문 흐름 7

Thanks to CUDA, the A100 GPUs we shipped 6 years ago are still running at full utilization today, powered by vastly improved software stack.

2025-11-19, 엔비디아 3Q25 실적발표 컨퍼런스 콜 中

엔비디아 3Q25 실적발표

Blackwell/Rubin 26년 말까지 풀부킹, 6년 된 A100도 풀가동 중

이번 분기 - CY3Q25 (FY3Q26)

EPS (Non-GAAP) : $1.30 vs 컨센 $1.25 (Beat) (YoY +61%)

매출 : $57.01B vs $55.19B (Beat) (YoY +62%)

Compute/DC : $51.2B vs $49.3B (Beat) (YoY +62%)

Gaming : $4.3B (YoY +30%)

Pro Viz : $760M (YoY +56%)

Automotive : $592M (YoY +32%)

​

CY3Q25 마진율 체크

GPM (Non-GAAP) : 73.6% vs 가이던스 73.5% (Beat)

​

가이던스 - CY4Q25 (FY4Q26)

매출 : $65.0B vs 컨센 $61.98B (Beat)

GPM (Non-GAAP) : 75.0% *CY26 GPM도 Mid-70%(74~76%) 유지할 것이라고 전망*

​

다시 한 번, 단기·장기, 수요·공급·경쟁역량 모두 우수

8
원문 흐름 8

지난 2Q25 엔비디아 실적발표에서 H20 수출통제로 인해 겉의 지표들은 미적지근했지만 실제 투자자들이 중요하게 생각하는 Core Product 성장률, 이익률, 점유율이 매우 좋기 때문에 실제로는 단기, 장기, 수요, 공급, 경쟁역량 모두 우수하다는 말씀을 드렸었는데요. 이번 분기에도 마찬가지입니다. 모든 면에서 좋습니다.

​

가장 좋았던 부분은 4Q25 GPM 가이던스가 75%로 상승할 것을 예고했던 부분, 그리고 CY26에 현재 부품 단가들이 올라가고는 있지만 여전히 GPM 75%를 유지할 것으로 전망한다는 부분이었습니다.

​

GPM (Non-GAAP) : 1Q25 71.3% → 2Q25 72.7% → 3Q25 73.6% → 4Q25(G) 75.0%

​

*제품 단가들이 하락했던 주 요인이 아니라 Hopper NVL8 → Blackwell NVL72로 전환하는 과정에서 워낙 바꿀 게 많았어서 그렇습니다. 공기냉각을 액체냉각으로 바꾸는 일이었고, HGX Hopper GPU 기준 컴퓨터당 6만 개의 부품이 들어가던 것을 GB200 NVL72 랙당 60만 개의 부품이 들어가는 것으로 바꾸는 일이었고, 랙당 40kW이던 것을 120kW로 만들었습니다. 3천 파운드의 무게, 5천 개의 케이블이 들어갔으며 60만 개의 부품은 자동차 20대에 들어가는 부품 규모입니다.

Compute +$10B / Networking +$1B

데이터센터 내 매출은 두 가지로 구분됩니다.

9
원문 흐름 9

Compute와 Networking입니다.

​

Compute 매출이 QoQ +27% 늘면서 매우 좋았습니다. 단일 분기 데이터센터 매출 증가폭 최고치입니다. 3Q Hopper 매출이 $2B였음을 감안하면 Blackwell 관련된 제품의 매출이 $41B라고 추정합니다. Blackwell 매출은 4Q24 $11B → 1Q25 $24B → 2Q25 $28B → 3Q25 $41B로 가파르게 증가했습니다. B300(Blackwell Ultra) 램프업이 매우 순조롭고 빨랐던 영향이 큽니다. B200 대비 B300은 ASP가 20%가량 높고, NVL랙 생산량이 분기에 크게 증가하다보니 Blackwell GPU 판매량만 오르는 것이 아니라 Grace CPU 매출, 랙/시스템 단위 매출이 함께 늘면서 매출 성장이 가팔라지는 효과를 보고 있습니다. Blackwell 판매량 중 3분의 2가 B300이라 했으므로 이번 분기 $13.7B가 B200 + $27.3B가 B300였습니다.

​

Networking 매출도 QoQ +13%로 좋습니다. 네트워킹 매출은 GB200·300 NVL72용 NVLink 패브릭, XDR InfiniBand, Spectrum-X 매출이 함께 성장했습니다. Spectrum-X 매출이 큽니다. 메타, 마이크로소프트, 오라클, xAI가 주요 구매자였습니다. 다만, 출하 시기나 공급 가능성이 전 분기에 비해서 다양해졌습니다. 네트워킹 매출은 대형 클러스터가 언제 온라인되느냐가 중요한데, 이제부터 여러 클러스터가 분기별로 온라인될 예정이다보니 그렇습니다.

10
원문 흐름 10

​

*왼쪽 차트 : Data Center 매출 → Compute $43B + 네트워킹 $8.2B입니다. 다른 사업부 매출들은 QoQ Flat정도였는데 데이터센터 사업부 매출은 직전분기에 비해 매출이 $10B(QoQ +25%)로 매우 크게 늘었습니다.

​

*오른쪽 차트 : Gaming 매출 → 게이밍 분야도 Blackwell 제품군 매출이 늘면서 YoY 30% 성장세입니다. 최종시장 판매량은 똑같이 증가 중인데, 연말연시 시즌을 앞두고 CY2Q25쯤에 공급망 전방기업들이 재고를 한 번 채웠기 때문에 이번 분기 매출은 Flat이었습니다. 엔비디아는 Sell-in으로 ASUS, MSI, Gigabyte 같은 곳이나 총판에 GPU를 판매하는 것이 매출에 잡히는 구조이고, 실제 최종시장 수요는 Sell-through로 각종 유통망에 있는 재고들을 게이머들이 사가는 수요를 뜻합니다. 최종시장 수요가 괜찮고, 채널 재고는 정상 수준이라는 점에서 이정도면 괜찮은 코멘트였습니다.

​

*왼쪽 차트 : Professional Visualization 매출 → DGX Spark를 출시했고, RTX Pro 6000 Blackwell 제품군이 판매량을 늘려가는 중입니다. 클라우드 서비스를 하거나 아니면 대기업이 자체 AI Factory를 구성하는 경우에 B200/B300 같은 하이엔드 제품을 구매하고, 개인이 AI 서버를 굴리려 할 때는 DGX Spark를 사서 돌릴 것이고, 기업들이 자체적으로 작게 AI를 굴리고 할 때는 RTX Pro 6000 Blackwell을 구매해서 돌리려 할 것입니다.

11
원문 흐름 11

이 차트는 단순히 엔비디아의 매출에서는 큰 의미가 없지만, 롱테일의 Enterprise AI에 대한 수요가 이만큼 올라오고 있다는 것을 뜻하기 때문에 함의점이 꽤 있는 차트입니다.

​

*오른쪽 차트 : Automotive & Robotics 매출 → 자율주행 칩 매출이 YoY 성장의 상당부분 차지했습니다. Gaming, Pro Viz 등 다른 사업부들과 마찬가지로 데이터센터향 매출에 비해서는 양이 크진 않겠지만, 향후 휴머노이드 시장과 자율주행 시장이 커지고 Physical AI 및 로보틱스 매출이 늘어나게 되면 엔비디아 입장에서 매출성장을 꽤나 기대해볼 수 있는 사업부이기도 합니다.

Preview 자료와 비교

어떤 부분이 좋고, 어떤 부분은 기대에 못미쳤나?

1. 이번 분기 3Q25(8월~10월) 실적은 얼마인가? 중요도 30%

Preview 코멘트 : 이번 분기에 가장 중요한 것은 ⓐGB200·300 NVL72 랙이 얼마나 많이 출하됐느냐 ⓑ가능성은 낮지만 중국 혹은 해외로 H20 재고분이 판매됐는가가 중요합니다. 2Q25 실적발표 당시 중국향 H20 판매가 가능하다면 3Q에 $3~5B정도의 매출을 추가할 수 있을 거라 말했었기 때문입니다.

ⓐ GB200·300 NVL72 랙 : NVL72 제품으로 판매하면 GPU 칩만 판매할 때에 비해 랙당 네트워킹, CPU를 포함한 콘텐츠의 양이 많아지고 전사 GPM을 높일 수 있기 때문에 매출과 마진을 동시에 높일 수 있다는 점에서 좋습니다.

12
원문 흐름 12

그리고 Reasoning 추론영역에서 All-to-All 연결이 TCO 대비 퍼포먼스의 핵심인 만큼(지난 2Q25 자료에서, 경쟁역량-Scale-up에 대한 내용을 참고하시면 도움이 되실 겁니다.) NVL72 랙을 하이퍼스케일러 고객들이 원하는 만큼 생산할 수 있다면 시장점유율 측면에서도 긍정적입니다. 랙 주요 생산업체가 Foxconn, Quanta, Wistron인데 이들의 코멘트가 좋았습니다. Foxconn은 2025년 연간 AI 서버 매출 목표를 3Q만에 벌써 달성했으며, 초기 테스트 및 수율 문제가 해결됐기 때문에 4Q25에는 AI 캐비닛 출하량이 크게 증가할 것으로 전망했습니다.

ⓑ H20 판매 : 미국 행정부는 적어도 1세대 이상 차이나는 구형칩만 중국에게 판매하겠다는 생각을 굳혔습니다. B30A 판매는 허가하지 않을 예정이며, H20만 허가했습니다. 트럼프가 "이제 엔비디아와 중국이 알아서 할 일이다"라고 말한 배경입니다. 반면, 중국은 'H20을 받느니 차라리 안 받겠다'라는 입장입니다. 중국의 목표는 기업 고객들에게 엔비디아 H20 수입을 최소화하고 자체적인 AI 가속기 생태계(화웨이, 캠브리콘 등)를 더 빠르게 안착시키는 것입니다. 그런 의미로 H20은 수입을 금지했습니다(젠슨황이 11월 2일, 한국 방문 후 기자간담회에서 발언). 그렇다면 중국으로의 판매는 막혔으므로 다른 국가에게 얼마나 팔았는가가 중요한데 이부분은 크게 기대하지 않고 있습니다.

13
원문 흐름 13

이번 분기에 엔비디아 주가가 크게 오지 않았던 이유가 H20 판매에 대한 기대감이 2Q 실적발표 이후 생겼다가 점점 줄어들었기 때문입니다. Non-China에서는 수요가 크게 올랐고, China에서는 수요 추정이 줄어들면서 이것이 상쇄되어 횡보 상태를 유지했습니다.

​

리뷰 #1 → 두 가지 서프라이즈가 컸습니다. ⓐB300으로의 전환이 생각보다 빠른 것, ⓑGB200·300 NVL72 랙 판매량이 많이 올라왔던 것에서 서프라이즈였습니다. 전사 GPM을 끌어올리는 데 성공했고 4Q25 및 CY26까지도 가시성을 높이는 데에 NVL랙의 역할이 중요합니다.

​

2. 다음 분기 4Q25(11월~1월) 실적 가이던스는 얼마인가? 중요도 40%

Preview 코멘트 : 4Q25를 생각할 때 중요한 건 GB200·GB300 NVL72 램프업에 문제가 없는가가 중요합니다. 위의 Foxconn, Quanta, Wistron 코멘트가 다음 분기까지도 영향을 주는 중요한 내용이란 의미입니다. 수요는 매우 높다는 것을 GTC Washington에서 확인했고, 공급은 GB200 NVL72 → GB300 NVL72에서 크게 달라지는 게 없기 때문에 거의 문제가 없을 것으로 예상됩니다. GB300 NVL72가 본격 생산량을 올리기 시작하는 때는 4Q25부터이지만, 물량의 절반 이상 수준으로 올라오는 시점은 1Q26쯤부터입니다.

​

리뷰 #2 → 3Q25보단 4Q25의 서프라이즈가 컸습니다.

14
원문 흐름 14

GB300 NVL72 랙 램프업에 문제가 없음은 4Q25 가이던스가 아니라 3Q25에서 미리 확인했기 때문에 좋습니다. Blackwell 매출 중 3분의 2가 B300에서 나왔습니다. 이미 물량의 절반 이상을 차지했으며 양산 단계에 들어갔기 때문에 GB300 NVL72이 매출에서 절반 이상을 차지하는 시점이 한 분기씩 당겨졌습니다. 그래서 이번 분기에 중요도 40%로 가장 중요했던 4Q25 가이던스상 매출은 $65B vs 컨센 $62B, GPM은 75%에 도달하며 꽤나 서프라이즈였습니다. 가이던스를 보수적으로 한다는 걸 감안하면 4Q25에 대략 $67B 이상이 나올 거란 자신감인데 이정도면 2Q25 매출 $46.7B → 3Q25 매출 $57B → 4Q25 매출 $67B이므로 +$10B씩 증가하는 추세입니다. 그리고 영업비용도 $5B로 크게 늘지 않았기에 CY1Q25부터 영업이익 레버리지가 계속해서 커지는 구간입니다.

​

3. 크게 보고 CY2025~CY2026 수요와 공급 가시성은 어떤가? 중요도 20%

Preview 코멘트 : 수요부분에서는 추론 수요 급증과 GPT-7, GPT-8급 모델 훈련을 위한 GW급 클러스터를 만드는 수요가 같이 묶이면서 CY26까지도 GB200·300 NVL72 랙 수요가 꽉찼습니다. Foxconn, Quanta, Wistron은 최근들어서 수요 가시성이 CY27까지 확보되기 시작했다고 말했습니다.

15
원문 흐름 15

공급부분에서는 이를 충족하기 위해 CY26에NVL랙을 얼마나 많이 만들 수 있을 것인가가 중요한데 세 기업 모두 현재까지는 적극적인 캐파 확장 중입니다.

​

리뷰 #3 → Rubin 출하에 관련해 램프업 시점은 2H26이 될 것이라 말했습니다. 투자자들이 기대하던 일정과 같습니다. Grace Blackwell NVL72 랙 공급망에서 큰 틀을 바꾸지는 않는 상태로, 전보다 충분한 시간에 걸쳐서 Vera Rubin NVL144 랙 공급망을 준비해가는 중입니다. L10 Compute Tray 조립 단계까지 직접 관리 영역을 확대함에 따라, 2H26 양산 시점의 생산 가시성과 통제력이 한층 강화될 전망입니다. 주요 데이터센터 및 CSP들은 엔비디아 랙 제품들을 받아서 구축하기까지의 노하우를 완벽하게 숙지한 상태이기 때문에 이전보다 원활한 Transition이 될 거라 예상합니다.

​

4. 중국향 제품, 블랙웰 제품군, 네트워킹, 소프트웨어 중요도 10%

Preview 코멘트 : 중국향 제품 출하 기대감은 크게 줄었고, Blackwell 랙 제품인 GB200·300 NVL72 제품 공급 증가도 원활하게 잘 되고 있으며, Rubin 랙 제품인 VR200 NVL144도 L10에 대한 마지막 협상을 남겨두고 있을뿐 비교적 정상적으로 개발되는 중으로 파악됩니다. VR200 NVL144는 2Q26부터 모듈 양산 → 3Q26에 서버 ODM에서 조립 시작(생산시작) → 4Q26에 양산물량 크게 증가(양산시작)의 과정이라 예상합니다.

16
원문 흐름 16

네트워킹은 이더넷 올인을 선언한 이후 새로운 성장동력이 됐습니다. 네트워킹 매출은 4Q24 $3.02B(QoQ -3%) → 1Q25 $4.96B(QoQ 64%) → 2Q25 $7.25B(QoQ 46%)로 매우 빠르게 성장 중입니다. 세 가지로 구분할 수 있습니다: ⓐScale-up 제품인 NVSwitch, NVLink쪽 매출도 GB200·300 NVL72 양산 물량이 늘어나면서 늘어나는 중입니다. ⓑScale-out 제품인 Spectrum-X 성장이 특히 인상적인데 최근 OCP Global Summit(10월 13~16일)에서는 마이크로소프트, 메타, 오라클에 차세대 Scale-out 표준으로 채택됐음을 확인했습니다. 엔비디아가 적극적으로 Spectrum-X를 Etherent 진영의 표준으로 만들려 하고 있습니다. 브로드컴 Tomahawk 파이와 아리스타 네트웍스의 파이를 일부 가져가는 과정입니다. Cisco Systems의 FY26 AI 인프라 수주는 Spectrum-X 수요와 연관되어 있습니다. Cisco는 FY2025(CY3Q24~2Q25) 동안 $2B의 주문을 받아서 $1B를 매출인식 했는데, 마지막 분기였던 FY4Q25(CY2Q25)는 한 분기에 $0.8B 주문을 받았고 → 이번 FY1Q26(CY3Q25)에는 $1.3B의 주문을 받았습니다. 수요가 크게 증가하고 있는 만큼 공급을 크게 늘려 FY2026에 총 $3B의 AI 인프라 매출을 거두겠다는 목표입니다.

17
원문 흐름 17

ⓒScale-across 제품인 Spectrum-XGS 수요도 CY26부터 늘어나기 시작할 것으로 예상합니다.

​

리뷰 #4 → 네트워킹 매출은 ⓐScale-up ⓑScale-out에서 계속해서 성장할 것으로 예상되고, ⓒScale-across에서도 Spectrum-XGS 수요가 높을 것으로 예상합니다. GPU뿐만 아니라 네트워킹에서도 고성장을 예상할 수 있는 만큼 전사 GPM에는 긍정적인 요인입니다.

어닝콜 정리

훈련은 균열 없고, 추론의 시대에 경쟁역량은 더 강화되는 중

엔비디아, 4Q24

주요 내용

매출 YoY 78%. Blackwell 램프 시작되고 H200 QoQ 성장. Blackwell 4Q $11B 매출 달성. 모든 Blackwell 제품 구성에서 Full Production 달성. Blackwell의 기본 클러스터는 10만개 규모가 일반적. 미세조정, 강화학습, Distillation 도입하며 사후학습 수요를 촉진하는 중. 이제 사전학습보다 사후학습이 컴퓨팅 규모는 더 커짐. Hugging Face만해도 Llama 기반으로 9만개 이상의 파생 모델을 호스팅하고 있음.

Test-time compute향 추론 수요는 OpenAI o3, DeepSeek-R1, Grok 3을 통해서 가속화. Blackwell 시대에는 추론에 대한 수요가 큼. 초기 GB200은 대부분 추론을 위해 배포했음.

18
원문 흐름 18

xAI는 GB200으로 Grok 차세대 모델 학습/추론 중. 4Q24 매출 50%가 거대 CSP들(Azure, GCP, AWS, OCI)향으로 판매됐고, 소비자-인터넷 기업향 매출은 전년 대비 3배 증가, 엔터프라이즈향 매출은 전년 대비 2배 증가. 중국향 데이터센터 매출비중은 규제 이전보다 훨씬 낮고 이정도로 유지될 것

거의 모든 자율주행 기업이 데이터센터/자동차에서 엔비디아를 채택 중. 자동차향 매출은 올해 $5B에 달할 것으로 기대 중. 네트워킹은 InfiniBand NVL8 → Spectrum-X NVL72로 전환 중. Blackwell 수요를 충족하기 위해 제조 가속화(비용)에 집중하는 중. 완전히 가동되면 2H25에 GPM 70% 중반이 될 것으로 예상. Ultra로의 전환은 쉬움. CUDA 개발자 커뮤니티는 590만명으로 늘어났음. 1Q25 가이던스는 매출 $43B, GPM 71%

​

엔비디아, 1Q25

주요 내용

매출 YoY 69%. AI 워크로드는 추론으로 전환 중. AI 팩토리로 상당한 매출. H20 수출통제로 $4.5B 비용 인식했고 1Q25 $2.5B 선적 못했음. 2Q25에는 H20 $8B정도 못팔았음. Blackwell 매출은 DC Compute 매출의 70%인 $24B. GTC 대비해서 더 많은 주문이 들어왔고 추론 수요가 폭발적으로 증가 중. Blackwell은 출시한지 얼마 안됐는데 SW 최적화로 한 달 사이 성능 1.5배 향상.

19
원문 흐름 19

Hopper는 2년 동안 4배 좋아짐

GB200 NVL72 수율이 크게 좋아졌음. 하이퍼스케일러들이 각각 주당 NVL72 랙 1,000개 or 72,000개 Blackwell GPUs씩 배포 중. 이번엔 생산량 더 늘릴 계획. MSFT는 이미 수만 개, OAI를 주요 고객으로 수십만 개의 GB200 추가 배포할 것. GB300 시스템 샘플링 5월 초에 CSP에서 시작 → 7월 말 생산. GB200/300은 동일한 아키텍처, 공간, 전기/전자 스펙이기에 공급망에서 높은 수율 유지하면서 원활히 전환 가능. HBM 50% 더 많기에 FP4 FLOPS 50% 더 높일 예정. CY28년까지 로드맵 준수할 예정

AI 팩토리 구축 속도와 규모가 가속화됨. 1Q25에만 AI 팩토리가 100개 넘어감(YoY 100%), 각 팩토리당 GPU 평균 개수도 2배 증가. 수십GW가 엔비디아 인프라 채택 중. NVLink 5 채택이 늘면서 1Q25 NVLink 매출이 $1B 돌파. Spectrum-X는 대성공했으며 ARR은 $8B 수준(매출의 5%), 코어위브/마이크로소프트/오라클/xAI/구글/메타가 채택. 싱가폴 매출의 99% 이상이 미국 주문. 1Q25 Non-GAAP GPM은 71.3%이고 2Q는 72%. 2Q25 매출은 $45B

​

엔비디아, 2Q25

주요 내용

매출 YoY 56%, Blackwell 매출 QoQ 17%($28B).

20
원문 흐름 20

5년간 AI 인프라 투자 $3~$4T. OpenAI, Meta, Mistral 차세대 모델 학습/추론에 GB200 NVL72 사용. GB300 랙은 양산 중. NVL랙은 주당 1,000개. 3Q에 더 증가할 것. Vera CPU, Rubin GPU, CX-9 SuperNIC, NVLink 144 Switch(up), Spectrum-X Switch(out, across), 광학프로세서 제작들어감. 3세대 NVLink 제품. CSP → Enterprise로의 수요 전환. GB300 NVL72는 Hopper 대비 토큰당 에너지 효율 50배 향상.

7월 말 H20 라이선스 검토 시작. 아직 출하는 없음. 현 상태로는 3Q $2~$5B Upside($56~$59B). H100/H200 출하량 증가. H20도 $650M 판매(중국 외). RTX Pro 서버는 Billions 제품이 될 것. EU AI 팩토리 20개로 €20B 투자. 올해 소버린 AI 매출 $20B. 로보틱스 플랫폼 개발자 200만, HW 1,000+

NVLInk, Spectrum-X, InfiniBand 수요 강세. Spectrum-X는 ARR $10B. InfiniBand는 대역폭 2배 늘린 XDR 도입 이후 QoQ 100% 증가. 3Q 매출 $54B(H20 포함X, 포함 시 $56~59B). GPM 73.5%. Agentic AI로 환각 크게 줄음. GW 데이터센터는 $50~60B인데, 그중 $35B정도가 엔비디아의 몫.

21
원문 흐름 21

중국은 $50B 시장. CAGR 50% 예상. 세 가지 네트워킹. H100/H200 매진. AI 투자 가속

​

엔비디아, 3Q25

주요 내용

매출 YoY 62%, QoQ 22%. 26년 말까지 Blackwell/Rubin 매출 $500B 가시성 확보. 더 높아질 수 있음. 클라우드 이미 매진. AI Labs ARR 성장 가파름. Agentic AI 확장 중. 기존에 CPU로 실행하던 작업을 CUDA-GPU 기반으로 옮기는 작업 계속. xAI-Humain 0.5GW 구축, AWS-Humain GB300 포함 총 15만 개(대략 0.3GW) 구축 발표. Blackwell 전체 매출의 3분의 2가 GB300으로 참. 램프업 정상. Hopper 3Q에 $2B 매출. H20은 $50M. Rubin은 2H26 양산 예정. 양산 가시성 크게 끌어올림

Blackwell/Hopper/Ampere 등 GPU 모두 가동 중. 6년된 A100도 가동률 매우 높음. 기존 구형 GPU들도 꾸준히 CUDA 업글하여 성능 향상하기 때문에 5~6년보다 훨씬 더 쓰는 상황. 대부분의 가속기는 시간 지나며 Perf/$ 하락. NVLink, Spectrum, InfiniBand 모두 성장. NVLink는 추론에서 엄청난 해자. 따라잡기까지 오랜 시간 걸릴 것. NVDA 찾아오는 플랫폼의 수가 오히려 증가 중. HW / SW / 네트워킹상 ASIC 경쟁력 하락 뷰 유지

22
원문 흐름 22

오픈AI와 ‘최소’ 10GW 파트너십. 자체 DC 구축 도울 것. 앤트로픽은 처음 NVDA 채택. CUDA 맞춰서 모델 최적화할 것. GB 및 VR에 1GW 컴퓨팅 구축이 포함 딜. 투입비용 오르고 있기는 하지만, 공급망 노력 중이고 CY26 GPM 75% 목표 유지. 전체 공급망에 걸쳐서 Co-design 개념 적용할 것. CUDA 생태계 확장을 위한 투자. Rubin CPX는 긴 컨텍스트 생성에 적합.

긍정적이었던 내용

ⓐ수요: 풀가동, 풀부킹 ⓑ공급: GB300, Rubin ⓒ경쟁역량: NVL, XGS, CPX, Enfabrica

*API Volume만 보여주기에 몇 가지 맹점들이 있습니다. 이는 감안하시면서 보셔야 합니다.

​

자체 앱 사용량 데이터 누락 (First-Party) : 이 차트는 API, 개발자들이 외부 애플리케이션(Cursor, Windsurf, Notion)에서 LLM을 호출하는 사용량만을 집계합니다. 실제 LLM 사용량의 가장 큰 부분은 오픈AI의 ChatGPT 및 Codex, 구글이 직접 서비스하는 양, 메타가 자체 Recommend and Ranking 알고리즘에 쓰는 양입니다. 이런 내부 트래픽은 API 판매 볼륨으로 잡히지 않으니 빙산의 일각(B2B 개발자 시장)만을 보여줄 가능성이 큽니다.

오픈소스 모델 중 일부 워크로드 누락 (Self-Hosting) : 마찬가지로 API 판매를 우선하는 특정 기업들의 볼륨을 추적하기에 DeepSeek, Qwen, Llama 등 오픈소스 모델을 자체 서버에 직접 설치하여 사용하는 경우에는 외부 API를 호출한 것이 아니므로 집계되지 않습니다.

23
원문 흐름 23

2025년 초 이후에 중국 내 프론티어 AI 연구소들이 DeepSeek, Qwen, Kimi 등 상당히 쓸만한 오픈소스를 많이 출시했고 그 결과 최근에는 Airbnb, Pinterest 등 미국 기업들도 비용 효율성을 위해 오픈소스 모델을 채택하여 쓰고 있습니다. 이런 기업이 늘어날 수록 이 차트에 포착되지 않는 AI 사용량의 비중은 더 커집니다.

​

수요 : ⓐ6년 전 A100도 '풀가동' ⓑBlackwell/Rubin '풀부킹'

이번 실적발표에서 젠슨황이 "6년 전 출시된 A100도 여전히 최대 가동률(the A100 GPUs we shipped 6 years ago are still running at full utilization today)로 작동하고 있다."고 말했습니다.

​

'6년 전 A100도 풀가동 중'

H100, H200, B200의 Spot 가격이 8~9월부터 매월 계속해서 증가하는 중입니다. H100, H200은 신규 공급이 크게 줄어든 상황에서 수요가 늘어나다보니 가격 상승이 잘 드러나고, B200은 온라인되는 양이 점점 더 많아짐에도 불구하고 8~9월 가격대인 $12에 비해서 크게 상승한 $20~$25를 오가고 있습니다.

​

코어위브는 3Q에 수요가 대폭발하기 전 2Q25부터 이미 A100, H100도 6~7년치 계약을 맺고 추론 수요로 수익화 중이라고 언급했고, 11월 10일의 3Q25 실적발표에서도 H100 재계약을 하는 과정에서 수요가 매우 높다보니 2개 분기 전부터 원 계약가격에 비해서 5%정도만 할인한 금액에서 계약이 체결되었다고 말했습니다.

24
원문 흐름 24

​

2025년 9월부터는 H100/A100 가용 가능한 인스턴스 규모가 빠르게 말라갔었는데, 최근에는 H100 Spot 가격이 4Q25 8% 상승하고, H200 Spot 가격은 4Q25에 18% 상승할 것으로 예상됩니다. AWS 메인 인스턴스에서도 B200는 물론 한 세대 전 버전인 H200 임대료도 인상했습니다. a16z 팟캐스트에서 구글의 AI 인프라 부문 부사장인 아민 바닷이 시장에서 AI 수요가 크게 높아지면서 7~8년차 구글 TPU도 가동률이 100%라고 말했습니다.

​

Blackwell/Rubin '풀부킹'

엔비디아는 GTC Washington에서 'CY25부터 CY26까지 Blackwell/Rubin 주문량이 총 $500B'라고 발표했었습니다. 이번 3Q25 실적까지 총 $104B가 출하(Blackwell 매출 추정: 4Q24 $11B → 1Q25 $24B → 2Q25 $28B → 3Q25 $41B)됐으므로 대략 $400B만큼의 주문이 남아있습니다. AI 워크로드가 1Q25 → 2Q25 → 3Q25로 갈수록 수요가 공급을 초과하는 정도가 점점 더 커지는 중입니다. 추론 수요와 차세대 모델을 위한 훈련 수요가 동시에 증가하는 구간이라 그렇습니다.

​

오늘 사우디아라비아와의 계약에서 3년 동안 40~60만 개의 GPU 주문이 체결됐고, 앤트로픽도 엔비디아의 컴퓨팅을 사용하는 계약을 처음 맺었음을 고려하면 앞으로 1년 동안 주문이 계속해서 추가될 것이므로 내년으로 갈수록 수주잔고 자체는 꾸준히 높게 유지될 가능성이 높습니다.

25
원문 흐름 25

엔비디아 3Q25 Preview에서 전해드린 것처럼 AI Labs의 ARR 성장세가 얼마나 가파른가가 핵심인데, 계속해서 추정치를 상회하고 있습니다.

​

공급 : ⓐBlackwell Ultra 서프라이즈 ⓑRubin과 L10

1H26까지 향후 6개월간 엔비디아의 매출 성장에는 GB200·300 NVL72 랙 공급이 얼마나 빠르게 많이 늘어나느냐가 중요합니다. 이후에는 VR200 NVL144가 중요하지만 우선은 NVL 랙 자체에 대한 경쟁역량이 높기에 공급이 늘어나는 만큼 매출로 연결될 것입니다. 이미 수요는 Foxconn, Quanta, Wistron이 말하기로 CY27까지 확보된 상황입니다. 미충족수요가 많아졌으니 공급이 얼마나 원활하게 증가할 수 있느냐에 따라서 엔비디아 입장에서는 아직 업사이드는 조금 더 열려있습니다.

​

모건스탠리는 공급망 체크를 토대로, NVL 랙 생산량이 3Q25 8,000~8,500개 → 4Q25 14,000~15,000개(중간값 기준: QoQ 76%)로 크게 늘어날 수 있다고 추정합니다. 10월 중순의 OCP Global Summit에서 체크하기로 GB300 NVL72 랙 생산과 관련해서는 수율 문제가 발생한 적이 없으며, 향후 몇 개월간 생산량이 순조롭게 증가할 것으로 예상할 수 있는 상태입니다. 연 단위로 보자면 CY25 28,000개의 NVL랙을 생산하고 → CY26에는 60,000~70,000개의 랙을 생산할 것으로 추정했습니다.

26
원문 흐름 26

​

순조로운 VR200 NVL144 도입 일정

GB300 NVL72 양산이 매우 순조로움을 확인했기에, 이제 중요한 것은 바톤을 이어갈 VR200 NVL144가 잘 준비되고 있는가인데 이 부분에서도 좋은 내용이 있었습니다. Rubin은 GB200·300 NVL72과 공급망 측면에서 대부분 호환되면서도 '대량 생산에 최적화된 구조로 재설계한(substantially redefined the manufacturability)' 3세대 랙 스케일 시스템이며, Vera Rubin NVL144 랙 설계도를 2025년 7월에 공개했던 만큼 이미 CSP나 주요 데이터센터 운영사들은 VR200을 어떻게 구축 후 실행할 것인지에 대해서 이해하고 있는 상황입니다.

​

여기서 대량 생산에 최적화된 구조로 재설계했다는 것은, L10 Compute Tray 도입을 의미한다고 봤습니다.

​

VR200 NVL144부터는 랙 생산 극대화를 위해 '공급망 통합'

엔비디아가 2H26부터 생산될 VR200 NVL144 랙의 생산량을 대폭 끌어올리기 위해, 공급망 전략을 한층 더 강화할 예정입니다. L10 Compute Tray처럼 핵심 중간 부품을 엔비디아가 직접 공급하고, 서버 ODM는 거의 최종 조립만 집중하도록 공급망을 재편하는 중입니다. NVL72에서 겪은 문제는 NVL144, 288, 576으로 갈수록 더 심화될 우려가 있었는데 이전보다 공급 가시성이 확보된다는 차원에서 중요한 전략 변경이라 생각합니다.​

27
원문 흐름 27

​

엔비디아가 이처럼 공급망 장악력을 높이는 데는 두 가지 이유가 있습니다:

​

생산 병목 해결 : 현재 GB200 NVL72 랙은 Foxconn, Wistron 같은 서버 ODM이 Compute Tray 등을 조립/생산하고 있습니다. 하지만 이 과정에서 수율이 기대만큼 오르지 못하고 생산 병목 현상이 발생하자, 엔비디아는 차세대 랙의 폭발적인 생산량 증가를 위해서는 이 문제를 직접 해결해야 한다고 판단했을 거라 추정합니다. 그리고 앞으로 더욱 더 전력밀도나 냉각밀도가 높아질 것이므로 개별 기업들의 R&D로는 충분히 해결되지 않으니 데이터센터 단위에서도 충분히 잘 작동하도록 하는 과정이기도 합니다.

마진 극대화 : 엔비디아가 L10 Compute Tray를 직접 생산해 공급하면, 더 많은 공급업체가 관여하며 발생하는 변수를 통제할 수 있습니다. 이는 수율과 양산 리드타임을 직접 컨트롤하는 동시에, 기존에 파트너사가 가져가던 마진까지 엔비디아가 흡수할 수 있음을 의미합니다. NVL72를 통해서 NVLink를 Scale-up의 핵심으로 만들고 엔비디아가 그 과정에서 CPU 및 네트워킹 제품에 대한 매출 및 마진을 가져가는 것과도 비슷한 맥락입니다. 물론 이 모든 과정에는 TCO 대비 퍼포먼스를 끌어올리기 위한 고민이 제1이겠지만 그 속에서 매출과 마진에도 순풍이 부는 구조를 설계했습니다.

28
원문 흐름 28

​

엔비디아가 관리하는 공급망의 영역은 점점 더 넓어지는 중입니다:

​

(ㄱ) Hopper까지만 해도 8개의 GPU를 연결하는 서버에 주로 '칩'만 판매했습니다.

(ㄴ) GB200부터 랙 단위로 제품을 구성하기 시작하며 좀 더 직접적으로 관여를 시작했는데, 이 과정에서 초기에 NVL72 랙 수율이 올라오는 속도(주로 Amphenol의 NVLink Spine, 일부 냉각부품)가 엔비디아의 내부 기대치에 못미치는 등 병목이 발생했습니다.

(ㄷ) VR200부터는 실제 고객들이 원하는 것은 NVL 랙 제품인데 공급이 따라오지 못하니 차세대에서는 이러한 병목을 해결하기 위해, 아예 L10 Compute Tray 같은 핵심 부품을 직접 공급하여 수율과 속도를 잡고, 파트너사는 최종 조립만 하도록 공급망을 수직 통합하려는 것입니다.

​

이어서, 이번 3Q25 동안 엔비디아의 X Factor들을 정리해봅니다:

Scale-up → NVLink

Scale-across → Spectrum-XGS

Agentic AI #1 → Rubin CPX

Agentic AI #2 → Enfabrica

​

경쟁역량 : ⓐNVLink ⓑRubin CPX ⓒSpectrum-XGS ⓓEnfabrica

네트워킹에는 세 가지 용어가 많이 쓰입니다. 하나의 컴퓨팅 단위당 성능을 높이는 Scale-up, 그것을 여러 랙으로 확장 연결하는 Scale-out, 데이터센터 단위를 연결하는 Scale-across입니다.

29
원문 흐름 29

​

IT HW/SW 분야에서 스케일 업Scale-Up은 기존 서버의 사양을 업그레이드함으로써 시스템을 확장하는 걸 말합니다. 수직적인 성능 향상입니다. 스케일 아웃Scale-Out은 서버를 여러 대 추가함으로써 시스템을 확장하는 걸 말합니다. 수평적인 성능 향상입니다. 엔비디아는 '스케일 아웃 전에 스케일 업이 중요하다'는 생각인데 여기서 가장 중요한 것이 GB200 NVL72입니다. 단일 GPU들을 넘어서 하나의 서버에 있는 모든 GPU를 하나의 GPU처럼 가동되게 만든 NVLink 서버로서 성공한 제품이기 때문입니다.

NVLink에 대한 언급

​

"NVLink는 현재 시중에서 유일하게 검증된 Scale-up 기술입니다. <학습> 최신 MLPerf 학습 결과에서 Blackwell Ultra는 Hopper보다 5배 빠른 학습 속도를 보였습니다. NVIDIA는 모든 벤치마크를 휩쓸었습니다. 특히 NVIDIA는 MLPerf의 엄격한 정확도 기준을 충족하면서 FP4를 활용하는 유일한 학습 플랫폼입니다. <추론> InferenceMAX 벤치마크에서 Blackwell은 모든 모델과 사용 사례에서 최고의 TCO 대비 퍼포먼스를 달성했습니다. 특히 전 세계에서 가장 널리 사용되는 추론 모델의 아키텍처인 MoE에서 Blackwell의 NVLink의 성능이 매우 중요합니다."

​

30
원문 흐름 30

"GB200, GB300은 엔비디아가 가진 Scale-up Network NVLink72 덕에 엄청난 성능을 낼 수 있음이 분명해졌습니다. 이는 큰 도약입니다. 누군가가 이를 따라잡기까지는 오랜 시간이 걸릴 것입니다. 엔비디아의 선도적 지위는 확실히 수년간(surely multiyear) 유지될 것입니다. 따라서 추론이 매우 중요한 분야가 되길 기대합니다. 추론 분야에서의 우리의 리더십은 탁월합니다."

2025-11-19, 엔비디아 3Q25 실적발표 中

Scale-up (NVL72) : 추론의 시대에 빛을 보다

위의 차트는 100MW 규모 AI 팩토리를 서로 다른 벤더의 서버 랙으로 구성했을 때의 수익성을 보여줍니다. 여기서 수익성이란 백만 토큰당 가격 기준으로 계산된 것입니다. 같은 비용으로 얼마나 많은 토큰을 처리할 수 있느냐가 곧 퍼포먼스이며 이를 기반으로 TCO(총소유비용)와 이익률이 산출한 것입니다. 그래서 종합적으로 퍼포먼스 대비 TCO가 GB200 NVL72가 압도적으로 좋다는 의미입니다.

​

GB200 NVL72 / 유일한 All-to-All 연결을 가능케 하는 NVLink

추론이 극한의 컴퓨팅인 이유는 토큰을 생성하는 것이 최종 고객인 기업들의 매출과 직결되기 때문입니다. 서비스 품질이나 수익성에 영향을 미치기 때문에 극한의 성능과 효율성 하에서 구축되어야 합니다.

31
원문 흐름 31

​

추론의 시대에 가장 중요한 가치는 "달러당 초당 몇 개의 토큰을 생성하여 몇 명의 사용자에게 어느 정도의 지연속도로 서비스 할 수 있는가"입니다. Groq/Cerebras가 더 우수하다거나, 하이엔드 GPU 없이도 로컬 LLM을 소비자용 GPU로 충분히 돌릴 수 있다는 주장들이 실제 기업들의 채택으로 이어지지 않는 이유들은 현실적인 배포 환경과 달라서 그렇습니다. ⓐThroughput ⓑLatency ⓒInteractivity 중 하나의 축을 생략하고 얘기하기 때문입니다.

​

실제 LLM 서비스를 제공할 때는 ⓐ매우 큰 Batch size를 통해 Throughput을 극대화하고, 동시에 ⓑLatency는 낮게 유지(빠른 답장)하며, ⓒ서버당 더 많은 사용자(높은 동시접속, Interactivity)를 수용해야 하기 때문에 All-to-All 네트워킹 규모가 클수록 동일 성능 대비 TCO가 좋아집니다.

​

*왼쪽 → 가로(X)축은 사용자 한명당 토큰을 생성하는 양입니다. 한 명에게 더 많이 토큰을 빠르게 만들어줄 수록 사용자 경험이 좋아지고, 혹은 더 많은 컴퓨팅을 배정함으로써 더 똑똑한 품질의 답변을 제공할 수 있습니다. 세로(Y)축은 서버 구축에 들인 달러당 초당 토큰 생산량을 의미합니다. Batch Size는 한 번에 병렬로 처리하는 사용자 요청 수를 의미합니다.

32
원문 흐름 32

예를 들어 여러 사용자가 챗봇이나 AI 모델에 동시에 질문을 한다고 가정하면 GPU는 이 요청을 일정한 개수씩 묶어서 한 번에 처리합니다. Batch size가 클수록 좋지만 너무 커지면 사용자 1명당 반응속도가 느려질 겁니다.

​

*오른쪽 → 두 가지 차트가 보이실 겁니다. 왼쪽 차트는 기존 HGX H100/H200 NVL8 서버에서 Reasoning 워크로드를 구동했을 때의 ⓐbatch size ⓑLatency ⓒInteractivity 차트를 보여주는 겁니다. ⓐⓑⓒ 세 가지 축 사이에서 '달러당 초당 몇 개의 토큰을 생성하여 몇 명의 사용자에게 어느 정도의 지연속도로 서비스 할 수 있는가'를 놓고 최고의 값이 나오는 ⓐⓑⓒ 세팅을 하는 것이 추론의 핵심입니다. 오른쪽 차트는 새로운 GB200 NVL72 서버에서 Reasoning 워크로드를 구동했을 때의 ⓐⓑⓒ 세팅입니다. 추론 시 Hopper NVL8에 비해 Blackwell NVL72에서 40배 가까이 경제성이 좋아졌습니다. Hopper → Blackwell 향상도 있지만 추론 시 NVL8에 비해서 NVL72를 All-to-All 연결함으로 인해서 나오는 추론의 경제성 향상도 상당하다는 의미입니다.

​

이때 NVLink만이 All-to-All 연결을 가능케하는 유일한 기술이기에 NVLink가 Scale-up 전략이 핵심입니다.

33
원문 흐름 33

Reasoning 워크로드는 쿼리당 요구 컴퓨팅·메모리가 기존 대비 10배(1,000 → 10,000) 증가하고, 서버당 수용 가능한 사용자 수는 1/4 수준(256명 → 64명)으로 줄어드는 등 부담이 40배 증가하게 됩니다. 이런 상황에서는 기존 8개의 GPU로는 능력이 떨어집니다. 72개의 GPU가 하나의 GPU처럼 메모리를 공유하면서 동일 문제를 매우 낮은 지연시간으로 처리할 수 있습니다.

​

Scale-across : Scaling Law를 이어가기 위한 새로운 네트워크

사전훈련의 스케일링 법칙(사후훈련, 추론의 스케일링 법칙은 따로 있습니다)에 따르면 투입되는 연산량(FLOPS), 데이터, 파라미터의 규모가 커질수록 AI 모델의 지능은 고도화되고 창발적으로(Emergent) 새로운 능력이 생겨납니다. 이를 위해 AI 업계는 데이터센터 용량을 50MW에서 1GW까지 늘리며 인프라를 확장해 왔습니다. 어느 시점까지는 단일부지에서 용량을 늘리는 게 효율이 높습니다. 하지만 전력 수급과 냉각 효율의 한계로 인해 단일 부지에서 3GW, 5GW, 10GW로 무한정 확장하는 것은 물리적으로 거의 불가능하고 효율이 크게 떨어집니다.

​

추론은 각 요청이 독립적이라 상대적으로 유연하게 적용할 수 있습니다. 문제는 추론(Inference)이 아닌 사전훈련(Pre-training)에 적용할 때 발생합니다.

34
원문 흐름 34

사전훈련은 수조~수십조 개의 파라미터를 쪼개서 학습하므로, GPU 간의 통신 빈도가 매우 높습니다. 만약 데이터센터 A와 B가 100km 떨어져 있다면, 빛의 속도 제약에 따른 지연 시간(Latency) 동안 수십만 개의 GPU가 멈춰 서는 유휴상태가 발생하게 되며, 이는 치명적인 비효율로 이어집니다. 수십조원을 들인 데이터센터이다보니 가동률에 민감할 수밖에 없습니다.

​

그렇다면 지금 1GW 데이터센터로 GPT-6을 훈련한다고 가정하면, 그 후의 GPT-7, GPT-8, GPT-9를 사전훈련하기 위해서는 더 많은 컴퓨팅을 연결하는 것이 필수적입니다. 데이터센터를 짓는 데 시간이 최소 12~18개월은 필요할 것이므로 2027~8년에 훈련할 모델의 데이터센터 및 컴퓨팅 계획을 2026년에는 세워야 한다는 의미입니다. 이 과정에서 시장을 주도하고 있는 엔비디아 입장에서는 1~2년 뒤에 다가올 것으로 예상되는 사전훈련 스케일링 법칙의 물리적 병목을 막기 위해 미리 준비하는 전략이 Scale-across입니다.

​

GPT-6가 1GW 데이터센터 시대를 열었다면, GPT-7과 그 이후 모델들은 필연적으로 그 이상의 컴퓨팅 파워를 요구합니다. 하지만 데이터센터는 하루아침에 지어지지 않습니다. 건설에만 최소 12~18개월이 걸릴 인프라의 특성상, '27~28년의 AI 패권을 쥐기 위한 인프라 투자는 당장 '26년에 결정되어야 합니다.

35
원문 흐름 35

이 시점에서 엔비디아의 Scale-across 의미는 명확합니다. 곧 다가올 단일 부지 확장의 한계라는 물리적 병목을 해결하지 못하면 AI의 발전도 멈추게 될 것이므로 엔비디아는 이 병목을 뚫어낼 네트워크 기술을 미리 준비함으로써, 고객들이 끊김 없이 다음 단계의 스케일링 경쟁에 진입할 수 있도록 판을 깔고 있는 것입니다.

​

Spectrum-XGS, Scale-across를 위한 방법

엔비디아가 먼 거리의 데이터센터들을 하나처럼 엮어 훈련용 컴퓨팅 클러스터로 쓸 수 있게 2025년 8월 24일, Hot Chips에서 Spectrum-XGS를 출시했습니다. 전력 병목을 줄일 수는 없지만 다소 완화(그렇다고 너무 작은 클러스터 여럿을 묶는 건 복잡성 비용이 더 늘어날 것)하고, 데이터센터 단위의 경쟁으로 나아가기 위함입니다. 100만 개 GPU 클러스터 시대를 맞이하기 위한 준비는 차곡차곡 되고 있습니다. GPT-7, GPT-8, GPT-9를 맞이하기 위한 X Factor입니다.

​

ⓐ5월 8일, 엔비디아가 자체적으로 NVIDIA Nemotron-4 340B를 1,000km 가까이 떨어진 두 개의 클러스터에서 End-to-End 21ms정도의 지연시간으로 단일 사이트 Throughput 96%정도를 유지하며 모델을 훈련시킨 내용을 공개한 바 있습니다.

36
원문 흐름 36

엔비디아는 동일한 접근 방식으로 궁극적으로 여러 시설에 걸쳐 50만 개 이상의 GPU를 조정할 수 있다고 주장했습니다. ⓑ7월 14일에는 엔비디아의 네트워킹에서 사용하는 라이브러리인 NCCL에서도 데이터센터를 오가며 훈련할 수 있도록 업데이트했습니다.

​

몇 년째 많은 사례들을 통해서 말씀드리곤 하지만, 엔비디아는 고객의 개발자들과 일선에서 함께 협력하며 판을 짜고 있기 때문에 계속해서 새로운 X Factor를 찾아내고 계속해서 해자를 강화해왔습니다. 고민을 같이 해결하면서 새로운 제품이 나오고 새로운 라이브러리가 나오는 것입니다.

​

엔비디아는 Spectrum-XGS, NCCL/NeMo를 통해서 데이터센터의 전체를 기준으로 TCO 대비 퍼포먼스 차원에서 이점을 가져갑니다. GPU의 연산에 병목이 되거나 비효율적인 '모든 것'을 효율화하는 중입니다. GPU 가동률을 높이면 GPU를 구매하는 사람들의 수익창출 능력이 좋아지니 엔비디아의 제품을 선호하게 되는 효과로 남습니다. GPU 경쟁을 넘어 → 랙 경쟁 → 데이터센터 단위 경쟁으로 경쟁의 축을 이동시키는 과정입니다.

​

추론의 시대를 위해 따로 준비한 칩 : Rubin CPX

Rubin CPX(4Q26 출시 예정)는 분산 추론(Disaggregated Inference)의 시작을 알린 칩입니다.

37
원문 흐름 37

Transformer 계열 LLM의 추론은 크게 두 가지 작업으로 분리됩니다. Prefill과 Decode입니다.

​

워크로드별로 특징을 보면 Prefill은 컴퓨팅이 많이 필요하고, 상대적으로 메모리 대역폭은 낮아도 됩니다. 그래서 비싼 HBM을 사용하는 대신 CPX에는 128GB GDDR7(대역폭 2TB/s)을 탑재했습니다. HBM 절반 가격으로 만든 칩이고, R200 GPU 대비 4분의 1 가격으로 동일 작업을 수행합니다. 그리고 Decode는 메모리 대역폭을 많이 필요로 합니다. HBM에 적합하기에 R200에는 여전히 288GB HBM4(대역폭 20.5TB/s)가 탑재됩니다.

​

기존의 방식은 Aggregated로, Prefill 및 Decode 작업을 단일 GPU에서 동시 처리하는 식이었습니다. Prefill은 계산량이 많아 병렬성이 낮고, Decode는 KV Cache를 사용할 수 있기 때문에 병렬성이 상대적으로 높은 워크로드입니다. 문제는 단일 아키텍처이기 때문에 유연성이 부족하고 병목이 생긴다는 점이 문제였습니다.

​

새로운 방식은 Disaggregated로, Prefill과 Decode 작업 중에 Prefill을 전용 하드웨어로 분리하는 게 핵심입니다. Prefill에 맞게 따로 특화시킨 CPX 칩에서 계산에 최적화된 작업을 하고, 병렬성이 높은 Decode 작업은 기존 Rubin GPU에 배정하는 것입니다.

38
원문 흐름 38

이렇게 되면 KV Cache를 HBM 대신 GDRR7처럼 더 저렴한 스토리지로 옮겨서 GPU 메모리를 확보할 수 있게 됩니다. 워크로드에도 다양한 하드웨어간 스마트 라우팅으로 유연한 확장을 할 수 있다는 게 핵심입니다.

​

이를 위해 엔비디아는 소프트웨어 레벨에서 ⓐSmart Router, ⓑKV Cache Manager, ⓒGPU Resource Planner를 추가하여 LLM 추론 과정에서 Prefill과 Decode를 분산하여 처리하고, KV Cache를 GPU 메모리에서 오프로딩하여 GPU 리소스를 최적화하는 아키텍처입니다. 이렇게 하면 대규모 사용자 처리, 모델 확장성, 리소스 효율성이 모두 개선됩니다. 이전에 비해 Prefill 비용이 절감되므로 ROI가 30~50배 증가하고, 전체 시스템 단위 효율은 3~7.5배 좋아졌습니다.

​

기존의 칩들과 전혀 다른 구조이기 때문에 이제 모든 ASIC 플레이어들은 엔비디아와의 'TCO 대비 퍼포먼스' 비교에서 엔비디아를 따라가기 위해 자체적인 Prefill ASIC을 동시에 개발해야 하는 상황이 시작됐습니다. 그리고 이제 추론에서도 엔비디아가 깔아둔 분산형 추론 설계를 채택할 경우 훨씬 더 TCO 대비 퍼포먼스가 우수해질 것입니다. 추론이 점점 복잡해질수록 훈련에서처럼 엔비디아가 가진 하드웨어·소프트웨어·네트워킹·공급망 관리 차원의 해자가 점점 더 강해질 것으로 예상합니다.

39
원문 흐름 39

​

Enfabrica 인수 : Agentic AI 워크로드를 준비하는 NVDA

젠슨 황이 다시 한번 초격차를 유지하기 위한 승부수를 띄웠습니다. 2025년 초 대만 ASIC 연구소를 통한 Rubin CPX(Long Context의 병목인 Prefill만 담당하는 ASIC) 도입과, Enfabrica의 기술 연계(ACF-S SuperNIC 및 메모리 패브릭 도입)는 2026~27년 본격화될 Agentic AI 시대를 장악하기 위한 핵심 퍼즐입니다.

​

마이크론과 AMD의 성장에는 Agentic AI이 포함되어 있습니다. 워크로드 성격이 바뀌기 때문에 그렇습니다:

​

LLM이 한 번 답을 뱉고 끝내는 게 아니라

LLM이 생각하고 → 검색 → DB조회 → 외부 API 호출/툴 실행 → 후속 추론을

여러 번 왕복하면서 하나의 작업을 처리하는 과정입니다.

​

이때 문제는 GPU가 느려서 생기는 게 아니라, AI GPU 서버 ↔ 일반 CPU 서버와의 통신량이 폭증하면서 병목이 생긴다는 것입니다. 더 많은 메모리를 쓰게 되고, CPU 서버 업그레이드 수요가 생기는 효과로 이어집니다.

​

엔비디아는 그래서:

​

NVLink로 랙 안의 GPU를 초저지연으로 묶어 Scale-up하고,

워크로드별로도 Prefill과 Decode를 분리하여 Prefill은 CPX로 빠르게 처리하며,

40
원문 흐름 40

Enfabrica에서 가져온 ACF-S SuperNIC 기술로 랙과 랙을 연결하는 Scale-out 네트워크를 만들고, 비싼 HBM 바깥의 외부 메모리 풀을 만들어 저렴한 DDR5 메모리를 연결하고 이더넷을 통해 GPU가 마치 자신의 메모리처럼 쓰게 만듭니다. 이렇게 되면 Long Context를 다루는 Agentic AI도 저렴하게 구동할 수 있게 되므로 4Q26쯤부터 Agentic AI 워크로드의 ROI가 크게 좋아지고 생산성이 향상될 것이라 예상합니다.

​

엔비디아의 그림을 생각해보면: CPX로 연산은 최대한 빠르게, AI 서버와 CPU 서버와의 연결도 빠르게 하고, 메모리 풀을 크게 확장하여, Agentic AI 워크로드에서 데이터가 오가는 길 전체를 가속화하려는 그림입니다. GPU는 최대한 연산에만 시간을 쓸 수 있도록 처리하니, 토큰당 비용($/token)과 토큰당 에너지(J/token)가 동시에 내려가면서 전체를 생각할 때 고객 입장에서 TCO 대비 퍼포먼스를 높이는 효과로 이어질 거라 예상합니다.

부정적이었던 내용

CY26 GPM 75% 유지, GAIN Act의 불확실성

CY26의 투입비용 부담이 늘어나는 중

AI서버뿐만 아니라 GP서버 수요까지 증가(2년간 억눌러온 상황에 Agentic AI 워크로드 증가하자 CPU 수요 증가)하자, 메모리 가격이 크게 오르면서 하드웨어 섹터 내에서 마진이 약간은 줄어들 리스크가 생기고 있습니다.

41
원문 흐름 41

​

엔비디아 CFO는 CY26를 전망할 때, 투입 비용이 증가하고 있음을 말했습니다. "투입 비용이 증가하고 있지만 GPM을 내년에도 75%대로 유지하기 위해서 노력하고 있다"는 것입니다.

​

이에 대해서 CFO는 ⓐ비용 절감(더 저렴한 메모리 사용) ⓑ제조시간 단축(같은 기간동안 더 많은 제품을 팔아서 고정비 줄이는) ⓒ제품 Mix 최적화(더 비싼 제품 판매)로 대응하여 CY26에도 GPM 75%를 유지하겠다는 계획입니다. 여기서 가격이 더 올라간다면 부담이 될 수 있겠지만 우선은 여러 수단을 써볼 수 있는 단계라고 답했습니다. 지금 당장으로서는 기대할 수 있는 답변 중에서 그나마 긍정적인 답변이었습니다.

​

강도로 보자면 BOM에서 차지하는 HBM 비중이 높을수록 문제입니다. 칩을 넘어서, 랙 단위 제품으로 판매하는 물량을 늘리고 있고 NVDA 입장에서는 상대적으로 덜하고, 가속기 중에서 HBM 비중이 높은 AWS Trainium, AMD 등이 상대적으로 영향을 많이 받는 구조일 것으로 봅니다. 구글 TPU가 상대적으로 유리한 구조이나 엔비디아도 상대적으로 가장 열위에 있진 않습니다. 그리고 엔비디아 입장에서는 계속해서 X Factor를 추가한 효과로 TCO 대비 퍼포먼스에서 경쟁력이 더 높아지고 → 그 결과 수요가 계속해서 높은 상태를 유지한다면 → 일부 가격인상을 통해서 고객들에게 전가할 수 있을 것이라 예상합니다.

42
원문 흐름 42

​

GAIN Act의 문제: ⓐ하이퍼스케일러 의존 ⓑNon-US 시장점유율 우려 Up

GAIN Act를 간단히 설명하면, AI HW 수요를 충족시킴에 있어서 미국에 컴퓨팅을 우선적으로 할당하고 다 배부르게 채우고 나면 Non-US로 수출하기 시작하라고 강제하는 법안입니다.

​

2H24부터 엔비디아는 이미 모든 하이퍼스케일러들에게 정가로 판매하고 있기 때문에 GPM이나 매출에 영향이 오진 않는데, 문제는 이렇게 되면 Non-US는 계속해서 미국 수요를 충족시키고 나서 할당받기에 Non-US 고객들에게는 TCO 대비 퍼포먼스 경쟁력상 늘 0.5~1.0세대 가까이 뒤처질 것으로 예상된다는 점이 문제였습니다. 예를 들어, CY26까지 미국 수요를 다 채우고 나서 CY27부터 GB300 NVL72를 판매해야 하는 상황이 된다는 의미입니다.

​

예상되는 문제 #1 - 미국 하이퍼스케일러 의존도 증가

GAIN Act를 실시하면 계속해서 미국에 있는 소수의 하이퍼스케일러 수요에만 의존하는 효과가 생긴다는 점이 엔비디아 입장에서는 좋지 않습니다. 하이퍼스케일러들은 이를 찬성했습니다. 하이퍼스케일러나 AI Labs들은 AI Diffusion Rule에 대해서도 중립 이상의 찬성 모습을 보였는데 같은 맥락입니다.

43
원문 흐름 43

가장 먼저 가장 좋은 칩을 할당받겠다는 니즈입니다.

​

엔비디아는 2023년 AI Boom 초입에 더 많은 기업들이 NVDA 컴퓨팅에 직접 접근할 수 있도록 하고자(= 하이퍼스케일러에 의존하는 상황을 타개하고자) 전략적으로 네오클라우드를 키웠던 것처럼 엔비디아는 최대한 많은 산업, 최대한 많은 기업, 최대한 많은 사용 사례에 채택될수록 협상력이 올라가는 구조(NVDA vs ASIC)입니다.

​

예상되는 문제 #2 - 화웨이는 놀고 있지 않다

조금 더 실존적인 위협은 2~3년 멀리 생각하면 화웨이에게 Non-US 시장을 뺏길 우려가 매우 높아진다는 점입니다. 화웨이가 제조능력을 올려서 첨단의 시스템을 Non-China로 충분히 판매할 수 있게 된다고 가정하면, 엔비디아 입장에서는 0.5~1세대 가까이 뒤처진 칩과 화웨이의 첨단의 시스템을 경쟁시켜야 하므로 Non-US 중 다소 중립적인 동남아시아, 중동, 아프리카, 남미에서 시장을 뺏길 우려가 커지기 때문에 문제였습니다. 분명 규제 강도는 다르지만 효과는 Diffusion Rule에서 겪었던 문제와 유사합니다.

​

다행인 소식: 트럼프, GAIN Act 반대할 듯

다행인 것은 오늘 실적발표만큼이나 좋았던 뉴스가 있는데, Axios 보도에 의하면 트럼프 행정부가 직접 나서서 "GAIN Act는 외교 관계와 산업계에 지나친 부담을 준다"며 제동을 걸고 있다는 내용입니다.

44
원문 흐름 44

수출 통제의 유연성이 확보되면서, 향후 글로벌 시장에서의 점유율 방어에 긍정적인 영향을 미칠 것으로 보입니다.

​

그리고 The Verge 보도에 의하면, 이번주 금요일에 트럼프는 캘리포니아 주 같은 곳에서 주 단위로 AI 규제 법률제정 시도를 불가능하게 만드는 행정명령에 서명할 예정입니다. GAIN Act까지 문제가 될 수 있었던 것들은 아니지만 주별로 AI 규제 법률을 만드는 것이 AI 발전에 걸림돌이 될 수 있었는데 이들을 모두 없애주는 것입니다.

​

투자의 생각 : 엔비디아(NVDA)

​

엔비디아(NVDA) 25년 PER 40배, EPS CAGR 3Y 60%, PEG 0.67배 : 실적발표 이후에도 Overweight를 유지합니다. 향후 5년 동안 누적 AI CAPEX가 $5T일 가능성에 대해서 여전히 그럴 가능성이 꽤 있다고 보고 있습니다. 이번 실적발표는 Preview에서 전해드린 것처럼 AI 수요 쓰나미를 확인한 시대에 갖게 되는 몇 가지 질문들에 답한 내용이 많았습니다. ⓐAI 사이클의 수요는 어디서 나와서 어떻게 흐르는가?

45
원문 흐름 45

ⓑASIC에 대해서는 어떻게 생각하는가? ⓒAI CAPEX $5T는 어떻게 조달할 수 있는가? ⓓ오픈AI발 순환 거래에 대해서는 어떻게 생각하는가?입니다. 최근 AI CAPEX 자금조달을 위한 회사채 발행에 대한 우려도 있었는데 이에 대해서는 11월 19일 일간보고 자료를 참고하시면 좋습니다. 더 높은 지능을 얻으면 새로운 사용 사례가 생기고, 동일 지능당 토큰 비용이 감소하면 더 많은 사람들이 채택하는 흐름이 계속해서 이어지고 있습니다. 제번스의 역설을 따라가는 중입니다. 현 시점에서 엔비디아를 둘러싼 수요-공급-경쟁역량을 고려할 때 여전히 Top Pick으로 보고 있습니다. 아직 VR200 NVL144 공급이 정상적으로 가능하기까지 또 한 번의 확인해야 할 사이클이 남아있기는 하지만, 수많은 X Factor들을 통해서 가늠할 때 해자는 이번 분기에 꽤나 강해졌다고 생각합니다. GPU-CPU-메모리, 800V DC, 데이터센터 연결, 오픈AI와 앤트로픽에게까지 ML/System에 대한 모든 것을 Co-deisgn하고 있습니다.

5

그럼에도 빠진내용 정리

잡담·곁다리 내용
  • 차트는 원문이 설명한 수치·축·해석만 회수했으며 이미지 자체의 추가 판독은 하지 않았다.
  • 원문에 포함된 계약·수주·생산량·마진의 일부는 작성자 또는 인용 주체의 추정·전망임을 flow와 분석에서 구분했다.
생략 기록

별도 생략 기록이 없습니다.

그럼에도 빠진내용 정리

보존 범위
목차의 이전 글 제목·투자자문 고지·원문 URL도 흐름에 보존했다.
화면 설명
차트와 이미지 자체는 별도 시각 근거가 없어, 원문이 설명한 축·수치·의미만 본문에 남겼다.
원문 안의 전망
NVL 랙 생산량, Rubin 일정, GPM 유지, GAIN Act와 Agentic AI 효과는 원문 작성자 또는 인용 주체의 전망·가정으로 보존했으며 확정 사실로 바꾸지 않았다.
원문 확인

document_work_runner prepare가 입력 원문을 수정 없이 보존했다.