2025.09.26 · 네이버 프리미엄 콘텐츠 · 올바른 미국주식 by SAPIENS

AI 사이클 한 눈에 보기, SemiAnalysis 인터뷰 : 승부사 엔비디아 젠슨황 그리고 화웨이의 역습

유형
네이버 프리미엄 콘텐츠
날짜
2025.09.26
강연자/작성자
올바른 미국주식 by SAPIENS
분석 주제
미지정
자료 길이
본문 45,795자
1

문서 전체 조망

핵심 구조

AI 사이클은 공급망의 실행력과 추론 수요의 운영 구조가 함께 바꾸고 있다

화웨이의 자립 로드맵, 엔비디아의 공급망 베팅, 클라우드의 전력·자금·칩 운용을 한 인터뷰 안에서 연결한다. 칩 설계와 발표만으로는 부족하고 실제 생산·전력·배포가 따라와야 AI 인프라의 규모가 결정되며, 이 실행 조건이 판단의 기준이 된다.

화웨이의 변수는 설계보다 제조

화웨이는 Prefill·Decode용 칩과 맞춤형 HBM 계획을 공개했지만, Ascend 생산량은 SMIC의 로직과 CXMT의 HBM 장비·수율에 달려 있다. 중국 수요를 채울 생산 능력의 시점과 규모가 불확실하다는 점이 로드맵 해석의 중심이다.

엔비디아의 우위는 제품과 공급망을 함께 확보하는 방식

인텔 투자는 노트북 협력의 계기가 될 수 있고, 엔비디아는 주문보다 앞서 공급망 능력을 잡는 베팅을 반복해왔다. 과거 취소·상각 위험도 감수해온 전략이라는 점에서 단순한 칩 성능 비교와 다르다.

AI CAPEX는 매출·현금·전력의 조건을 동시에 본다

오픈AI·오라클 계약과 대형 데이터센터 투자는 매출 성장·자본조달·현금 소진을 함께 확인해야 하며, 실제 클러스터 구축에서는 전력과 냉각·부지의 제약도 비용과 속도를 가른다.

AWS·오라클·xAI는 서로 다른 실행 병목을 안고 있다

AWS는 앤트로픽 협력과 네트워크 투자를 늘리면서도 데이터센터 전력·냉각 제약을 다루고, 오라클은 외부 용량 공동 엔지니어링과 GPU 임대 경제성을 계산한다. xAI는 전력 확보와 Colossus 2의 제시간 완공이 조건이다.

GB200은 성능 향상과 운영 난도를 같이 드러낸다

GB200 NVL72는 H100보다 TCO 성능이 개선되는 방향이지만, 72개 GPU를 묶은 구조는 고장·가동률·SLA 관리가 더 어렵다. 성능 수치가 실제 서비스 운영의 단순한 대체물이 아니라는 점을 보여준다.

추론 수요는 하드웨어 구조와 GPU 수급을 바꾼다

Prefill은 계산량, Decode는 KV Cache 메모리가 병목이어서 Rubin CPX처럼 분리된 설계가 등장한다. 주요 네오클라우드의 Hopper 매진과 Blackwell 배포 지연은 추론 수요가 기존 GPU까지 흡수하는 현장 상황으로 제시된다.

ANALYSIS VIEW사건별 사실과 작성자의 판단, 지속 정보를 나누어 읽기
2
발생·예정 사건과 출처별 관점

이슈 분석

이 자료가 이슈의 어떤 사실을 다루고, 작성자가 무슨 결론을 어떤 근거로 내렸는지 원문에 붙여 읽습니다.

발생발표·발생 후발생일 미확인

엔비디아의 인텔 투자와 협력

작성자의 핵심 판단

인터뷰 참여자는 인텔·엔비디아 협력이 특히 노트북 B2C 사업에 의미가 있고 인텔에는 새로운 동력이 될 수 있다고 평가한다.

근거 보기 1
  1. 원문 구간 1

    인텔의 내부 그래픽이나 AI 제품에는 어떤 일들이 일어날지 궁금합니다. 사실 인텔은 현재 두 사업부 모두에서 경쟁력 있는 제품을 못 내놓은 상황입니다. 특히 내부 그래픽 칩은 고성능 시장에서 경쟁력이 밀렸습니다. 두 기업에게 서로 말이 되는 협력입니다. 인텔 입장에서는 새로운 동력이 필요했다고 생각합니다. ​ AMD에게는 참 별로인 소식입니다. 두 숙적이 갑자기 팀을 이뤄서 AMD의 자리를 뺏으려 하는 거니까요. AMD의 하드웨어는 좋지만 소프트웨어 스택은 그렇지 않았습니다. ARM도 어떤 면에선 안 좋아졌다고 생각합니다. ARM의 소구점을 간단하게 정리하면 인텔과 협력하고 싶지 않은 모든 사람과 협력할 수 있는 솔루션이었기 때문입니다. 이제 갑자기 엔비디아가 인텔의 기술에 접근할 수 있게 됐고 어찌됐던 함께 협력하면서 판이 바뀔 거라 생각합니다. ​ 사라 왕 : 오늘 또 다른 소식은, 화웨이가 AI 로드맵을 공개한 것입니다. 성능을 좀 과장하고 있다고 보이는데, 중국의 현재 상황에 대한 당신의 생각을 듣고 싶습니다. DeepSeek가 다음 모델을 중국산 칩으로 훈련할 거라고 말한 것이나, 중국 정부가 엔비디아 칩 구매를 금지한 것에 대해서 어떻게 생각하시는지가 궁금합니다. ​ 딜런 파텔 Dylan Patel : 2020년부터 시작해서 좀 더 넓게 보면, 화웨이가 얼마나 대단한 회사인지 그리고 역사적으로 정말 뛰어난 회사였다는 걸 인식하는 게 가장 중요하다고 생각합니다. 물론 처음에는 Cisco의 소스코드나 펌웨어를 훔쳐서 시작했지만 그 후에 빠르게 경쟁자들을 넘어섰고, 다른 모든 통신회사들을 넘어섰습니다.

이 자료에서 다룬 사실

인터뷰에서 엔비디아가 인텔에 50억달러를 투자했다는 소식과, 발표 직후 인텔 주가가 시간외에서 30% 상승했다는 내용을 전한다.

근거 보기 1
  1. 원문 구간 1

    ​ *투자자문계약 권유문서 : https://naver.me/5ZST47Qf 목차 ​ 엔비디아, 인텔 그리고 화웨이 : 화웨이의 로드맵에 대한 SemiAnalysis의 생각 엔비디아의 2026년 전망 : 엔비디아의 점유율은 크게 안 바뀔 것이며, 연간 수조달러의 시장이 열릴 것 '승부사', 젠슨 황 : 젠슨황의 계획은 오픈AI와의 딜에 있었다 AWS 부활의 신호탄 : Anthropic과의 협력을 강화하다 오라클의 경쟁력 : 래리 엘리슨의 생각, 컴퓨팅 쓰나미가 온다 일론 머스크의 추진력 : xAI가 가장 먼저 GW급 클러스터를 만들 수도 GB200 NVL 그리고 Rubin CPX : 엔비디아가 미래를 준비하는 방법들 GPU는 마치 코카인을 사는 것 같다 : 추론 수요의 폭증으로 Hopper도 매진되는 상태 딜런 파텔 Dylan Patel 2025년 9월 22일, SemiAnalysis 창업자 겸 수석 애널리스트 : 엔비디아, 인텔, 중국 엔비디아, 인텔 그리고 화웨이 화웨이의 로드맵에 대한 SemiAnalysis의 생각 *세미애널리시스(SemiAnalysis)는 AI 반도체 분야 공부에 가장 많이 참고하는 독립리서치입니다. 창업자이자 수석 애널리스트이자 CEO인 딜런 파텔(Dylan Patel)의 인터뷰입니다. 세미애널리스트 팀은 소프트웨어, 하드웨어, 네트워킹, 데이터센터 등 각 분야별로 이해도가 높고 데이터를 끊임없이 트래킹하고 있기에 업계에선 유명합니다. ​ *인터뷰어는 a16z의 에릭 토렌버그(Erik Torenberg), 사라 왕(Sarah Wang), 귀도 아펜젤러(Guido Appenzeller)가 참여했습니다.

이 자료에서 다룬 실제 시장 반응

투자 사실이 알려진 직후 인텔이 시간외에서 30% 상승했다고 전한다.

근거 보기 1
  1. 원문 구간 1

    ​ *투자자문계약 권유문서 : https://naver.me/5ZST47Qf 목차 ​ 엔비디아, 인텔 그리고 화웨이 : 화웨이의 로드맵에 대한 SemiAnalysis의 생각 엔비디아의 2026년 전망 : 엔비디아의 점유율은 크게 안 바뀔 것이며, 연간 수조달러의 시장이 열릴 것 '승부사', 젠슨 황 : 젠슨황의 계획은 오픈AI와의 딜에 있었다 AWS 부활의 신호탄 : Anthropic과의 협력을 강화하다 오라클의 경쟁력 : 래리 엘리슨의 생각, 컴퓨팅 쓰나미가 온다 일론 머스크의 추진력 : xAI가 가장 먼저 GW급 클러스터를 만들 수도 GB200 NVL 그리고 Rubin CPX : 엔비디아가 미래를 준비하는 방법들 GPU는 마치 코카인을 사는 것 같다 : 추론 수요의 폭증으로 Hopper도 매진되는 상태 딜런 파텔 Dylan Patel 2025년 9월 22일, SemiAnalysis 창업자 겸 수석 애널리스트 : 엔비디아, 인텔, 중국 엔비디아, 인텔 그리고 화웨이 화웨이의 로드맵에 대한 SemiAnalysis의 생각 *세미애널리시스(SemiAnalysis)는 AI 반도체 분야 공부에 가장 많이 참고하는 독립리서치입니다. 창업자이자 수석 애널리스트이자 CEO인 딜런 파텔(Dylan Patel)의 인터뷰입니다. 세미애널리스트 팀은 소프트웨어, 하드웨어, 네트워킹, 데이터센터 등 각 분야별로 이해도가 높고 데이터를 끊임없이 트래킹하고 있기에 업계에선 유명합니다. ​ *인터뷰어는 a16z의 에릭 토렌버그(Erik Torenberg), 사라 왕(Sarah Wang), 귀도 아펜젤러(Guido Appenzeller)가 참여했습니다.

그렇게 판단한 이유

인텔의 내장 그래픽과 AI 제품이 고성능 시장에서 경쟁력을 잃은 상황, 엔비디아가 인텔 기술에 접근하게 된 점, AMD의 소프트웨어 스택 약점을 함께 든다.

근거 보기 1
  1. 원문 구간 1

    인텔의 내부 그래픽이나 AI 제품에는 어떤 일들이 일어날지 궁금합니다. 사실 인텔은 현재 두 사업부 모두에서 경쟁력 있는 제품을 못 내놓은 상황입니다. 특히 내부 그래픽 칩은 고성능 시장에서 경쟁력이 밀렸습니다. 두 기업에게 서로 말이 되는 협력입니다. 인텔 입장에서는 새로운 동력이 필요했다고 생각합니다. ​ AMD에게는 참 별로인 소식입니다. 두 숙적이 갑자기 팀을 이뤄서 AMD의 자리를 뺏으려 하는 거니까요. AMD의 하드웨어는 좋지만 소프트웨어 스택은 그렇지 않았습니다. ARM도 어떤 면에선 안 좋아졌다고 생각합니다. ARM의 소구점을 간단하게 정리하면 인텔과 협력하고 싶지 않은 모든 사람과 협력할 수 있는 솔루션이었기 때문입니다. 이제 갑자기 엔비디아가 인텔의 기술에 접근할 수 있게 됐고 어찌됐던 함께 협력하면서 판이 바뀔 거라 생각합니다. ​ 사라 왕 : 오늘 또 다른 소식은, 화웨이가 AI 로드맵을 공개한 것입니다. 성능을 좀 과장하고 있다고 보이는데, 중국의 현재 상황에 대한 당신의 생각을 듣고 싶습니다. DeepSeek가 다음 모델을 중국산 칩으로 훈련할 거라고 말한 것이나, 중국 정부가 엔비디아 칩 구매를 금지한 것에 대해서 어떻게 생각하시는지가 궁금합니다. ​ 딜런 파텔 Dylan Patel : 2020년부터 시작해서 좀 더 넓게 보면, 화웨이가 얼마나 대단한 회사인지 그리고 역사적으로 정말 뛰어난 회사였다는 걸 인식하는 게 가장 중요하다고 생각합니다. 물론 처음에는 Cisco의 소스코드나 펌웨어를 훔쳐서 시작했지만 그 후에 빠르게 경쟁자들을 넘어섰고, 다른 모든 통신회사들을 넘어섰습니다.

원문에서 직접 연결한 대상엔비디아인텔
발생발표·발생 후발생일 미확인

화웨이 AI 로드맵 공개

작성자의 핵심 판단

작성자는 화웨이의 설계 격차보다 충분한 생산능력을 얼마나 빨리 확보하느냐를 핵심 문제로 본다.

근거 보기 1
  1. 원문 구간 1

    ​ 딜런 파텔 Dylan Patel : 로직이 있고, 메모리가 있습니다. 이번 화웨이 발표에서 놀라웠던 점은 메모리입니다. HBM을 자체적으로 하고 있다는 게 흥미로운 포인트였습니다. 그들은 2026년에 두 가지 유형의 다른 칩을 출시한다고 발표했습니다. 하나는 Recommendation과 Prefill에 초점을 맞춘 칩이고, 다른 하나는 Decode에 초점을 맞춘 칩입니다. 엔비디아에서도 최근 Prefill을 위한 칩을 따로 내놨죠. Prefill과 Decode를 나눠서 각각을 효율화하려는 수많은 AI 하드웨어 스타트업들이 있습니다. ​ 그래서, 추론을 두 가지 워크로드로 나눈 이러한 방식은 화웨이도 똑같이 적용하려 하고 있다는 것입니다. 그리고 맞춤형 HBM도 설계했다는 것이죠. 이게 무슨 의미일까요? 공급망은 어떻게 구성할까요? 그게 가장 까다로운 부분입니다. 얼마나 많이 제조할 수 있을 것인가가 핵심입니다. 제조 능력이 충분하지 않습니다. 설계 능력 자체는 엔비디아의 칩에 비해 전력을 좀 더 소비할 것이고, 대역폭도 좀 더 낮겠지만 큰 격차를 둘 정도는 아닙니다. 중요한 문제는 생산 능력입니다. ​ *코멘트 → SemiAnalysis에 따르면, 화웨이가 로직 반도체에서 SMIC를 통해 자체 조달하기 전까지 TSMC를 통해 로직 웨이퍼 재고를 Die Bank에 비축한 것처럼, 메모리 반도체에서는 CXMT를 통해 자체 조달이 가능하기 전까지 삼성을 통해서 HBM 재고를 비축했습니다. 삼성은 엔비디아향 가속기 공급망 진입에서 실패했기에 화웨이향으로 HBM2e를 판매했습니다.

이 자료에서 다룬 사실

화웨이가 AI 로드맵을 공개했고, 2026년에 Recommendation·Prefill용 칩과 Decode용 칩을 내놓으며 맞춤형 HBM을 설계했다고 소개한다.

근거 보기 2
  1. 원문 구간 1

    ​ 2020년에는 Ascend 칩을 출시하고 모두가 볼 수 있도록 공개 벤치마크를 발표했었는데, 7nm AI 칩을 처음으로 출시한 기업이었습니다. 여전히 엔비디아가 앞서 있었긴 했지만 이때 격차가 거의 없었던 수준이었던 겁니다. 이때는 화웨이가 글로벌 공급망 전체에 자유롭게 접근할 수 있었던 때입니다. 그리고 TSMC의 최대 고객으로 자리매김하기 위해 애플을 막 넘겼을 때였습니다. 설계 관점에서 다른 모든 플레이어들보다 앞서 있었습니다. 물론 그때도 그랬고 지금도 엔비디아가 높은 시장점유율을 갖고 있지만, 그때는 AI가 상당히 초기 단계였기 때문에 사실은 돌아보면 그때는 화웨이가 시장을 장악하기 직전이던 순간이었습니다. 트럼프 정부에 의해서 2020년부터 공급망 접근이 금지됐고 소량의 칩만 생산할 정도로 줄어들었습니다. ​ 그 후로 몇 년 동안 화웨이의 개발이 막혔었기 때문에, 엔비디아는 계속해서 가속화할 수 있었고 화웨이는 TSMC로의 접근이 금지됐기 때문에 중국 내의 TSMC 역할인 SMIC에서 제조하는 방법을 알아내려 노력했습니다. 서류만 있는 기업들을 만들어서 TSMC에 파운드리 칩 제조를 맡기고, 한국에서 HBM을 구매하려 시도하는 등 다양한 시도를 해서 공급을 늘리려고 시도했습니다. ​ 2024년 말쯤에는 이것이 미국에게 적발되어 중단하게 됐지만, 그때는 화웨이가 TSMC로부터 290만 개의 칩을 생산할 수 있을 만큼의 칩을 확보한 뒤였습니다. 대략 $500M 만큼의 주문이었습니다. 그래서 미국 정부가 TSMC에 $1B 벌금을 부과하기도 했죠.

  2. 원문 구간 2

    ​ 딜런 파텔 Dylan Patel : 로직이 있고, 메모리가 있습니다. 이번 화웨이 발표에서 놀라웠던 점은 메모리입니다. HBM을 자체적으로 하고 있다는 게 흥미로운 포인트였습니다. 그들은 2026년에 두 가지 유형의 다른 칩을 출시한다고 발표했습니다. 하나는 Recommendation과 Prefill에 초점을 맞춘 칩이고, 다른 하나는 Decode에 초점을 맞춘 칩입니다. 엔비디아에서도 최근 Prefill을 위한 칩을 따로 내놨죠. Prefill과 Decode를 나눠서 각각을 효율화하려는 수많은 AI 하드웨어 스타트업들이 있습니다. ​ 그래서, 추론을 두 가지 워크로드로 나눈 이러한 방식은 화웨이도 똑같이 적용하려 하고 있다는 것입니다. 그리고 맞춤형 HBM도 설계했다는 것이죠. 이게 무슨 의미일까요? 공급망은 어떻게 구성할까요? 그게 가장 까다로운 부분입니다. 얼마나 많이 제조할 수 있을 것인가가 핵심입니다. 제조 능력이 충분하지 않습니다. 설계 능력 자체는 엔비디아의 칩에 비해 전력을 좀 더 소비할 것이고, 대역폭도 좀 더 낮겠지만 큰 격차를 둘 정도는 아닙니다. 중요한 문제는 생산 능력입니다. ​ *코멘트 → SemiAnalysis에 따르면, 화웨이가 로직 반도체에서 SMIC를 통해 자체 조달하기 전까지 TSMC를 통해 로직 웨이퍼 재고를 Die Bank에 비축한 것처럼, 메모리 반도체에서는 CXMT를 통해 자체 조달이 가능하기 전까지 삼성을 통해서 HBM 재고를 비축했습니다. 삼성은 엔비디아향 가속기 공급망 진입에서 실패했기에 화웨이향으로 HBM2e를 판매했습니다.

그렇게 판단한 이유

TSMC Die Bank와 삼성 HBM 재고, CXMT의 HBM 장비·수율, SMIC의 로직 생산능력이 Ascend 생산량을 가르는 변수라고 연결한다.

근거 보기 3
  1. 원문 구간 1

    실제로 벌금이 발행됐는지에 대해서는 뉴스가 없습니다. 이 290만 개의 칩을 기억하는 게 중요한 이유는, 시중에 떠도는 Ascend 칩의 수가 아직 이 전체 용량을 다 쓰지 못했을 만큼 적기 때문입니다. ​ *코멘트 → 2003년에 시스코는, 화웨이가 1999년에 시스코의 소스코드/매뉴얼/CLI 등을 복제했다는 내용으로 소송을 제기했습니다. 그리고 2019~2020년 화웨이의 설계부문 자회사였던 HiSilicon이 TSMC 전체 매출의 2위권이었고 애플과 얼마 차이가 나지 않던 때였습니다. TSMC는 2020년 9월 이후 화웨이에 칩을 판매하지 않겠다고 말했었으나, 실제로는 2024년 10월까지도 우회수출을 해왔던 상황이었습니다. 실제 화웨이의 Ascend 910B, 910C도 생산까지는 연결됐지만 실제 양산은 매우 적은 양만 해둔 상태입니다. 화웨이 칩의 연간 출하량을 20만 개 수준으로 예측할 만큼, Die Bank는 아직 풀리지 않은 상태입니다. TSMC에 주문해뒀던 Die Bank가 대략 200만 개 이상 남아있다고 추정할 수 있습니다. ​ *코멘트 → SemiAnalysis 추정치에 의하면, 화웨이의 2024년 Ascend 출하량은 50.7만 개 → 2025년에는 80.5만 개입니다. SMIC에서 생산하는 것도 쓰이지만 장비가 부족했고 수율이 낮았기에 생산량이 부족한 보릿고개를 지나가기 위해서 TSMC에게 칩을 우회수입했던 것입니다. TSMC의 Die Bank는 향후 9개월 내 소진될 것으로 예상하지만 그 이후부터 상당한 칩을 생산할 캐파가 온라인되기 때문에 2026년부터는 SMIC에서 나오는 웨이퍼를 모두 Ascend 칩 생산에 쓴다면 병목이 생기지 않는 수준까지 이를 수 있습니다.

  2. 원문 구간 2

    2024년 12월에 미국 산업안보국(BIS)가 중국으로 HBM 수출을 금지했지만, 판결 이후에도 2025년 1월까지 CoAsia Electronics, Faraday 같은 일종의 칩에 HBM만 탑재해달라고 요청하는 쉘 컴퍼니들을 통해서 삼성 HBM이 화웨이향으로 흘러들어갔었습니다. 총 1,300만 개의 HBM 스택을 저장해뒀는데 이정도 규모면 160만 개의 Ascend 910C를 생산할 수 있는 양입니다. HBM 자체가 부족하단 의미입니다. ​ *코멘트 → 대신 CXMT가 램프업할 시간을 벌어줬기 때문에 2026년부터는 CXMT의 HBM 스택 생산량이 얼마가 될 것이냐가 이제 화웨이의 Ascend 생산 계획에 가장 중요한 변수가 됩니다. CXMT의 HBM 생산량을 결정하는 건 두 가지입니다. DRAM을 HBM으로 전환하는 데 필요한 장비를 아직 충분히 갖추지 못했는데 이 장비를 얼마나 많이 들여올 수 있는가, 그리고 수율을 얼마나 빨리 올릴 수 있는가의 두 가지가 중요합니다. ​ *코멘트 → 시나리오에 따라 2026년의 Ascend 생산량은 2026년에 25~30만 개 정도일 수도 있고, 500만개 정도일 수도 있습니다. 2026년 4분기에 출시하는 Atlas 950 SuperPod이 8,192개의 Ascend 950DT를 엮은 것임을 생각해보면 30~37개의 Atlas 950 SuperPod을 만들거나 혹은 610개의 Atlas 950 SuperPod을 만들 수 있는 규모가 된다는 의미입니다. 상하단 범위가 큽니다. 아래에 따로 해설을 달아드렸는데, 그 전에 미리 한 번 말씀드리면 Atlas 950 SuperPod(8,192-XPU)의 경우 VR200 NVL144(2H26 양산예정) 기준 4.4개의 랙과 같은 컴퓨팅 규모입니다.

  3. 원문 구간 3

    그렇다는 건 엔비디아의 칩으로 구매할 때 VR200 NVL 144 랙 기준 144개~163개 혹은 2,684개를 가질 수 있다는 겁니다. VR200 GPU 기준으로 바꿔서 보면 20,736개~23,472개 혹은 386,496개의 GPU를 갖는 규모입니다. JPMorgan 추정치 기준 엔비디아의 CY26 AI GPU 총 생산량은 630만 개 정도로 예상하므로 대략 엔비디아의 칩 전체 생산분 중 6.1%정도 규모입니다. 그래서 대략 2027~2028년까지는 SMIC x CXMT의 Bull Case를 가정하더라도 중국 내부의 컴퓨팅을 충족하는 데에만 쓰일 것으로 예상합니다. ​ 딜런 파텔 Dylan Patel : 엔비디아가 중국에서 금지되었고, 중국은 엔비디아 칩을 사지 말라고 하고 있습니다. 한동안에는 화웨이도 자체 칩을 생산할 수 있을 겁니다. 중국의 입장에서 보자면, 2024년에 주문해서 받아뒀지만 AI 칩으로 전환하지는 않은 용량들이 아직 많습니다. 이제 그 용량들을 AI 칩으로 전환하고 있습니다. 비축량을 소진하는 상태인 건데, 이걸 다 쓰고나면 새로운 물량을 생산하기까지의 과정이 정말 까다로운 구간일 겁니다. ​ 다만, 저는 중국이 내부적으로 생산량을 늘릴 수 있을 거라고 생각합니다. 시간이 좀 더 걸릴 수도 있고, 중국이 중간중간 협상에서 물러나는 듯 보이면서 바이트댄스처럼 엔비디아의 칩을 대거 구매하는 모습들도 나올 거라 생각합니다. 바이트댄스는 생태계를 살리기 위해 캠브리콘이나 화웨이 칩을 일부 쓰지만, 엔비디아의 제품이 훨씬 좋기 때문에 엔비디아 칩을 살 수만 있다면 사고 싶어합니다.

원문에서 직접 연결한 대상화웨이Ascend중국 AI 반도체 산업
3
사실·구조, 해석·전망, 시점 관찰, 판단 방법

지식·관점

사건 밖에서도 다시 참고하거나 다른 자료와 비교할 가치가 있는 내용을 대상과 반복 가능한 논점으로 묶습니다.

사실·구조AI 인프라 지출주 대상 · 산업·업종 · AI 인프라

AI 인프라 지출과 소프트웨어 매출을 왜 같은 방식으로 계산하면 안 되는가

이 자료가 더한 내용

AI 모델은 CPU·데이터베이스·네트워크처럼 소프트웨어의 구성요소가 될 수 있으며, 인프라 비용과 그 위에서 발생하는 광고·소프트웨어 매출은 다른 항목으로 인식된다는 논리를 제시한다. GPU 인프라 500억달러 지출은 전 세계 연간 IT 지출 5조달러와 비교된다.

근거 보기 1
  1. 원문 구간 1

    ⓐ규모가 잘못됐다. ⓑ인프라는 그렇게 계산되지 않는다는 것입니다. 그중 핵심은 ⓑ였습니다. 내용은 이랬습니다: 오랫동안 AI 업계에 있었던 귀도 아펜젤러가 보기에 AI 모델은 CPU, 데이터베이스, 네트워크처럼 IT 인프라의 한 구성요소였습니다. 이미 오늘날 거의 모든 소프트웨어는 CPU, 데이터베이스, 네트워크를 사용하고 있습니다. 미래의 소프트웨어는 어떻게 변할지 생각해보면 마찬가지입니다. 모든 소프트웨어는 AI 기술 스택을 내재하고 구동된다는 것입니다. 또한 연간 네트워킹 인프라 CAPEX는 $200B 이상이지만, 이를 통해 '네트워킹 소프트웨어'가 $800B 이상 발생할 거라고 보는 사람은 없습니다. 그러나 구글은 이렇게 깔린 네트워킹 인프라를 이용하여 광고를 판매하고 있고 이는 네트워킹 매출이 아닌 광고매출로 잡힙니다. 마이크로소프트는 이렇게 깔린 네트워킹 인프라를 이용하여 엑셀과 파워포인트를 팔고 있으며 이는 네트워킹 매출이 아닌 소프트웨어 매출로 잡힙니다. 인프라 지출에 대한 비용과 그로 인해 발생할 매출에 대한 인식과정은 다릅니다. 따라서 $200B 문제는 없습니다. AI는 소프트웨어를 비롯한 모든 제품의 필수요소가 될 것입니다. GPU 인프라에 대한 $50B 지출은 전 세계적으로 연간 $5T에 달하는 IT 전체 지출비용(Worldwide IT Spend)에 비하면 작습니다. ​ 귀도 아펜젤러 Guido Appenzeller : 단기적으로 볼 때, 엔비디아와 인텔 모두 B2C 사업부에는 정말 좋을 거 같아요. 특히 노트북에서 인텔과 협력을 강화하면 정말 놀라운 일이 될 겁니다.

사실·구조화웨이 Ascend 공급주 대상 · 기업·종목 · 화웨이관련 대상 · 기술·제품 · Ascend

화웨이 Ascend의 생산량은 어떤 공급망 제약에 좌우되는가

이 자료가 더한 내용

로직은 SMIC 생산능력, 메모리는 CXMT의 HBM 장비 도입과 수율이 제약이며, 화웨이가 설계한 HBM·Prefill·Decode 분리 자체보다 제조능력이 핵심이라고 설명한다.

근거 보기 3
  1. 원문 구간 1

    로직과 메모리입니다. TSMC를 대체하는 것과, SK하이닉스, 마이크론, 삼성전자를 대체해야 합니다. 로직에서는 뒤처져 있기는 하지만 정말 빠르게 성장하고 있습니다. 중국 내부적으로 필요로 하는 생산능력에 도달할 수 있다고 생각합니다. ​ 미국은 여전히 중국이 필요로 하는 모든 장비를 수입하는 걸 거의 허용하고 있는 상태입니다. 금지 조치는 5nm 이하의 선단공정에만 국한되어 있습니다. 여기서 중국은 스펙상 14nm를 위한 장비를 수입한다고 말하고 있지만 실제로는 7nm 칩을 만들 수준의 장비를 구매하고 있습니다. 그래서 중국은 7nm AI 칩을 대량으로 생산하는 데 문제가 없고, 어쩌면 기존 장비를 사용해서 5nm까지도 가져다 쓸지도 모릅니다. ​ *코멘트 → SMIC는 상당량의 장비를 수입하고 있습니다. 미국과 네덜란드의 주요 장비들을 보면 중국향 매출이 40~50%에 가까운 걸 보실 수 있습니다. 어떻게 가능한가 보면 여러 가지를 고려해야 합니다. ⓐ주로 일본과 네덜란드 장비를 수입해서 쓰고 있습니다. 수출통제가 나오더라도 일본과 네덜란드가 이를 잘 따르지 않는다는 데에서 괴리가 생깁니다. 대부분의 대응조치가 6개월 지연되거나 아예 시행되지 않는 경우들도 있습니다. 중국 기업들은 수년 치 장비를 한 번에 주문하지만 미국 장비기업들만 중국발 대규모 수주러시에서 배제되는 상황이 많이 나오는 중입니다. 특히 일본 기업들이 조용히 중국발 특수를 누리기 위해 빠르게 주문을 처리하고 있습니다. 그리고 일본과 네덜란드는 재수출에 대해 많은 규제를 하고 있지 않기 때문에 예를 들어 제3국을 통과했다가 그 국가에서 사용한 뒤 중고품으로 중국으로 판매할 경우 이를 규제하지 않고 있습니다.

  2. 원문 구간 2

    ​ 딜런 파텔 Dylan Patel : 로직이 있고, 메모리가 있습니다. 이번 화웨이 발표에서 놀라웠던 점은 메모리입니다. HBM을 자체적으로 하고 있다는 게 흥미로운 포인트였습니다. 그들은 2026년에 두 가지 유형의 다른 칩을 출시한다고 발표했습니다. 하나는 Recommendation과 Prefill에 초점을 맞춘 칩이고, 다른 하나는 Decode에 초점을 맞춘 칩입니다. 엔비디아에서도 최근 Prefill을 위한 칩을 따로 내놨죠. Prefill과 Decode를 나눠서 각각을 효율화하려는 수많은 AI 하드웨어 스타트업들이 있습니다. ​ 그래서, 추론을 두 가지 워크로드로 나눈 이러한 방식은 화웨이도 똑같이 적용하려 하고 있다는 것입니다. 그리고 맞춤형 HBM도 설계했다는 것이죠. 이게 무슨 의미일까요? 공급망은 어떻게 구성할까요? 그게 가장 까다로운 부분입니다. 얼마나 많이 제조할 수 있을 것인가가 핵심입니다. 제조 능력이 충분하지 않습니다. 설계 능력 자체는 엔비디아의 칩에 비해 전력을 좀 더 소비할 것이고, 대역폭도 좀 더 낮겠지만 큰 격차를 둘 정도는 아닙니다. 중요한 문제는 생산 능력입니다. ​ *코멘트 → SemiAnalysis에 따르면, 화웨이가 로직 반도체에서 SMIC를 통해 자체 조달하기 전까지 TSMC를 통해 로직 웨이퍼 재고를 Die Bank에 비축한 것처럼, 메모리 반도체에서는 CXMT를 통해 자체 조달이 가능하기 전까지 삼성을 통해서 HBM 재고를 비축했습니다. 삼성은 엔비디아향 가속기 공급망 진입에서 실패했기에 화웨이향으로 HBM2e를 판매했습니다.

  3. 원문 구간 3

    2024년 12월에 미국 산업안보국(BIS)가 중국으로 HBM 수출을 금지했지만, 판결 이후에도 2025년 1월까지 CoAsia Electronics, Faraday 같은 일종의 칩에 HBM만 탑재해달라고 요청하는 쉘 컴퍼니들을 통해서 삼성 HBM이 화웨이향으로 흘러들어갔었습니다. 총 1,300만 개의 HBM 스택을 저장해뒀는데 이정도 규모면 160만 개의 Ascend 910C를 생산할 수 있는 양입니다. HBM 자체가 부족하단 의미입니다. ​ *코멘트 → 대신 CXMT가 램프업할 시간을 벌어줬기 때문에 2026년부터는 CXMT의 HBM 스택 생산량이 얼마가 될 것이냐가 이제 화웨이의 Ascend 생산 계획에 가장 중요한 변수가 됩니다. CXMT의 HBM 생산량을 결정하는 건 두 가지입니다. DRAM을 HBM으로 전환하는 데 필요한 장비를 아직 충분히 갖추지 못했는데 이 장비를 얼마나 많이 들여올 수 있는가, 그리고 수율을 얼마나 빨리 올릴 수 있는가의 두 가지가 중요합니다. ​ *코멘트 → 시나리오에 따라 2026년의 Ascend 생산량은 2026년에 25~30만 개 정도일 수도 있고, 500만개 정도일 수도 있습니다. 2026년 4분기에 출시하는 Atlas 950 SuperPod이 8,192개의 Ascend 950DT를 엮은 것임을 생각해보면 30~37개의 Atlas 950 SuperPod을 만들거나 혹은 610개의 Atlas 950 SuperPod을 만들 수 있는 규모가 된다는 의미입니다. 상하단 범위가 큽니다. 아래에 따로 해설을 달아드렸는데, 그 전에 미리 한 번 말씀드리면 Atlas 950 SuperPod(8,192-XPU)의 경우 VR200 NVL144(2H26 양산예정) 기준 4.4개의 랙과 같은 컴퓨팅 규모입니다.

해석·전망중국 AI 칩 대체주 대상 · 산업·업종 · 중국 AI 반도체 산업

중국 내 AI 칩 대체는 어떤 시간표와 시장 범위를 가정하는가

이 자료가 더한 내용

중국이 내부 생산량을 늘릴 수 있으나 시간이 걸리고, SMIC·CXMT의 낙관 시나리오에서도 2027~2028년까지는 중국 내부 컴퓨팅 수요를 채우는 데 쓰일 것으로 예상한다.

근거 보기 4
  1. 원문 구간 1

    그렇다는 건 엔비디아의 칩으로 구매할 때 VR200 NVL 144 랙 기준 144개~163개 혹은 2,684개를 가질 수 있다는 겁니다. VR200 GPU 기준으로 바꿔서 보면 20,736개~23,472개 혹은 386,496개의 GPU를 갖는 규모입니다. JPMorgan 추정치 기준 엔비디아의 CY26 AI GPU 총 생산량은 630만 개 정도로 예상하므로 대략 엔비디아의 칩 전체 생산분 중 6.1%정도 규모입니다. 그래서 대략 2027~2028년까지는 SMIC x CXMT의 Bull Case를 가정하더라도 중국 내부의 컴퓨팅을 충족하는 데에만 쓰일 것으로 예상합니다. ​ 딜런 파텔 Dylan Patel : 엔비디아가 중국에서 금지되었고, 중국은 엔비디아 칩을 사지 말라고 하고 있습니다. 한동안에는 화웨이도 자체 칩을 생산할 수 있을 겁니다. 중국의 입장에서 보자면, 2024년에 주문해서 받아뒀지만 AI 칩으로 전환하지는 않은 용량들이 아직 많습니다. 이제 그 용량들을 AI 칩으로 전환하고 있습니다. 비축량을 소진하는 상태인 건데, 이걸 다 쓰고나면 새로운 물량을 생산하기까지의 과정이 정말 까다로운 구간일 겁니다. ​ 다만, 저는 중국이 내부적으로 생산량을 늘릴 수 있을 거라고 생각합니다. 시간이 좀 더 걸릴 수도 있고, 중국이 중간중간 협상에서 물러나는 듯 보이면서 바이트댄스처럼 엔비디아의 칩을 대거 구매하는 모습들도 나올 거라 생각합니다. 바이트댄스는 생태계를 살리기 위해 캠브리콘이나 화웨이 칩을 일부 쓰지만, 엔비디아의 제품이 훨씬 좋기 때문에 엔비디아 칩을 살 수만 있다면 사고 싶어합니다.

  2. 원문 구간 2

    바이트댄스는 국내 공급망 같은 건 사실 신경쓰지 않습니다. 최고의 모델을 만들고 싶어합니다. 가능한 한 효율적으로 AI를 배포하고 싶어합니다. 그렇다는 건 중국 정부가 그들에게 그렇게 하지 말라고 명령하고 있다는 뜻이기도 합니다. 엔비디아가 경쟁력을 잃은 게 아니라 정부가 명령하고 규제하고 있는 겁니다. ​ 밀수는 여전히 일어나고 있습니다. 다른 나라에서 구매하고 중국으로 칩을 재수출하는 겁니다. 모두들 예상하시겠지만 어느 낮은 볼륨으로 계속해서 일어나고는 있습니다. *코멘트 → 2026년에 나올 엔비디아 Rubin GPU와 화웨이의 Ascend 950/960DT 칩 하나당 퍼포먼스 차이를 보여주는 Bernstein의 테이블입니다. 엔비디아의 Rubin GPU 하나의 성능을 내기 위해서 Ascend 950/960DT 칩은 12.8개가 필요한 상황입니다. Atlas 950 SuperPod은 총 8,192개의 Ascend 950DT를 엮어서 하나의 랙으로 만든 건데, VR200 NVL144를 기준으로 하면 4.4개 정도의 랙으로 만들 수 있습니다. 성능 대비 효율 면에서는 비교할 수 없는 규모이지만 중국의 목표는 미국으로부터 수출규제를 받아서 컴퓨팅을 충족할 수 없을 때 자체적으로 충당하기 위한 기준이므로 효율은 크게 필요 없는 상황이기도 합니다. 중국 내에서는 컴퓨팅만 필요하고 데이터센터 건설과 전력은 충분히 빠르게 할 수 있는 상황이니 전력이나 공간밀도 같은 건 크게 고려하지 않은 제품입니다. 그리고 실제로 NVL72, NVL144도 힘든 것임을 생각해보면은 8,192-XPU 및 15,488-XPU에서 얼마의 효율로 작동할지도 실제 배포해봐야 정확한 비교가 가능할 거라고 봅니다.

  3. 원문 구간 3

    서방이라는 건 중국을 제외한 동아시아의 생산 능력을 뜻합니다. 여기에 도달하기까지 시간이 걸릴 겁니다. ​ 그래서, 종합해보면 이건 중국이 할 수 '있다', '없다'의 문제가 아니라 '언제' 제조할 수 있을 거냐의 문제입니다. 만약의 문제가 아닌 언제의 문제입니다. 미국 정부가 알아야 할 전체적인 계산법입니다. 예를 들어, 어떤 수준의 AI 칩을 판매할 것이냐가 문제가 아닙니다. AI는 훨씬 더 강력한 시장을 가질 것이며, 반도체 및 장비의 TAM보다 훨씬 더 큰 시장일 것이기 때문입니다. 중국은 어떤 수를 써서라도 자체 공급망을 가질 겁니다. ​ 사라 왕 : 그렇다면 당신이 젠슨이라면, 이 상황에서 다음의 수는 무엇일까요? ​ 딜런 파텔 Dylan Patel : 젠슨이 AMD보다 화웨이를 더 두려워한다는 건 부분적으로 사실입니다. 2020년 제재가 내려지기 직전에 화웨이가 애플을 이겼습니다. 이미 TSMC 주문량에서 애플을 이겼고, 스마트폰 점유율에서도 애플을 이겼습니다. 미국에서는 아니지만 세계 여러 지역에서요. 지금도 서방 공급망 없이 시장 점유율을 늘리고 있습니다. 아시다시피 이미 수많은 산업에서 이렇게 해왔죠. 강력한 경쟁자라고 생각합니다. ​ 젠슨황의 주장은 '화웨이는 진짜 경쟁자'라는 것이고, 시간은 걸리겠지만 만만치 않은 경쟁자가 될 거라는 점입니다. 중국 시장뿐만 아니라, 중동, 동남아시아, 남아시아, 유럽, 라틴아메리카 등 해외 시장도 일부 장악할 여지가 있기 때문입니다. 그렇다보니 미국이 원하는 건 아예 중국에만 특화된 무언가를 만들도록 강제하려고 시도 중입니다.

  4. 원문 구간 4

    70~90년대 일본에서 있었던 일처럼 말이죠. 당시 일본의 PC는 정말 좋았지만 일본 시장에 지나치게 최적화되어 있었습니다. 그런 과거 사례를 참고해서, 중국의 기술을 중국에서만 쓸 수 있는 수준으로 적합시키고 미국은 그 사이 전 세계에 판매할 글로벌 스탠다드를 만들겠다는 계획입니다. ​ 미국의 기술은 LLM과 강화학습에 매우 최적화되어 있고, 하드웨어와 소프트웨어 공동 설계를 통해 양 축에서 앞으로 나아가고 있습니다. 중국은 이 테크트리에 접근할 수 없으니 그들 나름대로 최적의 방법을 택할 수밖에 없고 그 방식이 Non-China에는 잘 맞지 않는 구도로 가고 있습니다. 엔비디아의 2026년 전망 엔비디아의 점유율은 크게 안 바뀔 것이며, 연간 수조달러의 시장이 열릴 것 *코멘트 → BIG 6 하이퍼스케일러 CAPEX가 $500B이고, BIG 6를 제외하고 나머지 소버린 클라우드와 엔터프라이즈AI 및 Tier 2 CSP 규모들을 합쳐서 $100라고 가정할 경우, 2026년 CAPEX 시장은 $600B입니다. 이중 65%정도가 컴퓨팅과 네트워킹에 쓰이는 것을 생각해보면 AI 가속기의 내년 시장규모는 $390B입니다. 그중 엔비디아가 80~85%를 가져가고 있음을 감안하면 CY26 매출에 대해서 $310~330B라는 러프한 추정치가 나옵니다. 저희의 가정은 이것과 거의 비슷한 규모를 가정하되 약간 보수적으로 상향 가능한 룸은 열려 있습니다. 만약 추정치 변경이 있다면 내년 초입쯤에 실제 전반적인 AI 침투속도가 어떻게 바뀌는지 그리고 Agentic AI or Physical AI 침투속도가 얼마나 빠른지에 따라서 바뀔 수도 있겠지만 중간중간 추정치를 자잘하게 바꾸는 편은 아닙니다.

시점 관찰엔비디아의 중국 수요주 대상 · 기업·종목 · 엔비디아관련 대상 · 산업·업종 · 중국 AI 반도체 산업기준 2025.09

중국의 엔비디아 칩 제한은 제품 경쟁력과 어떻게 구분되는가

이 자료가 더한 내용

바이트댄스 같은 기업은 효율적인 AI 배포와 최고 모델을 위해 엔비디아 칩을 원하지만, 중국 정부의 명령·규제가 구매를 제한한다고 설명한다.

근거 보기 2
  1. 원문 구간 1

    바이트댄스는 국내 공급망 같은 건 사실 신경쓰지 않습니다. 최고의 모델을 만들고 싶어합니다. 가능한 한 효율적으로 AI를 배포하고 싶어합니다. 그렇다는 건 중국 정부가 그들에게 그렇게 하지 말라고 명령하고 있다는 뜻이기도 합니다. 엔비디아가 경쟁력을 잃은 게 아니라 정부가 명령하고 규제하고 있는 겁니다. ​ 밀수는 여전히 일어나고 있습니다. 다른 나라에서 구매하고 중국으로 칩을 재수출하는 겁니다. 모두들 예상하시겠지만 어느 낮은 볼륨으로 계속해서 일어나고는 있습니다. *코멘트 → 2026년에 나올 엔비디아 Rubin GPU와 화웨이의 Ascend 950/960DT 칩 하나당 퍼포먼스 차이를 보여주는 Bernstein의 테이블입니다. 엔비디아의 Rubin GPU 하나의 성능을 내기 위해서 Ascend 950/960DT 칩은 12.8개가 필요한 상황입니다. Atlas 950 SuperPod은 총 8,192개의 Ascend 950DT를 엮어서 하나의 랙으로 만든 건데, VR200 NVL144를 기준으로 하면 4.4개 정도의 랙으로 만들 수 있습니다. 성능 대비 효율 면에서는 비교할 수 없는 규모이지만 중국의 목표는 미국으로부터 수출규제를 받아서 컴퓨팅을 충족할 수 없을 때 자체적으로 충당하기 위한 기준이므로 효율은 크게 필요 없는 상황이기도 합니다. 중국 내에서는 컴퓨팅만 필요하고 데이터센터 건설과 전력은 충분히 빠르게 할 수 있는 상황이니 전력이나 공간밀도 같은 건 크게 고려하지 않은 제품입니다. 그리고 실제로 NVL72, NVL144도 힘든 것임을 생각해보면은 8,192-XPU 및 15,488-XPU에서 얼마의 효율로 작동할지도 실제 배포해봐야 정확한 비교가 가능할 거라고 봅니다.

  2. 원문 구간 2

    ​ *코멘트 → 중국 내 엔비디아와 관련해서 생각해볼 것은 크게 두 가지로 나뉩니다. 첫 번쨰는, 엔비디아 입장에서 점유율이 줄어들더라도 엔비디아 자체의 성장세를 해칠 정도는 아니라고 본다는 점입니다. 올해 중국의 AI 가속기 시장규모가 $50B입니다. 매년 50%씩 성장할 것으로 예상됩니다. CY25 $50B → CY26 $75B → CY27 $112.5B입니다. 엔비디아의 점유율은 올해 초 기준 54%였는데 H20 수출규제로 '못'팔게 되면서 예상 점유율은 40%입니다. 매년 10%p씩 감소한다고 가정해봅니다. 엔비디아의 중국향 매출은 CY25 $20B(TAM $50B x M/S 40%) → CY26 $22.5B(TAM $75B x M/S 30%) → CY27 $22.5B(TAM $112.5B x M/S 20%)입니다. 엔비디아의 매출은 올해 $200B, 내년 $300B 이상일 것으로 예상하므로 중국향 매출비중은 올해 10%, 내년부터 8%, 내후년에는 5%로 점점 줄어드는 것입니다. 경쟁역량이 줄어드는 수준 하에서는 전사 매출성장률을 깎아먹을 정도는 아니라는 것입니다. ​ *코멘트 → 두 번째는 중국 외부에 판매하기에 경쟁력이 충분하지 않은 칩이라는 점입니다. 칩 자체의 효율, 시스템단위의 효율이 엔비디아에 비해서 크게 떨어지고, 소프트웨어 생태계면에서 중국의 CANN/MindSpore를 택해야 한다는 게 문제입니다. 이미 엔비디아의 칩을 구매할 수 없는 중국, 러시아 등은 사용할 수 있겠지만(러시아도 대부분을 밀수로 몰래 하고 있는 상황이라, 지금처럼 조용히 가만히 있길 원할 수도 있습니다) 그 외의 제3지대로까지 3년 내에 유의미한 물량으로 판매되지는 못할 거라고 봅니다.

해석·전망AI CAPEX주 대상 · 산업·업종 · AI 데이터센터 인프라

AI 투자 규모를 볼 때 어떤 자금조달·수요 조건을 함께 봐야 하는가

이 자료가 더한 내용

오픈AI의 매출 성장, 오라클과의 3,000억달러 계약, 자본조달·현금 소진·흑자전환 시점이 AI CAPEX 시나리오를 가르는 조건으로 제시된다.

근거 보기 4
  1. 원문 구간 1

    ​ 사라 왕 : 다시 한 발 물러서서, 전체를 볼 때에 엔비디아의 입장에서 낙관적인 시나리오(Bull Case)와 비관적인 시나리오(Bear Case)를 말씀해주시겠어요? ​ 딜런 파텔 Dylan Patel : 숫자들부터 봅시다. 저희가 하이퍼스케일러라 부르는 기업은 총 6개입니다. 마이크로소프트, 코어위브, 아마존, 구글, 오라클, 메타입니다. 여기까지가 대략 Top 6 하이퍼스케일러입니다. 애널리스트들의 컨센서스는 CY26 기준 이들을 모두 합쳐 CAPEX가 $360B정도일 것으로 예상하고 있습니다. 그러나 제가 보는 숫자는 그보다 훨씬 높은 $450~500B정도입니다. 아시다시피 전체 숫자는 데이터센터에 대한 모든 연구, 각 데이터센터의 게획들, 공급망을 추적해서 도출합니다. 그러니까 이건 그냥 엔비디아의 시장규모와도 거의 같습니다. ​ CAPEX는 실제 여러 기업들로 나눠가지만, 여전히 압도적인 다수가 엔비디아로 갑니다. 엔비디아는 점유율을 더 가져갈 수는 없습니다. 시장과 함께 성장하고, 역량을 키워서 점유율을 방어하는 입장입니다. 그래서 엔비디아에게 중요한 건 하이퍼스케일러와 다른 기업들의 CAPEX 성장률이 얼마나 되느냐는 겁니다. 오라클과 코어위브는 전통적인 하이퍼스케일러는 아닌데, 이들을 제가 하이퍼스케일러라 보는 이유는 오픈AI의 하이퍼스케일러라 그렇습니다. ​ 오라클의 이번 3Q25 실적발표를 보면, 사람들이 왜 더 미치지 않는지 잘 이해가 안됩니다. 오픈AI와 오라클은 주식시장 기업 역사상 전례가 없는 일을 했습니다.

  2. 원문 구간 2

    4년치 가이던스를 제시했고, 래리 엘리슨이 세계 최고 부자가 됐습니다. 핵심은 '오픈AI의 매출이 얼마나 빠르게 성장하는가'인데 오픈AI가 오라클과 $300B 계약을 맺었는데 실제로 자본 조달과 매출을 합쳐서 그정도 조달은 가능할 거라고 생각합니다. ​ 여기서 또 많은 사람들의 질문은, '시장이 정말 그렇게 빨리 성장할까요?'에 대한 것입니다. 네, 그럴 가능성이 매우 높습니다. 오픈AI의 2026년 말 매출은 얼마나 될까요? 어떤 사람은 $35B라고 보고, 어떤 사람은 $40B라 보며, 어떤 사람은 $45B라고 추정합니다. 아시다시피 내년 말까지의 ARR을 뜻합니다. 그 성장률이 유지된다면 거의 모든 비용은 컴퓨팅으로 갈 것이고, 거기서 조달하는 모든 자본들도 컴퓨팅으로 갈 겁니다. 최근 투자자 라운드에서 투자자들에게 제시한 재무제표는 2026년에 $15B를 소진할 거라는 내용이었습니다. 아마 $20B정도가 될 가능성이 높다고 보긴 하는데, 여기에 자금조달을 받은 것들을 더함으로써 컴퓨팅 충당이 가능할 겁니다. ​ *코멘트 → 오픈AI의 2025년 9월 기준 재무 전망치는 이렇습니다. 매출 전망치는 25년 $13B → 26년 $30B → 27년 $60B → 28년 $100B → 29년 $145B → 30년 $200B 목표입니다. 매출성장치 상향은 주로 ChatGPT에서 나왔습니다. 쇼핑이나 광고 등 ChatGPT의 무료 사용자들을 수익화하겠다는 계획입니다. 대신, API 매출이나 Agent 매출은 약간씩 하향됐습니다.

  3. 원문 구간 3

    이슈가 됐던 부분은 현금 소진 전망치가 크게 상향된 부분이었습니다. 1Q25 당시에는 25~29년 사이 $115B만큼의 투자가 필요하며 2029년에는 흑자전환이 가능하다고 말했었는데 → 이번 3Q25에는 흑전 시점이 2030년으로 미뤄졌고 총 $80B만큼 비용이 늘었습니다. 요인들을 나눠보면 컴퓨팅이 대략 $60B, 인재 채용에 따른 주식보상비용이 $20B만큼 더 늘었습니다. 늘어난 자금 중 상당부분은 마이크로소프트 등 파트너사들에게 매출 공유해주는 비중을 20% → 8%로 줄임으로써 대략 $50B만큼의 자본을 더 확보할 수 있게 된 것에서 쓸 예정입니다. 아직까지는 AI 투자에 자금을 지원하려는 자금 수요가 초과입찰인 상태라 우려하고 있진 않으나, 이들이 추가 펀딩을 할 수 있을 정도만큼의 빠른 속도로 AI 채택이 계속될 수 있느냐는 늘 관심있게 보고 있습니다. 지금까지 문제는 없습니다. ​ 딜런 파텔 Dylan Patel : 오픈AI는 2029년까지 흑자를 내진 못할 겁니다. 매년 $15B, $20B, $25B씩 현금을 소진할텐데 대신 매출이 성장하는 만큼 그걸 다시 컴퓨팅에다 넣고 돌리는 거죠. 앤트로픽에서도 이걸 하고 있고, 오픈AI에서도 이를 하고, xAI에서도 같은 방식을 씁니다. 모든 연구소에서 이걸 하고 있죠. 파이가 $500B 이상으로 커질 가능성이 높습니다. 내년에 $360B가 아니라 $500B이 될 것이고 하이퍼스케일러들의 파이는 계속 커지는 겁니다. ​ 엔비디아의 입장에서 보자면, 앞으로 실제 AI 인프라에 연간 수조 달러가 들어가는 시장이 될 거라고 보고 있습니다.

  4. 원문 구간 4

    그리고 그 중 엄청난 점유율을 여전히 차지할 거라고 봅니다. 여기까지가 시나리오입니다. AI가 실제로 매우 혁신적이고, 세상이 데이터센터로 뒤덮이고, 상호작용 대부분이 AI로 이뤄지는 사회가 될 것입니다. 업무 생산성을 높이기 위해 에이전트에게 코드를 작성하라고 지시하는 일과, 아니면 AI 여자친구인 애니에게 대화하는 것도 있겠죠. 뭐든 상관없습니다. 그리고 이 모든 것은 대부분 엔비디아에서 실행되고 있을 겁니다. ​ 귀도 아펜젤러 : 잠시만요. 그러면, 저도 AI를 통해 수조 달러의 가치 시장이 열릴 거라고 보는 입장이긴 한데 만약 이것이 사실이라고 가정할 때, 엔비디아는 어디까지 오를 수 있을까요? ​ 딜런 파텔 Dylan Patel : 이륙(Take-off) 시나리오를 얼마나 믿으시나요? 이륙 시나리오란 AI가 더 강력한 AI를 만들고, 그것이 다시 더욱 강력한 AI를 만들고 하는 것을 반복하는 걸 뜻합니다. 각 단계의 지능이 경제에서 더 많은 일을 할테고, 그것이 더 높은 지능으로 연결되며 더 많은 일들을 하는 일이 일어나는 시나리오입니다. 만약에 이륙 시나리오라면 가치 창출 규모는 수백조 달러가 될 수 있겠죠. 모든 화이트칼라 노동자를 데려다가 AI로 두 배 더 생산적으로 만들면 그것만으로도 이미 수백조 달러의 가치를 합니다. ​ 저는 글쎄요. 5년 이상을 예측하는 건 불가능하다고 생각합니다. 얼마나 빠른 속도로, 얼마나 많은 것들이 변하고 있는 것을 고려하면 특히 그렇습니다. 저는 공급망 문제에 집중하려고 노력합니다.

사실·구조엔비디아 공급망 베팅주 대상 · 기업·종목 · 엔비디아

엔비디아의 공급능력 선확보 전략은 어떤 위험을 감수하는가

이 자료가 더한 내용

엔비디아는 주문 전에 공급망을 확보하는 베팅을 해왔고, 주문 취소에 따른 수십억달러 상각도 여러 차례 겪었다는 사례로 젠슨 황의 할당 방식과 위험 감수를 설명한다.

근거 보기 3
  1. 원문 구간 1

    ​ 엔비디아는 아주 옛날에 마이크로소프트가 엔비디아에 주문을 넣기 전부터 이미 XBOX용 공급망을 주문했던 일화가 있습니다. 말그대로 미친 베팅들을 많이들 보였습니다. 주문을 받기 전에 능력부터 확보한 셈이니까요. ​ 이전에 암호화폐 붐 같은 경우도 있었죠. 몇 번 있었는데, 엔비디아는 모든 사람과 공급망에 '이것은 지속 가능하며, 실제 수요이며, 필요한 제품입니다'라고 공급망에 설득하기 위해 최선을 다했습니다. 생산량을 크게 늘려야 한다고 말이죠. 그래서 그들은 모두 생산량을 늘렸고, 새로운 라인 구축에 모두가 CAPEX를 했고, 엄청난 양의 돈을 벌었지만, 단기적으로 암호화폐 버블이 꺼졌을 때 공급망은 분기별 재고들을 상각처리해야 했습니다. ​ 이때 AMD는 어땠나요? 사실 암호화폐 채굴에 훨씬 더 적합한 칩을 갖고 있었습니다. 해시량 대비 비용 측면에서 더 좋은 칩이었습니다. 소프트웨어도 필요없었죠. 하지만 그들은 그냥 "이런 버블에 생산량을 크게 늘리지 않을 거야"라고 생각했습니다. 합리적인 선택일 수 있었지만 승부사는 아닌 겁니다. ​ 최근에도 똑같은 일이 벌어졌던 거죠. 젠슨황은 이 미친 도박을 다시 한 번 굴렸습니다. 공급망 기업들이 믿지 못할 수준의 생산 능력을 여러 번이나 주문했습니다. 전방 고객들과 소통하니 당연히 수요가 있다는 건 알고 있었지만, 젠슨황은 거의 많은 경우에 이랬습니다. 마이크로소프트가 주문할 거라고 할당해놓은 공급망 주문량이, 마이크로소프트가 올해 CAPEX로 쓰기로 한 양보다 더 많았습니다.

  2. 원문 구간 2

    시차를 두고 마이크로소프트의 내부 계획이 올라갔지만, 마이크로소프트에 대한 공급망 할당량 자체가 주문량보다 훨씬 높았습니다. ​ 딜런 파텔 Dylan Patel : 젠슨은 이런 겁니다. 마치, '아, 마이크로소프트가 우리한테 말은 이렇게 해도, 실제로 이만큼만 필요할 것 같지는 않은데 말이지'라는 식인 겁니다. '고객님은 고객님이 예상한 것보다 더 많이 사시게 될 거에요'라고 말하는 상황이었던 거죠. 그렇게 젠슨황이 요청한 주문이 공급망을 통과해야 하니, 엔비디아는 NCNR(non-cancelable non-returnable) 조항을 걸고 통과시켰습니다. ​ 대만에서 제가 한 번 질문을 했던 적이 있습니다. 당시 CFO 콜레트 크레스와, CEO 젠슨 황이 동시에 있던 자리였죠. 방에는 금융업계 전문가들로 가득 차 있었고, 엔비디아 실적발표 3일 전이었기 때문에 당연하게도 콜레트와 젠슨은 거의 모든 질문에 답할 수 없었습니다. SEC 규정이 있으니까요. ​ 그런데, 그 와중에 제가 이런 질문을 했었습니다. '젠슨, 당신은 정말 직감에 의존하고 비전도 뛰어나잖아요. CFO도 훌륭하시지만 성격이 충돌하실 땐 어떻게 일하시나요?'라고 물었습니다. 그러자 젠슨은 '저는 스프레드시트를 싫어해요'라고 답했습니다. '저는 그걸 보지 않고, 그냥 압니다(I don't look at it, I just know)'라는 게 그의 답이었습니다. NCNR로 주문을 할 만큼의 베팅을 하는 것입니다. ​

  3. 원문 구간 3

    이미 엔비디아는 사실 역사적으로 누적 주문량을 볼 때, 여러 번, 수십억 달러를 상각해왔습니다. 주문했다가 취소했던 규모들만 합치더라도 수십억 달러는 되죠. 암호화폐 버블 이후 상각해야 했을 때에는 시가총액이 $100B도 되지 않을 때 상각했던 것임을 생각해보면 엄청난 규모였습니다. 이런 종류의 리스크를 감수하는 사람이 거의 없습니다. '승부사', 젠슨 황 젠슨황의 계획은 오픈AI와의 딜에 있었다 *코멘트 → 이 a16z 팟캐스트를 녹화할 때까지만 하더라도, 오픈AI에 대한 엔비디아의 $100B 지분투자 딜이 발표되기 전이었기 때문에 여기에서는 사라 왕과 딜런 파텔이 '앞으로 엔비디아가 수천억 달러의 현금을 어디에 쓸까?'를 두고 이런저런 생각을 했었습니다. 젠슨황의 생각은 오픈AI에 강한 지배력을 행사하는 것에 있었습니다. ​ *코멘트 → 오픈AI는 차세대 AI 인프라 구축을 위해서 최소 10GW 규모의 엔비디아 시스템을 배치하는 양해각서(LOI)를 체결했습니다. 첫 번째 제품은 2H26에 양산될 VR200 NVL144부터일 것으로 예상하고, 오픈AI의 모델 및 인프라 소프트웨어와 엔비디아의 하드웨어 및 소프트웨어를 공동으로 최적화하기 위한 로드맵을 조율하는 중입니다. ML/System co-design을 훨씬 더 강화하겠다는 의지입니다. 오픈AI는 이로서 Top 1을 굳힐 것으로 예상하고, 엔비디아는 최고의 워크로드 파트너를 가짐으로써 현재의 점유율을 5년 넘게 유지할 것으로 예상합니다.

사실·구조AWS AI 인프라주 대상 · 기업·종목 · 아마존 웹 서비스관련 대상 · 기업·종목 · 앤트로픽

AWS의 AI 인프라 경쟁력은 협력·네트워크·전력 제약과 어떻게 연결되는가

이 자료가 더한 내용

AWS는 앤트로픽과의 협력, CPU·GPU 데이터센터, 크레도·아스테라랩스 지분을 통해 AI 인프라를 구축하지만, 전력·냉각을 임계점까지 최적화한 데이터센터의 물리적 제약도 함께 다룬다.

근거 보기 3
  1. 원문 구간 1

    모든 대규모 데이터센터들이 온라인될 예정이니 다시 AWS 매출성장률은 YoY 20% 이상으로 가속화될 겁니다. ​ *코멘트 → 하지만 AWS가 앤트로픽(Anthropic)에 지분을 투자하고 전략적 파트너십을 크게 강화하면서 판이 달라졌습니다. 지금까지 앤트로픽-아마존 파트너십이 생각보다 AWS에게 큰 도움이 되지 않았던 이유는 지금까지는 앤트로픽이 추론 수요의 대부분을 구글 클라우드의 TPU에서 쓰고 있었기 때문입니다. 구글로부터도 지분을 조건으로 컴퓨팅 비용을 충당받았기 때문입니다. 그러나 이제 2025년 말부터는 세 곳의 대규모 AWS 캠퍼스가 온라인되면서 매출성장률이 가속화될 것으로 예상합니다. ​ *코멘트 → 앤트로픽은 컴퓨팅 비용을 처리할 파트너사가 필요했고, AWS는 매출성장과 ASIC 및 데이터센터 생태계의 경쟁력을 살리기 위한 파트너사가 필요했습니다. AI/ML 워크로드와 HW/System은 실과 바늘 같은 존재입니다. 서로서로 많이 쓰이면서 강화되다보니 Trainium 입장에서도 경쟁력이 생기게 되는 구조입니다. AWS는 Trainium 사용을 통해서 커널 작성으로 Neuron 스택에 기여하는 플레이어가 생기는 것과도 같습니다. 그리고 앤트로픽이라는 Tier 1 AI 연구소를 고객사로 두고 매출성장으로 바꿀 수 있으니 좋은 계약이었습니다. 이걸 생각해보면 엔비디아-오라클-오픈AI 딜 자체가 이미 업계에 많이 퍼진 관행임을 아실 수 있을 것 같기도 합니다. Azure-OpenAI 컴퓨팅 계약, AWS-Anthropic 계약, AWS는 특히 자체 네트워킹 패브릭을 만들어줄 파트너사들에게 R&D를 아웃소싱하는 대신 그들의 제품을 대거 AWS에 채용하는 딜을 많이 맺고 있는데 AWS 입장에서는 '본인들이 사줄 거라는 기대'가 곧 성장의 보증수표이니 매출을 늘릴 때마다 일정수준의 지분을 사고 있습니다.

  2. 원문 구간 2

    그래서 AWS가 크레도(Credo), 아스테라랩스(Astera Labs)의 지분을 들고 있습니다. ​ 딜런 파텔 Dylan Patel : AWS는 CPU와 GPU를 갖춘 데이터센터를 갖고 있습니다. 사용 경험은 코어위브나 다른 네오클라우드들처럼 좋진 않겠지만 지금 가장 중요한 건 용량입니다. 코어위브는 그렇게 엄청난 양의 데이터센터를 온라인할 수 없습니다. 그렇게 많이 확보할 수도 없습니다. 구축 속도는 매우 빠르지만, 세계에서 가장 많은 데이터센터 용량을 가진 회사는 아마존입니다. 물론 앞으로 2년 안에 추월당할 수도 있겠지만요. 아마존은 여전히 가장 많은 여유 용량을 갖고 있다는 뜻입니다. ​ 귀도 아펜젤러 : 그러면 기존의 데이터센터를 AI 데이터센터로 바꾸는 과정이 들어간다는 것을 유효 데이터센터 용량으로 보신 건데, 그 가정이 맞을까요? 고밀도 AI 랙을 구축하려면 훨씬 더 많은 냉각이 필요하고 물이 필요하고 전력이 필요할텐데요. 그게 괜찮을까요? ​ 딜런 파텔 Dylan Patel : 데이터센터 용량이란 전력이 확보되는 것부터 변전소~변압기~랙에 전원을 코드를 꽂을 수 있도록 하는 양까지를 의미합니다. 데이터센터 용량 자체는 똑같지 않을 겁니다. 역사적으로 아마존은 세계에서 가장 높은 전력 밀도의 데이터센터를 갖고 있었습니다. 모두가 12kW로 구성할 때, 40kW 랙으로 갔었습니다. 그리고 만약에 실제로 데이터센터 안에 가보신 적이 있다면, 보통은 꽤 시원하고 약간 건조합니다.

  3. 원문 구간 3

    그런데 아마존 데이터센터에 가보셨다면 마치 늪지대 같습니다. 습하고, 덥죠. 왜냐면 모든 전력과 냉각을 딱 임계점에 못 미칠 만큼 모든 비용을 최적화하고 있기 때문입니다. ​ 그래서 말씀하신 것처럼 아마존의 데이터센터는 새로운 유형의 인프라에 적합하지 않습니다. 다만, GPU 비용과 비교해보자면 냉각밀도를 높이는 건 상대적으로 저렴한 투자입니다. ​ 아시다시피 저희는 약 2개월 전에 아스테라 랩스(Astera Labs)에 대해서 언급했는데 당시 $90이었는데 그 다음 달에 $220까지 올랐죠. 아마존이 아스테라 랩스에 주문하는 양 때문입니다. 아마존의 인프라에는 AWS만을 위해 설계된 특정 부품들이 많습니다. 너무 깊이 들어가지는 않겠지만, AWS의 랙 인프라는 아스테라 랩스 네트워킹 제품을 훨씬 더 많이 사용하도록 설계되어 있습니다. 그리고 이건 냉각에도 똑같이 적용될 겁니다. 네트워킹이나 냉각에 더 많은 비용을 넣어야 하겠지만 GPU에 비해 비용은 그닥 크지 않다는 겁니다. ​ 전력을 모두 확보한 2GW 부지가 2개 있고, 습식 냉각기와 건식 냉각기가 모두 확보됐으며 모든 것이 잘 준비되고 있습니다. 효율적이진 않지만 뭐 괜찮습니다. AWS 데이터센터 매출은 더 늘어날 겁니다. 아마존의 내부 LLM이 더 훌륭해지거나, 그들의 Trainium이 엔비디아보다 낫거나, TPU 대비 경쟁력이 있다거나, 하드웨어 아키텍처가 최고라는 게 아닙니다. AWS는 충분히 많은 양의 데이터센터를 건설할 수 있고 임대할 고객도 찾은 상태입니다.

사실·구조오라클 데이터센터주 대상 · 기업·종목 · 오라클

오라클의 데이터센터 개발·GPU 임대 수익성은 어떤 전제로 계산되는가

이 자료가 더한 내용

오라클은 데이터센터를 직접 짓고 소유하기보다 다른 회사의 용량을 얻어 공동 엔지니어링하며, 2,000W당 5만달러 CAPEX와 장기 GPU 임대료 시간당 2.6~2.7달러를 놓고 MW당 비용과 매출을 계산한다.

근거 보기 3
  1. 원문 구간 1

    ​ 오라클은 다른 회사들로부터 데이터센터 용량을 얻어서 공동 엔지니어링을 하지만 물리적으로 직접 짓고 소유하진 않습니다. 새로운 데이터센터를 평가하고 엔지니어링 하는 데 상당히 민첩한 기업입니다. 수시로 데이터센터 부지들을 낚아채고, 계약하고 하길 반복하고 있습니다. 저희는 여기 GW, 저기 GW, 저쪽 GW가 생길 때마다 파악하고 있고 오라클은 그럴 때마다 그 부지에 가서 계약하고 있습니다. ​ 저희는 전체 공급망을 추적하고 있기 때문에 기록하고 있고 특히 기관 고객들에게 매우 자세한 방식으로, 하이퍼스케일러건, AI 연구소건, 반도체 회사건, 투자자들이건 데이터센터 모델에 대해서 알리고 있습니다. 그래서 타임라인도 갖고 있습니다. 모든 허가, 모든 규제 서류, LLM을 통해 위성 사진들을 계속해서 캡처하면서 냉각기, 변압기, 발전기 등이 어떻게 들어오고 있는지를 파악하고 있죠. 분기별로 각 사이트에 얼마의 전력이 온라인되는지에 대해서 상당히 자세한 추정치를 낼 수 있습니다. ​ 그래서 보자면, 오라클이 2027년 이후에 가동될 부지를 계약했다는 걸 파악하고 있으니 일종의 오라클 데이터센터 램프업 경로를 갖고 있는 셈입니다. ​ 간단하게 말해봅시다. 1MW를 GPU로 채운다면, MW당 GPU 비용은 얼마일까요? 만약 GB200 NVL72에 대해서 보면 전체 시스템을 GPU의 수로 나누면 GPU당 대략 2000W입니다. 그리고 모든 것을 합쳐서 GPU의 수로 나누면 GPU당 $50,000입니다.

  2. 원문 구간 2

    즉, 2000W당 $50K의 CAPEX가 드니까 1kW당 $25K입니다. 1MW당은 $25M이 드는 겁니다. GPU 임대료는, 장기 계약이라면 시간당 $2.6~2.7정도입니다. 그러므로 대략 1MW당 $12M정도를 벌 수 있는 겁니다. ​ 그리고 각 칩마다 다르죠. 그래서 각 칩의 CAPEX 비용, 네트워킹 비용을 추적하면은 어떤 칩을 쓰는지를 알 수가 있습니다. 각 칩이 어떤 데이터센터에 들어가든지, 해당 데이터센터가 언제 온라인으로 전환되는지, 분기별 MW 규모를 예측할 수 있습니다. 그러면 "아, 스타게이트가 이 기간에 온라인으로 전환되는구나"라는 결론에 도달할 수 있습니다. 그래서 이 분기에 임대를 시작할 거라는 추정도 가능하고, 스타게이트 사이트당 얼마의 칩이 들어가는지도 예상이 됩니다. 오픈AI는 그걸 임대하는 데 얼마의 비용을 써야한다는 것도 추정이 가능합니다. ​ 이걸 추정하면 꽤 높은 디테일로 오라클의 매출을 연도별로 예상할 수 있고, 2025년, 2026년, 2027년에 예측한 추정치와 최근 값이 정확히 일치했으며 2028년도 추정치도 꽤 근접했었습니다. 저희한테 놀라웠던 거는 오라클이 2028년과 2029년의 데이터센터 계획을 말했었는데 그건 지금 부지에 없습니다. 그리고 어떤 데이터센터를 확보하고 있는지, 전력량은 얼마나 되는지, 어떤 계약을 체결하고 있는지, 그걸 추정하면 얼마의 임대 매출이 추가로 들어올 수 있는지를 예측할 수 있죠.

  3. 원문 구간 3

    그게 저희 오라클 베팅의 기반입니다. ​ 바이트댄스가 오라클에 임대하고 있는 데이터센터 용량도 있습니다. 거기서도 같은 방식으로 추정했습니다. 바이트댄스는 수익성이 좋은 회사이므로 돈을 낼 게 확실합니다. 오픈AI는 그렇지 않죠. 오픈AI가 28년, 29년, 30년에 존재할지 그리고 오라클과 계약한 연간 $80B 이상의 계약을 실제 이행할 수 있을지에 대해서는 불확실성이 있습니다. 그게 유일한 위험 요소입니다. 그래도 그런 일이 발생할 것에 대비해서 오라클의 손실도 어느 정도 보호가 됩니다. 래리 엘리슨의 지혜입니다. 데이터센터의 CAPEX는 아니고 특정 기간의 임대에 대한 사용만 계약으로 해뒀기 때문입니다. 비용의 일부입니다. GPU가 비용의 전부이고, GPU는 실제 클러스터를 온라인하기 1~2분기 전에 구매합니다. 계약을 실제 성사시키지 못하더라도 손실 위험이 꽤 낮습니다. ​ 귀도 아펜젤러 : 오픈AI가 원래 컴퓨팅 제공자였는데, 그건 어떻게 바뀐 건가요? ​ 딜런 파텔 Dylan Patel : 마이크로소프트가 독점 제공자였다가, 오픈AI와 협상 후에 '우선 거부권'을 갖도록 재편성 됐습니다. 상호 배타적이거나 그런 건 아닙니다. 마이크로소프트는 여전히 가장 좋은 딜을 받고 있습니다. 예를 들어 오픈AI가 "5년 동안 $300B 규모의 계약을 하고 싶은데, 가능하세요?"라고 물으면 마이크로소프트가 오케이할지 아니면 거절할지를 정하고, 그 계약이 오라클에게 가는 식입니다.

해석·전망xAI 클러스터주 대상 · 기업·종목 · xAI

xAI의 대형 클러스터 구축은 전력 확보와 실행 속도에 어떻게 좌우되는가

이 자료가 더한 내용

xAI는 이동식 변전소·천연가스관·발전소·가스터빈을 활용해 전력을 확보했고, Colossus 2가 제시간에 완공되면 훈련용 컴퓨팅에서 앞설 수 있다는 조건부 평가를 제시한다.

근거 보기 2
  1. 원문 구간 1

    전력을 얻기 위해서 별의별 짓을 다 했습니다. 이동식 변전소를 설치하기도 하고, 공장 옆을 지나는 천연가스 관을 끌어다 쓴다던지 말이죠. 그렇게 일론이 해낸 겁니다. ​ 멤피스 시설 주변에서 시위가 많았습니다. 공기 오염에 대해서도 우려가 많았습니다. 가스터빈 발전소에서 공해가 많죠. 그 근처에는 멤피스 도시 전체에 서비스하는 하수 처리장이 있습니다. 온갖 혐오시설들이 다 그 주변에 있죠. 나라가 돌아가려면 그런 것들이 필요하죠. 이미 주변에서 많은 문제들이 나오고 있었는데, 약간의 공기질 저하로 불평이 큰 상황입니다. 워낙 정치적으로 한쪽으로 나아가다보니, NAACP도 일론 머스크에게 항의했었죠. 아무튼, 일론은 Colosuss 부지에 매우 많은 것들을 이미 구축했습니다. 그리고 또 다른 유통센터를 하나 산 게 있는데, 그것도 멤피스에 있습니다. ​ *코멘트 → xAI가 매우 빠른 속도로 콜로서스 데이터센터를 온라인시키고, 전력 조달비용을 거의 안 들인 이유는 솔라리스 에너지 인프라와의 계약에 있습니다. 이에 대해서는 <주간전략보고 : 투자의 생각 (9월 22일~9월 26일)>을 보시면 좋습니다. 회사가 말하는 것만 보면 사실 PEG 기준으로 매우 저렴하긴 한데, 시장에서 워낙 리스크에 대해서는 많이 언급이 안 되어 있다보니 상대적으로 주간보고에는 '이런 리스크들을 인지하시고 투자하셔야 한다'는 내용들을 강조하게 됐습니다. ​ 딜런 파텔 Dylan Patel : 그러나 흥미로운 거는 멤피스가 미시시피 바로 국경 건너편에 있다는 겁니다.

  2. 원문 구간 2

    그래서 일론은 미시시피에서 발전소를 샀고 거기에 가스터빈을 잔뜩 또 설치하고 있죠. 규제가 주별로 다르다는 점을 이용한 겁니다. ​ 그리고 여기서 핵심은 일론이 말하는 대로 Colosuss 2가 제시간에 완공된다면 일론이 Colosuss 2부터는 모두보다 앞서있게 됩니다. xAI는 아직 최고의 모델을 만들지 못했고, 적어도 오늘 현재 SOTA 모델을 갖고 있지는 않습니다. 그러나 이 추진력이 놀랍습니다. 대부분의 사람들은 '여기서 더 이상 데이터센터 부지에서 전력을 늘릴 수 없으니, 새로운 장소를 찾겠다'라고 말하지만, 머스크는 그냥 국경을 넘어서 미시시피에서 연결한 겁니다. 그리고 아칸소가 또 바로 옆에 있으니 더 지을 용량도 있다고 볼 수 있죠. 모든 미래의 데이터센터는 여러 주가 만나는 곳에서 지어질 거라 생각합니다. ​ *코멘트 → xAI의 컴퓨팅 규모가 2024년만 해도 상당히 낮았으나, 3Q24에 Colosuss 1을 매우 빠르게 온라인하고, 3Q25에는 Colosuss 2를 온라인하게 되면 단숨에 모델 훈련을 위해 쓰는 컴퓨팅 규모로는 Top 2로 올라오게 됩니다. 물론 문제는 모델의 훈련용 컴퓨팅만 추정하는 것이라서 ⓐ추론용 컴퓨팅, ⓑ메타의 자체 콘텐츠·광고 추천 및 랭킹 알고리즘을 위해 쓰는 컴퓨팅 규모는 포함하지 않은 값입니다. 그리고 여기 축에는 구글이 없는데, 구글이 가장 많은 컴퓨팅을 갖고 있을 것으로 예상합니다.

사실·구조GB200 NVL72주 대상 · 기술·제품 · GB200 NVL72관련 대상 · 기업·종목 · 엔비디아

GB200 NVL72의 성능 개선과 운영 난도는 어떻게 함께 나타나는가

이 자료가 더한 내용

GB200 NVL72는 H100 대비 TCO 성능이 개선됐지만, 72 GPU 단위의 고장·가동률 문제 때문에 64개 고우선순위 GPU와 8개 저우선순위 GPU로 나눠 운영하는 방식과 낮은 SLA가 논의된다.

근거 보기 4
  1. 원문 구간 1

    GB200 NVL 그리고 Rubin CPX 엔비디아가 미래를 준비하는 방법들 사라 왕 : 그리고 최근에 GB200의 TCO 대비 퍼포먼스가 H100 대비 1.66배에 달한다는 것을 분석하신 것도 인상적이었는데요. 최근 AI HW를 만들고 있는 스타트업들에게는 뭐라고 말씀해주실 수 있을까요? ​ 딜런 파텔 Dylan Patel : 어렵습니다. 매번 GPU가 세대를 거듭할 수록 훨씬 더 빨라지니까요. 어떤 지표에서는 GB200이 이전 세대보다 2~3배 빨라졌다고 하고, 다른 지표에서는 수십 배 이상 더 좋아졌다고 볼 수 있습니다. NVLink의 NVL72를 사용하면 GB200이 H100 대비 전반적으로 TCO 대비 퍼포먼스면에서 2배정도 좋은 거니까 다음 세대로 넘어갈 가치가 있긴 합니다. 60% 비싸진 대신 2~3배의 성능을 얻게 된 겁니다. ​ 다른 축으로 보자면, DeepSeek 모델 추론을 할 경우에는 이전 세대에 비해서 GPU당 성능 차이가 6~7배 이상으로 크게 벌어졌습니다. 딥시크에 대한 최적화가 계속되고 있습니다. 이렇게 되면 60% 비싸진 대신 6~7배의 성능을 얻은 겁니다. 달러당 3~4배의 성능 향상이 있는 거니까 딥시크 모델을 추론할 거라면 당연히 맞는 선택입니다. 그리고 강화학습을 할 때에도 GB200(NVL72)가 훨씬 더 좋은 건 마찬가지입니다. ​ *코멘트 → GB200 NVL72의 'TCO 대비 퍼포먼스'가 H100 NVL8을 앞서기 시작한 시점이 2025년 7월경이었습니다.

  2. 원문 구간 2

    시간순으로 정리해보면: 2025년 2~4월부터 주요 하이퍼스케일러들에게 첫 AI 랙들을 배송하고 테스트하는 단계(CoreWeave, Google, Microsoft, Oracle)를 거쳤는데 → 2025년 5월에는 GB200 NVL72 기준 CUDA 소프트웨어를 써서 DeepSeek 670B MoE 모델을 학습한 경우 H100에 비해서 TCO당 학습 성능이 9% 낮았고 → 2025년 7월에는 GB200 NVL72를 굴리는 엔지니어들의 수가 크게 증가하기 시작하니 진단 및 디버깅 툴들이 발전하고, 워크로드 최적화들이 가속화되면서 TCO 대비 퍼포먼스 관점에서 H100에 비해서 1.52배 더 우수해졌으며 → 2025년 12월에는 H100 대비 2.8배 더 좋아질 예정입니다. ​ *코멘트 → 상대적으로 난도가 낮은 추론 워크로드는 그보다 앞서 NVL72 클러스터에서 가동되었고(2025년 6월 오라클의 GB200 NVL72 '전체 클러스터 온라인' 시점부터 오픈AI가 o3 가격을 80% 인하했습니다.) 대규모 pre-training의 본격 최적화는 2025년 7월부터 가속이 붙었던 것입니다. 반대로 좀 더 생각해보면, 오픈AI GPT-5가 H100/H200 기반에서 사전훈련되었다는 점을 감안하면 차기 모델인 GPT-6는 GB200 NVL72를 기반으로 훈련할 것이기에 지능의 도약을 예상할 수 있기도 합니다. ​ 딜런 파텔 Dylan Patel : B200은 하드웨어 관점에서 훨씬 더 간단합니다.

  3. 원문 구간 3

    박스 안에 GPU 8개를 넣은 거라서, 특히 추론에서는 성능 향상이 크진 않은데 안정성은 높습니다. GB200은 여전히 안정성 문제가 좀 있습니다. 해결은 되고 있고 매일 점점 더 나아지고 있지만 어려운 문제입니다. ​ 가장 직관적으로 보자면 H100, H200, B200처럼 GPU 8개가 있을 때는 서버 하나가 고장나면 서버 전체를 오프라인시키면 됩니다. 그리고 고치는 거죠. 하지만 GB200이라면 GPU 72개를 어떻게 해야 할까요? 전체를 오프라인시키고 새 걸로 바꿔야 할까요? 그렇게 할 수 없습니다. 앞으로 세대를 거듭할 수록 GPU 고장률은 기껏해야 같거나 아마 더 나쁠 겁니다. 세대를 거듭할 수록 모든 것이 더 뜨거워지고 빨라지니까요. 고장률은 같다고 보더라도 8개 서버 하나가 고장나는 것과, 72개 서버 하나가 고장나기에 큰 문제입니다. ​ 그래서 요즘 많은 사람들이 하는 일은 72개의 GPU 중, 64개의 GPU에는 높은 우선순위의 작업을 실행하고 나머지 8개 GPU에는 낮은 우선순위의 작업을 실행하는 겁니다. 그러면 두 가지 레이어의 인프라를 갖는 것과도 같죠. 그러다가 높은 우선 순위의 작업에서 오류가 발생하면 랙 전체를 오프라인하는 대신, 낮은 우선순위 GPU에서 일부를 가져와서 높은 우선순위 GPU 풀에 넣고 고장난 GPU는 수리할 때까지 놔두는 겁니다. ​ 보통 클라우드를 사용하면 SLA가 있습니다.

  4. 원문 구간 4

    특정 기간 동안 가동 시간이 99%가 될 거라는 겁니다. 구간을 따져보면 GB200의 경우 72개가 아닌 64개의 GPU에 대해서는 99%이고, 72개 전체로 보면 95%정도입니다. 물론 클라우드마다 다르고, 모든 클라우드가 다른 SLA를 갖고 있지만 이걸 감안해서 조정하고 있습니다. 'GB200는 꽤 까다롭기에 SLA가 낮지만 그래도 원하십니까?'라는 거죠. 그대신 72개가 아닌 64개는 항상 작동하도록 보상해주는 식입니다. 최종 고객 입장에서는 불안정성을 감내해야 하니 B200을 그냥 사용할 수도 있을 겁니다. 아직 B200에 비해서 성능향상이 드라마틱하지 않기도 하니까요. 72개의 도메인을 원하는 이유는 엄청나게 헤비한 워크로드를 처리할 때 이점이 있다는 건데, 작은 회사들한테는 어려운 일입니다. 물론 이미 충분히 계속 좋아지고 있습니다. ​ *코멘트 → 클라우드의 공식 SLA는 보통 서비스(Region/Instance) 단위입니다. 이건 공식 SLA 퍼센트라기보다, 장애 시 보상이나 크레딧을 제공해주는 것 같은 운영 정책쪽에 있을 내용일 것 같습니다. 실제 네오클라우드 컴퓨팅 계약에서는 그럴 것 같기도 합니다. ​ 귀도 아펜젤러 : 엔비디아가 Rubin Prefill 카드인 CPX를 공개했잖아요, 여기에 대해서는 어떻게 생각하세요? 왜 특정 사용 사례에서 5배 더 빠른 칩을 미리 발표한 걸까요? ​ 딜런 파텔 Dylan Patel : 이전에는 AI 칩은 그냥 AI 칩이었습니다.

사실·구조분산형 추론주 대상 · 기술·제품 · 분산형 추론관련 대상 · 기술·제품 · Rubin CPX

Prefill과 Decode 분리는 왜 전용 하드웨어와 자원 배분을 요구하는가

이 자료가 더한 내용

Prefill은 계산량이 크고 Decode는 KV Cache의 메모리 용량·대역폭이 병목이어서, Rubin CPX처럼 Prefill을 전용 하드웨어로 분리하고 Decode를 HBM 기반 GPU에 맡기는 구조를 설명한다.

근거 보기 5
  1. 원문 구간 1

    Prefill은 계산량이 많아 병렬성이 낮고, Decode는 KV Cache를 사용할 수 있기 때문에 병렬성이 상대적으로 높은 워크로드입니다. 문제는 단일 아키텍처이기 때문에 유연성이 부족하고 병목이 생긴다는 점이 문제였습니다. ​ *코멘트 → 새로운 방식은 Disaggregated로, Prefill과 Decode 작업 중에 Prefill을 전용 하드웨어로 분리하는 게 핵심입니다. Prefill에 맞게 따로 특화시킨 엔비디아의 Rubin CPX 칩에서 계산에 최적화된 작업을 하고, 병렬성이 높은 Decode 작업은 기존 Rubin GPU에 배정하는 것입니다. 이렇게 되면 KV Cache를 HBM 대신 GDRR7처럼 더 저렴한 스토리지로 옮겨서 GPU 메모리를 확보할 수 있게 됩니다. 워크로드에도 다양한 하드웨어간 스마트 라우팅으로 유연한 확장을 할 수 있다는 게 핵심입니다. ​ *코멘트 → 이를 위해 엔비디아는 소프트웨어 레벨에서 ⓐSmart Router, ⓑKV Cache Manager, ⓒGPU Resource Planner를 추가하여 LLM 추론 과정에서 Prefill과 Decode를 분산하여 처리하고, KV Cache를 GPU 메모리에서 오프로딩하여 GPU 리소스를 최적화하는 아키텍처입니다. 이렇게 하면 대규모 사용자 처리, 모델 확장성, 리소스 효율성이 모두 개선됩니다. 이전에 비해 Prefill 비용이 절감되므로 ROI가 30~50배 증가하고, 전체 시스템 단위 효율은 3~7.5배 좋아졌습니다.

  2. 원문 구간 2

    ​ *코멘트 → 기존의 칩들과 전혀 다른 구조이기 때문에 이제 모든 ASIC 플레이어들은 엔비디아와의 'TCO 대비 퍼포먼스' 비교에서 엔비디아를 따라가기 위해 자체적인 Prefill ASIC을 동시에 개발해야 하는 상황이 시작됐습니다. 그리고 이제 추론에서도 엔비디아가 깔아둔 분산형 추론 설계를 채택할 경우 훨씬 더 TCO 대비 퍼포먼스가 우수해질 것이므로, 약간의 락인 효과를 기대합니다. 추론이 점점 복잡해질수록 훈련에서처럼 엔비디아가 가진 하드웨어·소프트웨어·네트워킹·공급망 관리 차원의 해자가 점점 더 강해질 것으로 예상합니다. ​ 딜런 파텔 Dylan Patel : 추론은 크게 두 가지로 나뉩니다. 첫 번째로는, Prefill을 위한 KV Cache를 계산하는 작업이 있습니다. 예를 들어 LLM에 문서를 집어넣으면 그 문서들의 Attention을 수행하는 겁니다. 모든 토큰들에서, 어떤 유형의 Attention을 사용하건 말이죠. 그리고 두 번째는 Decode 작업입니다. 각 토큰을 자기회귀적으로 생성하는 겁니다. 이 두 가지 작업은 매우 다른 유형의 워크로드입니다. 그래서 처음엔 ML 워크로드와 시스템 단위를 설계할 때 Batch size를 매 Forward pass마다 1,000씩 엄청 크게 만들고 32명의 사용자가 동시에 실행할 수 있게 한다면 968가 남는데 그만큼은 실제 사용자들로부터 Request가 들어오면 prefill을 채우는 일을 하게 시켜왔습니다.

  3. 원문 구간 3

    ​ 이렇게 하면 GPU 활용률이 정말 좋아지지만 이렇게 되면 decode 작업에 영향을 미치게 됩니다. 각 토큰을 회귀적으로 생성하려면 TPS가 크게 느려지게 되죠. 초당 몇 개의 토큰이 서비스되는가는 사용자 경험이나 모든 면에서 정말 중요합니다. 그러니 두 워크로드는 너무 다르고 prefill을 하고나서 decode를 하는 과정이 서로에게 병목인 상황이었습니다. 훈련과 추론이 하나로 합쳐진 상황에서는 특히 더 그랬습니다. 오픈AI, 앤트로픽, 구글 등 모든 AI 연구소들이 이걸 같은 칩에서 쓰고 있었습니다. 모두가 prefill, decode를 같이 쓰고 있었죠. ​ AI 연구소들은 같은 칩이지만 특정 GPU 세트에서 prefill을 전담하도록 클러스터를 설계하고, 다른 GPU 세트에서는 decode 작업을 하게끔 클러스터를 설계해뒀습니다. 이게 좋았던 이유는 그때그때 모델이나 추론 워크로드가 바뀔 때마다 확장하기가 훨씬 좋았기 때문입니다. 갑자기 컨텍스트 윈도우를 더 확장했다고 하면 prefill에 더 많은 GPU를 추가하면 됐습니다. 반면, 사용자들로부터 오는 Traffic mix가 long input + short output에서, short input + long output으로 바뀌게 되면 더 많은 decode GPU를 추가하는 식이었습니다. ​ 이렇게 함으로써 연구소들은 prefill 시간과 가동률을 높게 보장하면서도, 리소스에 맞춰서 시스템을 확장할 수 있었습니다.

  4. 원문 구간 4

    아시다시피 검색 서비스에서 가장 중요한 것은 웹페이지 로딩을 얼마나 빨리 끝내는가입니다. 게임을 하실 때 느끼셨을텐데, 로딩 화면에서 시간이 걸리면 이탈이 많아지다보니 개발자들은 팁과 요령을 주면서 주의를 분산시키는 방식을 씁니다. AI 서비스를 할 때에도 첫 번쨰 토큰이 나오는 시간이 훨씬 더 빨라야 서비스의 경험이 좋다고 느낀다는 연구와 논문들이 있습니다. 모든 토큰을 얻는 총 시간이 좀 더 길어지더라도 일단 첫 페이지를 빠르게 보여줘야 한다는 거죠. ​ decode 시간과 속도도 중요하긴 하지만, 첫 번째 토큰이 나오기까지 걸리는 시간을 단축시켜야 하는 정도만큼 중요한 건 아닙니다. 아무튼 이런 상황 속에서 어떻게 하면 더 좋게 만들 수 있을까요? 워크로드가 매우 다릅니다. decode는 모든 매개변수를 불러와야하고, KV Cache는 단일 토큰을 생성하는 데 쓰이는 식이었습니다. 여러 사용자들을 한 번에 처리하기 시작하면 모든 사람의 KV Cache 값이 다르니 메모리 용량이나 메모리 대역폭이 매우 빠르게 부족하게 됩니다. ​ 예를 들어, 사용자가 64,000개의 토큰을 입력하면 그 자체가 엄청난 연산량을 요구합니다. 예를 들어, Llama 70B 모델은 한 토큰당 140 GFLOPs를 필요로 합니다. 이 경우 GPU 전체를 몇 초 동안 단일 prefill 연산에만 사용할 정도입니다.

  5. 원문 구간 5

    즉, prefill은 순수하게 엄청난 계산량을 필요로 하는 문제이니까 GPU를 꽉 채워서 처리하기 쉽습니다. 그러나 decode는 반대로 메모리와 KV Cache 관리가 병목입니다. 이 둘을 구분해서 다루는 것이 합리적이며 이런 맥락에서 CPX 같은 구조가 등장한 겁니다. ​ CPX는 컴퓨팅에 최적화된 칩이고, prefill에 적합한 칩입니다. decode 작업은 솔직히 말해서 HBM이 들어간 범용 칩과도 같습니다. HBM이 GPU 비용의 절반 이상을 차지하고 있습니다. 전체 워크로드를 처리할 때 HBM의 비중을 줄이게 되면 훨씬 더 저렴한 칩을 고객에게 서비스할 수 있게 됩니다. 그리고 고객들은 같은 비용으로 훨씬 더 긴 컨텍스트를 사용할 수 있게 되죠. GPU는 마치 코카인을 사는 것 같다 추론 수요의 폭증으로 Hopper도 매진되는 상태 사라 왕 : 사람들은 GPU를 어떻게 사는 건가요? ​ 딜런 파텔 Dylan Patel : 실제 현장에서 보자면, 솔직히 GPU를 구매하는 방식은 코카인을 사는 방식과 비슷합니다. 이건 제가 묘사한 게 아니라 다른 사람이 제게 묘사해준 겁니다. 저는 코카인을 산 적은 없습니다. *웃음* 아무튼, 오늘도 GPU를 구하는 방식은 똑같습니다. 몇몇 사람들에게 문자를 보내고, 전화를 해서 "너 얼마나 있어?, 가격은 얼마야?"라고 물어보는 과정이거든요.

시점 관찰GPU 조달주 대상 · 산업·업종 · GPU 임대 시장기준 2025.09

Hopper와 Blackwell의 가용 용량은 추론 수요와 어떤 관계를 보이는가

이 자료가 더한 내용

주요 네오클라우드에서 Hopper 용량은 매진됐고 Blackwell은 몇 달 뒤 가동될 예정이며, 배포 학습 곡선 때문에 빠르게 가동할 수 있는 Hopper 수요와 가격이 올라가는 상태라고 전한다.

근거 보기 1
  1. 원문 구간 1

    저희는 슬랙으로 총 30개의 네오클라우드와 연결되어 있고, 주요 몇몇 서버 기업들과도 연결되어 있어서, 메시지를 보내서 소통하고 있습니다. "고객이 이만큼 주문하길 원한다"고 말하면 견적을 받죠. ​ 현재 주요 네오클라우드에서 Hopper 용량이 매진됐고, Blackwell 용량들은 몇 달 후에 가동될 예정입니다. 추론수요가 급증하면서 상황이 많이 바뀌고 있습니다. 그리고 Blackwell이 가동되고 있기는 한데 배포하기가 어렵다보니 약간의 학습 곡선들이 필요한 상태입니다. Hopper를 구매하면 1~2개월 안에 바로 가동할 수 있으니 모든 GPU의 수요가 올라가고 있는 겁니다. 이미 네오클라우드에 깔린 용량들은 많이 흡수됐습니다. Hopper 가격도 5~6개월 전에 바닥을 치고 요즘은 슬금슬금씩 올라오고 있죠. ​ 2023~2024년 만큼 GPU가 부족한 시대는 아니긴 합니다. GPU 몇 개 정도만 원하면 확실히 구하기 쉽습니다. 근데 많이 원하기 시작하면 그건 어렵습니다. 똑같아요. 원하는 만큼의 용량을 즉시 확보할 수가 없습니다. 주간전략보고 2025-09-22 주간전략보고 : 투자의 생각 (9월 22일~9월 26일) (바로가기​) AI 사이클

4

시간흐름대로 모든 내용을 살려 정리

시간흐름대로 모든 내용을 살려 정리

1
자료의 성격과 앞선 글 목록

[원문 유형] 네이버 프리미엄 콘텐츠
[채널] 올바른 미국주식 by SAPIENS
[게시일] 2025.09.26. 오후 7:00
[원문 URL] https://contents.premium.naver.com/sapiens/sapiensasset/contents/250926190025418bb
[제목] AI 사이클 한 눈에 보기, SemiAnalysis 인터뷰 : 승부사 엔비디아 젠슨황 그리고 화웨이의 역습
[수집 기준] 승인된 구독 열람권으로 실제 본문을 보존했다. 이미지·첨부는 별도 미디어 원장에 보관하며 시각적 의미 검토 여부를 구분한다.

[구독 원문 본문]

안녕하세요 사피엔스입니다.

SemiAnalysis 수석 애널리스트 딜런 파텔의 인터뷰입니다. 1시간 38분 가량의 팟캐스트에서 생각해볼 거리가 잔뜩 나온 만큼, 며칠에 걸쳐서 생각과 해설을 담아 준비해봤습니다.

시간을 내셔서 차분히 읽어보실만 한 내용이 많습니다. 현 시점의 AI의 모든 것입니다. 2026년 전망, 화웨이, 인텔, 승부사 젠슨황, AWS, 오라클, xAI, GB200, CPX, 코카인입니다.

화웨이의 3년 로드맵에 대한 생각, Trillion AI CAPEX의 시대에서 5년 뒤를 보면 어떤 그림이 그려지는지, 엔비디아와 아마존이 미래를 준비하는 방법에 대해 정리해봤습니다.

주간전략보고

2025-09-22

주간전략보고 : 투자의 생각 (9월 22일~9월 26일) (바로가기)

AI 사이클

2025-09-24

2
투자 유의문과 인터뷰의 목차

마이크론 3Q25 실적발표 : 클라우드 매출 YoY 214%, 숫자보다 '이유'가 더 중요하다 (바로가기)

2025-09-17

Scale-up 네트워크 이해하기 : 아스테라랩스와 브로드컴, 왜 지금 Scale-up인가? (바로가기)

2025-09-16

골드만삭스 테크 컨퍼런스 : "전례 없는 수요를 보고 있습니다" (바로가기)

2025-09-10

오라클 3Q25 실적발표 : "모두가 다가오는 쓰나미🌊의 규모를 이해하고 있는 건 아닙니다" (바로가기)

2025-08-28

엔비디아 2Q25 실적발표 : Blackwell 12개월치 SOLD OUT, AI CAPEX $3~4T를 말하다 (바로가기)

업계 전문가 인터뷰

2025-09-19

업계 전문가 인터뷰 : 로빈후드, 화려한 부활에 가려진 비하인드 스토리 (바로가기)

2025-09-12

업계 전문가 인터뷰 : 아스테라랩스, 모두가 Scale-up을 필요로 하는 시대의 핵심 기업 (바로가기)

2025-09-02

업계 전문가 인터뷰 : 블룸에너지, 데이터센터로 어디까지 침투할 수 있을까? (바로가기)

투자자문 서비스에 따른 투자 시 원금 손실이 발생할 수 있으며, 투자 손익에 대한 책임은 전적으로 고객에게 귀속됩니다. 또한 과거의 투자수익이 미래의 수익률을 보장하지 않습니다.

신규 구독 전에, 아래 투자자문계약 권유문서의 계약 관련 제반 사항을 반드시 읽으시고 충분히 검토하시기 바랍니다.

3
인터뷰 참가자와 엔비디아의 인텔 투자

*투자자문계약 권유문서 : https://naver.me/5ZST47Qf

목차

엔비디아, 인텔 그리고 화웨이 : 화웨이의 로드맵에 대한 SemiAnalysis의 생각

엔비디아의 2026년 전망 : 엔비디아의 점유율은 크게 안 바뀔 것이며, 연간 수조달러의 시장이 열릴 것

'승부사', 젠슨 황 : 젠슨황의 계획은 오픈AI와의 딜에 있었다

AWS 부활의 신호탄 : Anthropic과의 협력을 강화하다

오라클의 경쟁력 : 래리 엘리슨의 생각, 컴퓨팅 쓰나미가 온다

일론 머스크의 추진력 : xAI가 가장 먼저 GW급 클러스터를 만들 수도

GB200 NVL 그리고 Rubin CPX : 엔비디아가 미래를 준비하는 방법들

GPU는 마치 코카인을 사는 것 같다 : 추론 수요의 폭증으로 Hopper도 매진되는 상태

딜런 파텔 Dylan Patel

2025년 9월 22일, SemiAnalysis 창업자 겸 수석 애널리스트 : 엔비디아, 인텔, 중국

엔비디아, 인텔 그리고 화웨이

화웨이의 로드맵에 대한 SemiAnalysis의 생각

*세미애널리시스(SemiAnalysis)는 AI 반도체 분야 공부에 가장 많이 참고하는 독립리서치입니다. 창업자이자 수석 애널리스트이자 CEO인 딜런 파텔(Dylan Patel)의 인터뷰입니다. 세미애널리스트 팀은 소프트웨어, 하드웨어, 네트워킹, 데이터센터 등 각 분야별로 이해도가 높고 데이터를 끊임없이 트래킹하고 있기에 업계에선 유명합니다.

*인터뷰어는 a16z의 에릭 토렌버그(Erik Torenberg), 사라 왕(Sarah Wang), 귀도 아펜젤러(Guido Appenzeller)가 참여했습니다.

4
AI 인프라 지출을 보는 관점

그중 귀도 아펜젤러는 2014~2019년까지 VMware CTO로서 클라우드 및 네트워킹 사업부를 맡았었고, 2021년에는 인텔의 CTO이자 데이터센터 및 AI 책임자로 다니던 중 2022년부터는 a16z의 Special Advisor로 참여하고 2024년부터는 Partner로 AI 인프라 시장에 투자하는 데 전문지식을 쓰고 있습니다.

에릭 토렌버그 Erik Torenberg : 오늘 마침 초대드리자마자 엔비디아가 대규모 뉴스를 발표했네요. 인텔에 $5B를 투자했다는 소식입니다. 인텔과 엔비디아 협력에 대해서는 어떻게 보세요?

딜런 파텔 Dylan Patel : 흥미로운 건, 엔비디아가 $5B를 투자했다는 사실이 밝혀지자마자 이미 시간외에서 30% 상승했다는 점입니다. 그즉시 $1.5B를 벌은 겁니다. 사실 모든 게 제자리로 돌아가는 것 같은데, 노트북 시장에서는 엔비디아 그래픽이 탑재된 x86 노트북이 시장에서 최고의 제품이 될 겁니다.

사라 왕 Sarah Wang : 귀도씨는 이전에 인텔 AI CTO셨는데, 어떤 생각이신가요?

*코멘트 → 지금은 감춰진 글이지만 이전에 네프콘을 시작한지 얼마 안됐을 때에 세콰이어 캐피탈의 $200B Question에 대한 반박을, 1년 뒤에는 $600B Question에 대해서 반박하는 자료를 올려드린 바 있었습니다. 당시 귀도 아펜젤러의 의견을 전해드린 바 있었는데요. 여기 인터뷰에 참여하고 있는 인물이 그 '귀도 아펜젤러'입니다.

*코멘트 → 당시 그의 반박은 이랬습니다.

5
AI가 소프트웨어에 들어가는 비용과 매출

ⓐ규모가 잘못됐다. ⓑ인프라는 그렇게 계산되지 않는다는 것입니다. 그중 핵심은 ⓑ였습니다. 내용은 이랬습니다: 오랫동안 AI 업계에 있었던 귀도 아펜젤러가 보기에 AI 모델은 CPU, 데이터베이스, 네트워크처럼 IT 인프라의 한 구성요소였습니다. 이미 오늘날 거의 모든 소프트웨어는 CPU, 데이터베이스, 네트워크를 사용하고 있습니다. 미래의 소프트웨어는 어떻게 변할지 생각해보면 마찬가지입니다. 모든 소프트웨어는 AI 기술 스택을 내재하고 구동된다는 것입니다. 또한 연간 네트워킹 인프라 CAPEX는 $200B 이상이지만, 이를 통해 '네트워킹 소프트웨어'가 $800B 이상 발생할 거라고 보는 사람은 없습니다. 그러나 구글은 이렇게 깔린 네트워킹 인프라를 이용하여 광고를 판매하고 있고 이는 네트워킹 매출이 아닌 광고매출로 잡힙니다. 마이크로소프트는 이렇게 깔린 네트워킹 인프라를 이용하여 엑셀과 파워포인트를 팔고 있으며 이는 네트워킹 매출이 아닌 소프트웨어 매출로 잡힙니다. 인프라 지출에 대한 비용과 그로 인해 발생할 매출에 대한 인식과정은 다릅니다. 따라서 $200B 문제는 없습니다. AI는 소프트웨어를 비롯한 모든 제품의 필수요소가 될 것입니다. GPU 인프라에 대한 $50B 지출은 전 세계적으로 연간 $5T에 달하는 IT 전체 지출비용(Worldwide IT Spend)에 비하면 작습니다.

귀도 아펜젤러 Guido Appenzeller : 단기적으로 볼 때, 엔비디아와 인텔 모두 B2C 사업부에는 정말 좋을 거 같아요. 특히 노트북에서 인텔과 협력을 강화하면 정말 놀라운 일이 될 겁니다.

6
인텔·엔비디아 협력의 사업적 의미

인텔의 내부 그래픽이나 AI 제품에는 어떤 일들이 일어날지 궁금합니다. 사실 인텔은 현재 두 사업부 모두에서 경쟁력 있는 제품을 못 내놓은 상황입니다. 특히 내부 그래픽 칩은 고성능 시장에서 경쟁력이 밀렸습니다. 두 기업에게 서로 말이 되는 협력입니다. 인텔 입장에서는 새로운 동력이 필요했다고 생각합니다.

AMD에게는 참 별로인 소식입니다. 두 숙적이 갑자기 팀을 이뤄서 AMD의 자리를 뺏으려 하는 거니까요. AMD의 하드웨어는 좋지만 소프트웨어 스택은 그렇지 않았습니다. ARM도 어떤 면에선 안 좋아졌다고 생각합니다. ARM의 소구점을 간단하게 정리하면 인텔과 협력하고 싶지 않은 모든 사람과 협력할 수 있는 솔루션이었기 때문입니다. 이제 갑자기 엔비디아가 인텔의 기술에 접근할 수 있게 됐고 어찌됐던 함께 협력하면서 판이 바뀔 거라 생각합니다.

사라 왕 : 오늘 또 다른 소식은, 화웨이가 AI 로드맵을 공개한 것입니다. 성능을 좀 과장하고 있다고 보이는데, 중국의 현재 상황에 대한 당신의 생각을 듣고 싶습니다. DeepSeek가 다음 모델을 중국산 칩으로 훈련할 거라고 말한 것이나, 중국 정부가 엔비디아 칩 구매를 금지한 것에 대해서 어떻게 생각하시는지가 궁금합니다.

딜런 파텔 Dylan Patel : 2020년부터 시작해서 좀 더 넓게 보면, 화웨이가 얼마나 대단한 회사인지 그리고 역사적으로 정말 뛰어난 회사였다는 걸 인식하는 게 가장 중요하다고 생각합니다. 물론 처음에는 Cisco의 소스코드나 펌웨어를 훔쳐서 시작했지만 그 후에 빠르게 경쟁자들을 넘어섰고, 다른 모든 통신회사들을 넘어섰습니다.

7
화웨이의 Ascend 출발과 공급망 차단

2020년에는 Ascend 칩을 출시하고 모두가 볼 수 있도록 공개 벤치마크를 발표했었는데, 7nm AI 칩을 처음으로 출시한 기업이었습니다. 여전히 엔비디아가 앞서 있었긴 했지만 이때 격차가 거의 없었던 수준이었던 겁니다. 이때는 화웨이가 글로벌 공급망 전체에 자유롭게 접근할 수 있었던 때입니다. 그리고 TSMC의 최대 고객으로 자리매김하기 위해 애플을 막 넘겼을 때였습니다. 설계 관점에서 다른 모든 플레이어들보다 앞서 있었습니다. 물론 그때도 그랬고 지금도 엔비디아가 높은 시장점유율을 갖고 있지만, 그때는 AI가 상당히 초기 단계였기 때문에 사실은 돌아보면 그때는 화웨이가 시장을 장악하기 직전이던 순간이었습니다. 트럼프 정부에 의해서 2020년부터 공급망 접근이 금지됐고 소량의 칩만 생산할 정도로 줄어들었습니다.

그 후로 몇 년 동안 화웨이의 개발이 막혔었기 때문에, 엔비디아는 계속해서 가속화할 수 있었고 화웨이는 TSMC로의 접근이 금지됐기 때문에 중국 내의 TSMC 역할인 SMIC에서 제조하는 방법을 알아내려 노력했습니다. 서류만 있는 기업들을 만들어서 TSMC에 파운드리 칩 제조를 맡기고, 한국에서 HBM을 구매하려 시도하는 등 다양한 시도를 해서 공급을 늘리려고 시도했습니다.

2024년 말쯤에는 이것이 미국에게 적발되어 중단하게 됐지만, 그때는 화웨이가 TSMC로부터 290만 개의 칩을 생산할 수 있을 만큼의 칩을 확보한 뒤였습니다. 대략 $500M 만큼의 주문이었습니다. 그래서 미국 정부가 TSMC에 $1B 벌금을 부과하기도 했죠.

8
TSMC 우회 조달과 Ascend 재고

실제로 벌금이 발행됐는지에 대해서는 뉴스가 없습니다. 이 290만 개의 칩을 기억하는 게 중요한 이유는, 시중에 떠도는 Ascend 칩의 수가 아직 이 전체 용량을 다 쓰지 못했을 만큼 적기 때문입니다.

*코멘트 → 2003년에 시스코는, 화웨이가 1999년에 시스코의 소스코드/매뉴얼/CLI 등을 복제했다는 내용으로 소송을 제기했습니다. 그리고 2019~2020년 화웨이의 설계부문 자회사였던 HiSilicon이 TSMC 전체 매출의 2위권이었고 애플과 얼마 차이가 나지 않던 때였습니다. TSMC는 2020년 9월 이후 화웨이에 칩을 판매하지 않겠다고 말했었으나, 실제로는 2024년 10월까지도 우회수출을 해왔던 상황이었습니다. 실제 화웨이의 Ascend 910B, 910C도 생산까지는 연결됐지만 실제 양산은 매우 적은 양만 해둔 상태입니다. 화웨이 칩의 연간 출하량을 20만 개 수준으로 예측할 만큼, Die Bank는 아직 풀리지 않은 상태입니다. TSMC에 주문해뒀던 Die Bank가 대략 200만 개 이상 남아있다고 추정할 수 있습니다.

*코멘트 → SemiAnalysis 추정치에 의하면, 화웨이의 2024년 Ascend 출하량은 50.7만 개 → 2025년에는 80.5만 개입니다. SMIC에서 생산하는 것도 쓰이지만 장비가 부족했고 수율이 낮았기에 생산량이 부족한 보릿고개를 지나가기 위해서 TSMC에게 칩을 우회수입했던 것입니다. TSMC의 Die Bank는 향후 9개월 내 소진될 것으로 예상하지만 그 이후부터 상당한 칩을 생산할 캐파가 온라인되기 때문에 2026년부터는 SMIC에서 나오는 웨이퍼를 모두 Ascend 칩 생산에 쓴다면 병목이 생기지 않는 수준까지 이를 수 있습니다.

9
H20의 용도와 중국 내 생산 질문

국내 수요는 감당할 수 있을 정도의 규모입니다.

*코멘트 → H20은 훈련처럼 연산력이 중요한 작업이 아니라 메모리를 많이 쓰는 추론 워크로드에 맞춘 중국향 GPU입니다. FP8 296 TFLOPS는 RTX Pro 6000의 500 TFLOPS보다 낮지만, HBM3 96GB·4TB/s 대역폭과 NVLink 900GB/s로(워크스테이션 계열의 GDDR/PCIe 대비) KV-캐시가 큰 장문 추론, 임베딩 생성, 벡터DB 빌드, 긴 컨텍스트 프리필처럼 메모리 용량·대역폭이 병목인 작업에서 체감 성능이 나옵니다.

딜런 파텔 Dylan Patel : 이제 2025년으로 가봅시다. H20이 연초에 수출규제를 받았습니다. 엔비디아는 막대한 금액을 상각해야 했습니다. 엔비디아가 중국으로 팔 거라 기대했던 H20 매출 추정치는 $20B였습니다. 용량을 예약해둔 것들이 많았는데 제품 판매가 금지당했으니 그걸 상각해야 했던 겁니다. 엔비디아의 고민은 이제 다시 승인이 됐긴 한데, 재고를 판매하고는 있지만 추가로 공급망을 더 예약해야 할지에 대해서는 고민이 많은 것 같습니다.

한편, 중국에서는 계속해서 내부적으로 엔비디아의 칩이 필요없다고 말하고 있습니다. 화웨이와 캠브리콘이 언급됩니다. 설계 능력은 갖고 있지만, 공급 역량은 대부분이 외국에서 조달받는 것들입니다. 이들은 여전히 TSMC의 칩으로 생산하고 있고, 삼성전자에게 HBM을 공급받고 있습니다.

그래서 질문은 중국 내에서 얼마나 생산할 수 있느냐는 겁니다. 여기엔 두 가지를 해결해야겠죠.

10
로직 생산능력과 장비 수입

로직과 메모리입니다. TSMC를 대체하는 것과, SK하이닉스, 마이크론, 삼성전자를 대체해야 합니다. 로직에서는 뒤처져 있기는 하지만 정말 빠르게 성장하고 있습니다. 중국 내부적으로 필요로 하는 생산능력에 도달할 수 있다고 생각합니다.

미국은 여전히 중국이 필요로 하는 모든 장비를 수입하는 걸 거의 허용하고 있는 상태입니다. 금지 조치는 5nm 이하의 선단공정에만 국한되어 있습니다. 여기서 중국은 스펙상 14nm를 위한 장비를 수입한다고 말하고 있지만 실제로는 7nm 칩을 만들 수준의 장비를 구매하고 있습니다. 그래서 중국은 7nm AI 칩을 대량으로 생산하는 데 문제가 없고, 어쩌면 기존 장비를 사용해서 5nm까지도 가져다 쓸지도 모릅니다.

*코멘트 → SMIC는 상당량의 장비를 수입하고 있습니다. 미국과 네덜란드의 주요 장비들을 보면 중국향 매출이 40~50%에 가까운 걸 보실 수 있습니다. 어떻게 가능한가 보면 여러 가지를 고려해야 합니다. ⓐ주로 일본과 네덜란드 장비를 수입해서 쓰고 있습니다. 수출통제가 나오더라도 일본과 네덜란드가 이를 잘 따르지 않는다는 데에서 괴리가 생깁니다. 대부분의 대응조치가 6개월 지연되거나 아예 시행되지 않는 경우들도 있습니다. 중국 기업들은 수년 치 장비를 한 번에 주문하지만 미국 장비기업들만 중국발 대규모 수주러시에서 배제되는 상황이 많이 나오는 중입니다. 특히 일본 기업들이 조용히 중국발 특수를 누리기 위해 빠르게 주문을 처리하고 있습니다. 그리고 일본과 네덜란드는 재수출에 대해 많은 규제를 하고 있지 않기 때문에 예를 들어 제3국을 통과했다가 그 국가에서 사용한 뒤 중고품으로 중국으로 판매할 경우 이를 규제하지 않고 있습니다.

11
화웨이의 HBM·Prefill·Decode 계획

딜런 파텔 Dylan Patel : 로직이 있고, 메모리가 있습니다. 이번 화웨이 발표에서 놀라웠던 점은 메모리입니다. HBM을 자체적으로 하고 있다는 게 흥미로운 포인트였습니다. 그들은 2026년에 두 가지 유형의 다른 칩을 출시한다고 발표했습니다. 하나는 Recommendation과 Prefill에 초점을 맞춘 칩이고, 다른 하나는 Decode에 초점을 맞춘 칩입니다. 엔비디아에서도 최근 Prefill을 위한 칩을 따로 내놨죠. Prefill과 Decode를 나눠서 각각을 효율화하려는 수많은 AI 하드웨어 스타트업들이 있습니다.

그래서, 추론을 두 가지 워크로드로 나눈 이러한 방식은 화웨이도 똑같이 적용하려 하고 있다는 것입니다. 그리고 맞춤형 HBM도 설계했다는 것이죠. 이게 무슨 의미일까요? 공급망은 어떻게 구성할까요? 그게 가장 까다로운 부분입니다. 얼마나 많이 제조할 수 있을 것인가가 핵심입니다. 제조 능력이 충분하지 않습니다. 설계 능력 자체는 엔비디아의 칩에 비해 전력을 좀 더 소비할 것이고, 대역폭도 좀 더 낮겠지만 큰 격차를 둘 정도는 아닙니다. 중요한 문제는 생산 능력입니다.

*코멘트 → SemiAnalysis에 따르면, 화웨이가 로직 반도체에서 SMIC를 통해 자체 조달하기 전까지 TSMC를 통해 로직 웨이퍼 재고를 Die Bank에 비축한 것처럼, 메모리 반도체에서는 CXMT를 통해 자체 조달이 가능하기 전까지 삼성을 통해서 HBM 재고를 비축했습니다. 삼성은 엔비디아향 가속기 공급망 진입에서 실패했기에 화웨이향으로 HBM2e를 판매했습니다.

12
HBM 우회 조달과 CXMT 램프업

2024년 12월에 미국 산업안보국(BIS)가 중국으로 HBM 수출을 금지했지만, 판결 이후에도 2025년 1월까지 CoAsia Electronics, Faraday 같은 일종의 칩에 HBM만 탑재해달라고 요청하는 쉘 컴퍼니들을 통해서 삼성 HBM이 화웨이향으로 흘러들어갔었습니다. 총 1,300만 개의 HBM 스택을 저장해뒀는데 이정도 규모면 160만 개의 Ascend 910C를 생산할 수 있는 양입니다. HBM 자체가 부족하단 의미입니다.

*코멘트 → 대신 CXMT가 램프업할 시간을 벌어줬기 때문에 2026년부터는 CXMT의 HBM 스택 생산량이 얼마가 될 것이냐가 이제 화웨이의 Ascend 생산 계획에 가장 중요한 변수가 됩니다. CXMT의 HBM 생산량을 결정하는 건 두 가지입니다. DRAM을 HBM으로 전환하는 데 필요한 장비를 아직 충분히 갖추지 못했는데 이 장비를 얼마나 많이 들여올 수 있는가, 그리고 수율을 얼마나 빨리 올릴 수 있는가의 두 가지가 중요합니다.

*코멘트 → 시나리오에 따라 2026년의 Ascend 생산량은 2026년에 25~30만 개 정도일 수도 있고, 500만개 정도일 수도 있습니다. 2026년 4분기에 출시하는 Atlas 950 SuperPod이 8,192개의 Ascend 950DT를 엮은 것임을 생각해보면 30~37개의 Atlas 950 SuperPod을 만들거나 혹은 610개의 Atlas 950 SuperPod을 만들 수 있는 규모가 된다는 의미입니다. 상하단 범위가 큽니다. 아래에 따로 해설을 달아드렸는데, 그 전에 미리 한 번 말씀드리면 Atlas 950 SuperPod(8,192-XPU)의 경우 VR200 NVL144(2H26 양산예정) 기준 4.4개의 랙과 같은 컴퓨팅 규모입니다.

13
Ascend 생산량의 넓은 시나리오

그렇다는 건 엔비디아의 칩으로 구매할 때 VR200 NVL 144 랙 기준 144개~163개 혹은 2,684개를 가질 수 있다는 겁니다. VR200 GPU 기준으로 바꿔서 보면 20,736개~23,472개 혹은 386,496개의 GPU를 갖는 규모입니다. JPMorgan 추정치 기준 엔비디아의 CY26 AI GPU 총 생산량은 630만 개 정도로 예상하므로 대략 엔비디아의 칩 전체 생산분 중 6.1%정도 규모입니다. 그래서 대략 2027~2028년까지는 SMIC x CXMT의 Bull Case를 가정하더라도 중국 내부의 컴퓨팅을 충족하는 데에만 쓰일 것으로 예상합니다.

딜런 파텔 Dylan Patel : 엔비디아가 중국에서 금지되었고, 중국은 엔비디아 칩을 사지 말라고 하고 있습니다. 한동안에는 화웨이도 자체 칩을 생산할 수 있을 겁니다. 중국의 입장에서 보자면, 2024년에 주문해서 받아뒀지만 AI 칩으로 전환하지는 않은 용량들이 아직 많습니다. 이제 그 용량들을 AI 칩으로 전환하고 있습니다. 비축량을 소진하는 상태인 건데, 이걸 다 쓰고나면 새로운 물량을 생산하기까지의 과정이 정말 까다로운 구간일 겁니다.

다만, 저는 중국이 내부적으로 생산량을 늘릴 수 있을 거라고 생각합니다. 시간이 좀 더 걸릴 수도 있고, 중국이 중간중간 협상에서 물러나는 듯 보이면서 바이트댄스처럼 엔비디아의 칩을 대거 구매하는 모습들도 나올 거라 생각합니다. 바이트댄스는 생태계를 살리기 위해 캠브리콘이나 화웨이 칩을 일부 쓰지만, 엔비디아의 제품이 훨씬 좋기 때문에 엔비디아 칩을 살 수만 있다면 사고 싶어합니다.

14
중국 수요와 엔비디아 칩의 선택

바이트댄스는 국내 공급망 같은 건 사실 신경쓰지 않습니다. 최고의 모델을 만들고 싶어합니다. 가능한 한 효율적으로 AI를 배포하고 싶어합니다. 그렇다는 건 중국 정부가 그들에게 그렇게 하지 말라고 명령하고 있다는 뜻이기도 합니다. 엔비디아가 경쟁력을 잃은 게 아니라 정부가 명령하고 규제하고 있는 겁니다.

밀수는 여전히 일어나고 있습니다. 다른 나라에서 구매하고 중국으로 칩을 재수출하는 겁니다. 모두들 예상하시겠지만 어느 낮은 볼륨으로 계속해서 일어나고는 있습니다.

*코멘트 → 2026년에 나올 엔비디아 Rubin GPU와 화웨이의 Ascend 950/960DT 칩 하나당 퍼포먼스 차이를 보여주는 Bernstein의 테이블입니다. 엔비디아의 Rubin GPU 하나의 성능을 내기 위해서 Ascend 950/960DT 칩은 12.8개가 필요한 상황입니다. Atlas 950 SuperPod은 총 8,192개의 Ascend 950DT를 엮어서 하나의 랙으로 만든 건데, VR200 NVL144를 기준으로 하면 4.4개 정도의 랙으로 만들 수 있습니다. 성능 대비 효율 면에서는 비교할 수 없는 규모이지만 중국의 목표는 미국으로부터 수출규제를 받아서 컴퓨팅을 충족할 수 없을 때 자체적으로 충당하기 위한 기준이므로 효율은 크게 필요 없는 상황이기도 합니다. 중국 내에서는 컴퓨팅만 필요하고 데이터센터 건설과 전력은 충분히 빠르게 할 수 있는 상황이니 전력이나 공간밀도 같은 건 크게 고려하지 않은 제품입니다. 그리고 실제로 NVL72, NVL144도 힘든 것임을 생각해보면은 8,192-XPU 및 15,488-XPU에서 얼마의 효율로 작동할지도 실제 배포해봐야 정확한 비교가 가능할 거라고 봅니다.

15
중국 시장에서 엔비디아가 보는 범위

*코멘트 → 중국 내 엔비디아와 관련해서 생각해볼 것은 크게 두 가지로 나뉩니다. 첫 번쨰는, 엔비디아 입장에서 점유율이 줄어들더라도 엔비디아 자체의 성장세를 해칠 정도는 아니라고 본다는 점입니다. 올해 중국의 AI 가속기 시장규모가 $50B입니다. 매년 50%씩 성장할 것으로 예상됩니다. CY25 $50B → CY26 $75B → CY27 $112.5B입니다. 엔비디아의 점유율은 올해 초 기준 54%였는데 H20 수출규제로 '못'팔게 되면서 예상 점유율은 40%입니다. 매년 10%p씩 감소한다고 가정해봅니다. 엔비디아의 중국향 매출은 CY25 $20B(TAM $50B x M/S 40%) → CY26 $22.5B(TAM $75B x M/S 30%) → CY27 $22.5B(TAM $112.5B x M/S 20%)입니다. 엔비디아의 매출은 올해 $200B, 내년 $300B 이상일 것으로 예상하므로 중국향 매출비중은 올해 10%, 내년부터 8%, 내후년에는 5%로 점점 줄어드는 것입니다. 경쟁역량이 줄어드는 수준 하에서는 전사 매출성장률을 깎아먹을 정도는 아니라는 것입니다.

*코멘트 → 두 번째는 중국 외부에 판매하기에 경쟁력이 충분하지 않은 칩이라는 점입니다. 칩 자체의 효율, 시스템단위의 효율이 엔비디아에 비해서 크게 떨어지고, 소프트웨어 생태계면에서 중국의 CANN/MindSpore를 택해야 한다는 게 문제입니다. 이미 엔비디아의 칩을 구매할 수 없는 중국, 러시아 등은 사용할 수 있겠지만(러시아도 대부분을 밀수로 몰래 하고 있는 상황이라, 지금처럼 조용히 가만히 있길 원할 수도 있습니다) 그 외의 제3지대로까지 3년 내에 유의미한 물량으로 판매되지는 못할 거라고 봅니다.

16
화웨이 공급망의 대외 확장 한계

그리고 트럼프 정부가 올해 5월 말레이시아에 했던 조치처럼, 제3국들 입장에서도 화웨이 칩을 하나라도 도입할 경우 엔비디아의 칩을 수입하지 못하게 규제할 것이라 양자택일을 해야 하는 상황임을 고려해보면 쉽지 않습니다. 그리고 3년 뒤는 AGI가 나온 뒤이므로 전망이 큰 의미가 없다고 봅니다.

사라 왕 : 화웨이의 로드맵을 실현하기 위한 병목으로 HBM에 대해 언급했는데, 화웨이가 말하는 것처럼 이제 HBM이 병목현상이 아니게 될까요? 아니면 과장 광고일까요?

딜런 파텔 Dylan Patel : 생산 능력 면에서는 절대적인 병목 현상이 있다고 생각합니다. HBM을 만드는 데 필요한 특정 유형의 장비가 있습니다. 그것들은 수입해야 합니다. 국내 솔루션을 개발하고는 있지만 저희가 파악하기로는 충분한 장비를 수입하진 못했습니다.

중국의 수입 데이터를 보면, 다양한 유형의 장비들이 있고 Fab에 대한 CAPEX 항목들이 있습니다. 공정 기술에 따라 다르지만 팹은 리소그래피, 식각 증착, 계측 등 다양한 유형별로 다른 금액을 지출합니다. 원래 리소그래피는 17~18%였습니다. EUV를 쓰면서 25%로 늘었습니다. 중국은 리소그래피를 비축하고 싶어했고, 다가오는 수입금지에 대해서 우려가 컸다보니 리소그래피를 원래보다 훨씬 더 높은 비율로 수입했습니다. 그래서 장비 수입의 30~40%가 리소그래피일 정도로 장비를 많이 비축하고 있었습니다.

최근에는 반전돼서 이제 식각 증착 장비 수입이 급증하고 있습니다.

17
HBM 적층과 장비 병목

HBM 스태킹 주요 프로세스는 각 웨이퍼를 식각해서 TSV를 만들어 위와 아래를 관통하며 12단, 16단으로 쌓는 것이기 때문입니다. HBM을 만드는 과정에서 식각 장비가 많이 필요하다보니 해당 장비 수입들이 지금 로켓처럼 급증하고 있습니다.

반대로 보자면, 그게 지금 아직 생산능력이 다 안 갖춰졌다는 의미이기도 합니다. 생산량 입장에서는 두 가지 축으로 결정됩니다. 첫 번째로, 얼마나 빠르게 더 많은 장비를 확보하느냐에 따라 생산량이 결정될 겁니다. 두 번째로 같은 용량에서 얼마의 수율을 끌어올리느냐가 중요하겠죠. 인텔, 삼성이 잘하는 일이고 TSMC는 엄청나게 잘하죠. 수율 면에서는 HBM3 고속 생산은 시작도 안했습니다. HBM2 샘플링 정도만 한 상태입니다. HBM3가 몇 년 전에 나왔던 것임을 생각해보면 학습 곡선을 따라가기에도 갈 길이 멉니다. 물론 기술개발을 처음부터 하는 것보다는 훨씬 더 빨리 따라잡을 수 있죠. 이미 존재하니까요. 어떻게 만드는지 안다는 건 엄청난 이점입니다. 발명하는 것과 전혀 다른 문제입니다.

다시 돌아가서, 다른 하나는 생산 능력에 대한 겁니다. 최근 두어 달의 수출입 데이터만으로는 몇 년간의 공급망을 따라잡기에 당연히 충분하지 않습니다. 한국에서 생산하고 있는 양 정도를 갖추긴 어렵죠. SK하이닉스도 미국 일리노이에 투자하고 있고, 마이크론은 주로 일본에 투자하고 있습니다. 엄청난 양의 자본이 들어가고 있습니다. 중국이 서방과 맞먹을 생산 능력을 구축하는 데는 시간이 걸릴 겁니다.

18
중국 제조 역량의 시간 문제

서방이라는 건 중국을 제외한 동아시아의 생산 능력을 뜻합니다. 여기에 도달하기까지 시간이 걸릴 겁니다.

그래서, 종합해보면 이건 중국이 할 수 '있다', '없다'의 문제가 아니라 '언제' 제조할 수 있을 거냐의 문제입니다. 만약의 문제가 아닌 언제의 문제입니다. 미국 정부가 알아야 할 전체적인 계산법입니다. 예를 들어, 어떤 수준의 AI 칩을 판매할 것이냐가 문제가 아닙니다. AI는 훨씬 더 강력한 시장을 가질 것이며, 반도체 및 장비의 TAM보다 훨씬 더 큰 시장일 것이기 때문입니다. 중국은 어떤 수를 써서라도 자체 공급망을 가질 겁니다.

사라 왕 : 그렇다면 당신이 젠슨이라면, 이 상황에서 다음의 수는 무엇일까요?

딜런 파텔 Dylan Patel : 젠슨이 AMD보다 화웨이를 더 두려워한다는 건 부분적으로 사실입니다. 2020년 제재가 내려지기 직전에 화웨이가 애플을 이겼습니다. 이미 TSMC 주문량에서 애플을 이겼고, 스마트폰 점유율에서도 애플을 이겼습니다. 미국에서는 아니지만 세계 여러 지역에서요. 지금도 서방 공급망 없이 시장 점유율을 늘리고 있습니다. 아시다시피 이미 수많은 산업에서 이렇게 해왔죠. 강력한 경쟁자라고 생각합니다.

젠슨황의 주장은 '화웨이는 진짜 경쟁자'라는 것이고, 시간은 걸리겠지만 만만치 않은 경쟁자가 될 거라는 점입니다. 중국 시장뿐만 아니라, 중동, 동남아시아, 남아시아, 유럽, 라틴아메리카 등 해외 시장도 일부 장악할 여지가 있기 때문입니다. 그렇다보니 미국이 원하는 건 아예 중국에만 특화된 무언가를 만들도록 강제하려고 시도 중입니다.

19
중국 기술의 시장 분리 가능성

70~90년대 일본에서 있었던 일처럼 말이죠. 당시 일본의 PC는 정말 좋았지만 일본 시장에 지나치게 최적화되어 있었습니다. 그런 과거 사례를 참고해서, 중국의 기술을 중국에서만 쓸 수 있는 수준으로 적합시키고 미국은 그 사이 전 세계에 판매할 글로벌 스탠다드를 만들겠다는 계획입니다.

미국의 기술은 LLM과 강화학습에 매우 최적화되어 있고, 하드웨어와 소프트웨어 공동 설계를 통해 양 축에서 앞으로 나아가고 있습니다. 중국은 이 테크트리에 접근할 수 없으니 그들 나름대로 최적의 방법을 택할 수밖에 없고 그 방식이 Non-China에는 잘 맞지 않는 구도로 가고 있습니다.

엔비디아의 2026년 전망

엔비디아의 점유율은 크게 안 바뀔 것이며, 연간 수조달러의 시장이 열릴 것

*코멘트 → BIG 6 하이퍼스케일러 CAPEX가 $500B이고, BIG 6를 제외하고 나머지 소버린 클라우드와 엔터프라이즈AI 및 Tier 2 CSP 규모들을 합쳐서 $100라고 가정할 경우, 2026년 CAPEX 시장은 $600B입니다. 이중 65%정도가 컴퓨팅과 네트워킹에 쓰이는 것을 생각해보면 AI 가속기의 내년 시장규모는 $390B입니다. 그중 엔비디아가 80~85%를 가져가고 있음을 감안하면 CY26 매출에 대해서 $310~330B라는 러프한 추정치가 나옵니다. 저희의 가정은 이것과 거의 비슷한 규모를 가정하되 약간 보수적으로 상향 가능한 룸은 열려 있습니다. 만약 추정치 변경이 있다면 내년 초입쯤에 실제 전반적인 AI 침투속도가 어떻게 바뀌는지 그리고 Agentic AI or Physical AI 침투속도가 얼마나 빠른지에 따라서 바뀔 수도 있겠지만 중간중간 추정치를 자잘하게 바꾸는 편은 아닙니다.

20
엔비디아의 2026년 낙관·비관 시나리오

사라 왕 : 다시 한 발 물러서서, 전체를 볼 때에 엔비디아의 입장에서 낙관적인 시나리오(Bull Case)와 비관적인 시나리오(Bear Case)를 말씀해주시겠어요?

딜런 파텔 Dylan Patel : 숫자들부터 봅시다. 저희가 하이퍼스케일러라 부르는 기업은 총 6개입니다. 마이크로소프트, 코어위브, 아마존, 구글, 오라클, 메타입니다. 여기까지가 대략 Top 6 하이퍼스케일러입니다. 애널리스트들의 컨센서스는 CY26 기준 이들을 모두 합쳐 CAPEX가 $360B정도일 것으로 예상하고 있습니다. 그러나 제가 보는 숫자는 그보다 훨씬 높은 $450~500B정도입니다. 아시다시피 전체 숫자는 데이터센터에 대한 모든 연구, 각 데이터센터의 게획들, 공급망을 추적해서 도출합니다. 그러니까 이건 그냥 엔비디아의 시장규모와도 거의 같습니다.

CAPEX는 실제 여러 기업들로 나눠가지만, 여전히 압도적인 다수가 엔비디아로 갑니다. 엔비디아는 점유율을 더 가져갈 수는 없습니다. 시장과 함께 성장하고, 역량을 키워서 점유율을 방어하는 입장입니다. 그래서 엔비디아에게 중요한 건 하이퍼스케일러와 다른 기업들의 CAPEX 성장률이 얼마나 되느냐는 겁니다. 오라클과 코어위브는 전통적인 하이퍼스케일러는 아닌데, 이들을 제가 하이퍼스케일러라 보는 이유는 오픈AI의 하이퍼스케일러라 그렇습니다.

오라클의 이번 3Q25 실적발표를 보면, 사람들이 왜 더 미치지 않는지 잘 이해가 안됩니다. 오픈AI와 오라클은 주식시장 기업 역사상 전례가 없는 일을 했습니다.

21
오픈AI·오라클 계약과 자금조달 의문

4년치 가이던스를 제시했고, 래리 엘리슨이 세계 최고 부자가 됐습니다. 핵심은 '오픈AI의 매출이 얼마나 빠르게 성장하는가'인데 오픈AI가 오라클과 $300B 계약을 맺었는데 실제로 자본 조달과 매출을 합쳐서 그정도 조달은 가능할 거라고 생각합니다.

여기서 또 많은 사람들의 질문은, '시장이 정말 그렇게 빨리 성장할까요?'에 대한 것입니다. 네, 그럴 가능성이 매우 높습니다. 오픈AI의 2026년 말 매출은 얼마나 될까요? 어떤 사람은 $35B라고 보고, 어떤 사람은 $40B라 보며, 어떤 사람은 $45B라고 추정합니다. 아시다시피 내년 말까지의 ARR을 뜻합니다. 그 성장률이 유지된다면 거의 모든 비용은 컴퓨팅으로 갈 것이고, 거기서 조달하는 모든 자본들도 컴퓨팅으로 갈 겁니다. 최근 투자자 라운드에서 투자자들에게 제시한 재무제표는 2026년에 $15B를 소진할 거라는 내용이었습니다. 아마 $20B정도가 될 가능성이 높다고 보긴 하는데, 여기에 자금조달을 받은 것들을 더함으로써 컴퓨팅 충당이 가능할 겁니다.

*코멘트 → 오픈AI의 2025년 9월 기준 재무 전망치는 이렇습니다. 매출 전망치는 25년 $13B → 26년 $30B → 27년 $60B → 28년 $100B → 29년 $145B → 30년 $200B 목표입니다. 매출성장치 상향은 주로 ChatGPT에서 나왔습니다. 쇼핑이나 광고 등 ChatGPT의 무료 사용자들을 수익화하겠다는 계획입니다. 대신, API 매출이나 Agent 매출은 약간씩 하향됐습니다.

22
AI 투자 규모와 흑자 시점의 변화

이슈가 됐던 부분은 현금 소진 전망치가 크게 상향된 부분이었습니다. 1Q25 당시에는 25~29년 사이 $115B만큼의 투자가 필요하며 2029년에는 흑자전환이 가능하다고 말했었는데 → 이번 3Q25에는 흑전 시점이 2030년으로 미뤄졌고 총 $80B만큼 비용이 늘었습니다. 요인들을 나눠보면 컴퓨팅이 대략 $60B, 인재 채용에 따른 주식보상비용이 $20B만큼 더 늘었습니다. 늘어난 자금 중 상당부분은 마이크로소프트 등 파트너사들에게 매출 공유해주는 비중을 20% → 8%로 줄임으로써 대략 $50B만큼의 자본을 더 확보할 수 있게 된 것에서 쓸 예정입니다. 아직까지는 AI 투자에 자금을 지원하려는 자금 수요가 초과입찰인 상태라 우려하고 있진 않으나, 이들이 추가 펀딩을 할 수 있을 정도만큼의 빠른 속도로 AI 채택이 계속될 수 있느냐는 늘 관심있게 보고 있습니다. 지금까지 문제는 없습니다.

딜런 파텔 Dylan Patel : 오픈AI는 2029년까지 흑자를 내진 못할 겁니다. 매년 $15B, $20B, $25B씩 현금을 소진할텐데 대신 매출이 성장하는 만큼 그걸 다시 컴퓨팅에다 넣고 돌리는 거죠. 앤트로픽에서도 이걸 하고 있고, 오픈AI에서도 이를 하고, xAI에서도 같은 방식을 씁니다. 모든 연구소에서 이걸 하고 있죠. 파이가 $500B 이상으로 커질 가능성이 높습니다. 내년에 $360B가 아니라 $500B이 될 것이고 하이퍼스케일러들의 파이는 계속 커지는 겁니다.

엔비디아의 입장에서 보자면, 앞으로 실제 AI 인프라에 연간 수조 달러가 들어가는 시장이 될 거라고 보고 있습니다.

23
AI 확산이 만드는 장기 수요 그림

그리고 그 중 엄청난 점유율을 여전히 차지할 거라고 봅니다. 여기까지가 시나리오입니다. AI가 실제로 매우 혁신적이고, 세상이 데이터센터로 뒤덮이고, 상호작용 대부분이 AI로 이뤄지는 사회가 될 것입니다. 업무 생산성을 높이기 위해 에이전트에게 코드를 작성하라고 지시하는 일과, 아니면 AI 여자친구인 애니에게 대화하는 것도 있겠죠. 뭐든 상관없습니다. 그리고 이 모든 것은 대부분 엔비디아에서 실행되고 있을 겁니다.

귀도 아펜젤러 : 잠시만요. 그러면, 저도 AI를 통해 수조 달러의 가치 시장이 열릴 거라고 보는 입장이긴 한데 만약 이것이 사실이라고 가정할 때, 엔비디아는 어디까지 오를 수 있을까요?

딜런 파텔 Dylan Patel : 이륙(Take-off) 시나리오를 얼마나 믿으시나요? 이륙 시나리오란 AI가 더 강력한 AI를 만들고, 그것이 다시 더욱 강력한 AI를 만들고 하는 것을 반복하는 걸 뜻합니다. 각 단계의 지능이 경제에서 더 많은 일을 할테고, 그것이 더 높은 지능으로 연결되며 더 많은 일들을 하는 일이 일어나는 시나리오입니다. 만약에 이륙 시나리오라면 가치 창출 규모는 수백조 달러가 될 수 있겠죠. 모든 화이트칼라 노동자를 데려다가 AI로 두 배 더 생산적으로 만들면 그것만으로도 이미 수백조 달러의 가치를 합니다.

저는 글쎄요. 5년 이상을 예측하는 건 불가능하다고 생각합니다. 얼마나 빠른 속도로, 얼마나 많은 것들이 변하고 있는 것을 고려하면 특히 그렇습니다. 저는 공급망 문제에 집중하려고 노력합니다.

24
5년 이후 예측의 한계와 관찰 대상

공급망은 어떻고, 기업들의 AI를 통한 가치 창출은 어떻고, 사용량은 어떤지, 어떤 일들이 일어나는지를 보는 일입니다.

5년을 넘어서 예상한다는 건 예를 들어서, 일론 머스크가 앞으로 휴머노이드 로봇 덕분에 테슬라의 시가총액이 $10T에 달할 거라고 말한 것과도 비슷한 겁니다. 좋습니다. 그럼 그 모든 건 무엇을 기반으로 훈련되는 건가요? 엔비디아입니다. 좋습니다. 그럼 엔비디아도 $10T 가치가 있다는 걸 겁니다. 하지만, 이런 건 저는 잘 모르겠네요. 너무 현실과 동떨어진 가정들이니 제게는 잘 맞지 않습니다. SF 소설을 읽으시면 될 것 같습니다.

*코멘트 → 이륙 시나리오, 즉 ASI의 조건 중 첫 번째는 'AI 연구를 AI가 하기 시작한다'입니다. AI 연구원의 업무는 크게 보면 머신러닝 논문을 읽고 새로운 아이디어를 떠올리고, 그 아이디어를 테스트하는 실험을 구현해보고, 결과를 해석하고 반복하는 것입니다. AGI를 얻는다는 건 AI가 인간의 최고 레벨 소프트웨어 엔지니어보다 훌륭한 수준의 엔지니어가 된다는 의미인데, 이정도만 할 수 있게 되면 해당 AGI끼리 강화학습하면서 AlphaGo → AlphaZero의 모먼트를 느끼게 될 것이라는 것입니다.

*코멘트 → 알파고는 최고의 인간과 마지막 경기를 치른 이후 그 가중치를 가지고 자기 자신을 복제하여 수련에 들어갔습니다. 그리고 초인적인 존재가 되어 인간이 결코 생각할 수 없는 수를 두기 시작했죠. 바둑에 있어서는 초지능이 된 겁니다.

25
AGI 이륙 시나리오와 연구 자동화

AGI에서도 비슷한 것이 나타날 것이라는 것이 이륙 시나리오입니다. AGI가 머신러닝 연구의 상당부분을 수행할 수 있게 될 겁니다. 세계에서 손꼽는 AI 연구소들마다 수백 명의 엔지니어들이 연구하는 현재 상황이 아니라, 그보다 10만 배나 더 많은 알고리즘이 밤낮없이 알고리즘 혁신을 위해 일할 것입니다.

*코멘트 → 그리고 더 나아가서는 초지능을 다른 분야의 R&D에 적용하면 머신러닝 연구를 넘어 로봇공학 문제를 풀고, 다른 과학기술과 산업적으로도 폭발적인 발전을 이룰 수 있을 것입니다. 초지능은 군사적으로도 우위를 차지하는 방법일 것이며 전례 없는 파괴력을 발휘할 수 있을 것이란 기대입니다. 그리고 이정도의 지능을 갖게 되면 로보틱스를 통해 인간의 노동력을 대체할 수 있게 될 것이며 인류의 역사가 바뀔 거라는 게 '이륙 시나리오'인데, 여기로 넘어가기 시작하면 몇 번의 Log Scale을 넘은 상상이므로 말그대로 SF 소설에 가까워집니다. 상상할 수 있지만 지금의 레벨로는 마치 2D를 사는 개미가 3D의 인간, 4D의 존재를 상상하는 것과 같으니 상상만 하고 접게 되는 단계이긴 합니다. 성장 트렌드의 변화는 이전에도 있던 일입니다. 문명이 수렵에서 농업으로, 과학과 상업으로, 산업시대로 접어들면서 그때마다 세계 경제성장속도는 가속화됐습니다. 초지능은 성장 트렌드의 변화를 만드는 또 다른 시점일 수도 있을 거란 주장입니다. 로빈 핸슨의 <Long-Term Growth As A Sequence of Exponential Modes> 논문을 토대로 했습니다.

26
대규모 학습 클러스터의 비용 상상

*코멘트 → 노동을 대체하는 정도의 지능을 훈련하는 클러스터는 얼마를 써야 할지를 상상해본다면, 그에 대한 답은 '$1T에 가까울 가능성이 높다'입니다. 연간 Multi-trillion의 시장규모가 되는 셈입니다. 수십억 개의 클러스터가 굴러갈 거라는 오픈AI 샘 올트먼과 xAI를 이끄는 일론 머스크의 상상은 2030년에 가있는 것입니다. 이정도로 올라오다보면 고소공포증이 느껴지지만 적어도 지금까지 Log Scale로 발전해오고 있고, 지능이 빠르게 발전해오면서 ROI가 충족되고 있음을 생각해보면 아예 일리가 없는 얘기 자체는 아닙니다. 저희도 이 AI 사이클의 '엔드게임 시나리오'가 어떤지를 미리 알아보자는 차원정도로만 마음에 담아두고 있습니다.

사라 왕 : 당신이 말씀하신 부분에서, 엔비디아의 시장점유율이 이미 너무 압도적이라고 더 늘릴 수 없다고 말씀하신 게 있는데요. 엔비디아의 해자나 다른 것들을 말씀하셨었을 때, 그런 게 결국 지금의 높은 시장 점유율을 유지하는 것과 관련이 있던 것이었습니다. 그렇다면 이 전체를 이해하기 위해서 엔비디아가 역사적으로 어떻게 지금의 해자를 갖게 됐는지 설명해주실 수 있나요?

딜런 파텔 Dylan Patel : 정말 대단한 건, 아시다피시 엔비디아는 초기에 여러 번 실패했고 회사 전체를 건 베팅을 여러 번 했습니다. 젠슨황은 이미 오래전부터 회사 전체를 하나의 제품에 걸 만큼 미친 베팅을 많이 하는 경영자입니다. 예를 들어, 특정 칩이 제대로 작동하는지 알기도 전에 주문량을 엄청나게 잡아놓는다거나, 아직 수주하지 못한 프로젝트에 대해서 미리 공급망 내 주문을 엄청나게 늘리는 것처럼 말이죠.

27
주문 전에 능력을 갖춘 엔비디아

엔비디아는 아주 옛날에 마이크로소프트가 엔비디아에 주문을 넣기 전부터 이미 XBOX용 공급망을 주문했던 일화가 있습니다. 말그대로 미친 베팅들을 많이들 보였습니다. 주문을 받기 전에 능력부터 확보한 셈이니까요.

이전에 암호화폐 붐 같은 경우도 있었죠. 몇 번 있었는데, 엔비디아는 모든 사람과 공급망에 '이것은 지속 가능하며, 실제 수요이며, 필요한 제품입니다'라고 공급망에 설득하기 위해 최선을 다했습니다. 생산량을 크게 늘려야 한다고 말이죠. 그래서 그들은 모두 생산량을 늘렸고, 새로운 라인 구축에 모두가 CAPEX를 했고, 엄청난 양의 돈을 벌었지만, 단기적으로 암호화폐 버블이 꺼졌을 때 공급망은 분기별 재고들을 상각처리해야 했습니다.

이때 AMD는 어땠나요? 사실 암호화폐 채굴에 훨씬 더 적합한 칩을 갖고 있었습니다. 해시량 대비 비용 측면에서 더 좋은 칩이었습니다. 소프트웨어도 필요없었죠. 하지만 그들은 그냥 "이런 버블에 생산량을 크게 늘리지 않을 거야"라고 생각했습니다. 합리적인 선택일 수 있었지만 승부사는 아닌 겁니다.

최근에도 똑같은 일이 벌어졌던 거죠. 젠슨황은 이 미친 도박을 다시 한 번 굴렸습니다. 공급망 기업들이 믿지 못할 수준의 생산 능력을 여러 번이나 주문했습니다. 전방 고객들과 소통하니 당연히 수요가 있다는 건 알고 있었지만, 젠슨황은 거의 많은 경우에 이랬습니다. 마이크로소프트가 주문할 거라고 할당해놓은 공급망 주문량이, 마이크로소프트가 올해 CAPEX로 쓰기로 한 양보다 더 많았습니다.

28
젠슨 황의 공급망 베팅 방식

시차를 두고 마이크로소프트의 내부 계획이 올라갔지만, 마이크로소프트에 대한 공급망 할당량 자체가 주문량보다 훨씬 높았습니다.

딜런 파텔 Dylan Patel : 젠슨은 이런 겁니다. 마치, '아, 마이크로소프트가 우리한테 말은 이렇게 해도, 실제로 이만큼만 필요할 것 같지는 않은데 말이지'라는 식인 겁니다. '고객님은 고객님이 예상한 것보다 더 많이 사시게 될 거에요'라고 말하는 상황이었던 거죠. 그렇게 젠슨황이 요청한 주문이 공급망을 통과해야 하니, 엔비디아는 NCNR(non-cancelable non-returnable) 조항을 걸고 통과시켰습니다.

대만에서 제가 한 번 질문을 했던 적이 있습니다. 당시 CFO 콜레트 크레스와, CEO 젠슨 황이 동시에 있던 자리였죠. 방에는 금융업계 전문가들로 가득 차 있었고, 엔비디아 실적발표 3일 전이었기 때문에 당연하게도 콜레트와 젠슨은 거의 모든 질문에 답할 수 없었습니다. SEC 규정이 있으니까요.

그런데, 그 와중에 제가 이런 질문을 했었습니다. '젠슨, 당신은 정말 직감에 의존하고 비전도 뛰어나잖아요. CFO도 훌륭하시지만 성격이 충돌하실 땐 어떻게 일하시나요?'라고 물었습니다. 그러자 젠슨은 '저는 스프레드시트를 싫어해요'라고 답했습니다. '저는 그걸 보지 않고, 그냥 압니다(I don't look at it, I just know)'라는 게 그의 답이었습니다. NCNR로 주문을 할 만큼의 베팅을 하는 것입니다.

29
취소 위험과 과거 상각의 감수

이미 엔비디아는 사실 역사적으로 누적 주문량을 볼 때, 여러 번, 수십억 달러를 상각해왔습니다. 주문했다가 취소했던 규모들만 합치더라도 수십억 달러는 되죠. 암호화폐 버블 이후 상각해야 했을 때에는 시가총액이 $100B도 되지 않을 때 상각했던 것임을 생각해보면 엄청난 규모였습니다. 이런 종류의 리스크를 감수하는 사람이 거의 없습니다.

'승부사', 젠슨 황

젠슨황의 계획은 오픈AI와의 딜에 있었다

*코멘트 → 이 a16z 팟캐스트를 녹화할 때까지만 하더라도, 오픈AI에 대한 엔비디아의 $100B 지분투자 딜이 발표되기 전이었기 때문에 여기에서는 사라 왕과 딜런 파텔이 '앞으로 엔비디아가 수천억 달러의 현금을 어디에 쓸까?'를 두고 이런저런 생각을 했었습니다. 젠슨황의 생각은 오픈AI에 강한 지배력을 행사하는 것에 있었습니다.

*코멘트 → 오픈AI는 차세대 AI 인프라 구축을 위해서 최소 10GW 규모의 엔비디아 시스템을 배치하는 양해각서(LOI)를 체결했습니다. 첫 번째 제품은 2H26에 양산될 VR200 NVL144부터일 것으로 예상하고, 오픈AI의 모델 및 인프라 소프트웨어와 엔비디아의 하드웨어 및 소프트웨어를 공동으로 최적화하기 위한 로드맵을 조율하는 중입니다. ML/System co-design을 훨씬 더 강화하겠다는 의지입니다. 오픈AI는 이로서 Top 1을 굳힐 것으로 예상하고, 엔비디아는 최고의 워크로드 파트너를 가짐으로써 현재의 점유율을 5년 넘게 유지할 것으로 예상합니다.

30
AI 연구소·하이퍼스케일러의 칩 선택

AI Labs만 볼 때 엔비디아를 메인으로 택하는 진영에는 오픈AI, MSL, xAI, 마이크로소프트가 남습니다. 앤트로픽은 Trainium을, 구글은 TPU를 통해 컴퓨팅 상당수를 처리할 예정입니다. 엔비디아는 신규 시스템을 배치할 때마다 순차적으로 오픈AI에게 지분을 투자하여 최대 $100B까지 투자할 예정입니다. 1GW당 $35B인 것은 GB200을 기준으로 할 때이고, VR200 및 VR300으로 넘어가면 컴퓨팅과 네트워킹을 합쳐서 1GW당 $40~50B입니다. 따라서 대략 오픈AI가 $500B를 투자하면 엔비디아가 $100B에 대해서 오픈AI의 지분을 사는 구조입니다. 원래 시나리오상 '오픈AI가 ASIC을 도입할 경우 향후 5년간 최대 2GW까지를 ASIC으로 구축할 가능성이 있다'고 말씀드렸는데 여기서 잃을 수 있었던 규모가 엔비디아의 입장에서는 대략 $100B정도였습니다. 투자 규모 자체는 크지만 다년간 엔비디아의 HW/SW 자체에 종속되길(Perf/$면에서 Cost 낮추기보다 Perf를 높이길 택함으로써) 택하는 비용으로 $100B 지분 투자는 꽤 나쁘지 않은 딜이라고 생각합니다.

사라 왕 : 젠슨이 오늘 얘기하는 것은 로보틱스, AI 팩토리입니다. 엔비디아에 대한 마지막 질문일 수도 있을 것 같은데, 엔비디아의 향후 10~15년에 대해서 어떻게 생각하시나요? 5년 이상을 예측하기 어렵다는 건 알고 있습니다.

딜런 파텔 Dylan Patel : 엔비디아의 임원들과 제가 얘기할 때마다 질문한 내용들이 있습니다.

31
엔비디아 현금흐름과 고객 CAPEX

물론 대답하진 않겠지만, 정말 궁금했거든요. 엄청나게 현금흐름이 좋은 기업인데 투자할 곳은 많지 않은 상태였습니다. 반대로 하이퍼스케일러들은 현금흐름이 크게 줄어들고 있죠. 엔비디아의 GPU에 투자하고 있으니까요. 그럼 이렇게 늘어난 현금흐름으로 무엇을 할 건지가 중요합니다. ARM도 인수에 실패했고, 인텔에 대한 $5B 투자 조차도 규제당국의 감시를 거쳐서 통과될 거니 원하는 만큼 기업에 투자하기도 어렵습니다. 큰 건 살 수 없고 결국 대차대조표에 수천억 달러의 현금을 갖게 될 겁니다.

이걸로 뭘 해야 할까요? AI 인프라와 데이터센터를 구축하기 시작해야 할까요? 어쩌면 그럴 수도요. 하지만, 다른 기업들이 그 일을 대신하고 있으니 그렇게 할 이유는 잘 없습니다. 그냥 현금을 가져가면 되니까요. 엔비디아 입장에서는 아주 작은 금액들을 코어위브 같은 곳에 투자하고 대신 엄청난 양의 현금을 받는 구조를 이어가고 있습니다.

요즘 엄청나게 수요가 증가하고 있다보니 많은 양의 GPU를 한 번에 임대하기가 정말 어려운 상태라 코어위브의 수요가 높습니다. 모델을 3개월 동안 훈련시키고 싶다고 가정해봅시다. 큰 모델을 훈련하려면 작은 클러스터부터 큰 클러스터까지 모든 실험을 해야 하는데 그런 곳을 찾기가 매우 어렵습니다. 실리콘 밸리 대부분의 스타트업들은 자금조달 금액의 75%를 GPU에 쓰고 있습니다.

엔비디아는 하이퍼스케일러에게 빌리는 대신 내부 R&D 목적으로 코어위브에게 GPU 클러스터를 빌렸는데, 코어위브는 대신 엔비디아에게 더 저렴한 비용으로 다년간 계약을 맺어줬습니다.

32
할당량·할인·반독점 제약

엔비디아는 할당량을 가지고도 생태계를 바꿀 수 있습니다. 다만 이건 지금은 하지 않습니다. 과거에는 하이퍼스케일러들에게 대량 할인을 제시했었지만, 반독점 규제 대상에 들어갈 수 있으므로 지금은 모든 기업들이 동일한 가격에 구매하고 있습니다. 매우 공정합니다.

에릭 토렌버그 : 그렇다면 엔비디아는 현금으로 무엇을 해야 할까요?

딜런 파텔 Dylan Patel : 제 생각에는 데이터센터에 투자해야 한다고 생각합니다. 데이터센터를 만드는 것까지만 투자하고, 데이터센터 레이어에 들어가는 것에는 투자하지 않아야 합니다. 그래야 더 많은 사람들이 데이터센터를 지을 것이고, 시장 수요가 증가하는 속도에 맞춰서 데이터센터와 전력이 병목이 되지 않도록 맞추는 흐름을 만들 수 있습니다. 클라우드 레이어에는 투자하지 말아야 합니다. 클라우드 레이어는 상대적으로 커머디티 되는 영역에 가깝기 때문입니다. 클라우드가 커머디티라는 건 아니지만, 확실히 경쟁자들이 많습니다. 그리고 상업용 부동산과 기타 인프라 투자 회사들에게 AI 인프라에 투자하도록 교육하고 있기도 합니다. 아무튼 데이터센터와 에너지에 투자하는 게 좋다고 봅니다.

로봇공학 같은 곳도 좋은 수요처이고 투자할 만한 분야가 있을 것 같지만, $300B의 현금을 필요로 하는 곳은 없을 테니, 그 자본으로는 뭘 할지 잘 모르겠습니다. 젠슨이 뭔가 아이디어가 있긴 할 겁니다. 비전이 있는 계획이죠. 자사주 매입을 하는 건 말이 되지 않습니다.

33
엔터프라이즈 AI 전환과 애플의 사례

애플처럼 되는 겁니다. 애플이 거의 10년 동안 흥미로운 일을 하지 못한 이유는 머리에 비전이 있는 사람이 없기 때문입니다. 팀 쿡은 공급망 관리에 뛰어난 인재이지만, 자사주 매입에 엄청난 돈을 넣었습니다. 자율주행차는 실패했고, AR/VR도 어떻게 될지 지켜봐야 하죠. 웨어러블은 어떻게 될지 지켜봐야 합니다. 메타나 오픈AI가 더 나을 수도 있겠습니다.

그래서 어디에 투자해야 할까요? 전혀 모르겠지만, 무엇이 그렇게 많은 자본이 필요할 것인지가 어려운 질문이고, 실제 수익을 낼 수 있는 사업으로 연결되어야 한다는 것도 핵심입니다. 가장 쉬운 방법이 자사주를 매입하는 건데 사실 그건 회사 문화를 바꿀 수는 없습니다.

귀도 아펜젤러 : 그게 또 다른 문제인 것 같아요. 투자할 만한 분야는 있겠지만, 갑자기 회사가 완전히 다른 방향의 두 일을 하게 되면 유지하기가 매우 어렵습니다.

딜런 파텔 Dylan Patel : 다양한 방법이 있을 거라 생각합니다. 여러 회사에 투자하거나, 발전소 건설을 지원하는 것도 가능합니다. 30년 동안 투자해야 하는 일이니 아무도 발전소를 짓고 싶어하진 않으니까요. 자본을 활용해서 어떤 일이 일어나도록 하는 다양한 분야가 있을 겁니다.

AWS 부활의 신호탄

Anthropic과의 협력을 강화하다

사라 왕 : 제가 SemiAnalysis를 즐겨 읽는 이유 중 하나는 여러분이 종종 뭔가 컨센서스에서 벗어난 예측을 하기 때문입니다. 그중 흥미로웠던 거는 아마존의 AI 부활에 대한 것이었습니다.

34
AWS가 뒤처진 배경과 2023년 진단

저희 포트폴리오 회사들이 일부 있다보니, 궁금한 게 있는데 왜 아마존이 뒤처졌는지 한 번 정리해주시겠어요?

딜런 파텔 Dylan Patel : 2023년 1분기에, 아마존의 클라우드 위기에 대한 글을 쓴 바 있습니다. 네오클라우드들이 아마존을 커머디티화 시킬 거라는 내용이었고, 아마존의 전체 인프라가 지난 컴퓨팅의 시대에 매우 최적화 되어 있었다는 내용이었습니다. ENA, EFA, NICs, 프로토콜, 자체 CPU 등등 말이죠. Scale-out 컴퓨팅의 시대에는 정말 좋았는데 지금의 Scale-up AI 인프라 시대에는 잘 안 맞는 상황입니다. 그리고 이걸 네오클라우드가 어떻게 꿰뚫을 것인지에 대해서 정리했었습니다.

*코멘트 → AWS의 TCO 대비 퍼포먼스가 엔비디아에 비해 크게 떨어졌던 이유는 AWS가 자체 설계한 네트워킹 패브릭인 EFA 때문입니다. 프론트엔드쪽인 사용자-서비스 트래픽에서는 ENA(고성능 NIC)를 도입해서 충분히 처리할 수 있지만, 백엔드(랙/노드 간 통신)는 AWS의 자체 EFA 기반 패브릭이 InfiniBand, Spectrum-X, Cisco, Arista, Juniper의 ROCEv2 대비 느리다는 데 있습니다. 같은 GPU를 묶더라도 네트워킹 구조에 따라 학습시간이나 TPS 등 효율이 크게 차이가 납니다.

지금 AI 시대의 핵심은 비용 대비 최대의 성능을 원한다는 것입니다. 근데 이건 축이 두 가지입니다. 비용이 두 배가 되더라도 성능을 미친듯이 끌어올려서 3배로 만든다면 고객들이 좋아한다는 거죠.

35
네오클라우드와 엔비디아 하드웨어 선택

그게 엔비디아 하드웨어의 핵심입니다. 네오클라우드는 정말 좋은 판단을 했던 겁니다. 당시는 아마존이 최고의 실적을 내던 클라우드 기업이었고 마이크로소프트가 막 부각받던 시기였지만 오라클이나 네오클라우드들은 부각받지 못했던 시기였죠.

이제 그 이후로 아마존은 최악의 실적을 보이고 있는 하이퍼스케일러가 됐습니다. 여기서 중요한 건, AWS는 여전히 구조적인 문제를 갖고 있다는 점입니다. 여전히 Elastic Fabric을 사용하고. 엔비디아, 브로드컴, 아리스타 네트웍스의 네트워킹보다도 뒤처집니다. 자체 ASIC인 Trainium은 꽤 괜찮지만 중요한 건 이제 그들이 잠에서 깨어나서 실제로 사업을 수주할 수 있는 단계까지 됐다는 것입니다.

AWS의 매출 성장률은 계속해서 하락해왔는데, 저희는 여기서 매출성장률이 다시 가속화될 거란 전망을 했습니다. 이유는 앤트로픽 때문이고, 저희가 데이터센터에서 보고 있는 모든 데이터들이 같은 방향을 가리키고 있습니다. 모든 것을 추적하고 있습니다. 단일 데이터센터가 언제 온라인 될 예정인지, 그 안에 무엇이 들어갈 것인지를 알고 있습니다. 그리고 칩 비용, 네트워킹 비용, 전력 비용이 얼마인지를 알기에 이 전체에 대한 마진을 추정하고, 그러면 역으로 AWS 전체의 매출을 추정할 수 있습니다.

그래서 모든 것을 종합해보면 이번 아마존 2Q25 실적발표에서 AWS의 매출성장률이 최저점을 찍었다는 게 매우 분명합니다. 최소한 내년까지 YoY 기준으로 가장 낮은 매출성장률이 될 겁니다.

36
AWS 성장·앤트로픽 협력의 양면

모든 대규모 데이터센터들이 온라인될 예정이니 다시 AWS 매출성장률은 YoY 20% 이상으로 가속화될 겁니다.

*코멘트 → 하지만 AWS가 앤트로픽(Anthropic)에 지분을 투자하고 전략적 파트너십을 크게 강화하면서 판이 달라졌습니다. 지금까지 앤트로픽-아마존 파트너십이 생각보다 AWS에게 큰 도움이 되지 않았던 이유는 지금까지는 앤트로픽이 추론 수요의 대부분을 구글 클라우드의 TPU에서 쓰고 있었기 때문입니다. 구글로부터도 지분을 조건으로 컴퓨팅 비용을 충당받았기 때문입니다. 그러나 이제 2025년 말부터는 세 곳의 대규모 AWS 캠퍼스가 온라인되면서 매출성장률이 가속화될 것으로 예상합니다.

*코멘트 → 앤트로픽은 컴퓨팅 비용을 처리할 파트너사가 필요했고, AWS는 매출성장과 ASIC 및 데이터센터 생태계의 경쟁력을 살리기 위한 파트너사가 필요했습니다. AI/ML 워크로드와 HW/System은 실과 바늘 같은 존재입니다. 서로서로 많이 쓰이면서 강화되다보니 Trainium 입장에서도 경쟁력이 생기게 되는 구조입니다. AWS는 Trainium 사용을 통해서 커널 작성으로 Neuron 스택에 기여하는 플레이어가 생기는 것과도 같습니다. 그리고 앤트로픽이라는 Tier 1 AI 연구소를 고객사로 두고 매출성장으로 바꿀 수 있으니 좋은 계약이었습니다. 이걸 생각해보면 엔비디아-오라클-오픈AI 딜 자체가 이미 업계에 많이 퍼진 관행임을 아실 수 있을 것 같기도 합니다. Azure-OpenAI 컴퓨팅 계약, AWS-Anthropic 계약, AWS는 특히 자체 네트워킹 패브릭을 만들어줄 파트너사들에게 R&D를 아웃소싱하는 대신 그들의 제품을 대거 AWS에 채용하는 딜을 많이 맺고 있는데 AWS 입장에서는 '본인들이 사줄 거라는 기대'가 곧 성장의 보증수표이니 매출을 늘릴 때마다 일정수준의 지분을 사고 있습니다.

37
AWS의 네트워크 투자와 사용 경험

그래서 AWS가 크레도(Credo), 아스테라랩스(Astera Labs)의 지분을 들고 있습니다.

딜런 파텔 Dylan Patel : AWS는 CPU와 GPU를 갖춘 데이터센터를 갖고 있습니다. 사용 경험은 코어위브나 다른 네오클라우드들처럼 좋진 않겠지만 지금 가장 중요한 건 용량입니다. 코어위브는 그렇게 엄청난 양의 데이터센터를 온라인할 수 없습니다. 그렇게 많이 확보할 수도 없습니다. 구축 속도는 매우 빠르지만, 세계에서 가장 많은 데이터센터 용량을 가진 회사는 아마존입니다. 물론 앞으로 2년 안에 추월당할 수도 있겠지만요. 아마존은 여전히 가장 많은 여유 용량을 갖고 있다는 뜻입니다.

귀도 아펜젤러 : 그러면 기존의 데이터센터를 AI 데이터센터로 바꾸는 과정이 들어간다는 것을 유효 데이터센터 용량으로 보신 건데, 그 가정이 맞을까요? 고밀도 AI 랙을 구축하려면 훨씬 더 많은 냉각이 필요하고 물이 필요하고 전력이 필요할텐데요. 그게 괜찮을까요?

딜런 파텔 Dylan Patel : 데이터센터 용량이란 전력이 확보되는 것부터 변전소~변압기~랙에 전원을 코드를 꽂을 수 있도록 하는 양까지를 의미합니다. 데이터센터 용량 자체는 똑같지 않을 겁니다. 역사적으로 아마존은 세계에서 가장 높은 전력 밀도의 데이터센터를 갖고 있었습니다. 모두가 12kW로 구성할 때, 40kW 랙으로 갔었습니다. 그리고 만약에 실제로 데이터센터 안에 가보신 적이 있다면, 보통은 꽤 시원하고 약간 건조합니다.

38
아마존 데이터센터의 전력·냉각 제약

그런데 아마존 데이터센터에 가보셨다면 마치 늪지대 같습니다. 습하고, 덥죠. 왜냐면 모든 전력과 냉각을 딱 임계점에 못 미칠 만큼 모든 비용을 최적화하고 있기 때문입니다.

그래서 말씀하신 것처럼 아마존의 데이터센터는 새로운 유형의 인프라에 적합하지 않습니다. 다만, GPU 비용과 비교해보자면 냉각밀도를 높이는 건 상대적으로 저렴한 투자입니다.

아시다시피 저희는 약 2개월 전에 아스테라 랩스(Astera Labs)에 대해서 언급했는데 당시 $90이었는데 그 다음 달에 $220까지 올랐죠. 아마존이 아스테라 랩스에 주문하는 양 때문입니다. 아마존의 인프라에는 AWS만을 위해 설계된 특정 부품들이 많습니다. 너무 깊이 들어가지는 않겠지만, AWS의 랙 인프라는 아스테라 랩스 네트워킹 제품을 훨씬 더 많이 사용하도록 설계되어 있습니다. 그리고 이건 냉각에도 똑같이 적용될 겁니다. 네트워킹이나 냉각에 더 많은 비용을 넣어야 하겠지만 GPU에 비해 비용은 그닥 크지 않다는 겁니다.

전력을 모두 확보한 2GW 부지가 2개 있고, 습식 냉각기와 건식 냉각기가 모두 확보됐으며 모든 것이 잘 준비되고 있습니다. 효율적이진 않지만 뭐 괜찮습니다. AWS 데이터센터 매출은 더 늘어날 겁니다. 아마존의 내부 LLM이 더 훌륭해지거나, 그들의 Trainium이 엔비디아보다 낫거나, TPU 대비 경쟁력이 있다거나, 하드웨어 아키텍처가 최고라는 게 아닙니다. AWS는 충분히 많은 양의 데이터센터를 건설할 수 있고 임대할 고객도 찾은 상태입니다.

39
AWS·아스테라랩스 관련 링크와 전환점

꽤 간단한 논제입니다.

아스테라랩스 기업분석 코멘트들

주간전략보고 : 투자의 생각 (9월 8일~9월 12일) (바로가기)

업계 전문가 인터뷰 : 아스테라랩스, 모두가 Scale-up을 필요로 하는 시대의 핵심 기업 (바로가기)

Scale-up 네트워크 이해하기 : 아스테라랩스와 브로드컴, 왜 지금 Scale-up인가? (바로가기)

사라 왕 : Trainium 설계를 위해서 앤트로픽의 기여가 얼마나 컸나요? 지금은 얼마나 좋아졌나요?

딜런 파텔 Dylan Patel : 어... Trainium 자체는 여전히 안좋습니다. 일종의 모든 추론 스타트업들이 제시하는 주장과도 같습니다. 그들은 이렇게 말합니다. '저는 기껏해야 세 가지 모델만 실행하는데, 모든 것을 수동으로 최적화하고, 커널도 작성하고, 심지어 어셈블리 레벨까지 내려가서 짜면 되잖아?'라고 생각을 많이 합니다.

그런데 실제로는 꽤 어렵습니다. 그리고 Production 환경에서 추론을 돌릴 때에는 어차피 이런 작업들을 합니다. 예를 들어, 엔비디아의 cuDNN 같은 라이브러리를 쓰지 않습니다. 손쉬운 도구를 그대로 쓰진 않는다는 뜻입니다. 보통은 CUTLASS를 쓰거나, 아예 직접 PTX를 짜기도 하고, 경우에 따라서는 SASS 레벨까지 내려가기도 합니다. 오픈AI나 앤트로픽 같은 기업이 GPU 위에서 추론할 때에도 실제로 이런 방식을 씁니다.

그리고 이렇게 밑바닥까지 내려가면 생태계가 그렇게 훌륭하진 않습니다.

40
엔비디아 생태계·소프트웨어 경험

어디든 마찬가지입니다. 여기까지 내려오면 엔비디아 GPU를 쓴다고 해서 엄청 쉬운 건 아닙니다. 물론 엔비디아를 통해서 워낙 많은 아키텍처를 다뤄봤으니 직관적으로 이해하기 쉬운 건 맞고, 경험자들끼리의 커뮤니티가 활성화 되어 있으니 얘기도 잘 통하긴 하는데, 결국 쉽지는 않습니다.

반면, 앤트로픽이 TPU 위에서 훈련할 때를 생각해보면 하드웨어 아키텍처가 GPU보다 좀 더 단순하다는 얘기가 있었습니다. GPU처럼 온갖 기능을 다 넣은 게 아니라, 더 크고 단순한 코어 구조라서 범용성은 떨어지더라도 코딩하기는 좀 더 수월하다는 뜻입니다. 그리고 앤트로픽 사람들이 트위터에 올린 글을 보면, 로우레벨에서 작업할 때 단순함 때문에 Trainium과 TPU에서 작업하는 게 더 쉬웠다는 얘기도 있었습니다.

물론, TPU도 그렇고 Trainium도 사용하기는 매우 어렵습니다. 범용성은 없다고 보시면 됩니다. 그럼에도 불구하고 앤트로픽처럼 Claude 4.1 Opus, Sonnet 같은 것만 실행하고 나머지는 안 쓴다면 여기서 충분히 할 수 있습니다. 트래픽 대부분이 Sonnet을 굴리는 데 쓰니, 다른 워크로드는 GPU에서 쓰겠다는 결정을 하는 거죠. 아키텍처도 4~6개월 정도마다 한 번씩 바꾸는 수준이니 그렇게 많은 작업을 필요로 하지도 않아서 그렇습니다.

오라클의 경쟁력

래리 엘리슨의 생각, 컴퓨팅 쓰나미가 온다

*코멘트 → 오른쪽 차트에 많은 것을 표시했습니다.

41
오라클 OCI 전망과 성장 비중

OCI 매출전망, 이를 반영한 연도별 OCI의 매출비중, 전사매출성장률입니다. 오라클에 대해서는 <오라클 3Q25 실적발표 : "모두가 다가오는 쓰나미🌊의 규모를 이해하고 있는 건 아닙니다">를 보시면 좋습니다. 핵심은 오픈AI의 스타게이트 컴퓨팅 계약 $300B를 인식한 것입니다.

사라 왕 : 오라클이 왜 다른 하이퍼스케일러들에 비해서 이렇게 앞서나가고 있는지, 왜 이렇게 경쟁적인 환경에서 잘하고 있으며, 앞으로도 잘할 거라고 보는지에 대해서 한 번 설명해주시겠어요?

딜런 파텔 Dylan Patel : 오라클은 업계에서 가장 큰 대차대조표를 갖고 있고, 어떤 하드웨어에도 얽매이지 않습니다. 어떤 종류의 네트워킹도 얽매이지 않습니다. 아리스타 네트웍스를 통해서 이더넷을 깔고, 자체 화이트박스를 통해서 이더넷을 깔고, 엔비디아 InfiniBand와 Spectrum-X를 깔고 있기도 합니다. 정말 훌륭한 네트워크 엔지니어를 데리고 있고, 전반적으로 매우 훌륭한 소프트웨어도 갖고 있습니다.

오픈AI는 엄청난 컴퓨팅 수요를 갖고 있습니다. 마이크로소프트는 꽤나 연약합니다. 투자를 꺼리고, 오픈AI가 실제 그 금액을 지불할 수 없을 거라고 생각하는 것 같습니다. 돌아와서 오픈AI는 $300B 규모의 컴퓨팅 계약 수요는 갖고 있는데, 당장은 손에 없는 대신 오라클이 여기에 베팅하는 겁니다. 상대적으로 좀 더 안전한 베팅이긴 합니다. 오라클은 데이터센터 용량만 확보하면 되니까요.

42
오라클의 데이터센터 개발 방식

오라클은 다른 회사들로부터 데이터센터 용량을 얻어서 공동 엔지니어링을 하지만 물리적으로 직접 짓고 소유하진 않습니다. 새로운 데이터센터를 평가하고 엔지니어링 하는 데 상당히 민첩한 기업입니다. 수시로 데이터센터 부지들을 낚아채고, 계약하고 하길 반복하고 있습니다. 저희는 여기 GW, 저기 GW, 저쪽 GW가 생길 때마다 파악하고 있고 오라클은 그럴 때마다 그 부지에 가서 계약하고 있습니다.

저희는 전체 공급망을 추적하고 있기 때문에 기록하고 있고 특히 기관 고객들에게 매우 자세한 방식으로, 하이퍼스케일러건, AI 연구소건, 반도체 회사건, 투자자들이건 데이터센터 모델에 대해서 알리고 있습니다. 그래서 타임라인도 갖고 있습니다. 모든 허가, 모든 규제 서류, LLM을 통해 위성 사진들을 계속해서 캡처하면서 냉각기, 변압기, 발전기 등이 어떻게 들어오고 있는지를 파악하고 있죠. 분기별로 각 사이트에 얼마의 전력이 온라인되는지에 대해서 상당히 자세한 추정치를 낼 수 있습니다.

그래서 보자면, 오라클이 2027년 이후에 가동될 부지를 계약했다는 걸 파악하고 있으니 일종의 오라클 데이터센터 램프업 경로를 갖고 있는 셈입니다.

간단하게 말해봅시다. 1MW를 GPU로 채운다면, MW당 GPU 비용은 얼마일까요? 만약 GB200 NVL72에 대해서 보면 전체 시스템을 GPU의 수로 나누면 GPU당 대략 2000W입니다. 그리고 모든 것을 합쳐서 GPU의 수로 나누면 GPU당 $50,000입니다.

43
MW당 CAPEX와 GPU 임대료 계산

즉, 2000W당 $50K의 CAPEX가 드니까 1kW당 $25K입니다. 1MW당은 $25M이 드는 겁니다. GPU 임대료는, 장기 계약이라면 시간당 $2.6~2.7정도입니다. 그러므로 대략 1MW당 $12M정도를 벌 수 있는 겁니다.

그리고 각 칩마다 다르죠. 그래서 각 칩의 CAPEX 비용, 네트워킹 비용을 추적하면은 어떤 칩을 쓰는지를 알 수가 있습니다. 각 칩이 어떤 데이터센터에 들어가든지, 해당 데이터센터가 언제 온라인으로 전환되는지, 분기별 MW 규모를 예측할 수 있습니다. 그러면 "아, 스타게이트가 이 기간에 온라인으로 전환되는구나"라는 결론에 도달할 수 있습니다. 그래서 이 분기에 임대를 시작할 거라는 추정도 가능하고, 스타게이트 사이트당 얼마의 칩이 들어가는지도 예상이 됩니다. 오픈AI는 그걸 임대하는 데 얼마의 비용을 써야한다는 것도 추정이 가능합니다.

이걸 추정하면 꽤 높은 디테일로 오라클의 매출을 연도별로 예상할 수 있고, 2025년, 2026년, 2027년에 예측한 추정치와 최근 값이 정확히 일치했으며 2028년도 추정치도 꽤 근접했었습니다. 저희한테 놀라웠던 거는 오라클이 2028년과 2029년의 데이터센터 계획을 말했었는데 그건 지금 부지에 없습니다. 그리고 어떤 데이터센터를 확보하고 있는지, 전력량은 얼마나 되는지, 어떤 계약을 체결하고 있는지, 그걸 추정하면 얼마의 임대 매출이 추가로 들어올 수 있는지를 예측할 수 있죠.

44
오라클 베팅과 바이트댄스 계약 해석

그게 저희 오라클 베팅의 기반입니다.

바이트댄스가 오라클에 임대하고 있는 데이터센터 용량도 있습니다. 거기서도 같은 방식으로 추정했습니다. 바이트댄스는 수익성이 좋은 회사이므로 돈을 낼 게 확실합니다. 오픈AI는 그렇지 않죠. 오픈AI가 28년, 29년, 30년에 존재할지 그리고 오라클과 계약한 연간 $80B 이상의 계약을 실제 이행할 수 있을지에 대해서는 불확실성이 있습니다. 그게 유일한 위험 요소입니다. 그래도 그런 일이 발생할 것에 대비해서 오라클의 손실도 어느 정도 보호가 됩니다. 래리 엘리슨의 지혜입니다. 데이터센터의 CAPEX는 아니고 특정 기간의 임대에 대한 사용만 계약으로 해뒀기 때문입니다. 비용의 일부입니다. GPU가 비용의 전부이고, GPU는 실제 클러스터를 온라인하기 1~2분기 전에 구매합니다. 계약을 실제 성사시키지 못하더라도 손실 위험이 꽤 낮습니다.

귀도 아펜젤러 : 오픈AI가 원래 컴퓨팅 제공자였는데, 그건 어떻게 바뀐 건가요?

딜런 파텔 Dylan Patel : 마이크로소프트가 독점 제공자였다가, 오픈AI와 협상 후에 '우선 거부권'을 갖도록 재편성 됐습니다. 상호 배타적이거나 그런 건 아닙니다. 마이크로소프트는 여전히 가장 좋은 딜을 받고 있습니다. 예를 들어 오픈AI가 "5년 동안 $300B 규모의 계약을 하고 싶은데, 가능하세요?"라고 물으면 마이크로소프트가 오케이할지 아니면 거절할지를 정하고, 그 계약이 오라클에게 가는 식입니다.

45
오픈AI·오라클 관계의 자금 문제

오픈AI는 아시다시피, 먼저 실제 비용을 지불해줄 수 있는 재무제표를 가진 사람이 필요합니다. 그리고 나서 오픈AI에서 많은 돈을 벌기 시작하면 갚겠다는 것이죠. 오라클은 오픈AI의 스타게이트를 처리할 수 있을 만큼 충분한 재무제표를 갖고 있습니다. 오라클은 최근 부채 자본조달 방법을 알아보고 있다고 알고 있습니다. 매년 상당한 양의 GPU 비용을 지불하게 위해서 부채로 먼저 투자해야 하기 때문입니다.

25년과 26년 프로젝트는 현금흐름으로 충분히 가능한데, 27년, 28년, 29년 프로젝트는 GPU 클러스터를 갖추기 위해서 부채를 써야 할 겁니다. 코어위브나 많은 네오클라우드가 그랬듯이 대부분 부채로 자금을 조달합니다. 심지어 메타도 루이지애나 메가 데이터센터를 위해서는 부채로 자금조달을 했죠. 부채로 조달하는 게 주식 수익률로 얻을 수 있는 것과 비교할 때 가장 저렴해서 그렇습니다.

일론 머스크의 추진력

xAI가 가장 먼저 GW급 클러스터를 만들 수도

사라 왕 : 최근 xAI Colossus 2에 대한 리서치를 내셨는데요. 6개월 만에 이렇게 거대한 데이터센터를 짓는 것에 대해서 어떻게 생각하세요? 요즘은 감흥이 좀 줄어드는 중인가요? 아니면 여전히 흥미롭나요?

딜런 파텔 Dylan Patel : 흠, 제가 AI 연구자들을 칭할 때 하는 말은, 그들이 '규모의 관점에서 생각'하는 최초의 인간이 된 것 같다는 겁니다. 원래 사람은 산업화 이후로 항상 백분율 성장에 대해서 주로 성장해왔습니다.

46
AI 규모 인식이 바뀌는 속도

그전에는 그냥 숫자였죠. 인류 전체가 생각하는 방식 자체가 이제는 로그 값을 기준으로 생각하게 바뀌기 시작한 겁니다. 엄청나게 빠르게 상황이 바뀌고 있음을 가장 잘 보여주는 겁니다. GPT-2가 엄청나게 많은 칩으로 훈련됐다고 할 때도 충격적이었고, GPT-3와 GPT-4는 2만 개의 GPU로 훈련했고, 그러다 이제 10만 개의 GPU 클러스터의 시대가 왔습니다. 10만 개는 100MW를 넘깁니다.

이제 저희 팀은 슬랙 채널에서 데이터센터를 찾을 때 200MW정도는 "어, 또 찾았네"하는 식입니다. 그리고 채널에서 누군가 하품하는 이모티콘을 매번 올리는 사람이 있는데, 이제 GW급 데이터센터가 아니면 흥미가 안 생기는 거죠. GW의 시대입니다. 로그 스케일로 엄청나게 빠른 속도로 증가하고 있습니다. 오픈AI가 $10B 규모의 훈련을 하고 있다는 것도 놀라운 일이죠. 이전에 $1B 규모의 훈련을 했는데 이제 불과 몇 개월 만에 $10B입니다. 로그 스케일로 생각하는 인류입니다.

다시 돌아와서, 일론이 멤피스에서 하는 일은 처음에는 미친 짓 같아 보였습니다. 6개월 내에 10만 개의 GPU를 온라인하겠다고 말했었습니다. 2024년 2월에 공장을 샀고, 6개월 안에 모델 훈련을 끝냈습니다. 액체냉각을 도입하기도 했죠. 이정도 규모에서 액체 냉각을 도입한 사례는 처음이었습니다.

최초로 시도한 것들이 너무 많았습니다. 그리고 가스터빈 발전기를 아예 외부에 설치해버리는 것도 했습니다.

47
xAI의 전력 확보와 지역 반발

전력을 얻기 위해서 별의별 짓을 다 했습니다. 이동식 변전소를 설치하기도 하고, 공장 옆을 지나는 천연가스 관을 끌어다 쓴다던지 말이죠. 그렇게 일론이 해낸 겁니다.

멤피스 시설 주변에서 시위가 많았습니다. 공기 오염에 대해서도 우려가 많았습니다. 가스터빈 발전소에서 공해가 많죠. 그 근처에는 멤피스 도시 전체에 서비스하는 하수 처리장이 있습니다. 온갖 혐오시설들이 다 그 주변에 있죠. 나라가 돌아가려면 그런 것들이 필요하죠. 이미 주변에서 많은 문제들이 나오고 있었는데, 약간의 공기질 저하로 불평이 큰 상황입니다. 워낙 정치적으로 한쪽으로 나아가다보니, NAACP도 일론 머스크에게 항의했었죠. 아무튼, 일론은 Colosuss 부지에 매우 많은 것들을 이미 구축했습니다. 그리고 또 다른 유통센터를 하나 산 게 있는데, 그것도 멤피스에 있습니다.

*코멘트 → xAI가 매우 빠른 속도로 콜로서스 데이터센터를 온라인시키고, 전력 조달비용을 거의 안 들인 이유는 솔라리스 에너지 인프라와의 계약에 있습니다. 이에 대해서는 <주간전략보고 : 투자의 생각 (9월 22일~9월 26일)>을 보시면 좋습니다. 회사가 말하는 것만 보면 사실 PEG 기준으로 매우 저렴하긴 한데, 시장에서 워낙 리스크에 대해서는 많이 언급이 안 되어 있다보니 상대적으로 주간보고에는 '이런 리스크들을 인지하시고 투자하셔야 한다'는 내용들을 강조하게 됐습니다.

딜런 파텔 Dylan Patel : 그러나 흥미로운 거는 멤피스가 미시시피 바로 국경 건너편에 있다는 겁니다.

48
Colossus 2의 완공 조건과 xAI의 위치

그래서 일론은 미시시피에서 발전소를 샀고 거기에 가스터빈을 잔뜩 또 설치하고 있죠. 규제가 주별로 다르다는 점을 이용한 겁니다.

그리고 여기서 핵심은 일론이 말하는 대로 Colosuss 2가 제시간에 완공된다면 일론이 Colosuss 2부터는 모두보다 앞서있게 됩니다. xAI는 아직 최고의 모델을 만들지 못했고, 적어도 오늘 현재 SOTA 모델을 갖고 있지는 않습니다. 그러나 이 추진력이 놀랍습니다. 대부분의 사람들은 '여기서 더 이상 데이터센터 부지에서 전력을 늘릴 수 없으니, 새로운 장소를 찾겠다'라고 말하지만, 머스크는 그냥 국경을 넘어서 미시시피에서 연결한 겁니다. 그리고 아칸소가 또 바로 옆에 있으니 더 지을 용량도 있다고 볼 수 있죠. 모든 미래의 데이터센터는 여러 주가 만나는 곳에서 지어질 거라 생각합니다.

*코멘트 → xAI의 컴퓨팅 규모가 2024년만 해도 상당히 낮았으나, 3Q24에 Colosuss 1을 매우 빠르게 온라인하고, 3Q25에는 Colosuss 2를 온라인하게 되면 단숨에 모델 훈련을 위해 쓰는 컴퓨팅 규모로는 Top 2로 올라오게 됩니다. 물론 문제는 모델의 훈련용 컴퓨팅만 추정하는 것이라서 ⓐ추론용 컴퓨팅, ⓑ메타의 자체 콘텐츠·광고 추천 및 랭킹 알고리즘을 위해 쓰는 컴퓨팅 규모는 포함하지 않은 값입니다. 그리고 여기 축에는 구글이 없는데, 구글이 가장 많은 컴퓨팅을 갖고 있을 것으로 예상합니다.

49
GB200의 TCO와 세대 전환

GB200 NVL 그리고 Rubin CPX

엔비디아가 미래를 준비하는 방법들

사라 왕 : 그리고 최근에 GB200의 TCO 대비 퍼포먼스가 H100 대비 1.66배에 달한다는 것을 분석하신 것도 인상적이었는데요. 최근 AI HW를 만들고 있는 스타트업들에게는 뭐라고 말씀해주실 수 있을까요?

딜런 파텔 Dylan Patel : 어렵습니다. 매번 GPU가 세대를 거듭할 수록 훨씬 더 빨라지니까요. 어떤 지표에서는 GB200이 이전 세대보다 2~3배 빨라졌다고 하고, 다른 지표에서는 수십 배 이상 더 좋아졌다고 볼 수 있습니다. NVLink의 NVL72를 사용하면 GB200이 H100 대비 전반적으로 TCO 대비 퍼포먼스면에서 2배정도 좋은 거니까 다음 세대로 넘어갈 가치가 있긴 합니다. 60% 비싸진 대신 2~3배의 성능을 얻게 된 겁니다.

다른 축으로 보자면, DeepSeek 모델 추론을 할 경우에는 이전 세대에 비해서 GPU당 성능 차이가 6~7배 이상으로 크게 벌어졌습니다. 딥시크에 대한 최적화가 계속되고 있습니다. 이렇게 되면 60% 비싸진 대신 6~7배의 성능을 얻은 겁니다. 달러당 3~4배의 성능 향상이 있는 거니까 딥시크 모델을 추론할 거라면 당연히 맞는 선택입니다. 그리고 강화학습을 할 때에도 GB200(NVL72)가 훨씬 더 좋은 건 마찬가지입니다.

*코멘트 → GB200 NVL72의 'TCO 대비 퍼포먼스'가 H100 NVL8을 앞서기 시작한 시점이 2025년 7월경이었습니다.

50
GB200 배치·최적화의 시간 순서

시간순으로 정리해보면: 2025년 2~4월부터 주요 하이퍼스케일러들에게 첫 AI 랙들을 배송하고 테스트하는 단계(CoreWeave, Google, Microsoft, Oracle)를 거쳤는데 → 2025년 5월에는 GB200 NVL72 기준 CUDA 소프트웨어를 써서 DeepSeek 670B MoE 모델을 학습한 경우 H100에 비해서 TCO당 학습 성능이 9% 낮았고 → 2025년 7월에는 GB200 NVL72를 굴리는 엔지니어들의 수가 크게 증가하기 시작하니 진단 및 디버깅 툴들이 발전하고, 워크로드 최적화들이 가속화되면서 TCO 대비 퍼포먼스 관점에서 H100에 비해서 1.52배 더 우수해졌으며 → 2025년 12월에는 H100 대비 2.8배 더 좋아질 예정입니다.

*코멘트 → 상대적으로 난도가 낮은 추론 워크로드는 그보다 앞서 NVL72 클러스터에서 가동되었고(2025년 6월 오라클의 GB200 NVL72 '전체 클러스터 온라인' 시점부터 오픈AI가 o3 가격을 80% 인하했습니다.) 대규모 pre-training의 본격 최적화는 2025년 7월부터 가속이 붙었던 것입니다. 반대로 좀 더 생각해보면, 오픈AI GPT-5가 H100/H200 기반에서 사전훈련되었다는 점을 감안하면 차기 모델인 GPT-6는 GB200 NVL72를 기반으로 훈련할 것이기에 지능의 도약을 예상할 수 있기도 합니다.

딜런 파텔 Dylan Patel : B200은 하드웨어 관점에서 훨씬 더 간단합니다.

51
B200·GB200의 안정성과 운용 방식

박스 안에 GPU 8개를 넣은 거라서, 특히 추론에서는 성능 향상이 크진 않은데 안정성은 높습니다. GB200은 여전히 안정성 문제가 좀 있습니다. 해결은 되고 있고 매일 점점 더 나아지고 있지만 어려운 문제입니다.

가장 직관적으로 보자면 H100, H200, B200처럼 GPU 8개가 있을 때는 서버 하나가 고장나면 서버 전체를 오프라인시키면 됩니다. 그리고 고치는 거죠. 하지만 GB200이라면 GPU 72개를 어떻게 해야 할까요? 전체를 오프라인시키고 새 걸로 바꿔야 할까요? 그렇게 할 수 없습니다. 앞으로 세대를 거듭할 수록 GPU 고장률은 기껏해야 같거나 아마 더 나쁠 겁니다. 세대를 거듭할 수록 모든 것이 더 뜨거워지고 빨라지니까요. 고장률은 같다고 보더라도 8개 서버 하나가 고장나는 것과, 72개 서버 하나가 고장나기에 큰 문제입니다.

그래서 요즘 많은 사람들이 하는 일은 72개의 GPU 중, 64개의 GPU에는 높은 우선순위의 작업을 실행하고 나머지 8개 GPU에는 낮은 우선순위의 작업을 실행하는 겁니다. 그러면 두 가지 레이어의 인프라를 갖는 것과도 같죠. 그러다가 높은 우선 순위의 작업에서 오류가 발생하면 랙 전체를 오프라인하는 대신, 낮은 우선순위 GPU에서 일부를 가져와서 높은 우선순위 GPU 풀에 넣고 고장난 GPU는 수리할 때까지 놔두는 겁니다.

보통 클라우드를 사용하면 SLA가 있습니다.

52
SLA와 64·72 GPU 운용의 차이

특정 기간 동안 가동 시간이 99%가 될 거라는 겁니다. 구간을 따져보면 GB200의 경우 72개가 아닌 64개의 GPU에 대해서는 99%이고, 72개 전체로 보면 95%정도입니다. 물론 클라우드마다 다르고, 모든 클라우드가 다른 SLA를 갖고 있지만 이걸 감안해서 조정하고 있습니다. 'GB200는 꽤 까다롭기에 SLA가 낮지만 그래도 원하십니까?'라는 거죠. 그대신 72개가 아닌 64개는 항상 작동하도록 보상해주는 식입니다. 최종 고객 입장에서는 불안정성을 감내해야 하니 B200을 그냥 사용할 수도 있을 겁니다. 아직 B200에 비해서 성능향상이 드라마틱하지 않기도 하니까요. 72개의 도메인을 원하는 이유는 엄청나게 헤비한 워크로드를 처리할 때 이점이 있다는 건데, 작은 회사들한테는 어려운 일입니다. 물론 이미 충분히 계속 좋아지고 있습니다.

*코멘트 → 클라우드의 공식 SLA는 보통 서비스(Region/Instance) 단위입니다. 이건 공식 SLA 퍼센트라기보다, 장애 시 보상이나 크레딧을 제공해주는 것 같은 운영 정책쪽에 있을 내용일 것 같습니다. 실제 네오클라우드 컴퓨팅 계약에서는 그럴 것 같기도 합니다.

귀도 아펜젤러 : 엔비디아가 Rubin Prefill 카드인 CPX를 공개했잖아요, 여기에 대해서는 어떻게 생각하세요? 왜 특정 사용 사례에서 5배 더 빠른 칩을 미리 발표한 걸까요?

딜런 파텔 Dylan Patel : 이전에는 AI 칩은 그냥 AI 칩이었습니다.

53
훈련·추론 구분이 흐려지는 배경

그러다가 많은 사람들이 '이건 훈련을 위한 칩이고', '이건 추론을 위한 칩이야'라고 말하기 시작했었죠. 사실 훈련과 추론은 요구사항이 워낙 빠르게 바뀌고 있고 특정 사용 사례에 따라 요구 능력치가 바뀌는 경우도 있어서 이제는 칩 하나로 다 되고 있는 상황입니다. 훈련용 칩과 추론용 칩이 따로 구분되지 않습니다. 강화학습 덕분에 추론이기도 하면서 이제 훈련 사이클의 일부이기도 한 작업으로 바뀌었습니다.

*코멘트 → 엔비디아의 Rubin CPX(4Q26 출시 예정)는 분산 추론(Disaggregated Inference)의 시작을 알린 칩입니다. Transformer 계열 LLM의 추론은 크게 두 가지 작업으로 분리됩니다. Prefill과 Decode입니다.

*코멘트 → 워크로드별로 특징을 보면 Prefill은 컴퓨팅이 많이 필요하고, 상대적으로 메모리 대역폭은 낮아도 됩니다. 그래서 값비싼 HBM을 사용하는 대신 Rubin CPX에는 128GB GDDR7(대역폭 2TB/s)을 탑재했습니다. HBM 절반 가격으로 만든 칩이고, R200 GPU 대비 4분의 1 가격으로 동일 작업을 수행할 수 있게 됩니다. 그리고 Decode는 메모리 대역폭을 많이 필요로 합니다. HBM에 적합하기에 R200에는 여전히 288GB HBM4(대역폭 20.5TB/s)가 탑재됩니다.

*코멘트 → 기존의 방식은 Aggregated로, Prefill과 Decode 작업을 단일 GPU에서 동시에 처리하는 식이었습니다.

54
Rubin CPX의 Prefill·Decode 분리

Prefill은 계산량이 많아 병렬성이 낮고, Decode는 KV Cache를 사용할 수 있기 때문에 병렬성이 상대적으로 높은 워크로드입니다. 문제는 단일 아키텍처이기 때문에 유연성이 부족하고 병목이 생긴다는 점이 문제였습니다.

*코멘트 → 새로운 방식은 Disaggregated로, Prefill과 Decode 작업 중에 Prefill을 전용 하드웨어로 분리하는 게 핵심입니다. Prefill에 맞게 따로 특화시킨 엔비디아의 Rubin CPX 칩에서 계산에 최적화된 작업을 하고, 병렬성이 높은 Decode 작업은 기존 Rubin GPU에 배정하는 것입니다. 이렇게 되면 KV Cache를 HBM 대신 GDRR7처럼 더 저렴한 스토리지로 옮겨서 GPU 메모리를 확보할 수 있게 됩니다. 워크로드에도 다양한 하드웨어간 스마트 라우팅으로 유연한 확장을 할 수 있다는 게 핵심입니다.

*코멘트 → 이를 위해 엔비디아는 소프트웨어 레벨에서 ⓐSmart Router, ⓑKV Cache Manager, ⓒGPU Resource Planner를 추가하여 LLM 추론 과정에서 Prefill과 Decode를 분산하여 처리하고, KV Cache를 GPU 메모리에서 오프로딩하여 GPU 리소스를 최적화하는 아키텍처입니다. 이렇게 하면 대규모 사용자 처리, 모델 확장성, 리소스 효율성이 모두 개선됩니다. 이전에 비해 Prefill 비용이 절감되므로 ROI가 30~50배 증가하고, 전체 시스템 단위 효율은 3~7.5배 좋아졌습니다.

55
분산 추론과 ASIC 경쟁의 변화

*코멘트 → 기존의 칩들과 전혀 다른 구조이기 때문에 이제 모든 ASIC 플레이어들은 엔비디아와의 'TCO 대비 퍼포먼스' 비교에서 엔비디아를 따라가기 위해 자체적인 Prefill ASIC을 동시에 개발해야 하는 상황이 시작됐습니다. 그리고 이제 추론에서도 엔비디아가 깔아둔 분산형 추론 설계를 채택할 경우 훨씬 더 TCO 대비 퍼포먼스가 우수해질 것이므로, 약간의 락인 효과를 기대합니다. 추론이 점점 복잡해질수록 훈련에서처럼 엔비디아가 가진 하드웨어·소프트웨어·네트워킹·공급망 관리 차원의 해자가 점점 더 강해질 것으로 예상합니다.

딜런 파텔 Dylan Patel : 추론은 크게 두 가지로 나뉩니다. 첫 번째로는, Prefill을 위한 KV Cache를 계산하는 작업이 있습니다. 예를 들어 LLM에 문서를 집어넣으면 그 문서들의 Attention을 수행하는 겁니다. 모든 토큰들에서, 어떤 유형의 Attention을 사용하건 말이죠. 그리고 두 번째는 Decode 작업입니다. 각 토큰을 자기회귀적으로 생성하는 겁니다. 이 두 가지 작업은 매우 다른 유형의 워크로드입니다. 그래서 처음엔 ML 워크로드와 시스템 단위를 설계할 때 Batch size를 매 Forward pass마다 1,000씩 엄청 크게 만들고 32명의 사용자가 동시에 실행할 수 있게 한다면 968가 남는데 그만큼은 실제 사용자들로부터 Request가 들어오면 prefill을 채우는 일을 하게 시켜왔습니다.

56
Prefill과 Decode 병목의 실제 운영

이렇게 하면 GPU 활용률이 정말 좋아지지만 이렇게 되면 decode 작업에 영향을 미치게 됩니다. 각 토큰을 회귀적으로 생성하려면 TPS가 크게 느려지게 되죠. 초당 몇 개의 토큰이 서비스되는가는 사용자 경험이나 모든 면에서 정말 중요합니다. 그러니 두 워크로드는 너무 다르고 prefill을 하고나서 decode를 하는 과정이 서로에게 병목인 상황이었습니다. 훈련과 추론이 하나로 합쳐진 상황에서는 특히 더 그랬습니다. 오픈AI, 앤트로픽, 구글 등 모든 AI 연구소들이 이걸 같은 칩에서 쓰고 있었습니다. 모두가 prefill, decode를 같이 쓰고 있었죠.

AI 연구소들은 같은 칩이지만 특정 GPU 세트에서 prefill을 전담하도록 클러스터를 설계하고, 다른 GPU 세트에서는 decode 작업을 하게끔 클러스터를 설계해뒀습니다. 이게 좋았던 이유는 그때그때 모델이나 추론 워크로드가 바뀔 때마다 확장하기가 훨씬 좋았기 때문입니다. 갑자기 컨텍스트 윈도우를 더 확장했다고 하면 prefill에 더 많은 GPU를 추가하면 됐습니다. 반면, 사용자들로부터 오는 Traffic mix가 long input + short output에서, short input + long output으로 바뀌게 되면 더 많은 decode GPU를 추가하는 식이었습니다.

이렇게 함으로써 연구소들은 prefill 시간과 가동률을 높게 보장하면서도, 리소스에 맞춰서 시스템을 확장할 수 있었습니다.

57
첫 토큰 시간과 클러스터 확장

아시다시피 검색 서비스에서 가장 중요한 것은 웹페이지 로딩을 얼마나 빨리 끝내는가입니다. 게임을 하실 때 느끼셨을텐데, 로딩 화면에서 시간이 걸리면 이탈이 많아지다보니 개발자들은 팁과 요령을 주면서 주의를 분산시키는 방식을 씁니다. AI 서비스를 할 때에도 첫 번쨰 토큰이 나오는 시간이 훨씬 더 빨라야 서비스의 경험이 좋다고 느낀다는 연구와 논문들이 있습니다. 모든 토큰을 얻는 총 시간이 좀 더 길어지더라도 일단 첫 페이지를 빠르게 보여줘야 한다는 거죠.

decode 시간과 속도도 중요하긴 하지만, 첫 번째 토큰이 나오기까지 걸리는 시간을 단축시켜야 하는 정도만큼 중요한 건 아닙니다. 아무튼 이런 상황 속에서 어떻게 하면 더 좋게 만들 수 있을까요? 워크로드가 매우 다릅니다. decode는 모든 매개변수를 불러와야하고, KV Cache는 단일 토큰을 생성하는 데 쓰이는 식이었습니다. 여러 사용자들을 한 번에 처리하기 시작하면 모든 사람의 KV Cache 값이 다르니 메모리 용량이나 메모리 대역폭이 매우 빠르게 부족하게 됩니다.

예를 들어, 사용자가 64,000개의 토큰을 입력하면 그 자체가 엄청난 연산량을 요구합니다. 예를 들어, Llama 70B 모델은 한 토큰당 140 GFLOPs를 필요로 합니다. 이 경우 GPU 전체를 몇 초 동안 단일 prefill 연산에만 사용할 정도입니다.

58
CPX의 HBM 절감 논리

즉, prefill은 순수하게 엄청난 계산량을 필요로 하는 문제이니까 GPU를 꽉 채워서 처리하기 쉽습니다. 그러나 decode는 반대로 메모리와 KV Cache 관리가 병목입니다. 이 둘을 구분해서 다루는 것이 합리적이며 이런 맥락에서 CPX 같은 구조가 등장한 겁니다.

CPX는 컴퓨팅에 최적화된 칩이고, prefill에 적합한 칩입니다. decode 작업은 솔직히 말해서 HBM이 들어간 범용 칩과도 같습니다. HBM이 GPU 비용의 절반 이상을 차지하고 있습니다. 전체 워크로드를 처리할 때 HBM의 비중을 줄이게 되면 훨씬 더 저렴한 칩을 고객에게 서비스할 수 있게 됩니다. 그리고 고객들은 같은 비용으로 훨씬 더 긴 컨텍스트를 사용할 수 있게 되죠.

GPU는 마치 코카인을 사는 것 같다

추론 수요의 폭증으로 Hopper도 매진되는 상태

사라 왕 : 사람들은 GPU를 어떻게 사는 건가요?

딜런 파텔 Dylan Patel : 실제 현장에서 보자면, 솔직히 GPU를 구매하는 방식은 코카인을 사는 방식과 비슷합니다. 이건 제가 묘사한 게 아니라 다른 사람이 제게 묘사해준 겁니다. 저는 코카인을 산 적은 없습니다. *웃음* 아무튼, 오늘도 GPU를 구하는 방식은 똑같습니다. 몇몇 사람들에게 문자를 보내고, 전화를 해서 "너 얼마나 있어?, 가격은 얼마야?"라고 물어보는 과정이거든요.

59
GPU 조달 현장과 Hopper 수급

저희는 슬랙으로 총 30개의 네오클라우드와 연결되어 있고, 주요 몇몇 서버 기업들과도 연결되어 있어서, 메시지를 보내서 소통하고 있습니다. "고객이 이만큼 주문하길 원한다"고 말하면 견적을 받죠.

현재 주요 네오클라우드에서 Hopper 용량이 매진됐고, Blackwell 용량들은 몇 달 후에 가동될 예정입니다. 추론수요가 급증하면서 상황이 많이 바뀌고 있습니다. 그리고 Blackwell이 가동되고 있기는 한데 배포하기가 어렵다보니 약간의 학습 곡선들이 필요한 상태입니다. Hopper를 구매하면 1~2개월 안에 바로 가동할 수 있으니 모든 GPU의 수요가 올라가고 있는 겁니다. 이미 네오클라우드에 깔린 용량들은 많이 흡수됐습니다. Hopper 가격도 5~6개월 전에 바닥을 치고 요즘은 슬금슬금씩 올라오고 있죠.

2023~2024년 만큼 GPU가 부족한 시대는 아니긴 합니다. GPU 몇 개 정도만 원하면 확실히 구하기 쉽습니다. 근데 많이 원하기 시작하면 그건 어렵습니다. 똑같아요. 원하는 만큼의 용량을 즉시 확보할 수가 없습니다.

주간전략보고

2025-09-22

주간전략보고 : 투자의 생각 (9월 22일~9월 26일) (바로가기)

AI 사이클

60
마지막 관련 글 목록

2025-09-24

마이크론 3Q25 실적발표 : 클라우드 매출 YoY 214%, 숫자보다 '이유'가 더 중요하다 (바로가기)

2025-09-17

Scale-up 네트워크 이해하기 : 아스테라랩스와 브로드컴, 왜 지금 Scale-up인가? (바로가기)

2025-09-16

골드만삭스 테크 컨퍼런스 : "전례 없는 수요를 보고 있습니다" (바로가기)

2025-09-10

오라클 3Q25 실적발표 : "모두가 다가오는 쓰나미🌊의 규모를 이해하고 있는 건 아닙니다" (바로가기)

2025-08-28

엔비디아 2Q25 실적발표 : Blackwell 12개월치 SOLD OUT, AI CAPEX $3~4T를 말하다 (바로가기)

업계 전문가 인터뷰

2025-09-19

업계 전문가 인터뷰 : 로빈후드, 화려한 부활에 가려진 비하인드 스토리 (바로가기)

2025-09-12

업계 전문가 인터뷰 : 아스테라랩스, 모두가 Scale-up을 필요로 하는 시대의 핵심 기업 (바로가기)

2025-09-02

업계 전문가 인터뷰 : 블룸에너지, 데이터센터로 어디까지 침투할 수 있을까? (바로가기)

5

그럼에도 빠진내용 정리

잡담·곁다리 내용
  • 원문에 포함된 계약 권유문서·관련 글 링크와 투자 유의문은 작성자 주장과 구분해 flow에 보존했다.
생략 기록

별도 생략 기록이 없습니다.

그럼에도 빠진내용 정리

보존 범위
원문의 인터뷰·작성자 코멘트·관련 글 목록·투자 유의문을 순서대로 flow에 남겼다.
추정과 전망
Ascend 생산량, AI CAPEX, Colossus 2 완공, GB200·CPX의 성능·출시 관련 수치는 원문에 제시된 추정·계획·조건으로 보존했으며 확정 사실로 바꾸지 않았다.
시각 자료
원문에 이미지 참조가 있으나 이 작업에서는 보존 텍스트만 근거로 했고, 이미지의 별도 판독 내용은 추가하지 않았다.
원문 확인

document_work_runner prepare가 입력 원문을 수정 없이 보존했다.