25-7 GB200 NVL72의 TCO 대비 성능 개선
작성자의 핵심 판단
GB200 NVL72의 성능·경제성은 하드웨어만으로 완성되지 않으며 CUDA 소프트웨어 스택의 성숙이 필수라는 판단이다.
근거 보기 2
- 원문 구간 1
상대적으로 난도가 낮은 추론 워크로드는 그보다 앞서 NVL72 클러스터에서 가동되었고(2025년 6월 오라클의 GB200 NVL72 '전체 클러스터 온라인' 시점부터 오픈AI가 o3 가격을 80% 인하했습니다.) 대규모 pre-training의 본격 최적화는 2025년 7월부터 가속이 붙었던 것입니다. 반대로 좀 더 생각해보면, 오픈AI GPT-5가 H100/H200 기반에서 사전훈련되었다는 점을 감안하면 차기 모델은 GB200 NVL72를 기반으로 훈련할 것이기에 지능의 도약을 예상할 수 있기도 합니다. 핵심은 하드웨어만으로는 부족하다는 점입니다. NVL72의 성능·경제성을 온전히 끌어내려면 CUDA 소프트웨어 스택의 성숙이 필수였습니다.
- 원문 구간 2
예컨대 NVL72 특화 진단/디버깅 도구의 보강, 스위치 트레이/백플레인 등 구성품의 안정성 확보, MTBI/신뢰성 지표 개선 같은 시스템 전반의 End-to-End 최적화가 동시에 맞물려야 합니다. 이는 개별 기업의 단독 과제가 아니라 엔비디아–CSP–네오클라우드–프론티어 AI 연구소의 CUDA 개발자들이 대규모 배포·운영(훈련/추론)을 통해 실제로 부딪히면서 해결해 가는 공동 과제입니다. CUDA가 단순히 워크로드에만 영향을 주지 않고 생태계 단위에 전반적인 영향을 준다는 의미입니다. *워크로드단위에서도 충분한 해자를 지닙니다. 예를 들어, 오픈소스와 CUDA의 조합이 갖는 해자에 대해서는 <주간전략보고 : 투자의 생각 (9월 8일~9월 12일)>에서 FlashAtttention-4를 예시로 들었었습니다.
이 자료에서 다룬 사실
작성자는 2025년 7월 GB200 NVL72의 TCO 대비 퍼포먼스가 H100 대비 1.52배 더 우수해졌다고 제시했다.
근거 보기 1
- 원문 구간 1
시간순으로 정리해보면: 2025년 2~4월부터 주요 하이퍼스케일러들에게 첫 AI 랙들을 배송하고 테스트하는 단계(CoreWeave, Google, Microsoft, Oracle)를 거쳤는데 → 2025년 5월에는 GB200 NVL72 기준 CUDA 소프트웨어를 써서 DeepSeek 670B MoE 모델을 학습한 경우 H100에 비해서 TCO당 학습 성능이 9% 낮았고 → 2025년 7월에는 GB200 NVL72를 굴리는 엔지니어들의 수가 크게 증가하기 시작하니 진단 및 디버깅 툴들이 발전하고, 워크로드 최적화들이 가속화되면서 TCO 대비 퍼포먼스 관점에서 H100에 비해서 1.52배 더 우수해졌으며 → 2025년 12월에는 H100 대비 2.8배 더 좋아질 예정입니다.
그렇게 판단한 이유
초기 배송·테스트 뒤 엔지니어 수가 늘고 진단·디버깅 도구와 워크로드 최적화가 가속됐다는 시간 흐름을 근거로 든다.
근거 보기 1
- 원문 구간 1
시간순으로 정리해보면: 2025년 2~4월부터 주요 하이퍼스케일러들에게 첫 AI 랙들을 배송하고 테스트하는 단계(CoreWeave, Google, Microsoft, Oracle)를 거쳤는데 → 2025년 5월에는 GB200 NVL72 기준 CUDA 소프트웨어를 써서 DeepSeek 670B MoE 모델을 학습한 경우 H100에 비해서 TCO당 학습 성능이 9% 낮았고 → 2025년 7월에는 GB200 NVL72를 굴리는 엔지니어들의 수가 크게 증가하기 시작하니 진단 및 디버깅 툴들이 발전하고, 워크로드 최적화들이 가속화되면서 TCO 대비 퍼포먼스 관점에서 H100에 비해서 1.52배 더 우수해졌으며 → 2025년 12월에는 H100 대비 2.8배 더 좋아질 예정입니다.