2025.07.15 · 네이버 프리미엄 콘텐츠 · 올바른 미국주식 by SAPIENS

(아카이브) 엔비디아 총정리 : 젠슨황😉이 이끄는 100조 달러 규모의 AI 산업혁명

유형
네이버 프리미엄 콘텐츠
날짜
2025.07.15
강연자/작성자
올바른 미국주식 by SAPIENS
분석 주제
미지정
자료 길이
본문 18,597자
1

문서 전체 조망

핵심 구조

CUDA·설치기반·시스템 경쟁으로 읽는 엔비디아 AI 사이클

이 글은 엔비디아의 경쟁력을 GPU 한 장이 아니라 CUDA 소프트웨어, 대규모 설치기반, 네트워킹과 서버를 묶은 시스템으로 설명한다. Blackwell의 효율과 추론 컴퓨팅 수요가 이 구조를 더 중요하게 만든다는 것이 글의 핵심 문제의식이다.

CUDA 개발자와 라이브러리가 가속컴퓨팅의 출발점이다

2024년 10월 CUDA 개발자 수가 550만 명에 도달했고, 엔비디아는 산업별 알고리즘을 GPU에서 실행할 수 있게 하는 400개 이상의 라이브러리를 축적했다. 이 축적 구조는 새 사용사례와 시장을 여는 기반으로 제시된다.

호환성과 전환 비용이 CUDA의 나선효과를 만든다

기존 코드·프레임워크·개발자 풀이 CUDA에 맞춰져 있어 다른 플랫폼으로 옮기려면 호환성 검증과 추가 최적화가 필요한 전환 비용 구조다. hipify-perl로 평균 50%를 전환할 수 있어도 나머지는 개발자가 맞춰야 한다.

GPU 수요는 훈련과 추론 모두에서 계속된다는 해석이다

모델은 한 번 훈련하고 끝나는 것이 아니라 새 모델 실험, 최신 데이터 반영, 작업별 업데이트를 반복한다. 특화 ASIC은 잘 정해진 워크로드에서 효율적일 수 있지만, 변화가 빠른 단계에서는 GPU의 범용성이 유리하다는 인터뷰를 통해 수요가 이어지는 근거를 담았다.

추론도 설치기반과 소프트웨어 성능이 좌우한다

응답시간 자체보다 대규모 설치기반 위에서 소프트웨어를 돌리는 일이 추론의 더 어려운 문제라는 관점이며, 이 판단의 근거는 설치된 코드다. 소프트웨어를 추상화하거나 포크하면 최대 30~80% 성능 저하가 있을 수 있다는 코어위브의 설명도 함께 제시됐다.

AI 팩토리는 데이터에서 토큰을 생산하는 새 데이터센터라는 구상이다

AI 가속기 TAM은 기존 데이터센터 1조 달러와 AI 팩토리 1조 달러를 합친 2조 달러다. 기업·국가가 자체 AI를 구축하고 전력·기존 센터 개선이 병목이 되는 환경을 이 수요의 조건과 병목으로 둔다.

Blackwell은 칩이 아니라 서버·네트워크를 묶은 제품이다

GB200 NVL72는 Blackwell GPU, Grace CPU, NVLink와 스위치·NIC를 함께 묶으며, 비교상 추론 처리량·훈련속도·전력당 성능·데이터 처리량을 높인다. 더 적은 칩과 전력으로 같은 훈련을 끝낼 수 있다는 효율이 높은 가격을 정당화하는 근거이며 시스템 구조의 결론이다.

o1은 추론 시간에도 컴퓨팅을 늘리는 스케일링을 보여줬다

OpenAI o1은 추론에 더 많은 컴퓨팅을 할당해 성능을 높이는 방식을 보여줬다. 강화학습·합성데이터·큰 모델의 지식 증류가 훈련과 추론 수요를 함께 키울 수 있다는 전망으로 마무리한다.

ANALYSIS VIEW사건별 사실과 작성자의 판단, 지속 정보를 나누어 읽기
2
발생·예정 사건과 출처별 관점

이슈 분석

이 자료가 이슈의 어떤 사실을 다루고, 작성자가 무슨 결론을 어떤 근거로 내렸는지 원문에 붙여 읽습니다.

발생발표·발생 후발생일 24-10-8

24-10 엔비디아 투자자 프레젠테이션 공개

작성자의 핵심 판단

작성자는 이 자료를 바탕으로 엔비디아의 변화와 기존 논지를 현재 시점에 맞춰 다시 정리하려 한다.

근거 보기 1
  1. 원문 구간 1

    2024년 10월 8일에 엔비디아의 투자자 프레젠테이션Investor Presentation 자료가 올라왔습니다. 사람들이 알기 쉽도록 많은 것들이 업데이트됐습니다. 그동안 전해드렸던 트렌드들이 많이 담겨있었습니다. 차근차근 하나씩 다뤄보면서 달라진 부분들에 대한 생각들을 정리해보겠습니다. 이전에 전해드렸던 엔비디아에 대한 모든 것들을 다시 한 번 훑어보면서 현재 시점에 맞게 부분적으로 정리했습니다. CUDA는 빠질 수 없는 존재 CUDA 개발자 수는 이제 처음으로 550만명 도달 *2024년 10월 기준 CUDA 개발자 수가 550만명이 됐습니다. 2022년 11월 ChatGPT가 생성형AI 붐을 초래하고 나서 역대 가장 빠른 속도로 개발자들이 늘고 있다는 의미입니다. 기업들의 참여가 늘어서 그렇다고 생각합니다. 2024년과 2025년의 AI 수요 증분값은 대부분 Enterprise & Sovereign AI가 차지할 거라 생각했습니다.

이 자료에서 다룬 사실

2024년 10월 8일 엔비디아 투자자 프레젠테이션 자료가 올라왔고, 글은 그 자료에 기존에 다룬 트렌드와 업데이트가 담겼다고 적었다.

근거 보기 1
  1. 원문 구간 1

    2024년 10월 8일에 엔비디아의 투자자 프레젠테이션Investor Presentation 자료가 올라왔습니다. 사람들이 알기 쉽도록 많은 것들이 업데이트됐습니다. 그동안 전해드렸던 트렌드들이 많이 담겨있었습니다. 차근차근 하나씩 다뤄보면서 달라진 부분들에 대한 생각들을 정리해보겠습니다. 이전에 전해드렸던 엔비디아에 대한 모든 것들을 다시 한 번 훑어보면서 현재 시점에 맞게 부분적으로 정리했습니다. CUDA는 빠질 수 없는 존재 CUDA 개발자 수는 이제 처음으로 550만명 도달 *2024년 10월 기준 CUDA 개발자 수가 550만명이 됐습니다. 2022년 11월 ChatGPT가 생성형AI 붐을 초래하고 나서 역대 가장 빠른 속도로 개발자들이 늘고 있다는 의미입니다. 기업들의 참여가 늘어서 그렇다고 생각합니다. 2024년과 2025년의 AI 수요 증분값은 대부분 Enterprise & Sovereign AI가 차지할 거라 생각했습니다.

그렇게 판단한 이유

CUDA, 추론, Blackwell, AI 수요를 하나의 흐름으로 다룰 만큼 자료의 업데이트가 많았다고 설명했다.

근거 보기 2
  1. 원문 구간 1

    엔비디아 NVIDIA : 100조 달러의 산업을 바꿀 2조 달러의 데이터센터 시장 CUDA는 빠질 수 없는 존재 : CUDA 개발자 수는 이제 처음으로 550만명 도달 나선효과 : 왜 기업들은 CUDA에서 벗어나지 않을까? 추론에서도 "엔비디아" : 하드웨어는 쉽다, 현장에서는 Installed-base 싸움 엔비디아가 생각하는 TAM "$2T" : 새로운 산업혁명이 시작됐다. Data in, Token out Blackwell, Blackwell, Blackwell : 더 좋은 TCO, 더 높은 에너지효율, 더 우수한 ROI 새로운 스케일링 법칙 : OpenAI o1, 딸기가 일으킨 파급효과 엔비디아 NVIDIA 100조 달러의 산업을 바꿀 2조 달러의 데이터센터 시장 창립 25년, 엔비디아는 어디로 와서 어디로 가는가

  2. 원문 구간 2

    2024년 10월 8일에 엔비디아의 투자자 프레젠테이션Investor Presentation 자료가 올라왔습니다. 사람들이 알기 쉽도록 많은 것들이 업데이트됐습니다. 그동안 전해드렸던 트렌드들이 많이 담겨있었습니다. 차근차근 하나씩 다뤄보면서 달라진 부분들에 대한 생각들을 정리해보겠습니다. 이전에 전해드렸던 엔비디아에 대한 모든 것들을 다시 한 번 훑어보면서 현재 시점에 맞게 부분적으로 정리했습니다. CUDA는 빠질 수 없는 존재 CUDA 개발자 수는 이제 처음으로 550만명 도달 *2024년 10월 기준 CUDA 개발자 수가 550만명이 됐습니다. 2022년 11월 ChatGPT가 생성형AI 붐을 초래하고 나서 역대 가장 빠른 속도로 개발자들이 늘고 있다는 의미입니다. 기업들의 참여가 늘어서 그렇다고 생각합니다. 2024년과 2025년의 AI 수요 증분값은 대부분 Enterprise & Sovereign AI가 차지할 거라 생각했습니다.

발생발표·발생 후발생일 24-8-19

24-8 AMD의 ZT 시스템즈 인수 발표

작성자의 핵심 판단

작성자는 이 인수를 AI 가속기 경쟁이 서버·랙·데이터센터 단위로 넓어진 뒤의 늦은 행보로 평가한다.

근거 보기 1
  1. 원문 구간 1

    ​ 2024년 8월 19일, AMD가 $4.9B 규모로 ZT 시스템즈를 인수한다고 발표했었습니다. 콴타컴퓨터, 폭스콘, 인벤텍, 슈퍼마이크로 같은 서버제조기업을 인수한 것입니다. 꽤 늦은 행보입니다. 이미 AI 가속기 경쟁은 단일 칩 수준을 넘어서 칩과 칩을 고속연결하는 네트워킹의 경쟁, ㄴ) 수천~수만 개의 칩을 하나의 칩처럼 다루는 소프트웨어 플랫폼 단위의 경쟁으로 넘어온지 오래이기 때문입니다. 이에 대해 하나씩 정리해볼까 합니다. ​ TCO 대비 퍼포먼스를 엄청나게 끌어올린 Blackwell Hopper → Blackwell에서 엔비디아가 강조하는 것은 총 4가지입니다. 이번에는 서버 단위인 HGX H100 대비 GB200 NVL72의 성능이 얼마나 좋은지를 기준으로 비교했는데요.

이 자료에서 다룬 사실

AMD가 2024년 8월 19일 49억 달러 규모로 ZT 시스템즈 인수를 발표했다고 적었다.

근거 보기 1
  1. 원문 구간 1

    ​ 2024년 8월 19일, AMD가 $4.9B 규모로 ZT 시스템즈를 인수한다고 발표했었습니다. 콴타컴퓨터, 폭스콘, 인벤텍, 슈퍼마이크로 같은 서버제조기업을 인수한 것입니다. 꽤 늦은 행보입니다. 이미 AI 가속기 경쟁은 단일 칩 수준을 넘어서 칩과 칩을 고속연결하는 네트워킹의 경쟁, ㄴ) 수천~수만 개의 칩을 하나의 칩처럼 다루는 소프트웨어 플랫폼 단위의 경쟁으로 넘어온지 오래이기 때문입니다. 이에 대해 하나씩 정리해볼까 합니다. ​ TCO 대비 퍼포먼스를 엄청나게 끌어올린 Blackwell Hopper → Blackwell에서 엔비디아가 강조하는 것은 총 4가지입니다. 이번에는 서버 단위인 HGX H100 대비 GB200 NVL72의 성능이 얼마나 좋은지를 기준으로 비교했는데요.

그렇게 판단한 이유

엔비디아가 GPU와 서버·네트워킹을 함께 최적화해 온 뒤라는 점과, AI 가속기 수요가 기업용으로 이동한다는 맥락을 들었다.

근거 보기 2
  1. 원문 구간 1

    ​ 자율주행에서도 핵심은 주변의 데이터를 해석하고, 해석한 값을 토대로 최적경로를 계획하는 것이었습니다. 센서나 조향 및 가감속은 상대적으로 데이터를 해석하고 계획하는 분야에 비해 쉽습니다. Blackwell, Blackwell, Blackwell 더 좋은 TCO, 더 높은 에너지효율, 더 우수한 ROI Blackwell은 거대한 플랫폼 외부에서 볼 때는 칩의 가격 혹은 서버의 가격을 보고 비싸다고 하지만, 실제 엔비디아의 고객사인 기업들은 Blackwell을 구매하여 가동하는 5년 동안 어느 만큼의 컴퓨팅을 낼 수 있을 것인가를 놓고 비교합니다. 들인 비용에 비해서 실제 얻을 수 있는 컴퓨팅의 양을 비교하는 것이 총소유비용 TCO, Total Cost of Ownership 관점입니다.

  2. 원문 구간 2

    ​ 2024년 8월 19일, AMD가 $4.9B 규모로 ZT 시스템즈를 인수한다고 발표했었습니다. 콴타컴퓨터, 폭스콘, 인벤텍, 슈퍼마이크로 같은 서버제조기업을 인수한 것입니다. 꽤 늦은 행보입니다. 이미 AI 가속기 경쟁은 단일 칩 수준을 넘어서 칩과 칩을 고속연결하는 네트워킹의 경쟁, ㄴ) 수천~수만 개의 칩을 하나의 칩처럼 다루는 소프트웨어 플랫폼 단위의 경쟁으로 넘어온지 오래이기 때문입니다. 이에 대해 하나씩 정리해볼까 합니다. ​ TCO 대비 퍼포먼스를 엄청나게 끌어올린 Blackwell Hopper → Blackwell에서 엔비디아가 강조하는 것은 총 4가지입니다. 이번에는 서버 단위인 HGX H100 대비 GB200 NVL72의 성능이 얼마나 좋은지를 기준으로 비교했는데요.

3
사실·구조, 해석·전망, 시점 관찰, 판단 방법

지식·관점

사건 밖에서도 다시 참고하거나 다른 자료와 비교할 가치가 있는 내용을 대상과 반복 가능한 논점으로 묶습니다.

사실·구조CUDA 생태계주 대상 · 기업·종목 · 엔비디아관련 대상 · 기술·제품 · CUDA

CUDA 개발자·라이브러리 축적은 엔비디아의 가속컴퓨팅 경쟁력에 어떻게 작용하는가?

이 자료가 더한 내용

CUDA 개발자가 2024년 10월 550만 명에 이르렀고, 산업별 알고리즘을 가속기 방식으로 바꾸는 400개 이상의 라이브러리를 축적했다는 구조를 제시한다.

근거 보기 4
  1. 원문 구간 1

    NVIDIA CUDA 2006년 2018년 11월 2020년 8월 2021년 11월 2023년 5월 2024년 2월 2024년 10월 개발자 규모 런칭 100만명 200만명 300만명 400만명 500만명 550만명 걸린시간 - 13년 21개월 15개월 18개월 21개월 16개월 연율화 CUDA 개발자 커뮤니티 확장속도 Up CUDA는 엔비디아의 해자이기도 하지만, 가속컴퓨팅과 AI을 가능케 만든 근본적인 배경이기도 합니다. CPU를 사용하기 위해 C언어를 익혔듯이 GPU를 사용하기 위해 CUDA가 쓰였기 때문입니다. 가속컴퓨팅이 가능하려면 소프트웨어를 다시 GPU에 맞게 뜯어고쳐야 가능합니다.

  2. 원문 구간 2

    CPU/시퀀싱 기반의 알고리즘 프로세싱을 병렬로 바꾸기 위한 과정에서 CUDA는 엔비디아를 설명할 때, AI를 설명할 때 빠질 수 없는 존재입니다. ​ *새로운 CUDA 라이브러리는 새로운 알고리즘 사용사례를 개척하는 일을 뜻합니다. ​ 새로운 CUDA 라이브러리 = 새로운 시장 개척 소프트웨어를 가속시킴에 있어서, 소프트웨어 내부에는 각각의 고유한 알고리즘이 있습니다. 일반적으로 CPU로 소프트웨어를 실행시킨다 하면 소프트웨어 속 코드의 5~10%정도가 런타임의 99.999%를 차지합니다. 일정 알고리즘을 엄청나게 잘 가속시키는 프로세서를 만든다면 이론적으로 몇 백배까지도 애플리케이션 실행속도를 높일 수 있게 되는 이유입니다. ​ 그리고 이런 모든 것들을 로우레벨에서 코딩하기란 사실상 매우 어렵기 때문에 편의상 엔비디아는 CUDA 라이브러리를 만들었습니다.

  3. 원문 구간 3

    제각기 다른 모든 라이브러리는 아까 말씀드린 소프트웨어/애플리케이션에서 실행되는 알고리즘을 가져와서 가속기가 실행할 수 있는 방식으로 알고리즘을 리팩토링refactor thos algorithms 하기 위해 쓰입니다. ​ CUDA 라이브러리를 다루기 위해서 엔비디아는 하드웨어에 최적화시키기 위한 연구를 하고, 생태계를 개발해야 했습니다. 모든 사람들을 설득해가며 사용하도록 만들어야 했고, 어떤 종류의 컴퓨터에서 실행하고 싶은지, 어떤 워크로드를 가속시키고 싶은지를 정말 끊임없이 묻고 피드백 받아가며 수정했습니다. 산업도, 업종도, 사용사례도, 컴퓨터도 모두 다른 것들이었지만 한 도메인에서 잘 안착시킨 후 다른 도메인으로 계속해서 확장한 역사입니다. ​ 엔비디아가 정말 잘하는 것은 이렇게 기업들과 협력하며 새로운 시장을 만드는 것입니다.

  4. 원문 구간 4

    너무나 오랫동안 그렇게 일해왔기 때문에 엔비디아의 가속컴퓨팅이 어디에나 있는 것처럼 보이지만, 실제로는 한 번에 하나씩, 한 번에 한 산업을 위한 라이브러리씩 만들어온 역사입니다. 그렇게 엔비디아는 400개가 넘는 CUDA 라이브러리를 갖게 됐습니다. 나선효과 왜 기업들은 CUDA에서 벗어나지 않을까? CUDA 플랫폼이 이끄는 나선효과spiral 학부생때부터 CUDA를 기반으로 배우기 때문에 현실에서 이들이 한 번에 다른 플랫폼으로 옮겨가기란 매우 힘듭니다. 현실에서 생각해볼 가장 큰 문제는 '호환성'입니다. 풀스택으로 혼자 코드를 쓰고 프레임워크, 로우레벨 API까지 사용할 줄 아는 프로그래머는 적기 때문에, 실제로 개발자들은 타인의 코드를 구글링해서 쓰는 경우가 대부분입니다. 이 경우 예를 들어 일정코드를 AMD 기반으로 썼다고 해도, 타인 코드 중 어떤 무언가가 PyTorch의 최신버전을 지원하지 않거나, TensorFlow와 호환되지 않거나, 알고보니 CUDA 기반으로 넣어진 코드였다거나 하면 전체 코드를 쓰지 못하게 됩니다.

사실·구조AI 개발 플랫폼 전환주 대상 · 기술·제품 · CUDA관련 대상 · 산업·업종 · AI 가속기

CUDA에서 다른 플랫폼으로 옮기는 데 어떤 호환성과 비용 문제가 있는가?

이 자료가 더한 내용

기존 코드·프레임워크의 호환성과 업데이트 부담 때문에 다른 칩으로의 전환이 어렵고, hipify-perl은 평균 CUDA 워크로드의 50% 전환만 가능해 나머지에는 커스텀 작업이 필요하다고 설명한다.

근거 보기 3
  1. 원문 구간 1

    ​ CUDA는 소프트웨어 업그레이드를 통해 워크로드를 하드웨어 개별 칩에 최적화하는 방식으로 성능이 올리고 있습니다. 더 많은 가속성능을 제시할 수록 타 칩으로 옮길 때의 진입장벽이 커지는 구조입니다. 에릭 슈미트가 말한 것처럼, AI 연구는 6개월마다 업계 전망을 다시 말해야 할 정도로 빠르게 흘러가고 있기에 다양한 하드웨어, 다양한 플랫폼에 특화할 여유나 비용이 없습니다. 대부분의 코드는 엔비디아 GPU에만 최적화 되어 있고, 엔비디아를 따라잡기 위해서 경쟁자는 지난 10년 동안의 소프트웨어를 최적화시켜야 하므로 엔비디아가 꾸준한 해자를 가져갑니다. ​ 기업 입장에서 생각해봐야 할 것들 기업들의 입장에서도 만약 다른 칩을 쓰려고 한다면 호환성을 유지하기 위해 같은 칩에 5년 넘게 투자해야 하고, 개발자에게 CUDA와 같은 수준의 시간과 노력을 들여 ROCm을 다루도록 준비시켜야 하고, 개발도 두 세 갈래로 호환되게 시켜야 합니다.

  2. 원문 구간 2

    개발하고나서 업그레이드 및 업데이트도 꾸준히 이어집니다. AI 업계에서 5년은 매우 긴 시간입니다. ​ 물론 CUDA를 AMD 플랫폼에서도 실행할 수 있게 바꾸는 도구들도 있습니다. 'hipify-perl'입니다. 그러나 완전하게 가동될 수 있도록 옮겨오려면 그리고 동일한 성능을 내려면 추가적인 커스텀 작업들이 필요합니다. 평균적으로 CUDA 워크로드의 50%는 hipify-perl을 통해 전환이 가능합니다. 나머지 50%는 개발자들이 붙어서 커스텀해줘야 합니다. 50대 50정도입니다. 50%를 전문가 집단이 계속해서 최적화시켜줘야 합니다. 이에 대한 비용, 시간, 따로 CUDA-ROCm로 옮기느라 핵심 사업에 쓸 유능한 개발자를 낭비하는 것을 함께 생각해봐야 할 문제입니다. hipify-perl은 엔비디아 GPU에 접근할 수 없을 때 유용한 옵션입니다.

  3. 원문 구간 3

    ​ 기업 입장에서 가장 안전한 베팅은 다른 모든 사람들이 쓰는 칩에서 개발하는 것입니다. 99%의 새로운 모델과 AI 알고리즘 혁신은 엔비디아 칩 위에서 발생하고 있습니다. ​ 훈련엔 끝이 없다. 마치 사람처럼 업계 전문가 인터뷰 중 전직 메타 컴퓨팅 인프라 Director의 코멘트를 통해 메타가 엄청난 GPU를 구매하는 이유를 설명해드린 바 있습니다. 이에 대해서는 원문을 한 번 정리해드리겠습니다. ​ 메타 컴퓨팅 인프라 Director (전직) "추론에도 상당한 컴퓨팅 능력이 필요하지만 실시간으로 결정만 내리는 것이기 때문에 생각만큼 비용이 많이 들진 않을 수 있습니다. 훈련에 비용이 많이 들어가는 이유가 몇 가지 있습니다. ​첫 번째는 아무도 처음에 제대로 된 모델을 얻지 못합니다. 초기 투자의 상당부분은 어떤 모델을 사용하면 더 나은지를 알아내기 위해서 새로운 모델을 실험하고 훈련시키는 작업들입니다."

사실·구조GPU와 ASIC주 대상 · 산업·업종 · AI 가속기

훈련·추론 워크로드에서 GPU와 ASIC은 어떻게 다른 역할을 하는가?

이 자료가 더한 내용

새 모델을 시험하고 훈련하는 단계에는 범용 GPU가 적합하고, 모델이 다듬어진 뒤에는 ASIC이 효율적일 수 있으나 변화가 생기면 다시 GPU가 필요하다는 전직 메타 인프라 책임자 발언을 소개한다.

근거 보기 3
  1. 원문 구간 1

    "훈련은 멈추지 않습니다. 엄청나게 많은 다른 모델을 끊임없이 시도해봐야 합니다. 소수의 사람들이 지금보다 더 나은 모델을 연구하기 위해 컴퓨팅을 사용합니다. 엄청난 이유 중 하나입니다. 이들에게 충분한 GPU를 할당해줄만큼의 자금이 필요합니다. AI의 성능과 효율을 좋게하려 할 수록 많은 돈을 필요로 합니다." "각각의 작업들(검색, 광고, 콘텐츠 추천 알고리즘 등)에 가장 적합한 모델을 찾았을 때에도 계속 업데이트 해줘야 합니다. AI는 발전이 빠르기 때문에 특정 작업에 가장 좋은 모델이 조금씩 바뀝니다. 그에 맞춰서 업데이트 해야 해요. 계속 새로운 데이터를 넣어줘야 성능이 좋아집니다. 이 모든 것들은 지속적으로 업데이트되고 수정돼야 합니다. 더 성능이 좋아지려면 최신의 정보, 이전에 뽑았던 양질의 정보를 한 번에 넣고 끊임없이 '새롭게' 모델을 만들어야 합니다.

  2. 원문 구간 2

    한 번 모델을 만들고 그걸로 계속 쓰는 게 아닙니다." ​ 사회자 "그리고 마지막 질문은 GPU가 명백히 가장 범용적인 솔루션인 거 같다는 건데요. 메타가 ASIC 작업을 하고 있다는 걸 듣고 있는데, 메타는 5~10개의 대규모 메인 AI 워크로드를 보유하고 있으니 ASIC를 쓸 수 있지만 다른 ASIC은 어디에 쓰이나요? 비용은 저렴하지만 전체 워크로드의 유연성은 낮으니까요. 엔비디아와 AMD랑 같이 생각해보면 ASIC과 GPU의 관계를 어떻게 생각하면 될까요." ​ 메타 컴퓨팅 인프라 Director (전직) "GPU는 가장 범용적인 솔루션이기에 많이 보셨을 겁니다. 새로운 걸 시도하고 새로운 걸 훈련시킬 수 있는 가장 적합한 솔루션입니다. 모델을 점점 다듬을 수록 ASIC이 효율적입니다. 그래도 ASIC을 어느정도 선까지 업데이트 시킬 수는 있어도 경직된 솔루션이기 때문에 이동하려면 다시 GPU가 필요합니다."

  3. 원문 구간 3

    "새로운 것들을 만들 때마다 '이거 잘 될 거 같다 ASIC으로 설계하자' 이렇게 구상하는 게 아닙니다. 최종적으로 잘 뽑힌 워크로드지만 어떻게 될지 모를 때에는 GPU를 사용하는 게 더 합리적이에요. 이건 CPU 기반의 ASIC도 마찬가지입니다. ASIC 자체는 새로운 건 아닙니다. 특정 목적에 특화시키는 거죠. 모든 네트워킹 장비들은 패킷을 더 빠르게 이동시키기 위해 ASIC을 쓰고 있습니다." "AI에 대한 파이가 점점 더 커지면, ASIC도 더 큰 파이를 가질 겁니다. 다만 AI의 발전속도가 워낙 빠르기 때문에 당분간은 엔비디아에게 엄청난 업사이드가 있을 겁니다. AMD도 마찬가지로요. GPU냐 ASIC이냐는 관점보다는 AI에 대한 수요가 워낙 높고 성장이 가파르기 때문에 누구도 잃지 않을 가능성(= GPU 산업도 성장하고, ASIC 산업도 성장할 가능성이 높다는 의미)이 매우 높습니다."

해석·전망AI 추론주 대상 · 기업·종목 · 엔비디아관련 대상 · 산업·업종 · AI 추론

추론 경쟁에서 설치기반과 소프트웨어는 왜 중요한가?

이 자료가 더한 내용

글은 추론의 핵심 난제가 대규모 설치기반 위에서 소프트웨어를 구동하는 일이며, CUDA 코드베이스와 데이터센터·온프레미스·엣지의 동일 아키텍처가 해자로 작용한다고 해석한다.

근거 보기 3
  1. 원문 구간 1

    추론에서도 "엔비디아" 하드웨어는 쉽다, 현장에서는 Installed-base 싸움 추론시대에도 엔비디아/CUDA의 해자는 계속된다 추론도 설치기반Installed-Base에 따라 엔비디아가 해자를 그대로 가져갑니다. 젠슨황 CEO는 사람들이 훈련용은 너무 어렵다는 걸 알았기 때문에 칩 메이커들이 '우리는 훈련용이 아니라 추론용으로 개발했어요.'라고 말하는 경우가 많다고 말합니다. 직관에 반하는 내용이지만, 현실적으로 추론이 더 어려운 문제이기도 합니다. 추론의 응답시간을 빠르게 하는 건 매우 쉬운 부분입니다. 추론의 어려운 부분은 대규모 설치기반에 소프트웨어를 얹어야 좋다는 것입니다. 추론은 설치기반의 문제입니다. ​ 엔비디아 CUDA 생태계 내 참여자가 많고 이미 코딩베이스가 다 CUDA 기반이며 개발자도 많기 때문에 쉽게 바꾸기 어렵고 해자로 작용하고 있는 셈입니다.

  2. 원문 구간 2

    아이폰 앱을 판매하기 위해 앱스토어에서 애플이 만든 코드로 개발하는 것과도 비슷합니다. 엔비디아 가속컴퓨팅은 데이터센터부터 온프레미스, 엣지까지 모든 곳에 있는 곳에서 사용할 수 있는 유일한 플랫폼입니다. 온프레미스에서 클라우드에 이르기까지 모든 클라우드에서 동일한 아키텍처를 사용하고, 클라우드에서 구축하거나, 자체 슈퍼컴퓨터에서 구축하든, 자동차나 로봇, PC에서 실행하든 모든 소프트웨어를 실행하는 동일한 아키텍처가 중요합니다. 설치기반이 이를 받치고 있습니다. ​ 더 나아가서 2~3년 뒤를 생각하며, 젠슨황 CEO가 계속해서 강조하는 것은 연산력이 지금보다 훨씬 더 좋아지면 엔비디아 칩에서 ​​학습과 추론이 동시에 한 칩에서 벌어지기 시작할 것이란 점입니다. 컴퓨터가 비디오를 보고, 새로운 텍스트를 보면서 상호작용하면서 스스로 즉각 즉각 학습하기 시작할 수 있다는 내용인데, AI의 훈련~추론~배포~어플리케이션까지 하나로 통합되는 구조입니다.

  3. 원문 구간 3

    소프트웨어를 추상화Software Abstraction하거나 포크forks할 경우 최대 30~80%까지 추론 성능이 떨어지는 만큼 굳이 그럴 이유가 없다는 입장이죠. ​ 젠슨황 CEO의 전망과도 일치했습니다. 엔비디아가 생각하는 TAM "$2T" 새로운 산업혁명이 시작됐다. Data in, Token out *"클릭 후 더블클릭"하시면 크게 보실 수 있습니다. ​ *왼쪽 : 엔비디아가 생각하는 AI 가속기 TAM은 $2T입니다. 데이터센터 $1T + AI Factories $1T입니다. *중앙 : AI Factories는 데이터를 넣으면(input), 토큰이 나오는(output)식의 지능에 대한 산업혁명을 이룹니다. *오른쪽 : 각 지역, 국가에서 소버린 AI 클라우드 구축 경쟁입니다.

해석·전망AI 팩토리주 대상 · 산업·업종 · AI 인프라관련 대상 · 기업·종목 · 엔비디아

AI 팩토리는 데이터센터 수요를 어떻게 정의하는가?

이 자료가 더한 내용

엔비디아의 AI 가속기 TAM을 데이터센터 1조 달러와 AI 팩토리 1조 달러로 나누고, 데이터를 넣어 토큰 형태의 지능을 생산하는 새 데이터센터라는 설명을 제시한다.

근거 보기 3
  1. 원문 구간 1

    자신만의 AI를 구축하는 중입니다. ​ 데이터센터 $1T + AI Factories $1T 기존의 가속컴퓨팅 전환수요를 넘어서 새로운 데이터센터 유형인 AI 팩토리AI Factories가 깔리고 있습니다. 정확히 보자면 AI 팩토리는 엔터프라이즈 AI와도 비슷합니다. ​ 기업들이 자신의 데이터Data를 AI 모델에 넣어서 자신만의 AI 모델을 훈련시키고 나면, 해당 엔터프라이즈 AI 모델이 이미지, 차트, 그래프, 노래, 단어, 음성, 영상, 화합물, 단백질, 유전체, 시뮬레이션, 물리법칙 등 다양한 것을 생성합니다. 차량을 운전하는 방법, 로봇을 가동시키는 방법까지 다양한 것을 토큰Token을 통해 다룰 수 있게 됩니다. ​ 젠슨황은 이를 "AI 산업혁명"이라고 부르고 있습니다.

  2. 원문 구간 2

    원자재인 데이터를 넣으면, 지능이 토큰 형태로 나오기 때문입니다. 모든 회사가 디지털 지능을 갖게 됩니다. 디지털 간호사, 강사, 고객서비스, 에이전트, 칩 설계자, 공장에서의 로봇, 자율주행차, 기상예측 에이전트 등 다양한 사용사례로 널리 적용될 수 있습니다. 니콜라 테슬라가 교류발전기를 통해 전력을 생산해 세상을 바꿨던 것처럼, 엔비디아는 AI 팩토리이자 AI를 만드는 데이터센터를 통해 토큰을 생산해 세상을 바꾸겠다는 것입니다. ​ 컴퓨터 입장에선 책을 읽게 하고 그 안에서 한 단어의 뜻을 묻는 것과, 유전자 염기서열을 데이터로 넣고 해당 유전자의 의미를 묻는 것과, 자율주행 비디오를 데이터로 넣고 상황에 대한 맥락을 이해하는 것이 크게 다르지 않습니다. 생성형AI와 LLM 혁신의 핵심은 "컴퓨터를 사용하여 패턴이 아닌 의미를 이해하는 방법을 익히기 시작한 것"입니다.

  3. 원문 구간 3

    ​ 자율주행에서도 핵심은 주변의 데이터를 해석하고, 해석한 값을 토대로 최적경로를 계획하는 것이었습니다. 센서나 조향 및 가감속은 상대적으로 데이터를 해석하고 계획하는 분야에 비해 쉽습니다. Blackwell, Blackwell, Blackwell 더 좋은 TCO, 더 높은 에너지효율, 더 우수한 ROI Blackwell은 거대한 플랫폼 외부에서 볼 때는 칩의 가격 혹은 서버의 가격을 보고 비싸다고 하지만, 실제 엔비디아의 고객사인 기업들은 Blackwell을 구매하여 가동하는 5년 동안 어느 만큼의 컴퓨팅을 낼 수 있을 것인가를 놓고 비교합니다. 들인 비용에 비해서 실제 얻을 수 있는 컴퓨팅의 양을 비교하는 것이 총소유비용 TCO, Total Cost of Ownership 관점입니다.

사실·구조Blackwell 시스템주 대상 · 기술·제품 · NVIDIA Blackwell관련 대상 · 기업·종목 · 엔비디아

Blackwell과 GB200 NVL72의 성능·비용·전력 조건은 무엇인가?

이 자료가 더한 내용

GB200 NVL72는 추론 처리량, 훈련속도, 전력당 성능, 데이터 처리량 비교를 제시하고, H100 대비 B200 가격·냉각·서버 구성 및 GPT-4 훈련의 칩·전력 절감 사례를 함께 설명한다.

근거 보기 6
  1. 원문 구간 1

    ⓐ첫 번째는 추론능력Inference 비교입니다. GPT-4 기준 실시간 LLM Throughput시간당 토큰 출력량을 최대 30배 끌어올렸습니다. ⓑ두 번째는 훈련능력Training 비교입니다. FP8 기준으로 훈련속도를 4배 더 빠르게 끝낼 수 있게 됐습니다. ⓒ세 번째는 에너지 효율Energy Efficiency도 비교입니다. 공기냉각식에 비해서 더 효율적으로 냉각할 수 있기 때문에 액체냉각을 기본으로 하는 GB200 NVL72는 동일전력 기준 25배 더 높은 성능을 내고 있습니다. ⓓ네 번째는 데이터 처리량Database Join Query 비교입니다. HBM 대역폭을 키우고 NVLink 대역폭900GB/s → 1800GB/s도 크게 키웠기 때문에 데이터를 처리하고 분석하는 속도를 크게 키웠습니다.

  2. 원문 구간 2

    ​ B200은 H100/H200에 비해 성능을 올리면서도 가격은 $30~40K로 책정해서 경쟁사 AMD의 성능향상분을 제한하는 효과를 누리고 있습니다. AMD는 H100 80GB와 경쟁하기 위해 MI300X의 HBM 콘텐츠를 192GB로 출시했었습니다. 그러다보니 AMD는 엔비디아보다 더 높은 생산비용으로 제품을 생산하고 있었습니다. 애널리스트들이 AMD MI300X이 전사 마진율을 낮추는 게 아니냐고 초반에 우려했던 이유입니다. 생산비용은 추정하기로 H100 $3,320 vs MI300X $7,000정도입니다. H100 당시 GPM 기준 엔비디아가 87~89%를 가져가는 것과 달리 AMD는 부족한 성능을 비용상승분으로 극복했기에 마진율을 전사보다 약간 높은 50% 초반대로 유지했었습니다.

  3. 원문 구간 3

    ​ 엔비디아는 Blackwell로 넘어오면서 가격을 생각보다 많이 높이지 않았습니다. B200 생산단가는 H100보다 2배가 늘었기에 $6K 정도가 됐지만, 이제부터 AMD가 기술격차를 비용으로 커버하려면 전사마진율 50%는 최소한 넘기는 한에서 성능을 올려야 하기 때문에 하드웨어적으로는 상당히 많은 옵션들이 제한됐습니다. AMD도 나름 계획이 있을 거라 생각하지만 2025년에 출시될 MI400의 입장이 어렵습니다. ​ 가장 우수한 제품, GB200 NVL72 엔비디아는 칩 단가를 많이 높이지 않은 대신 '서버' 자체를 하나의 GPU처럼 제품화했습니다. 엔비디아 입장에서는 NVLink, NVSwitch, InfiniBand 등 네트워킹 제품이 칩만큼이나 마진율이 높기에 가능한 일입니다.

  4. 원문 구간 4

    제품적으로 GB200 NVL72에 힘을 주기도 했습니다. ​ 현재 블랙웰 GPU는 메인 제품버전으로 보면 총 3개입니다. ⓐB100 700W 공냉식(HGX로 판매) ⓑB200 1000W 공냉식(DGX B200) ⓒGB200 1200W 액체냉각식(GB200 NVL72)입니다. GB200은 B200 GPU 2개와 Grace CPU 1개가 들어갑니다. 그러나 GB200 열설계전력은 2300W(B100 1000W *2 + Grace 300W * 1)이 아닌 2700W(B200 1200W *2 + Grace 300W *1)입니다. 공기냉각식으로 쓸 때는 1000W, 액체냉각식으로는 1200W로 세팅했습니다. 액체냉각 제품을 쓰면 비싸지지만 성능을 더 높게 내면서 운영비용도 줄일 수 있는 구조로 처음부터 설계했습니다.

  5. 원문 구간 5

    ​ 따라서 상대적으로 냉각효율이 좋은 액체냉각 솔루션Direct-to-Chip인 GB200 NVL72로 구매할 경우 ㄱ) B200의 성능을 더 끌어올리지만 ㄴ) 냉각을 바꾼 만큼 냉각에 쓰이는 에너지효율이 세이브되므로 성능증가분 대비 비용증가분으로 생각할 때 경쟁력 있으며 ㄷ) 모듈식으로 GB200 NVL72을 구성한 것도 데이터센터 운영자들 입장에서는 좋은 부분이었습니다. 운영자는 서버를 구축하는데 드는 시간과 확장가능성도 중요하기 때문입니다. ​ *왼쪽 : GPU 단위 경쟁을 넘고, 서버 단위 경쟁을 넘어, 이젠 GB200 NVL72부터 데이터센터 단위 경쟁을 겪고 있습니다. *중앙 : 엔비디아의 NVLink는 새로운 기준이 됐습니다. *오른쪽 : 2년마다 새로운 세대의 칩이 나오는 시대에서, 2Q23부터는 1년마다 칩이 나오는 시대로 바뀌었습니다.

  6. 원문 구간 6

    4배 더 적은 칩, 3.75배 더 적은 전력사용량으로 GPT-4를 훈련시킬 수 있게 바뀐 것입니다. 칩당 가격은 60~70% 높아졌지만 성능이 평균 3~4배씩 좋아졌기 때문에 고객 입장에서는 구축해야 할 컴퓨팅 규모가 같다는 전제 하에 GB200 NVL72를 더 많이 빨리 가동할 수록 돈을 버는절약하는 구조가 되어 있습니다. ​ 또한 데이터센터 내에 AI 가속기가 감당 가능할 수준의 전력캐파가 부족하고, 끌어다 쓸 전력이 부족하다는 말이 나오는 상황에서 기업 입장으로는 비싸더라도 가장 성능이 뛰어난 GPU를 구매하게 됩니다. 가장 성능이 뛰어날 수록 가장 TCO도 좋고, 가장 에너지 효율도 좋으며, 가장 ROI도 높다는 의미이므로 모두가 Blackwell을 가장 많이 가장 먼저 받고싶어 합니다.

사실·구조추론 소프트웨어 최적화주 대상 · 기술·제품 · NVIDIA H100·H200

하드웨어 출시 뒤 소프트웨어 최적화는 추론 성능에 어떻게 작용하는가?

이 자료가 더한 내용

MLPerf 비교에서 H100의 Llama 2-70B 처리량과 H200의 Llama 3.1-405B 토큰 생성 속도가 소프트웨어 업데이트 뒤 개선됐다는 사례를 들어, 하드웨어 이후에도 성능이 높아진다고 설명한다.

근거 보기 2
  1. 원문 구간 1

    흥미로운 것들이 많습니다. ​ *왼쪽 : Llama 2-70B Throughput 퍼포먼스는 2023년 10월에 비해 2개월 사이 1.5배, 4개월 사이 2.5배 좋아졌습니다. *오른쪽 : Llama 3.1-405B 초당 토큰 생성속도는 2024년 7월에 비해 1개월 사이 1.30~1.35배 가까이 좋아졌습니다. ​ 왼쪽의 MLPerf v4.0를 보시면 엔비디아 H100의 추론성능은 2023년 10월에 비해 Llama 2-70B 모델 기준 Throuput 퍼포먼스가 2개월만에 1.6배로 좋아졌고, 4개월만에 2.5배 좋아졌습니다. Throughput은 H100 서버로 시간당 얼마나 많은 토큰을 생산할 수 있느냐입니다.

  2. 원문 구간 2

    엔비디아가 기업들의 LLM API 추론비용을 줄이는 데 크게 기여하고 있다는 의미입니다. 오른쪽의 MLPerf v4.1 자료를 보시면 엔비디아 H200의 추론성능은 2024년 7월에 비해 Llama 3.1-405B 모델 기준 초당 토큰 생성속도가 1개월만에 1.30~1.35배 좋아졌습니다. 모델이 얼마나 빠르게 텍스트를 생성할 수 있는지를 측정하는 지표입니다. 챗봇이나 음성인식 시스템에서 더 빠르게 답을 내거나 텍스트 처리 시간이 줄어들기 때문에 데이터 분석이나 번역작업들도 더 빠르게 완료할 수 있습니다. ​ Hopper → Blackwell : 4배 더 적은 칩, 3.75배 더 적은 전력사용량 GPT-4를 한 번 훈련하는데 있어서 H100으로는 8,000개의 GPU, 15MW 전력규모가 필요했지만, GB200 NVL72로는 2,000개의 GPU(NVL72 28개)와 4MW로 훈련을 끝낼 수 있습니다.

해석·전망추론 컴퓨팅 스케일링주 대상 · 기술·제품 · AI 모델관련 대상 · 산업·업종 · AI 인프라

OpenAI o1과 강화학습은 컴퓨팅 수요를 어떻게 다시 해석하게 하는가?

이 자료가 더한 내용

글은 o1이 생각·추론 시간에 더 많은 컴퓨팅을 할당해 성능을 높이는 흐름을 보여줬고, 강화학습·합성데이터·지식 증류가 큰 모델의 컴퓨팅 수요와 연결된다고 해석한다.

근거 보기 8
  1. 원문 구간 1

    이런 흐름은 GB300 NVL72, VR200 NVL144, VR300 NVL288의 흐름에서도 이어질 것입니다. 새로운 스케일링 법칙 OpenAI o1, 딸기가 일으킨 파급효과 스트로베리🍓가 추론계의 스케일링 법칙을 열었다 엔비디아가 투자자 프레젠테이션에 OpenAI o1이 추론컴퓨팅의 스케일링 법칙 시대를 열었다고 말했습니다. 훈련컴퓨팅의 스케일링 법칙만 계속되던 시대였는데 이제는 추론컴퓨팅도 생각하는 시간/추론하는 시간을 늘리는 방식으로 스케일링 법칙이 생겼단 것입니다. ​ 이 배경을 보시면, 오픈AI가 코드명 스트로베리Strawberry🍓로 불리던 OpenAI o1를 출시하며 시작됐습니다.

  2. 원문 구간 2

    아직 프리뷰 버전이고 정식버전이 아니지만 확실히 추론에 더 많은 컴퓨팅을 할당함으로써 좀 더 고차원적인 지능 영역이 열렸습니다. ​ 사람처럼 대답하기 전에 문제를 오랫동안 생각하도록 훈련된 첫 번째 제품이며, 이를 통해 더 좋은 답변을 내고 실수를 인식하는 방법을 배우는 중입니다. 그 결과 물리학, 화학, 생물학, 수학, 코딩 분야에서 박사급 지능을 내기 시작하고 있습니다. 국제수학올림피아드 예선문제에서 GPT-4o는 13%를 풀었으나 o1는 83%를 풀었습니다. 코딩 대회에서도 상위 11%의 성과 기록할 정도로 고차원의 생각이 가능해졌습니다. ​ *왼쪽 : 추론시간에 할당하는 컴퓨팅 시간을 늘렸더니 훨씬 더 우수한 지능의 답을 할 수 있게 됐음을 알린 Strawberry

  3. 원문 구간 3

    ​ 스트로베리가 대단한 점 첫 번째는 대규모 강화학습 알고리즘을 적용한 모델인데 추론/생각에 더 많은 컴퓨팅을 할당할 수록 지속적으로 성능이 좋아진다는 것을 발견한 게 매우 좋았습니다. 기존의 LLM pre-training에서 발생했던 종류의 제약과는 또 다른 것입니다. 이제 모두가 에릭 슈미트가 말했던 "최근 오픈AI는 $100B 클러스터 규모를 $300B로 키우고 싶어한다."의 의미를 이해할 수 있습니다. 더 많은 컴퓨팅의 효과를 이해할 수 있게 됐습니다. ​ 그리고 두 번째 포인트는 처음으로 인간과 동등하거나 인간을 넘긴 추론모델인 o1는 차세대 GPT인 코드명 "Orion"을 훈련시키는 데 이미 쓰이고 있다는 것입니다.

  4. 원문 구간 4

    AI 모델을 훈련시키기 위한 데이터셋은 상당부분이 AI를 통해 생성된 합성 데이터이기 때문에 훨씬 더 양질의 데이터셋을 얻을 수 있게 됐다는 의미입니다. 멀리 나아가 생각하자면 강화학습을 통해 AGI → ASI로 향하는길의 청신호입니다. ​ Q* 모델을 개발하기 시작했을 때가 2023년 말이었고 모델 개발과정에서 엔비디아 개발자와도 협력하기 때문에 두 CEO는 미리 이를 인터뷰에서 슬쩍슬쩍 언급하곤 합니다. ​ 'Reasoners'의 핵심은 2022년 Stanford의 STaR 논문 방법과 유사합니다. 자체학습하는 추론자Self-Taught Reasoner 모델로 개발하는 게 핵심입니다.

  5. 원문 구간 5

    일단 거대 데이터로 학습한 뒤 같은 작업을 반복하며 추론능력을 조금씩 향상시키는 방법인데요. 훈련한 뒤 추론하고 스스로 판단하여 정답에 가깝도록 이를 반복해가면서 AI가 인간 수준에 근접할 수 있다는 것입니다. 이 구조상 훈련-추론이 한 곳에서 이뤄지기 때문에 엄청난 컴퓨팅을 필요로 합니다. 여기서 생각할 수 있는 두 가지는 Orion 성능이 예상보다 더 좋을 수 있다는 점, Orion 훈련에 생각보다 더 많은 컴퓨팅이 들어갈 수 있다는 점입니다. ​ 이젠 이미 잘 아시겠지만, 훈련에서는 이미 스케일링 법칙이 계속되고 있습니다. *왼쪽 : 스케일링 법칙 차트 → 컴퓨팅, 데이터셋 규모, 매개변수 크기를 키울 수록 성능 개선

  6. 원문 구간 6

    *오른쪽 : 창발성 그래프 → '특정 수준 이상의 규모'가 되면 이전까지 없었던 새로운 기능이 열린다 ​ 2020년 오픈AI가 발표한 스케일링 법칙 <Scaling Laws for Neural Language Models>, 2022년 친칠라 스케일링 법칙<Chinchilla Scaling Laws>, LLM의 크기를 키웠을 때 창발성이 생기는 법칙 <Emergent Abilities of Large Language Models>이 이끄는 시대입니다. 모두 LLM 시대의 시작을 알린 논문들입니다. ​ ⓐ컴퓨팅이나 데이터셋의 크기 혹은 매개변수의 크기를 키우거나 ⓑ매개변수의 크기에 맞게 데이터셋의 크기를 키우는 쪽으로 갈 경우 성능이 좋아지며 ⓒ일정수준 이상으로 가면 A라는 기능이 1에서 10으로 좋아지는 것도 있지만, B라는 기능이 '새롭게' 생기더라는 것이 핵심입니다.

  7. 원문 구간 7

    이들을 선생처럼 써서 Knowledge Distillation <Distilling the Knowledge in a Neural Network>을 하며 발전해온 것이 소형모델의 역사입니다. "훈련에 쓸 데이터를 이상적인 합성데이터로 리팩터링하고 갖추기 위해서 거대모델의 도움이 더 필요합니다. 모델을 더 작게 만들기 전에, 먼저 모델을 더 크게 만들어야 하는 것입니다." ​ Therefore, the models have to first get larger before they can get smaller, because we need their (automated) help to refactor and mold the training data into ideal, synthetic formats.

  8. 원문 구간 8

    2024-07-19, 안드레 카파시의 발언 엔비디아 위주의 AI 사이클 베이스를 잡고 가는 자료입니다.

4

시간흐름대로 모든 내용을 살려 정리

시간흐름대로 모든 내용을 살려 정리

1
자료의 성격과 문제의식

[원문 유형] 네이버 프리미엄 콘텐츠
[채널] 올바른 미국주식 by SAPIENS
[게시일] 2025.07.15. 오후 8:43
[원문 URL] https://contents.premium.naver.com/sapiens/sapiensasset/contents/250715204332533ni
[제목] (아카이브) 엔비디아 총정리 : 젠슨황😉이 이끄는 100조 달러 규모의 AI 산업혁명
[수집 기준] 승인된 구독 열람권으로 실제 본문을 보존했다. 이미지·첨부는 별도 미디어 원장에 보관하며 시각적 의미 검토 여부를 구분한다.

[구독 원문 본문]

안녕하세요 사피엔스입니다.

*2024년 10월, '엔비디아가 이끄는 AI 사이클'에 대해 정리했던 생각을 바탕으로 현재 사피엔스투자자문의 시각에서 업데이트하여 작성한 자료입니다.

2
AI 산업의 규모와 글의 범위

여전히 일맥이 통하는 내용들이 있어 정리했습니다.*

엔비디아는 전 세계 $100T 산업을 바꿔낼 $2T 시장을 다루고 있습니다. 데이터를 넣으면 토큰이 나오는 디지털 지식단위의 새로운 산업혁명입니다.

엔비디아를 이해하기 위해서는 전체를 이해해야 합니다. CUDA의 네트워크 효과, 추론에서도 계속될 엔비디아의 해자, 기업들이 더 많은 Blackwell을 원하는 이유를 담았습니다.

기술적으로도, 하이퍼스케일러들의 경쟁으로도, 엔터프라이즈와 소버린AI 수요로도 모두가 가속을 말하고 있습니다. 오픈AI o1, 머스크, 액센츄어 키워드로 풀어봤습니다.

최근 글 모음

2025-07-15

네비우스 기업분석 : GPU 네오클라우드의 선두주자 (바로가기)

2025-07-15

일간보고 : 투자의 생각 (250715) (바로가기)

3
최근 글·투자 유의문과 목차

2025-07-14

주간전략보고 : 투자의 생각 (7월 14일~7월 18일) (바로가기)

2025-07-13

서클과 스테이블코인에 대한 모든 것 : 뜨거운 여름의 시작일까? (바로가기)

2025-07-13

서클 기업분석 : 트럼프의 큰 그림, 스테이블코인은 암호화폐 최초의 '킬러 앱'이 될까? (바로가기)

투자자문 서비스에 따른 투자 시 원금 손실이 발생할 수 있으며, 투자 손익에 대한 책임은 전적으로 고객에게 귀속됩니다. 또한 과거의 투자수익이 미래의 수익률을 보장하지 않습니다.

신규 구독 전에, 아래 투자자문계약 권유문서의 계약 관련 제반 사항을 반드시 읽으시고 충분히 검토하시기 바랍니다.

*투자자문계약 권유문서 : https://naver.me/5ZST47Qf

목차

4
다룰 질문과 데이터센터 시장

엔비디아 NVIDIA : 100조 달러의 산업을 바꿀 2조 달러의 데이터센터 시장

CUDA는 빠질 수 없는 존재 : CUDA 개발자 수는 이제 처음으로 550만명 도달

나선효과 : 왜 기업들은 CUDA에서 벗어나지 않을까?

추론에서도 "엔비디아" : 하드웨어는 쉽다, 현장에서는 Installed-base 싸움

엔비디아가 생각하는 TAM "$2T" : 새로운 산업혁명이 시작됐다. Data in, Token out

Blackwell, Blackwell, Blackwell : 더 좋은 TCO, 더 높은 에너지효율, 더 우수한 ROI

새로운 스케일링 법칙 : OpenAI o1, 딸기가 일으킨 파급효과

엔비디아 NVIDIA

100조 달러의 산업을 바꿀 2조 달러의 데이터센터 시장

창립 25년, 엔비디아는 어디로 와서 어디로 가는가

5
2024년 투자자 자료를 다시 읽는 출발점

2024년 10월 8일에 엔비디아의 투자자 프레젠테이션Investor Presentation 자료가 올라왔습니다. 사람들이 알기 쉽도록 많은 것들이 업데이트됐습니다. 그동안 전해드렸던 트렌드들이 많이 담겨있었습니다. 차근차근 하나씩 다뤄보면서 달라진 부분들에 대한 생각들을 정리해보겠습니다. 이전에 전해드렸던 엔비디아에 대한 모든 것들을 다시 한 번 훑어보면서 현재 시점에 맞게 부분적으로 정리했습니다.

CUDA는 빠질 수 없는 존재

CUDA 개발자 수는 이제 처음으로 550만명 도달

*2024년 10월 기준 CUDA 개발자 수가 550만명이 됐습니다. 2022년 11월 ChatGPT가 생성형AI 붐을 초래하고 나서 역대 가장 빠른 속도로 개발자들이 늘고 있다는 의미입니다. 기업들의 참여가 늘어서 그렇다고 생각합니다. 2024년과 2025년의 AI 수요 증분값은 대부분 Enterprise & Sovereign AI가 차지할 거라 생각했습니다.

6
CUDA 개발자 수의 확장

NVIDIA

CUDA

2006년

2018년

11월

2020년

8월

2021년

11월

2023년

5월

2024년

2월

2024년

10월

개발자

규모

런칭

100만명

200만명

300만명

400만명

500만명

550만명

걸린시간

-

13년

21개월

15개월

18개월

21개월

16개월

연율화

CUDA 개발자 커뮤니티 확장속도 Up

CUDA는 엔비디아의 해자이기도 하지만, 가속컴퓨팅과 AI을 가능케 만든 근본적인 배경이기도 합니다. CPU를 사용하기 위해 C언어를 익혔듯이 GPU를 사용하기 위해 CUDA가 쓰였기 때문입니다. 가속컴퓨팅이 가능하려면 소프트웨어를 다시 GPU에 맞게 뜯어고쳐야 가능합니다.

7
CUDA가 가속컴퓨팅의 기반인 이유

CPU/시퀀싱 기반의 알고리즘 프로세싱을 병렬로 바꾸기 위한 과정에서 CUDA는 엔비디아를 설명할 때, AI를 설명할 때 빠질 수 없는 존재입니다.

*새로운 CUDA 라이브러리는 새로운 알고리즘 사용사례를 개척하는 일을 뜻합니다.

새로운 CUDA 라이브러리 = 새로운 시장 개척

소프트웨어를 가속시킴에 있어서, 소프트웨어 내부에는 각각의 고유한 알고리즘이 있습니다. 일반적으로 CPU로 소프트웨어를 실행시킨다 하면 소프트웨어 속 코드의 5~10%정도가 런타임의 99.999%를 차지합니다. 일정 알고리즘을 엄청나게 잘 가속시키는 프로세서를 만든다면 이론적으로 몇 백배까지도 애플리케이션 실행속도를 높일 수 있게 되는 이유입니다.

그리고 이런 모든 것들을 로우레벨에서 코딩하기란 사실상 매우 어렵기 때문에 편의상 엔비디아는 CUDA 라이브러리를 만들었습니다.

8
라이브러리와 알고리즘 가속

제각기 다른 모든 라이브러리는 아까 말씀드린 소프트웨어/애플리케이션에서 실행되는 알고리즘을 가져와서 가속기가 실행할 수 있는 방식으로 알고리즘을 리팩토링refactor thos algorithms 하기 위해 쓰입니다.

CUDA 라이브러리를 다루기 위해서 엔비디아는 하드웨어에 최적화시키기 위한 연구를 하고, 생태계를 개발해야 했습니다. 모든 사람들을 설득해가며 사용하도록 만들어야 했고, 어떤 종류의 컴퓨터에서 실행하고 싶은지, 어떤 워크로드를 가속시키고 싶은지를 정말 끊임없이 묻고 피드백 받아가며 수정했습니다. 산업도, 업종도, 사용사례도, 컴퓨터도 모두 다른 것들이었지만 한 도메인에서 잘 안착시킨 후 다른 도메인으로 계속해서 확장한 역사입니다.

엔비디아가 정말 잘하는 것은 이렇게 기업들과 협력하며 새로운 시장을 만드는 것입니다.

9
산업별 라이브러리 축적

너무나 오랫동안 그렇게 일해왔기 때문에 엔비디아의 가속컴퓨팅이 어디에나 있는 것처럼 보이지만, 실제로는 한 번에 하나씩, 한 번에 한 산업을 위한 라이브러리씩 만들어온 역사입니다. 그렇게 엔비디아는 400개가 넘는 CUDA 라이브러리를 갖게 됐습니다.

나선효과

왜 기업들은 CUDA에서 벗어나지 않을까?

CUDA 플랫폼이 이끄는 나선효과spiral

학부생때부터 CUDA를 기반으로 배우기 때문에 현실에서 이들이 한 번에 다른 플랫폼으로 옮겨가기란 매우 힘듭니다. 현실에서 생각해볼 가장 큰 문제는 '호환성'입니다. 풀스택으로 혼자 코드를 쓰고 프레임워크, 로우레벨 API까지 사용할 줄 아는 프로그래머는 적기 때문에, 실제로 개발자들은 타인의 코드를 구글링해서 쓰는 경우가 대부분입니다. 이 경우 예를 들어 일정코드를 AMD 기반으로 썼다고 해도, 타인 코드 중 어떤 무언가가 PyTorch의 최신버전을 지원하지 않거나, TensorFlow와 호환되지 않거나, 알고보니 CUDA 기반으로 넣어진 코드였다거나 하면 전체 코드를 쓰지 못하게 됩니다.

10
CUDA 전환 비용과 소프트웨어 해자

CUDA는 소프트웨어 업그레이드를 통해 워크로드를 하드웨어 개별 칩에 최적화하는 방식으로 성능이 올리고 있습니다. 더 많은 가속성능을 제시할 수록 타 칩으로 옮길 때의 진입장벽이 커지는 구조입니다. 에릭 슈미트가 말한 것처럼, AI 연구는 6개월마다 업계 전망을 다시 말해야 할 정도로 빠르게 흘러가고 있기에 다양한 하드웨어, 다양한 플랫폼에 특화할 여유나 비용이 없습니다. 대부분의 코드는 엔비디아 GPU에만 최적화 되어 있고, 엔비디아를 따라잡기 위해서 경쟁자는 지난 10년 동안의 소프트웨어를 최적화시켜야 하므로 엔비디아가 꾸준한 해자를 가져갑니다.

기업 입장에서 생각해봐야 할 것들

기업들의 입장에서도 만약 다른 칩을 쓰려고 한다면 호환성을 유지하기 위해 같은 칩에 5년 넘게 투자해야 하고, 개발자에게 CUDA와 같은 수준의 시간과 노력을 들여 ROCm을 다루도록 준비시켜야 하고, 개발도 두 세 갈래로 호환되게 시켜야 합니다.

11
AMD 전환 도구의 한계

개발하고나서 업그레이드 및 업데이트도 꾸준히 이어집니다. AI 업계에서 5년은 매우 긴 시간입니다.

물론 CUDA를 AMD 플랫폼에서도 실행할 수 있게 바꾸는 도구들도 있습니다. 'hipify-perl'입니다. 그러나 완전하게 가동될 수 있도록 옮겨오려면 그리고 동일한 성능을 내려면 추가적인 커스텀 작업들이 필요합니다. 평균적으로 CUDA 워크로드의 50%는 hipify-perl을 통해 전환이 가능합니다. 나머지 50%는 개발자들이 붙어서 커스텀해줘야 합니다. 50대 50정도입니다. 50%를 전문가 집단이 계속해서 최적화시켜줘야 합니다. 이에 대한 비용, 시간, 따로 CUDA-ROCm로 옮기느라 핵심 사업에 쓸 유능한 개발자를 낭비하는 것을 함께 생각해봐야 할 문제입니다. hipify-perl은 엔비디아 GPU에 접근할 수 없을 때 유용한 옵션입니다.

12
모델 혁신과 지속되는 훈련

기업 입장에서 가장 안전한 베팅은 다른 모든 사람들이 쓰는 칩에서 개발하는 것입니다. 99%의 새로운 모델과 AI 알고리즘 혁신은 엔비디아 칩 위에서 발생하고 있습니다.

훈련엔 끝이 없다. 마치 사람처럼

업계 전문가 인터뷰 중 전직 메타 컴퓨팅 인프라 Director의 코멘트를 통해 메타가 엄청난 GPU를 구매하는 이유를 설명해드린 바 있습니다. 이에 대해서는 원문을 한 번 정리해드리겠습니다.

메타 컴퓨팅 인프라 Director (전직)

"추론에도 상당한 컴퓨팅 능력이 필요하지만 실시간으로 결정만 내리는 것이기 때문에 생각만큼 비용이 많이 들진 않을 수 있습니다. 훈련에 비용이 많이 들어가는 이유가 몇 가지 있습니다. 첫 번째는 아무도 처음에 제대로 된 모델을 얻지 못합니다. 초기 투자의 상당부분은 어떤 모델을 사용하면 더 나은지를 알아내기 위해서 새로운 모델을 실험하고 훈련시키는 작업들입니다."

13
모델 훈련이 멈추지 않는 이유

"훈련은 멈추지 않습니다. 엄청나게 많은 다른 모델을 끊임없이 시도해봐야 합니다. 소수의 사람들이 지금보다 더 나은 모델을 연구하기 위해 컴퓨팅을 사용합니다. 엄청난 이유 중 하나입니다. 이들에게 충분한 GPU를 할당해줄만큼의 자금이 필요합니다. AI의 성능과 효율을 좋게하려 할 수록 많은 돈을 필요로 합니다."

"각각의 작업들(검색, 광고, 콘텐츠 추천 알고리즘 등)에 가장 적합한 모델을 찾았을 때에도 계속 업데이트 해줘야 합니다. AI는 발전이 빠르기 때문에 특정 작업에 가장 좋은 모델이 조금씩 바뀝니다. 그에 맞춰서 업데이트 해야 해요. 계속 새로운 데이터를 넣어줘야 성능이 좋아집니다. 이 모든 것들은 지속적으로 업데이트되고 수정돼야 합니다. 더 성능이 좋아지려면 최신의 정보, 이전에 뽑았던 양질의 정보를 한 번에 넣고 끊임없이 '새롭게' 모델을 만들어야 합니다.

14
GPU와 ASIC의 쓰임을 묻는 질문

한 번 모델을 만들고 그걸로 계속 쓰는 게 아닙니다."

사회자

"그리고 마지막 질문은 GPU가 명백히 가장 범용적인 솔루션인 거 같다는 건데요. 메타가 ASIC 작업을 하고 있다는 걸 듣고 있는데, 메타는 5~10개의 대규모 메인 AI 워크로드를 보유하고 있으니 ASIC를 쓸 수 있지만 다른 ASIC은 어디에 쓰이나요? 비용은 저렴하지만 전체 워크로드의 유연성은 낮으니까요. 엔비디아와 AMD랑 같이 생각해보면 ASIC과 GPU의 관계를 어떻게 생각하면 될까요."

메타 컴퓨팅 인프라 Director (전직)

"GPU는 가장 범용적인 솔루션이기에 많이 보셨을 겁니다. 새로운 걸 시도하고 새로운 걸 훈련시킬 수 있는 가장 적합한 솔루션입니다. 모델을 점점 다듬을 수록 ASIC이 효율적입니다. 그래도 ASIC을 어느정도 선까지 업데이트 시킬 수는 있어도 경직된 솔루션이기 때문에 이동하려면 다시 GPU가 필요합니다."

15
범용 GPU와 특화 ASIC의 관계

"새로운 것들을 만들 때마다 '이거 잘 될 거 같다 ASIC으로 설계하자' 이렇게 구상하는 게 아닙니다. 최종적으로 잘 뽑힌 워크로드지만 어떻게 될지 모를 때에는 GPU를 사용하는 게 더 합리적이에요. 이건 CPU 기반의 ASIC도 마찬가지입니다. ASIC 자체는 새로운 건 아닙니다. 특정 목적에 특화시키는 거죠. 모든 네트워킹 장비들은 패킷을 더 빠르게 이동시키기 위해 ASIC을 쓰고 있습니다."

"AI에 대한 파이가 점점 더 커지면, ASIC도 더 큰 파이를 가질 겁니다. 다만 AI의 발전속도가 워낙 빠르기 때문에 당분간은 엔비디아에게 엄청난 업사이드가 있을 겁니다. AMD도 마찬가지로요. GPU냐 ASIC이냐는 관점보다는 AI에 대한 수요가 워낙 높고 성장이 가파르기 때문에 누구도 잃지 않을 가능성(= GPU 산업도 성장하고, ASIC 산업도 성장할 가능성이 높다는 의미)이 매우 높습니다."

16
추론의 경쟁은 설치기반의 경쟁

추론에서도 "엔비디아"

하드웨어는 쉽다, 현장에서는 Installed-base 싸움

추론시대에도 엔비디아/CUDA의 해자는 계속된다

추론도 설치기반Installed-Base에 따라 엔비디아가 해자를 그대로 가져갑니다. 젠슨황 CEO는 사람들이 훈련용은 너무 어렵다는 걸 알았기 때문에 칩 메이커들이 '우리는 훈련용이 아니라 추론용으로 개발했어요.'라고 말하는 경우가 많다고 말합니다. 직관에 반하는 내용이지만, 현실적으로 추론이 더 어려운 문제이기도 합니다. 추론의 응답시간을 빠르게 하는 건 매우 쉬운 부분입니다. 추론의 어려운 부분은 대규모 설치기반에 소프트웨어를 얹어야 좋다는 것입니다. 추론은 설치기반의 문제입니다.

엔비디아 CUDA 생태계 내 참여자가 많고 이미 코딩베이스가 다 CUDA 기반이며 개발자도 많기 때문에 쉽게 바꾸기 어렵고 해자로 작용하고 있는 셈입니다.

17
동일 아키텍처와 강화학습 데이터

아이폰 앱을 판매하기 위해 앱스토어에서 애플이 만든 코드로 개발하는 것과도 비슷합니다. 엔비디아 가속컴퓨팅은 데이터센터부터 온프레미스, 엣지까지 모든 곳에 있는 곳에서 사용할 수 있는 유일한 플랫폼입니다. 온프레미스에서 클라우드에 이르기까지 모든 클라우드에서 동일한 아키텍처를 사용하고, 클라우드에서 구축하거나, 자체 슈퍼컴퓨터에서 구축하든, 자동차나 로봇, PC에서 실행하든 모든 소프트웨어를 실행하는 동일한 아키텍처가 중요합니다. 설치기반이 이를 받치고 있습니다.

더 나아가서 2~3년 뒤를 생각하며, 젠슨황 CEO가 계속해서 강조하는 것은 연산력이 지금보다 훨씬 더 좋아지면 엔비디아 칩에서 학습과 추론이 동시에 한 칩에서 벌어지기 시작할 것이란 점입니다. 컴퓨터가 비디오를 보고, 새로운 텍스트를 보면서 상호작용하면서 스스로 즉각 즉각 학습하기 시작할 수 있다는 내용인데, AI의 훈련~추론~배포~어플리케이션까지 하나로 통합되는 구조입니다.

18
소버린 AI·에너지 병목

현재 인간이 하는 일입니다. 강화학습 루프는 ⓐ실제 세계와 상호작용하며 얻은 리얼월드 데이터와 ⓑ실시간으로 생성하는 합성데이터를 기반으로 이뤄집니다. 합성 데이터는 컴퓨터가 사람처럼 상상을 하는 것에 가깝습니다. 사람도 상상력으로 일단 어떻게 될지 보고 나서, 실제 작업에 투입한 뒤 데이터가 다르면 내가 아는 리얼월드 세상에 대한 세계관을 수정하는 식으로 진화합니다.

이미 현장에선 엔비디아의 해자를 느끼고 있다

현장에서 어떤 느낌을 받는지, 고객들은 무엇을 원하는지에 대해서는 코어위브CoreWeave의 코멘트를 통해 확인해드린 바 있습니다. 말씀드렸던 내용은 크게 네 가지입니다.

수요가 생각보다 더 빠르게 늘고 있다 : 전통적인 서버 공급망과 수요 사이클에 비해서 현재 고객들의 수요가 훨씬 빠르게 움직이고 있다.

19
추론 성능 저하와 코어위브의 관점

많은 고객들이 이제 자체 AI 서버를 갖기를 요구하고 있다는 내용이었습니다.

전력망-에너지가 병목이 될 것 : 앞으로 전력망에 스트레스를 줄 거대 데이터센터Megacampus가 더 늘어날 것이며, 오래된 데이터센터를 개조하는 게 어렵다보니 새 송전선/새 변전소를 구축하는 등의 프로젝트가 늘고 있다는 내용이었습니다.

대규모 추론 고객들 증가. 연말까지 캐파 '이미 다 찼다' : 고객들이 이제 훈련을 넘어 대규모 추론으로 전환함에 따라 올해 AI 수요가 크게 늘어날 것이고, 연말까지 모든 GPU 캐파가 이미 다 팔렸다는 내용이었습니다. 훈련에는 1만 개의 GPU를 임대 중이지만 → 추론에서는 수십만 개의 GPU를 필요로 하는 고객이 있다는 예시를 들어줬죠.

엔비디아는 추론시장에서도 강세일 것이다 : 이번 코어위브는 인터뷰를 통해 엔비디아 GPU로 훈련한 모델의 경우 고객은 대부분 엔비디아 GPU로 추론할 것이라는 전망을 밝혔습니다.

20
AI 팩토리라는 데이터센터 수요

소프트웨어를 추상화Software Abstraction하거나 포크forks할 경우 최대 30~80%까지 추론 성능이 떨어지는 만큼 굳이 그럴 이유가 없다는 입장이죠.

젠슨황 CEO의 전망과도 일치했습니다.

엔비디아가 생각하는 TAM "$2T"

새로운 산업혁명이 시작됐다. Data in, Token out

*"클릭 후 더블클릭"하시면 크게 보실 수 있습니다.

*왼쪽 : 엔비디아가 생각하는 AI 가속기 TAM은 $2T입니다. 데이터센터 $1T + AI Factories $1T입니다.

*중앙 : AI Factories는 데이터를 넣으면(input), 토큰이 나오는(output)식의 지능에 대한 산업혁명을 이룹니다.

*오른쪽 : 각 지역, 국가에서 소버린 AI 클라우드 구축 경쟁입니다.

21
토큰을 생산하는 AI 팩토리

자신만의 AI를 구축하는 중입니다.

데이터센터 $1T + AI Factories $1T

기존의 가속컴퓨팅 전환수요를 넘어서 새로운 데이터센터 유형인 AI 팩토리AI Factories가 깔리고 있습니다. 정확히 보자면 AI 팩토리는 엔터프라이즈 AI와도 비슷합니다.

기업들이 자신의 데이터Data를 AI 모델에 넣어서 자신만의 AI 모델을 훈련시키고 나면, 해당 엔터프라이즈 AI 모델이 이미지, 차트, 그래프, 노래, 단어, 음성, 영상, 화합물, 단백질, 유전체, 시뮬레이션, 물리법칙 등 다양한 것을 생성합니다. 차량을 운전하는 방법, 로봇을 가동시키는 방법까지 다양한 것을 토큰Token을 통해 다룰 수 있게 됩니다.

젠슨황은 이를 "AI 산업혁명"이라고 부르고 있습니다.

22
AI가 쓰일 수 있는 작업의 범위

원자재인 데이터를 넣으면, 지능이 토큰 형태로 나오기 때문입니다. 모든 회사가 디지털 지능을 갖게 됩니다. 디지털 간호사, 강사, 고객서비스, 에이전트, 칩 설계자, 공장에서의 로봇, 자율주행차, 기상예측 에이전트 등 다양한 사용사례로 널리 적용될 수 있습니다. 니콜라 테슬라가 교류발전기를 통해 전력을 생산해 세상을 바꿨던 것처럼, 엔비디아는 AI 팩토리이자 AI를 만드는 데이터센터를 통해 토큰을 생산해 세상을 바꾸겠다는 것입니다.

컴퓨터 입장에선 책을 읽게 하고 그 안에서 한 단어의 뜻을 묻는 것과, 유전자 염기서열을 데이터로 넣고 해당 유전자의 의미를 묻는 것과, 자율주행 비디오를 데이터로 넣고 상황에 대한 맥락을 이해하는 것이 크게 다르지 않습니다. 생성형AI와 LLM 혁신의 핵심은 "컴퓨터를 사용하여 패턴이 아닌 의미를 이해하는 방법을 익히기 시작한 것"입니다.

23
자율주행과 Blackwell의 연결

자율주행에서도 핵심은 주변의 데이터를 해석하고, 해석한 값을 토대로 최적경로를 계획하는 것이었습니다. 센서나 조향 및 가감속은 상대적으로 데이터를 해석하고 계획하는 분야에 비해 쉽습니다.

Blackwell, Blackwell, Blackwell

더 좋은 TCO, 더 높은 에너지효율, 더 우수한 ROI

Blackwell은 거대한 플랫폼

외부에서 볼 때는 칩의 가격 혹은 서버의 가격을 보고 비싸다고 하지만, 실제 엔비디아의 고객사인 기업들은 Blackwell을 구매하여 가동하는 5년 동안 어느 만큼의 컴퓨팅을 낼 수 있을 것인가를 놓고 비교합니다. 들인 비용에 비해서 실제 얻을 수 있는 컴퓨팅의 양을 비교하는 것이 총소유비용 TCO, Total Cost of Ownership 관점입니다.

24
AMD의 ZT 시스템즈 인수

2024년 8월 19일, AMD가 $4.9B 규모로 ZT 시스템즈를 인수한다고 발표했었습니다. 콴타컴퓨터, 폭스콘, 인벤텍, 슈퍼마이크로 같은 서버제조기업을 인수한 것입니다. 꽤 늦은 행보입니다. 이미 AI 가속기 경쟁은 단일 칩 수준을 넘어서 칩과 칩을 고속연결하는 네트워킹의 경쟁, ㄴ) 수천~수만 개의 칩을 하나의 칩처럼 다루는 소프트웨어 플랫폼 단위의 경쟁으로 넘어온지 오래이기 때문입니다. 이에 대해 하나씩 정리해볼까 합니다.

TCO 대비 퍼포먼스를 엄청나게 끌어올린 Blackwell

Hopper → Blackwell에서 엔비디아가 강조하는 것은 총 4가지입니다. 이번에는 서버 단위인 HGX H100 대비 GB200 NVL72의 성능이 얼마나 좋은지를 기준으로 비교했는데요.

25
GB200 NVL72의 네 가지 비교

ⓐ첫 번째는 추론능력Inference 비교입니다. GPT-4 기준 실시간 LLM Throughput시간당 토큰 출력량을 최대 30배 끌어올렸습니다. ⓑ두 번째는 훈련능력Training 비교입니다. FP8 기준으로 훈련속도를 4배 더 빠르게 끝낼 수 있게 됐습니다. ⓒ세 번째는 에너지 효율Energy Efficiency도 비교입니다. 공기냉각식에 비해서 더 효율적으로 냉각할 수 있기 때문에 액체냉각을 기본으로 하는 GB200 NVL72는 동일전력 기준 25배 더 높은 성능을 내고 있습니다. ⓓ네 번째는 데이터 처리량Database Join Query 비교입니다. HBM 대역폭을 키우고 NVLink 대역폭900GB/s → 1800GB/s도 크게 키웠기 때문에 데이터를 처리하고 분석하는 속도를 크게 키웠습니다.

26
B200 가격과 AMD의 비용 경쟁

B200은 H100/H200에 비해 성능을 올리면서도 가격은 $30~40K로 책정해서 경쟁사 AMD의 성능향상분을 제한하는 효과를 누리고 있습니다. AMD는 H100 80GB와 경쟁하기 위해 MI300X의 HBM 콘텐츠를 192GB로 출시했었습니다. 그러다보니 AMD는 엔비디아보다 더 높은 생산비용으로 제품을 생산하고 있었습니다. 애널리스트들이 AMD MI300X이 전사 마진율을 낮추는 게 아니냐고 초반에 우려했던 이유입니다. 생산비용은 추정하기로 H100 $3,320 vs MI300X $7,000정도입니다. H100 당시 GPM 기준 엔비디아가 87~89%를 가져가는 것과 달리 AMD는 부족한 성능을 비용상승분으로 극복했기에 마진율을 전사보다 약간 높은 50% 초반대로 유지했었습니다.

27
서버 단위 제품화와 마진 구조

엔비디아는 Blackwell로 넘어오면서 가격을 생각보다 많이 높이지 않았습니다. B200 생산단가는 H100보다 2배가 늘었기에 $6K 정도가 됐지만, 이제부터 AMD가 기술격차를 비용으로 커버하려면 전사마진율 50%는 최소한 넘기는 한에서 성능을 올려야 하기 때문에 하드웨어적으로는 상당히 많은 옵션들이 제한됐습니다. AMD도 나름 계획이 있을 거라 생각하지만 2025년에 출시될 MI400의 입장이 어렵습니다.

가장 우수한 제품, GB200 NVL72

엔비디아는 칩 단가를 많이 높이지 않은 대신 '서버' 자체를 하나의 GPU처럼 제품화했습니다. 엔비디아 입장에서는 NVLink, NVSwitch, InfiniBand 등 네트워킹 제품이 칩만큼이나 마진율이 높기에 가능한 일입니다.

28
Blackwell 제품군과 냉각 조건

제품적으로 GB200 NVL72에 힘을 주기도 했습니다.

현재 블랙웰 GPU는 메인 제품버전으로 보면 총 3개입니다. ⓐB100 700W 공냉식(HGX로 판매) ⓑB200 1000W 공냉식(DGX B200) ⓒGB200 1200W 액체냉각식(GB200 NVL72)입니다. GB200은 B200 GPU 2개와 Grace CPU 1개가 들어갑니다. 그러나 GB200 열설계전력은 2300W(B100 1000W *2 + Grace 300W * 1)이 아닌 2700W(B200 1200W *2 + Grace 300W *1)입니다. 공기냉각식으로 쓸 때는 1000W, 액체냉각식으로는 1200W로 세팅했습니다. 액체냉각 제품을 쓰면 비싸지지만 성능을 더 높게 내면서 운영비용도 줄일 수 있는 구조로 처음부터 설계했습니다.

29
액체냉각·전력·구축 효율

따라서 상대적으로 냉각효율이 좋은 액체냉각 솔루션Direct-to-Chip인 GB200 NVL72로 구매할 경우 ㄱ) B200의 성능을 더 끌어올리지만 ㄴ) 냉각을 바꾼 만큼 냉각에 쓰이는 에너지효율이 세이브되므로 성능증가분 대비 비용증가분으로 생각할 때 경쟁력 있으며 ㄷ) 모듈식으로 GB200 NVL72을 구성한 것도 데이터센터 운영자들 입장에서는 좋은 부분이었습니다. 운영자는 서버를 구축하는데 드는 시간과 확장가능성도 중요하기 때문입니다.

*왼쪽 : GPU 단위 경쟁을 넘고, 서버 단위 경쟁을 넘어, 이젠 GB200 NVL72부터 데이터센터 단위 경쟁을 겪고 있습니다.

*중앙 : 엔비디아의 NVLink는 새로운 기준이 됐습니다.

*오른쪽 : 2년마다 새로운 세대의 칩이 나오는 시대에서, 2Q23부터는 1년마다 칩이 나오는 시대로 바뀌었습니다.

30
7개 칩을 묶은 데이터센터 경쟁

네트워킹의 경쟁이자 데이터센터 단위의 경쟁

엔비디아의 Blackwell 제품 중 가장 고도로 최적화된 GB200 NVL72에는 ①Blackwell GPU + ②Grace CPU + ③NVLink Switch + ④Bluefield-3 DPU + ⑤ConnextX-7/-8 NIC, ⑥Spectrum-4 Ethernet Switch + ⑦Quantum-3 InfiniBand Switch가 포함되어 있습니다. 가장 높은 수준의 최적화를 위해 컴퓨팅을 위해서는 CUDA가, 네트워킹을 위해서는 NVCC가 쓰입니다. 엔비디아는 하나의 칩이 아닌 크게 7개의 칩을 같이 개발해왔고 그 위에는 이에 가장 최적화된 소프트웨어 스택이 합쳐져 있습니다.

수 만개, 수십 만개의 칩을 하나처럼 움직이도록 하기 위해서는 GPU-GPU 상호연결 네트워킹 기술과 서버-서버 상호연결 네트워킹 기술이 고도화되어야 합니다.

31
NVLink와 서버 간 연결

GPU간 연결로는 NVLink가 쓰이고, 서버-서버간 상호연결은인피니밴드InfiniBand, 멀티 테넌트향을 위해서는 엔비디아의 이더넷인 스펙트럼-XSpectrum-X가 쓰입니다.

거대모델 시대에 빛나는 NVLink

엔비디아는 2014년에 GPU와 GPU간 통신을 돕는 NVLink를 출시했습니다. 이전 자료에서 말씀드린 내용은 2012년 AlexNet 이후로 딥러닝의 가능성이 훨씬 넓어졌는데, 당시 엔비디아는 단일 GPU의 성능을 넘어 더 큰 기회를 생각했기 때문입니다. 여러 개의 GPU를 하나처럼 엮어서 멀티 GPU 구성시 성능을 높이는 게 목표였죠. 딥러닝의 연산에서 발생하는 병목을 줄이기 위함이었습니다. 원래는 GPU-CPU-GPU구조로 주로 CPU를 통해 통신하는 시대였지만, 엔비디아의 NVLink가 나오면서 GPU-GPU를 직접 연결하는 구조로 바뀌었습니다.

32
대형 모델에서 통신이 중요한 이유

'인공 신경망 하나가 한 GPU 안에 있느냐 or 아니냐'가 NVLink를 통한 성능향상에 직접적인 영향을 줍니다. AI 모델 크기가 그리 크지 않고 단일 GPU에서만 훈련-추론을 끝낼 수 있었다면 GPU간 통신할 일이 없으니 NVLink가 크게 부각되지 않았을 겁니다.

Groq, Cerebras는 경쟁자가 아니다

AI 모델의 매개변수 규모가 커질 수록 연산 시 병목을 최소화하기 위해 NVLink 대역폭도 커지고 HBM 대역폭도 커지고 있습니다. Groq와 Cerebras가 LLM 시대에 부적합하다고 말씀드린 이유도 같은 맥락입니다.

SRAM을 사용해서 속도는 높일 수 있겠지만 LLM 기반 서비스를 하는데 있어서는 매우 비효율적입니다.

33
Groq 사례와 대규모 모델의 비용

Groq은 Llama 3-70B 모델을 한 번 굴리기 위해서 576개의 LPU9개의 서버 랙이 추론을 수행하는 구조입니다. 저지연 소형모델 추론을 위해서는 비슷하겠지만 현재 많이 쓰이는 70B 모델로만 가도 매우 비효율적이므로 시장성에 대해서는 의문이 많습니다. 엔비디아 칩을 벗어나 Groq만을 위한 인프라를 보유해야 할 사용자가 없기에 직접 구축해서 추론 서비스만 지원했던 것인데, 비즈니스 구조상 계속되긴 어렵다고 생각합니다. 이제 LLM 전용 칩을 만들었다던 Groq은 $1만큼의 토큰을 서비스 할 때마다 엔비디아보다 10~100배 더 많은 비용을 쓰고 있습니다.

소프트웨어 플랫폼 단위의 경쟁, CUDA

사람들은 AI 컴퓨터를 만들 때 슈퍼 클러스터Supercluster, 인프라Infrastructure, 슈퍼컴퓨터Supercomputer 라는 단어를 쓰고 있습니다.

34
소프트웨어 플랫폼으로 보는 CUDA

칩 단위의 경쟁이 아니기 때문입니다. 엔비디아는 본질적으로 전체 데이터센터를 짓고 있습니다. 컴퓨터 안에 있는 모든 소프트웨어는 완전히 주문제작된, 커스터마이징된 것들이 실행되고 있습니다.

CUDA 위에서 AI 워크로드들이 가동되고 있다는 점은 다르게 해석하자면, 모든 워크로드들이 엔비디아 하드웨어에 매우 최적화해서 성능을 끌어올렸다는 의미입니다. H100 칩 성능은 소프트웨어가 업데이트 될 때마다 좋아지고 있습니다. 하드웨어에서 성능개선이 끝나는 것이 아니라 소프트웨어적인 미세조정을 통해 꾸준히 칩 성능이 좋아지고 있습니다. MLPerf 자료가 업데이트 될 때마다 찾아보면서 H100 기준 성능이 얼마나 업그레이드 됐는지 살펴보곤 하는데요.

35
MLPerf에서 나타난 소프트웨어 개선

흥미로운 것들이 많습니다.

*왼쪽 : Llama 2-70B Throughput 퍼포먼스는 2023년 10월에 비해 2개월 사이 1.5배, 4개월 사이 2.5배 좋아졌습니다.

*오른쪽 : Llama 3.1-405B 초당 토큰 생성속도는 2024년 7월에 비해 1개월 사이 1.30~1.35배 가까이 좋아졌습니다.

왼쪽의 MLPerf v4.0를 보시면 엔비디아 H100의 추론성능은 2023년 10월에 비해 Llama 2-70B 모델 기준 Throuput 퍼포먼스가 2개월만에 1.6배로 좋아졌고, 4개월만에 2.5배 좋아졌습니다. Throughput은 H100 서버로 시간당 얼마나 많은 토큰을 생산할 수 있느냐입니다.

36
Hopper와 Blackwell의 전력·칩 수 비교

엔비디아가 기업들의 LLM API 추론비용을 줄이는 데 크게 기여하고 있다는 의미입니다. 오른쪽의 MLPerf v4.1 자료를 보시면 엔비디아 H200의 추론성능은 2024년 7월에 비해 Llama 3.1-405B 모델 기준 초당 토큰 생성속도가 1개월만에 1.30~1.35배 좋아졌습니다. 모델이 얼마나 빠르게 텍스트를 생성할 수 있는지를 측정하는 지표입니다. 챗봇이나 음성인식 시스템에서 더 빠르게 답을 내거나 텍스트 처리 시간이 줄어들기 때문에 데이터 분석이나 번역작업들도 더 빠르게 완료할 수 있습니다.

Hopper → Blackwell : 4배 더 적은 칩, 3.75배 더 적은 전력사용량

GPT-4를 한 번 훈련하는데 있어서 H100으로는 8,000개의 GPU, 15MW 전력규모가 필요했지만, GB200 NVL72로는 2,000개의 GPU(NVL72 28개)와 4MW로 훈련을 끝낼 수 있습니다.

37
TCO·에너지효율과 Blackwell 수요

4배 더 적은 칩, 3.75배 더 적은 전력사용량으로 GPT-4를 훈련시킬 수 있게 바뀐 것입니다. 칩당 가격은 60~70% 높아졌지만 성능이 평균 3~4배씩 좋아졌기 때문에 고객 입장에서는 구축해야 할 컴퓨팅 규모가 같다는 전제 하에 GB200 NVL72를 더 많이 빨리 가동할 수록 돈을 버는절약하는 구조가 되어 있습니다.

또한 데이터센터 내에 AI 가속기가 감당 가능할 수준의 전력캐파가 부족하고, 끌어다 쓸 전력이 부족하다는 말이 나오는 상황에서 기업 입장으로는 비싸더라도 가장 성능이 뛰어난 GPU를 구매하게 됩니다. 가장 성능이 뛰어날 수록 가장 TCO도 좋고, 가장 에너지 효율도 좋으며, 가장 ROI도 높다는 의미이므로 모두가 Blackwell을 가장 많이 가장 먼저 받고싶어 합니다.

38
o1과 추론 컴퓨팅 스케일링

이런 흐름은 GB300 NVL72, VR200 NVL144, VR300 NVL288의 흐름에서도 이어질 것입니다.

새로운 스케일링 법칙

OpenAI o1, 딸기가 일으킨 파급효과

스트로베리🍓가 추론계의 스케일링 법칙을 열었다

엔비디아가 투자자 프레젠테이션에 OpenAI o1이 추론컴퓨팅의 스케일링 법칙 시대를 열었다고 말했습니다. 훈련컴퓨팅의 스케일링 법칙만 계속되던 시대였는데 이제는 추론컴퓨팅도 생각하는 시간/추론하는 시간을 늘리는 방식으로 스케일링 법칙이 생겼단 것입니다.

이 배경을 보시면, 오픈AI가 코드명 스트로베리Strawberry🍓로 불리던 OpenAI o1를 출시하며 시작됐습니

39
o1의 성능과 프리뷰 조건

다. 아직 프리뷰 버전이고 정식버전이 아니지만 확실히 추론에 더 많은 컴퓨팅을 할당함으로써 좀 더 고차원적인 지능 영역이 열렸습니다.

사람처럼 대답하기 전에 문제를 오랫동안 생각하도록 훈련된 첫 번째 제품이며, 이를 통해 더 좋은 답변을 내고 실수를 인식하는 방법을 배우는 중입니다. 그 결과 물리학, 화학, 생물학, 수학, 코딩 분야에서 박사급 지능을 내기 시작하고 있습니다. 국제수학올림피아드 예선문제에서 GPT-4o는 13%를 풀었으나 o1는 83%를 풀었습니다. 코딩 대회에서도 상위 11%의 성과 기록할 정도로 고차원의 생각이 가능해졌습니다.

*왼쪽 : 추론시간에 할당하는 컴퓨팅 시간을 늘렸더니 훨씬 더 우수한 지능의 답을 할 수 있게 됐음을 알린 Strawberr

40
강화학습과 더 많은 컴퓨팅

y

스트로베리가 대단한 점 첫 번째는 대규모 강화학습 알고리즘을 적용한 모델인데 추론/생각에 더 많은 컴퓨팅을 할당할 수록 지속적으로 성능이 좋아진다는 것을 발견한 게 매우 좋았습니다. 기존의 LLM pre-training에서 발생했던 종류의 제약과는 또 다른 것입니다. 이제 모두가 에릭 슈미트가 말했던 "최근 오픈AI는 $100B 클러스터 규모를 $300B로 키우고 싶어한다."의 의미를 이해할 수 있습니다. 더 많은 컴퓨팅의 효과를 이해할 수 있게 됐습니다.

그리고 두 번째 포인트는 처음으로 인간과 동등하거나 인간을 넘긴 추론모델인 o1는 차세대 GPT인 코드명 "Orion"을 훈련시키는 데 이미 쓰이고 있다는 것입니

41
합성데이터와 Orion에 대한 전망

다. AI 모델을 훈련시키기 위한 데이터셋은 상당부분이 AI를 통해 생성된 합성 데이터이기 때문에 훨씬 더 양질의 데이터셋을 얻을 수 있게 됐다는 의미입니다. 멀리 나아가 생각하자면 강화학습을 통해 AGI → ASI로 향하는길의 청신호입니다.

Q* 모델을 개발하기 시작했을 때가 2023년 말이었고 모델 개발과정에서 엔비디아 개발자와도 협력하기 때문에 두 CEO는 미리 이를 인터뷰에서 슬쩍슬쩍 언급하곤 합니다.

'Reasoners'의 핵심은 2022년 Stanford의 STaR 논문 방법과 유사합니다. 자체학습하는 추론자Self-Taught Reasoner 모델로 개발하는 게 핵심입니

42
STaR 방식과 훈련·추론의 결합

다. 일단 거대 데이터로 학습한 뒤 같은 작업을 반복하며 추론능력을 조금씩 향상시키는 방법인데요. 훈련한 뒤 추론하고 스스로 판단하여 정답에 가깝도록 이를 반복해가면서 AI가 인간 수준에 근접할 수 있다는 것입니다. 이 구조상 훈련-추론이 한 곳에서 이뤄지기 때문에 엄청난 컴퓨팅을 필요로 합니다. 여기서 생각할 수 있는 두 가지는 Orion 성능이 예상보다 더 좋을 수 있다는 점, Orion 훈련에 생각보다 더 많은 컴퓨팅이 들어갈 수 있다는 점입니다.

이젠 이미 잘 아시겠지만, 훈련에서는 이미 스케일링 법칙이 계속되고 있습니다.

*왼쪽 : 스케일링 법칙 차트 → 컴퓨팅, 데이터셋 규모, 매개변수 크기를 키울 수록 성능 개

43
기존 스케일링 법칙과 창발성

선

*오른쪽 : 창발성 그래프 → '특정 수준 이상의 규모'가 되면 이전까지 없었던 새로운 기능이 열린다

2020년 오픈AI가 발표한 스케일링 법칙 <Scaling Laws for Neural Language Models>, 2022년 친칠라 스케일링 법칙<Chinchilla Scaling Laws>, LLM의 크기를 키웠을 때 창발성이 생기는 법칙 <Emergent Abilities of Large Language Models>이 이끄는 시대입니다. 모두 LLM 시대의 시작을 알린 논문들입니다.

ⓐ컴퓨팅이나 데이터셋의 크기 혹은 매개변수의 크기를 키우거나 ⓑ매개변수의 크기에 맞게 데이터셋의 크기를 키우는 쪽으로 갈 경우 성능이 좋아지며 ⓒ일정수준 이상으로 가면 A라는 기능이 1에서 10으로 좋아지는 것도 있지만, B라는 기능이 '새롭게' 생기더라는 것이 핵심입니

44
큰 모델이 작은 모델의 데이터를 돕는 구조

다. 이들을 선생처럼 써서 Knowledge Distillation <Distilling the Knowledge in a Neural Network>을 하며 발전해온 것이 소형모델의 역사입니다.

"훈련에 쓸 데이터를 이상적인 합성데이터로 리팩터링하고 갖추기 위해서 거대모델의 도움이 더 필요합니다. 모델을 더 작게 만들기 전에, 먼저 모델을 더 크게 만들어야 하는 것입니다."

Therefore, the models have to first get larger before they can get smaller, because we need their (automated) help to refactor and mold the training data into ideal, synthetic formats

45
글의 최종 관점

.

2024-07-19, 안드레 카파시의 발언

엔비디아 위주의 AI 사이클 베이스를 잡고 가는 자료입니

5

그럼에도 빠진내용 정리

잡담·곁다리 내용

별도 참고사항이 없습니다.

생략 기록

별도 생략 기록이 없습니다.

그럼에도 빠진내용 정리

원문 범위
최근 글 모음과 투자자문계약 안내는 자료의 주변 정보로 flow에 보존했다.
시각 자료
원문은 도표·이미지를 언급하지만 이 초안은 보존된 텍스트에서 확인되는 설명과 수치만 다뤘다.
표현의 성격
TAM, 성능 비교, 향후 제품 흐름과 AI 수요에 관한 평가는 글에 제시된 작성자 해석·전망으로 보존했으며 별도 사실로 확장하지 않았다.
원문 확인

document_work_runner prepare가 입력 원문을 수정 없이 보존했다.