2025.12.24 · 네이버 프리미엄 콘텐츠 · 올바른 미국주식 by SAPIENS

구글 AI 인프라 책임자의 경고 : '우리는 여전히 수요를 심각하게 과소평가하고 있다'

유형
네이버 프리미엄 콘텐츠
날짜
2025.12.24
강연자/작성자
올바른 미국주식 by SAPIENS
분석 주제
미지정
자료 길이
본문 19,773자
1

문서 전체 조망

핵심 구조

AI 인프라는 수요와 공급 제약, 워크로드별 설계가 함께 바꾸는 두 번째 재창조

구글·시스코 인프라 책임자 대화와 작성자의 해설은 AI 컴퓨팅 수요를 심각하게 과소평가하고 있다는 진단과 전력·토지·인허가·공급망의 제약을 다룬다. 공급이 있어야 쓸 수 있다는 조건 때문에 칩·네트워크·소프트웨어를 워크로드별로 함께 설계해야 하는 변화가 중요하다.

수요는 구형 자원까지 끌어쓴다

왜 수요가 강한지를 7~8년 된 TPU의 100% 가동으로 설명한다. 고객은 얻을 수 있는 가속기를 모두 쓰며, 바흐다트는 서비스 용량을 6개월마다 두 배로 해야 하고 이 제약이 5년 갈 수 있다고 전망한다.

공급은 컴퓨팅 투자 속도를 결정한다

전력·토지·인허가·공급망의 병목 때문에 큰 지출 의사만으로는 수요를 충족할 수 없다. 전력이 있는 곳으로 데이터센터가 가고, 멀어진 시설을 잇는 Scale-up·Scale-out·Scale-across 수요가 함께 커진다.

컴퓨팅은 거대한 단일 장비가 아니라 공동 설계된 클러스터다

GPU·TPU 클러스터는 일부만 떼어 쓸 수 있는 Scale-out 구조이며, 수만 가속기의 작업을 나누는 소프트웨어가 핵심이다. AI 시대에는 ML/System Co-design이 중요하다는 관점이 다음 컴퓨팅 스택의 변화를 설명한다.

특화는 효율을 높이지만 개발 시간과 미래 예측을 요구한다

TPU 같은 특화 칩은 특정 연산에서 와트당 효율을 높일 수 있지만, 개념부터 양산까지 최고 팀도 2년 반이 걸릴 수 있다. 따라서 특화의 가치는 칩 이름보다 워크로드별 총소유비용 대비 성능과 공동 설계에서 판단한다.

추론은 하나의 작업이 아니며 네트워크도 갈라진다

훈련·추론·강화학습의 요구가 다르고, Prefill은 계산 중심, Decode는 메모리 대역폭 중심이라 하드웨어와 소프트웨어를 분리하는 설계가 제시된다. 대규모 사전훈련의 짧은 피크 용량과 버스티한 통신은 네트워크 활용의 난제를 남긴다.

효율 개선은 사용량 감소를 뜻하지 않는다

추론 비용을 빠르게 낮춰도 사용자는 더 높은 품질과 더 긴 자율 실행을 요구할 수 있다. 작성자는 제번스의 역설을 빌려 낮은 비용이 새 사용 사례와 지출을 늘리는 구조를 설명한다.

AI 도입의 마지막 병목은 조직의 재시험 속도다

AI 도입의 마지막 병목은 조직의 재시험 속도다. 코드 마이그레이션은 AI의 뚜렷한 활용 사례지만 오래된 인프라 코드에는 한계가 남으며, 기술이 아닌 문화적 재설정이 중요하다는 설명이 이어진다.

ANALYSIS VIEW사건별 사실과 작성자의 판단, 지속 정보를 나누어 읽기
2
발생·예정 사건과 출처별 관점

이슈 분석

이 자료가 이슈의 어떤 사실을 다루고, 작성자가 무슨 결론을 어떤 근거로 내렸는지 원문에 붙여 읽습니다.

발생발표·발생 후발생일 25-10-29

25-10 구글 AI 인프라 책임자의 AI 인프라 대담

작성자의 핵심 판단

두 대담자는 현재 AI 인프라 사이클의 수요 규모와 속도에 선례가 없으며, 컴퓨팅·전력·네트워크를 함께 설계해야 한다는 문제의식을 드러낸다.

근거 보기 3
  1. 원문 구간 1

    ​ 라구 라구람 Raghu Raghuram : 두 분은 업계에 모두 오래 계셨고, 여러 인프라 사이클을 경험하셨는데요. 지금의 AI 사이클 같은 사이클을 본 적이 있나요? 투자자의 관점이 아니라 무언가를 실제로 구축하고 계획하는 책임자이신 기업인의 관점에서요. ​ 아민 바흐다트 Amin Vahdat : 제 생각에는 아무도 이런 규모의 사이클은 본 적이 없다고 확신합니다. 90년대~00년대 초반의 인터넷은 정말 거대한 사이클이었고, 당시에는 믿을 수 없을 정도의 구축 속도라고 느꼈었습니다. 당시 속도감과 비교할 때 지금은 100배 정도의 모멘텀을 갖고 있는 것 같습니다. 그리고 인터넷 시기 구축했던 네트워킹의 잠재적인 활용가치 대비 업사이드도 100배 정도에 달할 것이라고 생각합니다. ​ 지투 파텔 Jeetu Patel : 맞습니다. 이정도 규모, 속도, 범위에 대한 선례는 없습니다.

  2. 원문 구간 2

    좋은 소식은 인프라를 다루는 게 다시 섹시해졌다는 점입니다. 오랫동안 고리타분한 분야였죠. 정말 흥미로운 건 이 산업의 특성을 보자면 인터넷 인프라 구축, 우주 발사 경쟁, 맨해튼 프로젝트가 모두 합쳐진 것처럼 움직이고 있다는 것입니다. 지정학적 함의, 경제적 함의, 국가안보적 함의 등 심오한 분야입니다. ​ 그리고 아직 수요에 대해 심각하게 과소평가하고 있다고 생각합니다. 제가 가장 많이 하는 일은 이 산업에 거품이 있는지를 체크하고 다니는 일인데, 여전히 구축에 쓰일 수요를 심각하게 과소평가 하고 있다고 생각합니다. 예상치보다 훨씬 더 많은 것들이 필요할 것이라 생각합니다. ​ 라구 라구람 : 뒤의 질문과 이어지는데요. 그럼 지금 CAPEX 사이클 중 어느쯤에 왔다고 생각하시나요? 그리고 수요를 예측하기 위해 여러분이 내부적으로 사용하시는 신호는 무엇인가요?

  3. 원문 구간 3

    논리적으로는 하나처럼 움직입니다. 그리고 이를 가능하게 하는 건 수만 개의 가속기에 대해서 작업을 쪼개고 관리하는 소프트웨어 기술이 핵심이란 점입니다. ​ ​ 아민 바흐다트 Amin Vahdat : 두 가지로 정리해볼 수 있겠습니다. 첫 번째는 25년 전쯤 구글과 다른 곳에서 동시에 컴퓨팅 인프라가 진정한 의미로 변했다는 데에 전적으로 동의합니다. 당시 Linux 스택을 실행하는 상용 PC를 사용하여 디스크, 컴퓨팅, 네트워킹을 Scale-out했던 진정한 혁신이 있었습니다. 당시에는 상당히 급진적인 아이디어라고들 생각했는데, 이제는 모두가 당연하게 생각하는 부분입니다. ​ 두 번째로 흥미로운 점은, 지금의 AI 사이클은 그 이후 컴퓨팅을 두 번째로 재창조하는 시기라는 점입니다. 5년 후에는 하드웨어부터 소프트웨어까지 컴퓨팅 스택은 무엇이든 예전의 형태를 알아볼 수 없을 정도로 변할 것입니다.

이 자료에서 다룬 사실

2025년 10월 29일 대화에서 구글 AI 인프라 책임자 아민 바흐다트와 시스코의 지투 파텔은 AI 인프라 수요, 전력·네트워크 병목, 칩 특화와 추론 설계를 논의했다.

근거 보기 2
  1. 원문 구간 1

    목차 ​ 수요는 여전히 과소평가 되는 중 : 7~8년 된 TPU도 100% 가동되고 있는 상태 25년 만에 컴퓨팅을 재창조하는 중 : ML/System Co-design이 핵심이다 인프라 차원에서의 효율성 : 대규모 사전훈련, 추론, 강화학습, prefill, decode AI를 잘 쓰기 위해 준비할 것 : 기술이 아닌 문화적 재설정이 중요하다 아민 바흐다트 Amin Vahdat 2025년 10월 29일, 구글 AI 칩 인프라 책임자의 생각 수요는 여전히 과소평가 되는 중 7~8년 된 TPU도 100% 가동되고 있는 상태 *코멘트 → 인터뷰어인 라구 라구람(Raghu Raghuram)은 VMware에서 20년간 근무하며 2021~2023년 CEO까지 올라간 뒤 2025년 5월부터는 a16z의 General Partner로 일하고 있는 인물입니다. / 인터뷰이인 아민 바흐다트(Amin Vahdat)는 2010년부터 15년째 구글의 AI 인프라 책임자로서 TPU 및 각종 인프라를 관리하는 책임자이고, 지투 파텔(Jeetu Patel)은 JLL, Equinix의 사외이사이자 Cisco의 사장 겸 CPO로 근무 중인 인물입니다.

  2. 원문 구간 2

    ​ 라구 라구람 Raghu Raghuram : 두 분은 업계에 모두 오래 계셨고, 여러 인프라 사이클을 경험하셨는데요. 지금의 AI 사이클 같은 사이클을 본 적이 있나요? 투자자의 관점이 아니라 무언가를 실제로 구축하고 계획하는 책임자이신 기업인의 관점에서요. ​ 아민 바흐다트 Amin Vahdat : 제 생각에는 아무도 이런 규모의 사이클은 본 적이 없다고 확신합니다. 90년대~00년대 초반의 인터넷은 정말 거대한 사이클이었고, 당시에는 믿을 수 없을 정도의 구축 속도라고 느꼈었습니다. 당시 속도감과 비교할 때 지금은 100배 정도의 모멘텀을 갖고 있는 것 같습니다. 그리고 인터넷 시기 구축했던 네트워킹의 잠재적인 활용가치 대비 업사이드도 100배 정도에 달할 것이라고 생각합니다. ​ 지투 파텔 Jeetu Patel : 맞습니다. 이정도 규모, 속도, 범위에 대한 선례는 없습니다.

그렇게 판단한 이유

구형 TPU까지 100% 가동되고 전력·토지·인허가·공급망이 공급을 제한한다는 관찰, 그리고 워크로드별 칩·네트워크 요구가 다르다는 설명을 근거로 든다.

근거 보기 4
  1. 원문 구간 1

    데이터센터는 4~5년 전부터 계획을 하셔야 할텐데, 수요나 기술적인 신호를 어떻게 해석하고 계획하고 계신가요? ​ 아민 바흐다트 Amin Vahdat : 사이클 초기라고 생각합니다. 저희가 보는 수요로 추정하자면 확실히 그렇습니다. 구글은 10년 넘게 TPU를 만들어왔고 이제 7세대 생산을 시작했습니다. 내부적으로도 외부적으로도 사용되는데 7~8년 된 TPU도 100% 가동률을 보일 정도로 수요가 엄청나게 높습니다. 고객들은 누구나 가장 최신의 칩을 사용하고 싶어하지만, 얻을 수 있는 가속기라면 무엇이든 사용하고 있습니다. 수요가 엄청나다는 것도 말해주지만 공급이 부족하다는 것이기도 합니다. 할당을 거절하게 되는 분야들도 많습니다. ​ 문제는 말씀하신 것처럼, 전력에 의해 병목이 발생하고, 데이터센터를 지을 토지에 대해서 제한이 있고, 인허가에 대한 병목이 있고, 공급망의 많은 것들이 제한적이라는 데 있습니다.

  2. 원문 구간 2

    제가 걱정하는 것 중 하나는 공급이 느리기 때문에 우리 모두가 원하는 만큼 수요를 충족시키지 못할 수 있을 거란 우려입니다. 모두가 엄청난 금액을 지출하려 하지만 그게 실제로 투자로 연결될 수 있을지는 모르겠습니다. 수요 예측에 맞게 수조 달러의 자금이 투입되려 하지만 공급이 있어야 쓸 수 있을 것이라 그렇습니다. 저는 이 상황이 5년 동안 지속될 것이라 생각합니다. ​ *코멘트 → 2025년 11월 6일, 구글 전사 직원회의에서 AI 인프라 책임자인 아민 바흐다트는 앞으로 AI 제품 서비스 수요를 충족하기 위해 6개월마다 서비스 용량을 2배씩 늘려야 한다고 말했습니다. 향후 4~5년 안에 1,000배+ 증가(2^10)를 말한 것입니다. 한쪽은 고객사 수요 증가세를 보고 컴퓨팅 수요를 생각한 것이고 한쪽은 돌아온 결과를 통해 추론한 것이지만, 12월 22일 주간전략보고에서 전해드린 OpenAI's Compute Flywheel도 비슷한 속도감입니다.

  3. 원문 구간 3

    인프라 차원에서의 효율성 대규모 사전훈련, 추론, 강화학습, prefill, decode 라구 라구람 : 다음 주제로 넘어가면, 네트워킹에 대해서 생각해봅시다. Scale-up, Scale-out, Scale-across를 언급하셨는데, 네트워킹도 상당한 방식으로 혁신될 것 같습니다. 두 분께서 보고 계신 신호들을 모아서 볼 때 앞으로 네트워킹이 나아갈 방향은 무엇이라고 생각하시나요? ​ 아민 바흐다트 Amin Vahdat : 네트워킹도 특정 목적에 맞춰서 바뀔 것이라 생각합니다. 데이터센터 내에 필요한 대역폭의 규모는 정말 놀라운 수준입니다. 그리고 계속해서 높아지고만 있습니다. 네트워크가 주요 병목 현상이 되고 있다는 점은 새로운 우려이기도 합니다. 더 높은 대역폭은 더 높은 성능으로 직접적으로 이어지고 있고, 네트워크는 칩에 비해서 전력 소비는 적으면서도 전체 클러스터의 TCO 대비 퍼포먼스는 크게 높이기 때문에 와트당 활용도는 매우 높습니다.

  4. 원문 구간 4

    ​ 아민 바흐다트 Amin Vahdat : 어떻게 하는 게 좋을지 알아내려고 노력하고 있습니다. ​ 지투 파텔 Jeetu Patel : 흥미로운 분야이죠. 전력이 병목이고, 컴퓨팅이 자산이라면, 네트워크는 이들을 증폭시키는 요소입니다. 패킷 이동에 절약하는 모든 와트는 더 많은 GPU에 할당할 수 있기 때문입니다. 훈련과 추론처럼 워크로드에 따라 최적화시켜야 하는 요소가 다릅니다. 예를 들어 훈련에는 Latency를 최적화하는 게 중요하지만, 추론에서는 메모리 최적화가 훨씬 더 중요합니다. 앞으로 네트워킹 인프라는 지금까지 그랬듯이 훈련용으로 썼던 인프라를 그대로 추론에 가져다 쓰는 것이 아니라, 점차 추론 전용 네트워크로 구축되는 방향으로 진화할 거라 생각합니다. ​ 라구 라구람 : 사용 사례로 넘어가보면, 추론에 대해서 정리할 때 추론을 위해서 특정 아키텍처를 배포하고 계신가요?

발생발표·발생 후발생일 25-11-6

25-11 구글 AI 서비스 용량 증설 계획

작성자의 핵심 판단

작성자는 이 발언을 4~5년 안의 1,000배 이상 증가 인식으로 해석하며, 컴퓨팅 확보 속도가 AI 제품과 매출 확장의 조건이라는 문제의식을 제시한다.

근거 보기 1
  1. 원문 구간 1

    더 많은 컴퓨팅이 더 강한 AI, 더 나은 제품, 더 높은 매출로 연결된다는 것이고 1년에 3~4배 이상의 컴퓨팅 확보가 필요하다는 속도인식을 공유하고 있습니다. 앤트로픽의 ARR도 올해 말 $9B → 내년 $20~$26B로 전망한 것을 생각하면 1년에 ~3배 정도의 속도감입니다. ​ 라구 라구람 : 그러면 감가상각 주기에는 어떻게 대응하시나요? 수요와 감가상각 주기가 잘 일치하나요? ​ 아민 바흐다트 Amin Vahdat : 저희는 적시에 필요한 컴퓨팅만큼을 구매(Just-in-time)합니다. 중요한 건 이는 하드웨어에 대한 적시 구매이고, 전력에 대한 감가상각은 약 25~40년이므로 이점이 있습니다. ​ *코멘트 → 고객사들은 특정 랙에 맞춰서 데이터센터 전력과 냉각 밀도를 설계해야 하기 때문에, 수요추정을 한 뒤에 앞으로 몇 년간 필요할 컴퓨팅에 대해서 엔비디아, AMD, ASIC 파트너들에게 미리 요청하고 데이터센터 가동이 준비되면 칩을 인도받아 클러스터를 구축하는 식입니다.

이 자료에서 다룬 사실

원문은 2025년 11월 6일 구글 전사 직원회의에서 바흐다트가 AI 제품·서비스 수요를 맞추기 위해 서비스 용량을 6개월마다 두 배로 늘려야 한다고 말했다고 전한다.

근거 보기 1
  1. 원문 구간 1

    더 많은 컴퓨팅이 더 강한 AI, 더 나은 제품, 더 높은 매출로 연결된다는 것이고 1년에 3~4배 이상의 컴퓨팅 확보가 필요하다는 속도인식을 공유하고 있습니다. 앤트로픽의 ARR도 올해 말 $9B → 내년 $20~$26B로 전망한 것을 생각하면 1년에 ~3배 정도의 속도감입니다. ​ 라구 라구람 : 그러면 감가상각 주기에는 어떻게 대응하시나요? 수요와 감가상각 주기가 잘 일치하나요? ​ 아민 바흐다트 Amin Vahdat : 저희는 적시에 필요한 컴퓨팅만큼을 구매(Just-in-time)합니다. 중요한 건 이는 하드웨어에 대한 적시 구매이고, 전력에 대한 감가상각은 약 25~40년이므로 이점이 있습니다. ​ *코멘트 → 고객사들은 특정 랙에 맞춰서 데이터센터 전력과 냉각 밀도를 설계해야 하기 때문에, 수요추정을 한 뒤에 앞으로 몇 년간 필요할 컴퓨팅에 대해서 엔비디아, AMD, ASIC 파트너들에게 미리 요청하고 데이터센터 가동이 준비되면 칩을 인도받아 클러스터를 구축하는 식입니다.

그렇게 판단한 이유

원문은 6개월마다 두 배라는 증설 속도를 2의 10승으로 계산하고, OpenAI Compute Flywheel 및 앤트로픽 ARR 전망과 비슷한 속도감으로 비교한다.

근거 보기 1
  1. 원문 구간 1

    더 많은 컴퓨팅이 더 강한 AI, 더 나은 제품, 더 높은 매출로 연결된다는 것이고 1년에 3~4배 이상의 컴퓨팅 확보가 필요하다는 속도인식을 공유하고 있습니다. 앤트로픽의 ARR도 올해 말 $9B → 내년 $20~$26B로 전망한 것을 생각하면 1년에 ~3배 정도의 속도감입니다. ​ 라구 라구람 : 그러면 감가상각 주기에는 어떻게 대응하시나요? 수요와 감가상각 주기가 잘 일치하나요? ​ 아민 바흐다트 Amin Vahdat : 저희는 적시에 필요한 컴퓨팅만큼을 구매(Just-in-time)합니다. 중요한 건 이는 하드웨어에 대한 적시 구매이고, 전력에 대한 감가상각은 약 25~40년이므로 이점이 있습니다. ​ *코멘트 → 고객사들은 특정 랙에 맞춰서 데이터센터 전력과 냉각 밀도를 설계해야 하기 때문에, 수요추정을 한 뒤에 앞으로 몇 년간 필요할 컴퓨팅에 대해서 엔비디아, AMD, ASIC 파트너들에게 미리 요청하고 데이터센터 가동이 준비되면 칩을 인도받아 클러스터를 구축하는 식입니다.

3
사실·구조, 해석·전망, 시점 관찰, 판단 방법

지식·관점

사건 밖에서도 다시 참고하거나 다른 자료와 비교할 가치가 있는 내용을 대상과 반복 가능한 논점으로 묶습니다.

해석·전망AI 인프라 수요와 공급 제약주 대상 · 산업·업종 · AI 인프라

강한 컴퓨팅 수요가 전력·토지·인허가·공급망 제약과 만날 때 무엇이 투자 집행을 제한하는가?

이 자료가 더한 내용

수요가 강해도 전력·토지·인허가·공급망이 느리면 원하는 만큼 공급할 수 없고, 지출 의사가 실제 투자로 이어지려면 공급이 필요하다는 해석을 제시한다.

근거 보기 2
  1. 원문 구간 1

    데이터센터는 4~5년 전부터 계획을 하셔야 할텐데, 수요나 기술적인 신호를 어떻게 해석하고 계획하고 계신가요? ​ 아민 바흐다트 Amin Vahdat : 사이클 초기라고 생각합니다. 저희가 보는 수요로 추정하자면 확실히 그렇습니다. 구글은 10년 넘게 TPU를 만들어왔고 이제 7세대 생산을 시작했습니다. 내부적으로도 외부적으로도 사용되는데 7~8년 된 TPU도 100% 가동률을 보일 정도로 수요가 엄청나게 높습니다. 고객들은 누구나 가장 최신의 칩을 사용하고 싶어하지만, 얻을 수 있는 가속기라면 무엇이든 사용하고 있습니다. 수요가 엄청나다는 것도 말해주지만 공급이 부족하다는 것이기도 합니다. 할당을 거절하게 되는 분야들도 많습니다. ​ 문제는 말씀하신 것처럼, 전력에 의해 병목이 발생하고, 데이터센터를 지을 토지에 대해서 제한이 있고, 인허가에 대한 병목이 있고, 공급망의 많은 것들이 제한적이라는 데 있습니다.

  2. 원문 구간 2

    제가 걱정하는 것 중 하나는 공급이 느리기 때문에 우리 모두가 원하는 만큼 수요를 충족시키지 못할 수 있을 거란 우려입니다. 모두가 엄청난 금액을 지출하려 하지만 그게 실제로 투자로 연결될 수 있을지는 모르겠습니다. 수요 예측에 맞게 수조 달러의 자금이 투입되려 하지만 공급이 있어야 쓸 수 있을 것이라 그렇습니다. 저는 이 상황이 5년 동안 지속될 것이라 생각합니다. ​ *코멘트 → 2025년 11월 6일, 구글 전사 직원회의에서 AI 인프라 책임자인 아민 바흐다트는 앞으로 AI 제품 서비스 수요를 충족하기 위해 6개월마다 서비스 용량을 2배씩 늘려야 한다고 말했습니다. 향후 4~5년 안에 1,000배+ 증가(2^10)를 말한 것입니다. 한쪽은 고객사 수요 증가세를 보고 컴퓨팅 수요를 생각한 것이고 한쪽은 돌아온 결과를 통해 추론한 것이지만, 12월 22일 주간전략보고에서 전해드린 OpenAI's Compute Flywheel도 비슷한 속도감입니다.

사실·구조AI 데이터센터 네트워크 토폴로지주 대상 · 기술·제품 · AI 데이터센터 네트워크

전력 입지의 분산은 데이터센터 연결 방식에 어떤 수요를 만드는가?

이 자료가 더한 내용

전력이 있는 곳으로 데이터센터가 분산되면서 Scale-up, Scale-out, 최대 800~900km를 잇는 Scale-across 수요가 함께 증가한다는 구조를 설명한다.

근거 보기 2
  1. 원문 구간 1

    대략 2년차부터는 해당 GPU가 상대적으로 사양 민감도가 낮은 워크로드로 계속해서 재배치(Cascading)되어 지속적으로 활용되기 때문에, 6년이라는 기간 동안 경제적 가치는 충분히 유지되는 구조입니다. ​ 지투 파텔 Jeetu Patel : 네트워킹 측면에 대해서 말씀드리자면, 하이퍼스케일러, 네오클라우드, 엔터프라이즈로 고객들을 나눠 볼 때 얘기들이 상당히 많이 다르다고 생각합니다. 엔터프라이즈는 인프라 구축 단계에 있어서 상당한 초기 단계입니다. 이들이 자체 데이터센터를 구축 및 업그레이드 하는 주기가 생길 것인데, 기존 CPU 데이터센터에 비해서 랙당 전력 및 냉각 요구사항이 매우 다르기 때문입니다. ​ *엔터프라이즈 AI 자료 → <AI 버블론을 잠재우는 숫자들 : 엔터프라이즈 AI $37B 시장의 현주소> ​ 그리고 전력, 컴퓨팅, 네트워크의 희소성에 대해서는 저도 아민의 의견과 같습니다.

  2. 원문 구간 2

    여기에 덧붙여서 보면, 지금 당장은 한 곳에 충분한 전력이 없기 때문에 데이터센터가 지어질 곳으로 전력을 가져오는 게 아니라, 데이터센터가 전력이 충분한 곳에 지어지고 있습니다. 전 세계적으로 프로젝트가 분산되는 이유입니다. ​ 데이터센터들이 점점 더 멀리 떨어져서 지어진다는 게 특징인데, 이 과정에서 단일 부지에 ⓐ랙당 더 많은 네트워킹을 가진 Scale-up Network 수요가 크게 증가하고 있고, ⓑ여러 랙과 클러스터를 연결하는 Scale-out에 대한 수요도 증가하고 있으며, ⓒ최대 800~900km 가량 떨어진 두 개의 데이터센터를 하나의 논리적인 데이터센터로 만드는 Scale-across에 대한 수요도 증가하고 있습니다. ​ *Scale-up, Scale-out, Scale-across에 대한 자료 → <엔비디아 3Q25 실적발표 : 2026년 말까지 "SOLD OUT", 젠슨황이 $500B 매출을 확신하는 이유>

사실·구조ML/System 공동 설계주 대상 · 산업·업종 · AI 컴퓨팅 인프라

AI 컴퓨팅 스택은 왜 하드웨어와 소프트웨어를 함께 설계해야 하는가?

이 자료가 더한 내용

대형 GPU·TPU 클러스터는 일부만 나눠 쓰는 Scale-out 구조이고, 수만 가속기의 작업을 나누는 소프트웨어와 하드웨어의 공동 설계가 다음 스택의 핵심이라는 설명이다.

근거 보기 4
  1. 원문 구간 1

    25년 만에 컴퓨팅을 재창조하는 중 ML/System Co-design이 핵심이다 라구 라구람 : 다음 주제인 시스템과 네트워킹의 미래로 이어지는데요. 구글은 웹 혁명을 위한 최초의, 대규모 Scale-out 상용 서버를 생산했고, 엔비디아는 다른 형태이지만 메인프레임을 되살리는 중입니다. 다음에는 무슨 일이 일어날 거라 보시나요? ​ 아민 바흐다트 Amin Vahdat : 글쎄요. 메인프레임으로 돌아가고 있다고 생각하진 않습니다. 사람들은 여전히 여러 풀에 걸쳐서 Scale-out 아키텍처로 구성된 클러스터를 사용하고 있습니다. GPU나 TPU를 갖고 있더라도 전체 GPU 슈퍼컴퓨터를 사용하는 사람만 있는 것은 아닙니다. 예를 들어, GPU 16,384개(HGX 8-GPU 1개 랙 * 2048개 rack-to-rack 연결)로 구성한 하나의 클러스터가 있다면 그중 일부를 가져다 쓰는 식입니다.

  2. 원문 구간 2

    많은 경우에 균일한 연결성을 갖고 있으며 매우 유연하고 확장 가능한 컴퓨팅입니다. TPU도 마찬가지입니다. 여기서의 핵심은 소프트웨어의 Scale-out입니다. ​ *코멘트 → 메인프레임은 하나의 거대하고 강력한 단일 시스템입니다. 성능을 높이려면 더 크고 비싼 부품으로 교체해야 하고(Scale-up), 시스템 전체가 하나로 묶여 있어 쪼개 쓰거나 유연하게 확장하기 어렵습니다. 아민은 현재 GPU/TPU 클러스터가 아무리 커졌더라도 본질적으로는 클러스터를 쪼개서 쓸 수 있는 Scale-out 구조를 따르고 있다고 말했습니다. ​ *코멘트 → 아민은 두 가지 때문에 메인프레임이 아니라고 말했습니다. ⓐ클러스터는 거대하지만 사용자가 전체를 빌려서 쓰는 구조가 아니라 그렇습니다. 그중 8개, 128개 등 일부만 떼서 사용할 수 있습니다. ⓑ메인프레임은 내부 부품끼리만 연결되어 있었는데, 지금은 수만 개의 칩이 하나처럼 연결하는 네트워킹 인프라와 함께 발전했습니다.

  3. 원문 구간 3

    논리적으로는 하나처럼 움직입니다. 그리고 이를 가능하게 하는 건 수만 개의 가속기에 대해서 작업을 쪼개고 관리하는 소프트웨어 기술이 핵심이란 점입니다. ​ ​ 아민 바흐다트 Amin Vahdat : 두 가지로 정리해볼 수 있겠습니다. 첫 번째는 25년 전쯤 구글과 다른 곳에서 동시에 컴퓨팅 인프라가 진정한 의미로 변했다는 데에 전적으로 동의합니다. 당시 Linux 스택을 실행하는 상용 PC를 사용하여 디스크, 컴퓨팅, 네트워킹을 Scale-out했던 진정한 혁신이 있었습니다. 당시에는 상당히 급진적인 아이디어라고들 생각했는데, 이제는 모두가 당연하게 생각하는 부분입니다. ​ 두 번째로 흥미로운 점은, 지금의 AI 사이클은 그 이후 컴퓨팅을 두 번째로 재창조하는 시기라는 점입니다. 5년 후에는 하드웨어부터 소프트웨어까지 컴퓨팅 스택은 무엇이든 예전의 형태를 알아볼 수 없을 정도로 변할 것입니다.

  4. 원문 구간 4

    그리고 이 과정에서는 ML/System Co-design이 중요합니다. 구글의 예시를 들어서 설명드리자면, Big table, Spanner, GFS, Borg, Colossus 같은 소프트웨어는 하드웨어와 소프트웨어간 공동 설계 없이는 불가능했을 것입니다. 이러한 작업은 AI 시대에도 동일하게 발생할 것입니다. ​ *코멘트 → Bigtable은 대규모 구조화 데이터를 저장하기 위한 분산형 스토리지이고, Spanner는 여러 지역에 데이터를 복제하면서도 하나의 DB처럼 쓸 수 있게 해주는 것, Google File System은 많은 머신을 오가는 워크로드의 throughput을 높이기 위해 장애를 허용하면서도 대규모 데이터 처리를 돕는 분산 파일 시스템, Borg는 구글 내 클러스터 스케줄러 및 오케스트레이터, Colossus는 GFS를 잇는 차세대 파일 시스템입니다.

해석·전망특화 AI 칩의 효율과 개발 주기주 대상 · 기술·제품 · AI 가속기

워크로드 특화 칩은 어떤 효율과 시간 제약을 함께 갖는가?

이 자료가 더한 내용

TPU처럼 특정 연산의 와트당 효율을 높이는 특화는 전력·비용·공간 절감의 이점이 있지만, 개념부터 양산까지 약 2년 반이 걸리고 미래 워크로드를 예측해야 한다는 해석이다.

근거 보기 3
  1. 원문 구간 1

    ​ 예를 들어, 구글 같은 하이퍼스케일러와 협력할 때 저희는 거래가 성사되기 한참 전부터 심층적인 설계 파트너십을 맺고 몇 개월 동안 로드맵에 대해서 공유합니다. 이처럼 업계는 이미 폐쇄적인 환경에서 개발하고 있지 않고, 점점 더 개방형 생태계에서 운영하고 있습니다. 하드웨어부터 소프트웨어까지 긴밀한 협력을 위해서 점점 더 많은 것들이 오픈되고 결합될 거라 생각합니다. ​ 라구 라구람 : 투자자들이 가장 흥미로워 하는 주제는 칩에 대한 것입니다. 현재 엄청난 시장 점유율을 가진 놀라운 프로세서를 생산하는 칩 메이커가 있습니다. 그리고 스타트업들이 온갖 종류의 AI 칩을 개발하고 있는 것들도 보고 있으며, 구글의 폐쇄적인 정원에도 놀라운 프로세서가 있습니다. 이런 칩 분야에서는 앞으로 어떤 일이 일어날 거라고 생각하시나요? ​

  2. 원문 구간 2

    아민 바흐다트 Amin Vahdat : *웃음* 우선, 저희는 엔비디아의 열렬한 팬입니다. 엔비디아 제품과 칩을 정말 많이 판매하고 있고, 고객들이 그 제품을 좋아하기 때문에 그렇습니다. 그리고 저희는 TPU도 계속해서 발전시키고 있습니다. 미래는 정말 흥미로울 거라 느끼는데, GPU, TPU, Trainium 등 다양한 칩들이 생긴다고 해서 단일 기업의 정점이 올 거라고 느끼지 않습니다. ​ 지금은 진정한 특화(Specialization)의 황금기입니다. 제가 가장 잘 아는 TPU를 예로 들자면, 특정 연산의 경우 와트당 효율성이 10~100배 더 높습니다. 구글에서 많이 시행되는 다양한 제품이나 에이전트 워크로드 같은 것도 좀 더 특화시킨 아키텍처와 좀 더 특화시킨 칩을 통해서 많은 이점을 얻을 수 있습니다. ​ 이 분야에서 실제 병목은 워크로드에 전문화된 아키텍처를 구현하는 것이 얼마나 어려우며, 현실 속 혁신의 속도에 비해서 시간이 매우 많이 걸린다는 부분입니다.

  3. 원문 구간 3

    지금은 거의 영원한 수준입니다. 세계 최고의 팀을 기준으로 하더라도 개념을 설정하고 실제 양산에 이르기까지 빛의 속도로 개발한다고 볼 때 2년 반이 걸립니다. 모든 것을 완벽하게 해낸다는 가정 하에 말입니다. ​ 지금 그렇게 하는 팀은 아주 소수(a few team)있지만, 전문화된 하드웨어를 구축하기 위해 2년 반 뒤의 미래를 어떻게 예측할 수 있을 것이냐의 문제입니다. 그래서 ⓐ개발 주기를 더 단축시킬 수 있어야 한다고 생각하지만 ⓑ개발이 조금씩 더 느려지더라도 전력 절감, 비용 절감, 공간 절감이 엄청나게 무시할 수 없을 수준이기 때문에 더 많은 특화된 아키텍처가 개발될 것으로 예상합니다. ​ *코멘트 → 엔비디아의 정체성이 처음에 GPU로 시작했다보니 시장에서도 편의상 'GPU'라고 많이 언급되는데, 실제로는 Tensor Core로 가득찬 TPU입니다.

사실·구조AI 워크로드별 네트워크 설계주 대상 · 산업·업종 · AI 네트워킹

훈련·추론·강화학습은 왜 네트워크의 같은 최적화 기준을 공유하지 않는가?

이 자료가 더한 내용

훈련에는 지연시간, 추론에는 메모리 최적화가 더 중요하며, 버스티한 사전훈련과 유휴 대규모 용량 문제 때문에 추론 전용 네트워크로의 진화가 제시된다.

근거 보기 5
  1. 원문 구간 1

    인프라 차원에서의 효율성 대규모 사전훈련, 추론, 강화학습, prefill, decode 라구 라구람 : 다음 주제로 넘어가면, 네트워킹에 대해서 생각해봅시다. Scale-up, Scale-out, Scale-across를 언급하셨는데, 네트워킹도 상당한 방식으로 혁신될 것 같습니다. 두 분께서 보고 계신 신호들을 모아서 볼 때 앞으로 네트워킹이 나아갈 방향은 무엇이라고 생각하시나요? ​ 아민 바흐다트 Amin Vahdat : 네트워킹도 특정 목적에 맞춰서 바뀔 것이라 생각합니다. 데이터센터 내에 필요한 대역폭의 규모는 정말 놀라운 수준입니다. 그리고 계속해서 높아지고만 있습니다. 네트워크가 주요 병목 현상이 되고 있다는 점은 새로운 우려이기도 합니다. 더 높은 대역폭은 더 높은 성능으로 직접적으로 이어지고 있고, 네트워크는 칩에 비해서 전력 소비는 적으면서도 전체 클러스터의 TCO 대비 퍼포먼스는 크게 높이기 때문에 와트당 활용도는 매우 높습니다.

  2. 원문 구간 2

    조금만 투자해도 훨씬 더 많은 것을 얻을 수 있다는 의미입니다. ​ AI 워크로드는 네트워크 통신 패턴에 대해서 사전에 알고 있다는 게 엄청난 기회입니다. 예를 들어서, 어떤 식으로 통신할지를 미리 세팅할 수 있다면 패킷 내의 스위치의 모든 기능이 필요한지에 대해서 의문을 가져볼 수 있고, 여기서도 최적화 시킬 수 있는 기회들이 많을 거란 의미입니다. ​ AI 훈련용 워크로드는 놀라울 정도로 Busty합니다. 컴퓨팅을 잔뜩 수행하다가, 갑자기 멈추고 대규모 네트워크 통신을 수행하고, 다시 컴퓨팅으로 전환됩니다. 수십~수백MW급 규모의 클러스터가 한 번에 연산했다가 한 번에 쉬고 하기 때문에, 전력 유틸리티 기업들이 구글 외부에서 이렇게 멈추는 과정을 알아낼 수 있을 정도입니다. 짧은 시간 동안 0% → 100%를 오가는 네트워크를 어떻게 구축하는 것이 효율적인가에 대한 난제가 있습니다.

  3. 원문 구간 3

    ​ 그리고 네트워크 구축 과정에서도 난제가 있습니다. 대규모 사전훈련은 1년 내내 데이터센터 사이트 전체에서 수행되지 않습니다. 예를 들어서, 프론티어 모델을 대규모 사전훈련하기 위해서 최신 칩과 최신 네트워킹을 세 곳의 데이터센터에 구축했다고 가정해봅니다. 그리고 더 최신 칩과 네트워킹으로 새로운 모델을 훈련시켜야 할 겁니다. 남겨진 기존 네트워크에서도 충분한 워크로드 가동이 있겠지만, 대규모 사전훈련에 필요했던 규모만큼의 용량이 필요하진 않습니다. 그렇다면 전체 데이터센터의 생애주기 중에서 5%의 시간에만 대규모 네트워크가 필요한 것인데 이에 대해서 어떻게 더 활용할지에 대한 해결책이 난제입니다. ​ 혹시 여러분 중에 아시는 분이 계시다면 알려주시면 감사하겠습니다. 고민입니다. ​ 라구 라구람 : 저희가 모르면 아무도 모를 것 같은데요?

  4. 원문 구간 4

    ​ 아민 바흐다트 Amin Vahdat : 어떻게 하는 게 좋을지 알아내려고 노력하고 있습니다. ​ 지투 파텔 Jeetu Patel : 흥미로운 분야이죠. 전력이 병목이고, 컴퓨팅이 자산이라면, 네트워크는 이들을 증폭시키는 요소입니다. 패킷 이동에 절약하는 모든 와트는 더 많은 GPU에 할당할 수 있기 때문입니다. 훈련과 추론처럼 워크로드에 따라 최적화시켜야 하는 요소가 다릅니다. 예를 들어 훈련에는 Latency를 최적화하는 게 중요하지만, 추론에서는 메모리 최적화가 훨씬 더 중요합니다. 앞으로 네트워킹 인프라는 지금까지 그랬듯이 훈련용으로 썼던 인프라를 그대로 추론에 가져다 쓰는 것이 아니라, 점차 추론 전용 네트워크로 구축되는 방향으로 진화할 거라 생각합니다. ​ 라구 라구람 : 사용 사례로 넘어가보면, 추론에 대해서 정리할 때 추론을 위해서 특정 아키텍처를 배포하고 계신가요?

  5. 원문 구간 5

    아니면 여전히 훈련에서 쓰는 아키텍처를 추론에도 쓰는 중인가요? ​ 아민 바흐다트 Amin Vahdat : 구글은 추론을 위해 특화된 아키텍처를 배포하고 있으며(훈련용 v6p, 추론용 v6e), 하드웨어만큼 소프트웨어에서도 추론용 소프트웨어에도 노력하고 있습니다. 추론 워크로드 중 하나로서 정말 흥미로워지고 있는 포인트는 강화학습입니다. 서빙 워크로드들 중에 ​​강화학습이 차지하는 비중(Reasoning)이 늘고 있는데, 강화학습은 지연시간이 절대적으로 중요(Test-time compute는 훈련과 비슷)한 것이라 중요합니다. 시스템 구축 및 연결 방식에서 네트워킹이 점점 더 핵심적인 역할을 하고 있습니다. ​ *코멘트 → 12월 8일 주간전략보고를 통해 전해드린 것처럼, Sparse MoE & Reasoning 워크로드에 대해서는 NVLink를 통한 All-to-All 연결이 갖는 장점이 뚜렷한 구조입니다.

해석·전망엔비디아의 분산 추론 설계주 대상 · 기업·종목 · 엔비디아관련 대상 · 기술·제품 · 분산 추론

Prefill과 Decode를 나누는 설계는 추론 시스템의 비용·자원 활용을 어떻게 바꾸는가?

이 자료가 더한 내용

작성자는 Prefill을 전용 CPX, Decode를 Rubin GPU에 배정하고 캐시를 옮기는 분산 설계가 비용과 자원 효율을 높이며, 복잡한 추론에서 엔비디아의 통합 역량이 더 중요해질 것으로 예상한다.

근거 보기 5
  1. 원문 구간 1

    오픈AI는 이제 추론의 효율을 극한까지 끌어올리기 위해 알리바바가 Qwen-Next에서 512개의 expert를 만드는 사이 GPT-6부터는 2,048개의 expert를 둘 것으로 예상합니다. ​ 라구 라구람 : 추론 비용을 1,000배 낮추는 데 필요한 단일 병목지점이 있나요? 아니면 여러 분야에서 추론 비용을 낮춰가는 곡선처럼 구성되어 있나요? ​ 아민 바흐다트 Amin Vahdat : 추론은 두 가지 분야로 나뉩니다. 아마 익숙하시겠지만, Prefill과 Decode는 매우 매우 다른 워크로드입니다. 균형점이 다릅니다. 그래서 사실 이상적으로는 두 가지 다른 하드웨어로 추론하는 것이 중요합니다. 그게 하나의 기회입니다. ​ *코멘트 → Rubin CPX(4Q26 출시 예정)는 분산 추론(Disaggregated Inference)의 시작을 알린 칩입니다.

  2. 원문 구간 2

    Transformer 계열 LLM의 추론은 크게 두 가지 작업으로 분리됩니다. Prefill과 Decode입니다. ​ 워크로드별로 특징을 보면 Prefill은 컴퓨팅이 많이 필요하고, 상대적으로 메모리 대역폭은 낮아도 됩니다. 그래서 비싼 HBM을 사용하는 대신 CPX에는 128GB GDDR7(대역폭 2TB/s)을 탑재했습니다. HBM 절반 가격으로 만든 칩이고, R200 GPU 대비 4분의 1 가격으로 동일 작업을 수행합니다. 그리고 Decode는 메모리 대역폭을 많이 필요로 합니다. HBM에 적합하기에 R200에는 여전히 288GB HBM4(대역폭 20.5TB/s)가 탑재됩니다. ​ 기존의 방식은 Aggregated로, Prefill 및 Decode 작업을 단일 GPU에서 동시 처리하는 식이었습니다.

  3. 원문 구간 3

    Prefill은 계산량이 많아 병렬성이 낮고, Decode는 KV Cache를 사용할 수 있기 때문에 병렬성이 상대적으로 높은 워크로드입니다. 문제는 단일 아키텍처이기 때문에 유연성이 부족하고 병목이 생긴다는 점이 문제였습니다. ​ 새로운 방식은 Disaggregated로, Prefill과 Decode 작업 중에 Prefill을 전용 하드웨어로 분리하는 게 핵심입니다. Prefill에 맞게 따로 특화시킨 CPX 칩에서 계산에 최적화된 작업을 하고, 병렬성이 높은 Decode 작업은 기존 Rubin GPU에 배정하는 것입니다. 이렇게 되면 KV Cache를 HBM 대신 GDRR7처럼 더 저렴한 스토리지로 옮겨서 GPU 메모리를 확보할 수 있게 됩니다. 워크로드에도 다양한 하드웨어간 스마트 라우팅으로 유연한 확장을 할 수 있다는 게 핵심입니다.

  4. 원문 구간 4

    ​ 이를 위해 엔비디아는 소프트웨어 레벨에서 ⓐSmart Router, ⓑKV Cache Manager, ⓒGPU Resource Planner를 추가하여 LLM 추론 과정에서 Prefill과 Decode를 분산하여 처리하고, KV Cache를 GPU 메모리에서 오프로딩하여 GPU 리소스를 최적화하는 아키텍처입니다. 이렇게 하면 대규모 사용자 처리, 모델 확장성, 리소스 효율성이 모두 개선됩니다. 이전에 비해 Prefill 비용이 절감되므로 ROI가 30~50배 증가하고, 전체 시스템 단위 효율은 3~7.5배 좋아졌습니다. ​ 기존의 칩들과 전혀 다른 구조이기 때문에 이제 모든 ASIC 플레이어들은 엔비디아와의 'TCO 대비 퍼포먼스' 비교에서 엔비디아를 따라가기 위해 자체적인 Prefill ASIC을 동시에 개발해야 하는 상황이 시작됐습니다.

  5. 원문 구간 5

    그리고 이제 추론에서도 엔비디아가 깔아둔 분산형 추론 설계를 채택할 경우 훨씬 더 TCO 대비 퍼포먼스가 우수해질 것입니다. 추론이 점점 복잡해질수록 훈련에서처럼 엔비디아가 가진 하드웨어·소프트웨어·네트워킹·공급망 관리 차원의 해자가 점점 더 강해질 것으로 예상합니다. ​ 그리고 개인적으로 다년간에 걸쳐서 향후 Decode용 칩도 따로 설계될 것으로 예상합니다. 대만에서 유능한 ASIC 인재들을 수천 명 모아서 AI 연구소가 첫 번째로 출시한 칩이 CPX일 뿐입니다. 엔비디아가 ASIC 팀을 준비 중이라는 내용은 2024년 4월 업계에 처음으로 팀 빌딩에 대해 알려졌고 → 2025년 1월에 대만에 1,000명 규모 대규모 R&D 연구소를 꾸리면서 공식 확인됐던 내용입니다.

해석·전망AI 컴퓨팅 비용과 제번스의 역설주 대상 · 산업·업종 · AI 컴퓨팅

컴퓨팅 단위비용 하락이 왜 사용량 감소가 아니라 새 수요로 이어질 수 있는가?

이 자료가 더한 내용

작성자는 더 낮은 OPEX가 수익성 있는 사용 사례를 늘려 지출을 키운다는 제번스의 역설로, 추론 효율 향상 뒤에도 더 높은 품질과 더 긴 자율 실행을 원하는 수요를 해석한다.

근거 보기 4
  1. 원문 구간 1

    당시 MediaTek, Alchip, GUC쪽 대만 ASIC 인재를 블랙홀처럼 빨아들였던 것의 결과가 4Q26에 출시될 Rubin CPX로 연결됐습니다. ​ 아민 바흐다트 Amin Vahdat : 다만, 많은 분들이 깨닫지 못하는 것은 실제로 우리는 추론 비용을 엄청나게 빠른 속도로 절감하고 있다는 것입니다. 100배씩 대규모로 절감하고 있습니다. 문제는 사용자들이 더 효율성이 높은 모델을 원하는 게 아니라, 더 높은 퀄리티를 계속해서 요구한다는 점입니다. 기존의 모델에 대한 효율성을 100배씩 이상 개선시키자마자, 차세대 모델이 출시되고, 달러당 지능은 훨씬 더 높아지지만 여전히 더 많은 비용을 지불하게 되는 사이클이 반복되고 있습니다. ​ 지투 파텔 Jeetu Patel : 그리고 추론시간이 길어질수록 사용자들은 더 조급해하고 있습니다.

  2. 원문 구간 2

    예를 들어, 이전에 Deep Research를 써서는 20분 정도씩 추론하여 하나의 리서치를 완료했습니다. 이제는 코딩 도구들을 보면 7시간~30시간까지도 자율적으로 에이전트가 실행하며 답을 찾아내옵니다. 이런 자율 실행 시간이 길어질수록 그 시간을 압축하려는 더 큰 수요가 발생하고 있습니다. ​ 끊임 없는 루프입니다. 지능을 높이기 위해 더 길게 생각하고, 더 많은 도구를 사용하게 되는데, 그러면 사용자는 그 시간을 단축시켜주길 원합니다. 더 높은 지능, 더 많은 사용 사례를 가질수록 더 많은 추론 수요를 필요로 하는 일종의 자기 충족적인 예언과도 같으며 추론에 대한 수요는 영속적일 거라 생각합니다. ​ 제번스의 역설 Jevons Paradox 엔비디아의 제품전략에 대해서 깊게 생각해보셨다면, 직관에는 맞지 않는 포인트가 하나 있습니다.

  3. 원문 구간 3

    Ampere → Hopper → Blackwell로 오면서 제품 가격은 결과적으로 점점 더 비싸졌는데 단위당 컴퓨팅 비용은 더 줄어드는 쪽으로 개발하고 있습니다. 그렇다면 엔비디아는 GPU를 쓰는 워크로드가 계속해서 늘어날 것을 가정한다는 이야기입니다. 이것이 엔비디아 소프트웨어 개발자들이 산업 일선에서 고객들과 끊임없이 소통하며 CUDA가 사용되는 사례를 늘리고 혁신에 앞장서는 기업인 이유이기도 하지만, 여기엔 조금 더 생각해볼 게 있습니다. ​ 산업혁명 시대 제번스의 역설이 재밌는 힌트였습니다. 과거에도 늘 비슷한 일들이 있어왔기 때문입니다. 1865년에 영국의 경제학자 윌리엄 스탠리 제번스William Stanley Jevons는 새로운 사회 현상을 발견했고 이를 논문으로 옮겼습니다.

  4. 원문 구간 4

    석탄 사용의 효율성이 계속해서 높아지면 석탄 사용이 줄어들 거라 생각하지만, 그렇지 않고 오히려 석탄 소비량이 더 늘었다는 것입니다. 증기엔진이 효율적으로 변할 수록 더 많은 석탄을 쓰는 결과로 이어졌습니다. 비밀은 효율에 있었습니다. ​ 증기 엔진을 더 효율적으로 만들면 OPEX가 감소하고 → OPEX를 줄이면 수익성 있는 사용 사례가 증가하니 더 많이 지출한다는 것입니다. 클라우드 컴퓨팅, 이커머스, 핀테크의 역사에도 적용되는 이야기이며, 엔비디아가 컴퓨팅의 한계비용을 0으로 만들수록 계속해서 더 많은 사용 사례가 생겨나는 이유이기도 합니다. ​ 제번스의 역설은 기본적으로 산업혁명 시기부터 계속되어 왔던 노동 덩어리의 오류(Lump of labor fallacy)'와도 맞닿아 있습니다.

판단 방법AI 도입의 문화적 재설정주 대상 · 투자판단·운용 · AI 도입 방법

AI 도구 도입에서 기술 성능 외에 조직이 반복적으로 확인해야 할 것은 무엇인가?

이 자료가 더한 내용

구글·시스코의 코드 마이그레이션 사례를 통해 일부 도구의 한계는 남지만, 안 된다는 판단을 오래 방치하지 않고 짧은 주기로 재시험하며 미래 도구 수준을 미리 상정하는 문화가 중요하다고 설명한다.

근거 보기 5
  1. 원문 구간 1

    이 오류는 주어진 시간에 경제에서 수행할 노동의 총량이 정해져있으며, 그 일을 두고 기계와 사람이 경쟁한다는 오해에서 시작됩니다. 기계가 할 일이 늘어난 만큼 사람이 할 일이 없어질 거라는 생각입니다. AI를 잘 쓰기 위해 준비할 것 기술이 아닌 문화적 재설정이 중요하다 라구 라구람 : 현재 사용 가능한 모든 AI를 통해서, 얻고 있는 성과 중에 가장 중요한 성과는 무엇이신가요? 구글 내부적으로, 시스코 내부적으로 무엇을 얻고 있는지 궁금합니다. ​ 아민 바흐다트 Amin Vahdat : 코딩은 AI의 가장 명확한 사용 사례입니다. 활용도나 역량도 점점 더 높아지고 있습니다. 가장 최근의 프로젝트를 보자면, 며칠 전에 AI를 사용하여 명령어 세트 마이그레이션을 수행하는 방법에 대한 논문을 발표했습니다.

  2. 원문 구간 2

    x86 → ARM으로 상당히 대규모의 마이그레이션을 수행했는데, 이를 통해서 구글의 엄청난 코드베이스 전체를 명령어 집합에 구애받지 않도록 만들었습니다. 저희는 모든 코드 베이스가 그렇게 되기를 원하고 있습니다. 이에 대한 동기는 몇 년 전으로 거슬러 올라갑니다. ​ 저희는 Bigtable이란 놀라운 레거시 시스템과, Spanner라는 놀라운 시스템을 갖고 있었습니다. 그리고 당시 구글에서는 Bigtable에서 Spanner로 모두 이동해야 한다는 결정을 내렸습니다. 그래서 마이그레이션을 하는 데 얼마가 걸리는지를 추정했더니, 팀원 7명이 수천년 이상을 투입해야 마이그레이션할 수 있는 정도였습니다. 저희 엔지니어는 게으르지 않습니다.

  3. 원문 구간 3

    기회비용이 너무 크다고 생각하여 마이그레이션을 포기하고 Bigtable에 남기로 결정했던 시점이었습니다. ​ 구글 내에서는 계속해서 코드베이스 마이그레이션을 꽤나 자주 합니다. TensorFlow → JAX로 마이그레이션을 하는 일도 많았는데, 이 과정에서는 AI를 통해 훨씬 더 빠르게 마이그레이션을 수행할 수 있엇습니다. 어떤 AI 도구는 아직 구글 엔지니어들에게 내부적으로 대규모 배포하여 사용하기에는 기준에 미치지 못하는 것들도 있지만, 계속해서 사용 사례나 대체정도는 점점 더 커지고 있습니다. ​ ​ 지투 파텔 Jeetu Patel : 시스코에서는 코드 마이그레이션도 많이 하고, 지금도 활용 가능성이 높은 3~4가지 정말 좋은 사용 사례를 보고 있고 아직 안 되는 것들인제 관심있게 보는 것들도 있습니다.

  4. 원문 구간 4

    코드 마이그레이션에는 Codex, Claude, Cursor, Windsurf의 조합을 많이 쓰고 있습니다. 디버깅은 CLI를 사용하면 훨씬 더 생산적으로 쓰고 있습니다. 프론트엔드에서 다루는 코드 프로젝트는 훨씬 더 잘 먹힙니다. 엔지니어들의 생산성을 엄청나게 끌어올리고 있습니다. 다만, 오래된 코드, 특히 인프라 스택의 깊은 곳으로 다가가면 AI를 사용하기가 훨씬 어렵습니다. ​ 저희가 엔지니어에게 지시하는 것은 사실 기술적인 문제를 지시하기보다, 문화적인 재설정을 강조하고 있습니다. 누군가가 무언가 AI를 사용해보고 '제대로 작동하지 않습니다'라고 말한다고 해서 이걸 6~9개월 동안 방치해서는 안됩니다.

  5. 원문 구간 5

    4주 안에 다시 돌아와서 다시 작동해보고 통하는지 확인해봐야 합니다. 모델이나 도구들이 발전하는 속도가 너무 빠르기 때문에 거의 이런 식으로 해야 생산성을 크게 끌어올릴 수 있습니다. ​ 오늘도 150명의 뛰어난 엔지니어들과 있었는데 제가 이들에게 요구한 건, 이 AI 도구들이 6개월 안에 무한하게 좋아질 것이라고 가정하라는 것이었습니다. 그리고 6개월 후 AI로 시킬 수 있을 것들은 무엇이 있을지를 미리 생각해보게 하는 것이 중요합니다. 지금 단기에 보고 안된다고 포기하는 것은 거대한 전략적 오류라고 생각합니다. 시스코는 내부적으로 25,000명의 엔지니어와 함께 일하고 있습니다. 내년 안에 엔지니어들의 생산성을 2~3배 높일 수 있기를 바라며, 실제로 어떻게 되는지 지켜볼만 하실 거라 생각합니다.

4

시간흐름대로 모든 내용을 살려 정리

시간흐름대로 모든 내용을 살려 정리

1
자료의 출발점

[원문 유형] 네이버 프리미엄 콘텐츠
[채널] 올바른 미국주식 by SAPIENS
[게시일] 2025.12.24. 오후 3:31
[원문 URL] https://contents.premium.naver.com/sapiens/sapiensasset/contents/251224153133074jm
[제목] 구글 AI 인프라 책임자의 경고 : '우리는 여전히 수요를 심각하게 과소평가하고 있다'
[수집 기준] 승인된 구독 열람권으로 실제 본문을 보존했다. 이미지·첨부는 별도 미디어 원장에 보관하며 시각적 의미 검토 여부를 구분한다.
[구독 원문 본문]
안녕하세요 올바른입니다.
AI 심화편 자료입니다. a16z에서 구글의 TPU 인프라 책임자인 아민 바흐다트, 시스코의 사장 겸 CPO인 지투 파텔과 AI 인프라의 현재와 미래에 대해서 말했습니다.
TPU의 탄생부터 함께 해온 구글 인프라 책임자 바흐다트는 추론용 컴퓨팅 수요는 6개월마다 2배씩 증가하고 있으며, 5년 뒤에는 총 1,000배의 컴퓨팅을 필요로 할 것을 전망했습니다.

2
연결 자료와 고지

​
25년 만의 컴퓨팅 재창조가 일어나는 과정입니다. 전력과 네트워킹에 대한 수요를 들어보고, 아민 바흐다트가 고민하고 있는 대규모 사전훈련 및 제번스의 역설을 정리했습니다.
AI 사이클 : 전체 흐름 이해하기
2025-12-19
블랙록 2026 전망 : AI CAPEX $8T 시대를 열기 위한 '금융 보릿고개'를 지나는 중 (바로가기)
2025-12-18
마이크론 4Q25 실적발표 : 마이크론이 증명한 메모리 슈퍼사이클의 수혜강도 (바로가기)
2025-12-17
AI 버블론을 잠재우는 숫자들 : 엔터프라이즈 AI $37B 시장의 현주소 (바로가기)
2025-12-11
오라클 4Q25 실적발표 : 폭풍 속 컨퍼런스콜, 그리고 투자자들에게 남긴 세 가지 답변 (바로가기)
2025-12-04
엔비디아 펀더멘탈 체크 : 구글 TPU의 추격?

3
대화의 배경

시장점유율에 대한 생각, 아시아 공급망 체크 (바로가기)
2025-11-28
오픈AI 공동창업자 일리야 수츠케버 : 인간의 진화에서 찾은 초지능의 열쇠, '감정' (바로가기)
2025-10-03
엔비디아 CEO 젠슨황 인터뷰 : 오픈AI 10GW 동맹 x 극한의 풀스택 공동 설계 (바로가기)
2025-09-26
AI 사이클 한 눈에 보기, SemiAnalysis 인터뷰 : 승부사 젠슨황 그리고 화웨이의 역습 (바로가기)
투자자문 서비스에 따른 투자 시 원금 손실이 발생할 수 있으며, 투자 손익에 대한 책임은 전적으로 고객에게 귀속됩니다. 또한 과거의 투자수익이 미래의 수익률을 보장하지 않습니다.
신규 구독 전에, 아래 투자자문계약 권유문서의 계약 관련 제반 사항을 반드시 읽으시고 충분히 검토하시기 바랍니다.
*투자자문계약 권유문서 : https://naver.me/5ZST47Qf

4
전례 없는 인프라 사이클

목차
수요는 여전히 과소평가 되는 중 : 7~8년 된 TPU도 100% 가동되고 있는 상태
25년 만에 컴퓨팅을 재창조하는 중 : ML/System Co-design이 핵심이다
인프라 차원에서의 효율성 : 대규모 사전훈련, 추론, 강화학습, prefill, decode
AI를 잘 쓰기 위해 준비할 것 : 기술이 아닌 문화적 재설정이 중요하다
아민 바흐다트 Amin Vahdat
2025년 10월 29일, 구글 AI 칩 인프라 책임자의 생각
수요는 여전히 과소평가 되는 중
7~8년 된 TPU도 100% 가동되고 있는 상태
*코멘트 → 인터뷰어인 라구 라구람(Raghu Raghuram)은 VMware에서 20년간 근무하며 2021~2023년 CEO까지 올라간 뒤 2025년 5월부터는 a16z의 General Partner로 일하고 있는 인물입니다. / 인터뷰이인 아민 바흐다트(Amin Vahdat)는 2010년부터 15년째 구글의 AI 인프라 책임자로서 TPU 및 각종 인프라를 관리하는 책임자이고, 지투 파텔(Jeetu Patel)은 JLL, Equinix의 사외이사이자 Cisco의 사장 겸 CPO로 근무 중인 인물입니다.

5
수요를 과소평가한다는 진단

​
라구 라구람 Raghu Raghuram : 두 분은 업계에 모두 오래 계셨고, 여러 인프라 사이클을 경험하셨는데요. 지금의 AI 사이클 같은 사이클을 본 적이 있나요? 투자자의 관점이 아니라 무언가를 실제로 구축하고 계획하는 책임자이신 기업인의 관점에서요.
아민 바흐다트 Amin Vahdat : 제 생각에는 아무도 이런 규모의 사이클은 본 적이 없다고 확신합니다. 90년대~00년대 초반의 인터넷은 정말 거대한 사이클이었고, 당시에는 믿을 수 없을 정도의 구축 속도라고 느꼈었습니다. 당시 속도감과 비교할 때 지금은 100배 정도의 모멘텀을 갖고 있는 것 같습니다. 그리고 인터넷 시기 구축했던 네트워킹의 잠재적인 활용가치 대비 업사이드도 100배 정도에 달할 것이라고 생각합니다.
지투 파텔 Jeetu Patel : 맞습니다. 이정도 규모, 속도, 범위에 대한 선례는 없습니다.

6
구형 TPU까지 가동되는 수요

좋은 소식은 인프라를 다루는 게 다시 섹시해졌다는 점입니다. 오랫동안 고리타분한 분야였죠. 정말 흥미로운 건 이 산업의 특성을 보자면 인터넷 인프라 구축, 우주 발사 경쟁, 맨해튼 프로젝트가 모두 합쳐진 것처럼 움직이고 있다는 것입니다. 지정학적 함의, 경제적 함의, 국가안보적 함의 등 심오한 분야입니다.
그리고 아직 수요에 대해 심각하게 과소평가하고 있다고 생각합니다. 제가 가장 많이 하는 일은 이 산업에 거품이 있는지를 체크하고 다니는 일인데, 여전히 구축에 쓰일 수요를 심각하게 과소평가 하고 있다고 생각합니다. 예상치보다 훨씬 더 많은 것들이 필요할 것이라 생각합니다.
라구 라구람 : 뒤의 질문과 이어지는데요. 그럼 지금 CAPEX 사이클 중 어느쯤에 왔다고 생각하시나요? 그리고 수요를 예측하기 위해 여러분이 내부적으로 사용하시는 신호는 무엇인가요?

7
수요와 공급 병목

데이터센터는 4~5년 전부터 계획을 하셔야 할텐데, 수요나 기술적인 신호를 어떻게 해석하고 계획하고 계신가요?
아민 바흐다트 Amin Vahdat : 사이클 초기라고 생각합니다. 저희가 보는 수요로 추정하자면 확실히 그렇습니다. 구글은 10년 넘게 TPU를 만들어왔고 이제 7세대 생산을 시작했습니다. 내부적으로도 외부적으로도 사용되는데 7~8년 된 TPU도 100% 가동률을 보일 정도로 수요가 엄청나게 높습니다. 고객들은 누구나 가장 최신의 칩을 사용하고 싶어하지만, 얻을 수 있는 가속기라면 무엇이든 사용하고 있습니다. 수요가 엄청나다는 것도 말해주지만 공급이 부족하다는 것이기도 합니다. 할당을 거절하게 되는 분야들도 많습니다.
문제는 말씀하신 것처럼, 전력에 의해 병목이 발생하고, 데이터센터를 지을 토지에 대해서 제한이 있고, 인허가에 대한 병목이 있고, 공급망의 많은 것들이 제한적이라는 데 있습니다.

8
용량 증설의 속도와 비교

제가 걱정하는 것 중 하나는 공급이 느리기 때문에 우리 모두가 원하는 만큼 수요를 충족시키지 못할 수 있을 거란 우려입니다. 모두가 엄청난 금액을 지출하려 하지만 그게 실제로 투자로 연결될 수 있을지는 모르겠습니다. 수요 예측에 맞게 수조 달러의 자금이 투입되려 하지만 공급이 있어야 쓸 수 있을 것이라 그렇습니다. 저는 이 상황이 5년 동안 지속될 것이라 생각합니다.
*코멘트 → 2025년 11월 6일, 구글 전사 직원회의에서 AI 인프라 책임자인 아민 바흐다트는 앞으로 AI 제품 서비스 수요를 충족하기 위해 6개월마다 서비스 용량을 2배씩 늘려야 한다고 말했습니다. 향후 4~5년 안에 1,000배+ 증가(2^10)를 말한 것입니다. 한쪽은 고객사 수요 증가세를 보고 컴퓨팅 수요를 생각한 것이고 한쪽은 돌아온 결과를 통해 추론한 것이지만, 12월 22일 주간전략보고에서 전해드린 OpenAI's Compute Flywheel도 비슷한 속도감입니다.

9
적시 구매와 전력의 긴 수명

더 많은 컴퓨팅이 더 강한 AI, 더 나은 제품, 더 높은 매출로 연결된다는 것이고 1년에 3~4배 이상의 컴퓨팅 확보가 필요하다는 속도인식을 공유하고 있습니다. 앤트로픽의 ARR도 올해 말 $9B → 내년 $20~$26B로 전망한 것을 생각하면 1년에 ~3배 정도의 속도감입니다.
라구 라구람 : 그러면 감가상각 주기에는 어떻게 대응하시나요? 수요와 감가상각 주기가 잘 일치하나요?
아민 바흐다트 Amin Vahdat : 저희는 적시에 필요한 컴퓨팅만큼을 구매(Just-in-time)합니다. 중요한 건 이는 하드웨어에 대한 적시 구매이고, 전력에 대한 감가상각은 약 25~40년이므로 이점이 있습니다.
*코멘트 → 고객사들은 특정 랙에 맞춰서 데이터센터 전력과 냉각 밀도를 설계해야 하기 때문에, 수요추정을 한 뒤에 앞으로 몇 년간 필요할 컴퓨팅에 대해서 엔비디아, AMD, ASIC 파트너들에게 미리 요청하고 데이터센터 가동이 준비되면 칩을 인도받아 클러스터를 구축하는 식입니다.

10
칩 세대와 데이터센터 구축

새로운 현상은 아니고 2023년 AI Boom 첫 사이클 시작에서부터 같은 상황이 이어져 오고 있습니다. 당시 마이크로소프트는 2023년 하반기부터 2024년 하반기까지 오픈AI가 더 많은 컴퓨팅을 요청했음에도 이를 거절했었는데, 이는 MSFT가 오픈AI 단일 고객을 위한 호스트가 아니며 단일 세대의 H100에 대규모 인프라가 갇히는 걸 원하지 않았기 때문이었습니다.
*코멘트 → 11월 중순, 주간전략보고에서 전해드린 마이크로소프트 CEO 사티아 나델라의 생각도 같았습니다. 1년마다 새로운 칩이 나오면서 발생하는 감가상각때문이기도 하지만, GB200, GB300, VR200, VR300에 이르기까지 계속해서 냉각과 전력 밀도가 달라지기 때문에 하나의 스펙에 맞춰서 모든 것을 구축하지 않고 새로운 칩이 나올 때마다 충분한 칩을 구매하는 게 목표입니다.

11
구형 GPU의 재배치

마이크로소프트도 오픈AI향 추론 수요를 감당하기 위해서 4Q25에는 Fairwater 1에 GB300 10만 개를 온라인했습니다.
*코멘트 → 감가상각에 대해서는 11월 24일 주간전략보고에서 전해드린 바 있습니다. Bernstein이 출시 6년차인 A100 모델조차 충분한 수익성을 증명하고 있다고 말한 부분입니다. GPU의 내용 연수를 6년으로 설정하는 감가상각 회계 처리가 타당하다고 보았습니다. GPU 운영 비용이 클라우드 렌탈 시세 대비 현저히 낮기 때문에, 구형 모델인 A100을 가동하더라도 여전히 높은 마진을 남길 수 있다는 것입니다. 물론 GPU는 출시 첫해에 가치가 20~30%가량 하락합니다. 이는 하이퍼스케일러와 AI Labs들이 초기 12~18개월 동안은 차세대 모델의 사전훈련에 최신 GPU를 집중적으로 할당하기 때문입니다. 하지만 사전 학습이 완료되고 사후훈련 및 추론 단계로 넘어가면 상황은 달라집니다.

12
전력이 데이터센터 위치를 정한다

대략 2년차부터는 해당 GPU가 상대적으로 사양 민감도가 낮은 워크로드로 계속해서 재배치(Cascading)되어 지속적으로 활용되기 때문에, 6년이라는 기간 동안 경제적 가치는 충분히 유지되는 구조입니다.
지투 파텔 Jeetu Patel : 네트워킹 측면에 대해서 말씀드리자면, 하이퍼스케일러, 네오클라우드, 엔터프라이즈로 고객들을 나눠 볼 때 얘기들이 상당히 많이 다르다고 생각합니다. 엔터프라이즈는 인프라 구축 단계에 있어서 상당한 초기 단계입니다. 이들이 자체 데이터센터를 구축 및 업그레이드 하는 주기가 생길 것인데, 기존 CPU 데이터센터에 비해서 랙당 전력 및 냉각 요구사항이 매우 다르기 때문입니다.
*엔터프라이즈 AI 자료 → <AI 버블론을 잠재우는 숫자들 : 엔터프라이즈 AI $37B 시장의 현주소>
그리고 전력, 컴퓨팅, 네트워크의 희소성에 대해서는 저도 아민의 의견과 같습니다.

13
세 겹의 네트워크 수요

여기에 덧붙여서 보면, 지금 당장은 한 곳에 충분한 전력이 없기 때문에 데이터센터가 지어질 곳으로 전력을 가져오는 게 아니라, 데이터센터가 전력이 충분한 곳에 지어지고 있습니다. 전 세계적으로 프로젝트가 분산되는 이유입니다.
데이터센터들이 점점 더 멀리 떨어져서 지어진다는 게 특징인데, 이 과정에서 단일 부지에 ⓐ랙당 더 많은 네트워킹을 가진 Scale-up Network 수요가 크게 증가하고 있고, ⓑ여러 랙과 클러스터를 연결하는 Scale-out에 대한 수요도 증가하고 있으며, ⓒ최대 800~900km 가량 떨어진 두 개의 데이터센터를 하나의 논리적인 데이터센터로 만드는 Scale-across에 대한 수요도 증가하고 있습니다.
*Scale-up, Scale-out, Scale-across에 대한 자료 → <엔비디아 3Q25 실적발표 : 2026년 말까지 "SOLD OUT", 젠슨황이 $500B 매출을 확신하는 이유>

14
메인프레임이 아닌 분할 가능한 클러스터

25년 만에 컴퓨팅을 재창조하는 중
ML/System Co-design이 핵심이다
라구 라구람 : 다음 주제인 시스템과 네트워킹의 미래로 이어지는데요. 구글은 웹 혁명을 위한 최초의, 대규모 Scale-out 상용 서버를 생산했고, 엔비디아는 다른 형태이지만 메인프레임을 되살리는 중입니다. 다음에는 무슨 일이 일어날 거라 보시나요?
아민 바흐다트 Amin Vahdat : 글쎄요. 메인프레임으로 돌아가고 있다고 생각하진 않습니다. 사람들은 여전히 여러 풀에 걸쳐서 Scale-out 아키텍처로 구성된 클러스터를 사용하고 있습니다. GPU나 TPU를 갖고 있더라도 전체 GPU 슈퍼컴퓨터를 사용하는 사람만 있는 것은 아닙니다. 예를 들어, GPU 16,384개(HGX 8-GPU 1개 랙 * 2048개 rack-to-rack 연결)로 구성한 하나의 클러스터가 있다면 그중 일부를 가져다 쓰는 식입니다.

15
논리적 하나와 소프트웨어 Scale-out

많은 경우에 균일한 연결성을 갖고 있으며 매우 유연하고 확장 가능한 컴퓨팅입니다. TPU도 마찬가지입니다. 여기서의 핵심은 소프트웨어의 Scale-out입니다.
*코멘트 → 메인프레임은 하나의 거대하고 강력한 단일 시스템입니다. 성능을 높이려면 더 크고 비싼 부품으로 교체해야 하고(Scale-up), 시스템 전체가 하나로 묶여 있어 쪼개 쓰거나 유연하게 확장하기 어렵습니다. 아민은 현재 GPU/TPU 클러스터가 아무리 커졌더라도 본질적으로는 클러스터를 쪼개서 쓸 수 있는 Scale-out 구조를 따르고 있다고 말했습니다.
*코멘트 → 아민은 두 가지 때문에 메인프레임이 아니라고 말했습니다. ⓐ클러스터는 거대하지만 사용자가 전체를 빌려서 쓰는 구조가 아니라 그렇습니다. 그중 8개, 128개 등 일부만 떼서 사용할 수 있습니다. ⓑ메인프레임은 내부 부품끼리만 연결되어 있었는데, 지금은 수만 개의 칩이 하나처럼 연결하는 네트워킹 인프라와 함께 발전했습니다.

16
두 번째 컴퓨팅 재창조

논리적으로는 하나처럼 움직입니다. 그리고 이를 가능하게 하는 건 수만 개의 가속기에 대해서 작업을 쪼개고 관리하는 소프트웨어 기술이 핵심이란 점입니다.
아민 바흐다트 Amin Vahdat : 두 가지로 정리해볼 수 있겠습니다. 첫 번째는 25년 전쯤 구글과 다른 곳에서 동시에 컴퓨팅 인프라가 진정한 의미로 변했다는 데에 전적으로 동의합니다. 당시 Linux 스택을 실행하는 상용 PC를 사용하여 디스크, 컴퓨팅, 네트워킹을 Scale-out했던 진정한 혁신이 있었습니다. 당시에는 상당히 급진적인 아이디어라고들 생각했는데, 이제는 모두가 당연하게 생각하는 부분입니다.
두 번째로 흥미로운 점은, 지금의 AI 사이클은 그 이후 컴퓨팅을 두 번째로 재창조하는 시기라는 점입니다. 5년 후에는 하드웨어부터 소프트웨어까지 컴퓨팅 스택은 무엇이든 예전의 형태를 알아볼 수 없을 정도로 변할 것입니다.

17
공동 설계와 워크로드 변화

그리고 이 과정에서는 ML/System Co-design이 중요합니다. 구글의 예시를 들어서 설명드리자면, Big table, Spanner, GFS, Borg, Colossus 같은 소프트웨어는 하드웨어와 소프트웨어간 공동 설계 없이는 불가능했을 것입니다. 이러한 작업은 AI 시대에도 동일하게 발생할 것입니다.
*코멘트 → Bigtable은 대규모 구조화 데이터를 저장하기 위한 분산형 스토리지이고, Spanner는 여러 지역에 데이터를 복제하면서도 하나의 DB처럼 쓸 수 있게 해주는 것, Google File System은 많은 머신을 오가는 워크로드의 throughput을 높이기 위해 장애를 허용하면서도 대규모 데이터 처리를 돕는 분산 파일 시스템, Borg는 구글 내 클러스터 스케줄러 및 오케스트레이터, Colossus는 GFS를 잇는 차세대 파일 시스템입니다.

18
통합 시스템과 개방형 협력

*코멘트 → 이번 인터뷰이 중에 시스코 임원이 있으므로, 워크로드와 하드웨어가 얼마나 밀접한 연관이 있는지에 대해 시스코쪽 사례를 들어 설명드리면 이렇습니다. 시스코는 현재 챗봇 상호작용이 메인인 추론 워크로드가 앞으로 점점 더Agentic AI 워크로드로 가게 되면 마치 네트워크상 훈련과 점점 더 비슷해집니다. 원래는 사용자가 질문을 던질 때만 트래픽이 급증하고 답변을 받으면 다시 떨어지는 식으로 상호작용이 간헐적이고 단발적인데, Agentic AI는 명령 없이도 스스로 작업을 수행하는 긴 자율 행동 시간을 갖기 때문에 네트워크 부하가 높은 수준으로 꽤나 오래 유지된다는 점입니다.
*코멘트 → 모델과 워크로드가 바뀌면 하드웨어도 바뀝니다. 이 과정에서 엔비디아의 해자는 수많은 고객사들과 연구~사전훈련~사후훈련~추론에 이르기까지 수많은 ML들을 가속시켜주는 과정에서 차세대 워크로드로 무엇이 될 것이라는 힌트를 미리 얻는다는 점입니다.

19
특화 칩의 황금기

이는 구글의 제프 딘이 강조했던 부분이기도 하고, AWS가 앤트로픽에게 지분투자하면서 사실상 Project Rainier를 무료로 주는 대신 차세대 모델 훈련을 Trainium을 기반으로 하게끔 계약을 맺은 이유이기도 합니다.
지투 파텔 Jeetu Patel : 통합된 시스템에 대한 엄청난 수요가 있을 거라 생각합니다. 시스코는 물리적인 부분부터 의미론적인 부분까지, 즉 칩부터 애플리케이션까지 모든 것을 다루고 있습니다. 실제 AI 애플리케이션을 운영하는 과정에서 겪는 병목 중 하나는 전체 ML/System이 얼마나 잘 통합되어 있으며 전체 스택을 가동하는 데 있어서 손실을 얼마나 최소화 할 수 있는가입니다. 긴밀한 통합은 점점 더 중요해질 이유입니다. 마치 하드웨어와 소프트웨어가 서로 다른 여러 기업임에도 불구하고 같이 협업하면서 한 회사처럼 일해야 한다는 것입니다.

20
특화의 시간 제약

​
예를 들어, 구글 같은 하이퍼스케일러와 협력할 때 저희는 거래가 성사되기 한참 전부터 심층적인 설계 파트너십을 맺고 몇 개월 동안 로드맵에 대해서 공유합니다. 이처럼 업계는 이미 폐쇄적인 환경에서 개발하고 있지 않고, 점점 더 개방형 생태계에서 운영하고 있습니다. 하드웨어부터 소프트웨어까지 긴밀한 협력을 위해서 점점 더 많은 것들이 오픈되고 결합될 거라 생각합니다.
라구 라구람 : 투자자들이 가장 흥미로워 하는 주제는 칩에 대한 것입니다. 현재 엄청난 시장 점유율을 가진 놀라운 프로세서를 생산하는 칩 메이커가 있습니다. 그리고 스타트업들이 온갖 종류의 AI 칩을 개발하고 있는 것들도 보고 있으며, 구글의 폐쇄적인 정원에도 놀라운 프로세서가 있습니다. 이런 칩 분야에서는 앞으로 어떤 일이 일어날 거라고 생각하시나요?

21
TCO 중심의 공동 설계

아민 바흐다트 Amin Vahdat : *웃음* 우선, 저희는 엔비디아의 열렬한 팬입니다. 엔비디아 제품과 칩을 정말 많이 판매하고 있고, 고객들이 그 제품을 좋아하기 때문에 그렇습니다. 그리고 저희는 TPU도 계속해서 발전시키고 있습니다. 미래는 정말 흥미로울 거라 느끼는데, GPU, TPU, Trainium 등 다양한 칩들이 생긴다고 해서 단일 기업의 정점이 올 거라고 느끼지 않습니다.
지금은 진정한 특화(Specialization)의 황금기입니다. 제가 가장 잘 아는 TPU를 예로 들자면, 특정 연산의 경우 와트당 효율성이 10~100배 더 높습니다. 구글에서 많이 시행되는 다양한 제품이나 에이전트 워크로드 같은 것도 좀 더 특화시킨 아키텍처와 좀 더 특화시킨 칩을 통해서 많은 이점을 얻을 수 있습니다.
이 분야에서 실제 병목은 워크로드에 전문화된 아키텍처를 구현하는 것이 얼마나 어려우며, 현실 속 혁신의 속도에 비해서 시간이 매우 많이 걸린다는 부분입니다.

22
지역별 인프라 특화의 불확실성

지금은 거의 영원한 수준입니다. 세계 최고의 팀을 기준으로 하더라도 개념을 설정하고 실제 양산에 이르기까지 빛의 속도로 개발한다고 볼 때 2년 반이 걸립니다. 모든 것을 완벽하게 해낸다는 가정 하에 말입니다.
지금 그렇게 하는 팀은 아주 소수(a few team)있지만, 전문화된 하드웨어를 구축하기 위해 2년 반 뒤의 미래를 어떻게 예측할 수 있을 것이냐의 문제입니다. 그래서 ⓐ개발 주기를 더 단축시킬 수 있어야 한다고 생각하지만 ⓑ개발이 조금씩 더 느려지더라도 전력 절감, 비용 절감, 공간 절감이 엄청나게 무시할 수 없을 수준이기 때문에 더 많은 특화된 아키텍처가 개발될 것으로 예상합니다.
*코멘트 → 엔비디아의 정체성이 처음에 GPU로 시작했다보니 시장에서도 편의상 'GPU'라고 많이 언급되는데, 실제로는 Tensor Core로 가득찬 TPU입니다.

23
네트워크는 성능을 높이는 병목

특화를 말하면 주로 ASIC이 처음 생각나실 수 있으나, 워크로드별로 TCO 대비 퍼포먼스를 극한까지 끌어올리는 과정이 핵심입니다. HW만 생각하는 것을 넘어서, ML/System 차원에서의 생각을 쭉 끌고가는 게 중요하다고 생각합니다. 엔비디아의 NVLink 72, Rubin CPX 같은 경우가 기존 AI HW에서 한 가지 X Factor씩을 더한 대표적인 사례입니다. GPU vs ASIC에 대해서는 <엔비디아 펀더멘탈 체크 : 구글 TPU의 추격? 시장점유율에 대한 생각> 자료에서 전체적인 맥락을 다시 잡으실 수 있습니다.
지투 파텔 Jeetu Patel : 이는 지정학적인 구조에도 흥미로운 영향을 줄 것입니다. 왜냐하면, 지금 중국에서 무슨 일이 벌어지고 있는지를 생각해볼 때, 중국은 2nm 칩을 만들지 않기 때문입니다.

24
버스티 훈련과 유휴 용량 문제

중국은 7nm 칩을 만듭니다. 그대신 그들은 무제한의 전력과 무제한의 엔지니어링 자원을 갖고 있습니다. 그렇다면 7nm 칩 하에서 무제한의 엔지니어들을 투입하여 전력 효율과 무관한 인프라를 구축할 수 있습니다.
미국은 극도로 전력 효율적이어야 하며, 엔지니어가 중국만큼 수요에 비해 풍부하진 않습니다. 대신 2nm 칩으로 생산할 수 있습니다. 전력 효율적이란 이점을 갖고 있지만 어떤 면에서는 열 손실이 발생할 수도 있습니다. 이런 요소들을 모두 고려하자면 모델 아키텍처나 시스템들은 지역별로 앞으로 더욱 더 특화될 것이라 생각합니다. 중국이 내수를 벗어나서 외국으로 칩을 판매하려고 할 때, 미국이 파는 모델과 시스템에 비해서 매우 다른 아키텍처 형태를 판매할 수 있다는 의미입니다. 물론 이는 향후 3년간 테크 분야에서 벌어질 흥미로운 게임이론적 문제이며, 지금은 결과를 아무도 예단할 수 없을 거라 생각합니다.

25
훈련과 추론은 다른 최적화

인프라 차원에서의 효율성
대규모 사전훈련, 추론, 강화학습, prefill, decode
라구 라구람 : 다음 주제로 넘어가면, 네트워킹에 대해서 생각해봅시다. Scale-up, Scale-out, Scale-across를 언급하셨는데, 네트워킹도 상당한 방식으로 혁신될 것 같습니다. 두 분께서 보고 계신 신호들을 모아서 볼 때 앞으로 네트워킹이 나아갈 방향은 무엇이라고 생각하시나요?
아민 바흐다트 Amin Vahdat : 네트워킹도 특정 목적에 맞춰서 바뀔 것이라 생각합니다. 데이터센터 내에 필요한 대역폭의 규모는 정말 놀라운 수준입니다. 그리고 계속해서 높아지고만 있습니다. 네트워크가 주요 병목 현상이 되고 있다는 점은 새로운 우려이기도 합니다. 더 높은 대역폭은 더 높은 성능으로 직접적으로 이어지고 있고, 네트워크는 칩에 비해서 전력 소비는 적으면서도 전체 클러스터의 TCO 대비 퍼포먼스는 크게 높이기 때문에 와트당 활용도는 매우 높습니다.

26
추론 전용 TPU와 강화학습

조금만 투자해도 훨씬 더 많은 것을 얻을 수 있다는 의미입니다.
AI 워크로드는 네트워크 통신 패턴에 대해서 사전에 알고 있다는 게 엄청난 기회입니다. 예를 들어서, 어떤 식으로 통신할지를 미리 세팅할 수 있다면 패킷 내의 스위치의 모든 기능이 필요한지에 대해서 의문을 가져볼 수 있고, 여기서도 최적화 시킬 수 있는 기회들이 많을 거란 의미입니다.
AI 훈련용 워크로드는 놀라울 정도로 Busty합니다. 컴퓨팅을 잔뜩 수행하다가, 갑자기 멈추고 대규모 네트워크 통신을 수행하고, 다시 컴퓨팅으로 전환됩니다. 수십~수백MW급 규모의 클러스터가 한 번에 연산했다가 한 번에 쉬고 하기 때문에, 전력 유틸리티 기업들이 구글 외부에서 이렇게 멈추는 과정을 알아낼 수 있을 정도입니다. 짧은 시간 동안 0% → 100%를 오가는 네트워크를 어떻게 구축하는 것이 효율적인가에 대한 난제가 있습니다.

27
Prefill과 Decode의 분리

​
그리고 네트워크 구축 과정에서도 난제가 있습니다. 대규모 사전훈련은 1년 내내 데이터센터 사이트 전체에서 수행되지 않습니다. 예를 들어서, 프론티어 모델을 대규모 사전훈련하기 위해서 최신 칩과 최신 네트워킹을 세 곳의 데이터센터에 구축했다고 가정해봅니다. 그리고 더 최신 칩과 네트워킹으로 새로운 모델을 훈련시켜야 할 겁니다. 남겨진 기존 네트워크에서도 충분한 워크로드 가동이 있겠지만, 대규모 사전훈련에 필요했던 규모만큼의 용량이 필요하진 않습니다. 그렇다면 전체 데이터센터의 생애주기 중에서 5%의 시간에만 대규모 네트워크가 필요한 것인데 이에 대해서 어떻게 더 활용할지에 대한 해결책이 난제입니다.
혹시 여러분 중에 아시는 분이 계시다면 알려주시면 감사하겠습니다. 고민입니다.
라구 라구람 : 저희가 모르면 아무도 모를 것 같은데요?

28
컴퓨팅형 Prefill과 메모리형 Decode

​
아민 바흐다트 Amin Vahdat : 어떻게 하는 게 좋을지 알아내려고 노력하고 있습니다.
지투 파텔 Jeetu Patel : 흥미로운 분야이죠. 전력이 병목이고, 컴퓨팅이 자산이라면, 네트워크는 이들을 증폭시키는 요소입니다. 패킷 이동에 절약하는 모든 와트는 더 많은 GPU에 할당할 수 있기 때문입니다. 훈련과 추론처럼 워크로드에 따라 최적화시켜야 하는 요소가 다릅니다. 예를 들어 훈련에는 Latency를 최적화하는 게 중요하지만, 추론에서는 메모리 최적화가 훨씬 더 중요합니다. 앞으로 네트워킹 인프라는 지금까지 그랬듯이 훈련용으로 썼던 인프라를 그대로 추론에 가져다 쓰는 것이 아니라, 점차 추론 전용 네트워크로 구축되는 방향으로 진화할 거라 생각합니다.
라구 라구람 : 사용 사례로 넘어가보면, 추론에 대해서 정리할 때 추론을 위해서 특정 아키텍처를 배포하고 계신가요?

29
집적형의 병목과 분리형 구조

아니면 여전히 훈련에서 쓰는 아키텍처를 추론에도 쓰는 중인가요?
아민 바흐다트 Amin Vahdat : 구글은 추론을 위해 특화된 아키텍처를 배포하고 있으며(훈련용 v6p, 추론용 v6e), 하드웨어만큼 소프트웨어에서도 추론용 소프트웨어에도 노력하고 있습니다. 추론 워크로드 중 하나로서 정말 흥미로워지고 있는 포인트는 강화학습입니다. 서빙 워크로드들 중에 ​​강화학습이 차지하는 비중(Reasoning)이 늘고 있는데, 강화학습은 지연시간이 절대적으로 중요(Test-time compute는 훈련과 비슷)한 것이라 중요합니다. 시스템 구축 및 연결 방식에서 네트워킹이 점점 더 핵심적인 역할을 하고 있습니다.
*코멘트 → 12월 8일 주간전략보고를 통해 전해드린 것처럼, Sparse MoE & Reasoning 워크로드에 대해서는 NVLink를 통한 All-to-All 연결이 갖는 장점이 뚜렷한 구조입니다.

30
분산 추론 소프트웨어와 작성자의 전망

오픈AI는 이제 추론의 효율을 극한까지 끌어올리기 위해 알리바바가 Qwen-Next에서 512개의 expert를 만드는 사이 GPT-6부터는 2,048개의 expert를 둘 것으로 예상합니다.
라구 라구람 : 추론 비용을 1,000배 낮추는 데 필요한 단일 병목지점이 있나요? 아니면 여러 분야에서 추론 비용을 낮춰가는 곡선처럼 구성되어 있나요?
아민 바흐다트 Amin Vahdat : 추론은 두 가지 분야로 나뉩니다. 아마 익숙하시겠지만, Prefill과 Decode는 매우 매우 다른 워크로드입니다. 균형점이 다릅니다. 그래서 사실 이상적으로는 두 가지 다른 하드웨어로 추론하는 것이 중요합니다. 그게 하나의 기회입니다.
*코멘트 → Rubin CPX(4Q26 출시 예정)는 분산 추론(Disaggregated Inference)의 시작을 알린 칩입니다.

31
CPX까지의 인력과 시간

Transformer 계열 LLM의 추론은 크게 두 가지 작업으로 분리됩니다. Prefill과 Decode입니다.
워크로드별로 특징을 보면 Prefill은 컴퓨팅이 많이 필요하고, 상대적으로 메모리 대역폭은 낮아도 됩니다. 그래서 비싼 HBM을 사용하는 대신 CPX에는 128GB GDDR7(대역폭 2TB/s)을 탑재했습니다. HBM 절반 가격으로 만든 칩이고, R200 GPU 대비 4분의 1 가격으로 동일 작업을 수행합니다. 그리고 Decode는 메모리 대역폭을 많이 필요로 합니다. HBM에 적합하기에 R200에는 여전히 288GB HBM4(대역폭 20.5TB/s)가 탑재됩니다.
기존의 방식은 Aggregated로, Prefill 및 Decode 작업을 단일 GPU에서 동시 처리하는 식이었습니다.

32
효율 하락이 아닌 품질 수요

Prefill은 계산량이 많아 병렬성이 낮고, Decode는 KV Cache를 사용할 수 있기 때문에 병렬성이 상대적으로 높은 워크로드입니다. 문제는 단일 아키텍처이기 때문에 유연성이 부족하고 병목이 생긴다는 점이 문제였습니다.
새로운 방식은 Disaggregated로, Prefill과 Decode 작업 중에 Prefill을 전용 하드웨어로 분리하는 게 핵심입니다. Prefill에 맞게 따로 특화시킨 CPX 칩에서 계산에 최적화된 작업을 하고, 병렬성이 높은 Decode 작업은 기존 Rubin GPU에 배정하는 것입니다. 이렇게 되면 KV Cache를 HBM 대신 GDRR7처럼 더 저렴한 스토리지로 옮겨서 GPU 메모리를 확보할 수 있게 됩니다. 워크로드에도 다양한 하드웨어간 스마트 라우팅으로 유연한 확장을 할 수 있다는 게 핵심입니다.

33
긴 자율 실행과 수요 루프

​
이를 위해 엔비디아는 소프트웨어 레벨에서 ⓐSmart Router, ⓑKV Cache Manager, ⓒGPU Resource Planner를 추가하여 LLM 추론 과정에서 Prefill과 Decode를 분산하여 처리하고, KV Cache를 GPU 메모리에서 오프로딩하여 GPU 리소스를 최적화하는 아키텍처입니다. 이렇게 하면 대규모 사용자 처리, 모델 확장성, 리소스 효율성이 모두 개선됩니다. 이전에 비해 Prefill 비용이 절감되므로 ROI가 30~50배 증가하고, 전체 시스템 단위 효율은 3~7.5배 좋아졌습니다.
기존의 칩들과 전혀 다른 구조이기 때문에 이제 모든 ASIC 플레이어들은 엔비디아와의 'TCO 대비 퍼포먼스' 비교에서 엔비디아를 따라가기 위해 자체적인 Prefill ASIC을 동시에 개발해야 하는 상황이 시작됐습니다.

34
제번스의 역설로 읽는 비용

그리고 이제 추론에서도 엔비디아가 깔아둔 분산형 추론 설계를 채택할 경우 훨씬 더 TCO 대비 퍼포먼스가 우수해질 것입니다. 추론이 점점 복잡해질수록 훈련에서처럼 엔비디아가 가진 하드웨어·소프트웨어·네트워킹·공급망 관리 차원의 해자가 점점 더 강해질 것으로 예상합니다.
그리고 개인적으로 다년간에 걸쳐서 향후 Decode용 칩도 따로 설계될 것으로 예상합니다. 대만에서 유능한 ASIC 인재들을 수천 명 모아서 AI 연구소가 첫 번째로 출시한 칩이 CPX일 뿐입니다. 엔비디아가 ASIC 팀을 준비 중이라는 내용은 2024년 4월 업계에 처음으로 팀 빌딩에 대해 알려졌고 → 2025년 1월에 대만에 1,000명 규모 대규모 R&D 연구소를 꾸리면서 공식 확인됐던 내용입니다.

35
추론 비용 하락과 품질 수요

당시 MediaTek, Alchip, GUC쪽 대만 ASIC 인재를 블랙홀처럼 빨아들였던 것의 결과가 4Q26에 출시될 Rubin CPX로 연결됐습니다.
아민 바흐다트 Amin Vahdat : 다만, 많은 분들이 깨닫지 못하는 것은 실제로 우리는 추론 비용을 엄청나게 빠른 속도로 절감하고 있다는 것입니다. 100배씩 대규모로 절감하고 있습니다. 문제는 사용자들이 더 효율성이 높은 모델을 원하는 게 아니라, 더 높은 퀄리티를 계속해서 요구한다는 점입니다. 기존의 모델에 대한 효율성을 100배씩 이상 개선시키자마자, 차세대 모델이 출시되고, 달러당 지능은 훨씬 더 높아지지만 여전히 더 많은 비용을 지불하게 되는 사이클이 반복되고 있습니다.
지투 파텔 Jeetu Patel : 그리고 추론시간이 길어질수록 사용자들은 더 조급해하고 있습니다.

36
긴 자율 실행과 수요 루프

예를 들어, 이전에 Deep Research를 써서는 20분 정도씩 추론하여 하나의 리서치를 완료했습니다. 이제는 코딩 도구들을 보면 7시간~30시간까지도 자율적으로 에이전트가 실행하며 답을 찾아내옵니다. 이런 자율 실행 시간이 길어질수록 그 시간을 압축하려는 더 큰 수요가 발생하고 있습니다.
끊임 없는 루프입니다. 지능을 높이기 위해 더 길게 생각하고, 더 많은 도구를 사용하게 되는데, 그러면 사용자는 그 시간을 단축시켜주길 원합니다. 더 높은 지능, 더 많은 사용 사례를 가질수록 더 많은 추론 수요를 필요로 하는 일종의 자기 충족적인 예언과도 같으며 추론에 대한 수요는 영속적일 거라 생각합니다.
제번스의 역설 Jevons Paradox
엔비디아의 제품전략에 대해서 깊게 생각해보셨다면, 직관에는 맞지 않는 포인트가 하나 있습니다.

37
제번스의 역설로 읽는 비용

Ampere → Hopper → Blackwell로 오면서 제품 가격은 결과적으로 점점 더 비싸졌는데 단위당 컴퓨팅 비용은 더 줄어드는 쪽으로 개발하고 있습니다. 그렇다면 엔비디아는 GPU를 쓰는 워크로드가 계속해서 늘어날 것을 가정한다는 이야기입니다. 이것이 엔비디아 소프트웨어 개발자들이 산업 일선에서 고객들과 끊임없이 소통하며 CUDA가 사용되는 사례를 늘리고 혁신에 앞장서는 기업인 이유이기도 하지만, 여기엔 조금 더 생각해볼 게 있습니다.
산업혁명 시대 제번스의 역설이 재밌는 힌트였습니다. 과거에도 늘 비슷한 일들이 있어왔기 때문입니다. 1865년에 영국의 경제학자 윌리엄 스탠리 제번스William Stanley Jevons는 새로운 사회 현상을 발견했고 이를 논문으로 옮겼습니다.

38
낮은 OPEX와 노동 덩어리 오류

석탄 사용의 효율성이 계속해서 높아지면 석탄 사용이 줄어들 거라 생각하지만, 그렇지 않고 오히려 석탄 소비량이 더 늘었다는 것입니다. 증기엔진이 효율적으로 변할 수록 더 많은 석탄을 쓰는 결과로 이어졌습니다. 비밀은 효율에 있었습니다.
증기 엔진을 더 효율적으로 만들면 OPEX가 감소하고 → OPEX를 줄이면 수익성 있는 사용 사례가 증가하니 더 많이 지출한다는 것입니다. 클라우드 컴퓨팅, 이커머스, 핀테크의 역사에도 적용되는 이야기이며, 엔비디아가 컴퓨팅의 한계비용을 0으로 만들수록 계속해서 더 많은 사용 사례가 생겨나는 이유이기도 합니다.
제번스의 역설은 기본적으로 산업혁명 시기부터 계속되어 왔던 노동 덩어리의 오류(Lump of labor fallacy)'와도 맞닿아 있습니다.

39
AI가 가능하게 한 코드 이식

이 오류는 주어진 시간에 경제에서 수행할 노동의 총량이 정해져있으며, 그 일을 두고 기계와 사람이 경쟁한다는 오해에서 시작됩니다. 기계가 할 일이 늘어난 만큼 사람이 할 일이 없어질 거라는 생각입니다.
AI를 잘 쓰기 위해 준비할 것
기술이 아닌 문화적 재설정이 중요하다
라구 라구람 : 현재 사용 가능한 모든 AI를 통해서, 얻고 있는 성과 중에 가장 중요한 성과는 무엇이신가요? 구글 내부적으로, 시스코 내부적으로 무엇을 얻고 있는지 궁금합니다.
아민 바흐다트 Amin Vahdat : 코딩은 AI의 가장 명확한 사용 사례입니다. 활용도나 역량도 점점 더 높아지고 있습니다. 가장 최근의 프로젝트를 보자면, 며칠 전에 AI를 사용하여 명령어 세트 마이그레이션을 수행하는 방법에 대한 논문을 발표했습니다.

40
과거의 포기와 현재의 전환

x86 → ARM으로 상당히 대규모의 마이그레이션을 수행했는데, 이를 통해서 구글의 엄청난 코드베이스 전체를 명령어 집합에 구애받지 않도록 만들었습니다. 저희는 모든 코드 베이스가 그렇게 되기를 원하고 있습니다. 이에 대한 동기는 몇 년 전으로 거슬러 올라갑니다.
저희는 Bigtable이란 놀라운 레거시 시스템과, Spanner라는 놀라운 시스템을 갖고 있었습니다. 그리고 당시 구글에서는 Bigtable에서 Spanner로 모두 이동해야 한다는 결정을 내렸습니다. 그래서 마이그레이션을 하는 데 얼마가 걸리는지를 추정했더니, 팀원 7명이 수천년 이상을 투입해야 마이그레이션할 수 있는 정도였습니다. 저희 엔지니어는 게으르지 않습니다.

41
시스코의 도구 활용과 한계

기회비용이 너무 크다고 생각하여 마이그레이션을 포기하고 Bigtable에 남기로 결정했던 시점이었습니다.
구글 내에서는 계속해서 코드베이스 마이그레이션을 꽤나 자주 합니다. TensorFlow → JAX로 마이그레이션을 하는 일도 많았는데, 이 과정에서는 AI를 통해 훨씬 더 빠르게 마이그레이션을 수행할 수 있엇습니다. 어떤 AI 도구는 아직 구글 엔지니어들에게 내부적으로 대규모 배포하여 사용하기에는 기준에 미치지 못하는 것들도 있지만, 계속해서 사용 사례나 대체정도는 점점 더 커지고 있습니다.
지투 파텔 Jeetu Patel : 시스코에서는 코드 마이그레이션도 많이 하고, 지금도 활용 가능성이 높은 3~4가지 정말 좋은 사용 사례를 보고 있고 아직 안 되는 것들인제 관심있게 보는 것들도 있습니다.

42
문화적 재설정

코드 마이그레이션에는 Codex, Claude, Cursor, Windsurf의 조합을 많이 쓰고 있습니다. 디버깅은 CLI를 사용하면 훨씬 더 생산적으로 쓰고 있습니다. 프론트엔드에서 다루는 코드 프로젝트는 훨씬 더 잘 먹힙니다. 엔지니어들의 생산성을 엄청나게 끌어올리고 있습니다. 다만, 오래된 코드, 특히 인프라 스택의 깊은 곳으로 다가가면 AI를 사용하기가 훨씬 어렵습니다.
저희가 엔지니어에게 지시하는 것은 사실 기술적인 문제를 지시하기보다, 문화적인 재설정을 강조하고 있습니다. 누군가가 무언가 AI를 사용해보고 '제대로 작동하지 않습니다'라고 말한다고 해서 이걸 6~9개월 동안 방치해서는 안됩니다.

43
6개월 뒤를 가정하는 조직

4주 안에 다시 돌아와서 다시 작동해보고 통하는지 확인해봐야 합니다. 모델이나 도구들이 발전하는 속도가 너무 빠르기 때문에 거의 이런 식으로 해야 생산성을 크게 끌어올릴 수 있습니다.
오늘도 150명의 뛰어난 엔지니어들과 있었는데 제가 이들에게 요구한 건, 이 AI 도구들이 6개월 안에 무한하게 좋아질 것이라고 가정하라는 것이었습니다. 그리고 6개월 후 AI로 시킬 수 있을 것들은 무엇이 있을지를 미리 생각해보게 하는 것이 중요합니다. 지금 단기에 보고 안된다고 포기하는 것은 거대한 전략적 오류라고 생각합니다. 시스코는 내부적으로 25,000명의 엔지니어와 함께 일하고 있습니다. 내년 안에 엔지니어들의 생산성을 2~3배 높일 수 있기를 바라며, 실제로 어떻게 되는지 지켜볼만 하실 거라 생각합니다.

44
반복된 관련 자료 목록

AI 사이클 : 전체 흐름 이해하기
2025-12-19
블랙록 2026 전망 : AI CAPEX $8T 시대를 열기 위한 '금융 보릿고개'를 지나는 중 (바로가기)
2025-12-18
마이크론 4Q25 실적발표 : 마이크론이 증명한 메모리 슈퍼사이클의 수혜강도 (바로가기)
2025-12-17
AI 버블론을 잠재우는 숫자들 : 엔터프라이즈 AI $37B 시장의 현주소 (바로가기)
2025-12-11
오라클 4Q25 실적발표 : 폭풍 속 컨퍼런스콜, 그리고 투자자들에게 남긴 세 가지 답변 (바로가기)

45
반복된 관련 자료 목록의 나머지

2025-12-04
엔비디아 펀더멘탈 체크 : 구글 TPU의 추격? 시장점유율에 대한 생각, 아시아 공급망 체크 (바로가기)
2025-11-28
오픈AI 공동창업자 일리야 수츠케버 : 인간의 진화에서 찾은 초지능의 열쇠, '감정' (바로가기)
2025-10-03
엔비디아 CEO 젠슨황 인터뷰 : 오픈AI 10GW 동맹 x 극한의 풀스택 공동 설계 (바로가기)
2025-09-26
AI 사이클 한 눈에 보기, SemiAnalysis 인터뷰 : 승부사 젠슨황 그리고 화웨이의 역습 (바로가기)

5

그럼에도 빠진내용 정리

잡담·곁다리 내용
  • 잡담, 화면 설명, 불확실한 표현을 무작정 버리지 않는다.
생략 기록

별도 생략 기록이 없습니다.

그럼에도 빠진내용 정리

보존 범위
투자자문 손실 고지와 계약 권유문서 URL, 상단과 하단의 관련 자료 바로가기 목록도 원문 순서대로 flow에 보존했다.
원문 속 전망
서비스 용량 1,000배 계산, 앤트로픽 ARR, Rubin CPX의 출시·ROI·효율, 엔비디아 해자와 Decode용 칩은 원문이 제시한 계획·전망·해설의 강도로 보존했다.
확인되지 않은 것
이 글은 대담과 작성자 해설을 보존하며, 원문 밖의 실제 채택 규모·미래 실적·시장 결과는 추가하지 않았다.
원문 확인

document_work_runner prepare가 입력 원문을 수정 없이 보존했다.