25-10 구글 AI 인프라 책임자의 AI 인프라 대담
작성자의 핵심 판단
두 대담자는 현재 AI 인프라 사이클의 수요 규모와 속도에 선례가 없으며, 컴퓨팅·전력·네트워크를 함께 설계해야 한다는 문제의식을 드러낸다.
근거 보기 3
- 원문 구간 1
라구 라구람 Raghu Raghuram : 두 분은 업계에 모두 오래 계셨고, 여러 인프라 사이클을 경험하셨는데요. 지금의 AI 사이클 같은 사이클을 본 적이 있나요? 투자자의 관점이 아니라 무언가를 실제로 구축하고 계획하는 책임자이신 기업인의 관점에서요. 아민 바흐다트 Amin Vahdat : 제 생각에는 아무도 이런 규모의 사이클은 본 적이 없다고 확신합니다. 90년대~00년대 초반의 인터넷은 정말 거대한 사이클이었고, 당시에는 믿을 수 없을 정도의 구축 속도라고 느꼈었습니다. 당시 속도감과 비교할 때 지금은 100배 정도의 모멘텀을 갖고 있는 것 같습니다. 그리고 인터넷 시기 구축했던 네트워킹의 잠재적인 활용가치 대비 업사이드도 100배 정도에 달할 것이라고 생각합니다. 지투 파텔 Jeetu Patel : 맞습니다. 이정도 규모, 속도, 범위에 대한 선례는 없습니다.
- 원문 구간 2
좋은 소식은 인프라를 다루는 게 다시 섹시해졌다는 점입니다. 오랫동안 고리타분한 분야였죠. 정말 흥미로운 건 이 산업의 특성을 보자면 인터넷 인프라 구축, 우주 발사 경쟁, 맨해튼 프로젝트가 모두 합쳐진 것처럼 움직이고 있다는 것입니다. 지정학적 함의, 경제적 함의, 국가안보적 함의 등 심오한 분야입니다. 그리고 아직 수요에 대해 심각하게 과소평가하고 있다고 생각합니다. 제가 가장 많이 하는 일은 이 산업에 거품이 있는지를 체크하고 다니는 일인데, 여전히 구축에 쓰일 수요를 심각하게 과소평가 하고 있다고 생각합니다. 예상치보다 훨씬 더 많은 것들이 필요할 것이라 생각합니다. 라구 라구람 : 뒤의 질문과 이어지는데요. 그럼 지금 CAPEX 사이클 중 어느쯤에 왔다고 생각하시나요? 그리고 수요를 예측하기 위해 여러분이 내부적으로 사용하시는 신호는 무엇인가요?
- 원문 구간 3
논리적으로는 하나처럼 움직입니다. 그리고 이를 가능하게 하는 건 수만 개의 가속기에 대해서 작업을 쪼개고 관리하는 소프트웨어 기술이 핵심이란 점입니다. 아민 바흐다트 Amin Vahdat : 두 가지로 정리해볼 수 있겠습니다. 첫 번째는 25년 전쯤 구글과 다른 곳에서 동시에 컴퓨팅 인프라가 진정한 의미로 변했다는 데에 전적으로 동의합니다. 당시 Linux 스택을 실행하는 상용 PC를 사용하여 디스크, 컴퓨팅, 네트워킹을 Scale-out했던 진정한 혁신이 있었습니다. 당시에는 상당히 급진적인 아이디어라고들 생각했는데, 이제는 모두가 당연하게 생각하는 부분입니다. 두 번째로 흥미로운 점은, 지금의 AI 사이클은 그 이후 컴퓨팅을 두 번째로 재창조하는 시기라는 점입니다. 5년 후에는 하드웨어부터 소프트웨어까지 컴퓨팅 스택은 무엇이든 예전의 형태를 알아볼 수 없을 정도로 변할 것입니다.
이 자료에서 다룬 사실
2025년 10월 29일 대화에서 구글 AI 인프라 책임자 아민 바흐다트와 시스코의 지투 파텔은 AI 인프라 수요, 전력·네트워크 병목, 칩 특화와 추론 설계를 논의했다.
근거 보기 2
- 원문 구간 1
목차 수요는 여전히 과소평가 되는 중 : 7~8년 된 TPU도 100% 가동되고 있는 상태 25년 만에 컴퓨팅을 재창조하는 중 : ML/System Co-design이 핵심이다 인프라 차원에서의 효율성 : 대규모 사전훈련, 추론, 강화학습, prefill, decode AI를 잘 쓰기 위해 준비할 것 : 기술이 아닌 문화적 재설정이 중요하다 아민 바흐다트 Amin Vahdat 2025년 10월 29일, 구글 AI 칩 인프라 책임자의 생각 수요는 여전히 과소평가 되는 중 7~8년 된 TPU도 100% 가동되고 있는 상태 *코멘트 → 인터뷰어인 라구 라구람(Raghu Raghuram)은 VMware에서 20년간 근무하며 2021~2023년 CEO까지 올라간 뒤 2025년 5월부터는 a16z의 General Partner로 일하고 있는 인물입니다. / 인터뷰이인 아민 바흐다트(Amin Vahdat)는 2010년부터 15년째 구글의 AI 인프라 책임자로서 TPU 및 각종 인프라를 관리하는 책임자이고, 지투 파텔(Jeetu Patel)은 JLL, Equinix의 사외이사이자 Cisco의 사장 겸 CPO로 근무 중인 인물입니다.
- 원문 구간 2
라구 라구람 Raghu Raghuram : 두 분은 업계에 모두 오래 계셨고, 여러 인프라 사이클을 경험하셨는데요. 지금의 AI 사이클 같은 사이클을 본 적이 있나요? 투자자의 관점이 아니라 무언가를 실제로 구축하고 계획하는 책임자이신 기업인의 관점에서요. 아민 바흐다트 Amin Vahdat : 제 생각에는 아무도 이런 규모의 사이클은 본 적이 없다고 확신합니다. 90년대~00년대 초반의 인터넷은 정말 거대한 사이클이었고, 당시에는 믿을 수 없을 정도의 구축 속도라고 느꼈었습니다. 당시 속도감과 비교할 때 지금은 100배 정도의 모멘텀을 갖고 있는 것 같습니다. 그리고 인터넷 시기 구축했던 네트워킹의 잠재적인 활용가치 대비 업사이드도 100배 정도에 달할 것이라고 생각합니다. 지투 파텔 Jeetu Patel : 맞습니다. 이정도 규모, 속도, 범위에 대한 선례는 없습니다.
그렇게 판단한 이유
구형 TPU까지 100% 가동되고 전력·토지·인허가·공급망이 공급을 제한한다는 관찰, 그리고 워크로드별 칩·네트워크 요구가 다르다는 설명을 근거로 든다.
근거 보기 4
- 원문 구간 1
데이터센터는 4~5년 전부터 계획을 하셔야 할텐데, 수요나 기술적인 신호를 어떻게 해석하고 계획하고 계신가요? 아민 바흐다트 Amin Vahdat : 사이클 초기라고 생각합니다. 저희가 보는 수요로 추정하자면 확실히 그렇습니다. 구글은 10년 넘게 TPU를 만들어왔고 이제 7세대 생산을 시작했습니다. 내부적으로도 외부적으로도 사용되는데 7~8년 된 TPU도 100% 가동률을 보일 정도로 수요가 엄청나게 높습니다. 고객들은 누구나 가장 최신의 칩을 사용하고 싶어하지만, 얻을 수 있는 가속기라면 무엇이든 사용하고 있습니다. 수요가 엄청나다는 것도 말해주지만 공급이 부족하다는 것이기도 합니다. 할당을 거절하게 되는 분야들도 많습니다. 문제는 말씀하신 것처럼, 전력에 의해 병목이 발생하고, 데이터센터를 지을 토지에 대해서 제한이 있고, 인허가에 대한 병목이 있고, 공급망의 많은 것들이 제한적이라는 데 있습니다.
- 원문 구간 2
제가 걱정하는 것 중 하나는 공급이 느리기 때문에 우리 모두가 원하는 만큼 수요를 충족시키지 못할 수 있을 거란 우려입니다. 모두가 엄청난 금액을 지출하려 하지만 그게 실제로 투자로 연결될 수 있을지는 모르겠습니다. 수요 예측에 맞게 수조 달러의 자금이 투입되려 하지만 공급이 있어야 쓸 수 있을 것이라 그렇습니다. 저는 이 상황이 5년 동안 지속될 것이라 생각합니다. *코멘트 → 2025년 11월 6일, 구글 전사 직원회의에서 AI 인프라 책임자인 아민 바흐다트는 앞으로 AI 제품 서비스 수요를 충족하기 위해 6개월마다 서비스 용량을 2배씩 늘려야 한다고 말했습니다. 향후 4~5년 안에 1,000배+ 증가(2^10)를 말한 것입니다. 한쪽은 고객사 수요 증가세를 보고 컴퓨팅 수요를 생각한 것이고 한쪽은 돌아온 결과를 통해 추론한 것이지만, 12월 22일 주간전략보고에서 전해드린 OpenAI's Compute Flywheel도 비슷한 속도감입니다.
- 원문 구간 3
인프라 차원에서의 효율성 대규모 사전훈련, 추론, 강화학습, prefill, decode 라구 라구람 : 다음 주제로 넘어가면, 네트워킹에 대해서 생각해봅시다. Scale-up, Scale-out, Scale-across를 언급하셨는데, 네트워킹도 상당한 방식으로 혁신될 것 같습니다. 두 분께서 보고 계신 신호들을 모아서 볼 때 앞으로 네트워킹이 나아갈 방향은 무엇이라고 생각하시나요? 아민 바흐다트 Amin Vahdat : 네트워킹도 특정 목적에 맞춰서 바뀔 것이라 생각합니다. 데이터센터 내에 필요한 대역폭의 규모는 정말 놀라운 수준입니다. 그리고 계속해서 높아지고만 있습니다. 네트워크가 주요 병목 현상이 되고 있다는 점은 새로운 우려이기도 합니다. 더 높은 대역폭은 더 높은 성능으로 직접적으로 이어지고 있고, 네트워크는 칩에 비해서 전력 소비는 적으면서도 전체 클러스터의 TCO 대비 퍼포먼스는 크게 높이기 때문에 와트당 활용도는 매우 높습니다.
- 원문 구간 4
아민 바흐다트 Amin Vahdat : 어떻게 하는 게 좋을지 알아내려고 노력하고 있습니다. 지투 파텔 Jeetu Patel : 흥미로운 분야이죠. 전력이 병목이고, 컴퓨팅이 자산이라면, 네트워크는 이들을 증폭시키는 요소입니다. 패킷 이동에 절약하는 모든 와트는 더 많은 GPU에 할당할 수 있기 때문입니다. 훈련과 추론처럼 워크로드에 따라 최적화시켜야 하는 요소가 다릅니다. 예를 들어 훈련에는 Latency를 최적화하는 게 중요하지만, 추론에서는 메모리 최적화가 훨씬 더 중요합니다. 앞으로 네트워킹 인프라는 지금까지 그랬듯이 훈련용으로 썼던 인프라를 그대로 추론에 가져다 쓰는 것이 아니라, 점차 추론 전용 네트워크로 구축되는 방향으로 진화할 거라 생각합니다. 라구 라구람 : 사용 사례로 넘어가보면, 추론에 대해서 정리할 때 추론을 위해서 특정 아키텍처를 배포하고 계신가요?