[원문 유형] 네이버 프리미엄 콘텐츠 [채널] 올바른 미국주식 by SAPIENS [게시일] 2025.12.24. 오후 3:31 [원문 URL] https://contents.premium.naver.com/sapiens/sapiensasset/contents/251224153133074jm [제목] 구글 AI 인프라 책임자의 경고 : '우리는 여전히 수요를 심각하게 과소평가하고 있다' [수집 기준] 승인된 구독 열람권으로 실제 본문을 보존했다. 이미지·첨부는 별도 미디어 원장에 보관하며 시각적 의미 검토 여부를 구분한다. [구독 원문 본문] ​ 안녕하세요 올바른입니다. ​ AI 심화편 자료입니다. a16z에서 구글의 TPU 인프라 책임자인 아민 바흐다트, 시스코의 사장 겸 CPO인 지투 파텔과 AI 인프라의 현재와 미래에 대해서 말했습니다. ​ TPU의 탄생부터 함께 해온 구글 인프라 책임자 바흐다트는 추론용 컴퓨팅 수요는 6개월마다 2배씩 증가하고 있으며, 5년 뒤에는 총 1,000배의 컴퓨팅을 필요로 할 것을 전망했습니다. ​ 25년 만의 컴퓨팅 재창조가 일어나는 과정입니다. 전력과 네트워킹에 대한 수요를 들어보고, 아민 바흐다트가 고민하고 있는 대규모 사전훈련 및 제번스의 역설을 정리했습니다. ​ AI 사이클 : 전체 흐름 이해하기 2025-12-19 블랙록 2026 전망 : AI CAPEX $8T 시대를 열기 위한 '금융 보릿고개'를 지나는 중 (바로가기) 2025-12-18 마이크론 4Q25 실적발표 : 마이크론이 증명한 메모리 슈퍼사이클의 수혜강도 (바로가기) 2025-12-17 AI 버블론을 잠재우는 숫자들 : 엔터프라이즈 AI $37B 시장의 현주소 (바로가기) 2025-12-11 오라클 4Q25 실적발표 : 폭풍 속 컨퍼런스콜, 그리고 투자자들에게 남긴 세 가지 답변 (바로가기) 2025-12-04 엔비디아 펀더멘탈 체크 : 구글 TPU의 추격? 시장점유율에 대한 생각, 아시아 공급망 체크 (바로가기) 2025-11-28 오픈AI 공동창업자 일리야 수츠케버 : 인간의 진화에서 찾은 초지능의 열쇠, '감정' (바로가기) 2025-10-03 엔비디아 CEO 젠슨황 인터뷰 : 오픈AI 10GW 동맹 x 극한의 풀스택 공동 설계 (바로가기) 2025-09-26 AI 사이클 한 눈에 보기, SemiAnalysis 인터뷰 : 승부사 젠슨황 그리고 화웨이의 역습 (바로가기) 투자자문 서비스에 따른 투자 시 원금 손실이 발생할 수 있으며, 투자 손익에 대한 책임은 전적으로 고객에게 귀속됩니다. 또한 과거의 투자수익이 미래의 수익률을 보장하지 않습니다. ​ 신규 구독 전에, 아래 투자자문계약 권유문서의 계약 관련 제반 사항을 반드시 읽으시고 충분히 검토하시기 바랍니다. ​ *투자자문계약 권유문서 : https://naver.me/5ZST47Qf 목차 ​ 수요는 여전히 과소평가 되는 중 : 7~8년 된 TPU도 100% 가동되고 있는 상태 25년 만에 컴퓨팅을 재창조하는 중 : ML/System Co-design이 핵심이다 인프라 차원에서의 효율성 : 대규모 사전훈련, 추론, 강화학습, prefill, decode AI를 잘 쓰기 위해 준비할 것 : 기술이 아닌 문화적 재설정이 중요하다 아민 바흐다트 Amin Vahdat 2025년 10월 29일, 구글 AI 칩 인프라 책임자의 생각 수요는 여전히 과소평가 되는 중 7~8년 된 TPU도 100% 가동되고 있는 상태 *코멘트 → 인터뷰어인 라구 라구람(Raghu Raghuram)은 VMware에서 20년간 근무하며 2021~2023년 CEO까지 올라간 뒤 2025년 5월부터는 a16z의 General Partner로 일하고 있는 인물입니다. / 인터뷰이인 아민 바흐다트(Amin Vahdat)는 2010년부터 15년째 구글의 AI 인프라 책임자로서 TPU 및 각종 인프라를 관리하는 책임자이고, 지투 파텔(Jeetu Patel)은 JLL, Equinix의 사외이사이자 Cisco의 사장 겸 CPO로 근무 중인 인물입니다. ​ 라구 라구람 Raghu Raghuram : 두 분은 업계에 모두 오래 계셨고, 여러 인프라 사이클을 경험하셨는데요. 지금의 AI 사이클 같은 사이클을 본 적이 있나요? 투자자의 관점이 아니라 무언가를 실제로 구축하고 계획하는 책임자이신 기업인의 관점에서요. ​ 아민 바흐다트 Amin Vahdat : 제 생각에는 아무도 이런 규모의 사이클은 본 적이 없다고 확신합니다. 90년대~00년대 초반의 인터넷은 정말 거대한 사이클이었고, 당시에는 믿을 수 없을 정도의 구축 속도라고 느꼈었습니다. 당시 속도감과 비교할 때 지금은 100배 정도의 모멘텀을 갖고 있는 것 같습니다. 그리고 인터넷 시기 구축했던 네트워킹의 잠재적인 활용가치 대비 업사이드도 100배 정도에 달할 것이라고 생각합니다. ​ 지투 파텔 Jeetu Patel : 맞습니다. 이정도 규모, 속도, 범위에 대한 선례는 없습니다. 좋은 소식은 인프라를 다루는 게 다시 섹시해졌다는 점입니다. 오랫동안 고리타분한 분야였죠. 정말 흥미로운 건 이 산업의 특성을 보자면 인터넷 인프라 구축, 우주 발사 경쟁, 맨해튼 프로젝트가 모두 합쳐진 것처럼 움직이고 있다는 것입니다. 지정학적 함의, 경제적 함의, 국가안보적 함의 등 심오한 분야입니다. ​ 그리고 아직 수요에 대해 심각하게 과소평가하고 있다고 생각합니다. 제가 가장 많이 하는 일은 이 산업에 거품이 있는지를 체크하고 다니는 일인데, 여전히 구축에 쓰일 수요를 심각하게 과소평가 하고 있다고 생각합니다. 예상치보다 훨씬 더 많은 것들이 필요할 것이라 생각합니다. ​ 라구 라구람 : 뒤의 질문과 이어지는데요. 그럼 지금 CAPEX 사이클 중 어느쯤에 왔다고 생각하시나요? 그리고 수요를 예측하기 위해 여러분이 내부적으로 사용하시는 신호는 무엇인가요? 데이터센터는 4~5년 전부터 계획을 하셔야 할텐데, 수요나 기술적인 신호를 어떻게 해석하고 계획하고 계신가요? ​ 아민 바흐다트 Amin Vahdat : 사이클 초기라고 생각합니다. 저희가 보는 수요로 추정하자면 확실히 그렇습니다. 구글은 10년 넘게 TPU를 만들어왔고 이제 7세대 생산을 시작했습니다. 내부적으로도 외부적으로도 사용되는데 7~8년 된 TPU도 100% 가동률을 보일 정도로 수요가 엄청나게 높습니다. 고객들은 누구나 가장 최신의 칩을 사용하고 싶어하지만, 얻을 수 있는 가속기라면 무엇이든 사용하고 있습니다. 수요가 엄청나다는 것도 말해주지만 공급이 부족하다는 것이기도 합니다. 할당을 거절하게 되는 분야들도 많습니다. ​ 문제는 말씀하신 것처럼, 전력에 의해 병목이 발생하고, 데이터센터를 지을 토지에 대해서 제한이 있고, 인허가에 대한 병목이 있고, 공급망의 많은 것들이 제한적이라는 데 있습니다. 제가 걱정하는 것 중 하나는 공급이 느리기 때문에 우리 모두가 원하는 만큼 수요를 충족시키지 못할 수 있을 거란 우려입니다. 모두가 엄청난 금액을 지출하려 하지만 그게 실제로 투자로 연결될 수 있을지는 모르겠습니다. 수요 예측에 맞게 수조 달러의 자금이 투입되려 하지만 공급이 있어야 쓸 수 있을 것이라 그렇습니다. 저는 이 상황이 5년 동안 지속될 것이라 생각합니다. ​ *코멘트 → 2025년 11월 6일, 구글 전사 직원회의에서 AI 인프라 책임자인 아민 바흐다트는 앞으로 AI 제품 서비스 수요를 충족하기 위해 6개월마다 서비스 용량을 2배씩 늘려야 한다고 말했습니다. 향후 4~5년 안에 1,000배+ 증가(2^10)를 말한 것입니다. 한쪽은 고객사 수요 증가세를 보고 컴퓨팅 수요를 생각한 것이고 한쪽은 돌아온 결과를 통해 추론한 것이지만, 12월 22일 주간전략보고에서 전해드린 OpenAI's Compute Flywheel도 비슷한 속도감입니다. 더 많은 컴퓨팅이 더 강한 AI, 더 나은 제품, 더 높은 매출로 연결된다는 것이고 1년에 3~4배 이상의 컴퓨팅 확보가 필요하다는 속도인식을 공유하고 있습니다. 앤트로픽의 ARR도 올해 말 $9B → 내년 $20~$26B로 전망한 것을 생각하면 1년에 ~3배 정도의 속도감입니다. ​ 라구 라구람 : 그러면 감가상각 주기에는 어떻게 대응하시나요? 수요와 감가상각 주기가 잘 일치하나요? ​ 아민 바흐다트 Amin Vahdat : 저희는 적시에 필요한 컴퓨팅만큼을 구매(Just-in-time)합니다. 중요한 건 이는 하드웨어에 대한 적시 구매이고, 전력에 대한 감가상각은 약 25~40년이므로 이점이 있습니다. ​ *코멘트 → 고객사들은 특정 랙에 맞춰서 데이터센터 전력과 냉각 밀도를 설계해야 하기 때문에, 수요추정을 한 뒤에 앞으로 몇 년간 필요할 컴퓨팅에 대해서 엔비디아, AMD, ASIC 파트너들에게 미리 요청하고 데이터센터 가동이 준비되면 칩을 인도받아 클러스터를 구축하는 식입니다. 새로운 현상은 아니고 2023년 AI Boom 첫 사이클 시작에서부터 같은 상황이 이어져 오고 있습니다. 당시 마이크로소프트는 2023년 하반기부터 2024년 하반기까지 오픈AI가 더 많은 컴퓨팅을 요청했음에도 이를 거절했었는데, 이는 MSFT가 오픈AI 단일 고객을 위한 호스트가 아니며 단일 세대의 H100에 대규모 인프라가 갇히는 걸 원하지 않았기 때문이었습니다. ​ *코멘트 → 11월 중순, 주간전략보고에서 전해드린 마이크로소프트 CEO 사티아 나델라의 생각도 같았습니다. 1년마다 새로운 칩이 나오면서 발생하는 감가상각때문이기도 하지만, GB200, GB300, VR200, VR300에 이르기까지 계속해서 냉각과 전력 밀도가 달라지기 때문에 하나의 스펙에 맞춰서 모든 것을 구축하지 않고 새로운 칩이 나올 때마다 충분한 칩을 구매하는 게 목표입니다. 마이크로소프트도 오픈AI향 추론 수요를 감당하기 위해서 4Q25에는 Fairwater 1에 GB300 10만 개를 온라인했습니다. ​ *코멘트 → 감가상각에 대해서는 11월 24일 주간전략보고에서 전해드린 바 있습니다. Bernstein이 출시 6년차인 A100 모델조차 충분한 수익성을 증명하고 있다고 말한 부분입니다. GPU의 내용 연수를 6년으로 설정하는 감가상각 회계 처리가 타당하다고 보았습니다. GPU 운영 비용이 클라우드 렌탈 시세 대비 현저히 낮기 때문에, 구형 모델인 A100을 가동하더라도 여전히 높은 마진을 남길 수 있다는 것입니다. 물론 GPU는 출시 첫해에 가치가 20~30%가량 하락합니다. 이는 하이퍼스케일러와 AI Labs들이 초기 12~18개월 동안은 차세대 모델의 사전훈련에 최신 GPU를 집중적으로 할당하기 때문입니다. 하지만 사전 학습이 완료되고 사후훈련 및 추론 단계로 넘어가면 상황은 달라집니다. 대략 2년차부터는 해당 GPU가 상대적으로 사양 민감도가 낮은 워크로드로 계속해서 재배치(Cascading)되어 지속적으로 활용되기 때문에, 6년이라는 기간 동안 경제적 가치는 충분히 유지되는 구조입니다. ​ 지투 파텔 Jeetu Patel : 네트워킹 측면에 대해서 말씀드리자면, 하이퍼스케일러, 네오클라우드, 엔터프라이즈로 고객들을 나눠 볼 때 얘기들이 상당히 많이 다르다고 생각합니다. 엔터프라이즈는 인프라 구축 단계에 있어서 상당한 초기 단계입니다. 이들이 자체 데이터센터를 구축 및 업그레이드 하는 주기가 생길 것인데, 기존 CPU 데이터센터에 비해서 랙당 전력 및 냉각 요구사항이 매우 다르기 때문입니다. ​ *엔터프라이즈 AI 자료 → ​ 그리고 전력, 컴퓨팅, 네트워크의 희소성에 대해서는 저도 아민의 의견과 같습니다. 여기에 덧붙여서 보면, 지금 당장은 한 곳에 충분한 전력이 없기 때문에 데이터센터가 지어질 곳으로 전력을 가져오는 게 아니라, 데이터센터가 전력이 충분한 곳에 지어지고 있습니다. 전 세계적으로 프로젝트가 분산되는 이유입니다. ​ 데이터센터들이 점점 더 멀리 떨어져서 지어진다는 게 특징인데, 이 과정에서 단일 부지에 ⓐ랙당 더 많은 네트워킹을 가진 Scale-up Network 수요가 크게 증가하고 있고, ⓑ여러 랙과 클러스터를 연결하는 Scale-out에 대한 수요도 증가하고 있으며, ⓒ최대 800~900km 가량 떨어진 두 개의 데이터센터를 하나의 논리적인 데이터센터로 만드는 Scale-across에 대한 수요도 증가하고 있습니다. ​ *Scale-up, Scale-out, Scale-across에 대한 자료 → <엔비디아 3Q25 실적발표 : 2026년 말까지 "SOLD OUT", 젠슨황이 $500B 매출을 확신하는 이유> 25년 만에 컴퓨팅을 재창조하는 중 ML/System Co-design이 핵심이다 라구 라구람 : 다음 주제인 시스템과 네트워킹의 미래로 이어지는데요. 구글은 웹 혁명을 위한 최초의, 대규모 Scale-out 상용 서버를 생산했고, 엔비디아는 다른 형태이지만 메인프레임을 되살리는 중입니다. 다음에는 무슨 일이 일어날 거라 보시나요? ​ 아민 바흐다트 Amin Vahdat : 글쎄요. 메인프레임으로 돌아가고 있다고 생각하진 않습니다. 사람들은 여전히 여러 풀에 걸쳐서 Scale-out 아키텍처로 구성된 클러스터를 사용하고 있습니다. GPU나 TPU를 갖고 있더라도 전체 GPU 슈퍼컴퓨터를 사용하는 사람만 있는 것은 아닙니다. 예를 들어, GPU 16,384개(HGX 8-GPU 1개 랙 * 2048개 rack-to-rack 연결)로 구성한 하나의 클러스터가 있다면 그중 일부를 가져다 쓰는 식입니다. 많은 경우에 균일한 연결성을 갖고 있으며 매우 유연하고 확장 가능한 컴퓨팅입니다. TPU도 마찬가지입니다. 여기서의 핵심은 소프트웨어의 Scale-out입니다. ​ *코멘트 → 메인프레임은 하나의 거대하고 강력한 단일 시스템입니다. 성능을 높이려면 더 크고 비싼 부품으로 교체해야 하고(Scale-up), 시스템 전체가 하나로 묶여 있어 쪼개 쓰거나 유연하게 확장하기 어렵습니다. 아민은 현재 GPU/TPU 클러스터가 아무리 커졌더라도 본질적으로는 클러스터를 쪼개서 쓸 수 있는 Scale-out 구조를 따르고 있다고 말했습니다. ​ *코멘트 → 아민은 두 가지 때문에 메인프레임이 아니라고 말했습니다. ⓐ클러스터는 거대하지만 사용자가 전체를 빌려서 쓰는 구조가 아니라 그렇습니다. 그중 8개, 128개 등 일부만 떼서 사용할 수 있습니다. ⓑ메인프레임은 내부 부품끼리만 연결되어 있었는데, 지금은 수만 개의 칩이 하나처럼 연결하는 네트워킹 인프라와 함께 발전했습니다. 논리적으로는 하나처럼 움직입니다. 그리고 이를 가능하게 하는 건 수만 개의 가속기에 대해서 작업을 쪼개고 관리하는 소프트웨어 기술이 핵심이란 점입니다. ​ ​ 아민 바흐다트 Amin Vahdat : 두 가지로 정리해볼 수 있겠습니다. 첫 번째는 25년 전쯤 구글과 다른 곳에서 동시에 컴퓨팅 인프라가 진정한 의미로 변했다는 데에 전적으로 동의합니다. 당시 Linux 스택을 실행하는 상용 PC를 사용하여 디스크, 컴퓨팅, 네트워킹을 Scale-out했던 진정한 혁신이 있었습니다. 당시에는 상당히 급진적인 아이디어라고들 생각했는데, 이제는 모두가 당연하게 생각하는 부분입니다. ​ 두 번째로 흥미로운 점은, 지금의 AI 사이클은 그 이후 컴퓨팅을 두 번째로 재창조하는 시기라는 점입니다. 5년 후에는 하드웨어부터 소프트웨어까지 컴퓨팅 스택은 무엇이든 예전의 형태를 알아볼 수 없을 정도로 변할 것입니다. 그리고 이 과정에서는 ML/System Co-design이 중요합니다. 구글의 예시를 들어서 설명드리자면, Big table, Spanner, GFS, Borg, Colossus 같은 소프트웨어는 하드웨어와 소프트웨어간 공동 설계 없이는 불가능했을 것입니다. 이러한 작업은 AI 시대에도 동일하게 발생할 것입니다. ​ *코멘트 → Bigtable은 대규모 구조화 데이터를 저장하기 위한 분산형 스토리지이고, Spanner는 여러 지역에 데이터를 복제하면서도 하나의 DB처럼 쓸 수 있게 해주는 것, Google File System은 많은 머신을 오가는 워크로드의 throughput을 높이기 위해 장애를 허용하면서도 대규모 데이터 처리를 돕는 분산 파일 시스템, Borg는 구글 내 클러스터 스케줄러 및 오케스트레이터, Colossus는 GFS를 잇는 차세대 파일 시스템입니다. *코멘트 → 이번 인터뷰이 중에 시스코 임원이 있으므로, 워크로드와 하드웨어가 얼마나 밀접한 연관이 있는지에 대해 시스코쪽 사례를 들어 설명드리면 이렇습니다. 시스코는 현재 챗봇 상호작용이 메인인 추론 워크로드가 앞으로 점점 더Agentic AI 워크로드로 가게 되면 마치 네트워크상 훈련과 점점 더 비슷해집니다. 원래는 사용자가 질문을 던질 때만 트래픽이 급증하고 답변을 받으면 다시 떨어지는 식으로 상호작용이 간헐적이고 단발적인데, Agentic AI는 명령 없이도 스스로 작업을 수행하는 긴 자율 행동 시간을 갖기 때문에 네트워크 부하가 높은 수준으로 꽤나 오래 유지된다는 점입니다. ​ *코멘트 → 모델과 워크로드가 바뀌면 하드웨어도 바뀝니다. 이 과정에서 엔비디아의 해자는 수많은 고객사들과 연구~사전훈련~사후훈련~추론에 이르기까지 수많은 ML들을 가속시켜주는 과정에서 차세대 워크로드로 무엇이 될 것이라는 힌트를 미리 얻는다는 점입니다. 이는 구글의 제프 딘이 강조했던 부분이기도 하고, AWS가 앤트로픽에게 지분투자하면서 사실상 Project Rainier를 무료로 주는 대신 차세대 모델 훈련을 Trainium을 기반으로 하게끔 계약을 맺은 이유이기도 합니다. ​ 지투 파텔 Jeetu Patel : 통합된 시스템에 대한 엄청난 수요가 있을 거라 생각합니다. 시스코는 물리적인 부분부터 의미론적인 부분까지, 즉 칩부터 애플리케이션까지 모든 것을 다루고 있습니다. 실제 AI 애플리케이션을 운영하는 과정에서 겪는 병목 중 하나는 전체 ML/System이 얼마나 잘 통합되어 있으며 전체 스택을 가동하는 데 있어서 손실을 얼마나 최소화 할 수 있는가입니다. 긴밀한 통합은 점점 더 중요해질 이유입니다. 마치 하드웨어와 소프트웨어가 서로 다른 여러 기업임에도 불구하고 같이 협업하면서 한 회사처럼 일해야 한다는 것입니다. ​ 예를 들어, 구글 같은 하이퍼스케일러와 협력할 때 저희는 거래가 성사되기 한참 전부터 심층적인 설계 파트너십을 맺고 몇 개월 동안 로드맵에 대해서 공유합니다. 이처럼 업계는 이미 폐쇄적인 환경에서 개발하고 있지 않고, 점점 더 개방형 생태계에서 운영하고 있습니다. 하드웨어부터 소프트웨어까지 긴밀한 협력을 위해서 점점 더 많은 것들이 오픈되고 결합될 거라 생각합니다. ​ 라구 라구람 : 투자자들이 가장 흥미로워 하는 주제는 칩에 대한 것입니다. 현재 엄청난 시장 점유율을 가진 놀라운 프로세서를 생산하는 칩 메이커가 있습니다. 그리고 스타트업들이 온갖 종류의 AI 칩을 개발하고 있는 것들도 보고 있으며, 구글의 폐쇄적인 정원에도 놀라운 프로세서가 있습니다. 이런 칩 분야에서는 앞으로 어떤 일이 일어날 거라고 생각하시나요? ​ 아민 바흐다트 Amin Vahdat : *웃음* 우선, 저희는 엔비디아의 열렬한 팬입니다. 엔비디아 제품과 칩을 정말 많이 판매하고 있고, 고객들이 그 제품을 좋아하기 때문에 그렇습니다. 그리고 저희는 TPU도 계속해서 발전시키고 있습니다. 미래는 정말 흥미로울 거라 느끼는데, GPU, TPU, Trainium 등 다양한 칩들이 생긴다고 해서 단일 기업의 정점이 올 거라고 느끼지 않습니다. ​ 지금은 진정한 특화(Specialization)의 황금기입니다. 제가 가장 잘 아는 TPU를 예로 들자면, 특정 연산의 경우 와트당 효율성이 10~100배 더 높습니다. 구글에서 많이 시행되는 다양한 제품이나 에이전트 워크로드 같은 것도 좀 더 특화시킨 아키텍처와 좀 더 특화시킨 칩을 통해서 많은 이점을 얻을 수 있습니다. ​ 이 분야에서 실제 병목은 워크로드에 전문화된 아키텍처를 구현하는 것이 얼마나 어려우며, 현실 속 혁신의 속도에 비해서 시간이 매우 많이 걸린다는 부분입니다. 지금은 거의 영원한 수준입니다. 세계 최고의 팀을 기준으로 하더라도 개념을 설정하고 실제 양산에 이르기까지 빛의 속도로 개발한다고 볼 때 2년 반이 걸립니다. 모든 것을 완벽하게 해낸다는 가정 하에 말입니다. ​ 지금 그렇게 하는 팀은 아주 소수(a few team)있지만, 전문화된 하드웨어를 구축하기 위해 2년 반 뒤의 미래를 어떻게 예측할 수 있을 것이냐의 문제입니다. 그래서 ⓐ개발 주기를 더 단축시킬 수 있어야 한다고 생각하지만 ⓑ개발이 조금씩 더 느려지더라도 전력 절감, 비용 절감, 공간 절감이 엄청나게 무시할 수 없을 수준이기 때문에 더 많은 특화된 아키텍처가 개발될 것으로 예상합니다. ​ *코멘트 → 엔비디아의 정체성이 처음에 GPU로 시작했다보니 시장에서도 편의상 'GPU'라고 많이 언급되는데, 실제로는 Tensor Core로 가득찬 TPU입니다. 특화를 말하면 주로 ASIC이 처음 생각나실 수 있으나, 워크로드별로 TCO 대비 퍼포먼스를 극한까지 끌어올리는 과정이 핵심입니다. HW만 생각하는 것을 넘어서, ML/System 차원에서의 생각을 쭉 끌고가는 게 중요하다고 생각합니다. 엔비디아의 NVLink 72, Rubin CPX 같은 경우가 기존 AI HW에서 한 가지 X Factor씩을 더한 대표적인 사례입니다. GPU vs ASIC에 대해서는 <엔비디아 펀더멘탈 체크 : 구글 TPU의 추격? 시장점유율에 대한 생각> 자료에서 전체적인 맥락을 다시 잡으실 수 있습니다. ​ 지투 파텔 Jeetu Patel : 이는 지정학적인 구조에도 흥미로운 영향을 줄 것입니다. 왜냐하면, 지금 중국에서 무슨 일이 벌어지고 있는지를 생각해볼 때, 중국은 2nm 칩을 만들지 않기 때문입니다. 중국은 7nm 칩을 만듭니다. 그대신 그들은 무제한의 전력과 무제한의 엔지니어링 자원을 갖고 있습니다. 그렇다면 7nm 칩 하에서 무제한의 엔지니어들을 투입하여 전력 효율과 무관한 인프라를 구축할 수 있습니다. ​ 미국은 극도로 전력 효율적이어야 하며, 엔지니어가 중국만큼 수요에 비해 풍부하진 않습니다. 대신 2nm 칩으로 생산할 수 있습니다. 전력 효율적이란 이점을 갖고 있지만 어떤 면에서는 열 손실이 발생할 수도 있습니다. 이런 요소들을 모두 고려하자면 모델 아키텍처나 시스템들은 지역별로 앞으로 더욱 더 특화될 것이라 생각합니다. 중국이 내수를 벗어나서 외국으로 칩을 판매하려고 할 때, 미국이 파는 모델과 시스템에 비해서 매우 다른 아키텍처 형태를 판매할 수 있다는 의미입니다. 물론 이는 향후 3년간 테크 분야에서 벌어질 흥미로운 게임이론적 문제이며, 지금은 결과를 아무도 예단할 수 없을 거라 생각합니다. 인프라 차원에서의 효율성 대규모 사전훈련, 추론, 강화학습, prefill, decode 라구 라구람 : 다음 주제로 넘어가면, 네트워킹에 대해서 생각해봅시다. Scale-up, Scale-out, Scale-across를 언급하셨는데, 네트워킹도 상당한 방식으로 혁신될 것 같습니다. 두 분께서 보고 계신 신호들을 모아서 볼 때 앞으로 네트워킹이 나아갈 방향은 무엇이라고 생각하시나요? ​ 아민 바흐다트 Amin Vahdat : 네트워킹도 특정 목적에 맞춰서 바뀔 것이라 생각합니다. 데이터센터 내에 필요한 대역폭의 규모는 정말 놀라운 수준입니다. 그리고 계속해서 높아지고만 있습니다. 네트워크가 주요 병목 현상이 되고 있다는 점은 새로운 우려이기도 합니다. 더 높은 대역폭은 더 높은 성능으로 직접적으로 이어지고 있고, 네트워크는 칩에 비해서 전력 소비는 적으면서도 전체 클러스터의 TCO 대비 퍼포먼스는 크게 높이기 때문에 와트당 활용도는 매우 높습니다. 조금만 투자해도 훨씬 더 많은 것을 얻을 수 있다는 의미입니다. ​ AI 워크로드는 네트워크 통신 패턴에 대해서 사전에 알고 있다는 게 엄청난 기회입니다. 예를 들어서, 어떤 식으로 통신할지를 미리 세팅할 수 있다면 패킷 내의 스위치의 모든 기능이 필요한지에 대해서 의문을 가져볼 수 있고, 여기서도 최적화 시킬 수 있는 기회들이 많을 거란 의미입니다. ​ AI 훈련용 워크로드는 놀라울 정도로 Busty합니다. 컴퓨팅을 잔뜩 수행하다가, 갑자기 멈추고 대규모 네트워크 통신을 수행하고, 다시 컴퓨팅으로 전환됩니다. 수십~수백MW급 규모의 클러스터가 한 번에 연산했다가 한 번에 쉬고 하기 때문에, 전력 유틸리티 기업들이 구글 외부에서 이렇게 멈추는 과정을 알아낼 수 있을 정도입니다. 짧은 시간 동안 0% → 100%를 오가는 네트워크를 어떻게 구축하는 것이 효율적인가에 대한 난제가 있습니다. ​ 그리고 네트워크 구축 과정에서도 난제가 있습니다. 대규모 사전훈련은 1년 내내 데이터센터 사이트 전체에서 수행되지 않습니다. 예를 들어서, 프론티어 모델을 대규모 사전훈련하기 위해서 최신 칩과 최신 네트워킹을 세 곳의 데이터센터에 구축했다고 가정해봅니다. 그리고 더 최신 칩과 네트워킹으로 새로운 모델을 훈련시켜야 할 겁니다. 남겨진 기존 네트워크에서도 충분한 워크로드 가동이 있겠지만, 대규모 사전훈련에 필요했던 규모만큼의 용량이 필요하진 않습니다. 그렇다면 전체 데이터센터의 생애주기 중에서 5%의 시간에만 대규모 네트워크가 필요한 것인데 이에 대해서 어떻게 더 활용할지에 대한 해결책이 난제입니다. ​ 혹시 여러분 중에 아시는 분이 계시다면 알려주시면 감사하겠습니다. 고민입니다. ​ 라구 라구람 : 저희가 모르면 아무도 모를 것 같은데요? ​ 아민 바흐다트 Amin Vahdat : 어떻게 하는 게 좋을지 알아내려고 노력하고 있습니다. ​ 지투 파텔 Jeetu Patel : 흥미로운 분야이죠. 전력이 병목이고, 컴퓨팅이 자산이라면, 네트워크는 이들을 증폭시키는 요소입니다. 패킷 이동에 절약하는 모든 와트는 더 많은 GPU에 할당할 수 있기 때문입니다. 훈련과 추론처럼 워크로드에 따라 최적화시켜야 하는 요소가 다릅니다. 예를 들어 훈련에는 Latency를 최적화하는 게 중요하지만, 추론에서는 메모리 최적화가 훨씬 더 중요합니다. 앞으로 네트워킹 인프라는 지금까지 그랬듯이 훈련용으로 썼던 인프라를 그대로 추론에 가져다 쓰는 것이 아니라, 점차 추론 전용 네트워크로 구축되는 방향으로 진화할 거라 생각합니다. ​ 라구 라구람 : 사용 사례로 넘어가보면, 추론에 대해서 정리할 때 추론을 위해서 특정 아키텍처를 배포하고 계신가요? 아니면 여전히 훈련에서 쓰는 아키텍처를 추론에도 쓰는 중인가요? ​ 아민 바흐다트 Amin Vahdat : 구글은 추론을 위해 특화된 아키텍처를 배포하고 있으며(훈련용 v6p, 추론용 v6e), 하드웨어만큼 소프트웨어에서도 추론용 소프트웨어에도 노력하고 있습니다. 추론 워크로드 중 하나로서 정말 흥미로워지고 있는 포인트는 강화학습입니다. 서빙 워크로드들 중에 ​​강화학습이 차지하는 비중(Reasoning)이 늘고 있는데, 강화학습은 지연시간이 절대적으로 중요(Test-time compute는 훈련과 비슷)한 것이라 중요합니다. 시스템 구축 및 연결 방식에서 네트워킹이 점점 더 핵심적인 역할을 하고 있습니다. ​ *코멘트 → 12월 8일 주간전략보고를 통해 전해드린 것처럼, Sparse MoE & Reasoning 워크로드에 대해서는 NVLink를 통한 All-to-All 연결이 갖는 장점이 뚜렷한 구조입니다. 오픈AI는 이제 추론의 효율을 극한까지 끌어올리기 위해 알리바바가 Qwen-Next에서 512개의 expert를 만드는 사이 GPT-6부터는 2,048개의 expert를 둘 것으로 예상합니다. ​ 라구 라구람 : 추론 비용을 1,000배 낮추는 데 필요한 단일 병목지점이 있나요? 아니면 여러 분야에서 추론 비용을 낮춰가는 곡선처럼 구성되어 있나요? ​ 아민 바흐다트 Amin Vahdat : 추론은 두 가지 분야로 나뉩니다. 아마 익숙하시겠지만, Prefill과 Decode는 매우 매우 다른 워크로드입니다. 균형점이 다릅니다. 그래서 사실 이상적으로는 두 가지 다른 하드웨어로 추론하는 것이 중요합니다. 그게 하나의 기회입니다. ​ *코멘트 → Rubin CPX(4Q26 출시 예정)는 분산 추론(Disaggregated Inference)의 시작을 알린 칩입니다. Transformer 계열 LLM의 추론은 크게 두 가지 작업으로 분리됩니다. Prefill과 Decode입니다. ​ 워크로드별로 특징을 보면 Prefill은 컴퓨팅이 많이 필요하고, 상대적으로 메모리 대역폭은 낮아도 됩니다. 그래서 비싼 HBM을 사용하는 대신 CPX에는 128GB GDDR7(대역폭 2TB/s)을 탑재했습니다. HBM 절반 가격으로 만든 칩이고, R200 GPU 대비 4분의 1 가격으로 동일 작업을 수행합니다. 그리고 Decode는 메모리 대역폭을 많이 필요로 합니다. HBM에 적합하기에 R200에는 여전히 288GB HBM4(대역폭 20.5TB/s)가 탑재됩니다. ​ 기존의 방식은 Aggregated로, Prefill 및 Decode 작업을 단일 GPU에서 동시 처리하는 식이었습니다. Prefill은 계산량이 많아 병렬성이 낮고, Decode는 KV Cache를 사용할 수 있기 때문에 병렬성이 상대적으로 높은 워크로드입니다. 문제는 단일 아키텍처이기 때문에 유연성이 부족하고 병목이 생긴다는 점이 문제였습니다. ​ 새로운 방식은 Disaggregated로, Prefill과 Decode 작업 중에 Prefill을 전용 하드웨어로 분리하는 게 핵심입니다. Prefill에 맞게 따로 특화시킨 CPX 칩에서 계산에 최적화된 작업을 하고, 병렬성이 높은 Decode 작업은 기존 Rubin GPU에 배정하는 것입니다. 이렇게 되면 KV Cache를 HBM 대신 GDRR7처럼 더 저렴한 스토리지로 옮겨서 GPU 메모리를 확보할 수 있게 됩니다. 워크로드에도 다양한 하드웨어간 스마트 라우팅으로 유연한 확장을 할 수 있다는 게 핵심입니다. ​ 이를 위해 엔비디아는 소프트웨어 레벨에서 ⓐSmart Router, ⓑKV Cache Manager, ⓒGPU Resource Planner를 추가하여 LLM 추론 과정에서 Prefill과 Decode를 분산하여 처리하고, KV Cache를 GPU 메모리에서 오프로딩하여 GPU 리소스를 최적화하는 아키텍처입니다. 이렇게 하면 대규모 사용자 처리, 모델 확장성, 리소스 효율성이 모두 개선됩니다. 이전에 비해 Prefill 비용이 절감되므로 ROI가 30~50배 증가하고, 전체 시스템 단위 효율은 3~7.5배 좋아졌습니다. ​ 기존의 칩들과 전혀 다른 구조이기 때문에 이제 모든 ASIC 플레이어들은 엔비디아와의 'TCO 대비 퍼포먼스' 비교에서 엔비디아를 따라가기 위해 자체적인 Prefill ASIC을 동시에 개발해야 하는 상황이 시작됐습니다. 그리고 이제 추론에서도 엔비디아가 깔아둔 분산형 추론 설계를 채택할 경우 훨씬 더 TCO 대비 퍼포먼스가 우수해질 것입니다. 추론이 점점 복잡해질수록 훈련에서처럼 엔비디아가 가진 하드웨어·소프트웨어·네트워킹·공급망 관리 차원의 해자가 점점 더 강해질 것으로 예상합니다. ​ 그리고 개인적으로 다년간에 걸쳐서 향후 Decode용 칩도 따로 설계될 것으로 예상합니다. 대만에서 유능한 ASIC 인재들을 수천 명 모아서 AI 연구소가 첫 번째로 출시한 칩이 CPX일 뿐입니다. 엔비디아가 ASIC 팀을 준비 중이라는 내용은 2024년 4월 업계에 처음으로 팀 빌딩에 대해 알려졌고 → 2025년 1월에 대만에 1,000명 규모 대규모 R&D 연구소를 꾸리면서 공식 확인됐던 내용입니다. 당시 MediaTek, Alchip, GUC쪽 대만 ASIC 인재를 블랙홀처럼 빨아들였던 것의 결과가 4Q26에 출시될 Rubin CPX로 연결됐습니다. ​ 아민 바흐다트 Amin Vahdat : 다만, 많은 분들이 깨닫지 못하는 것은 실제로 우리는 추론 비용을 엄청나게 빠른 속도로 절감하고 있다는 것입니다. 100배씩 대규모로 절감하고 있습니다. 문제는 사용자들이 더 효율성이 높은 모델을 원하는 게 아니라, 더 높은 퀄리티를 계속해서 요구한다는 점입니다. 기존의 모델에 대한 효율성을 100배씩 이상 개선시키자마자, 차세대 모델이 출시되고, 달러당 지능은 훨씬 더 높아지지만 여전히 더 많은 비용을 지불하게 되는 사이클이 반복되고 있습니다. ​ 지투 파텔 Jeetu Patel : 그리고 추론시간이 길어질수록 사용자들은 더 조급해하고 있습니다. 예를 들어, 이전에 Deep Research를 써서는 20분 정도씩 추론하여 하나의 리서치를 완료했습니다. 이제는 코딩 도구들을 보면 7시간~30시간까지도 자율적으로 에이전트가 실행하며 답을 찾아내옵니다. 이런 자율 실행 시간이 길어질수록 그 시간을 압축하려는 더 큰 수요가 발생하고 있습니다. ​ 끊임 없는 루프입니다. 지능을 높이기 위해 더 길게 생각하고, 더 많은 도구를 사용하게 되는데, 그러면 사용자는 그 시간을 단축시켜주길 원합니다. 더 높은 지능, 더 많은 사용 사례를 가질수록 더 많은 추론 수요를 필요로 하는 일종의 자기 충족적인 예언과도 같으며 추론에 대한 수요는 영속적일 거라 생각합니다. ​ 제번스의 역설 Jevons Paradox 엔비디아의 제품전략에 대해서 깊게 생각해보셨다면, 직관에는 맞지 않는 포인트가 하나 있습니다. Ampere → Hopper → Blackwell로 오면서 제품 가격은 결과적으로 점점 더 비싸졌는데 단위당 컴퓨팅 비용은 더 줄어드는 쪽으로 개발하고 있습니다. 그렇다면 엔비디아는 GPU를 쓰는 워크로드가 계속해서 늘어날 것을 가정한다는 이야기입니다. 이것이 엔비디아 소프트웨어 개발자들이 산업 일선에서 고객들과 끊임없이 소통하며 CUDA가 사용되는 사례를 늘리고 혁신에 앞장서는 기업인 이유이기도 하지만, 여기엔 조금 더 생각해볼 게 있습니다. ​ 산업혁명 시대 제번스의 역설이 재밌는 힌트였습니다. 과거에도 늘 비슷한 일들이 있어왔기 때문입니다. 1865년에 영국의 경제학자 윌리엄 스탠리 제번스William Stanley Jevons는 새로운 사회 현상을 발견했고 이를 논문으로 옮겼습니다. 석탄 사용의 효율성이 계속해서 높아지면 석탄 사용이 줄어들 거라 생각하지만, 그렇지 않고 오히려 석탄 소비량이 더 늘었다는 것입니다. 증기엔진이 효율적으로 변할 수록 더 많은 석탄을 쓰는 결과로 이어졌습니다. 비밀은 효율에 있었습니다. ​ 증기 엔진을 더 효율적으로 만들면 OPEX가 감소하고 → OPEX를 줄이면 수익성 있는 사용 사례가 증가하니 더 많이 지출한다는 것입니다. 클라우드 컴퓨팅, 이커머스, 핀테크의 역사에도 적용되는 이야기이며, 엔비디아가 컴퓨팅의 한계비용을 0으로 만들수록 계속해서 더 많은 사용 사례가 생겨나는 이유이기도 합니다. ​ 제번스의 역설은 기본적으로 산업혁명 시기부터 계속되어 왔던 노동 덩어리의 오류(Lump of labor fallacy)'와도 맞닿아 있습니다. 이 오류는 주어진 시간에 경제에서 수행할 노동의 총량이 정해져있으며, 그 일을 두고 기계와 사람이 경쟁한다는 오해에서 시작됩니다. 기계가 할 일이 늘어난 만큼 사람이 할 일이 없어질 거라는 생각입니다. AI를 잘 쓰기 위해 준비할 것 기술이 아닌 문화적 재설정이 중요하다 라구 라구람 : 현재 사용 가능한 모든 AI를 통해서, 얻고 있는 성과 중에 가장 중요한 성과는 무엇이신가요? 구글 내부적으로, 시스코 내부적으로 무엇을 얻고 있는지 궁금합니다. ​ 아민 바흐다트 Amin Vahdat : 코딩은 AI의 가장 명확한 사용 사례입니다. 활용도나 역량도 점점 더 높아지고 있습니다. 가장 최근의 프로젝트를 보자면, 며칠 전에 AI를 사용하여 명령어 세트 마이그레이션을 수행하는 방법에 대한 논문을 발표했습니다. x86 → ARM으로 상당히 대규모의 마이그레이션을 수행했는데, 이를 통해서 구글의 엄청난 코드베이스 전체를 명령어 집합에 구애받지 않도록 만들었습니다. 저희는 모든 코드 베이스가 그렇게 되기를 원하고 있습니다. 이에 대한 동기는 몇 년 전으로 거슬러 올라갑니다. ​ 저희는 Bigtable이란 놀라운 레거시 시스템과, Spanner라는 놀라운 시스템을 갖고 있었습니다. 그리고 당시 구글에서는 Bigtable에서 Spanner로 모두 이동해야 한다는 결정을 내렸습니다. 그래서 마이그레이션을 하는 데 얼마가 걸리는지를 추정했더니, 팀원 7명이 수천년 이상을 투입해야 마이그레이션할 수 있는 정도였습니다. 저희 엔지니어는 게으르지 않습니다. 기회비용이 너무 크다고 생각하여 마이그레이션을 포기하고 Bigtable에 남기로 결정했던 시점이었습니다. ​ 구글 내에서는 계속해서 코드베이스 마이그레이션을 꽤나 자주 합니다. TensorFlow → JAX로 마이그레이션을 하는 일도 많았는데, 이 과정에서는 AI를 통해 훨씬 더 빠르게 마이그레이션을 수행할 수 있엇습니다. 어떤 AI 도구는 아직 구글 엔지니어들에게 내부적으로 대규모 배포하여 사용하기에는 기준에 미치지 못하는 것들도 있지만, 계속해서 사용 사례나 대체정도는 점점 더 커지고 있습니다. ​ ​ 지투 파텔 Jeetu Patel : 시스코에서는 코드 마이그레이션도 많이 하고, 지금도 활용 가능성이 높은 3~4가지 정말 좋은 사용 사례를 보고 있고 아직 안 되는 것들인제 관심있게 보는 것들도 있습니다. 코드 마이그레이션에는 Codex, Claude, Cursor, Windsurf의 조합을 많이 쓰고 있습니다. 디버깅은 CLI를 사용하면 훨씬 더 생산적으로 쓰고 있습니다. 프론트엔드에서 다루는 코드 프로젝트는 훨씬 더 잘 먹힙니다. 엔지니어들의 생산성을 엄청나게 끌어올리고 있습니다. 다만, 오래된 코드, 특히 인프라 스택의 깊은 곳으로 다가가면 AI를 사용하기가 훨씬 어렵습니다. ​ 저희가 엔지니어에게 지시하는 것은 사실 기술적인 문제를 지시하기보다, 문화적인 재설정을 강조하고 있습니다. 누군가가 무언가 AI를 사용해보고 '제대로 작동하지 않습니다'라고 말한다고 해서 이걸 6~9개월 동안 방치해서는 안됩니다. 4주 안에 다시 돌아와서 다시 작동해보고 통하는지 확인해봐야 합니다. 모델이나 도구들이 발전하는 속도가 너무 빠르기 때문에 거의 이런 식으로 해야 생산성을 크게 끌어올릴 수 있습니다. ​ 오늘도 150명의 뛰어난 엔지니어들과 있었는데 제가 이들에게 요구한 건, 이 AI 도구들이 6개월 안에 무한하게 좋아질 것이라고 가정하라는 것이었습니다. 그리고 6개월 후 AI로 시킬 수 있을 것들은 무엇이 있을지를 미리 생각해보게 하는 것이 중요합니다. 지금 단기에 보고 안된다고 포기하는 것은 거대한 전략적 오류라고 생각합니다. 시스코는 내부적으로 25,000명의 엔지니어와 함께 일하고 있습니다. 내년 안에 엔지니어들의 생산성을 2~3배 높일 수 있기를 바라며, 실제로 어떻게 되는지 지켜볼만 하실 거라 생각합니다. AI 사이클 : 전체 흐름 이해하기 2025-12-19 블랙록 2026 전망 : AI CAPEX $8T 시대를 열기 위한 '금융 보릿고개'를 지나는 중 (바로가기) 2025-12-18 마이크론 4Q25 실적발표 : 마이크론이 증명한 메모리 슈퍼사이클의 수혜강도 (바로가기) 2025-12-17 AI 버블론을 잠재우는 숫자들 : 엔터프라이즈 AI $37B 시장의 현주소 (바로가기) 2025-12-11 오라클 4Q25 실적발표 : 폭풍 속 컨퍼런스콜, 그리고 투자자들에게 남긴 세 가지 답변 (바로가기) 2025-12-04 엔비디아 펀더멘탈 체크 : 구글 TPU의 추격? 시장점유율에 대한 생각, 아시아 공급망 체크 (바로가기) 2025-11-28 오픈AI 공동창업자 일리야 수츠케버 : 인간의 진화에서 찾은 초지능의 열쇠, '감정' (바로가기) 2025-10-03 엔비디아 CEO 젠슨황 인터뷰 : 오픈AI 10GW 동맹 x 극한의 풀스택 공동 설계 (바로가기) 2025-09-26 AI 사이클 한 눈에 보기, SemiAnalysis 인터뷰 : 승부사 젠슨황 그리고 화웨이의 역습 (바로가기)