2025.09.17 · 네이버 프리미엄 콘텐츠 · 올바른 미국주식 by SAPIENS

Scale-up 네트워크 이해하기 : 아스테라랩스와 브로드컴, 왜 지금 Scale-up인가?

유형
네이버 프리미엄 콘텐츠
날짜
2025.09.17
강연자/작성자
올바른 미국주식 by SAPIENS
분석 주제
미지정
자료 길이
본문 14,951자
1

문서 전체 조망

핵심 구조

랙 단위 AI의 기준점이 된 NVL72가 ASIC 진영의 Scale-up 경쟁을 넓힌다

GB200 NVL72는 하드웨어와 CUDA의 공동 최적화로 성능·경제성의 기준점이 됐고, 추론 토큰 증가와 대형 랙 확장이 UALink·SUE 및 관련 스위치 수요를 부각시킨다. 아스테라랩스에서는 AWS Trainium 3 침투와 이후 타 ASIC 채택이 가장 큰 변수로 제시된다.

Scale-up은 한 컴퓨팅 단위의 성능을 높이고, Scale-out은 여러 랙을 잇는다

NVL72는 기존 8개 GPU를 하나처럼 다루던 NVLink의 범위를 72개 GPU까지 확장한 랙 솔루션이다. 대규모 클러스터로 가기 전에 이 연결 단위의 성능을 먼저 끌어올리는 것이 중요했다는 관점이다.

GB200의 기준점은 하드웨어 출시가 아니라 CUDA와 운영 경험의 축적에서 나왔다

2025년 5월 DeepSeek 670B MoE 학습의 TCO당 성능은 H100보다 9% 낮았지만, 7월에는 진단·디버깅과 워크로드 최적화가 진전되며 H100 대비 1.52배로 제시됐다. NVL72의 경제성은 드라이버·런타임·통신·메모리 관리와 구성품 신뢰성이 함께 맞아야 한다는 설명이다.

Reasoning은 추론 단계의 토큰을 늘려 랙 내부 고성능 연결의 필요성을 키웠다

o1-preview와 o1-pro 이후 내부 추론과 검증에 쓰는 토큰이 늘었고, 지능 향상 대비 비용이 사전훈련 FLOPS를 10배 늘리는 것보다 낮아 이 흐름이 빠르게 채택됐다는 관점이다. NVL72의 TCO 대비 성능은 ASIC이 맞춰야 할 비교 기준이 됐다.

UALink와 SUE는 NVLink만 있던 시장에서 2026년 하반기부터 침투할 후보로 제시된다

모건스탠리의 Scale-up 네트워크 시장 전망은 2024년 40억달러에서 2029년 170억달러이며, 8-XPU에서 72·144·576·1024-XPU로 커지는 랙 수요는 더 빠른 확대 가능성을 만든다는 관점이다. 다만 이 수치는 전망이며 실제 랙 요청 규모가 전제다.

고객별 연결 방식은 다르고 AWS Trainium 3가 아스테라랩스의 첫 확인 구간이다

엔비디아는 NVLink, 구글은 ICI·OCS, AWS는 NeuronLink를 사용해 왔으며 AWS는 Scorpio X를 맞춤 설계해 2026년 램프업을 준비한다고 적었다. Trainium 3의 Teton 랙 배분과 이후 다른 하이퍼스케일러 ASIC의 UALink 채택이 아스테라랩스 성장의 핵심 변수다.

단거리 Scale-up은 구리 기반이 주류이고 광학은 중장기 과제로 남는다

랙 내부 1~2m 미만 연결에서는 가격과 지연 측면에서 구리가 유리하며, 모건스탠리는 2028년까지도 구리 기반이 주류일 것으로 예상했다. 광학의 Scale-up 채택은 가능성이지만 아직 주류와는 거리가 있다는 유보다.

아스테라랩스의 큰 성장 전망은 제품 탑재 비율과 고객 확산이라는 가정에 걸려 있다

Trainium 3의 20% 또는 40%가 Teton 랙으로 구축된다는 가정 아래 Scorpio X 매출은 각각 2억1,200만달러와 4억2,400만달러로 계산된다. Bull 15억달러와 Base 10억달러는 확정 실적이 아닌 배분·채택 조건의 시나리오다.

ANALYSIS VIEW사건별 사실과 작성자의 판단, 지속 정보를 나누어 읽기
2
발생·예정 사건과 출처별 관점

이슈 분석

이 자료가 이슈의 어떤 사실을 다루고, 작성자가 무슨 결론을 어떤 근거로 내렸는지 원문에 붙여 읽습니다.

발생진행 중발생월 25-7

25-7 GB200 NVL72의 TCO 대비 성능 개선

작성자의 핵심 판단

GB200 NVL72의 성능·경제성은 하드웨어만으로 완성되지 않으며 CUDA 소프트웨어 스택의 성숙이 필수라는 판단이다.

근거 보기 2
  1. 원문 구간 1

    ​ 상대적으로 난도가 낮은 추론 워크로드는 그보다 앞서 NVL72 클러스터에서 가동되었고(2025년 6월 오라클의 GB200 NVL72 '전체 클러스터 온라인' 시점부터 오픈AI가 o3 가격을 80% 인하했습니다.) 대규모 pre-training의 본격 최적화는 2025년 7월부터 가속이 붙었던 것입니다. 반대로 좀 더 생각해보면, 오픈AI GPT-5가 H100/H200 기반에서 사전훈련되었다는 점을 감안하면 차기 모델은 GB200 NVL72를 기반으로 훈련할 것이기에 지능의 도약을 예상할 수 있기도 합니다. ​ 핵심은 하드웨어만으로는 부족하다는 점입니다. NVL72의 성능·경제성을 온전히 끌어내려면 CUDA 소프트웨어 스택의 성숙이 필수였습니다.

  2. 원문 구간 2

    예컨대 NVL72 특화 진단/디버깅 도구의 보강, 스위치 트레이/백플레인 등 구성품의 안정성 확보, MTBI/신뢰성 지표 개선 같은 시스템 전반의 End-to-End 최적화가 동시에 맞물려야 합니다. 이는 개별 기업의 단독 과제가 아니라 엔비디아–CSP–네오클라우드–프론티어 AI 연구소의 CUDA 개발자들이 대규모 배포·운영(훈련/추론)을 통해 실제로 부딪히면서 해결해 가는 공동 과제입니다. CUDA가 단순히 워크로드에만 영향을 주지 않고 생태계 단위에 전반적인 영향을 준다는 의미입니다. ​ *워크로드단위에서도 충분한 해자를 지닙니다. 예를 들어, 오픈소스와 CUDA의 조합이 갖는 해자에 대해서는 <주간전략보고 : 투자의 생각 (9월 8일~9월 12일)>에서 FlashAtttention-4를 예시로 들었었습니다.

이 자료에서 다룬 사실

작성자는 2025년 7월 GB200 NVL72의 TCO 대비 퍼포먼스가 H100 대비 1.52배 더 우수해졌다고 제시했다.

근거 보기 1
  1. 원문 구간 1

    시간순으로 정리해보면: 2025년 2~4월부터 주요 하이퍼스케일러들에게 첫 AI 랙들을 배송하고 테스트하는 단계(CoreWeave, Google, Microsoft, Oracle)를 거쳤는데 → 2025년 5월에는 GB200 NVL72 기준 CUDA 소프트웨어를 써서 DeepSeek 670B MoE 모델을 학습한 경우 H100에 비해서 TCO당 학습 성능이 9% 낮았고 → 2025년 7월에는 GB200 NVL72를 굴리는 엔지니어들의 수가 크게 증가하기 시작하니 진단 및 디버깅 툴들이 발전하고, 워크로드 최적화들이 가속화되면서 TCO 대비 퍼포먼스 관점에서 H100에 비해서 1.52배 더 우수해졌으며 → 2025년 12월에는 H100 대비 2.8배 더 좋아질 예정입니다.

그렇게 판단한 이유

초기 배송·테스트 뒤 엔지니어 수가 늘고 진단·디버깅 도구와 워크로드 최적화가 가속됐다는 시간 흐름을 근거로 든다.

근거 보기 1
  1. 원문 구간 1

    시간순으로 정리해보면: 2025년 2~4월부터 주요 하이퍼스케일러들에게 첫 AI 랙들을 배송하고 테스트하는 단계(CoreWeave, Google, Microsoft, Oracle)를 거쳤는데 → 2025년 5월에는 GB200 NVL72 기준 CUDA 소프트웨어를 써서 DeepSeek 670B MoE 모델을 학습한 경우 H100에 비해서 TCO당 학습 성능이 9% 낮았고 → 2025년 7월에는 GB200 NVL72를 굴리는 엔지니어들의 수가 크게 증가하기 시작하니 진단 및 디버깅 툴들이 발전하고, 워크로드 최적화들이 가속화되면서 TCO 대비 퍼포먼스 관점에서 H100에 비해서 1.52배 더 우수해졌으며 → 2025년 12월에는 H100 대비 2.8배 더 좋아질 예정입니다.

원문에서 직접 연결한 대상엔비디아GB200 NVL72
발생진행 중발생월 25-6

25-6 오라클 GB200 NVL72 전체 클러스터 가동과 o3 가격 인하

작성자의 핵심 판단

상대적으로 난도가 낮은 추론 워크로드는 대규모 사전훈련보다 먼저 NVL72 클러스터에서 가동됐다는 해석이다.

근거 보기 1
  1. 원문 구간 1

    ​ 상대적으로 난도가 낮은 추론 워크로드는 그보다 앞서 NVL72 클러스터에서 가동되었고(2025년 6월 오라클의 GB200 NVL72 '전체 클러스터 온라인' 시점부터 오픈AI가 o3 가격을 80% 인하했습니다.) 대규모 pre-training의 본격 최적화는 2025년 7월부터 가속이 붙었던 것입니다. 반대로 좀 더 생각해보면, 오픈AI GPT-5가 H100/H200 기반에서 사전훈련되었다는 점을 감안하면 차기 모델은 GB200 NVL72를 기반으로 훈련할 것이기에 지능의 도약을 예상할 수 있기도 합니다. ​ 핵심은 하드웨어만으로는 부족하다는 점입니다. NVL72의 성능·경제성을 온전히 끌어내려면 CUDA 소프트웨어 스택의 성숙이 필수였습니다.

이 자료에서 다룬 사실

작성자는 2025년 6월 오라클의 GB200 NVL72 전체 클러스터 온라인 시점부터 오픈AI가 o3 가격을 80% 인하했다고 적었다.

근거 보기 1
  1. 원문 구간 1

    ​ 상대적으로 난도가 낮은 추론 워크로드는 그보다 앞서 NVL72 클러스터에서 가동되었고(2025년 6월 오라클의 GB200 NVL72 '전체 클러스터 온라인' 시점부터 오픈AI가 o3 가격을 80% 인하했습니다.) 대규모 pre-training의 본격 최적화는 2025년 7월부터 가속이 붙었던 것입니다. 반대로 좀 더 생각해보면, 오픈AI GPT-5가 H100/H200 기반에서 사전훈련되었다는 점을 감안하면 차기 모델은 GB200 NVL72를 기반으로 훈련할 것이기에 지능의 도약을 예상할 수 있기도 합니다. ​ 핵심은 하드웨어만으로는 부족하다는 점입니다. NVL72의 성능·경제성을 온전히 끌어내려면 CUDA 소프트웨어 스택의 성숙이 필수였습니다.

그렇게 판단한 이유

추론 워크로드와 대규모 pre-training의 최적화 속도가 달랐고, pre-training 최적화는 2025년 7월부터 가속됐다고 설명한다.

근거 보기 1
  1. 원문 구간 1

    ​ 상대적으로 난도가 낮은 추론 워크로드는 그보다 앞서 NVL72 클러스터에서 가동되었고(2025년 6월 오라클의 GB200 NVL72 '전체 클러스터 온라인' 시점부터 오픈AI가 o3 가격을 80% 인하했습니다.) 대규모 pre-training의 본격 최적화는 2025년 7월부터 가속이 붙었던 것입니다. 반대로 좀 더 생각해보면, 오픈AI GPT-5가 H100/H200 기반에서 사전훈련되었다는 점을 감안하면 차기 모델은 GB200 NVL72를 기반으로 훈련할 것이기에 지능의 도약을 예상할 수 있기도 합니다. ​ 핵심은 하드웨어만으로는 부족하다는 점입니다. NVL72의 성능·경제성을 온전히 끌어내려면 CUDA 소프트웨어 스택의 성숙이 필수였습니다.

원문에서 직접 연결한 대상오픈AI오라클GB200 NVL72
3
사실·구조, 해석·전망, 시점 관찰, 판단 방법

지식·관점

사건 밖에서도 다시 참고하거나 다른 자료와 비교할 가치가 있는 내용을 대상과 반복 가능한 논점으로 묶습니다.

사실·구조AI 데이터센터 연결 구조주 대상 · 산업·업종 · Scale-up 네트워크

Scale-up·Scale-out·Scale-across는 각각 무엇을 확장하는가?

이 자료가 더한 내용

Scale-up은 하나의 컴퓨팅 단위당 성능을 높이고, Scale-out은 여러 랙을 연결하며, Scale-across는 데이터센터 단위를 연결하는 구조로 설명한다.

근거 보기 2
  1. 원문 구간 1

    다가오는 rack scale AI 기회는 $17B ​ "Scale-up Before Scale-out" 하나의 컴퓨팅 단위당 성능을 높이는 Scale-up, 그것을 여러 랙으로 확장 연결하는 Scale-out, 데이터센터 단위를 연결하는 Scale-across입니다. IT HW/SW 분야에서 스케일 업Scale-Up은 기존 서버의 사양을 업그레이드함으로써 시스템을 확장하는 걸 말합니다. 수직적인 성능 향상입니다. 스케일 아웃Scale-Out은 서버를 여러 대 추가함으로써 시스템을 확장하는 걸 말합니다. 수평적인 성능 향상입니다. 젠슨황이 GTC 2025에서 강조한 것을 요약하면 "Scale-up Before Scale-out"입니다.

  2. 원문 구간 2

    V100 NVL8 → A100 NVL8 → H100 NVL8로 이어지던 흐름에서 Blackwell부터는 경쟁의 축을 추가하여 GB200 NVL72라는 새로운 Scale-up 솔루션을 만들었기 때문입니다. 기존에는 NVLink로 8개의 GPU를 CUDA 플랫폼에서 하나의 GPU처럼 다룰 수 있었다면, NVL72에서는 72개의 GPU를 하나처럼 다룰 수 있게 만든 것입니다. 몇 백만 개 이상의 GPU 클러스터로 나아가기에 앞서서 가장 우수한 Scale-up 네트워크 로드맵을 설정하는 게 중요했습니다. 엔비디아의 Scale-up GB200 NVL72은 하루아침에 만들어지지 않았다 ​

사실·구조CUDA와 NVL72 운영주 대상 · 기술·제품 · CUDA관련 대상 · 기업·종목 · 엔비디아

NVL72의 성능과 전환 난도는 무엇으로 형성되는가?

이 자료가 더한 내용

NVL72는 드라이버·런타임·커뮤니케이션·메모리 관리와 진단 도구, 구성품 안정성, 신뢰성 지표의 동시 최적화가 필요하다고 설명한다.

근거 보기 2
  1. 원문 구간 1

    엔비디아의 Scale-up: GB200 NVL72 하드웨어만 잘 만들었다고 끝은 아닙니다. GB200 NVL72에는 지난 몇 년간 갈고닦은 하드웨어·소프트웨어 공동 최적화 노하우가 깊게 스며 있습니다. 단순히 출시 후 공급망을 램프업을 하는 차원을 넘어, 다양한 ML 워크로드가 NVL72에서 CUDA 스택으로 충분한 성능을 내도록 드라이버·런타임·커뮤니케이션·메모리 관리까지 전층에서 손을 봐야 했습니다. ​ 엔비디아에게도 쉽지 않았던 GB200 NVL72 이를 보여주는 좋은 사례가 있습니다. GB200 NVL72의 'TCO 대비 퍼포먼스'가 H100 NVL8을 앞서기 시작한 시점이 2025년 7월경이라는 점입니다.

  2. 원문 구간 2

    예컨대 NVL72 특화 진단/디버깅 도구의 보강, 스위치 트레이/백플레인 등 구성품의 안정성 확보, MTBI/신뢰성 지표 개선 같은 시스템 전반의 End-to-End 최적화가 동시에 맞물려야 합니다. 이는 개별 기업의 단독 과제가 아니라 엔비디아–CSP–네오클라우드–프론티어 AI 연구소의 CUDA 개발자들이 대규모 배포·운영(훈련/추론)을 통해 실제로 부딪히면서 해결해 가는 공동 과제입니다. CUDA가 단순히 워크로드에만 영향을 주지 않고 생태계 단위에 전반적인 영향을 준다는 의미입니다. ​ *워크로드단위에서도 충분한 해자를 지닙니다. 예를 들어, 오픈소스와 CUDA의 조합이 갖는 해자에 대해서는 <주간전략보고 : 투자의 생각 (9월 8일~9월 12일)>에서 FlashAtttention-4를 예시로 들었었습니다.

해석·전망Scale-up 네트워크 시장주 대상 · 산업·업종 · Scale-up 네트워크

시장 규모와 랙 단위 확장 전망은 무엇에 달려 있는가?

이 자료가 더한 내용

모건스탠리는 2024년 40억달러였던 시장이 2029년 CAGR 34% 성장해 170억달러에 이를 것으로 예상했다.

근거 보기 1
  1. 원문 구간 1

    2024년까지 Scale-up 네트워크 시장 규모는 $4B였고, 모건스탠리는 이것이 2029년까지 CAGR 34%로 성장하면 2029년에는 $17B에 이를 것으로 예상했습니다. ​ 저희가 생각하기에는 시장규모가 더 빠르게 커질 수 있다고 가정합니다. NVL72 랙 생산의 40%를 담당하고 있는 폭스콘의 최근 코멘트를 보시면 CY25 기준 NVL72 같은 AI 랙 생산량을 30,000개로 예상하고 있는데 → CY26에는 AI 랙으로만 업계 전반에 50~60,000개 생산이 될 것으로 예상했고 'Bull Case는 100,000개까지 커질 수 있다'고 봤습니다. 차이가 큰 이유는 하이퍼스케일러들이 얼마나 Scale-up 이후 랙 단위 제품으로 요청할 것이냐에 달려있습니다.

사실·구조Reasoning 워크로드주 대상 · 기술·제품 · Reasoning AI관련 대상 · 산업·업종 · Scale-up 네트워크

추론 토큰 증가는 왜 Scale-up 수요와 연결되는가?

이 자료가 더한 내용

o1-preview 이후 Reasoning 워크로드가 생기고, o1-pro가 병렬식 test-time compute로 더 많은 토큰을 사용하고 검증하는 흐름을 만들었다고 설명한다.

근거 보기 2
  1. 원문 구간 1

    점점 더 복잡하고 대규모의 워크로드를 처리해야 하다보니 여러 XPU를 상호연결 하기 위해 고성능 네트워킹이 필요해졌습니다. Scale-up 분야가 주목받은 가장 중요한 이유는 2024년 9월 Strawberry였던 o1-preview 등장 이후 Reasoning 워크로드가 생기면서 생각보다 추론에서도 훨씬 더 토큰 사용량이 늘어났기 때문입니다. ​ 그리고 2024년 12월 이후에 첫 병렬식 Test-time compute 구조였던 o1-pro를 발표하면서 훨씬 더 많은 토큰을 사용하고 이를 검증하는 식으로 지능을 높이는 트렌드를 만들었던 것도, 새로운 것이 아니라 계속해서 단일 사용자의 request당 토큰 사용량이 늘어나게 되는 흐름을 더 가속화시킨 것이었습니다.

  2. 원문 구간 2

    ​ 단순히 비용만 늘어난 게 핵심이 아니고, output을 내기 위해서 내부적으로 생각에 쓰는 토큰을 늘렸더니 지능이 크게 좋아졌기 때문에 그렇습니다. System 2 Thinking을 개방한 순간이었습니다. AI 연구소들 입장에서는 늘 지능 향상의 정도에 비해 드는 비용을 생각하게 되는데, pre-training 클러스터의 FLOPS를 Log 스케일로 10배 키우는 것보다 더 저렴했기에 Reasoning 트렌드가 빠르게 채택됐습니다. ​ 젠슨황이 먼저 GB200 NVL72로 나아간 길을 따라가는 업계 Scale-up 네트워크가 중요해진 이유는 결국 추론의 시대에도 엔비디아가 우세하고 점유율을 오히려 더 높인 것과도 같은 이치입니다.

사실·구조AI 인프라 고객별 연결 방식주 대상 · 기술·제품 · AI 가속기 네트워크관련 대상 · 기업·종목 · 엔비디아관련 대상 · 기업·종목 · AMD관련 대상 · 기업·종목 · 구글관련 대상 · 기업·종목 · AWS

엔비디아·AMD·구글·AWS는 어떤 연결 구조를 쓰거나 준비하는가?

이 자료가 더한 내용

엔비디아는 NVLink, AMD는 Infinity Fabric과 UALink, 구글 TPU는 ICI·OCS, AWS Trainium은 NeuronLink를 각각 사용·준비하는 구조로 정리한다.

근거 보기 4
  1. 원문 구간 1

    ​ NVLink vs Custom vs UALink vs SUE Scale-up 네트워크의 고객사들은 무엇을 사용하는지를 정리해봅니다. ​ 엔비디아 : 엔비디아는 자체 NVLink 네트워킹 프로토콜을 사용하여 GPU를 하나처럼 묶고 있습니다. GB200부터 처음 쓰인 NVL72 랙 구조에서는 NVLink는 GPU-GPU간 연결을 넘어서, GPU-CPU간 연결까지 확장되어 있습니다. 앞으로도 엔비디아는 거의 NVLink로만 확장할 예정입니다. *NVLink Fusion 기대가 낮습니다.* ​ AMD : AMD는 자체 Infinity Fabric을 사용하여 MI300X 내의 8개 GPU를 하나처럼 묶고 있습니다.

  2. 원문 구간 2

    AMD는 여기서 자체 개발로 엔비디아와의 Scale-up 경쟁이 부적합하다는 것을 파악하고 한계에 부딪혔기 때문에, UALink 출시에 앞장섰습니다. UALink의 시작은 어찌보면 AMD가 'Infinity Fabric을 아예 오픈소스로 공개해버려야 경쟁이 가능하겠다'라는 것에서부터 시작됐습니다. 이에 MI400부터는 Helios라는 랙 제품으로 72개 GPU 랙 구성을 도입할 예정입니다. 다만 이거는 순수한 UALink가 아닙니다. 소프트웨어는 UALink를 사용하지만 하드웨어는 브로드컴의 Tomahawk 스위치를 사용하는 버전입니다. UALink 전용 스위치가 출시되는 시점인 2027년에 출시될 MI500부터는 아스테라랩스의 Scorpio-X PCle Switch를 탑재할 예정입니다.

  3. 원문 구간 3

    특정 아키텍처나 사용 사례별로 다른 Pod을 사용하는데, 대형 Pod은 아예 인접 칩들을 직접 연결하는 방식의 Mesh 구조인 3D Torus 구조(4 x 4 x 4 구조의 64칩 큐브)를 사용합니다. 그렇게 칩간 연결을 달성하고 나서 OCS를 통해서 총 144개의 큐브(1Pod 9,216칩 or 144큐브, 1큐브 = 64칩)를 상호 연결하는 식입니다. ​ AWS : 아마존 Trainium도 자체 네트워크를 통해서 칩을 연결하고 있습니다. NeuronLink입니다. Trainium 2 시스템 구조를 정리해보면 이렇습니다. 랙은 크게 두 가지 구조로 구성됐는데, Trainium 2 16개가 들어가는 Teton PD와 64개가 들어간 Teton PD Ultra로 구성됐습니다.

  4. 원문 구간 4

    Teton PD는 Trainium 2 칩 2개를 하나의 서버로 만들고, 16개의 서버를 NeuronLink를 통해 하나의 인스턴스로 엮어서 64개의 칩을 연결한 것이 Teton PD Ultra였습니다. 현재 아마존은 아스테라랩스와 긴밀히 협력하면서 Scorpio-X PCle Switch를 AWS에 맞게 커스터마이징하여 설계하고 있습니다. 준비는 끝났고, 해당 스위치가 2026년에 램프업될 예정입니다. 이는 AWS가 UALink의 가장 초기 구매자이자 검증자가 된다는 의미이며, 이 경우 AWS가 자체 개발했던 ASIC은 Scorpio-X PCle Switch로 대체되는 구조입니다.

사실·구조Scale-up 연결 매체주 대상 · 산업·업종 · Scale-up 광학

왜 랙 내부 Scale-up은 구리 기반이 주류로 제시되는가?

이 자료가 더한 내용

Scale-up 연결 거리는 1~2m 미만이고 구리 케이블은 성능 대비 가격, SerDes와 광-전기 전환 지연 측면에서 유리하다고 설명한다.

근거 보기 1
  1. 원문 구간 1

    Copper vs Optics 아직까진 주로 구리선 기반, AEC 채택이 메인 Copper vs Optics? 현재 Scale-up 네트워크는 주로 구리선을 기반으로 이뤄져있습니다. ​ Scale-up에서의 네트워크 연결 거리는 1~2m 미만으로 매우 짧고, 칩 간, 보드 간, 백플레인 또는 케이블로 연결하는 것을 의미합니다. 기능적으로나 성능 대비 가격을 생각해보면 구리 케이블이 여전히 우수하고 SerDes에서 발생하는 과정이나, 광-전기 전환 과정에서 발생하는 지연을 없애다보니, 지연시간이 매우 짧고 긴밀하게 결합된 Scale-up에 최적의 네트워크로 쓰이고 있습니다.

해석·전망아스테라랩스와 Trainium 3주 대상 · 기업·종목 · 아스테라랩스관련 대상 · 기술·제품 · AWS Trainium 3

Trainium 3의 Teton 배치가 Scorpio X 성장 계산에 어떤 의미를 갖는가?

이 자료가 더한 내용

Teton PDS는 Trainium 2~3 64개와 Scorpio X 32개, Teton Max는 Trainium 3 72개와 Scorpio X 40개가 탑재돼 각각 가속기당 스위치 비율 0.5와 0.56으로 제시됐다.

근거 보기 1
  1. 원문 구간 1

    Teton PDS는 공기냉각식으로 총 64개의 Trainium 2~3이 탑재되고 Scorpio X는 32개가 탑재됩니다. 가속기당 스위치 비율은 1:0.5입니다. Teton Max는 액체냉각식으로 총 72개의 Trainium 3가 탑재되고 Scorpio X는 40개가 탑재됩니다. 가속기당 스위치 비율은 1:0.56입니다. 50대 50으로 구매한다고 가정하면 Trainium 칩 1개당 Scorpio X PCle Switch 비율은 0.53입니다. ​ ​ 예를 들어, 원래 가정은 내년에 Trainium 3 250만 개 칩 중 20%정도가 Teton 랙으로 탑재될 거라고 봤는데, 이 경우 아스테라랩스 입장에서는 26.5만 개의 Scorpio X 스위치가 들어갑니다.

해석·전망브로드컴과 마벨의 Scale-up 기회주 대상 · 기업·종목 · 브로드컴관련 대상 · 기업·종목 · 마벨

두 기업의 Scale-up 기회와 제약은 어떻게 제시되는가?

이 자료가 더한 내용

모건스탠리는 브로드컴 AI 네트워킹 시장 매출이 2024년 45억달러에서 2026년 최소 90억달러 이상으로 커질 것으로 예상했다.

근거 보기 1
  1. 원문 구간 1

    이렇게 되면 Scale-out과 up을 구분하기가 어렵지만, 모건스탠리는 브로드컴의 AI 네트워킹 시장 매출이 2024년 $4.5B → 2026년에 최소 $9.0B 이상으로 커질 것을 예상했습니다. ​ 하이퍼스케일러가 ASIC에 어떤 네트워킹을 선택하느냐는 자유롭게 고를 수 있지만, 브로드컴이 맡은 ASIC 설계를 맡은 프로젝트들의 경우에는 어느정도 SUE와의 번들링이 생길 수 있다고 봅니다. 그렇게 의도한다기보다도, SUE로 UALink 수준의 Scale-up 지연속도를 맞추려면 정교한 하드웨어/펌웨어 설계가 필요한데 그런 역량을 브로드컴에서만 갖고 있기 때문입니다.

해석·전망아스테라랩스 성장 경로주 대상 · 기업·종목 · 아스테라랩스관련 대상 · 기업·종목 · AWS관련 대상 · 기술·제품 · Scorpio X

CY25~28 성장 전망은 어떤 고객·제품 조건에 의존하는가?

이 자료가 더한 내용

Aries·Scorpio P·Scorpio X·Taurus가 AWS의 엔비디아 및 Trainium 3 구성에서 쓰이며, AMD와 다른 ASIC 서버의 Scorpio X 본격 탑재 시점은 CY27로 제시됐다.

근거 보기 2
  1. 원문 구간 1

    고성장, 고변동성 기업군입니다. 최근 주간전략보고 9월 8일, 15일분 자료 중 아스테라랩스 코멘트와 업계 전문가 인터뷰를 통해 대략의 감을 잡으시면 좋습니다. 어떤 포인트가 중요한지를 고객사 위주로 생각해보자면, (1) 엔비디아 HGX B200 판매량이 늘어날 때 (2) AWS의 엔비디아 MGX GB200 NVL72가 늘어날 때(AWS는 엔비디아의 ConnectX NIC 대신 자체 k2v5 NIC를 채택했기에 GB200~k2v5 NIC를 연결하기 위해) Aries 리타이머와 Scorpio P Switch가 쓰이고 (3) AWS의 Trainium 3 서버 내 All-to-All 연결의 핵심이 아스테라랩스의 Scorpio X입니다.

  2. 원문 구간 2

    Teton PDS, Teton Max 모두에서 쓰입니다. 물론 Aries, Scorpio P, Taurus도 같이 쓰입니다. (4) 그리고 AMD 및 다른 ASIC 서버들에 Scorpio X가 본격 탑재되는 때는 CY27입니다. 이렇다보니 CY25 → CY26 → CY27까지 매출성장세가 계속해서 높은 상태를 유지할 것을 전망하고 있습니다. 크레도가 AWS에서 쓰이면서 매출 YoY 64~89%대 고성장을 이어가다가 → 마이크로소프트, 구글에서 본격 채택되기 시작하면서 YoY 154%~274%로 현재 폭발기를 맞이한 것도 같은 사례입니다.

4

시간흐름대로 모든 내용을 살려 정리

시간흐름대로 모든 내용을 살려 정리

1
자료의 성격과 범위

[원문 유형] 네이버 프리미엄 콘텐츠
[채널] 올바른 미국주식 by SAPIENS
[게시일] 2025.09.17. 오후 4:01
[원문 URL] https://contents.premium.naver.com/sapiens/sapiensasset/contents/250917160134403eh
[제목] Scale-up 네트워크 이해하기 : 아스테라랩스와 브로드컴, 왜 지금 Scale-up인가?
[수집 기준] 승인된 구독 열람권으로 실제 본문을 보존했다. 이미지·첨부는 별도 미디어 원장에 보관하며 시각적 의미 검토 여부를 구분한다.

[구독 원문 본문]

안녕하세요 사피엔스입니다.

2
연결 자료와 투자 유의

Scale-up Network 심화편입니다. 엔비디아의 GB200 NVL72에 대해 살펴보고, UALink vs SUE, 아스테라랩스와 브로드컴 그리고 마벨에 대한 생각을 정리한 자료입니다.

GPT-6를 기대하는 이유, 왜 지금 Scale-up이 부각받았는지, Scale-up의 주요 고객사들은 SUE와 UALink 중 무엇을 채택하고 있는지, 어떤 포인트에 대한 뉴스가 중요한지를 알 수 있습니다.

아스테라랩스의 CY25 → CY26 → CY27 → CY28로 가는 과정에서 연도별로 주요 포인트가 다르고, 컨센서스 차이도 큰 상황인데, 왜 그런지에 대해서 감을 잡으실 수 있으실 자료입니다.

3
목차의 분석 축

주간전략보고

2025-09-15

주간전략보고 : 투자의 생각 (9월 15일~9월 19일) (바로가기)

AI 사이클 이해하기

2025-09-16

골드만삭스 테크 컨퍼런스 : "전례 없는 수요를 보고 있습니다" (바로가기)

2025-09-10

오라클 3Q25 실적발표 : "모두가 다가오는 쓰나미🌊의 규모를 이해하고 있는 건 아닙니다" (바로가기)

2025-08-28

엔비디아 2Q25 실적발표 : Blackwell 12개월치 SOLD OUT, AI CAPEX $3~4T를 말하다 (바로가기)

업계 전문가 인터뷰

2025-09-12

4
Scale-up의 기본 구분

업계 전문가 인터뷰 : 아스테라랩스, 모두가 Scale-up을 필요로 하는 시대의 핵심 기업 (바로가기)

2025-09-02

업계 전문가 인터뷰 : 블룸에너지, 데이터센터로 어디까지 침투할 수 있을까? (바로가기)

투자자문 서비스에 따른 투자 시 원금 손실이 발생할 수 있으며, 투자 손익에 대한 책임은 전적으로 고객에게 귀속됩니다. 또한 과거의 투자수익이 미래의 수익률을 보장하지 않습니다.

신규 구독 전에, 아래 투자자문계약 권유문서의 계약 관련 제반 사항을 반드시 읽으시고 충분히 검토하시기 바랍니다.

*투자자문계약 권유문서 : https://naver.me/5ZST47Qf

5
NVL72가 바꾼 연결 단위

목차

AI Scale-up Network : 다가오는 rack scale AI 기회는 $17B

엔비디아의 Scale-up : GB200 NVL72은 하루아침에 만들어지지 않았다

똑같은 기준에서 경쟁하기 위해 : GB200 NVL72에 대항하려면 필요한 Scale-up 네트워크

왜 지금 Scale-up인가? : 추론의 시대에도 엄청난 컴퓨팅이 필요해졌다

Copper vs Optics : 아직까진 주로 구리선 기반, AEC 채택이 메인

Scale-up 주요 플레이어 : ALAB, AVGO, MRVL

투자의 생각 : 아스테라랩스(ALAB)

5줄 요약

AI Scale-up Network

6
GB200의 공동 최적화

다가오는 rack scale AI 기회는 $17B

"Scale-up Before Scale-out"

하나의 컴퓨팅 단위당 성능을 높이는 Scale-up, 그것을 여러 랙으로 확장 연결하는 Scale-out, 데이터센터 단위를 연결하는 Scale-across입니다. IT HW/SW 분야에서 스케일 업Scale-Up은 기존 서버의 사양을 업그레이드함으로써 시스템을 확장하는 걸 말합니다. 수직적인 성능 향상입니다. 스케일 아웃Scale-Out은 서버를 여러 대 추가함으로써 시스템을 확장하는 걸 말합니다. 수평적인 성능 향상입니다.

젠슨황이 GTC 2025에서 강조한 것을 요약하면 "Scale-up Before Scale-out"입니다.

7
성능 기준점의 이동

V100 NVL8 → A100 NVL8 → H100 NVL8로 이어지던 흐름에서 Blackwell부터는 경쟁의 축을 추가하여 GB200 NVL72라는 새로운 Scale-up 솔루션을 만들었기 때문입니다. 기존에는 NVLink로 8개의 GPU를 CUDA 플랫폼에서 하나의 GPU처럼 다룰 수 있었다면, NVL72에서는 72개의 GPU를 하나처럼 다룰 수 있게 만든 것입니다. 몇 백만 개 이상의 GPU 클러스터로 나아가기에 앞서서 가장 우수한 Scale-up 네트워크 로드맵을 설정하는 게 중요했습니다.

엔비디아의 Scale-up

GB200 NVL72은 하루아침에 만들어지지 않았다

8
하드웨어만으로 부족한 이유

엔비디아의 Scale-up: GB200 NVL72

하드웨어만 잘 만들었다고 끝은 아닙니다. GB200 NVL72에는 지난 몇 년간 갈고닦은 하드웨어·소프트웨어 공동 최적화 노하우가 깊게 스며 있습니다. 단순히 출시 후 공급망을 램프업을 하는 차원을 넘어, 다양한 ML 워크로드가 NVL72에서 CUDA 스택으로 충분한 성능을 내도록 드라이버·런타임·커뮤니케이션·메모리 관리까지 전층에서 손을 봐야 했습니다.

엔비디아에게도 쉽지 않았던 GB200 NVL72

이를 보여주는 좋은 사례가 있습니다. GB200 NVL72의 'TCO 대비 퍼포먼스'가 H100 NVL8을 앞서기 시작한 시점이 2025년 7월경이라는 점입니다.

9
초기 배송과 학습 성능

시간순으로 정리해보면: 2025년 2~4월부터 주요 하이퍼스케일러들에게 첫 AI 랙들을 배송하고 테스트하는 단계(CoreWeave, Google, Microsoft, Oracle)를 거쳤는데 → 2025년 5월에는 GB200 NVL72 기준 CUDA 소프트웨어를 써서 DeepSeek 670B MoE 모델을 학습한 경우 H100에 비해서 TCO당 학습 성능이 9% 낮았고 → 2025년 7월에는 GB200 NVL72를 굴리는 엔지니어들의 수가 크게 증가하기 시작하니 진단 및 디버깅 툴들이 발전하고, 워크로드 최적화들이 가속화되면서 TCO 대비 퍼포먼스 관점에서 H100에 비해서 1.52배 더 우수해졌으며 → 2025년 12월에는 H100 대비 2.8배 더 좋아질 예정입니다.

10
추론 가동과 다음 모델의 가능성

상대적으로 난도가 낮은 추론 워크로드는 그보다 앞서 NVL72 클러스터에서 가동되었고(2025년 6월 오라클의 GB200 NVL72 '전체 클러스터 온라인' 시점부터 오픈AI가 o3 가격을 80% 인하했습니다.) 대규모 pre-training의 본격 최적화는 2025년 7월부터 가속이 붙었던 것입니다. 반대로 좀 더 생각해보면, 오픈AI GPT-5가 H100/H200 기반에서 사전훈련되었다는 점을 감안하면 차기 모델은 GB200 NVL72를 기반으로 훈련할 것이기에 지능의 도약을 예상할 수 있기도 합니다.

핵심은 하드웨어만으로는 부족하다는 점입니다. NVL72의 성능·경제성을 온전히 끌어내려면 CUDA 소프트웨어 스택의 성숙이 필수였습니다.

11
CUDA 생태계의 공동 과제

예컨대 NVL72 특화 진단/디버깅 도구의 보강, 스위치 트레이/백플레인 등 구성품의 안정성 확보, MTBI/신뢰성 지표 개선 같은 시스템 전반의 End-to-End 최적화가 동시에 맞물려야 합니다. 이는 개별 기업의 단독 과제가 아니라 엔비디아–CSP–네오클라우드–프론티어 AI 연구소의 CUDA 개발자들이 대규모 배포·운영(훈련/추론)을 통해 실제로 부딪히면서 해결해 가는 공동 과제입니다. CUDA가 단순히 워크로드에만 영향을 주지 않고 생태계 단위에 전반적인 영향을 준다는 의미입니다.

*워크로드단위에서도 충분한 해자를 지닙니다. 예를 들어, 오픈소스와 CUDA의 조합이 갖는 해자에 대해서는 <주간전략보고 : 투자의 생각 (9월 8일~9월 12일)>에서 FlashAtttention-4를 예시로 들었었습니다.

12
CUDA 아래 단위의 해자

오픈소스라고 해도 CUDA의 더 아래 단위인 CUDA Templates for Linear Algebra Subroutines and Solvers를 사용하여 알고리즘 혁신을 이룬 것이기에 AMD ROCm HIP으로 포팅하기가 더 어려워진다는 의미였습니다. 프레임워크 레벨로 내려가서 메모리 레이아웃, 타일링, 쓰레드 블록 배치 등을 다룬 것이니 기존의 CUDA보다 더 엔비디아 HW에 밀접한 레벨로 내려갔던 것이기 때문입니다.

똑같은 기준에서 경쟁하기 위해

GB200 NVL72에 대항하려면 필요한 Scale-up 네트워크

CY25: NVLink Only → CY26~27: UALink, SUE 침투

13
시장 규모와 랙 생산 가정

2024년까지 Scale-up 네트워크 시장 규모는 $4B였고, 모건스탠리는 이것이 2029년까지 CAGR 34%로 성장하면 2029년에는 $17B에 이를 것으로 예상했습니다.

저희가 생각하기에는 시장규모가 더 빠르게 커질 수 있다고 가정합니다. NVL72 랙 생산의 40%를 담당하고 있는 폭스콘의 최근 코멘트를 보시면 CY25 기준 NVL72 같은 AI 랙 생산량을 30,000개로 예상하고 있는데 → CY26에는 AI 랙으로만 업계 전반에 50~60,000개 생산이 될 것으로 예상했고 'Bull Case는 100,000개까지 커질 수 있다'고 봤습니다. 차이가 큰 이유는 하이퍼스케일러들이 얼마나 Scale-up 이후 랙 단위 제품으로 요청할 것이냐에 달려있습니다.

14
랙 단위 확장의 방향

그리고 시장규모가 생각보다 더 많이 커질 수 있다고 가정합니다. 8-XPU 구조에서 72, 144, 576, 1024까지 매년 Scale-up 스위치 시장은 더 빠르게 늘어가는 트렌드입니다. 내년부터는 하이퍼스케일러와 AI 연구소들이 구매하는 기본 제품이 NVL72 → NVL144 → NVL576으로 이어지는 '랙'이 될 가능성이 높기 때문입니다.

지금은 All-to-All 연결을 위해서 NVLink만 존재하는 시장입니다. 앞으로도 여전히 NVLink가 메인일 거라 생각하만, 하이퍼스케일러들도 엔비디아가 개척한 경쟁의 축을 따라가야하기에 All-to-All Switch 구조의 Scale-up을 원하므로 UALink 및 SUE가 2026년 하반기부터 침투할 것이라는 게 핵심입니다.

15
NVLink 이후의 경쟁 구도

그리고 이건 '칩'당 돈을 받는 것이기 때문에 CoWoS 웨이퍼의 수 차원에서 엔비디아 외의 비중인 45%의 시장을 차지하고 벌이는 활동이라는 것도 중요합니다.

Next NVLink?: 아스테라랩스, 브로드컴, 마벨

Scale-up 트렌드를 주도하고 있는 핵심기업은 아스테라랩스(ALAB: 시총 $38B, TTM 매출 $606M), 브로드컴(AVGO: 시총 $1,720B, 매출 $59,926M), 마벨(MRVL: 시총 $58B, 매출 $7,235M)입니다.

다만, 사실상 현재 기술 주도권과 가져갈 업사이드를 생각하면 아스테라랩스가 주도하는 UALink vs 브로드컴이 주도하는 SUE간의 경쟁입니다.

16
UALink와 SUE의 경쟁 구도

그리고 투자자 입장에서는 시총과 매출차이를 생각하면 UALink가 2~3개 기업의 ASIC 서버에만 Scale-up 네트워크로 채택되더라도, 아스테라랩스 입장에서는 다년간 YoY 70~100%대 성장을 기대할 수 있을 만큼 성장기회가 매우 크다는 게 포인트입니다.

이미 AWS에는 메인 솔루션으로 탑재될 것이 정해져있으므로 1~2개의 하이퍼스케일러 참여정도가 중요한 상황이었는데, 아스테라랩스는 2Q25 실적발표에서 "10개 하이퍼스케일러 및 AI 연구소가 관심을 보이고 있다"고 말했습니다. 또한 아스테라랩스 경영진은 "Scorpio X에 대해 소통하는 모든 고객이 UALink로 전환할 계획을 갖고 있으며, 관심이 높은 상태"임을 말했습니다.

17
아스테라랩스와 브로드컴의 접근

각 업체들의 접근 방식이 다릅니다. 아스테라랩스는 Scorpio-X PCle 스위치를 통해 침투할 예정입니다. 성장궤적을 보면, 2026년에는 AWS Trainium 3 프로젝트부터 침투하고 → 2027년에는 얼마나 많은 ASIC 프로젝트들이 UALink를 택하느냐로 업사이드가 결정됩니다. 브로드컴은 이더넷에서의 우위를 활용하여 Tomahawk 6로 이미 Scale-out의 핵심인 이더넷을 강화하여 rack scale에도 도입하자는 게 핵심입니다.

왜 지금 Scale-up인가?

추론의 시대에도 엄청난 컴퓨팅이 필요해졌다

Scale-up 네트워크가 중요해진 이유

18
추론 토큰과 연결 수요

점점 더 복잡하고 대규모의 워크로드를 처리해야 하다보니 여러 XPU를 상호연결 하기 위해 고성능 네트워킹이 필요해졌습니다. Scale-up 분야가 주목받은 가장 중요한 이유는 2024년 9월 Strawberry였던 o1-preview 등장 이후 Reasoning 워크로드가 생기면서 생각보다 추론에서도 훨씬 더 토큰 사용량이 늘어났기 때문입니다.

그리고 2024년 12월 이후에 첫 병렬식 Test-time compute 구조였던 o1-pro를 발표하면서 훨씬 더 많은 토큰을 사용하고 이를 검증하는 식으로 지능을 높이는 트렌드를 만들었던 것도, 새로운 것이 아니라 계속해서 단일 사용자의 request당 토큰 사용량이 늘어나게 되는 흐름을 더 가속화시킨 것이었습니다.

19
Reasoning의 비용과 지능

단순히 비용만 늘어난 게 핵심이 아니고, output을 내기 위해서 내부적으로 생각에 쓰는 토큰을 늘렸더니 지능이 크게 좋아졌기 때문에 그렇습니다. System 2 Thinking을 개방한 순간이었습니다. AI 연구소들 입장에서는 늘 지능 향상의 정도에 비해 드는 비용을 생각하게 되는데, pre-training 클러스터의 FLOPS를 Log 스케일로 10배 키우는 것보다 더 저렴했기에 Reasoning 트렌드가 빠르게 채택됐습니다.

젠슨황이 먼저 GB200 NVL72로 나아간 길을 따라가는 업계

Scale-up 네트워크가 중요해진 이유는 결국 추론의 시대에도 엔비디아가 우세하고 점유율을 오히려 더 높인 것과도 같은 이치입니다.

20
NVL72가 만든 기준점

성능향상의 비결이 다시 한 번 컴퓨팅에서부터 시작됐기 때문입니다. 이전에는 All-to-All 연결의 중요도가 이정도로 높지 않았지만, 엔비디아가 개발자들의 고민을 해결하는 과정에서 NVL72 설계를 구상하여 대규모 양산하며 판이 바뀐 셈입니다.

잘 설계된 GB200 NVL72 랙이 낼 수 있는 토큰 처리량과 가격이 'TCO 대비 퍼포먼스'의 기준점이 되었기 때문입니다. ASIC의 목적은 늘 특정 사용 사례에서 '엔비디아와 비교할 때 TCO 대비 퍼포먼스'를 높이는 게 목표이므로 NVL72에 대응하기 위해 어떤 솔루션이 필요한지 목표치가 이동한 것이고, 결과적으로 All-to-All 연결과 Latency 스펙 표준화가 가능한 UALink에 대한 관심이 높아진 것입니다.

21
고객별 네트워크 구조

NVLink vs Custom vs UALink vs SUE

Scale-up 네트워크의 고객사들은 무엇을 사용하는지를 정리해봅니다.

엔비디아 : 엔비디아는 자체 NVLink 네트워킹 프로토콜을 사용하여 GPU를 하나처럼 묶고 있습니다. GB200부터 처음 쓰인 NVL72 랙 구조에서는 NVLink는 GPU-GPU간 연결을 넘어서, GPU-CPU간 연결까지 확장되어 있습니다. 앞으로도 엔비디아는 거의 NVLink로만 확장할 예정입니다. *NVLink Fusion 기대가 낮습니다.*

AMD : AMD는 자체 Infinity Fabric을 사용하여 MI300X 내의 8개 GPU를 하나처럼 묶고 있습니다.

22
AMD의 UALink 이행

AMD는 여기서 자체 개발로 엔비디아와의 Scale-up 경쟁이 부적합하다는 것을 파악하고 한계에 부딪혔기 때문에, UALink 출시에 앞장섰습니다. UALink의 시작은 어찌보면 AMD가 'Infinity Fabric을 아예 오픈소스로 공개해버려야 경쟁이 가능하겠다'라는 것에서부터 시작됐습니다. 이에 MI400부터는 Helios라는 랙 제품으로 72개 GPU 랙 구성을 도입할 예정입니다. 다만 이거는 순수한 UALink가 아닙니다. 소프트웨어는 UALink를 사용하지만 하드웨어는 브로드컴의 Tomahawk 스위치를 사용하는 버전입니다. UALink 전용 스위치가 출시되는 시점인 2027년에 출시될 MI500부터는 아스테라랩스의 Scorpio-X PCle Switch를 탑재할 예정입니다.

23
MI400의 연결 한계

*문제는 MI400의 UALoe72 구조가 사실상 8-GPU를 9개 연결한 구조라서 완전한 All-to-All 연결이 아니라는 점입니다. 즉, AMD가 유의미한 반격을 하려는 시점은 MI500으로 연기됐습니다*

구글 : 구글 TPU는 독점적인 두 가지 네트워크를 통해서 칩들을 연결하고 있습니다. ⓐ랙 내부 확장을 위한 ICI(Inter-Chip-Interconnect)와 ⓑ랙과 랙간 확장을 위한 OCS(Optical Circuit Switching)입니다. 이를 합쳐서 TPU Pod을 구성하는 방식입니다. TPU v7 Pod에서는 최대 9,216개의 TPU를 하나의 랙으로 연결하는 구조입니다.

24
구글 TPU Pod의 연결 방식

특정 아키텍처나 사용 사례별로 다른 Pod을 사용하는데, 대형 Pod은 아예 인접 칩들을 직접 연결하는 방식의 Mesh 구조인 3D Torus 구조(4 x 4 x 4 구조의 64칩 큐브)를 사용합니다. 그렇게 칩간 연결을 달성하고 나서 OCS를 통해서 총 144개의 큐브(1Pod 9,216칩 or 144큐브, 1큐브 = 64칩)를 상호 연결하는 식입니다.

AWS : 아마존 Trainium도 자체 네트워크를 통해서 칩을 연결하고 있습니다. NeuronLink입니다. Trainium 2 시스템 구조를 정리해보면 이렇습니다. 랙은 크게 두 가지 구조로 구성됐는데, Trainium 2 16개가 들어가는 Teton PD와 64개가 들어간 Teton PD Ultra로 구성됐습니다.

25
AWS Trainium과 Scorpio X

Teton PD는 Trainium 2 칩 2개를 하나의 서버로 만들고, 16개의 서버를 NeuronLink를 통해 하나의 인스턴스로 엮어서 64개의 칩을 연결한 것이 Teton PD Ultra였습니다. 현재 아마존은 아스테라랩스와 긴밀히 협력하면서 Scorpio-X PCle Switch를 AWS에 맞게 커스터마이징하여 설계하고 있습니다. 준비는 끝났고, 해당 스위치가 2026년에 램프업될 예정입니다. 이는 AWS가 UALink의 가장 초기 구매자이자 검증자가 된다는 의미이며, 이 경우 AWS가 자체 개발했던 ASIC은 Scorpio-X PCle Switch로 대체되는 구조입니다.

26
짧은 거리의 구리 연결

Copper vs Optics

아직까진 주로 구리선 기반, AEC 채택이 메인

Copper vs Optics?

현재 Scale-up 네트워크는 주로 구리선을 기반으로 이뤄져있습니다.

Scale-up에서의 네트워크 연결 거리는 1~2m 미만으로 매우 짧고, 칩 간, 보드 간, 백플레인 또는 케이블로 연결하는 것을 의미합니다. 기능적으로나 성능 대비 가격을 생각해보면 구리 케이블이 여전히 우수하고 SerDes에서 발생하는 과정이나, 광-전기 전환 과정에서 발생하는 지연을 없애다보니, 지연시간이 매우 짧고 긴밀하게 결합된 Scale-up에 최적의 네트워크로 쓰이고 있습니다.

27
광학 전환의 시간표

그리고 모건스탠리는 앞으로도 2028년까지 Scale-up에서는 꽤 오랫동안 구리 기반이 주류일 것으로 예상했습니다. '언젠가 광학 제품들이 Scale-up에도 사용될 것 같기는 하지만 아직 주류로는 멀었다'는 의미였습니다. 만약 이쪽분야가 부각받게 되면 Lumentum(LITE)과 Coherent(COHR)가 부각받을 예정입니다. 물론 이쪽 두 기업은 Scale-up이 아니더라도 Scale-out 시장에서 충분한 성장을 내고 있긴 합니다.

Scale-up 주요 플레이어

ALAB, AVGO, MRVL

아스테라랩스 Astera Labs 시총 $38B / TTM 매출 $606M

28
아스테라랩스의 제품 축

아스테라랩스의 CY26~27 성장은 ⓐ리타이머: Aries, ⓑHead-node 스위치: Scorpio P(CPU/NIC/SSD/GPU 등 다양한 엔드포인트간 데이터 교환, AWS MGX GB200 NVL72에서 GB200와 k2v5 NIC를 연결하는 데 쓰임), ⓒ랙 Scale-up(All-to-All 연결) 핵심: Scorpio X, ⓓAEC: Taurus 모두에서 나오겠지만, 가장 중요한 것은 Scorpio X 입니다.

아스테라랩스에게 2026년의 성장에 가장 중요한 것은 AWS Trainium 3 중에서 얼만큼이 Teton PDS/Max로 채워질 것이냐에서 나옵니다.

29
Teton 구성과 스위치 비율

Teton PDS는 공기냉각식으로 총 64개의 Trainium 2~3이 탑재되고 Scorpio X는 32개가 탑재됩니다. 가속기당 스위치 비율은 1:0.5입니다. Teton Max는 액체냉각식으로 총 72개의 Trainium 3가 탑재되고 Scorpio X는 40개가 탑재됩니다. 가속기당 스위치 비율은 1:0.56입니다. 50대 50으로 구매한다고 가정하면 Trainium 칩 1개당 Scorpio X PCle Switch 비율은 0.53입니다.

예를 들어, 원래 가정은 내년에 Trainium 3 250만 개 칩 중 20%정도가 Teton 랙으로 탑재될 거라고 봤는데, 이 경우 아스테라랩스 입장에서는 26.5만 개의 Scorpio X 스위치가 들어갑니다.

30
Trainium 3 배치 가정

개당 $800이므로 Scorpio X 스위치 매출만 현재 매출에서 연간 $212M가 더해지는 효과입니다. 만약 Bull Case로 40%를 Teton 랙 형태로 구축한다면 Scorpio X 스위치 매출만 CY26 한 해에 $424M입니다. 여기에 AWS Trainium 향으로만 해도 Aries 리타이머, Scorpio P Switch, Taurus AEC도 함께 판매할 예정이므로 훨씬 더 높은 매출이 가능합니다.

저희 자체 추정과 모건스탠리 추정을 결합(Scale-up 매출이 $400M일 경우 CY26 매출 $1.5B 추정)하여 생각해보면, Bull Case의 경우에는 CY26 매출이 $1.5B를 넘길 수 있다는 의미입니다.

31
CY26 이후 성장의 변수

이렇게 되면 CY24 매출이 $396M이었고, TTM 매출이 $605.5M이므로, 2Q26까지 YoY 100% 넘는 성장률을 유지할 수 있단 추정이 가능합니다. CY27 성장은 타 하이퍼스케일러들의 자체 ASIC 랙에 UALink을 얼마나 탑재할 것인가로 결정되며, CY28이후의 성장은 해당 랙들의 XPU 연결 규모가 얼마나 증가하느냐(72-XPU → 144-XPU → 576-XPU → 1024-XPU)가 중요한 요소입니다.

아스테라랩스 (ALAB)

2025-09-15

주간전략보고 : 투자의 생각 (9월 15일~9월 19일) (바로가기)

32
관련 자료 링크

2025-09-12

업계 전문가 인터뷰 : 아스테라랩스, 모두가 Scale-up을 필요로 하는 시대의 핵심 기업 (바로가기)

2025-09-08

주간전략보고 : 투자의 생각 (9월 8일~9월 12일) (바로가기)

브로드컴 Broadcom 시총 $1.72T / TTM 매출 $59.93B

브로드컴은 기존 이더넷 Scale-out 네트워크를 바탕으로 Scale-up에서도 이더넷을 채택하겠다는 계획입니다. 하이퍼스케일러들은 Tomahawk를 통해서 Scale-out을 하고 있는데, Tomahawk 6부터는 Scale-up에도 같은 제품을 넣으면 된다는 것입니다.

33
브로드컴의 이더넷 전략

이렇게 되면 Scale-out과 up을 구분하기가 어렵지만, 모건스탠리는 브로드컴의 AI 네트워킹 시장 매출이 2024년 $4.5B → 2026년에 최소 $9.0B 이상으로 커질 것을 예상했습니다.

하이퍼스케일러가 ASIC에 어떤 네트워킹을 선택하느냐는 자유롭게 고를 수 있지만, 브로드컴이 맡은 ASIC 설계를 맡은 프로젝트들의 경우에는 어느정도 SUE와의 번들링이 생길 수 있다고 봅니다. 그렇게 의도한다기보다도, SUE로 UALink 수준의 Scale-up 지연속도를 맞추려면 정교한 하드웨어/펌웨어 설계가 필요한데 그런 역량을 브로드컴에서만 갖고 있기 때문입니다.

34
SUE 번들링의 조건

브로드컴은 ASIC에서 일부 파이프라인을 미디어텍에게 넘겨주긴 했지만 계속해서 새로운 고객을 얻고 있는 기업이기도 하므로, 추가로 부는 Scale-up & Scale-out의 순풍이 전사에 도움이 될 수 있는 입장입니다.

마벨 Marvell 시총 $58B / TTM 매출 $7,235M

마벨은 광 분야에서 강력한 입지를 갖고 있습니다. 이를 바탕으로 Scale-up에서 LPO/CPO를 접목하는 쪽으로 연구를 많이 하고 있습니다. 스위치 분야에서도 브로드컴보다 점유율이 낮기는 하지만 Scale-up 및 Scale-out 시장 자체가 빠르게 증가하면서 기회는 있을 것으로 봅니다.

35
마벨의 기회와 제약

문제는 투자자 관점에서는 이것이 전사 매출과 EPS 성장률을 끌어올리고 견인할 만큼 충분히 강력한 동력인가가 중요한데, 아직 그정도는 아닌 상태입니다. ASIC 내에서 점유율을 Alchip에게 뺏기고 있는 상황이라 26년 말~27년의 마이크로소프트 Maia300이 현재로서 가장 중요한 돌파구가 될 수'도' 있습니다.

투자의 생각 : 아스테라랩스(ALAB)

아스테라랩스(ALAB) 26년 PER 80배, EPS CAGR 3Y 80%, fwd PEG 1배 : Overweight를 유지하고 있습니다.

36
아스테라랩스의 고객별 수요

고성장, 고변동성 기업군입니다. 최근 주간전략보고 9월 8일, 15일분 자료 중 아스테라랩스 코멘트와 업계 전문가 인터뷰를 통해 대략의 감을 잡으시면 좋습니다. 어떤 포인트가 중요한지를 고객사 위주로 생각해보자면, (1) 엔비디아 HGX B200 판매량이 늘어날 때 (2) AWS의 엔비디아 MGX GB200 NVL72가 늘어날 때(AWS는 엔비디아의 ConnectX NIC 대신 자체 k2v5 NIC를 채택했기에 GB200~k2v5 NIC를 연결하기 위해) Aries 리타이머와 Scorpio P Switch가 쓰이고 (3) AWS의 Trainium 3 서버 내 All-to-All 연결의 핵심이 아스테라랩스의 Scorpio X입니다.

37
CY25~27 제품 탑재 경로

Teton PDS, Teton Max 모두에서 쓰입니다. 물론 Aries, Scorpio P, Taurus도 같이 쓰입니다. (4) 그리고 AMD 및 다른 ASIC 서버들에 Scorpio X가 본격 탑재되는 때는 CY27입니다. 이렇다보니 CY25 → CY26 → CY27까지 매출성장세가 계속해서 높은 상태를 유지할 것을 전망하고 있습니다. 크레도가 AWS에서 쓰이면서 매출 YoY 64~89%대 고성장을 이어가다가 → 마이크로소프트, 구글에서 본격 채택되기 시작하면서 YoY 154%~274%로 현재 폭발기를 맞이한 것도 같은 사례입니다.

38
XPU 연결 확대의 사례

크레도는 단일 클러스터의 규모가 커지면서 랙 내 연결과 랙과 랙간 연결에서 AEC 채택이 빠르게 늘던 것 핵심인데, 이번에는 랙 내 All-to-All 연결 규모가 기존 8-XPU 규모에서 2026년 이후 64~72-XPU 단위로 크게 커지고 매년 144-XPU, 576-XPU, 1024-XPU까지 커질 것이므로 점점 더 중요해지면서 Scorpio X(UALink) 채택이 크게 늘어날 것으로 예상합니다.

Latency가 중요한 만큼 UALink도 일정부분 점유율을 가져갈 것 : SUE는 브로드컴이 말하는 <400ns Latency를 구현하려면 구현 난이도가 높다는 점입니다.

39
UALink와 SUE의 지연 차이

XPU에서 나온 명령/데이터를 모아서 패킹하고 → 헤더 부착 → 이더넷 프레임화 → 스위치 파이프 통과 과정에서 각각 수십 ns~100 ns 단위의 지연이 쌓입니다. 그래서 레이턴시 목표를 맞추려면 매우 정교한 하드웨어/펌웨어 설계가 필요합니다. 반면, UALink는 PCle ↔ Ethernet 구조를 통해서 훨씬 경로가 짧습니다. 고정 크기의 FLIT에 헤더도 더 작게 붙여 전송하니, 동일한 규격을 주고받는 식입니다. 레이턴시가 구조적으로 더 낮을 수밖에 없는 설계라는 점이 장점인데 이 덕에 2Q25에 기술표준으로 UALink가 부각되기 시작했다고 보고 있습니다.

40
두 방식의 비유

정리해보자면, SUE는 기존 고속도로에 전용차선을 설치한 것 같습니다. 건설은 빠르겠지만 신호등이나 톨게이트 등을 따로 설계해줘야 하니 크건 작건 병목이 생길 수밖에 없습니다. 그러다보니 브로드컴은 'Latency를 스펙에 적을 필요없다. 충분히 빠르다.'고 주장하는 것입니다. 반면, UALink는 전용 고속도로를 새로 깐 것과도 같습니다. 동일한 규격으로 전용 차선을 통해서 주고 받으니 결국에는 '우리는 Latency를 스펙에 적을 수 있다'라는 말로 나오는 것입니다.

41
관련 자료 링크와 5줄 요약

아스테라랩스 (ALAB)

2025-09-15

주간전략보고 : 투자의 생각 (9월 15일~9월 19일) (바로가기)

2025-09-12

업계 전문가 인터뷰 : 아스테라랩스, 모두가 Scale-up을 필요로 하는 시대의 핵심 기업 (바로가기)

2025-09-08

주간전략보고 : 투자의 생각 (9월 8일~9월 12일) (바로가기)

5줄 요약

42
핵심 투자 판단

Scale-up 분야에서 가장 좋게 보는 기업은 아스테라랩스이며, Overweight를 유지하고 있습니다. 랙 단위 AI 네트워크가 핵심으로 부상했습니다. Scale-up 시장은 $4B(’24) → $17B(’29E)로 성장 전망이며 GB200 NVL72가 성능·경제성의 기준점이 되었습니다.

NVL72는 HW+CUDA가 함께 성장한 결과물입니다. 엔비디아의 경쟁역량 자체는 꾸준히 높을 거라고 보고 있습니다.

43
NVL72와 수혜 강도의 차이

GPU와 ASIC 동시 성장을 기대하고 있기 때문에 ASIC쪽에서 NVL72을 따라잡기 위해 브로드컴의 Tomahawk 6과 아스테라랩스의 Scorpio X를 택할 것인데, 브로드컴의 연매출은 $60B, 아스테라랩스의 연매출은 $0.6B로 10배 차이나는 상태다보니 수혜강도 차이가 큽니다.

랙 내부의 단거리는 2028년까지 구리 기반이 주류일 것으로 예상합니다. Optics는 Scale-out에서 성장하고 있습니다.

44
구리·광학과 AWS 의존

Scale-up으로 채택될 기대는 중장기 과제입니다.

크레도와 아스테라랩스는 업계 전문가 인터뷰를 통해서 보실 수 있으셨겠지만, AWS가 낳은 자식에 가깝습니다. 그렇다보니 CY26에는 AWS가 이끄는 성장을 누리고 → CY27에는 타 빅테크들로부터 채택되고 → CY28 이후는 XPU 연결 확대가 이어질 것을 기대합니다.

Trainium 3 중 몇 개의 칩이 Teton으로 할당되느냐에 따라 CY26 EPS 변화가 크다보니, Bull/Base/Bear Case간 격차가 큽니다.

45
Bull·Base 시나리오

모건스탠리는 Trainium 3 내에서 Scale-up 기회가 $400M이 넘어서 매출 $1.5B를 시나리오로 가정하여 Bull Case로 제시했습니다. Base는 매출 $1.0B 예상입니다.

5

그럼에도 빠진내용 정리

잡담·곁다리 내용
  • 원문의 계산·가정·전망은 확인된 사실과 구분해 보존했다.
생략 기록
  • 없음. 모든 sourceCoverage 구간은 flow에서 순서대로 회수했다.

그럼에도 빠진내용 정리

보존 범위
45개 원문 구간을 흐름 순서대로 회수했으며, 본문 첫머리의 채널·게시일·URL, 연결 자료와 투자 유의 문구도 포함했다.
계산과 전망
Trainium 3 탑재 비중, Scorpio X 매출, CY26 매출과 EPS는 작성자의 가정·시나리오로 유지했고 확인된 사실로 바꾸지 않았다.
남은 유보
UALink·SUE의 실제 채택, 광학의 Scale-up 전환, 마벨의 돌파구, AWS 이후 고객 확산은 원문이 가능성·전망으로 남긴 범위에서 보존했다.
원문 확인

document_work_runner prepare가 입력 원문을 수정 없이 보존했다.