[원문 유형] 네이버 프리미엄 콘텐츠 [채널] 올바른 미국주식 by SAPIENS [게시일] 2025.09.12. 오후 6:04 [원문 URL] https://contents.premium.naver.com/sapiens/sapiensasset/contents/250912180453325pv [제목] 업계 전문가 인터뷰 : 아스테라랩스, 모두가 Scale-up을 필요로 하는 시대의 핵심 기업 [수집 기준] 승인된 구독 열람권으로 실제 본문을 보존했다. 이미지·첨부는 별도 미디어 원장에 보관하며 시각적 의미 검토 여부를 구분한다. [구독 원문 본문] ​ 안녕하세요 사피엔스입니다. ​ 업계 전문가 인터뷰입니다. 아스테라랩스 특집입니다. ⓐAMD 전 임원이 바라본 아스테라랩스 ⓑ반도체 17년, 마벨 출신이 본 경쟁구도 ⓒ아스테라랩스 CTO 출신이 경쟁력에 대해 말한 자료입니다. ​ 엔비디아가 GB200 NVL72로 추론의 시대에도 압도적인 점유율을 보이고 있는 시대에, 엔비디아의 Scale-up을 따라가기 위해 중요해진 기업 아스테라랩스에 대해 들어봤습니다. ​ Trainium 2부터 강화되어 Trainium 3에서 꽃을 피울 것으로 예상하는 아스테라랩스와 AWS와의 관계, 그리고 AEC와 리타이머 시장에 대해서 많은 얘기를 들어볼 수 있었습니다. ​ 주간전략보고 2025-09-08 주간전략보고 : 투자의 생각 (9월 8일~9월 12일) (바로가기​) AI 사이클, GPU vs ASIC에 대한 생각 (자료 맨 밑에 있습니다) 2025-09-10 오라클 3Q25 실적발표 : "모두가 다가오는 쓰나미🌊의 규모를 이해하고 있는 건 아닙니다" (바로가기) 2025-08-28 엔비디아 2Q25 실적발표 : Blackwell 12개월치 SOLD OUT, AI CAPEX $3~4T를 말하다 (바로가기) 업계 전문가 인터뷰 2025-09-02 업계 전문가 인터뷰 : 블룸에너지, 데이터센터로 어디까지 침투할 수 있을까? (바로가기) 투자자문 서비스에 따른 투자 시 원금 손실이 발생할 수 있으며, 투자 손익에 대한 책임은 전적으로 고객에게 귀속됩니다. 또한 과거의 투자수익이 미래의 수익률을 보장하지 않습니다. ​ 신규 구독 전에, 아래 투자자문계약 권유문서의 계약 관련 제반 사항을 반드시 읽으시고 충분히 검토하시기 바랍니다. ​ *투자자문계약 권유문서 : https://naver.me/5ZST47Qf 목차 ​ NVLink vs 'UALink' : 모든 ASIC 프로젝트들이 Scale-up을 필요로 한다 주요 기업들과의 경쟁구도 : Astera vs Credo, Broadcom, Marvell 아스테라랩스 CTO 출신이 입을 열다 : GB200 NVL, HGX B200, AWS, Scorpio, AEC, UALink ​ NVLink vs 'UALink' 모든 ASIC 프로젝트들이 Scale-up을 필요로 한다 A. AMD 임원이 바라보는 아스테라랩스의 경쟁력 *인터뷰 날짜 : 2025-03-14* 사회자 "AI 데이터센터 분야에 대해서 얘기를 나눠볼까 합니다. 아스테라랩스에 대해서 질문 드릴텐데, 아스테라랩스의 제품과 데이터센터 구축 및 소프트웨어에 대해서 자세히 알고 싶습니다." ​ AMD의 데이터센터 GPU 설계 임원 (현직) "제 배경을 말씀드리면, 저는 10년 넘게 데이터센터 업계에서 일해왔습니다. 처음에는 설계 엔지니어로 시작했고, 이후에는 Dell에서 엔터프라이즈 데이터센터를 대상으로 하는 서버·스토리지·네트워킹 사업을 이끌었습니다. 제가 Dell에 있을 때, Dell은 기업 데이터센터에 공급하는 1위 업체가 되었고, Fortune 2000 기업들이 모두 Dell에서 장비를 구매했습니다. 연간 $50B 규모의 비즈니스였죠. 데이터센터 시장에서 상당히 큰 비중을 차지하는 부분이지만, 가장 빠르게 성장하는 분야는 아닙니다." "가장 빠르게 성장하는 쪽은 하이퍼스케일러들이고, 기업 데이터센터는 전체에서 훨씬 더 큰 비중을 차지합니다. 이 이야기를 꺼내는 이유는 Astera Labs도 기업 데이터센터와 하이퍼스케일 비즈니스 모두에서 활약하게 될 것이기 때문입니다. 지난 1년 반 동안 저는 순수하게 하이퍼스케일 사업에 집중해왔습니다. 지금은 AMD에서 데이터센터 GPU 설계 그룹에 속해 있으며, 거의 전적으로 Microsoft, Meta, Alibaba 같은 기업들을 대상으로 일하고 있습니다." "Dell, Lenovo, HP 같은 기업 데이터센터 고객에게도 제품을 공급하고 있지만, 이는 비즈니스의 핵심 부분은 아닙니다. Dell에 있었을 때와는 정반대 상황이죠. 당시에는 Uber 같은 Web 2.0 기업에도 판매했고, Azure 비즈니스에도 공급했습니다. 하지만 요즘은 하이퍼스케일러들이 자체 엔지니어링과 설계팀을 꾸리면서 Dell, HP, Lenovo 같은 전통적 OEM 업체들의 기회는 줄어들었습니다. 여전히 공급은 하지만, 대부분의 하이퍼스케일러들은 직접 대만 업체들과 거래하는 경우가 많습니다." ​ *코멘트 → ⓐ엔터프라이즈 데이터센터는 대기업들이 자사 워크로드를 직접 운영하는 형태입니다. Dell, HP, Lenovo 같은 OEM 업체가 서버-스토리지-네트워킹 장비를 한 번에 공급합니다. ⓑ하이퍼스케일러 데이터센터는 초대형 규모의 데이터센터를 운영하다보니 자체 설계 팀이 있어서 대만의 ODM(Foxconn, Quanta, Wiwynn)과 직접 계약하고 있습니다. ​ 사회자 "아스테라랩스 제품을 써보셨던 경험이나, 아스테라랩스 제품이 요즘 데이터센터 구축에 왜 중요한지 말씀해주실 수 있나요?" ​ AMD의 데이터센터 GPU 설계 임원 (현직) "저는 Astera Labs의 창업자들과 팀을 회사 초창기부터 알고 지냈습니다. 그들이 Dell에 찾아와 우리와 대화했던 이유는 당시 우리가 확장된 PCIe 기능을 가진 서버를 구축하고 있었기 때문입니다. PCIe는 내부 버스이고, 그 위에 올라가는 것이 GPU 같은 장치들입니다. 많은 AI 서버를 보면 기본적으로 전통적인 서버 구조이지만, 수많은 PCIe 슬롯에 GPU들이 꽂혀 있는 형태입니다. Astera가 우리에게 가능하게 해준 것은 CPU의 도달 범위를 확장하는 것이었습니다. 그들은 리타이머(Retimer)​라는 제품을 제공했는데, 이를 통해 더 많은 PCIe 슬롯을 추가할 수 있었습니다. 그 제품은 지금도 출하되고 있습니다. "현재 AMD의 MI300X 제품은 유니버셜 베이스보드(UBB, Universal Base Board)라고 부르는 형태로 출하됩니다. 그 위에는 GPU가 8개 올라가 있고, 여기에 Astera의 리타이머도 들어 있습니다. 이 리타이머는 우리가 연결하는 CPU와 GPU를 연결하는 데 중요한 역할을 합니다. 지난 1년 동안 AMD의 매출을 보면, 대부분의 출하량이 Azure와 해당 서버 박스로 갔습니다. 그리고 그 박스마다 모두 Astera의 리타이머가 들어 있습니다." ​ *코멘트 → PCle는 서버 내부에서 CPU ↔ GPU, NIC, SSD 같은 장치들을 서로 연결하는 고속 데이터 버스 표준입니다. 데이터를 더 많이 전송하려다보니 속도를 더 빠르게 만드는 데, PCle Gen5는 32GT/s → Gen6는 64GT/s → Gen7 128GT/s로 2배씩 빨라지는 트렌드입니다. 이렇게 되면 신호가 몇 m 이상 가면 깨지는 감쇠(attenuation) 문제가 커집니다. 리타이머는 여기서 쓰입니다. 신호를 다시 깨끗하게 만들어서 다시 먼 거리까지 통신하게 해주는 겁니다. 오른쪽 사진자료에서 보시면 HGX B200 제품에 들어가는 칩에는 리타이머가 들어가있습니다. ​ 사회자 "리타이머에 대해서 공부해보다가, 최근 Scorpio를 통해서 PCle Switch로까지 역량을 늘렸다는 걸 파악했는데 혹시 알고 계신가요?" ​ AMD의 데이터센터 GPU 설계 임원 (현직) "이것은 Astera 같은 회사의 자연스러운 진화 과정입니다. 그들은 시장에서 입지를 다지길 원했습니다. PCIe 스위치를 보면, 몇 년 전까지만 해도 우리는 PLX가 만든 PCIe 스위치를 사용했습니다. 그때의 용도도 같았죠. “서버에 어떻게 하면 더 많은 PCIe 슬롯을 넣을 수 있을까?”라는 문제였습니다. 결국 Avago가 PLX를 인수했고, 지금은 Broadcom이 PCIe 스위치를 보유하고 있습니다." "이 시장은 경쟁이 치열하지만 수익성 있는 시장입니다. Astera가 그 공간에서 입지를 다지고, Marvell도 Broadcom과 경쟁하려는 것은 자연스러운 흐름입니다. 각 회사는 조금씩 차별점이 있고, 기본적으로는 PCIe 규격을 따르지만, 공간 효율, 크기, 전력 소비 같은 부분에서 경쟁할 수 있습니다. 경쟁할 수 있는 벡터가 많습니다. Astera는 상당히 재능 있는 팀을 보유하고 있고, 이 분야에서 경쟁하기 위해 포트폴리오를 확장해 나가고 있습니다." ​ 사회자 "흥미롭네요. 이 스위치 기술은 제가 맞다면, Head node switch인데 왜 이런 게 필요한 건가요? 주요 수요는 뭔가요?" ​ AMD의 데이터센터 GPU 설계 임원 (현직) "PCIe 스위치는 사실상 헤드 노드뿐만 아니라 랙 전체에 걸쳐서 사용되는 것을 보실 수 있습니다. 일반적으로 랙 단위에서 보면, 주로 이더넷 스위치를 많이 사용합니다. 이는 랙 단위에서 노드들을 연결하는 일반적인 방식입니다. 다만, 엔비디아의 Blackwell 랙 같은 경우는 예외인데, 그들은 랙 안의 모든 노드를 연결하기 위해 NVLink라는 방식을 사용합니다. PCIe를 패브릭으로 쓰는 방식은 랙 수준에서는 아직 본격적으로 확산되지 않았습니다." ​ 사회자 "좋습니다. 제가 이해하려는 부분은 이렇습니다. Astera Labs는 처음에는 리타이머에서 출발했지만, 이제 Scorpio 제품군을 구축하고 있습니다. 제가 알기로 X-시리즈는 UALink, P-시리즈는 스위치, 그리고 또 CXL 컨트롤러도 갖추고 있습니다. 제가 궁금한 건, 당신이 Astera Labs와 상호작용해본 경험을 토대로 봤을 때, 이 회사가 정말로 여러 시장에서 활약할 수 있을 만큼 신뢰할 만하다고 보십니까? 아니면 여전히 리타이머에만 특화된 회사라고 보십니까?" ​ AMD의 데이터센터 GPU 설계 임원 (현직) "AI 분야를 보면, 엔비디아가 다른 모든 기업을 훨씬 앞서 있습니다. 만약 제가 엔비디아와 경쟁할 제품을 설계한다고 하면, 랙 스케일 신호 처리(rack-scale signaling), 즉 스케일업 네트워크(scale-up network)가 필요합니다. 엔비디아는 이를 위해 NVLink를 사용하고 있죠. NVLink는 원래 212Gbps를 목표로 했던 것으로 아는데 실제로는 그 속도에 완전히 도달하지는 못했습니다. 대신 다소 낮은 속도로 동작하지만 링크의 양쪽 끝을 모두 엔비디아가 제어하기 때문에 문제가 되지 않습니다." "엔비디아와 경쟁하려는 모든 기업들을 보면, AMD도 그 그룹 안에 있고, 아마도 출하량 기준으로는 아마존의 Trainium이 엔비디아 다음으로 클 겁니다. AMD도 그 중간 어딘가에 위치합니다. 그런데 아무도 이런 스케일업 네트워크를 직접 구축할 수 있는 IP를 가지고 있지 않습니다. 그래서 Astera와 같은 업체가 필요합니다. 그들이 이런 네트워크를 가능하게 해주는 SerDes(Serializer/Deserializer) 링크를 공급할 수 있기 때문입니다. 저는 최근에 메타와 대화를 나눴는데, 메타는 이 분야에서 큰 지출을 하는 회사이고, 그들이 저희한테 직접적으로 'Astera를 스케일업 네트워크 공급 후보로 보고 있다'고 언급했습니다. Astera는 로드맵에 212Gbps 리타이머를 가지고 있습니다. 그들은 시장이 어디로 향하는지, 어떤 수요가 있는지를 잘 알고 있으며, 그에 맞춘 제품을 파이프라인에 준비해두고 있습니다." ​ *코멘트 → 엔비디아 자료를 통해 많이 강조드린 부분이지만 추론의 경제학에서 All-to-All 연결이 무엇보다 중요해진 시대에 AWS, AMD, Meta, Microsoft에는 이런 독자적인 NVLink에 대항할 만한 Scale-up 네트워크가 없다는 게 핵심입니다. 2025년 상반기까지는 리타이머 제품군인 Aries 브랜드로만 성장을 이뤄왔는데 이제 아스테라랩스의 Scorpio 스위치가 향후 중요해질 것으로 전망합니다. 이미지를 보시면 맨 왼쪽에 랙 내에서 여러 XPU들을 Scorpio X 스위치로 묶어줍니다. 그리고 GPU 클러스터와 스토리지, NIC간 연결에서는 Scorpio P 스위치로 확장할 수 있습니다. 이제 리타이머로만 성장하던 단계에서 벗어나 NVLink 대체재가 되고 있음을 주가로 반영하는 구간입니다. ​ 사회자 "정말 흥미롭네요. 방금 아마존의 Trainium 칩과 같은 커스텀 실리콘 솔루션을 언급하셨습니다. 이런 커스텀 실리콘이 Astera Labs가 개발하는 연결 제품이나 네트워킹 제품의 수요에는 어떤 영향을 미치나요? 커스텀 칩으로 구축된 데이터센터는 이런 유형의 제품을 더 많이 쓰게 될까요, 아니면 덜 쓰게 될까요?" ​ AMD의 데이터센터 GPU 설계 임원 (현직) "대부분의 ASIC 프로젝트들이 아마존, 마이크로소프트, 메타를 포함해서 모두 Scale-up 네트워크를 필요로 하고 있습니다. 제가 알기로는 어느 하이퍼스케일러도 대규모 SerDes 팀을 보유하고 있지 않습니다. SerDes는 데이터를 실제로 이동시키는 실리콘의 물리적 구현체입니다. PCIe든 이더넷이든, 어떤 방식이든 SerDes는 반드시 필요합니다. 그런데 제가 아는 한, 하이퍼스케일러들은 이 분야에 큰 팀을 두고 있지 않습니다. 반면, Astera의 전문성은 바로 SerDes에 있습니다. 이들은 어떤 속도든 지원할 수 있고, 현재는 212Gbps까지 개발되어 있습니다." ​ 사회자 "흥미롭네요. 제가 Astera에 대해 읽었던 또 다른 것 중 하나는 COSMOS 소프트웨어인데, 혹시 이것에 대해 알고 계신가요? 알고 계시다면 어떻게 실제로 쓰이는지, 어떤 문제를 해결하는지 설명해주시겠어요?" ​ AMD의 데이터센터 GPU 설계 임원 (현직) "하이퍼스케일 시장부터 말씀드리겠습니다. 이들은 방대한 소프트웨어 팀을 갖추고 있어서, 필요한 모든 소프트웨어를 직접 개발할 수 있습니다. 모든 것을 철저히 모니터링하는데, 이는 총소유비용(TCO, Total Cost of Ownership)에 아주 민감하기 때문입니다. 그들은 와트당 성능, 달러당 성능, 하드웨어 투자 대비 수익률까지 꼼꼼하게 따집니다. 이런 이유로, 하이퍼스케일러들은 보통 COSMOS 같은 소프트웨어를 쓰지는 않습니다. 다만, 네트워크 통계를 직접 작성하는 것보다 COSMOS가 더 저렴한 방법이라고 판단될 경우에는 채택할 수도 있습니다." "반면, 연간 $150B 규모의 기업 데이터센터 시장은 정반대입니다. 이들은 자신들의 비즈니스 애플리케이션만 작성할 뿐, 그 외에는 직접 하지 않습니다. 그들은 모든 것이 쉽게 사용할 수 있고, 기본 제공(built-in)이기를 원합니다. 예를 들어, Dell 고객이 네트워크 통계를 원한다면, Dell이 출하하는 모든 서버에 COSMOS를 공장 출하 시 사전 설치(factory-installed)해주기를 바랄 수 있습니다." "Astera는 이런 OEM 서버 업체들과 협력해 소프트웨어를 통합하는 데 능숙합니다. 업계에서 얼마나 광범위하게 배포되고 있는지는 제가 알 수 없지만, 일부 네트워크 통계를 수집하는 것은 분명히 가치가 있습니다. 궁극적으로 모든 링크와 시스템은 제조사 보증 설계 기준에 맞는 비트 오류율(BER, Bit Error Rate) 수준으로 동작하도록 설계됩니다. 광고된 성능을 실제로 얻고 있는지 확인하는 건 언제나 좋은 일이고, COSMOS가 바로 그런 데서 역할을 합니다. 다만, 본질적으로 필수적인 도구라고 보기는 어렵습니다." ​ *코멘트 → COSMOS란 아스테라랩스가 제공하는 시스템 수준의 모니터링 및 진단 소프트웨어입니다. 리타이머나 스위치가 제대로 잘 작동하는지 확인할 수 있고, 비트 오류율, 링크 상태, 네트워크 통계 등을 한 눈에 보여줍니다. 하이퍼스케일러들 입장에서는 이미 모니터링 툴이 있으니 채택을 안 할 수도 있지만, 기업들은 다릅니다. COSMOS가 자연스레 채택될 가능성이 높습니다. ​ 사회자 "괜찮습니다. 제가 궁금한 건, Astera가 앞으로 어떤 제품이나 데이터센터의 다른 영역으로 확장하는 것이 논리적일지에 대한 당신의 생각입니다. PCIe 스위치와 인접한 영역 가운데, Astera가 혁신적으로 진출할 만한 부분이 있을까요?" ​ AMD의 데이터센터 GPU 설계 임원 (현직) "제가 보기에 Astera의 기회는, 앞서 언급했듯이 이더넷 리타이머가 곧 대규모로 배치될 것이라는 점을 이해하고 이미 그 시장에 들어가 있다는 데 있습니다. 마벨이 해온 일을 보면, 사실상 브로드컴과 어깨를 나란히 하고 있습니다. 브로드컴은 데이터센터 네트워킹 시장을 사실상 지배하고 있죠. 물론 시스코와 주니퍼도 있지만, 이들은 주로 대형 장비(big iron)에 집중하고 있고, 현재 랙 수준에서의 스케일업·스케일아웃을 다루는 데 있어서는, NVIDIA 생태계를 제외하면 브로드컴이 유일한 대안입니다. AMD, 인텔, 그리고 모든 하이퍼스케일러들이 이와 관련된 모든 활동을 하고 있죠." "마벨도 이를 잘 알고 있습니다. 이제는 스위치 시장에서 신뢰를 얻었고, 자체 고객 기반을 구축해 나가고 있습니다. 따라서 Astera가 그 공간에서 경쟁하지 못할 이유는 없습니다. 경쟁력이 있다고 보고, 이는 아주 논리적인 다음 단계입니다. Astera가 212Gbps 리타이머 시장에서 자리를 확실히 잡으면 그다음 단계는 이더넷 스위치가 될 수 있습니다. 이 시장은 매우 수익성이 높습니다. Astera는 이미 하이퍼스케일 부문에서 충분히 인정받고 있기 때문에, 기업 데이터센터까지는 아니더라도, 스위치 제품을 내놓는다면 기꺼이 고객들이 받아들일 것이라 생각합니다." "Astera는 기업 데이터센터에서도 PCIe 리타이머로 폭넓게 자리잡았고, 언젠가는 다른 제품군으로도 확장할 수 있을 것입니다. 물론 그러려면 실행력을 입증해야 합니다. 이 업계의 고객들은 모든 시스템이 연중무휴 24/7로 무결점·무오류로 동작하길 원합니다. 이런 신뢰를 얻기까지는 시간이 조금 걸립니다. 몇 년 전만 해도 Astera가 막 시작했을 때, 과연 제대로 자리를 잡을 수 있을까 의문이 있었는데, 지금까지 매우 인상적인 성과를 내며 성장했습니다." ​ 사회자 "제가 공부 차원에서 여쭤보는 건데요, Tomahawk 스위치는 칩 대 칩 연결보다는 랙 대 랙 연결과 더 관련이 있는 것 아닌가요? 제가 지금 spine과 leaf 아키텍처에 대해 조금 읽고 있는데, 데이터센터 안에서 이 모든 것들이 어떻게 맞물려 있는지 이해하려는 중입니다." ​ AMD의 데이터센터 GPU 설계 임원 (현직) "두 가지 측면이 다 있습니다. 잠깐 옆길로 돌아가서 말씀드리자면, 브로드컴과 마벨도 NIC(Network Interface Card) 시장에 참여하고 있습니다. 모든 CPU는 랙 상단 스위치(Top-of-Rack Switch, ToR)에 연결되는 NIC를 가지고 있죠. 이는 Astera에게도 차후 확장할 수 있는 기회가 될 수 있습니다. 지금 당장 핵심 영역은 아니지만, 전혀 불가능한 일도 아닙니다." "이제 다시 질문으로 돌아가서, Blackwell 아키텍처를 보겠습니다. 오늘날 생성형 AI 학습용으로 가장 중요한 아키텍처이며, 현재 새로운 대안 제안도 없습니다. 엔비디아는 칩-칩 연결(chip-to-chip)을 위해 NVLink를 사용합니다. 한 랙에 72개의 GPU가 있고, 이 모든 GPU는 구리선으로 직접 NVSwitch에 연결됩니다. 만약 경쟁자가 이와 경쟁할 무언가를 만들고 싶다면, 최소한 랙에 72개의 GPU를 넣고, 이들이 모두 스위치와 연결되어야 합니다." ​ *코멘트 → Scale-up을 위해서는 엔비디아는 NVLink를 쓸 것이고, 일부 작은 비중은 NVLink Fusion을 택하는 기업들도 있겠지만, 대부분은 SUE(=UEC)와 UALink가 나눠가질 것으로 예상합니다. 아스테라랩스가 최근에 많이 오른 것은 아스테라랩스 2Q25 실적발표에서 "10개의 고객사가 테스트 중"이라는 코멘트로 확인할 수 있었던 것처럼 Scale-up 네트워크에서 UALink가 생각보다 점유율을 가져갈 가능성이 높아졌기 때문이었습니다. ​ *코멘트 → 브로드컴과 마벨이 주도하고 있는 SUE가 주장하는 것은 기본적으로 Scale-out의 솔루션을 Scale-up으로도 가져올 수 있다는 것이 핵심입니다. Tomahawk Ultra를 출시하면서 rack-to-rack을 넘어서 chip-to-chip으로 침투하겠다는 것입니다. 반면 AWS, AMD, 메타, 인텔, 마이크로소프트, 구글이 주도하는 UALink는 PCle 패브릭으로 랙 내부는 따로 다뤄야 한다는 것입니다. 초저지연을 위해서는 랙 내부의 chip-to-chip 연결은 PCle 기반 패브릭이 퍼포먼스 대비 TCO가 더 좋다는 것입니다. 결국은 고객사인 하이퍼스케일러들이 택하는 이슈인데 여기서 Scale-up 솔루션으로 UALink를 택할 것인지, SUE를 택할 것인지가 결정되다보니 경쟁 관계입니다. ​ *코멘트 → 이에 대해서 자세한 내용은 <주간전략보고 : 투자의 생각 (9월 8일~9월 12일)> 자료를 보시면 좋습니다. SUE의 장점은 이더넷 재사용이란 장점 덕분에 설계 자유도가 높으니 상용화나 멀티벤더를 구현할 수 있겠지만, 문제는 브로드컴이 말하는 <400ns Latency를 구현하려면 구현 난이도가 높다는 점입니다. XPU에서 나온 명령/데이터를 모아서 패킹하고 → 헤더 부착 → 이더넷 프레임화 → 스위치 파이프 통과 과정에서 각각 수십 ns~100 ns 단위의 지연이 쌓입니다. 그래서 레이턴시 목표를 맞추려면 매우 정교한 하드웨어/펌웨어 설계가 필요합니다. 반면, UALink는 PCle ↔ Ethernet 구조를 통해서 훨씬 경로가 짧습니다. 고정 크기의 FLIT에 헤더도 더 작게 붙여 전송하니, 동일한 규격을 주고받는 식입니다. 레이턴시가 구조적으로 더 낮을 수밖에 없는 설계라는 점이 장점입니다. ​ *코멘트 → 정리해보자면, SUE는 기존 고속도로에 전용차선을 설치한 것 같습니다. 건설은 빠르겠지만 신호등이나 톨게이트 등을 따로 설계해줘야 하니 크건 작건 병목이 생길 수밖에 없습니다. 그러다보니 브로드컴은 'Latency를 스펙에 적을 필요없다. 충분히 빠르다.'고 주장하는 것입니다. 반면, UALink는 전용 고속도로를 새로 깐 것과도 같습니다. 동일한 규격으로 전용 차선을 통해서 주고 받으니 결국에는 '우리는 Latency를 스펙에 적을 수 있다'라는 말로 나오는 것입니다. Latency는 추론의 경제학에서 가장 큰 축 세 가지 중 하나일만큼 중요한 요소입니다. 추론이 이렇게 헤비하지 않았다면 SUE로도 충분했겠지만, Reasoning → Agentic AI 트렌드까지 추론은 점점 더 헤비해지고 있습니다. ​ *코멘트 → 추론의 경제학을 차트화시킨 젠슨황 사장님의 자료를 보시면 'Latency'라는 직접적인 단어는 없지만, 왼쪽 차트에서는 TPS per 1 User와 Fast Response가 곧 Latency를 나타내는 값입니다. 그리고 오른쪽 차트에서는 Batch size와 Context %에 따라 TPS per 1 User의 X축과 TPS/MW의 Y축의 최적 값이 바뀌는 모습을 보여주고 있는데, 여기에서 batch size와 context %가 작을 수록 실사용자의 Latency는 짧아지는 구조입니다. 따라서 정리해보면 추론의 경제학에서 ⓐBatch size ⓑLatency ⓒInteractivity가 중요하다는 것은 같습니다. ​ *코멘트 → Latency를 스펙으로 담보할 수 없다면 "달러당 초당 몇 개의 토큰을 생성하여 몇 명의 사용자에게 얼마의 지연속도로 서비스할 수 있는가"를 정확히 잡을 수 없게 됩니다. 실제 LLM 서비스를 제공할 때는 ⓐ매우 큰 Batch size를 통해 Throughput을 극대화하고, 동시에 ⓑLatency는 낮게 유지(빠른 답장)하며, ⓒ서버당 더 많은 사용자(높은 동시접속, Interactivity)를 수용해야 할 수 있어야 합니다. 세 가지 축을 고려할 때 최고의 퍼포먼스 대비 TCO가 나오는 지점을 찾는 게 '추론의 경제'입니다. ​ 사회자 "지금 제가 이해하려는 것은, 일반적인 데이터센터 랙에서 Astera가 현재 얼마나 가치를 차지하고 있는지, 그리고 장기적으로는 얼마나 더 많은 가치를 차지할 수 있을지입니다." ​ AMD의 데이터센터 GPU 설계 임원 (현직) "현재 상황을 보면, Astera는 일반적인 AMD 랙에서 모든 UBB(Universal Baseboard)에 들어가 있습니다. 향후 이들이 랙에 어떻게 통합되느냐에 따라 기회는 상당히 커질 수 있습니다. 만약 GPU 하나의 모든 PCIe 레인마다 리타이머가 붙는 구조라면, 랙 수준에서 엄청난 수량의 리타이머가 필요하게 되고, 이는 곧 랙당 수천 달러 규모의 리타이머 매출로 이어집니다." "그리고 앞으로 약 18개월 이내에 Astera는 212Gbps 리타이머를 본격적으로 대규모 출하할 수 있을 것으로 보입니다. 좀 더 장기적으로는 만약 이들이 PCIe 스위치 시장에서 자리를 잡는다면 이 역시 리타이머와 유사한 규모의 기회가 될 것입니다. 그리고 훨씬 더 장기적으로, 만약 Astera가 이더넷 스위치 시장에서 주요 업체로 자리매김한다면, 그 기회는 정말 거대합니다. 이미 보셨듯, 브로드컴은 그 시장에서 최대 플레이어이며, 데이터센터 네트워킹 부문에서 수십억 달러 규모 매출을 올리고 있습니다." ​ 사회자 "만약 Astera가 AI 워크로드 전용 칩이나 AI 중심 데이터센터용 칩을 설계한다면, 이 분야에서 경쟁 우위를 가질 수 있다고 보십니까? 제가 생각하는 건 이런 겁니다. 지금의 Scorpio P-시리즈 칩을 “AI 워크로드에 더 호환성이 좋은 단순화된 패브릭 스위치”라고 포지셔닝했듯이, 그 전략을 다시 반복할 수 있을까요? 제가 이해하려는 건 바로 이 지점입니다." ​ AMD의 데이터센터 GPU 설계 임원 (현직) "정말 좋은 질문입니다. 엔비디아의 NVSwitch 제품은 실제로 AI 워크로드에 최적화되어 있습니다. 그리고 여기에 브로드컴 스위치에는 없는 기능들이 포함되어 있어서 학습 속도를 가속화합니다. 제가 기억하기로 엔비디아가 사용하는 약어가 SMART였던 것 같은데, 정확한 풀네임은 기억이 나지 않습니다. 이 NVSwitch에는 학습을 더 빠르게 할 수 있도록 설계된 기능들이 내장되어 있습니다." ​ 사회자 "흥미로운 부분이네요. 엔비디아는 NVLink를 보유하고 있고, 반면 Astera는 Scorpio X-시리즈를 발표했는데, 이는 Non-NVLink 생태계용 대안이라고 설명하곤 합니다. 혹시 이 X-시리즈에 대해 잘 알고 계신가요? 혹시 직접 X-시리즈 스위치를 배포해보셨나요? 저는 지금 이걸 이해하려고 합니다. 랙을 X-시리즈 스위치를 중심으로 구성하는 것의 장점이 무엇인지, 그리고 이것이 랙 안에서 어떤 식으로 배치되는지 알고 싶습니다. 실제로 이런 걸 직접 배포해보셨는지 궁금합니다." ​ AMD의 데이터센터 GPU 설계 임원 (현직) "NVLink은 GPU ↔ GPU 간 데이터 링크입니다. 하지만 모든 NVIDIA GPU에는 여전히 프로세서와 연결하기 위한 PCIe 인터페이스도 있습니다. Dell에서 우리는 NVIDIA GPU가 들어간 서버를 출하했는데, 거기에는 Astera의 리타이머나 PLX PCIe 스위치가 들어가 있었습니다. 즉, 아키텍처 상에서 보면 Astera는 여전히 NVIDIA 환경 안에서도 역할을 하고 있는 셈입니다. 물론 Blackwell 세대에서는 구체적으로 Astera가 필요하지 않을 수도 있지만, NVIDIA는 여전히 방대한 제품 라인업을 가지고 있고 그중 상당수는 PCIe 기반 카드들입니다. 사실 몇 년 전까지만 해도 PCIe 카드가 NVIDIA의 주요 사업이었죠. 따라서 Astera가 그 공간에서 완전히 배제된다고 보긴 어렵습니다. 이 부분은 특히 기업 데이터센터(corporate data center) 시장에서 여전히 중요한 기회가 될 수 있습니다." ​ *코멘트 → 주요 투자포인트는 CY26~27의 Scorpio지만, 지금은 거의 엔비디아의 성장세를 따라가고 있습니다. Blackwell HGX B200이 많이 팔리는 것에 맞춰서 Aries 리타이머 매출이 늘어나고 있고, Blackwell MGX 플랫폼 판매가 늘어나는 트렌드에 맞춰서 Scorpio P 스위치 판매가 늘어나고 있습니다. CPU ↔ GPU, GPU ↔ NIC, GPU ↔ SSD 이종 컴포넌트 간 연결을 관리하는 스위치입니다. DGX는 NVLink를 넣지만 MGX/HGX는 하이퍼스케일러들이 받아갈 떄 자체 NIC를 넣다보니 여전히 아스테라랩스의 Aries 리타이머, Scorpio P Switch가 쓰이는 겁니다. ​ 사회자 "그럼 질문을 바꿔서 드려보겠습니다. 만약 당신이 AMD GPU를 사용해 AI 데이터센터를 구축한다면, 그때는 Astera의 X-시리즈를 사용해서 각 AMD GPU들을 서로 연결하게 되는 건가요?" ​ AMD의 데이터센터 GPU 설계 임원 (현직) "그건 확실히 가능합니다. 다만 그 인터페이스를 직접 설계해야 합니다. 지금도 파트너들과 고객사들 중에는 AMD GPU를 기반으로 자체 설계를 진행하는 곳들이 있습니다. 그런 방향은 논리적으로 충분히 타당합니다." ​ *코멘트 → Scale-up 전환 없이는 불리한 상황이기 때문에 이를 생각해보면 AMD가 엔비디아와 비등한 레벨에서 겨루는 단계는 UALink가 도입되고나서부터 시작입니다. Scorpio X Switch가 양산되기 시작하면 탑재될 예정인데 2026년 하반기의 MI400X부터 탑재되기는 어렵고, 2027년의 MI500X부터 탑재될 예정입니다. 최근 NVIDIA Rubin CPX 칩이 발표되면서 AMD의 역전은 하드웨어 로드맵상 2027년 말쯤까지 어려워보입니다. 물론 절대적인 판매량 자체는 꾸준히 증가할 것이므로 아스테라랩스 입장에서는 충분히 고객으로 중요합니다. ​ 사회자 "마지막으로, 제가 놓친 Astera의 가장 중요한 요소는 무엇이라고 보시나요?" ​ AMD의 데이터센터 GPU 설계 임원 (현직) "제가 앞으로 계속 지켜볼 부분은, 이들이 어떤 새로운 시장으로 확장하려는지입니다. 제 생각에는 이더넷쪽의 기회가 PCIe 못지않게 크다고 봅니다. 그리고 Astera도 분명히 그걸 이해하고 있습니다." 주요 기업들과의 경쟁구도 Astera vs Credo, Broadcom, Marvell B. 반도체 17년 전문가, 마벨 출신이 본 아스테라랩스 *인터뷰 날짜 : 2025-07-18* 사회자 "오늘 문의 주셔서 감사합니다. 주요 논의 주제는 특히 Astera Labs이지만, 더 일반적으로는 AI 데이터센터 백엔드 네트워킹 전반과, 이 영역의 주요 업체들인 브로드컴, 마벨, 크레도, 아스테라의 기술 역량입니다. 제가 특히 알고 싶은 것은 네트워킹의 구성 요소들, 벤더 락인이 어디서 발생하는지, 교체 난이도, 전기 → 광으로의 전환 트렌드와 예상 시기, 그리고 이와 유사한 사안들입니다. 또, 업체의 현재 경쟁력은 어떻고 COSMOS의 장점은 무엇인지 궁금합니다." ​ 마벨 출신의 반도체 17년 전문가 (전직) "좋습니다. 이건 포괄적인 질문이군요. 하나씩 이야기해보겠습니다. Astera Labs는 리타이머 시장에서 점점 더 입지를 키워가며 지금까지 매우 경쟁력 있게 자리잡았습니다. 이것이 이들의 반도체 솔루션, 즉 하드웨어입니다. 한편, COSMOS는 잘 아시다시피 소프트웨어 플랫폼입니다. 이는 네트워크의 “건강 상태”를 관리하고 최적화하며, 대규모 배치 환경에서 사용자, 네트워크 엔지니어, IT 팀이 고속 데이터 링크의 성능과 상태를 파악할 수 있도록 가시성을 보장하는 시스템에 가깝습니다." "특히 최근 데이터센터가 점점 더 복잡해지고, 여러 개의 컴퓨팅·네트워킹 컴포넌트로 확장할수록 이런 가시성과 관리 기능은 점점 더 가치가 높아집니다. COSMOS라는 이름이 붙었을 뿐, 사실 이런 종류의 기능은 완전히 새로운 개념은 아닙니다. 네트워킹 업계의 플레이어들은 정도의 차이는 있지만 비슷한 기능을 가진 소프트웨어를 개발해왔고, 일부는 이미 시장에서 제공 중입니다. 예를 들어 RAS(신뢰성, 가용성, 서비스성: Reliability, Availability, Serviceability) 성능을 고객이 이해할 수 있도록 돕는 소프트웨어가 기존에도 있었습니다." "Astera의 독특한 점은, COSMOS를 통해 이를 대규모 데이터센터 수준에서 관리할 수 있다고 주장한다는 것입니다. 다만 이 서비스 품질이나 RAS 기능의 품질이 오늘날의 데이터센터에 맞게 맞춤화되지 않으면 얼마나 안정적이고 지속 가능한지는 아직 알 수 없습니다만, 분명히 COSMOS 플랫폼은 계속 진화하고 있습니다. 그들이 말하는 대로 하이퍼스케일러 환경에서 연결을 모니터링·관리·디버깅할 수 있다는 건 큰 강점이며, 자사 네트워킹 하드웨어와 함께 COSMOS를 제공할 수 있다는 점은 엄청난 자산입니다." "Astera Labs는 지난 몇 년간 꾸준히 포트폴리오를 확장해왔습니다. 리타이머에서 시작해, 이제는 메모리 컨트롤러, 액티브 케이블 모듈, 스위치 시장로 진출했습니다. 제가 알기로 COSMOS는 이 모든 제품군을 아우르는 플릿 관리(fleet management) 역할을 하고 있습니다. 소프트웨어가 하드웨어의 사용성(usability), 활용도(utility), 관리 용이성(manageability)를 높이고, 반대로 하드웨어가 소프트웨어 플랫폼을 확장시키는 강력한 시너지를 만듭니다. 고객에게는 매우 완결성 있고 견고한 솔루션을 제공하는 셈이죠. 제 생각에 COSMOS는 Astera의 제품 포트폴리오 맥락에서 볼 때 매우 중요한 자산인 게 맞습니다." ​ ​ 사회자 "질문은 이렇습니다. Astera는 아마존 같은 큰 고객을 보유하고 있고, 과거에는 엔비디아도 주요 고객이었습니다. 다만 Blackwell 아키텍처에서는 칩간 연결이 보드 내 전기적 직결(electrical connections)로 구현되어, Astera 솔루션이 필요하지 않은 것으로 보입니다. 어쨌든 Astera는 대형 고객을 확보한 상태죠. 문제는 Gen5 → Gen6로 넘어가는 시점입니다. 크레도, 마벨, 브로드컴 모두가 Gen6 리타이머 솔루션을 보유하고 있다고 주장합니다. 그렇다면, COSMOS만을 이유로 다른 업체들의 솔루션을 배제할 수 있을까요?" ​ *코멘트 → GB200 NVL72이나, B300 NVL16에서 안 쓰이는 것은 맞지만 MGX나 HGX에서는 쓰이고 있습니다. 주로 AWS가 자체 Smart NIC를 만들어서 쓰고 있다보니 AWS의 Trainium 출하량이 늘어나는 게 아스테라랩스에게는 호재입니다. 최근 Anthropic에 투자를 늘리면서 Trainium 출하량을 굉장히 늘리고 있는데 이런 점들도 순풍입니다. ​ 마벨 출신의 반도체 17년 전문가 (전직) "제 관점도 그렇습니다. 제가 말하고자 했던 건 COSMOS가 매우 강력하고 가치 있는 플랫폼이라는 점입니다. 다만, 이것이 단일한 게임 체인저이자 하이퍼스케일러 고객의 의사결정을 좌우하는 핵심 요소인지에 대해서는 물음표가 붙는다고 봅니다. 제가 CSP 및 하이퍼스케일러들과 직접 일하면서 느낀 건, 그들이 가장 중시하는 건 결국 총소유비용과 공급망의 지속 가능성(sustainability of the supply chain)입니다. 이게 핵심이라고 생각합니다. 물론 COSMOS는 Astera Labs만의 독특한 플릿 매니지먼트 솔루션입니다." 하지만 적어도 마벨과 브로드컴은 이미 텔레메트리 소프트웨어 툴을 보유하고 있습니다. 이는 업계 표준처럼, 데이터센터 고객이 REST 기능을 통해 원격으로 문제를 대화하고 디버깅할 수 있도록 제공하는 것입니다. 따라서 COSMOS 자체만으로 경쟁에서 확실한 리드를 가져갈 수는 있겠지만 그것만이 고객의 유일한 고려 요소이자 락인 요인이라고 보기는 어렵습니다." ​ 사회자 "현재 Astera가 진출하려는 영역 중 하나가 바로 AEC입니다. 이 분야에서는 크레도가 상당히 강세를 보이고 있습니다. 마벨 역시 DSP(신호처리 칩)를 제공하지만, 직접 케이블을 만드는 건 아니고 TE Connectivity, Amphenol, Molex 같은 케이블 제조업체들에 DSP를 공급합니다. 그렇다면 케이블까지 완제품 형태로 제공하는 크레도의 풀 패키지 솔루션과 아스테라, 마벨의 접근 방식은 어떤 차이가 있을까요? ​ 마벨 출신의 반도체 17년 전문가 (전직) "차이는 최소한 두 가지 측면에서 볼 수 있습니다. 첫 번째는 공급망 관리와 공급망 소유권의 문제입니다. DSP가 탑재된 케이블을 직접 사내에서 제조하여 완제품인 AEC 형태로 공급할지, 아니면 그렇지 않을지를 두고 전략적 선택을 해야 합니다. 대부분의 네트워킹 반도체 공급업체들은 실제 케이블 제작에는 깊이 관여하지 않고 실리콘 솔루션(DSP, 리타이머 등)만 제공합니다. 이것은 결국 ROI 차원의 전략 문제입니다. 핵심 사업과 직접 관련이 크지 않은 물리 케이블 사업에 수천만 달러를 투자할 가치가 있는지, 아니면 이미 잘 알려지고 검증된 케이블 제조업체들과 파트너십을 맺는 게 나은지, 이런 부분에서 갈립니다." "두 번째는 최종 고객 관점입니다. 예를 들어 AWS 같은 경우, 그들의 소싱팀은 두 가지 방식을 병행합니다. 하나는 케이블과 DSP를 따로 구매해서, 직접 통합하여 자체 랙 환경에 맞게 최적화하는 방식. 또 다른 하나는 크레도 같은 공급업체로부터 AEC 완제품을 통째로 구매하는 방식입니다. AWS는 이런 멀티 소스 전략을 유지합니다. 어느 방식이 더 옳은지는 최종 고객의 선택 문제라 외부에서 단정하기는 어렵습니다. 다만 현재 모듈 조달 방식 자체가 이렇게 운영되고 있는 만큼, 단기간 내에 이 모델이 바뀔 가능성은 낮다고 봅니다. 따라서 앞으로도 최종 고객 측에서는 두 가지 조달 방식이 공존하는 상황이 계속될 것으로 보입니다." ​ *코멘트 → AEC는 Active Electrical Cable로 구리 케이블에 DSP나 리타이머 같은 Active한 칩을 넣어 고속 신호를 안정적으로 전달하는 케이블입니다. NIC과 스위치 연결상 점점 더 고속으로 갈수록 신호 품질 유지가 어려워져서 AEC를 필요로 하는 것입니다. 크레도가 마벨의 자리를 많이 가져갔습니다. 크레도는 턴키로 공급하는 구조이다보니 상대적으로 하이퍼스케일러들이 마벨에게 DSP를 공급받아 커넥터 제조업체들에게 위탁생산을 맡겼던 공급망 관리를 안해도 되니 그만큼 신뢰도가 높아서 많이 쓰였습니다. ​ *코멘트 → 아스테라랩스의 성장에는 AWS가 절대적입니다. 사실 크레도나 아스테라랩스나 모두 AWS가 키워주고 있는 기업에 가깝습니다. 아스테라랩스의 Aries, Scorpio P, X, Taurus까지 모두 AWS Trainium 3 차세대 랙/시스템에 채택될 예정입니다. Teton PDS, Teton Max의 All-to-All 연결에 처음으로 Scorpio X Switch가 대거 채택되고, AWS가 여전히 ConnectX-9 대신 자체 네트워킹인 EFA를 사용하고 싶어하기 때문에 Scorpio P Switch도 구매해서 Vera CPU, 자체 NVMe, Rubin GPU, AWS가 자체적으로 만든 NIC를 연결할 예정입니다. 그리고 PCle AEC로 아스테라랩스의 Taurus를 구매할 예정입니다. 크레도의 AEC 시장 중 일부를 아스테라랩스가 가져가는 셈입니다. ​ 사회자 "업계에서 보셨을 때, Astera 제품 중 어떤 것에 가장 익숙하신가요?" ​ 마벨 출신의 반도체 17년 전문가 (전직) "저라면 여전히 리타이머를 이야기할 것입니다. 제 생각에 이것이 Astera의 가장 강력한 역량이자, 시장에서의 최고 가치입니다. 나머지 제품들에 대해서는 분명히 좋은 계획을 갖고 있다고 보지만, 개인적으로는 그들이 다른 시장에서 어떻게 전개해 나가는지를 좀 더 지켜볼 것입니다. 그러나 리타이머 분야만큼은 확실합니다. Astera는 시장에 매우 이른 시점에 진입했고, 지속적으로 혁신적인 솔루션을 내놓았습니다. 또한 몇몇 에코시스템 파트너들과 긴밀한 관계를 구축했는데, 여기에는 XPU 제조업체들(CPU, GPU, DPU 등을 아우르는 범용 가속기 업체들)도 포함됩니다. 따라서 이 부분에서는 Astera가 확실히 강점을 가지고 있다고 생각합니다." ​ 사회자 "제가 이 질문을 드리는 이유는 Astera가 발표한 성장 로드맵 때문입니다. 그들은 여전히 리타이머가 사업의 큰 축이 될 것이라고 말하지만, 동시에 이제는 하이퍼스케일러 XPU 중심의 스케일업 연결 쪽으로 나아가고 있습니다. 엔비디아를 제외한 시장을 겨냥한다는 뜻입니다. 그들이 말하는 확장 솔루션이 바로 Scorpio 스위치 제품군입니다. 스케일업 네트워크용 스위치인데, 그들의 주장은 “COSMOS를 이미 알고 있다면 COSMOS로 Scorpio까지 관리할 수 있다”는 점입니다. 그래서 제 질문은, Scorpio에 대해 어떤 정보를 알고 계시며, Astera가 이 논리를 근거로 스케일업 네트워크 연결 시장에서 큰 점유율을 차지할 수 있다는 주장은 얼마나 설득력이 있다고 보십니까?" ​ 마벨 출신의 반도체 17년 전문가 (전직) "네, Scorpio는 PCIe 스위치 제품이 맞습니다. 리타이머에 비해 PCIe 스위치 시장은 좀 더 새로운 시장에 진입하는 것이라고 생각합니다. 업계 최초의 PCIe 6세대 패브릭 스위치를 소개했습니다. 다만, 스위치 쪽은 브로드컴·마벨 같은 기존 강자들과 경쟁해야 합니다. 리타이머 때와는 다릅니다. 리타이머에서는 Astera가 엔드 투 엔드 솔루션을 공급했고, 당시 마벨과 브로드컴은 DSP 칩만 하던 시절이라 Astera가 매우 일찍 시장에 들어올 수 있었습니다. 하지만 스위치 세계는 양상이 다를 수 있습니다. 브로드컴은 여전히 여러 측면에서 사실상 지배자이고, 특히 기술 우위·IP·강력한 공급망(제조·파운드리 준비도)에서 앞서 있습니다." 그래서 Astera Labs의 포커스는 범용 아키텍처를 전부 노리기보다, 특정 니즈를 겨냥하는 쪽이 더 맞을 겁니다. 즉, XPU 간 통신을 충분히 효율적으로 만들어 주는 특정 기능에 집중하는 식이죠. 여기서 말하는 XPU는 CPU일 수도, ASIC 가속기일 수도, NPU일 수도 있습니다. 이렇게 하면 스케일업 영역 전체가 아니라 그중 일부 스택에 집중할 수 있습니다. 스케일업은 매우 복잡하고 어렵습니다. 어떤 프로토콜을 쓸지(예: 이더넷인지, 기타인지)도 고려해야 하니까요. 이렇게 세분화·기능 특화 관점으로 접근하면 브로드컴·마벨의 성숙한 기존 솔루션에 비해서 다른 방향을 Astera가 어필하여 주도할 여지가 있습니다. 저도 그 변화가 어떻게 전개될지 기대하고 있습니다." "이제 첫 번째 질문으로 돌아가서, COSMOS가 Scorpio PCIe 스위치와 어떻게 잘 맞물리는가에 대해 말하자면, 우선 가능합니다. COSMOS는 복합 플랫폼이고, 그 “쉘” 자체가 표준 네트워킹 관리 도구를 포함하고 있어 링크 업/트레이닝 상태/고성능 체크 등을 수행할 수 있습니다. 이런 표준 점검 항목들은 COSMOS 상에서 Scorpio에도 당연히 적용됩니다. COSMOS는 리타이머에만 한정될 필요가 없고, 스위치, 그리고 앞으로는 메모리 컨트롤러나 케이블 모듈까지 지원할 수 있습니다. 요컨대 COSMOS는 PCIe 스위치와 호환되어야 하고, 그렇게 설계되어 있다고 봅니다." ​ 사회자 "Astera의 스위치와 Broadcom·Marvell의 스위치 간 기술적 차이는 무엇일까요? 그리고 왜 고객이 특정 벤더의 스위치를 더 선호하게 될까요?" ​ 마벨 출신의 반도체 17년 전문가 (전직) "Astera Labs가 비교적 신생 기업이니, 먼저 다른 업체들의 기술을 코멘트하겠습니다. Marvell과 Broadcom의 경우 핵심 기술적 진보는 각종 PCIe/SerDes IP에 있고, 특히 시장 수요에 맞춰 SerDes 기능을 진화시키고 있습니다. 둘 다 아마 PCIe Gen4에서 Gen5, 더 나아가 Gen6 같은 차세대 기술로 옮겨가고 있다고 봅니다. 이것이 그들의 기술적 역량이며, 이전 설계에서 얻은 교훈과 경험 역시 IP 자산입니다." "Astera에 대해 말하자면, 그들이 혁신을 해온 건 맞지만, 스위치에 관해서는 아직 잘 모르겠습니다. 특정 목적에 맞춘 기능을 넣는 대신 일부 기능을 과감히 생략하려는 것으로 보입니다. 제가 모르는 부분은 PCIe Gen6 스위치가 이전 모든 세대와 역호환되는지 여부이고, 또 스위칭 동작 시 전력 효율(power efficiency) 관련 기능을 어떻게 구현했는지도 의문입니다. 기술 측면에서 보면 Astera는 PCIe 6.0을 가장 먼저 상용화하려 하고, 고객사들(AWS, Microsoft, Meta 등)이 커스터마이즈 할 수 있도록 적극적으로 지원하는 데에 무게를 두는 듯합니다. 즉, 최종 고객과 밀착 협업해 고객의 XPU를 위해 기능을 맞춤 설계하는 역량을 또 하나의 기술적 차별점으로 삼으려는 것 같습니다." ​ 사회자 "당신 말은, 아스테라랩스가 규모가 더 작고, 고객 수도 적기 때문에, 오히려 맞춤형 역량이 더 강할 수 있다는 뜻인가요? ​ 마벨 출신의 반도체 17년 전문가 (전직) "네, 그들은 소수의 고객과 깊은 유대 관계를 맺고 있으며, 고객들에게 맞춤형 솔루션을 제공하는 데 더 유연합니다. 하이퍼스케일러의 니즈에 훨씬 더 특화된 솔루션들을 개발한다는 게 강점입니다." ​ *코멘트 → 아스테라랩스는 2Q 실적발표에서 최근 Scale-up을 위해 10개 이상의 AI 플랫폼 및 클라우드 인프라 공급업체가 고객사가 접근했다고 말했고, Scorpio X-Series 출하는 2025년 말부터 시작하여 2026년에는 대량생산을 하겠다고 말했습니다. 10개사를 생각해보면 AWS의 채택 일정이 가장 빠르고, 메타, 마이크로소프트, 구글, AMD, 인텔, 알리바바, HPE, 시스코 등이 대표적입니다. AWS는 확정인 상황이기 때문에 '여러 하이퍼스케일러와 여러 컴퓨팅 공급업체가 자사 XPU 로드맵에 통합하고 싶어한다'고 말한 것이 매우 고무적인 내용이었습니다. 실제 도입 후 출하를 생각하면 2026년의 성장은 대부분 AWS로 나오고, 2027년에 UALink 채택이 광범위하게 이뤄지며 더욱 성장할 것으로 예상합니다. ​ 사회자 "전기적 연결, 즉 구리 기반 연결이 현재 어디에 서 있고, 언제 광학(optical)이 필요해질지에 대해 조금 이야기해보죠. 지금으로서는 최소한 Blackwell 세대에서는 랙 내부의 많은 연결이 전기 방식일 것으로 보입니다. 그러나 언젠가는 광학으로 전환이 필요해질 텐데요. 언제쯤 그런 필요가 생길 것이며, 어떤 구체적인 요구사항들이 광학으로의 전환을 이끌게 될까요?" ​ 마벨 출신의 반도체 17년 전문가 (전직) "우리 모두가 공감하는 가장 큰 트렌드는 AI 시대에서 더 빠른 전송 속도, 더 나은 대역폭, 그리고 더 낮은 지연(Latency)에 대한 요구라고 생각합니다. 전환이 정확히 언제라고 정의하기는 어렵지만, 제 느낌으로는 이미 지금 일어나고 있습니다. 여기서 '모두'라고 말하는 건 이 분야의 플레이어들이며, 모두가 이를 깊이 조사하고 있다는 뜻입니다. 결국 이건 각 회사의 기술 전략과 로드맵 이해에 달려 있어서 통일된 답은 없고, 각자 자기만의 가시성을 가지고 있다고 봅니다." "몇 가지를 생각해보면, 데이터센터 안에서, 심지어 한 서버 안에서도 연결 거리가 점점 더 길어지고 있고, 거리가 길어질수록 신호는 약해지게 됩니다. 전통적인 구리선에서는 크로스토크(cross talk) 문제도 많습니다. 그리고 아마 가장 큰 요인은 전력이라고 생각합니다. 이런 전력 소비 문제는 최종 고객 입장에서 가장 중요한 고려 사항 중 하나가 되고 있고, 이는 네트워크 및 케이블 공급업체들이 광학 솔루션을 더 빨리 시장에 내놓도록 동기를 부여할 것입니다. 명확한 타임라인을 말할 수는 없지만, 최첨단 AI 훈련 클러스터가 시장에서 더 주류로 자리잡을 때쯤에는 광학 솔루션이 이미 배포되고 있을 가능성이 큽니다. 그렇다면 그 시점에서 거꾸로 추론해 언제 광학 솔루션이 시장을 장악할 수 있을지를 생각할 수 있습니다. 제 생각에는 이미 변화가 시작됐고, 본격적으로 광학 솔루션 도입이 확대되는 시점은 대부분의 전송 속도가 레인(lane)당 200Gbps를 넘어설 때일 것입니다. 이건 이미 일어나고 있고, 아마 앞으로 1~3년 안에 주류가 될 가능성이 큽니다." 아스테라랩스 CTO 출신이 입을 열다 GB200 NVL, HGX B200, AWS, Scorpio, AEC, UALink C. 리타이머 전체를 설계했던 아스테라랩스 CTO *인터뷰 날짜 : 2025-06-16* 사회자 "아마도 먼저 이 분야에서의 귀하의 배경부터 시작하는 게 좋을 것 같습니다. 관련해서 어떤 종류의 일을 해오셨는지, 그리고 아스테라랩스에서 일하셨던 경험은 물론, 크레도에 대해서는 어느 정도 익숙하신지도 궁금합니다." ​ 아스테라랩스 CTO 출신 (전직) "네, 저는 아스테라랩스에서 5년 동안 근무했습니다. 마지막 2년은 AI 네트워킹 및 인프라 영역에서 제 스타트업을 하고 있습니다. 아스테라에서는 PCIe 및 이더넷 리타이머, 메모리 컨트롤러 제품, 그리고 PCIe 스위치 아키텍처 설계를 담당했습니다. 리타이머 분야에서는 사실상 전체 설계가 제 몫이었고, 아키텍처부터 모든 부분을 제가 주도했습니다. 그래서 리타이머 시장에는 매우 익숙합니다. 크레도에 대해서는 제가 그들과 직접 함께 일한 적은 없습니다. 다만 과거 다른 회사에서 크레도의 SerDes를 사용한 적이 있습니다. 저는 그들의 제품과 적어도 고객군에 대해서는 잘 알고 있습니다. 아스테라와 크레도는 비슷한 고객들과 소통하기 때문입니다. 고객 프로필과 시장 역학에 대해서는 잘 알고 있지만, 그들이 정확히 몇 개를 판매했는지 매출 규모가 얼마인지 같은 수치는 말씀드릴 수 없습니다. 하지만 칩 아키텍처나 시장 구조에 대해서는 말씀드릴 수 있습니다." ​ 사회자 "그렇다면 미국이나 중국 외 지역, 혹은 서유럽에서 아스테라랩스나 크레도와 유사한 리타이머나 이와 비슷한 칩을 설계하는 다른 기업들이 있나요?" ​ 아스테라랩스 CTO 출신 (전직) "네, 마벨과 브로드컴도 리타이머를 보유하고 있습니다. 마벨은 규모가 꽤 괜찮은 편입니다. 브로드컴은 SerDes 기술이 뛰어나긴 하지만, 리타이머 시장에서는 그렇게 큰 비중을 차지하지는 않는다고 생각합니다. 과거에는 참여했지만 지금은 그렇지 않습니다. 그래서 정리하자면, 리타이머 시장의 주요 플레이어는 아스테라랩스, 크레도, 그리고 어느 정도 마벨 정도라고 할 수 있습니다." ​ 사회자 "언제부터 데이터센터에 리타이머/AEC가 광범위하게 채택되기 시작했던 거죠?" ​ 아스테라랩스 CTO 출신 (전직) "맞습니다. 레인당 50Gbps 속도, 즉 PAM4 신호로 넘어가면서, 일반 수동 구리선으로는 2.5m~3m 거리를 달성하지 못하게 되었고, 그래서 AEC이 등장하게 됐습니다. 보통은 레인 4개 × 50Gbps, 즉 200GbE NIC에서 ToR(Top-of-Rack) 스위치로 연결하는 구성이 일반적입니다. 경우에 따라서는 25Gbps × 4 = 100GbE 구성이 쓰이기도 했는데, 예컨대 AWS에서는 그 방식이 사용된 걸로 압니다." "그러나 일반적으로는 레인당 50Gbps 이상일 때 3m 거리를 달성하기 위해 AEC가 필요합니다. NIC이 200GbE(50Gbps × 4)로 전환되었을 때 신호 문제가 발생하기 시작했고, 그래서 AEC가 도입되었습니다. 이것이 시작점이었고, 그 이후 NIC이 400GbE, 지금은 800GbE와 1.6TbE로 발전하면서 네트워킹에서 AEC의 활용은 더 보편화되었습니다. 다만 언젠가는 AEC가 광학에 자리를 내어줄 것이고, 그것은 순수 AEC 시장이 아닌 또 다른 시장으로 넘어가는 흐름일 것입니다." ​ 사회자 "말씀하신 대로라면, DAC(Direct Attach Copper)도 리타이머를 사용하는 게 맞나요?" ​ 아스테라랩스 CTO 출신 (전직) "아닙니다. 구리 케이블에는 Active와 Passive가 있습니다. 패시브 구리 케이블은 리타이머 같은 능동형 부품을 전혀 사용하지 않고 단순히 구리선을 연결하는 방식입니다. 과거에는 잘 작동했지만, 지금처럼 속도가 빨라진 상황에서는 더 이상 통하지 않기 때문에 케이블 안에 능동형 부품(리타이머, DSP)을 넣어야 합니다." ​ 사회자 "알겠습니다. 말씀하신 50Gbps × 4에서 처음으로 필요성이 보였다고 하신 건, AEC를 말씀하신 거죠?" ​ 아스테라랩스 CTO 출신 (전직) "네, 맞습니다." ​ ​ 사회자 "좋습니다. 확인만 하고 싶었습니다. 그렇다면 크레도와 아스테라랩스는 어떻게 해서 각각 AEC와 리타이머 시장의 핵심 플레이어가 될 수 있었을까요? 말씀하신 대로 마벨과 브로드컴도 이 시장에 있기는 합니다. 물론 그들은 다른 일들도 많이 하고 있죠. 그렇다면 크레도와 아스테라는 어떻게 해서 사실상 이 시장의 핵심 기업이 될 수 있었을까요?" ​ 아스테라랩스 CTO 출신 (전직) "맞습니다. 크레도는 오랫동안 이더넷 SerDes를 보유해왔습니다. 네트워크 스위치 AEC 개발업체, NIC 개발업체 등에게 이를 IP 형태로 판매하는 것이 초기 비즈니스 모델이었죠. 그런데 속도가 빨라지고, 잡음과 오류가 늘어나자 하이퍼스케일러들이 해결책을 찾기 시작했습니다. 그때 나온 요구가 바로, '리타이머를 할 수는 없는가?' 였습니다. 리타이머 자체는 새로운 개념이 아닙니다. 저도 시스코에서 근무할 때 백플레인(backplane) 신호 품질을 맞추기 위해 리타이머를 적용하려고 시도했었습니다. 당시에는 낮은 속도에서도 그런 시도가 있었지만 활용 범위는 제한적이었습니다. 그때는 리타이머를 케이블이 아니라 스위치 메인보드에 장착했죠. 대부분 백플레인으로 가는 연결이었기 때문에 메인보드에 넣는 방식이었습니다." 그러다가 '메인보드가 아니라 케이블 안에 넣어 플러그형 모듈로 만들면 어떨까?'하는 아이디어가 나왔습니다. 서버마다 모두 AEC 케이블이 필요한 게 아니라는 점에서 설득력이 있었습니다. 일부 서버는 ToR 스위치와 가까워서 패시브 케이블로도 충분하니까요. 모든 NIC·스위치에 리타이머를 탑재하면 비용과 전력이 낭비됩니다. 필요할 때만 AEC에 리타이머를 넣고, 아닐 땐 패시브를 쓰는 방식이 최적이라는 겁니다. 이 개념이 자리잡으면서 하이퍼스케일러들이 이 문제를 체감했고, 크레도가 리타이머를 내놓으며 시장에 뛰어들었습니다. 이후 마벨이 Inphi를 인수하면서 관련 칩을 확보했지만 광학 쪽 사업을 의식해 적극적으로 AEC 쪽을 밀지는 않았습니다." "반면 아스테라랩스는 AWS의 요청으로 뛰어들었습니다. AWS가 'Credo가 하고 있는데, 우리는 세컨드 소스를 원한다. 이미 PCIe 리타이머를 했으니 이더넷 리타이머도 해달라' 고 요구했고, 아스테라는 이를 수용해 제품을 만들었습니다. 여기서 차이가 있었는데, 크레도는 케이블 전체(패들 카드 + 칩 + 케이블)를 판매한 반면, 아스테라는 패들 카드만 공급하고 케이블은 고객이 원하는 벤더를 선택할 수 있도록 제안했습니다. 이는 하이퍼스케일러 입장에서 비용 절감 효과가 있었죠. 이후 크레도도 유사한 방식을 취했습니다." "정리하면, 크레도는 SerDes를 기반으로 리타이머를 케이블에 넣어 시장에 먼저 진입했고, 아스테라는 AWS의 세컨드 소스 요구로 시장에 들어왔습니다. 마벨은 칩은 있었지만 광학을 의식해 뒤늦게 참여했습니다. 현재 크레도가 AEC 시장 최대 플레이어이며, 아스테라는 아직 400GbE·800GbE 제품을 발표하지 않았지만 곧 내놓을 것이고, 이는 크레도의 점유율에 영향을 줄 수도 있습니다." ​ *코멘트 → 이전 Trainium 2 당시 서버/랙에도 아스테라랩스의 AEC 패들 카드(Paddle Card)와 Aries Smart Cable이 쓰이고 있었습니다. Aries PCle 5.0 리타이머도 마찬가지입니다. ​ 사회자 "그렇다면 하이퍼스케일러들이 크레도와 아스테라랩스에게 리타이머를 만들어달라고 요청한 시점은 언제쯤입니까? 2018년, 2019년쯤인가요, 아니면 그보다 더 이른 시점인가요?" ​ 아스테라랩스 CTO 출신 (전직) "제가 아스테라랩스의 이야기를 말씀드릴 수 있습니다. 2019년에 리타이머를 만들어달라는 요청을 받았습니다. 그때 우리는 '이걸 해야 할까, 아니면 그냥 칩만 팔까?'를 두고 논의했죠. 2020년이 되자 칩은 정상적으로 동작하기 시작했습니다. 다만 패들 카드와 케이블 테스트, 그리고 하드웨어 안정화까지는 시간이 오래 걸렸습니다. 그 시점에는 크레도가 이미 시장에 진입해 있었고, 케이블까지 완비한 상태였습니다. 그래서 2020년 말~2021년 초가 본격적으로 시장이 움직이기 시작한 시점이라고 할 수 있습니다." "그때 서버 업체들이 대부분 50Gbps SerDes를 채택했고, NIC들도 50Gbps SerDes와 200Gbps 업링크로 전환하기 시작했기 때문입니다. 따라서 대략 2020~2021년에 시장이 본격적으로 성장하기 시작했다고 말할 수 있습니다. 다만 전환에는 시간이 걸렸습니다. 200Gbps로 전환하기까지는 NIC, 케이블, 서버 등 생태계 전체가 변해야 했기 때문에 몇 년이 걸렸습니다. 제 생각에 크레도는 2020년 말부터 출하를 시작했고, 2021~2022년에 본격적으로 확대되었습니다. 그게 제가 보는 타임라인입니다." ​ 사회자 "GPU가 본격적으로 중요한 요소가 된 건 2022년 중반~후반부터였죠. 그 전까지는 주로 CPU 중심으로 운영되던 데이터센터에 대해서 말씀하시는 게 맞나요?" ​ 아스테라랩스 CTO 출신 (전직) "맞습니다. 그 전까지는 말씀하신 그대로였습니다. 2022년 말에 ChatGPT가 발표되긴 했지만, 실제로 업계 전체가 본격적으로 움직이기 시작한 건 2023년 중반이었습니다. 이때 아스테라랩스를 포함해 일부 기업들이 주문을 받기 시작했는데, 이는 PCIe 쪽이었습니다. 동시에 업계는 더 빠른 네트워크 연결이 필요하다는 사실을 깨달았지만, 따라잡는 데에는 시간이 걸렸습니다. 엔비디아는 원하는 대로 밀어붙일 수 있지만, 나머지 업계는 이를 따라가는 데 시간이 필요했습니다. 말씀하신 대로 2023년 말쯤에는 일부 NIC들이 400GbE로 넘어가기 시작했습니다." ​ 사회자 "현재를 보면 적어도 하이엔드 데이터센터는 GPU 중심으로 움직이고 있으며, 모든 CAPEX가 이른바 GPU 팜과 클러스터를 구축하는 데 투입되고 있습니다. 사용 사례 관점에서 볼 때, 리타이머의 활용은 2023년 이전과 비교했을 때 AI 클러스터나 AI 데이터센터에서 어떤 점이 다릅니까?" ​ 아스테라랩스 CTO 출신 (전직) "엔비디아 GB200 NVL72 등 최상위 AI 클러스터는 NIC를 GPU 보드 쪽으로 끌어올려 붙입니다. 기술적으로 이들의 SerDes가 조금 더 강력하고, 공장 출하 기준도 새로운 스탠더드여서 리타이머 없이 3~4m를 쉽게 구동할 수 있습니다. GPU마다 NIC가 필요하다는 전제를 깔면, NVL72의 GPU들을 ToR 이더넷 스위치에 연결해야 합니다. 이때 AEC가 필요할까요? 엔비디아가 내부적으로 어떻게 연결하는지는 모르겠지만, AWS나 다른 환경에서 제가 다른 스위치를 쓴다면 저는 확실히 AEC 케이블을 씁니다." 여기서의 문제는 800GbE AEC 케이블이 필요하다는 점입니다. 현재로선 크레도가 주요 공급사이고, 마벨도 공급한다고 발표했습니다. 아스테라는 아직 800GbE에는 도달하지 못한 것 같습니다. 아마 올해 말쯤 800 GbE 솔루션을 내놓을 수 있겠지요. 엔비디아가 이 구성을 공식 지원하든 아니든, 기술적으로 제가 엔비디아 랙을 사서 제 네트워킹 스위치에 물린다면 저는 안정성을 위해 AEC 케이블을 쓸 겁니다. 엔비디아는 자체 SerDes로 밀어붙일 수 있어 3~4m에서 리테일 AEC 케이블이 필요 없을 수도 있지만, 저는 회의적입니다. 제 생각에는 관리 단순화와 오류 특성 감소를 위해 모든 엔비디아 랙은 ToR 스위치까지 AEC 케이블을 거치는 게 좋습니다." ​ 사회자 "업계 일부에서는 엔비디아가 Blackwell 발표에서 아스테라의 리타이머를 사용하지 않았다는 점을 지적했습니다. 앞서 말씀하신 내용에서도 그 점을 언급하셨습니다. 반면 Hopper 세대에서는 아스테라 리타이머를 사용했다고 이해하고 있습니다. 그렇다면 Blackwell에서 처음 리타이머를 쓰지 않은 이유는 말씀하신대로, 리타이머 없이도 4m까지 신호를 전달할 수 있는 설계 때문인가요?" ​ 아스테라랩스 CTO 출신 (전직) "우리가 지금까지 이야기한 건 AEC 케이블에 관한 것이었고, 엔비디아와 아스테라의 관계는 주로 PCIe 리타이머 쪽입니다. Hopper 시나리오에서는 대부분 기존 아키텍처가 8개의 GPU로 구성된 DGX 박스나 HGX 박스였습니다. 엔비디아가 제공하는 GPU 서버에는 8개의 GPU가 들어 있고, 이들 사이에는 스위치가 있으며, CPU와 NIC은 별도의 플러그형 모듈로 연결됩니다. 그렇다면 이 NIC들을 GPU와 어떻게 연결할까요? HGX나 DGX 박스에서는 GPU마다 프론트엔드 NIC가 하나씩 붙어 있어서, 8개의 GPU에는 8개의 NIC가 필요합니다. 그리고 GPU는 CPU와도 연결되어야 합니다. GPU-CPU, GPU-NIC 연결은 PCIe Gen5를 통해 이루어졌고, 여기서 리타이머가 필요했습니다." "이때 아스테라 PCIe 리타이머가 사용되어 NIC과 CPU에 도달할 수 있었던 겁니다. 또한 NIC도 CPU와 연결되어야 했기에, PCIe 연결을 위해 수많은 리타이머가 투입되었습니다. 하지만 NVL72 랙에서는 NIC을 별도 카드에 두는 대신 GPU에 아주 가깝게 배치했습니다. 즉, NIC을 GPU와 같은 마더보드 위에 올려놓은 거죠. 이렇게 되니 PCIe 리타이머가 필요 없어졌습니다. 두 번째로, Grace Blackwell 칩에서 ARM CPU를 GPU 두 개 옆에 붙여버렸습니다. 이로써 GPU-CPU 연결, NIC-CPU 연결에서도 리타이머가 사라졌습니다. 사실상 PCIe 리타이머를 모두 제거한 셈입니다. 아스테라 입장에서는 좋지 않은 일이지만, NVL72는 엔비디아의 폐쇄형 시스템이니 그들 마음대로 할 수 있는 부분입니다." "앞으로도 여전히 B200 기반 DGX, HGX 박스는 존재합니다. 많은 하이퍼스케일러들이 NVL72 랙을 사기도 하지만, 여전히 8 GPU 박스(DGX, HGX)도 많이 구매합니다. 이 아키텍처에서는 리타이머가 다시 필요합니다. 이번에는 PCIe Gen6 리타이머가 되겠죠. 따라서 아스테라는 여전히 하이퍼스케일러를 대상으로 시장을 유지하거나 성장할 수 있습니다. 제가 알기로는 2H25부터 고객사에 B200 칩이 탑재된 DGX, HGX 박스가 공급될 예정입니다. 1H25에는 NVL72 랙으로 공급이 집중되지만요. 엔비디아가 하이퍼스케일러들에게 B200 칩 기반 8 GPU 박스를 약속했다는 얘기를 들었습니다. 이것이 바로 PCIe 측면 이야기입니다." "이더넷 측면에서는, 말씀드린 대로, NIC을 GPU 가까이에 배치하면서, 카드 앞단에 있던 것보다 거리가 조금 늘어나긴 했지만, 엔비디아는 자사 SerDes가 리타이머 없이도 ToR 스위치까지 3m 연결을 충족한다고 주장합니다. 그래서 AEC 케이블을 권장하지 않는 입장입니다. 따라서 NVL72를 Spectrum-X 스위치와 함께 쓰는 고객은 AEC 케이블 없이도 갈 수 있습니다. 하지만 제가 설계자라면, 유연성을 위해 한쪽 끝 또는 일부 구간에는 AEC를 넣을 것 같습니다. GPU 랙에서 ToR 스위치까지의 거리, 설계에 따라 선택적으로 AEC 케이블을 쓰는 게 더 안전하기 때문입니다. 일부 고객들은 오류를 줄이거나, 엔비디아 스위치가 아닌 브로드컴 같은 다른 회사의 스위치를 연결할 경우 모든 연결에 AEC를 넣는 선택을 할 수도 있습니다. 비용이 조금 더 들더라도 문제를 줄이는 게 낫기 때문입니다. 게다가 AEC는 엔비디아가 아닌 다른 벤더로부터도 살 수 있어서 비용을 낮출 수 있고, 그만큼 리스크를 줄일 수 있습니다. 따라서 NVL72를 쓰더라도 다른 이더넷 스위치에 연결한다면 AEC는 여전히 구매할 수밖에 없을 겁니다." ​ ​ 사회자 "추가로 몇 가지 질문이 있습니다. 먼저, 방금 브로드컴 스위치 대신 엔비디아 스위치를 산다고 말씀하셨는데요. 엔비디아도 스위치를 판매하나요?" ​ 아스테라랩스 CTO 출신 (전직) "맞습니다. 엔비디아는 Spectrum-X 이더넷 스위치를 보유하고 있습니다." ​ 사회자 "두 번째로 확인하고 싶은 건 PCIe Gen5와 Gen6의 차이입니다. 핵심적인 차이는 무엇인가요?" ​ 아스테라랩스 CTO 출신 (전직) "PCle Gen 5는 Lane당 32GT/s → Gen 6는 Lane당 64GT/s → Gen 7은 128GT/s입니다. 5에서 6으로 바뀌면서 속도는 32GT에서 64GT로 두 배 빨라집니다. 그리고 프로토콜 패킷 형식도 완전히 바뀌었습니다. PCIe Gen5까지는 4,000바이트 같은 큰 패킷을 보낼 수도 있었지만, 실제로는 그렇게 쓰지 않고 대부분 최대 256바이트 패킷을 보냈습니다. Gen6에서는 FLIT 기반(fixed-length transaction) 모드로 전환되었고, 패킷 포맷도 바뀌었습니다. PCI-SIG 측 설명으로는 효율성이 조금 더 좋아지고 에러 정정 코드(ECC)도 개선되었다고 합니다. 하지만 이건 프로토콜 차원의 low-level 구현일 뿐이고, 실제로 체감되는 가장 큰 차이는 속도 증가와, 대형 패킷 대신 고정 길이 패킷을 쓰는 방식이라는 점입니다. 그 외 Gen5와 Gen6 사이에 큰 차이는 없습니다. 일부 forwarding mode가 추가되었지만, 스위치를 쓰지 않는 시나리오에서는 거의 무용지물입니다. 예를 들어 NIC-CPU, NIC-GPU 직접 연결에서는 스위치가 필요 없으므로 포워딩 모드는 별 의미가 없습니다." ​ 사회자 "일부 하이퍼스케일러들이 GB200만 사용하는 대신 B200 기반의 DGX 구성을 여전히 원할 수 있다고 말씀하셨습니다. 그 이유는 그들이 자체 전문성을 가지고 있어서 워크로드에 맞게 환경을 최적화하려는 것 때문인가요, 아니면 다른 이유가 있을까요?" ​ 아스테라랩스 CTO 출신 (전직) "아닙니다. 이것은 워크로드와는 관련이 없습니다. 첫 번째로 가장 큰 문제는, GB200 GPU를 사용할 때마다 엔비디아의 Grace CPU을 함께 사야 하는 구조라는 점입니다. 첫째, 그 CPU 성능이 충분히 강력하지 않다는 점입니다. 둘째, GPU 두 개마다 CPU 하나 값의 프리미엄을 얹어야 하고, 큰 패키지와 여러 복잡성이 따라온다는 점입니다." "두 번째 문제는, 하이퍼스케일러들이 GPU 자체보다는 인프라 관리 툴을 중심으로 운영 체계를 맞춰왔다는 점입니다. 지금까지는 x86(인텔 또는 AMD) 기반 시스템 위에서 관리 툴이 모두 구축되어 있었습니다. 그런데 이제 ARM CPU가 붙으면서, 기존 툴을 전부 포팅해야 합니다. 또, GPU 두 개당 ARM CPU 하나가 붙는 구조라 인스턴스 관리가 복잡해지고, 이중화나 CPU 연결 방식에도 변화가 필요합니다. 결국 하이퍼스케일러들은 시스템을 어떻게 관리할지, 부품 장애를 어떻게 진단할지, 그리고 데이터센터 수준에서 스케줄링·워크로드 분산을 어떻게 유지할지 등 많은 문제에 직면합니다. 이 모든 부분을 새로 손대고 싶지 않은 겁니다." "또 다른 이유는 이미 H100 세대에서 사용해온 DGX 시스템 설계와 운영 경험이 있다는 점입니다. 이미 검증된 아키텍처와 툴 체인을 갖추고 있기 때문에, 단순히 더 강력한 GPU(B200)를 넣고 냉각만 보강하면 됩니다. 그래서 현재로서는 그 모델을 선호하는 겁니다." ​ *코멘트 → 왼쪽이 GB200 NVL72이고, 오른쪽이 HGX B200입니다. 엔비디아의 CPU, GPU, NVLink 등 컴퓨팅 및 네트워킹 부품을 모두 넣은 랙 자체를 제품으로 구매하는 것이 NVL72이고, HGX B200은 GPU 칩만 구매하는 것입니다. ​ 사회자 "또 다른 질문인데요, 엔비디아가 Hopper 세대에서 리타이머 벤더를 선택할 때, 왜 마벨이나 크레도가 아니라 아스테라랩스가 선택된 건가요?" ​ 아스테라랩스 CTO 출신 (전직) "당시 마벨이나 브로드컴에는 PCIe 리타이머가 없었습니다. 아스테라만이 다양한 환경, 다양한 박스, 다양한 시스템, 다양한 프로세스에서 제대로 동작하는 칩을 가진 유일한 업체였습니다. 엔비디아 입장에서는 벤더 호환성 매트릭스가 굉장히 방대했는데, 아스테라는 지난 5년간 수많은 시스템에서 검증을 거쳐 안정성을 입증했습니다. 마벨은 그 당시 리타이머가 없었고, 최근 1년 전에야 진입했습니다. 이전에도 두 차례 시도했지만 완전히 실패했습니다. 브로드컴은 2024년에 Gen5·Gen6 리타이머를 발표했지만, 고객사 환경에서 문제가 많았고 특히 SerDes에서 이슈가 발생했습니다. 결국 PCIe SerDes를 다시 설계해야 했고, 디버깅용 케이블을 많이 붙여야 하는 등 미완성 상태였습니다." "반면, 그 시점에 엔비디아는 아스테라 리타이머를 검증 완료했기 때문에 그대로 사용했습니다. 엔비디아 입장에서는 이미 검증된 벤더를 두고 새로운 벤더를 다시 검증하는 건 아무 의미가 없습니다. 리타이머를 실제 시스템에서 안정적으로 동작하게 만드는 것은 엄청난 고생입니다. 디버깅, 튜닝, 펌웨어 변경 등 손이 많이 갑니다. 비록 엔비디아 보드는 거의 동일하다 해도, 반대편에 붙는 장치가 AWS NIC일 수도 있고, 브로드컴 NIC, 인텔 CPU, AMD CPU일 수도 있습니다. 시스템과 부품마다 특성이 다르니, 이를 전부 통과시키려면 엄청난 검증 시간이 필요합니다. 한 번 이 과정을 통과해 아스테라 제품이 안정적으로 돌아가고 수많은 시스템에 납품이 되었다면, 굳이 다시 새 벤더를 검증할 이유가 없습니다." "또 다른 이유는 비용 구조입니다. 리타이머 칩은 GPU 가격 대비 매우 저렴합니다. GPU 한 개가 $35,000인데, 리타이머는 개당 $30~40 수준입니다. 엔비디아는 이 비용을 고객에게 전가하고, 프리미엄까지 붙여서 판매합니다. 아스테라가 $30 리타이머를 $100에 판다고 해도, 엔비디아 입장에서는 문제 없습니다. 다른 벤더를 검증해 몇백 달러 절약할 이유가 없습니다. 오히려, 엔비디아는 고객에게 '이 리타이머를 쓰라'고 강제합니다. 다른 벤더 제품을 써서 문제가 생기면 고객 책임이기 때문입니다." "결국 지금까지의 시스템에는 모두 아스테라 리타이머가 들어갑니다. 메타, AWS, 마이크로소프트가 자체적으로 DGX 박스를 만든 경우에도 아스테라 리타이머가 사용되었습니다. 시스템당 $100~200 절약하려다가 전체 시스템이 꼬이면 막대한 피해가 발생하기 때문에, 굳이 위험을 감수하지 않습니다. 이게 아스테라가 누리는 해자입니다. 물론, 혹시 모를 상황에 대비해 백업 플랜 차원에서 마벨이나 브로드컴 리타이머를 테스트해두고 있을 가능성은 있습니다. 만약 아스테라가 큰 문제를 일으킨다면, 빠르게 교체하기 위해서입니다. 하지만 지금까지는 그런 얘기를 들은 적이 없습니다." ​ 사회자 "제가 들은 또 다른 얘기인데, 크레도는 자체 SerDes IP를 보유하고 있고, 아스테라는 시놉시스(Synopsys)로부터 SerDes IP를 라이선스받아 사용한다고 알고 있습니다. 이것이 경쟁력이나 고객 평가에 영향을 미치는 요소일까요? 아니면 큰 문제가 되지 않을까요?" ​ 아스테라랩스 CTO 출신 (전직) "리타이머 관점에서 보면, SerDes 자체 개발 여부는 큰 문제가 아닙니다. 애초에 SerDes 개발은 매우 힘든 과정이고, 여러 차례 테스트 칩을 제작해 동작을 검증해야 합니다. 단일 칩만 갖고는 그 비용을 상쇄하기 어렵습니다. 아스테라가 시놉시스로부터 SerDes를 라이선스하는 데 수백만 달러 정도 들었을 겁니다. 하지만 판매당 로열티는 없는 것으로 알고 있고 그 비용은 무시할 만한 수준입니다." "문제는, 만약 SerDes에서 이슈가 생기면 전체 칩을 다시 제작해야 하는 상황이 생길 수 있다는 점입니다. 실제로 과거에 시놉시스 SerDes 때문에 아스테라가 리타이머를 re-spin한 적이 있습니다. 아스테라 로직에는 문제가 없었지만, 대규모 실환경 테스트에서 문제가 발견된 거죠. 펌웨어 수정으로 해결 가능한 경우도 있었지만, 그렇지 않은 경우 칩을 통째로 다시 제작해야 했습니다. 사실 이건 크레도든 자체 개발 기업이든 마찬가지입니다. 소규모 테스트에서는 발견되지 않던 문제가, 실제로 리타이머 같은 제품에서는 32개의 SerDes를 사용하고 수천 개 칩이 다양한 환경에서 동작하다 보니 나타나는 경우가 있습니다." "시놉시스를 사용하는 장점은, 동일한 SerDes가 여러 고객사에서 쓰이기 때문에 다른 곳에서 발견한 문제를 공유받아 해결할 수 있다는 점입니다. 반대로 크레도는 자기 제품에서만 배운다는 한계가 있습니다. 이더넷 SerDes는 예전에 크레도가 외부 라이선스를 하기도 했지만, PCIe SerDes는 그렇지 않았습니다. 따라서 학습 곡선에서 Credo가 단독으로 겪어야 하는 부분이 있죠." "물론, 자체 개발의 장점도 있습니다. 크레도처럼 자체 개발이면 문제가 발생했을 때 내부 지식으로 빠르게 대응할 수 있습니다. 아스테라는 시놉시스에 문제를 제기해야 하고, 그 과정에서 '이 데이터를 달라', '이 실험을 해봐라' 같은 요청을 받아 대응이 느려질 수 있습니다. 이 점은 크레도의 장점입니다." "아스테라 입장에서, 단일 제품에 SerDes를 자체 개발하는 건 리스크가 크지만, 이제는 제품군이 많아졌으니 자체 SerDes 개발로 얻을 수 있는 이점이 커졌습니다. 리타이머, 스위치 등 여러 제품에 같은 SerDes를 활용할 수 있으니 내부 지식 축적도 빨라지고 디버깅도 용이해집니다. 실제로 아스테라는 마벨, 브로드컴 출신 인재들을 영입해 SerDes 개발팀을 꾸렸습니다. 그래도 제대로 된 SerDes를 만들려면 1~1.5년은 걸리고, 여러 차례 제작-테스트-수정 사이클을 거쳐야 합니다." "비용 면에서는, 자체 개발과 라이선스의 차이가 수 센트에서 1달러 수준이라 사실상 미미합니다. 다만 크레도는 특정 고객 용도에 최적화해 저전력 설계를 할 수 있는 장점이 있습니다. 반면 시놉시스 SerDes는 다양한 고객을 만족시켜야 하므로 필요 이상의 모드와 기능이 들어가고, 이는 칩 면적 증가나 약간의 전력 손실로 이어질 수 있습니다. 결국, SerDes를 자체 개발하면 고객 맞춤형 최적화가 가능하고, 크레도는 2008년부터 쌓아온 경험이 있습니다. 반면 아스테라는 이제 시작 단계라 시간이 필요합니다. 아무리 마벨이나 브로드컴 출신 인재를 데려와도, 실전에서 반복 테스트와 수정 과정을 겪으며 노하우를 쌓아야 합니다." "고객 입장에서 중요한 건 단 하나입니다. 칩이 모든 환경에서 문제없이 잘 동작하는가. SerDes가 시놉시스 것이든, 자체 개발이든 중요하지 않습니다. 전력 효율이 개선된다면 관심을 가질 수 있겠지만, 나머지는 신경 쓰지 않습니다. 따라서 크레도가 자체 SerDes로 최적화를 할 수 있는 장점이 있는 건 사실이지만, 시놉시스를 쓰는 것도 다른 고객 경험 공유라는 장점이 있습니다." ​ 사회자 "지금까지 공개된 자료를 보면, 아스테라의 주요 고객은 아마존과 엔비디아 두 곳이었습니다. 그런데 말씀하신 대로 Blackwell 관련 구조를 고려하면 엔비디아향 매출은 줄어들 가능성이 있습니다. 아마존은 자체 Trainium 모듈에서 아스테라 제품을 쓰고 있습니다. 그리고 구글이나 메타처럼 자체 ASIC 칩을 개발하는 하이퍼스케일러들도 아스테라 제품을 사용할 수 있을 것입니다. 저는 아스테라의 다변화 전망이 궁금합니다. 아마존은 아스테라에 일정 물량을 구매하는 조건으로 지분을 취득할 수 있는 파트너십을 맺고 있습니다. 크레도도 마찬가지로 마이크로소프트, 아마존 의존도가 큽니다. 문제는, 미래에도 결국 고객사가 이 소수의 하이퍼스케일러로 고정되고, 아스테라와 크레도가 그 고객들을 두고 경쟁만 하게 되는 구조일까요? 그렇다면 어떻게 경쟁에서 이길 수 있으며, 이런 구조가 가격에 어떤 영향을 미칠까요?" ​ 아스테라랩스 CTO 출신 (전직) "PCIe 리타이머부터 얘기를 시작해 보죠. 아스테라의 경우 NVL72 랙에서는 리타이머 채택 비중이 줄어들 수밖에 없습니다. 하지만 고객들이 B200 기반 DGX로 이동하면 그 수요는 유지됩니다. 게다가 B200은 Gen6 리타이머가 필요하기 때문에 단가가 높아져 아스테라가 오히려 약간 더 수익을 낼 수도 있습니다. NVL72에서는 매출이 줄어들 수 있겠지만요." "두 번째로, AWS는 Trainium을 적극적으로 밀고 있습니다. 아스테라가 점유율을 더 가져온다기보다 AWS 자체의 TAM이 커지면서 아스테라 매출이 늘어날 것으로 보입니다. 그리고 메타와 마이크로소프트도 자체 XPU를 개발하고 있는데 볼륨이 아주 크지는 않겠지만 CPU와 연결되는 PCIe 구간에서는 리타이머가 필요합니다. 따라서 신규 시스템이 도입될 때마다 아스테라가 점유율을 가져갈 수 있는 '그린필드 기회'가 생깁니다. 물론 여기서 크레도나 마벨, 브로드컴도 기회를 노릴 수 있겠지만, 결국 주요 벤더로는 아스테라가 자리잡을 가능성이 큽니다." "PCIe 영역에서 아스테라의 진짜 성장 기회는 스위치입니다. AWS가 소형 PCIe 스위치를 사용하면서 아스테라에 의미 있는 매출을 주고 있고, 향후 대형 PCIe 스위치를 내놓으면 매출 비중이 더 커질 겁니다. 지금은 Scorpio P 스위치 매출이 전체의 약 10% 수준이지만, 향후 몇 년간 점진적으로 늘어날 것입니다. 또, PCIe 기반의 광학 케이블과 AEC에서도 성장 여력이 있습니다. AWS가 이를 테스트 중이거나 이미 쓰고 있다는 점에서 매출 기회가 있습니다." "더 큰 기회는 400GbE, 800GbE AEC 시장입니다. 지금은 크레도가 AWS와 마이크로소프트에서 독점하다시피 하고 있지만, 아스테라가 100Gbps/lane급 AEC를 출시하면 크레도의 점유율을 잠식할 수 있습니다. 제가 들은 바로는 아스테라가 이미 소프트웨어 이슈는 해결했고, 100Gbps SerDes만 검증되면 바로 제품을 내놓을 수 있습니다. 이 시장은 빠르게 성장 중이기 때문에, 크레도와 아스테라 모두 성장할 수 있지만, 크레도의 독점 구조는 깨질 수 있습니다." "향후 아스테라의 더 큰 베팅은 UALink입니다. AWS가 UALink를 주도하고 있고, 아스테라는 UALink 스위치와 리타이머 개발을 시작했습니다. 만약 UALink가 NVLink의 대안으로 업계에서 채택된다면, 2027년 무렵 아스테라의 주요 매출원이 될 수도 있습니다. AWS는 아스테라에 표준 이상으로 특화된 기능 구현을 요구할 수 있고, 아스테라가 이를 제공할 수 있다면 초기 채택에서 우위를 점할 수 있습니다." "반면, 크레도는 점차 광학 쪽으로 이동하고 있습니다. 메타는 이미 1.6TbE 속도 이상에서는 AEC가 아니라 광학으로 전환하겠다고 방향을 잡고 있습니다. 크레도는 광학 DSP와 광학 모듈 포트폴리오를 보유하고 있어 전환기에 유리합니다. 현재 마벨의 광학은 AEC 대비 가격이 2~3배로 비싸지만, 만약 크레도가 가격을 낮출 수 있다면 빠른 채택이 가능할 겁니다. 물론 전력은 더 쓰고 오류 가능성도 높지만, 비용 구조상 충분히 매력적입니다." "결국 단기적으로는 크레도가 고속 AEC 시장에서 우위를 지키고, 아스테라는 UALink 및 PCIe 스위치/리타이머 확장으로 성장 기회를 잡는 그림입니다."