26-10 HBM4 적층 수와 메모리 수요 관련 보도
작성자의 핵심 판단
이 자료는 HBM 적층 수 축소와 메모리 수요 둔화 우려의 근거가 제한적이라는 문제의식을 제시한다.
근거 보기 2
- 원문 구간 1
즉, 저는 이 응답을 통해 무언가를 배웠다는 뜻 이죠. 다음 단계 를 진행할 텐데, 이때 로컬 DRAM 이나 다른 CPU의 DRAM, 혹은 SSD 나 HDD 등 어딘가에서 컨텍스트를 가져와야 할 필요 가 있습니다. 이제는 엄청난 규모의 오케스트레이션도 이루어져야 합니다. 설계 방식이 상당히 크게 변하고 있는데, 가속기 컴퓨팅에 대한 수요는 증가 하는 반면 CPU, 네트워킹, 스토리지, 즉 기존 데이터 센터 CPU 등에 대한 수요도 폭발적으로 늘고 있습니다. >> 그렇다면 GPU 랙 옆에 CPU를 더 많이 배치 한다는 뜻 인가요? >> 네, GPU 나 TPU 랙의 경우가 그렇습니다. 이것이 최적화와 전문화 라는 문제로 돌아가는 핵심 질문 입니다. CPU 랙을 GPU 나 TPU 옆에 많이 배치 하기 시작 하면, CPU 랙과 비교 했을 때 TPU 랙이 요구 하는 밀도와 네트워크 요건에 완전히 특화 할 수 없게 된다는 뜻 입니다. TPU 랙은 CPU 랙 보다 더 높은 밀도를 가질 것 입니다. 아마도 CPU 랙 보다 더 많은 네트워킹이 필요할 것 입니다 . 즉, 이제는 건물 설계 방식 이 바뀌어야 한다는 것 입니다. 또 다른 선택 지는 통일성을 유지 하면서 TPU 나 GPU는 한 건물에 몰아 넣고, CPU 는 옆 건물에 두는 방식 입니다. 그리고 하드 드라이브는 또 다른 요구 사항이 있으니 반대편 건물에 배치 해야 할 수도 있습니다. 이제는 건물들 사이에 상당한 수준의 네트워킹이 필요 하게 됩니다. 건물을 벗어나 면 네트워킹 복잡성이 상당히 증가 합니다. 신뢰성 측면 이나 비용 측면에서 지연 시간이 늘어 납니다. 수용 가능한 수준 일 수도 있겠지만, 구성 요소 간의 대기열로 인해 지연 시간이 수백 마이크로 초, 혹은 그 이상으로 늘어날 수도 있습니다. 고려해야 할 사항 들이 매우 흥미로운 방식으로 바뀌는 것이죠. >> 음, 그렇군요. 일이 힘드시 겠어요. >> 재미 있습니다. >> 재미 있어요. >> 네. >> 네트워킹 측면 에서는 어떤 일이 벌어 지고 있나요? 구글 은 광학 기술을 포함한 최신 네트워킹 분야에서 항상 앞서 나갔다고 들었 습니다.
- 원문 구간 2
랙 클러스터 들 말이죠. 이것이 첫 번째 이유 였습니다. 두 번째 이유 는 광섬유를 실제로 옮기지 않고도 네트워크를 확장 하거나 축소 할 수 있기를 원했기 때문 입니다. 세부 사항을 다 설명 하진 않겠지 만, 칠판에 그려 본다면 광 회로 스위치를 사용 하면 사람이 직접 개입 할 필요 없이 컨트롤러가 네트워크의 스파인 구조를 재구성 하여 네트워크를 확장 하거나 축소 할 수 있습니다. 이제 TPU로 넘어가 보죠. TPU는 토러스 토폴로지를 가지고 있어 모든 TPU를 서로 직접 연결 합니다. 앞서 처리량 (throughput) 과 유효 처리량 (goodput) 에 대해 이야기 했었죠. 우리가 할 수 있는 것 중 하나는 TPU 랙에 장애가 발생 하면 광섬유를 옮기지 않고도 다른 TPU 랙 으로 대체 할 수 있다는 점 입니다. 다시 말씀 드리지만, 손짓으로 설명 하거나 화이트 보드에 그려야 하겠지만, 기본적으로 항상 여분의 랙이 준비 되어 있다고 말할 수 있습니다. 그래서 랙에 장애가 발생 하면 빛을 그 새로운 랙으로 다시 보냅니다 . 그 작업은 밀리 초 단위로 이루어질 수 있습니다. >> 그렇다면 왜 굳이 광섬유를 사용 하나요? >> 완전한 자유 공간 통신이 아닌 상태에서 말이죠. 네, 아주 좋은 질문 입니다. 음, 감쇠 손실 문제로 대역폭이 급격히 떨어질 것 입니다. 게다가 매우 큰 건물 전체 에서 3 차원으로 연결해 주는 광섬유의 이점 없이 모든 것을 조준 한다는 것은 거의 불가능에 가까울 정도로 어려운 일 입니다. 음, 저희도 그 부분에 대해 논의 해 봤습니다. 사실 그에 관해 아주 흥미로운 논의 들이 오 갔습니다. 하지만 네, 대부분 은 광섬유를 통하지만, 광 회로 스위치에 도달 하면 본질적으로 빛이 말 그대로 작은 칩 위로 쏟아 지게 됩니다. 그래서 그게 하나의 큰 방향 인데, 음, 사실 그 외에도 아주 많습니다. 제 생각 에는 데이터 센터에서 네트워킹의 성능과 필요성이 폭발적으로 증가 하고 있다고 봅니다. >> 정말 멋지네요. 그것 만으로도 대화를 한참 이어갈 수 있겠 어요.
이 자료에서 다룬 사실
- 카운터포인트리서치 분석을 인용한 보도는 대부분의 엔비디아 루빈 탑재 제품이 HBM4 12단 구성으로 수렴하는 추세라고 전했다.
- 보도는 HBM 생산에 범용 D램보다 3배 이상의 생산능력이 투입된다고 전했다.
근거 보기 3
- 원문 구간 1
즉, 저는 이 응답을 통해 무언가를 배웠다는 뜻 이죠. 다음 단계 를 진행할 텐데, 이때 로컬 DRAM 이나 다른 CPU의 DRAM, 혹은 SSD 나 HDD 등 어딘가에서 컨텍스트를 가져와야 할 필요 가 있습니다. 이제는 엄청난 규모의 오케스트레이션도 이루어져야 합니다. 설계 방식이 상당히 크게 변하고 있는데, 가속기 컴퓨팅에 대한 수요는 증가 하는 반면 CPU, 네트워킹, 스토리지, 즉 기존 데이터 센터 CPU 등에 대한 수요도 폭발적으로 늘고 있습니다. >> 그렇다면 GPU 랙 옆에 CPU를 더 많이 배치 한다는 뜻 인가요? >> 네, GPU 나 TPU 랙의 경우가 그렇습니다. 이것이 최적화와 전문화 라는 문제로 돌아가는 핵심 질문 입니다. CPU 랙을 GPU 나 TPU 옆에 많이 배치 하기 시작 하면, CPU 랙과 비교 했을 때 TPU 랙이 요구 하는 밀도와 네트워크 요건에 완전히 특화 할 수 없게 된다는 뜻 입니다. TPU 랙은 CPU 랙 보다 더 높은 밀도를 가질 것 입니다. 아마도 CPU 랙 보다 더 많은 네트워킹이 필요할 것 입니다 . 즉, 이제는 건물 설계 방식 이 바뀌어야 한다는 것 입니다. 또 다른 선택 지는 통일성을 유지 하면서 TPU 나 GPU는 한 건물에 몰아 넣고, CPU 는 옆 건물에 두는 방식 입니다. 그리고 하드 드라이브는 또 다른 요구 사항이 있으니 반대편 건물에 배치 해야 할 수도 있습니다. 이제는 건물들 사이에 상당한 수준의 네트워킹이 필요 하게 됩니다. 건물을 벗어나 면 네트워킹 복잡성이 상당히 증가 합니다. 신뢰성 측면 이나 비용 측면에서 지연 시간이 늘어 납니다. 수용 가능한 수준 일 수도 있겠지만, 구성 요소 간의 대기열로 인해 지연 시간이 수백 마이크로 초, 혹은 그 이상으로 늘어날 수도 있습니다. 고려해야 할 사항 들이 매우 흥미로운 방식으로 바뀌는 것이죠. >> 음, 그렇군요. 일이 힘드시 겠어요. >> 재미 있습니다. >> 재미 있어요. >> 네. >> 네트워킹 측면 에서는 어떤 일이 벌어 지고 있나요? 구글 은 광학 기술을 포함한 최신 네트워킹 분야에서 항상 앞서 나갔다고 들었 습니다.
- 원문 구간 2
광 네트워킹의 현주소에 대해 한 말씀 해주실 수 있나요? >> 저희 구글은 15, 16 년 전쯤에 데이터 센터 내의 단일 광섬유에 여러 신호를 실을 수 있는 파장 분할 다중화 기술을 도입 한 최초의 기업 중 하나 였습니다. 실제로 저희는 랙 간의 모든 통신에 그 기술을 활용 하고 있습니다. 동시에 파장 분할 다중화와 함께 광 회선 교환 이라는 기술도 도입 했습니다 . 광 회선 교환은 기존의 전기 패킷 교환 방식과 달리 데이터를 전적으로 광 영역 에서 전송 하고 이동 시키는 기술 입니다. 이 기술의 대단한 점을 설명해 드리 자면, 패킷 스위치 에서는 패킷을 받으면 헤더를 전기적 도메인에서 확인 하여 패킷이 어디로 향하는 지 파악 합니다. 헤더 에는 "이 패킷을 어디로 보내야 하지?" 라는 정보를 담은 IP 주소가 있을 수 있습니다. 그러면 테이블 에서 해당 목적지를 조회 하여 어떤 포트로 전송 할지 결정 합니다. 즉, 초당 수십억 , 수백억, 어쩌면 수조 개의 패킷이 엄청난 속도로 들어 오면 이를 계속 전달 하는 것이죠. 광 회로 스위칭은 " 전기적 도메인 에서는이 비트 들을 건드리지 않겠다" 고 말합니다. 대신 입력 포트에 대해 빛을 보낼 출력 포트가 어디 인지 파악 하는 방식을 취 합니다. 아 시겠 나요? 이를 수행 하는 방법 에는 여러 가지가 있습니다. 우리 가 처음 시작한 방식은 MEMS 스위치 라고 하는데, 미세 전기 모터가 3D 공간에서 거울 을 제어 하는 방식 입니다. 그래서 이제 128 개나 256 개 포트 등을 가진 장치를 프로그래밍 방식으로 제어 할 수 있게 되었습니다. 들어오는 광섬유의 모든 입력 포트를 출력 포트에 매핑 하고, 빛이 거울에 비쳐 올바른 출력 포트로 반사 되도록 거울의 각도를 조절 하는 것이죠. 처음에 우리가 이 작업을 수행 한 이유는 두 가지로, 랙 그룹 간의 지역성 을 생성 하기 위해서 였습니다. 예를 들어 컴퓨팅 클러스터와 스토리지 클러스터가 있고, 둘 다 검색 서비스를 지원 한다고 가정 해 봅시다. 두 클러스터가 서로 통신을 많이 할 것을 알았 기에, 거울을 구성 하여 두 클러스터 사이에 순수 하게 광학적 인 지름길을 만들었 습니다.
- 원문 구간 3
>> 네, 정말 멋진 일 이죠. >> 이더 볼 (eth ball) 사진으로 돌아가서 보면, 수많은 케이블 들이 제 눈을 사로 잡더군요. >> 정확 합니다. 네, 그리고 그 케이블 중 일부는 결국 저희 데이터 센터의 광 회로 스위치로 연결 됩니다. >> 이해가 됩니다. 좋습니다, 이제 전력에 관한 이야기로 넘어가 보죠. 와트 당 굿풋 ( good put) 이나 와트 당 다른 단위들에 대해 계속 말씀 하셨 잖아요. 그걸 들으니 ' 와트 당' 이라는 표현이 전력 이 어떤 면에서 제약 사항 이거나 부족한 자원, 혹은 비용이 많이 드는 문제 라는 생각이 드네요. >> 네, 그래서 종종 "저희가 직면 한 가장 큰 제약 사항은 무엇 인가요?" 라는 질문을 받곤 합니다. 그런데 사실 우리가 직면 한 가장 큰 제약은 하나로 정의 할 수 없습니다. 모두가 제약 조건 이니까요. 전부 정말 어려운 문제들 입니다. 음, 그것들은 계속 해서 변하기도 하죠. 하지만 근본적으로 답 해야 한다면, 전력이 우리가 직면 한 가장 근본적인 제약 이라고 말씀 드리고 싶습니다. 다른 것들은 해결 방법을 알고 있고, 단지 시간을 두고 해결 해야 할 문제처럼 보이 거든요. 전력 이라, 네, 말씀 하신 방식이 참 좋네요. 그건 장기적으로 구속력을 갖는 문제 이고, 저희가 아직...뭐, 핵 발전 같은 것도 있긴 하지만요. 어쩌면 원자력이 풍부한 청정 에너지를 제공 해서 많은 문제를 확실히 해결해 줄지도 모르죠. 언제 그런 일이 일어날 지, 그리고 언제 대규모로 가능할 지는 여전히 미지수 입니다. >> 그렇다면 실제로는 어떻게 운영 되나요? 새로운 데이터 센터를 구축 한다고 가정 해 봅시다. 1 기가 와트의 전력이 필요 합니다. PG&E에 전화 해서 "저기, 1 기가 와트의 전력을 좀 보내 주세요" 라고 말할 수 는 없을 것 같은데요. 전력 공급은 실제로 어떻게 이루어 지나요? 직접 터빈을 돌리는 방식처럼 수직 계열화를 해야 하나요, 아니면 전력 부족 문제를 어떻게 해결 하시나요 ? >> 네, 정말 중요 하고도 큰 질문 입니다.
그렇게 판단한 이유
AI 연산에서는 비용 절감보다 메모리 대역폭과 용량 확보가 중요하고, ASIC 시장에서도 4단 제품이 확인되지 않았다는 설명을 근거로 들었다.
근거 보기 2
- 원문 구간 1
광 네트워킹의 현주소에 대해 한 말씀 해주실 수 있나요? >> 저희 구글은 15, 16 년 전쯤에 데이터 센터 내의 단일 광섬유에 여러 신호를 실을 수 있는 파장 분할 다중화 기술을 도입 한 최초의 기업 중 하나 였습니다. 실제로 저희는 랙 간의 모든 통신에 그 기술을 활용 하고 있습니다. 동시에 파장 분할 다중화와 함께 광 회선 교환 이라는 기술도 도입 했습니다 . 광 회선 교환은 기존의 전기 패킷 교환 방식과 달리 데이터를 전적으로 광 영역 에서 전송 하고 이동 시키는 기술 입니다. 이 기술의 대단한 점을 설명해 드리 자면, 패킷 스위치 에서는 패킷을 받으면 헤더를 전기적 도메인에서 확인 하여 패킷이 어디로 향하는 지 파악 합니다. 헤더 에는 "이 패킷을 어디로 보내야 하지?" 라는 정보를 담은 IP 주소가 있을 수 있습니다. 그러면 테이블 에서 해당 목적지를 조회 하여 어떤 포트로 전송 할지 결정 합니다. 즉, 초당 수십억 , 수백억, 어쩌면 수조 개의 패킷이 엄청난 속도로 들어 오면 이를 계속 전달 하는 것이죠. 광 회로 스위칭은 " 전기적 도메인 에서는이 비트 들을 건드리지 않겠다" 고 말합니다. 대신 입력 포트에 대해 빛을 보낼 출력 포트가 어디 인지 파악 하는 방식을 취 합니다. 아 시겠 나요? 이를 수행 하는 방법 에는 여러 가지가 있습니다. 우리 가 처음 시작한 방식은 MEMS 스위치 라고 하는데, 미세 전기 모터가 3D 공간에서 거울 을 제어 하는 방식 입니다. 그래서 이제 128 개나 256 개 포트 등을 가진 장치를 프로그래밍 방식으로 제어 할 수 있게 되었습니다. 들어오는 광섬유의 모든 입력 포트를 출력 포트에 매핑 하고, 빛이 거울에 비쳐 올바른 출력 포트로 반사 되도록 거울의 각도를 조절 하는 것이죠. 처음에 우리가 이 작업을 수행 한 이유는 두 가지로, 랙 그룹 간의 지역성 을 생성 하기 위해서 였습니다. 예를 들어 컴퓨팅 클러스터와 스토리지 클러스터가 있고, 둘 다 검색 서비스를 지원 한다고 가정 해 봅시다. 두 클러스터가 서로 통신을 많이 할 것을 알았 기에, 거울을 구성 하여 두 클러스터 사이에 순수 하게 광학적 인 지름길을 만들었 습니다.
- 원문 구간 2
랙 클러스터 들 말이죠. 이것이 첫 번째 이유 였습니다. 두 번째 이유 는 광섬유를 실제로 옮기지 않고도 네트워크를 확장 하거나 축소 할 수 있기를 원했기 때문 입니다. 세부 사항을 다 설명 하진 않겠지 만, 칠판에 그려 본다면 광 회로 스위치를 사용 하면 사람이 직접 개입 할 필요 없이 컨트롤러가 네트워크의 스파인 구조를 재구성 하여 네트워크를 확장 하거나 축소 할 수 있습니다. 이제 TPU로 넘어가 보죠. TPU는 토러스 토폴로지를 가지고 있어 모든 TPU를 서로 직접 연결 합니다. 앞서 처리량 (throughput) 과 유효 처리량 (goodput) 에 대해 이야기 했었죠. 우리가 할 수 있는 것 중 하나는 TPU 랙에 장애가 발생 하면 광섬유를 옮기지 않고도 다른 TPU 랙 으로 대체 할 수 있다는 점 입니다. 다시 말씀 드리지만, 손짓으로 설명 하거나 화이트 보드에 그려야 하겠지만, 기본적으로 항상 여분의 랙이 준비 되어 있다고 말할 수 있습니다. 그래서 랙에 장애가 발생 하면 빛을 그 새로운 랙으로 다시 보냅니다 . 그 작업은 밀리 초 단위로 이루어질 수 있습니다. >> 그렇다면 왜 굳이 광섬유를 사용 하나요? >> 완전한 자유 공간 통신이 아닌 상태에서 말이죠. 네, 아주 좋은 질문 입니다. 음, 감쇠 손실 문제로 대역폭이 급격히 떨어질 것 입니다. 게다가 매우 큰 건물 전체 에서 3 차원으로 연결해 주는 광섬유의 이점 없이 모든 것을 조준 한다는 것은 거의 불가능에 가까울 정도로 어려운 일 입니다. 음, 저희도 그 부분에 대해 논의 해 봤습니다. 사실 그에 관해 아주 흥미로운 논의 들이 오 갔습니다. 하지만 네, 대부분 은 광섬유를 통하지만, 광 회로 스위치에 도달 하면 본질적으로 빛이 말 그대로 작은 칩 위로 쏟아 지게 됩니다. 그래서 그게 하나의 큰 방향 인데, 음, 사실 그 외에도 아주 많습니다. 제 생각 에는 데이터 센터에서 네트워킹의 성능과 필요성이 폭발적으로 증가 하고 있다고 봅니다. >> 정말 멋지네요. 그것 만으로도 대화를 한참 이어갈 수 있겠 어요.
작성자가 예상한 다음 전개
HBM 수요가 유지되면 범용 D램 공급 제약과 고부가 메모리 수요가 삼성전자와 SK하이닉스 실적에 지속 영향을 줄 수 있다고 전망했다.
근거 보기 2
- 원문 구간 1
>> 네, 정말 멋진 일 이죠. >> 이더 볼 (eth ball) 사진으로 돌아가서 보면, 수많은 케이블 들이 제 눈을 사로 잡더군요. >> 정확 합니다. 네, 그리고 그 케이블 중 일부는 결국 저희 데이터 센터의 광 회로 스위치로 연결 됩니다. >> 이해가 됩니다. 좋습니다, 이제 전력에 관한 이야기로 넘어가 보죠. 와트 당 굿풋 ( good put) 이나 와트 당 다른 단위들에 대해 계속 말씀 하셨 잖아요. 그걸 들으니 ' 와트 당' 이라는 표현이 전력 이 어떤 면에서 제약 사항 이거나 부족한 자원, 혹은 비용이 많이 드는 문제 라는 생각이 드네요. >> 네, 그래서 종종 "저희가 직면 한 가장 큰 제약 사항은 무엇 인가요?" 라는 질문을 받곤 합니다. 그런데 사실 우리가 직면 한 가장 큰 제약은 하나로 정의 할 수 없습니다. 모두가 제약 조건 이니까요. 전부 정말 어려운 문제들 입니다. 음, 그것들은 계속 해서 변하기도 하죠. 하지만 근본적으로 답 해야 한다면, 전력이 우리가 직면 한 가장 근본적인 제약 이라고 말씀 드리고 싶습니다. 다른 것들은 해결 방법을 알고 있고, 단지 시간을 두고 해결 해야 할 문제처럼 보이 거든요. 전력 이라, 네, 말씀 하신 방식이 참 좋네요. 그건 장기적으로 구속력을 갖는 문제 이고, 저희가 아직...뭐, 핵 발전 같은 것도 있긴 하지만요. 어쩌면 원자력이 풍부한 청정 에너지를 제공 해서 많은 문제를 확실히 해결해 줄지도 모르죠. 언제 그런 일이 일어날 지, 그리고 언제 대규모로 가능할 지는 여전히 미지수 입니다. >> 그렇다면 실제로는 어떻게 운영 되나요? 새로운 데이터 센터를 구축 한다고 가정 해 봅시다. 1 기가 와트의 전력이 필요 합니다. PG&E에 전화 해서 "저기, 1 기가 와트의 전력을 좀 보내 주세요" 라고 말할 수 는 없을 것 같은데요. 전력 공급은 실제로 어떻게 이루어 지나요? 직접 터빈을 돌리는 방식처럼 수직 계열화를 해야 하나요, 아니면 전력 부족 문제를 어떻게 해결 하시나요 ? >> 네, 정말 중요 하고도 큰 질문 입니다.
- 원문 구간 2
그들이 필요 로 할 때 그 전력을 공급할 수 있게 되는 것이죠, 맞나요? 다시 말해, 일 년 중 가장 더운 2 주처럼 주거용 전력 수요가 폭증 하는 시기가 있을 수 있습니다. 우리가 자체 생산 한 전력이 있다면, 그때 그리드에 다시 공급할 수 있는 것 입니다. 결국 우리 에게는 전력 회사들과 수년간 협력 하는 과정이 꼭 필요 합니다. >> 왜 전력 회사들과 협력 하는 것을 선호 하시나요? 자체적 으로 수직 계열화를 구축 하는 대신 말이죠. >> 네, 주된 이유는 양쪽 모두 에게 유연성과 이점이 있기 때문 입니다. 한 가지 관점은 '통계적 다중화' 또는 '대수의 법칙' 이라고 볼 수 있습니다. 만약 우리가 1 기가 와트의 전력이 필요 하고, 이를 99.99% 이상의 신뢰도로 확보 하고 싶다고 가정 해 봅시다. 아마도 2 기가 와트 규모의 전력 설비를 구축 해야 할 것 입니다. 그렇지 않나요? 99.99% 나 99.999%수준의 안정성을 위해서는 1 + 1 중복성이 필요 합니다. 그건 비용이 많이 드는 일 이죠. 게다가 이상적인 친환경 에너지 원을 데이터 센터 바로 옆에 확보 하는 것도 어려운 과제 일 수 있습니다. 이제 데이터 센터 와 파트너십을 맺는 다면, 우리가 직접 생산 한 전력 중 일부를 그리드에 덜 필요한 시기에 제공 하고, 필요할 때는 전력을 가져올 수도 있습니다. 즉, 더 큰 기반에서 통계적 다중화를 활용 함으로써 결과적으로 모두가 윈윈 하게 되는 것 입니다. 우리도 이득을 보고, 그리드 도 이득을 보며, 주거 시설도 혜택을 받는 등 모두가 좋아지는 것이죠. 우리는 그런 방식을 선호 합니다. 물론 아주 드문 경우에 ' 비하인드 더 미터 (behind the meter)' 방식으로 진행할 수도 있지만, 그때도 1 년 뒤에는 전력 회사와 협력 할 것이라는 전제 하에 움직 입니다. 우리는 항상 그리드 와 연결 되기를 원 하니까요. 그건 다시 말해 우리 에게도 도움이 되고, 전력망 에도 도움이 되는 일 입니다. >> 일리가 있네요. 데이터 센터 규모는 어떻게 결정 하시나요 ?