상승 전환추적 후보Codex 검토엔비디아의 분산 추론 설계는 추론 시스템의 통합 역량을 다시 검토하게 하는 관찰이다.수익 구조 변화경쟁력 검증달라진 점원문은 Prefill 전용 CPX와 Decode용 Rubin GPU, 캐시 오프로딩과 라우팅을 결합한 분산 추론 설계를 제시한다.다르게 볼 이유작성자는 이 설계가 복잡해지는 추론에서 엔비디아의 하드웨어·소프트웨어·네트워킹·공급망 통합 역량을 더 중요하게 만들 수 있다고 예상한다. 이는 작성자 전망이며, Codex 검토는 실제 채택·효과가 확인되지 않아 watch로 둔다.남은 확인원문은 실제 고객 채택 규모와 장기 수익 기여를 제시하지 않는다.
원문을 바탕으로 한 Codex의 독립 판단입니다. 출처가 전한 사실·해석과 구분해 읽을 수 있습니다.
분석 대상 · 엔비디아의 분산 추론 설계
이전에는
원문은 기존 Aggregated 방식이 단일 GPU에서 Prefill과 Decode를 함께 처리해 유연성이 부족하고 병목이 생긴다고 설명한다.
원문 근거
Prefill은 계산량이 많아 병렬성이 낮고, Decode는 KV Cache를 사용할 수 있기 때문에 병렬성이 상대적으로 높은 워크로드입니다. 문제는 단일 아키텍처이기 때문에 유연성이 부족하고 병목이 생긴다는 점이 문제였습니다. 새로운 방식은 Disaggregated로, Prefill과 Decode 작업 중에 Prefill을 전용 하드웨어로 분리하는 게 핵심입니다. Prefill에 맞게 따로 특화시킨 CPX 칩에서 계산에 최적화된 작업을 하고, 병렬성이 높은 Decode 작업은 기존 Rubin GPU에 배정하는 것입니다. 이렇게 되면 KV Cache를 HBM 대신 GDRR7처럼 더 저렴한 스토리지로 옮겨서 GPU 메모리를 확보할 수 있게 됩니다. 워크로드에도 다양한 하드웨어간 스마트 라우팅으로 유연한 확장을 할 수 있다는 게 핵심입니다.
새롭게 달라진 점
원문은 Prefill 전용 CPX와 Decode용 Rubin GPU, 캐시 오프로딩과 라우팅을 결합한 분산 추론 설계를 제시한다.
원문 근거
Prefill은 계산량이 많아 병렬성이 낮고, Decode는 KV Cache를 사용할 수 있기 때문에 병렬성이 상대적으로 높은 워크로드입니다. 문제는 단일 아키텍처이기 때문에 유연성이 부족하고 병목이 생긴다는 점이 문제였습니다. 새로운 방식은 Disaggregated로, Prefill과 Decode 작업 중에 Prefill을 전용 하드웨어로 분리하는 게 핵심입니다. Prefill에 맞게 따로 특화시킨 CPX 칩에서 계산에 최적화된 작업을 하고, 병렬성이 높은 Decode 작업은 기존 Rubin GPU에 배정하는 것입니다. 이렇게 되면 KV Cache를 HBM 대신 GDRR7처럼 더 저렴한 스토리지로 옮겨서 GPU 메모리를 확보할 수 있게 됩니다. 워크로드에도 다양한 하드웨어간 스마트 라우팅으로 유연한 확장을 할 수 있다는 게 핵심입니다.
이를 위해 엔비디아는 소프트웨어 레벨에서 ⓐSmart Router, ⓑKV Cache Manager, ⓒGPU Resource Planner를 추가하여 LLM 추론 과정에서 Prefill과 Decode를 분산하여 처리하고, KV Cache를 GPU 메모리에서 오프로딩하여 GPU 리소스를 최적화하는 아키텍처입니다. 이렇게 하면 대규모 사용자 처리, 모델 확장성, 리소스 효율성이 모두 개선됩니다. 이전에 비해 Prefill 비용이 절감되므로 ROI가 30~50배 증가하고, 전체 시스템 단위 효율은 3~7.5배 좋아졌습니다. 기존의 칩들과 전혀 다른 구조이기 때문에 이제 모든 ASIC 플레이어들은 엔비디아와의 'TCO 대비 퍼포먼스' 비교에서 엔비디아를 따라가기 위해 자체적인 Prefill ASIC을 동시에 개발해야 하는 상황이 시작됐습니다.
다르게 볼 이유
작성자는 이 설계가 복잡해지는 추론에서 엔비디아의 하드웨어·소프트웨어·네트워킹·공급망 통합 역량을 더 중요하게 만들 수 있다고 예상한다. 이는 작성자 전망이며, Codex 검토는 실제 채택·효과가 확인되지 않아 watch로 둔다.
원문 근거
그리고 이제 추론에서도 엔비디아가 깔아둔 분산형 추론 설계를 채택할 경우 훨씬 더 TCO 대비 퍼포먼스가 우수해질 것입니다. 추론이 점점 복잡해질수록 훈련에서처럼 엔비디아가 가진 하드웨어·소프트웨어·네트워킹·공급망 관리 차원의 해자가 점점 더 강해질 것으로 예상합니다. 그리고 개인적으로 다년간에 걸쳐서 향후 Decode용 칩도 따로 설계될 것으로 예상합니다. 대만에서 유능한 ASIC 인재들을 수천 명 모아서 AI 연구소가 첫 번째로 출시한 칩이 CPX일 뿐입니다. 엔비디아가 ASIC 팀을 준비 중이라는 내용은 2024년 4월 업계에 처음으로 팀 빌딩에 대해 알려졌고 → 2025년 1월에 대만에 1,000명 규모 대규모 R&D 연구소를 꾸리면서 공식 확인됐던 내용입니다.
판단을 바꿀 조건
분산 설계가 비용·자원 효율 개선이나 고객 채택으로 이어지지 않는다는 확인이 나오면 이 긍정 해석은 약화될 수 있다.
원문 근거
Prefill은 계산량이 많아 병렬성이 낮고, Decode는 KV Cache를 사용할 수 있기 때문에 병렬성이 상대적으로 높은 워크로드입니다. 문제는 단일 아키텍처이기 때문에 유연성이 부족하고 병목이 생긴다는 점이 문제였습니다. 새로운 방식은 Disaggregated로, Prefill과 Decode 작업 중에 Prefill을 전용 하드웨어로 분리하는 게 핵심입니다. Prefill에 맞게 따로 특화시킨 CPX 칩에서 계산에 최적화된 작업을 하고, 병렬성이 높은 Decode 작업은 기존 Rubin GPU에 배정하는 것입니다. 이렇게 되면 KV Cache를 HBM 대신 GDRR7처럼 더 저렴한 스토리지로 옮겨서 GPU 메모리를 확보할 수 있게 됩니다. 워크로드에도 다양한 하드웨어간 스마트 라우팅으로 유연한 확장을 할 수 있다는 게 핵심입니다.
이를 위해 엔비디아는 소프트웨어 레벨에서 ⓐSmart Router, ⓑKV Cache Manager, ⓒGPU Resource Planner를 추가하여 LLM 추론 과정에서 Prefill과 Decode를 분산하여 처리하고, KV Cache를 GPU 메모리에서 오프로딩하여 GPU 리소스를 최적화하는 아키텍처입니다. 이렇게 하면 대규모 사용자 처리, 모델 확장성, 리소스 효율성이 모두 개선됩니다. 이전에 비해 Prefill 비용이 절감되므로 ROI가 30~50배 증가하고, 전체 시스템 단위 효율은 3~7.5배 좋아졌습니다. 기존의 칩들과 전혀 다른 구조이기 때문에 이제 모든 ASIC 플레이어들은 엔비디아와의 'TCO 대비 퍼포먼스' 비교에서 엔비디아를 따라가기 위해 자체적인 Prefill ASIC을 동시에 개발해야 하는 상황이 시작됐습니다.
판단을 뒷받침하는 근거
- 원문은 Smart Router, KV Cache Manager, GPU Resource Planner가 Prefill·Decode 분리와 캐시 오프로딩을 지원한다고 설명한다.
원문 근거
이를 위해 엔비디아는 소프트웨어 레벨에서 ⓐSmart Router, ⓑKV Cache Manager, ⓒGPU Resource Planner를 추가하여 LLM 추론 과정에서 Prefill과 Decode를 분산하여 처리하고, KV Cache를 GPU 메모리에서 오프로딩하여 GPU 리소스를 최적화하는 아키텍처입니다. 이렇게 하면 대규모 사용자 처리, 모델 확장성, 리소스 효율성이 모두 개선됩니다. 이전에 비해 Prefill 비용이 절감되므로 ROI가 30~50배 증가하고, 전체 시스템 단위 효율은 3~7.5배 좋아졌습니다. 기존의 칩들과 전혀 다른 구조이기 때문에 이제 모든 ASIC 플레이어들은 엔비디아와의 'TCO 대비 퍼포먼스' 비교에서 엔비디아를 따라가기 위해 자체적인 Prefill ASIC을 동시에 개발해야 하는 상황이 시작됐습니다.
- 작성자는 ASIC 업체의 Prefill ASIC 개발 필요성과 엔비디아 해자 강화를 예상한다.
원문 근거
그리고 이제 추론에서도 엔비디아가 깔아둔 분산형 추론 설계를 채택할 경우 훨씬 더 TCO 대비 퍼포먼스가 우수해질 것입니다. 추론이 점점 복잡해질수록 훈련에서처럼 엔비디아가 가진 하드웨어·소프트웨어·네트워킹·공급망 관리 차원의 해자가 점점 더 강해질 것으로 예상합니다. 그리고 개인적으로 다년간에 걸쳐서 향후 Decode용 칩도 따로 설계될 것으로 예상합니다. 대만에서 유능한 ASIC 인재들을 수천 명 모아서 AI 연구소가 첫 번째로 출시한 칩이 CPX일 뿐입니다. 엔비디아가 ASIC 팀을 준비 중이라는 내용은 2024년 4월 업계에 처음으로 팀 빌딩에 대해 알려졌고 → 2025년 1월에 대만에 1,000명 규모 대규모 R&D 연구소를 꾸리면서 공식 확인됐던 내용입니다.
다음 확인 지점
- 원문에 제시된 설계가 실제 고객 환경에서 채택·운영되는지 확인이 필요하다.
원문 근거
이를 위해 엔비디아는 소프트웨어 레벨에서 ⓐSmart Router, ⓑKV Cache Manager, ⓒGPU Resource Planner를 추가하여 LLM 추론 과정에서 Prefill과 Decode를 분산하여 처리하고, KV Cache를 GPU 메모리에서 오프로딩하여 GPU 리소스를 최적화하는 아키텍처입니다. 이렇게 하면 대규모 사용자 처리, 모델 확장성, 리소스 효율성이 모두 개선됩니다. 이전에 비해 Prefill 비용이 절감되므로 ROI가 30~50배 증가하고, 전체 시스템 단위 효율은 3~7.5배 좋아졌습니다. 기존의 칩들과 전혀 다른 구조이기 때문에 이제 모든 ASIC 플레이어들은 엔비디아와의 'TCO 대비 퍼포먼스' 비교에서 엔비디아를 따라가기 위해 자체적인 Prefill ASIC을 동시에 개발해야 하는 상황이 시작됐습니다.
그리고 이제 추론에서도 엔비디아가 깔아둔 분산형 추론 설계를 채택할 경우 훨씬 더 TCO 대비 퍼포먼스가 우수해질 것입니다. 추론이 점점 복잡해질수록 훈련에서처럼 엔비디아가 가진 하드웨어·소프트웨어·네트워킹·공급망 관리 차원의 해자가 점점 더 강해질 것으로 예상합니다. 그리고 개인적으로 다년간에 걸쳐서 향후 Decode용 칩도 따로 설계될 것으로 예상합니다. 대만에서 유능한 ASIC 인재들을 수천 명 모아서 AI 연구소가 첫 번째로 출시한 칩이 CPX일 뿐입니다. 엔비디아가 ASIC 팀을 준비 중이라는 내용은 2024년 4월 업계에 처음으로 팀 빌딩에 대해 알려졌고 → 2025년 1월에 대만에 1,000명 규모 대규모 R&D 연구소를 꾸리면서 공식 확인됐던 내용입니다.
아직 모르는 점
- 원문은 실제 고객 채택 규모와 장기 수익 기여를 제시하지 않는다.
원문 근거 5개 펼치기
출처의 해석·전망
- 작성자는 Prefill을 전용 CPX, Decode를 Rubin GPU에 배정하고 캐시를 옮기는 분산 설계가 비용과 자원 효율을 높이며, 복잡한 추론에서 엔비디아의 통합 역량이 더 중요해질 것으로 예상한다.
보존 원문 발췌
오픈AI는 이제 추론의 효율을 극한까지 끌어올리기 위해 알리바바가 Qwen-Next에서 512개의 expert를 만드는 사이 GPT-6부터는 2,048개의 expert를 둘 것으로 예상합니다. 라구 라구람 : 추론 비용을 1,000배 낮추는 데 필요한 단일 병목지점이 있나요? 아니면 여러 분야에서 추론 비용을 낮춰가는 곡선처럼 구성되어 있나요? 아민 바흐다트 Amin Vahdat : 추론은 두 가지 분야로 나뉩니다. 아마 익숙하시겠지만, Prefill과 Decode는 매우 매우 다른 워크로드입니다. 균형점이 다릅니다. 그래서 사실 이상적으로는 두 가지 다른 하드웨어로 추론하는 것이 중요합니다. 그게 하나의 기회입니다. *코멘트 → Rubin CPX(4Q26 출시 예정)는 분산 추론(Disaggregated Inference)의 시작을 알린 칩입니다.
Transformer 계열 LLM의 추론은 크게 두 가지 작업으로 분리됩니다. Prefill과 Decode입니다. 워크로드별로 특징을 보면 Prefill은 컴퓨팅이 많이 필요하고, 상대적으로 메모리 대역폭은 낮아도 됩니다. 그래서 비싼 HBM을 사용하는 대신 CPX에는 128GB GDDR7(대역폭 2TB/s)을 탑재했습니다. HBM 절반 가격으로 만든 칩이고, R200 GPU 대비 4분의 1 가격으로 동일 작업을 수행합니다. 그리고 Decode는 메모리 대역폭을 많이 필요로 합니다. HBM에 적합하기에 R200에는 여전히 288GB HBM4(대역폭 20.5TB/s)가 탑재됩니다. 기존의 방식은 Aggregated로, Prefill 및 Decode 작업을 단일 GPU에서 동시 처리하는 식이었습니다.
Prefill은 계산량이 많아 병렬성이 낮고, Decode는 KV Cache를 사용할 수 있기 때문에 병렬성이 상대적으로 높은 워크로드입니다. 문제는 단일 아키텍처이기 때문에 유연성이 부족하고 병목이 생긴다는 점이 문제였습니다. 새로운 방식은 Disaggregated로, Prefill과 Decode 작업 중에 Prefill을 전용 하드웨어로 분리하는 게 핵심입니다. Prefill에 맞게 따로 특화시킨 CPX 칩에서 계산에 최적화된 작업을 하고, 병렬성이 높은 Decode 작업은 기존 Rubin GPU에 배정하는 것입니다. 이렇게 되면 KV Cache를 HBM 대신 GDRR7처럼 더 저렴한 스토리지로 옮겨서 GPU 메모리를 확보할 수 있게 됩니다. 워크로드에도 다양한 하드웨어간 스마트 라우팅으로 유연한 확장을 할 수 있다는 게 핵심입니다.
이를 위해 엔비디아는 소프트웨어 레벨에서 ⓐSmart Router, ⓑKV Cache Manager, ⓒGPU Resource Planner를 추가하여 LLM 추론 과정에서 Prefill과 Decode를 분산하여 처리하고, KV Cache를 GPU 메모리에서 오프로딩하여 GPU 리소스를 최적화하는 아키텍처입니다. 이렇게 하면 대규모 사용자 처리, 모델 확장성, 리소스 효율성이 모두 개선됩니다. 이전에 비해 Prefill 비용이 절감되므로 ROI가 30~50배 증가하고, 전체 시스템 단위 효율은 3~7.5배 좋아졌습니다. 기존의 칩들과 전혀 다른 구조이기 때문에 이제 모든 ASIC 플레이어들은 엔비디아와의 'TCO 대비 퍼포먼스' 비교에서 엔비디아를 따라가기 위해 자체적인 Prefill ASIC을 동시에 개발해야 하는 상황이 시작됐습니다.
그리고 이제 추론에서도 엔비디아가 깔아둔 분산형 추론 설계를 채택할 경우 훨씬 더 TCO 대비 퍼포먼스가 우수해질 것입니다. 추론이 점점 복잡해질수록 훈련에서처럼 엔비디아가 가진 하드웨어·소프트웨어·네트워킹·공급망 관리 차원의 해자가 점점 더 강해질 것으로 예상합니다. 그리고 개인적으로 다년간에 걸쳐서 향후 Decode용 칩도 따로 설계될 것으로 예상합니다. 대만에서 유능한 ASIC 인재들을 수천 명 모아서 AI 연구소가 첫 번째로 출시한 칩이 CPX일 뿐입니다. 엔비디아가 ASIC 팀을 준비 중이라는 내용은 2024년 4월 업계에 처음으로 팀 빌딩에 대해 알려졌고 → 2025년 1월에 대만에 1,000명 규모 대규모 R&D 연구소를 꾸리면서 공식 확인됐던 내용입니다.
상승 관점 보조 신호 · 가격 충격·지속성·후속 근거
장대양봉급 뉴스
근거 미확인- 이 자료에서 판단할 근거를 확보하지 못했습니다.
지속 턴어라운드
근거 미확인- 이 자료에서 판단할 근거를 확보하지 못했습니다.
셀온 뒤 재상승 근거
근거 미확인- 이 자료에서 판단할 근거를 확보하지 못했습니다.