25-9 엔비디아 Rubin CPX 발표
작성자의 핵심 판단
작성자는 CPX가 추론 시대의 경쟁 축을 바꾸고 엔비디아의 전성기를 연장할 수 있는 발표라고 평가한다.
근거 보기 1
- 원문 구간 1
Prefill을 위한 ASIC을 추가했기 때문입니다. 엔비디아가 ASIC 팀을 준비 중이라는 내용은 2024년 4월 업계에 처음으로 팀 빌딩에 대해서 알려졌고 → 2025년 1월에 대만에 1,000명 규모의 대규모 R&D 연구소를 꾸리면서 공식 확인됐던 내용입니다. 당시 MediaTek, Alchip, GUC쪽 대만 ASIC 인재를 블랙홀처럼 빨아들였던 것의 결과가 CPX로 연결됐습니다. 2026년 말에 양산될 Rubin CPX는 Reasoning 및 Agentic AI처럼 prefill이 무거운 워크로드에 맞춘 전용 가속기로, 소프트웨어(NVIDIA Dynamo)에서 시도하던 prefill/decode 분리를 하드웨어 설계에까지 끌어올렸습니다. 이로써 prefill은 GDDR7을 채택한 CPX가 연산 집약 구간을 빠르게 밀어주고, decode는 HBM을 갖춘 Rubin GPU가 메모리 집약 구간을 전담하는 구조가 됩니다. 결과적으로 같은 전력·비용으로 더 많은 토큰을 처리하고 응답지연을 줄임으로써 추론의 단가 구조 자체를 바꾸게 되는 것입니다. 이 접근은 과거 GB200 NVL72가 72-GPU 스케일업 도메인을 표준화하며 랙 단위 경제성을 뒤집었던 흐름의 연장선입니다.
이 자료에서 다룬 사실
엔비디아는 미국시간 2025년 9월 9일 Rubin CPX를 발표했으며, 원문은 2026년 말 양산과 prefill·decode 역할 분담 구조를 적었다.
근거 보기 2
- 원문 구간 1
Prefill을 위한 ASIC을 추가했기 때문입니다. 엔비디아가 ASIC 팀을 준비 중이라는 내용은 2024년 4월 업계에 처음으로 팀 빌딩에 대해서 알려졌고 → 2025년 1월에 대만에 1,000명 규모의 대규모 R&D 연구소를 꾸리면서 공식 확인됐던 내용입니다. 당시 MediaTek, Alchip, GUC쪽 대만 ASIC 인재를 블랙홀처럼 빨아들였던 것의 결과가 CPX로 연결됐습니다. 2026년 말에 양산될 Rubin CPX는 Reasoning 및 Agentic AI처럼 prefill이 무거운 워크로드에 맞춘 전용 가속기로, 소프트웨어(NVIDIA Dynamo)에서 시도하던 prefill/decode 분리를 하드웨어 설계에까지 끌어올렸습니다. 이로써 prefill은 GDDR7을 채택한 CPX가 연산 집약 구간을 빠르게 밀어주고, decode는 HBM을 갖춘 Rubin GPU가 메모리 집약 구간을 전담하는 구조가 됩니다. 결과적으로 같은 전력·비용으로 더 많은 토큰을 처리하고 응답지연을 줄임으로써 추론의 단가 구조 자체를 바꾸게 되는 것입니다. 이 접근은 과거 GB200 NVL72가 72-GPU 스케일업 도메인을 표준화하며 랙 단위 경제성을 뒤집었던 흐름의 연장선입니다.
- 원문 구간 2
이제는 한 칩의 만능화가 아니라 추론 워크로드 단계별 전용화가 경쟁 포인트가 되는 것입니다. 그동안 TPU, Trainium 등은 "칩당 HBM 용량을 키우면 긴 컨텍스트·Reasoning 트렌드에서 유리하다"는 논리로 대응해 왔습니다. 하지만 CPX 체제에서는 연산 최적 칩(CPX)과 대역폭 최적 칩(Rubin)을 역할 분할해 투입하므로, HBM 용량 우세만으로는 설명되지 않는 토큰당 비용 축소·처리량 증대가 가능합니다. 즉, 메모리 부문만의 장점을 앞세운 접근은 prefill 전용 가속기의 등장으로 다시 비교 기준을 재설정해야 하는 상황입니다. 엔비디아의 강점은 하이퍼스케일러·AI 랩과의 밀착 협업에서 현장의 병목을 직접 확인하고, 그 해결책을 곧바로 제품 로드맵에 반영한다는 점입니다. 유일하게 고객의 고충을 '직접 보고 느끼며' 해결하는 기업이라 가능합니다. 주요 고객들이 NVDA-CUDA 기반으로 성능을 끌어올리는 과정에서 엔비디아 엔지니어들은 고객사 엔지니어들과 한 팀처럼 문제를 정의·재설계하고 있습니다. 그 결과 AMD나 ASIC 기업들이 주로 '고객들의 커스텀 요구에 부응하기'에 머무는 동안 엔비디아는 소프트웨어(Dynamo)–칩 설계(CPX)–랙 아키텍처(NVL144 CPX)로 이어지는 수직적 통합을 통해, 추론이 점점 더 중요해지는 시장에서 '퍼포먼스 대비 TCO' 중 '퍼포먼스'를 더 경쟁력 있게 끌어올릴 수 있게 되는 것입니다.
그렇게 판단한 이유
GDDR7 기반 CPX가 연산 집약 prefill을, HBM 기반 Rubin GPU가 메모리 집약 decode를 맡아 토큰 처리량과 지연을 개선할 수 있다는 설명을 근거로 든다.
근거 보기 1
- 원문 구간 1
이제는 한 칩의 만능화가 아니라 추론 워크로드 단계별 전용화가 경쟁 포인트가 되는 것입니다. 그동안 TPU, Trainium 등은 "칩당 HBM 용량을 키우면 긴 컨텍스트·Reasoning 트렌드에서 유리하다"는 논리로 대응해 왔습니다. 하지만 CPX 체제에서는 연산 최적 칩(CPX)과 대역폭 최적 칩(Rubin)을 역할 분할해 투입하므로, HBM 용량 우세만으로는 설명되지 않는 토큰당 비용 축소·처리량 증대가 가능합니다. 즉, 메모리 부문만의 장점을 앞세운 접근은 prefill 전용 가속기의 등장으로 다시 비교 기준을 재설정해야 하는 상황입니다. 엔비디아의 강점은 하이퍼스케일러·AI 랩과의 밀착 협업에서 현장의 병목을 직접 확인하고, 그 해결책을 곧바로 제품 로드맵에 반영한다는 점입니다. 유일하게 고객의 고충을 '직접 보고 느끼며' 해결하는 기업이라 가능합니다. 주요 고객들이 NVDA-CUDA 기반으로 성능을 끌어올리는 과정에서 엔비디아 엔지니어들은 고객사 엔지니어들과 한 팀처럼 문제를 정의·재설계하고 있습니다. 그 결과 AMD나 ASIC 기업들이 주로 '고객들의 커스텀 요구에 부응하기'에 머무는 동안 엔비디아는 소프트웨어(Dynamo)–칩 설계(CPX)–랙 아키텍처(NVL144 CPX)로 이어지는 수직적 통합을 통해, 추론이 점점 더 중요해지는 시장에서 '퍼포먼스 대비 TCO' 중 '퍼포먼스'를 더 경쟁력 있게 끌어올릴 수 있게 되는 것입니다.