상승 전환추적 후보Codex 검토엔비디아는 LPX를 결합한 분산 추론으로 저지연 에이전트용 AI 팩토리 구조를 구체화했다.수익 구조 변화핵심 의문 해소달라진 점엔비디아를 분석 대상으로, 원문은 Dynamo가 Rubin GPU와 Groq LPX를 나누어 쓰는 구조와 LPX 최대 25% 배치를 제시했다.다르게 볼 이유Codex 검토로, 원문 작성자가 토큰당 매출과 저지연의 중요성을 연결한 만큼 이 구조는 엔비디아의 추론용 시스템 구성을 다르게 검토할 근거가 될 수 있다. 다만 실제 고객 도입·매출은 원문에서 확인되지 않았다.남은 확인실제 고객 도입, 매출 기여와 경쟁 제품 대비 성과는 현재 원문만으로 확인되지 않는다.
원문을 바탕으로 한 Codex의 독립 판단입니다. 출처가 전한 사실·해석과 구분해 읽을 수 있습니다.
분석 대상 · LPX 기반 분산 추론
이전에는
이전 상태의 비교 근거가 이 분석에 정리되지 않았습니다.
새롭게 달라진 점
엔비디아를 분석 대상으로, 원문은 Dynamo가 Rubin GPU와 Groq LPX를 나누어 쓰는 구조와 LPX 최대 25% 배치를 제시했다.
원문 근거
분산 추론의 완성 : Dynamo, VR200 NVL72 ↔ Groq 3 LPX 지난 GTC 2026 Preview에서 전해드렸던 분산 추론의 방향성이 구체화되었습니다. 핵심은 NVIDIA Dynamo 플랫폼을 활용한 이기종 컴퓨팅 환경의 유연한 통합입니다. 고객이 Vera CPU, Rubin GPU, Groq LPX 등 다양한 하드웨어를 혼합하여 구축할 경우, Dynamo는 batch size와 병렬 처리 수준을 지능적으로 분석해 최적의 하드웨어로 워크로드를 분산시킵니다.
젠슨 황 CEO는 시스템 구성 시 Groq LPX의 비중을 최대 25%까지 할당할 수 있다고 언급하며 아키텍처의 유연성을 강조했습니다. 이러한 분산 처리의 핵심 역할 분담은 다음과 같습니다: Vera Rubin NVL72 (Prefill 담당) : 방대한 컨텍스트를 한 번에 읽고 이해해야 하는 Prefill 단계는 여전히 막대한 연산량과 HBM 용량을 요구합니다. Rubin GPU는 이 동적이고 복잡한 스케줄링 워크로드를 전담하며 KV Cache를 생성합니다. Groq 3 LPX (Decode 담당) : 생성된 KV Cache를 넘겨받아 토큰을 하나씩 반복적으로 생성하는 Decode 작업은 LPX로 라우팅됩니다.
다르게 볼 이유
Codex 검토로, 원문 작성자가 토큰당 매출과 저지연의 중요성을 연결한 만큼 이 구조는 엔비디아의 추론용 시스템 구성을 다르게 검토할 근거가 될 수 있다. 다만 실제 고객 도입·매출은 원문에서 확인되지 않았다.
원문 근거
이러한 NVL72의 물리적 한계를 뛰어넘기 위해 LPX가 핵심적인 역할을 합니다. Groq의 결정론적 데이터 프로세서와 On-chip SRAM의 강점을 결합하여 분산 추론 과정의 Decode 단계를 혁신적으로 가속화한 것입니다. 그 결과, 엔비디아는 Throughput과 Latency를 동시에 충족시키며 기존에는 도달할 수 없었던 새로운 파레토 프론티어를 개척해 냈습니다. *Ian Buck이 LPX를 통해 멀티 에이전트 시스템에서 생기는 추론 시장을 선점할 것을 설명하는 발표자료
판단을 바꿀 조건
LPX가 계획된 통합·양산 뒤에도 분산 추론의 성능 또는 채택을 보여주지 못한다면 이 긍정 검토 근거는 약해진다.
원문 근거
LPX는 컴파일러 단계에서 데이터 이동을 100% 계획하는 결정론적 컴퓨팅과 막대한 대역폭의 On-chip SRAM을 통해 대기 시간 없이 토큰을 쏟아냅니다. 압도적 대역폭의 설계 단일 Groq 3 LPU 칩은 500MB의 SRAM(150 TB/s 대역폭)을 탑재하여 B200 대비 용량은 작지만 On-chip 효과 덕에 대역폭이 150TB/s로 HBM4의 22TB/s에 비해서도 약 7배나 높습니다. Decode 작업의 속도를 극대화하기 좋은 칩입니다. 엔비디아는 256개의 Groq 3 LPU를 All-to-All 연결한 랙 스케일(NVIDIA Groq 3 LPX)로 확장하여 총 128GB의 SRAM(R200 GPU 288GB, B200 192GB보다도 작습니다)과 40 PB/s의 메모리 대역폭을 확보했습니다.
판단을 뒷받침하는 근거
- 원문은 NVL72가 Prefill, LPX가 Decode를 맡고 LPX 랙이 3Q26부터 양산 예정이라고 설명한다.
원문 근거
젠슨 황 CEO는 시스템 구성 시 Groq LPX의 비중을 최대 25%까지 할당할 수 있다고 언급하며 아키텍처의 유연성을 강조했습니다. 이러한 분산 처리의 핵심 역할 분담은 다음과 같습니다: Vera Rubin NVL72 (Prefill 담당) : 방대한 컨텍스트를 한 번에 읽고 이해해야 하는 Prefill 단계는 여전히 막대한 연산량과 HBM 용량을 요구합니다. Rubin GPU는 이 동적이고 복잡한 스케줄링 워크로드를 전담하며 KV Cache를 생성합니다. Groq 3 LPX (Decode 담당) : 생성된 KV Cache를 넘겨받아 토큰을 하나씩 반복적으로 생성하는 Decode 작업은 LPX로 라우팅됩니다.
LPX는 컴파일러 단계에서 데이터 이동을 100% 계획하는 결정론적 컴퓨팅과 막대한 대역폭의 On-chip SRAM을 통해 대기 시간 없이 토큰을 쏟아냅니다. 압도적 대역폭의 설계 단일 Groq 3 LPU 칩은 500MB의 SRAM(150 TB/s 대역폭)을 탑재하여 B200 대비 용량은 작지만 On-chip 효과 덕에 대역폭이 150TB/s로 HBM4의 22TB/s에 비해서도 약 7배나 높습니다. Decode 작업의 속도를 극대화하기 좋은 칩입니다. 엔비디아는 256개의 Groq 3 LPU를 All-to-All 연결한 랙 스케일(NVIDIA Groq 3 LPX)로 확장하여 총 128GB의 SRAM(R200 GPU 288GB, B200 192GB보다도 작습니다)과 40 PB/s의 메모리 대역폭을 확보했습니다.
다음 확인 지점
- LPX 랙의 3Q26 양산과 실제 적용 워크로드가 원문에서 제시한 저지연·고부가가치 사용처로 이어지는지 확인한다.
원문 근거
LPX는 컴파일러 단계에서 데이터 이동을 100% 계획하는 결정론적 컴퓨팅과 막대한 대역폭의 On-chip SRAM을 통해 대기 시간 없이 토큰을 쏟아냅니다. 압도적 대역폭의 설계 단일 Groq 3 LPU 칩은 500MB의 SRAM(150 TB/s 대역폭)을 탑재하여 B200 대비 용량은 작지만 On-chip 효과 덕에 대역폭이 150TB/s로 HBM4의 22TB/s에 비해서도 약 7배나 높습니다. Decode 작업의 속도를 극대화하기 좋은 칩입니다. 엔비디아는 256개의 Groq 3 LPU를 All-to-All 연결한 랙 스케일(NVIDIA Groq 3 LPX)로 확장하여 총 128GB의 SRAM(R200 GPU 288GB, B200 192GB보다도 작습니다)과 40 PB/s의 메모리 대역폭을 확보했습니다.
아직 모르는 점
- 실제 고객 도입, 매출 기여와 경쟁 제품 대비 성과는 현재 원문만으로 확인되지 않는다.
원문 근거 4개 펼치기
출처의 해석·전망
- 작성자는 Dynamo가 Vera CPU·Rubin GPU·Groq LPX 혼합 환경에서 배치 크기와 병렬 수준을 분석해 워크로드를 나누며, LPX 비중은 최대 25%까지 가능하다고 설명했다. NVL72는 큰 컨텍스트를 읽고 KV Cache를 만드는 Prefill을, LPX는 이를 받아 토큰을 반복 생성하는 Decode를 맡는다.
보존 원문 발췌
이러한 NVL72의 물리적 한계를 뛰어넘기 위해 LPX가 핵심적인 역할을 합니다. Groq의 결정론적 데이터 프로세서와 On-chip SRAM의 강점을 결합하여 분산 추론 과정의 Decode 단계를 혁신적으로 가속화한 것입니다. 그 결과, 엔비디아는 Throughput과 Latency를 동시에 충족시키며 기존에는 도달할 수 없었던 새로운 파레토 프론티어를 개척해 냈습니다. *Ian Buck이 LPX를 통해 멀티 에이전트 시스템에서 생기는 추론 시장을 선점할 것을 설명하는 발표자료
분산 추론의 완성 : Dynamo, VR200 NVL72 ↔ Groq 3 LPX 지난 GTC 2026 Preview에서 전해드렸던 분산 추론의 방향성이 구체화되었습니다. 핵심은 NVIDIA Dynamo 플랫폼을 활용한 이기종 컴퓨팅 환경의 유연한 통합입니다. 고객이 Vera CPU, Rubin GPU, Groq LPX 등 다양한 하드웨어를 혼합하여 구축할 경우, Dynamo는 batch size와 병렬 처리 수준을 지능적으로 분석해 최적의 하드웨어로 워크로드를 분산시킵니다.
젠슨 황 CEO는 시스템 구성 시 Groq LPX의 비중을 최대 25%까지 할당할 수 있다고 언급하며 아키텍처의 유연성을 강조했습니다. 이러한 분산 처리의 핵심 역할 분담은 다음과 같습니다: Vera Rubin NVL72 (Prefill 담당) : 방대한 컨텍스트를 한 번에 읽고 이해해야 하는 Prefill 단계는 여전히 막대한 연산량과 HBM 용량을 요구합니다. Rubin GPU는 이 동적이고 복잡한 스케줄링 워크로드를 전담하며 KV Cache를 생성합니다. Groq 3 LPX (Decode 담당) : 생성된 KV Cache를 넘겨받아 토큰을 하나씩 반복적으로 생성하는 Decode 작업은 LPX로 라우팅됩니다.
LPX는 컴파일러 단계에서 데이터 이동을 100% 계획하는 결정론적 컴퓨팅과 막대한 대역폭의 On-chip SRAM을 통해 대기 시간 없이 토큰을 쏟아냅니다. 압도적 대역폭의 설계 단일 Groq 3 LPU 칩은 500MB의 SRAM(150 TB/s 대역폭)을 탑재하여 B200 대비 용량은 작지만 On-chip 효과 덕에 대역폭이 150TB/s로 HBM4의 22TB/s에 비해서도 약 7배나 높습니다. Decode 작업의 속도를 극대화하기 좋은 칩입니다. 엔비디아는 256개의 Groq 3 LPU를 All-to-All 연결한 랙 스케일(NVIDIA Groq 3 LPX)로 확장하여 총 128GB의 SRAM(R200 GPU 288GB, B200 192GB보다도 작습니다)과 40 PB/s의 메모리 대역폭을 확보했습니다.
상승 관점 보조 신호 · 가격 충격·지속성·후속 근거
장대양봉급 뉴스
근거 미확인- 이 자료에서 판단할 근거를 확보하지 못했습니다.
지속 턴어라운드
근거 미확인- 이 자료에서 판단할 근거를 확보하지 못했습니다.
셀온 뒤 재상승 근거
근거 미확인- 이 자료에서 판단할 근거를 확보하지 못했습니다.