상승 전환추적 후보Codex 검토Groq 인수는 엔비디아가 Decode 저지연 역량을 시스템에 넣어볼 근거지만 제품화는 아직 예상 단계다.기존 자산의 재발견달라진 점엔비디아가 Groq LPU 기술을 라이선스하고 창업자와 핵심 엔지니어를 인수했으며, 작성자는 이를 LPX로 출시할 것으로 예상했다.다르게 볼 이유Codex 검토로는 기존 GPU 중심 시스템이 대응하기 어려웠던 저지연 Decode 레인을 보완할 가능성을 다시 볼 근거다. 다만 이는 작성자의 기술 해석과 출시 예상에 기반한다.남은 확인SRAM은 용량이 제한되고 GB당 비용이 HBM보다 10배 이상 높으며, GroqNode도 CPU·DDR·SSD와 결합해 구성됐다.
원문을 바탕으로 한 Codex의 독립 판단입니다. 출처가 전한 사실·해석과 구분해 읽을 수 있습니다.
분석 대상 · 엔비디아의 Groq 인수
이전에는
이전 상태의 비교 근거가 이 분석에 정리되지 않았습니다.
새롭게 달라진 점
엔비디아가 Groq LPU 기술을 라이선스하고 창업자와 핵심 엔지니어를 인수했으며, 작성자는 이를 LPX로 출시할 것으로 예상했다.
원문 근거
이를 가능케하는 Groq의 핵심역량은 크게 세 가지입니다. ⓐsoftware-first, ⓑdeterministic compute and networking, ⓒon-chip SRAM입니다. 편하게 설명을 드리려면 ⓒSRAM의 하드웨어적인 한계를 먼저 풀고나서 그리고 ⓐⓑ결정론적 컴퓨팅과 소프트웨어를 설명드리는 게 좋을 것 같습니다. On-chip SRAM SRAM의 장점과 한계점도 분명합니다. SRAM의 대역폭은 HBM보다 훨씬 높고 지연시간도 상당히 짧습니다. 하지만 용량이 제한적이고, GB당 비용은 HBM보다 10배 이상 높습니다. Groq 1세대 칩은 230MB의 SRAM이 통합되어 있는데, 랙당 576개의 LPU를 하나로 묶어도 용량은 132.5GB 정도밖에 되지 않습니다.
다르게 볼 이유
Codex 검토로는 기존 GPU 중심 시스템이 대응하기 어려웠던 저지연 Decode 레인을 보완할 가능성을 다시 볼 근거다. 다만 이는 작성자의 기술 해석과 출시 예상에 기반한다.
원문 근거
이를 가능케하는 Groq의 핵심역량은 크게 세 가지입니다. ⓐsoftware-first, ⓑdeterministic compute and networking, ⓒon-chip SRAM입니다. 편하게 설명을 드리려면 ⓒSRAM의 하드웨어적인 한계를 먼저 풀고나서 그리고 ⓐⓑ결정론적 컴퓨팅과 소프트웨어를 설명드리는 게 좋을 것 같습니다. On-chip SRAM SRAM의 장점과 한계점도 분명합니다. SRAM의 대역폭은 HBM보다 훨씬 높고 지연시간도 상당히 짧습니다. 하지만 용량이 제한적이고, GB당 비용은 HBM보다 10배 이상 높습니다. Groq 1세대 칩은 230MB의 SRAM이 통합되어 있는데, 랙당 576개의 LPU를 하나로 묶어도 용량은 132.5GB 정도밖에 되지 않습니다.
이런 관점에서 Groq은 아예 메모리 계층을 극단적으로 단순화하고, 실행의 변동성 자체를 소프트웨어로 제거하는 강점을 가진 시스템을 가졌습니다. 엔비디아는 이를 Vera Rubin 그리고 그 이후의 Feynman과 녹여내어 전체의 퍼포먼스를 끌어올릴 예정입니다. 특정 추론 구간을 SRAM/결정론적 실행으로 빠르게 처리해주는 별도의 레인을 만드는 것입니다. Rubin CPX가 Prefill을 가속화하기 위한 작업이라면, LPX(가칭)은 Decode를 가속화하기 위한 것에 쓰일 것으로 예상합니다. 이제 단일 GPU나 ASIC의 최적화를 넘어서 시스템 전체의 분산 추론(Disaggregation)과 스마트 라우팅(Routing)이 새로운 X Factor가 될 것이란 예상입니다.
오픈AI의 GPT-5에서도 작업별 성격에 따라 라우팅이 중요했던 것처럼 하드웨어 인프라에서도 비슷한 길을 가고 있습니다. 결정론적 작업은 Groq LPU : Decode에서 토큰을 하나씩 반복적으로 생성하는 작업이나, MoE(Mixture of Experts) 모델에서 어떤 전문가 모델을 호출할지 결정하는 Gating 네트워크처럼 예측 가능하고 동시성이 높은 작업이 이곳으로 배정됩니다. Low Latency가 필요하 분야입니다. 동적 스케줄링 작업은 Rubin GPU : 각종 동적이고 복잡한 스케줄링이 여전히 필요한 작업에서는 막대한 메모리 용량을 가진 Rubin GPU 및 기존의 엔비디아 칩들의 몫입니다. 하이엔드이자 다기능 워크로드는 여전히 GPU를 대체할 수 없습니다.
판단을 뒷받침하는 근거
- Groq는 온칩 SRAM과 결정론적 실행으로 낮은 지연시간을 목표로 하며, 작성자는 엔비디아 IP와의 시너지를 기대했다.
원문 근거
이를 가능케하는 Groq의 핵심역량은 크게 세 가지입니다. ⓐsoftware-first, ⓑdeterministic compute and networking, ⓒon-chip SRAM입니다. 편하게 설명을 드리려면 ⓒSRAM의 하드웨어적인 한계를 먼저 풀고나서 그리고 ⓐⓑ결정론적 컴퓨팅과 소프트웨어를 설명드리는 게 좋을 것 같습니다. On-chip SRAM SRAM의 장점과 한계점도 분명합니다. SRAM의 대역폭은 HBM보다 훨씬 높고 지연시간도 상당히 짧습니다. 하지만 용량이 제한적이고, GB당 비용은 HBM보다 10배 이상 높습니다. Groq 1세대 칩은 230MB의 SRAM이 통합되어 있는데, 랙당 576개의 LPU를 하나로 묶어도 용량은 132.5GB 정도밖에 되지 않습니다.
High Throughput이 필요한 분야입니다. 그리고 Prefill에 한해서는 컨텍스트 처리를 대신해줄 Rubin CPX가 도와줄 것입니다. 결과적으로는 두 차선 모두 꽉차게 될 것이라 예상합니다. 토큰 추론비용이 낮아짐으로 인해서 생기는 제번스의 역설로 하여금 AI 워크로드를 더욱 더 빠르게 늘릴 것이기 때문입니다. Groq의 추론 성능을 극한까지 끌어올리기 어려웠던 이유는 데이터 흐름을 설계함에 있어서 컴파일러/소프트웨어~네트워킹 단위에서의 작업을 오차없이 맞추기 어려웠기 때문입니다. 그런데 그런 역량을 가장 많이 갖고 있는 팀이 엔비디아이기에, 엔비디아의 IP와 만나서 시너지를 크게 끌어올릴 수 있을 것이란 기대를 하고 있습니다. 어떤 모습으로 녹여낼 것인지에 대한 답을 제시할, GTC 2026을 기대해봅니다.
<엔비디아가 $20B를 주고 데려온 남자 : Groq 창업자 조나단 로스의 통찰>을 참고하시면 좋습니다. 결정론적 컴퓨팅 및 네트워킹 여기서 중요한 건 ⓐⓑ결정론적 컴퓨팅 및 네트워킹(deterministic compute and networking)과 이를 가능케하는 소프트웨어입니다. 칩이 작동하기 전에 컴파일러가 데이터의 이동과 연산 스케줄을 100% 미리 계획합니다. 실행 중 발생하는 병목이나 대기 시간이 없으므로, 토큰 단위의 생성 속도가 극단적으로 빠릅니다. AI 추론에서 현재 비용이 높아지는 건 컴퓨팅 그자체라기보다 각종 기다림으로 인해서 생기는 비용이 늘고 있기 때문입니다. 기다림의 비용을 줄이기 위해서 메모리(HBM, LPDDR5, GDDR5)도 GPU와 더 가까이에 더 많이 집어넣으려 하는 것이고, 그래서 네트워킹/인터커넥트에도 더 투자하는 것입니다.
반대 근거·남은 조건
- SRAM은 용량이 제한되고 GB당 비용이 HBM보다 10배 이상 높으며, GroqNode도 CPU·DDR·SSD와 결합해 구성됐다.
원문 근거
B200 단일 칩의 HBM 용량 192GB보다도 작은 규모입니다. 이미 GroqNode 랙스케일 제품 자체에서도 SRAM 용량 제약으로 인해 고성능 CPU(AMD EPYC 7313 2개) 및 대용량 DDR 메모리 풀(1TB DDR4-3200 ECC DRAM & 7.68TB PCIe NVMe SSD)과의 조합으로 랙을 구성했었습니다. HBM, 서버 DRAM, NAND 등의 역할을 대체하진 않는다는 의미입니다. GPU+HBM 조합은 기본적으로 High Throughput에 초점을 맞추고 있고, LPU+On-chip SRAM 조합은 기본적으로 Low Latency에 초점을 맞추고 있습니다. High throughput과 Low Latency에는 trade-off가 있어서 엔비디아 입장에서는 Low Latency를 요구하는 특정 워크로드에 대응할 수 없던 상태였는데 이 빈자리를 정확히 채웠습니다.
다음 확인 지점
- LPX의 실제 제품 사양과 출시 형태가 확인되는지 본다.
원문 근거
이를 가능케하는 Groq의 핵심역량은 크게 세 가지입니다. ⓐsoftware-first, ⓑdeterministic compute and networking, ⓒon-chip SRAM입니다. 편하게 설명을 드리려면 ⓒSRAM의 하드웨어적인 한계를 먼저 풀고나서 그리고 ⓐⓑ결정론적 컴퓨팅과 소프트웨어를 설명드리는 게 좋을 것 같습니다. On-chip SRAM SRAM의 장점과 한계점도 분명합니다. SRAM의 대역폭은 HBM보다 훨씬 높고 지연시간도 상당히 짧습니다. 하지만 용량이 제한적이고, GB당 비용은 HBM보다 10배 이상 높습니다. Groq 1세대 칩은 230MB의 SRAM이 통합되어 있는데, 랙당 576개의 LPU를 하나로 묶어도 용량은 132.5GB 정도밖에 되지 않습니다.
- Groq 기술이 Rubin 시스템에서 어떤 워크로드로 통합되는지 확인한다.
원문 근거
이런 관점에서 Groq은 아예 메모리 계층을 극단적으로 단순화하고, 실행의 변동성 자체를 소프트웨어로 제거하는 강점을 가진 시스템을 가졌습니다. 엔비디아는 이를 Vera Rubin 그리고 그 이후의 Feynman과 녹여내어 전체의 퍼포먼스를 끌어올릴 예정입니다. 특정 추론 구간을 SRAM/결정론적 실행으로 빠르게 처리해주는 별도의 레인을 만드는 것입니다. Rubin CPX가 Prefill을 가속화하기 위한 작업이라면, LPX(가칭)은 Decode를 가속화하기 위한 것에 쓰일 것으로 예상합니다. 이제 단일 GPU나 ASIC의 최적화를 넘어서 시스템 전체의 분산 추론(Disaggregation)과 스마트 라우팅(Routing)이 새로운 X Factor가 될 것이란 예상입니다.
오픈AI의 GPT-5에서도 작업별 성격에 따라 라우팅이 중요했던 것처럼 하드웨어 인프라에서도 비슷한 길을 가고 있습니다. 결정론적 작업은 Groq LPU : Decode에서 토큰을 하나씩 반복적으로 생성하는 작업이나, MoE(Mixture of Experts) 모델에서 어떤 전문가 모델을 호출할지 결정하는 Gating 네트워크처럼 예측 가능하고 동시성이 높은 작업이 이곳으로 배정됩니다. Low Latency가 필요하 분야입니다. 동적 스케줄링 작업은 Rubin GPU : 각종 동적이고 복잡한 스케줄링이 여전히 필요한 작업에서는 막대한 메모리 용량을 가진 Rubin GPU 및 기존의 엔비디아 칩들의 몫입니다. 하이엔드이자 다기능 워크로드는 여전히 GPU를 대체할 수 없습니다.
아직 모르는 점
- 원문은 LPX의 확정 출시·성능·매출 기여를 제시하지 않는다
원문 근거 6개 펼치기
출처가 전한 사실
- 엔비디아는 Groq LPU 기술을 라이선스하고 창업자 및 핵심 엔지니어를 200억달러에 인수했다고 설명했다.
출처의 해석·전망
- Groq의 낮은 지연시간·결정론적 실행 역량을 Vera Rubin과 이후 Feynman에 녹이면 전체 성능의 시너지를 크게 끌어올릴 수 있을 것으로 기대한다.
- Groq는 온칩 SRAM과 사전 계획된 데이터 이동·연산 스케줄로 Decode처럼 예측 가능한 작업의 대기 시간을 줄이는 구조이며, 기존 GPU+HBM의 고처리량 중심 구조가 대응하지 못한 저지연 워크로드를 채운다고 설명했다.
보존 원문 발췌
이를 가능케하는 Groq의 핵심역량은 크게 세 가지입니다. ⓐsoftware-first, ⓑdeterministic compute and networking, ⓒon-chip SRAM입니다. 편하게 설명을 드리려면 ⓒSRAM의 하드웨어적인 한계를 먼저 풀고나서 그리고 ⓐⓑ결정론적 컴퓨팅과 소프트웨어를 설명드리는 게 좋을 것 같습니다. On-chip SRAM SRAM의 장점과 한계점도 분명합니다. SRAM의 대역폭은 HBM보다 훨씬 높고 지연시간도 상당히 짧습니다. 하지만 용량이 제한적이고, GB당 비용은 HBM보다 10배 이상 높습니다. Groq 1세대 칩은 230MB의 SRAM이 통합되어 있는데, 랙당 576개의 LPU를 하나로 묶어도 용량은 132.5GB 정도밖에 되지 않습니다.
이런 관점에서 Groq은 아예 메모리 계층을 극단적으로 단순화하고, 실행의 변동성 자체를 소프트웨어로 제거하는 강점을 가진 시스템을 가졌습니다. 엔비디아는 이를 Vera Rubin 그리고 그 이후의 Feynman과 녹여내어 전체의 퍼포먼스를 끌어올릴 예정입니다. 특정 추론 구간을 SRAM/결정론적 실행으로 빠르게 처리해주는 별도의 레인을 만드는 것입니다. Rubin CPX가 Prefill을 가속화하기 위한 작업이라면, LPX(가칭)은 Decode를 가속화하기 위한 것에 쓰일 것으로 예상합니다. 이제 단일 GPU나 ASIC의 최적화를 넘어서 시스템 전체의 분산 추론(Disaggregation)과 스마트 라우팅(Routing)이 새로운 X Factor가 될 것이란 예상입니다.
High Throughput이 필요한 분야입니다. 그리고 Prefill에 한해서는 컨텍스트 처리를 대신해줄 Rubin CPX가 도와줄 것입니다. 결과적으로는 두 차선 모두 꽉차게 될 것이라 예상합니다. 토큰 추론비용이 낮아짐으로 인해서 생기는 제번스의 역설로 하여금 AI 워크로드를 더욱 더 빠르게 늘릴 것이기 때문입니다. Groq의 추론 성능을 극한까지 끌어올리기 어려웠던 이유는 데이터 흐름을 설계함에 있어서 컴파일러/소프트웨어~네트워킹 단위에서의 작업을 오차없이 맞추기 어려웠기 때문입니다. 그런데 그런 역량을 가장 많이 갖고 있는 팀이 엔비디아이기에, 엔비디아의 IP와 만나서 시너지를 크게 끌어올릴 수 있을 것이란 기대를 하고 있습니다. 어떤 모습으로 녹여낼 것인지에 대한 답을 제시할, GTC 2026을 기대해봅니다.
B200 단일 칩의 HBM 용량 192GB보다도 작은 규모입니다. 이미 GroqNode 랙스케일 제품 자체에서도 SRAM 용량 제약으로 인해 고성능 CPU(AMD EPYC 7313 2개) 및 대용량 DDR 메모리 풀(1TB DDR4-3200 ECC DRAM & 7.68TB PCIe NVMe SSD)과의 조합으로 랙을 구성했었습니다. HBM, 서버 DRAM, NAND 등의 역할을 대체하진 않는다는 의미입니다. GPU+HBM 조합은 기본적으로 High Throughput에 초점을 맞추고 있고, LPU+On-chip SRAM 조합은 기본적으로 Low Latency에 초점을 맞추고 있습니다. High throughput과 Low Latency에는 trade-off가 있어서 엔비디아 입장에서는 Low Latency를 요구하는 특정 워크로드에 대응할 수 없던 상태였는데 이 빈자리를 정확히 채웠습니다.
<엔비디아가 $20B를 주고 데려온 남자 : Groq 창업자 조나단 로스의 통찰>을 참고하시면 좋습니다. 결정론적 컴퓨팅 및 네트워킹 여기서 중요한 건 ⓐⓑ결정론적 컴퓨팅 및 네트워킹(deterministic compute and networking)과 이를 가능케하는 소프트웨어입니다. 칩이 작동하기 전에 컴파일러가 데이터의 이동과 연산 스케줄을 100% 미리 계획합니다. 실행 중 발생하는 병목이나 대기 시간이 없으므로, 토큰 단위의 생성 속도가 극단적으로 빠릅니다. AI 추론에서 현재 비용이 높아지는 건 컴퓨팅 그자체라기보다 각종 기다림으로 인해서 생기는 비용이 늘고 있기 때문입니다. 기다림의 비용을 줄이기 위해서 메모리(HBM, LPDDR5, GDDR5)도 GPU와 더 가까이에 더 많이 집어넣으려 하는 것이고, 그래서 네트워킹/인터커넥트에도 더 투자하는 것입니다.
오픈AI의 GPT-5에서도 작업별 성격에 따라 라우팅이 중요했던 것처럼 하드웨어 인프라에서도 비슷한 길을 가고 있습니다. 결정론적 작업은 Groq LPU : Decode에서 토큰을 하나씩 반복적으로 생성하는 작업이나, MoE(Mixture of Experts) 모델에서 어떤 전문가 모델을 호출할지 결정하는 Gating 네트워크처럼 예측 가능하고 동시성이 높은 작업이 이곳으로 배정됩니다. Low Latency가 필요하 분야입니다. 동적 스케줄링 작업은 Rubin GPU : 각종 동적이고 복잡한 스케줄링이 여전히 필요한 작업에서는 막대한 메모리 용량을 가진 Rubin GPU 및 기존의 엔비디아 칩들의 몫입니다. 하이엔드이자 다기능 워크로드는 여전히 GPU를 대체할 수 없습니다.
상승 관점 보조 신호 · 가격 충격·지속성·후속 근거
장대양봉급 뉴스
근거 미확인- 이 자료에서 판단할 근거를 확보하지 못했습니다.
지속 턴어라운드
근거 미확인- 이 자료에서 판단할 근거를 확보하지 못했습니다.
셀온 뒤 재상승 근거
근거 미확인- 이 자료에서 판단할 근거를 확보하지 못했습니다.