엔비디아의 Groq 비독점 계약과 인수 추진
작성자의 핵심 판단
작성자는 이 움직임을 엔비디아가 범용 GPU만이 아니라 워크로드별 특화 영역까지 포괄하려는 방향으로 본다.
근거 보기 2
- 원문 구간 1
모델이 CoT를 통해서 여러 번의 컨텍스트를 처리해가며 답하게 되어 있고, 여러 병렬 스트림을 생성하며 답합니다. 오픈AI와 구글 모두 Pro 모델로 이러한 매커니즘을 출시했는데, 단일 CoT만 진행하는 게 아니라 병렬로 Reasoning하는 특징을 갖고 있습니다. 그리고 추론의 다른 영역도 있습니다. KV Cache를 만드는 칩입니다. 엔비디아는 이것을 위한 칩을 이미 만들었습니다. CPX입니다. Prefill을 위해 CPX를 만들고, Decode를 위해 Groq을 인수했으며, 여전히 범용 GPU를 갖고 있습니다. 엔비디아는 자신들이 선두 주자라는 것을 알고 있습니다. 중심에 있습니다. 한편으로는 다른 모든 사람들보다 더 빨리 달릴 수 있지만, 계속해서 구글이나 오픈AI 또는 다른 회사의 ASIC보다 2배 더 좋다는 것을 정당화하기는 어려운 것이기도 합니다. GPM 75%를 정당화하기 위해 말이죠. 이제 중요한 건,'과연 어떤 하드웨어 아키텍처가 그것을 구현해 낼 것인가'입니다. 물론 GPU의 프로그래밍 가능성을 유지하는 것은 AI 훈련이나 다양한 워크로드를 처리하는 데 아주 훌륭한 강점입니다. 하지만 앞으로 많은 사람들은 그저 오픈소스 모델과 추론 프레임워크를 다운로드한 뒤, 바로 실행 버튼을 누르는 방식을 택할 것입니다. 현실은 그것보다 조금 더 복잡하겠지만 수많은 일반 기업과 스타트업, 테크 회사들의 소비 방식은 바로 그런 형태가 될 것입니다.
- 원문 구간 2
직접 다운로드해서 실행하거나, 아니면 클라우드에서 GPU나 칩을 대여한 다음 오픈소스 프레임워크와 모델을 올려 곧바로 구동하는 식이 되겠죠. 엔비디아 역시 이런 흐름을 정확히 인식하고 있으며, 모든 것에 두루 쓰이는 범용이 아닌 특정 목적을 위한 맞춤형 제품의 시장성도 분명 존재한다고 판단하고 있습니다. 당연히 범용 GPU가 여전히 모델 훈련의 주축을 담당하고, 대다수의 일반적이거나 비용 효율적인 추론 작업에서 메인 라인 역할을 할 것입니다. 하지만 압도적으로 빠른 속도를 요구하거나, KV Cache를 생성하는 것처럼 Prefill 과정이 막대하게 필요한 워크로드들도 있습니다. 이런 특수한 워크로드에는 범용 GPU가 아닌 다른 형태의 칩이 필요할 수 있습니다. 엔비디아가 발표한 CPX 칩이 바로 그런 맥락입니다. 그들은 이 칩이 컨텍스트 처리, 즉 KV Cache 생성을 위한 것이라고 설명하죠. 또한 비디오 모델은 상대적으로 메모리 대역폭의 영향을 크게 받지 않기 때문에 비디오 모델을 구동하는 데에도 이 칩이 매우 유용합니다. *코멘트 → 이전에 메모리가 부각받는 이유에 대해 설명했던 <추론의 시대, 핵심이 된 메모리 : 메모리 쇼티지를 떠받치고 있는 힘> 자료에서 전해드렸었지만 KV Cache에 대해서 정리드리고, 개인적인 생각들도 쭉 적어봅니다. KV Cache와 Context Window의 딜레마
이 자료에서 다룬 사실
인터뷰는 엔비디아가 Groq과 비독점 계약을 맺고 인수를 진행한다고 전한다. Groq은 훈련·초대형 모델·다수 사용자 서비스에는 맞지 않지만 단일 스트림 Decode에서 빠르게 작동하는 칩으로 설명된다.
근거 보기 2
- 원문 구간 1
Firstmark 이전에는 Bloomberg Ventures 설립에 참여한 파트너로 활동하다가 넘어온 경력입니다. 맷 터크 Matt Turck : Groq과 엔비디아부터 얘기를 시작하고 싶네요. 얼마 전 엔비디아가 GPU 하나로 모든 것을 할 수 있다고 말했는데, 이제 Groq과 비독점 계약을 맺고 인수를 진행했는데, 이건 뭘 뜻하는 건가요? 딜런 파텔 Dylan Patel : 아주 명확합니다. 우리는 AI 모델이 향후 몇 년 동안 어떤 방향으로 나아갈지, 아키텍처에 어떤 일이 일어날지 확실하지 않지만, 모두가 동의하는 것은 모델이 상당히 자기회귀적이라는 것입니다. 흥미로운 점은 엔비디아가 이긴 이유는 가장 넓은 표면적에 베팅했고, 사람들이 그 위에 모델을 계속 개발했기 때문이며, 그 모양이 잘 맞았다는 것입니다. 하지만 이제 워크로드가 너무 커져서 특정 도메인에서 10배의 증가를 가져올 수 있는 전문화의 여지가 있습니다. 일반적인 워크로드에서는 Groq이 작동하지 않습니다. 모델을 훈련할 수 없고, 정말 정말 큰 모델을 효율적으로 추론할 수 없습니다. 많은 사용자를 서비스할 수 없습니다. 하지만 매우 빠르게 작동한다는 데 장점이 있습니다. 최근의 오픈AI-세레브라스 거래도 비슷한 맥락이었습니다. 단일 워크로드만 잘 굴리기 위한 칩을 받은 것입니다. Decode 중심적인 워크로드에서 단일 스트림에서 자동 회귀 토큰을 생성하는 것에 특화된 칩입니다.
- 원문 구간 2
모델이 CoT를 통해서 여러 번의 컨텍스트를 처리해가며 답하게 되어 있고, 여러 병렬 스트림을 생성하며 답합니다. 오픈AI와 구글 모두 Pro 모델로 이러한 매커니즘을 출시했는데, 단일 CoT만 진행하는 게 아니라 병렬로 Reasoning하는 특징을 갖고 있습니다. 그리고 추론의 다른 영역도 있습니다. KV Cache를 만드는 칩입니다. 엔비디아는 이것을 위한 칩을 이미 만들었습니다. CPX입니다. Prefill을 위해 CPX를 만들고, Decode를 위해 Groq을 인수했으며, 여전히 범용 GPU를 갖고 있습니다. 엔비디아는 자신들이 선두 주자라는 것을 알고 있습니다. 중심에 있습니다. 한편으로는 다른 모든 사람들보다 더 빨리 달릴 수 있지만, 계속해서 구글이나 오픈AI 또는 다른 회사의 ASIC보다 2배 더 좋다는 것을 정당화하기는 어려운 것이기도 합니다. GPM 75%를 정당화하기 위해 말이죠. 이제 중요한 건,'과연 어떤 하드웨어 아키텍처가 그것을 구현해 낼 것인가'입니다. 물론 GPU의 프로그래밍 가능성을 유지하는 것은 AI 훈련이나 다양한 워크로드를 처리하는 데 아주 훌륭한 강점입니다. 하지만 앞으로 많은 사람들은 그저 오픈소스 모델과 추론 프레임워크를 다운로드한 뒤, 바로 실행 버튼을 누르는 방식을 택할 것입니다. 현실은 그것보다 조금 더 복잡하겠지만 수많은 일반 기업과 스타트업, 테크 회사들의 소비 방식은 바로 그런 형태가 될 것입니다.
그렇게 판단한 이유
Prefill용 CPX, Decode용 Groq 계열 LPX, 범용 GPU를 함께 둬 전체 추론 병목을 낮추려는 구성이 제시됐다.
근거 보기 2
- 원문 구간 1
Decode : 앞선 결과를 기다려야 하는 순차적 작업(Autoregressive)이므로 연산량은 적지만, 메모리에서 데이터를 얼마나 빨리 가져오느냐(Memory-bound)가 관건입니다. 이 서로 다른 성격의 작업을 분리하는 것이 Disaggregated Serving(Inference)입니다. 하지만 추론을 워크로드별로 분리하려면 KV Cache, LLM 인식 라우팅, 효율적인 메모리 관리가 하드웨어~소프트웨어~네트워킹단까지 정밀하게 맞물려야 하는데 이러한 요소를 조율하는 것이 NVIDIA Dynamo입니다. 연산 능력이 압도적으로 뛰어난 노드(Prefill Node)가 긴 프롬프트를 순식간에 읽어내어 거대한 KV Cache를 '생성'합니다. 그리고 초고속 네트워크(NVLink 등)를 통해 이 KV Cache를 메모리 대역폭과 지연 시간(Latency) 최적화에 특화된 다른 노드(Decode Node)로 전송하여 최종 답변을 빠르게 생성하게 만드는 아키텍처입니다. 엔비디아가 가려는 길 그런데 이러한 Disaggregated Inference의 장점을 온전히 살리려면 워크로드별로 특화된 칩들을 통해서 추가적인 가속이 필요합니다. 이것이 CPX, LPX입니다. 결과적으로 엔비디아는 범용 GPU의 장점은 그대로 살리되, Prefill에서는 CPX + Decode에서는 Groq에서 가져온 LPX를 각각 두어 워크로드 전체적인 병목을 최소화하려는 방향입니다.
- 원문 구간 2
흥미로운 건 CPX의 특성이 비디오 생성 모델에도 부합하는 것입니다. 이렇게 되면 Rubin CPX 랙이 출하되기 시작하면서 각종 생성형AI로 만들어진 쇼츠 비디오들이 대규모 늘어날 수도 있겠습니다. 비디오 생성 모델(주로 Diffusion 기반 모델이나 고해상도 시각 연산)은 픽셀이나 Latent space의 거대한 덩어리를 한 번에 병렬로 처리하는 비중이 훨씬 높습니다. 메모리를 순차적으로 읽고 쓰는 속도보다는 한 번에 쏟아지는 막대한 행렬 곱셈을 뚫어내는 Compute-bound 성향이 강하다는 의미입니다. 맷 터크 : 이게 좋은 방법일까요? 라이선스 방식이긴 하지만 실제로는 인수와 비슷한 거래 중 하나잖아요? 딜런 파텔 Dylan Patel : 독과점 규제나 반경쟁적인 측면에서 볼 때, 저는 이런 상황이 확실히 좋지 않다고 생각합니다. 기업들이 아무런 독과점 심사 절차도 거치지 않고 마음대로 다른 회사를 사들일 수 있어서는 안 되겠죠. 물론 대기업이 이제 막 시작하는 스타트업을 인수하는 일반적인 경우라면 저는 전적으로 찬성합니다. 하지만 다른 측면에서 생각해 볼까요? 어떤 인수 거래가 진행 중이라는 사실을 모두가 다 아는 상황 말입니다. 제가 자문으로 있던 회사에서도 비슷한 일이 있었습니다. 엔비디아가 Groq 관련 거래를 하기 불과 몇 달 전에 Enfabrica를 인수했을 때와 비슷한 스타일의 거래였죠.