26-7 문샷 키미 K3 공개
작성자의 핵심 판단
작성자는 Kimi-K3를 스케일링 법칙과 더 큰 컴퓨팅 수요가 이어짐을 보여주는 사례로 본다.
근거 보기 2
- 원문 구간 1
모델 규모를 키우면 성능이 계속해서 개선되는 스케일링 법칙이 여전히 유효함을 다시 한 번 입증한 모델입니다. 파라미터 규모를 키우면 데이터 규모와 FLOPS도 키워야 하고, 데이터 중 대부분이 RL을 통해 나오는 합성 데이터임을 생각해볼 때, 바꿔 말하자면 더 많은 컴퓨팅이 AI가 창출할 수 있는 부가가치의 TAM을 더 크게 키우는 흐름이 계속해서 유지되고 있다는 의미입니다. 이제 GB200/GB300 NVL72 클러스터로 사전훈련한 모델이 나오기 시작한 만큼, 올해 말까지는 1GW급 클러스터에서 훈련한 모델들이 줄줄이 출시될 것으로 예상합니다. 벤치마크들로만 보기에는 아직 정확히 어느 수준이라고 파악하기가 어려워보입니다.
- 원문 구간 2
오픈AI, xAI, MSL이 모두 총 파라미터 규모 기준 1.0T → 1.5T → 3.0T으로 키워가며 모델의 성능을 끌어올리는 과정에 있습니다. 알렉산더 왕 인터뷰에서 언급한 '스케일링의 사다리'의 함의라 생각합니다. 일례로 과거에 오픈AI의 경우 GPT-2에서 이미 성공했던 레시피를 GPT-3, GPT-4는 그대로 확장했기 때문에 당시 다들 GPT-4까지는 매우 놀라운 모델이 나올 것임에 대해서 나름의 확신 레벨이 높았던 때였습니다. 지금도 그런 스케일링의 사다리가 작용하고 있단 의미입니다. 이에 대해서는 스타게이트 애빌린이 300MW(2026년 3월) → 600MW(5월) → 900MW(6~7월) → 1.2GW급(10~12월)으로 확장해감에 따라 GPT-5.6 이후의 모델에 대해서도 기대한다는 맥락을 이번 주 주간전략보고에서 전해드렸습니다.
이 자료에서 다룬 사실
Kimi-K3는 총 2.8T 파라미터와 896개 Expert 중 16개 활성 구조로 제시됐으며 API 가격은 입력 3달러·출력 15달러다.
근거 보기 3
- 원문 구간 1
모델 규모를 키우면 성능이 계속해서 개선되는 스케일링 법칙이 여전히 유효함을 다시 한 번 입증한 모델입니다. 파라미터 규모를 키우면 데이터 규모와 FLOPS도 키워야 하고, 데이터 중 대부분이 RL을 통해 나오는 합성 데이터임을 생각해볼 때, 바꿔 말하자면 더 많은 컴퓨팅이 AI가 창출할 수 있는 부가가치의 TAM을 더 크게 키우는 흐름이 계속해서 유지되고 있다는 의미입니다. 이제 GB200/GB300 NVL72 클러스터로 사전훈련한 모델이 나오기 시작한 만큼, 올해 말까지는 1GW급 클러스터에서 훈련한 모델들이 줄줄이 출시될 것으로 예상합니다. 벤치마크들로만 보기에는 아직 정확히 어느 수준이라고 파악하기가 어려워보입니다.
- 원문 구간 2
많이는 안 쓰는 에이전트 사용 사례에서는 모델만큼이나 하네스가 중요하기 때문입니다. Kimi-K3의 API 백만토큰당 가격은 Input $3/Output $15입니다. ⓐSonnet 5($3/$15), ⓑGPT-5.6 Terra($2.5/$15), ⓒGemini 3.1 Pro($2/$12)와 비슷했습니다. 프론티어 모델인 Fable 5($10/$50), GPT-5.6 Sol($5/$30), Opus 4.8($5/$25)보다는 저렴하지만 그정도 스펙이 나오진 않습니다. 그리고 요즘은 작업당 비용을 잘 봐야 합니다. 프론티어 AI Labs의 모델 백만토큰당 가격이 비싸보이지만 그걸 많이 쓰는 이유 중에는 토큰 압축비가 좋아서 작업당 비용으로 보면 아래 모델들과 별 차이가 안 나기 때문도 있습니다.
- 원문 구간 3
간단하게 정리드리자면 느낌상 뭔가 모델과 워크로드가 굉장히 복잡해지고 생략을 더 많이 하는 과정으로 갈수록 GPU에 유리한 구조입니다. Kimi-K3의 총 파라미터 2.8T인데 896개 Expert 중 16개를 활성화하는 모델입니다. 바꿔 생각하자면 2.8T를 896개로 나누면 Expert 1개당 대략 3.125B이므로 16개면 한 토큰을 생성할 때 활성화되는 Active Parameter는 50B입니다. Dense는 전체를 활성화시키는 것이라 Total Parameter = Active Parameter인 구조라, Dense 50B 모델의 추론비용 수준으로 2.8T 모델을 추론하는 구조입니다.
그렇게 판단한 이유
Active Parameter를 50B로 낮춰도 all-to-all 통신과 고대역폭 네트워크가 중요하며, 작업당 비용은 토큰 단가만으로 판단할 수 없다고 설명한다.
근거 보기 2
- 원문 구간 1
예를 들어 GPT-5.6 Sol의 작업당 비용(벤치마크 기준)은 $1.04였는데 Kimi-K3는 $0.94였습니다. 백만토큰당 비용으로만 보자면 $3/$15 vs $5/$30이니 K3가 절반가량 더 싸야 맞는데 같은 지능 수준에 도달하기 위해서 CoT를 더 길게 하고 있단 의미입니다. DeepSeek-V4도 그렇고 Kimi-K3도 그렇고 Qwen 3.8은 아직 공개가 안됐지만 모두 비슷하게 엔비디아 HW에 맞게 엄청난 최적화들을 공격적으로 시도하여 효율을 높이고 있습니다. 엔비디아 HW의 특성에 대해서는 <AI 가속기 심화편 : GPU vs TPU, 무엇이 칩을 다르게 만드나>에서 전해드린 것처럼 GPU는 훨씬 더 동적으로 스케쥴링하는 세팅이고 TPU는 더 정적으로 대규모 행렬곱 연산에 특화된 세팅입니다.
- 원문 구간 2
물론 FLOPS 자체는 이정도로 줄일 수 있지만 대신 all-to-all 통신을 어떻게 관리하느냐의 영역이 중요해지므로 비용이 사라졌다기보다 엔비디아의 방식으로는 충분히 해결할 수 있는 구조로 모델이 짜여지고 있는 사례입니다. 여기서 엔비디아의 방식이란 NVLink를 통한 고대역폭의 Switched Scale-up Network를 의미합니다. Moonshot 팀이 Kimi-K3를 가장 TCO 대비 퍼포먼스가 좋게끔 서빙하는 방법으로 권장하는 사양도 GB200/GB300 NVL72 구조입니다. TPU의 SuperPod 구조도 좋기는 한데 문제는 all-to-all 통신이 이렇게 많이 일어나는 환경에서는 hop이 병목이 되니 HW를 옮길 수야 있겠지만 그닥 효율은 높지 않을 것으로 예상됩니다.