[원문 유형] 네이버 프리미엄 콘텐츠 [채널] 올바른 미국주식 by SAPIENS [게시일] 2026.01.09. 오후 6:14 [원문 URL] https://contents.premium.naver.com/sapiens/sapiensasset/contents/260109181400067qv [제목] 100조 개 토큰으로 살펴보는 진짜 LLM 사용법 [수집 기준] 승인된 구독 열람권으로 실제 본문을 보존했다. 이미지·첨부는 별도 미디어 원장에 보관하며 시각적 의미 검토 여부를 구분한다. [구독 원문 본문] ​ 안녕하세요 올바른입니다. ​ AI 심화편 자료입니다. 2024년 초부터 2025년 말까지의 LLM 실사용량 데이터를 기반으로 100조 개의 토큰을 분석하여, 현재 LLM 시장이 어떤 모습인지를 정리한 자료입니다. ​ 폐쇄소스 모델과 오픈소스 모델 간의 점유율, LLM 사용량 중 Reasoning이 차지하는 비율, AI Labs들의 주요 모델들은 각각 주로 어떤 카테고리에 강한지가 담겨 있습니다. ​ 돈이 되는 워크로드는 어디로 흐르는지, Product-Market Fit의 시대를 지나 Workload-Model Fit의 시대로 가고 있는 이유, 지역별 토큰 사용량 점유율 등에 대해 살펴봤습니다. 살펴보셨으면 하는 글들 2026-01-02 엔비디아가 $20B를 주고 데려온 남자 : Groq 창업자 조나단 로스의 통찰 (바로가기) 2025-12-24 구글 AI 인프라 책임자의 경고 : '우리는 여전히 수요를 심각하게 과소평가하고 있다' (바로가기) 2025-12-19 블랙록 2026 전망 : AI CAPEX $8T 시대를 열기 위한 '금융 보릿고개'를 지나는 중 (바로가기) 2025-12-17 AI 버블론을 잠재우는 숫자들 : 엔터프라이즈 AI $37B 시장의 현주소 (바로가기) 2025-12-04 엔비디아 펀더멘탈 체크 : 구글 TPU의 추격? 시장점유율에 대한 생각, 아시아 공급망 체크 (바로가기) 2025-10-08 오픈AI 퇴사자의 글 #1 : 2027년 AGI가 온다 (바로가기) 2025-10-03 엔비디아 CEO 젠슨황 인터뷰 : 오픈AI 10GW 동맹 x 극한의 풀스택 공동 설계 (바로가기) 2025-09-26 AI 사이클 한 눈에 보기, SemiAnalysis 인터뷰 : 승부사 젠슨황 그리고 화웨이의 역습 (바로가기) 투자자문 서비스에 따른 투자 시 원금 손실이 발생할 수 있으며, 투자 손익에 대한 책임은 전적으로 고객에게 귀속됩니다. 또한 과거의 투자수익이 미래의 수익률을 보장하지 않습니다. ​ 신규 구독 전에, 아래 투자자문계약 권유문서의 계약 관련 제반 사항을 반드시 읽으시고 충분히 검토하시기 바랍니다. ​ *투자자문계약 권유문서 : https://naver.me/5ZST47Qf 목차 ​ 100조 개 토큰을 살펴보다 : OpenRouter를 통한 LLM 산업분석 오픈소스 모델 vs 폐쇄소스 모델 : 30% vs 70% Reasoning이 새로운 기본값 : 더 길어진 시퀀스, 프로그래밍이 메인이다 LLM은 어디에 가장 많이 쓰이나? : AI Labs들은 각각 어느 워크로드에 가장 많이 쓰이나? 지역별 LLM 사용량 : 북미 47%, 아시아 29%, 유럽 21% 왜 '1위' 모델이 되는 게 중요한가? : 선발주자 이점과 신데렐라의 '유리 구두' 현상 ​ 100조 개 토큰을 살펴보다 OpenRouter를 통한 LLM 산업분석 ​ LLM 시장은 어디서 와서 어디로 가고 있는가? 이번 자료는 OpenRouter가 자사 플랫폼을 통해서 실제로 고객사들이 2024년 11월 3일부터 2025년 11월 30일까지 쓴 100조 개의 토큰을 분석하여, LLM 모델에 대한 전반적인 뷰를 얻기 위한 자료입니다. ​ OpenAI o1, "Strawberry 🍓" 1년 전만 하더라도 LLM 업계는 지금과 완전히 달랐습니다. ​ 오픈AI의 o1(코드명 Strawberry)가 나오기 전(2024년 9월에 o1-preview 출시)까지만 해도 LLM은 단순하게 사전훈련된 데이터에서 질문을 받자마자 곧바로 답을 출력하는 방식이었습니다. o1은 현재 'Reasoning'으로 불리는 Test-time compute를 선보였습니다. 최종 출력물을 말하기 전에 내부적으로 여러 단계에 걸쳐 숙고하고, 반복적으로 스스로 되묻는 과정을 거치면서 보다 정돈된 답을 내놓는 첫 모델이었습니다. 이후 24년 12월 Gemini 2.0 Flash Thinking(preview)이 출시되고, 2025년 1월에 DeepSeek-R1이 출시된 흐름입니다. ​ 그리고 오픈AI가 2024년 12월에 병렬식(Parallel) test-time compute 구조인 o1-pro를 발표했었습니다. 여러 모델이 서로 검증하면서 최선의 답을 내놓는 구조입니다. 이후에 다시 이 구조가 2025년 5월 20일에 Gemini 2.5 Deep Think에 채택되고, 5월 23일 Claude 4에 채택됐으며, 7월 9일에 Grok 4 Heavy에서 쓰였습니다. 이후 업계를 주도할 새로운 패러다임이 나오진 않았습니다. LLM 사용에 대한 실증 연구 논문 보통은 설문조사를 통한 내용이 많았는데 실제 사용자들의 데이터를 살펴본 건 이번 OpenRouter 자료가 처음입니다. OpenRouter 자체가 다양한 모델들의 요청을 오케스트레이션 하는 플랫폼이기 때문에 개발자와 최종 사용자들이 다양한 작업을 위해서 실제로 어떤 모델 API를 불러오는지를 살펴볼 수 있는 플랫폼이기 때문입니다. ​ 오픈소스 모델 vs 폐쇄소스 모델 에이전트 기반 추론 사용 사례 카테고리별 모델 사용 지리적 분석 모델의 유지 패턴 ​ 다섯 가지를 정리해봤습니다. 오픈소스 모델 vs 폐쇄소스 모델 30% vs 70% *오픈소스(OSS)냐 폐쇄소스 유형별 총 토큰 볼륨 점유율을 시각화한 차트입니다. 밝은 파란색은 오픈소스 모델이고 그 중에서 중국 OSS와 기타 국가 OSS를 시각화했습니다. 진한 파란색은 폐쇄소스 모델입니다. 세로 선들은 주요 모델들을 보여주는 차트입니다. ​ 오픈소스와 폐쇄소스간 균형 AI 생태계의 핵심 중 하나는 오픈소스 모델과 폐쇄소스 모델 간 점유율 변화, 그리고 오픈소스 모델 내에서 중국 모델이 차지하는 점유율 변화입니다. 전체 모델 사용량을 보자면 여전히 미국 AI Labs들의 모델이 토큰 사용량 대부분을 차지하고 있지만, 오픈소스 모델의 비율은 꾸준히 30% 정도를 유지하고 있습니다. ​ 이건 생각해보면 (1) 규제·보안·데이터 주권 때문에 외부 API 호출이 제한되는 기업들이나, (2) 비용·벤더 락인·커스터마이징 관점에서 자체 호스팅이 경제적으로 매력적인 워크로드가 늘고 있어서 그렇습니다. ​ 오픈소스 모델 사용량이 단기간에 오르는 시점은 Llama 3.3 70B, DeepSeek V3/R1, Kimi K2, Qwen 3, gpt-oss 등 상대적으로 경쟁력 있는 오픈소스 모델이 출시되는 시점과 관련이 높습니다. ​ *위는 점유율 관점에서 본 것이라면, 여기는 볼륨 관점에서 본 것입니다. 진한 빨간색은 폐쇄형, 주황색은 중국 오픈소스, 청록색은 중국 외의 오픈소스 모델 주간 토큰 사용량입니다. ​ 볼륨 관점으로 본 오픈/폐쇄소스 사용량 오픈소스 모델 성장의 상당부분은 중국 AI Labs에서 개발된 모델에서 나오고 있습니다. 2024년 말에는 점유율 1.2%정도 수준이었는데 일부 시점에는 점유율이 거의 30%에 달하기도 했고, 연간으로 보자면 중국 모델이 평균 토큰 볼륨의 13.0%를 차지했습니다. 오픈AI의 gpt-oss, 메타의 Llama, 프랑스 Mistral 등 중국 외 국가 모델들은 평균 13.7%를 차지했습니다. ​ 중국 AI Labs들의 오픈소스 모델의 경쟁력은 모델의 퀄리티도 있지만, 빠르고 촘촘한 모델 업데이트 사이클 덕분이기도 합니다. Qwen, DeepSeek는 상대적으로 정기적인 모델 출시로 새로운 워크로드에 신속하게 적응하는 데 초점을 맞추고 있습니다. ​ *상위 15개 오픈소스 모델 간 점유율 추이들을 보여주는 차트입니다. 25년 하반기부터 매우 경쟁적인 환경이 됐습니다. ​ 지난 1년 동안의 Top 15 오픈소스 모델 점유율 2024년 말부터 메타의 Llama 모델에서 점차 주도권이 DeepSeek V3, R1 모델으로 넘어가기 시작했고, 2025년 상반기에도 DeepSeek 모델의 점유율이 상당히 높았던 시기였습니다. 메타의 점유율은 이미 상당히 훼손된 모습을 확인하실 수 있습니다. 이 시점쯤이 저커버그가 MSL을 설립하면서 본격적으로 피벗한 시기입니다. ​ 그러다가 2025년 8월부터는 매우 경쟁적인 시장으로 바뀌기 시작해 지금까지 비슷한 트렌드를 유지하고 있습니다. 추론 수요가 크게 늘어남에 따라 시장이 크게 넓어지고 사용 사례도 다양해졌습니다. 대표적인 모델도 많습니다. DeepSeek, Qwen, Kimi, MiniMax, GLM, gpt-oss입니다. 단일 모델이 오픈소스 토큰 점유율 25%를 넘기는 경우가 없어졌고, 사용자들이 점점 더 재빠르게 더 좋은 모델을 택하고 있습니다. 유능한 오픈소스 모델을 만들 수만 있다면 몇 주만에 오픈소스 업계 Top 1이 될 수도 있는 시대입니다. ​ *오픈소스 모델의 사이즈별로 사용량 점유율을 보여주는 것입니다. 위부터 대형, 중형, 소형 모델이 처리한 전체 오픈소스 토큰 볼륨의 점유율입니다. ​ Medium is the New Small 1년 전만 해도 오픈소스 모델 생태계는 소수의 강력한 대형 모델 & 다수의 작고 빠른 소형 모델들이 있는 구도였습니다. 소형은 파라미터 수가 15B 미만이고, 중형은 15~70B이며, 대형은 70B 이상인 모델을 뜻합니다. 그러다가 시장이 성숙해짐에 따라서 점차 상대적으로 모델의 평균 규모가 점점 더 커지는 중입니다. 거대모델의 사용량이 늘었고, 1Q25부터는 중형 모델의 사용량이 점점 늘어나고 있습니다. ​ 오픈소스 모델 사용량 중 평균 52%가 Roleplay 오픈소스 모델 사용량 중 대략 절반 이상이 Roleplay에 쓰이고 있습니다. 사용자들이 스토리텔링, 캐릭터 역할극, 게임 시나리오 등입니다. 오픈소스 모델은 상대적으로 파인튜닝에 적합하기도 하고 콘텐츠 검열이 적어서 판타지나 엔터테인먼트에 잘 맞아서입니다. Reasoning이 새로운 기본값 더 길어진 시퀀스, 프로그래밍이 메인이다 *Non-Reasoning 토큰과 Reasoning 기반 모델 토큰의 추세, 모델들이 출력한 토큰 중에서 Reasoning 토큰의 비율을 본 것이 아니라 Reasoning 모델이 처리한 토큰의 비율을 보여주는 것입니다. ​ Reasoning 모델이 전체 LLM 사용량의 절반 o1-preview가 출시된 시점은 2024년 9월이지만 1Q25까지만 하더라도 Reasoning 모델을 사용하는 비율이 매우 낮았으나 시간이 지나면서 비중이 점차 늘며 현재는 50%를 넘겼습니다. GPT-5, Claude 4.5, Gemini 3 같은 모델들이 이어지면서 이제는 Reasoning 모델이 표준이 된 시대입니다. 또한 점차 사용자들은 단순히 텍스트를 생성하는 모델이 아닌 에이전트 방식의 워크플로우를 지원하는 모델을 점점 더 선호하고 있습니다. ​ *왼쪽: 프롬프트 토큰 수가 증가하고 있습니다. 평균 프롬프트 길이는 2024년 초 이후 4배 가까이 늘었으며, 이는 점점 더 사람들이 AI에 컨텍스트 정보를 더 많이 요하는/더 높은 지능과 해석을 요하는 작업을 늘리고 있다는 의미입니다. **오른쪽: 완료 토큰 수도 3배로 증가했습니다. 토큰 사용량의 증가는 대부분 프로그래밍 때문 프롬프트 토큰(input)와 완료 토큰(output) 수 모두 크게 증가했지만 규모는 좀 다릅니다. 요청당 평균 프롬프트 토큰 수는 2024년 1월 1,500개 → 2025년 11월 6,000개로 4배 증가했고, 완료 토큰은 같은 기간 150개 → 400개로 약 3배 증가했습니다. 이전보다 사용자들이 좀더 복잡한 작업을 시키고 있다는 의미입니다. 일례로 '에세이를 써주세요' 같은 요청이 아닌, 코드베이스, 문서, 녹취록 등 다양하고 큰 문서들을 쭉 넣고 분석 및 통찰을 뽑아내주길 원하고 있다는 것입니다. LLM은 어디에 가장 많이 쓰이나? AI Labs들은 각각 어느 워크로드에 가장 많이 쓰이나? 프로그래밍: 25년 5월 11% → 25년 12월 50% 모든 LLM 사용 사례 중 독보적으로 많이 쓰이는 사용 사례가 프로그래밍입니다. 2025년 5월 기준 전체 토큰량의 11%를 차지했는데 2025년 12월쯤에는 50%를 넘겼습니다. 주요 AI Labs들 중 프로그래밍에 가장 집중하고 있고 가장 많은 점유율을 차지하고 있는 AI Lab은 앤트로픽입니다. ​ 다만, 최근에 시장 점유율에 변화가 생기는 중입니다. ​ Anthropic, 프로그래밍 시장 점유율 60% 앤트로픽의 Claude 모델이 가장 많은 코딩 요청을 처리하고 있고 오픈AI와 구글이 뒤를 잇고, MiniMax의 점유율오 조금씩 증가하는 중입니다. Grok Code Fast는 사용량 자체는 많지만 무료로 뿌리고 있어서 사용량이 많은 것이므로 이를 제외한 시장점유율입니다. 워낙 경쟁적인 환경이기 때문에 모델 품질이나 지연 시간의 작은 변화들도 매주 시장 점유율을 바꿀 정도입니다. Groq 창업자인 조나단 로스가 말하기로, 유능한 개발진들은 거의 매월 코딩 모델을 바꾸고 있을 정도로 매우 민감하게 대응 중이라고 말했습니다. ​ AI Labs들의 모델별 주요 사용 사례 Anthropic, Google, OpenAI, xAI, DeepSeek, Qwen의 주요 모델들이 어디에 많이 쓰이고 있는지를 보여주는 차트입니다. 순서대로 (1) 앤트로픽은 프로그래밍 및 기술 관련 작업에 80% 이상 사용되고 있습니다. (2) 구글은 롤플레이, 프로그래밍, 테크, 법률, 과학 등 광범위하게 쓰이고 있습니다. 상대적으로 정보 검색엔진으로 많이 쓰이고 있다는 의미입니다. (3) 오픈AI는 시간이 지나면서 프로그래밍 및 기술 관련 토큰 사용량이 증가하고, 롤플레이나 가벼운 대화 비중은 줄어들고 있습니다. (4) xAI는 프로그래밍에 집중되어 있으나 이는 Grok Code Fast 모델을 무료로 풀어서 그렇습니다. (5) DeepSeek 모델은 역할극 및 캐주얼한 상호작용에 주로 쓰이고 있습니다. 검열이 덜한 모델이어서 그렇기도 합니다. (6) Qwen은 프로그래밍에 집중하고 있습니다. 전체 기간 동안 프로그래밍 관련 볼륨이 40~60%를 꾸준히 차지하고 있습니다. ​ 2025년 내내 오픈AI 모델의 사용 양상이 가장 많이 변했습니다. 2025년 초에는 과학 관련 작업이 오픈AI 토큰 사용량의 50% 이상을 차지했는데 → 2025년 말에는 과학 비중이 15%로 줄었습니다. 대신 프로그래밍 및 기술 분야 사용량은 이제 전체 사용량의 58%를 차지할 정도로 커졌습니다. 개발자 워크플로우, 생산성 도구, 각종 전문 애플리케이션에 더 잘 통합되고 있다는 의미입니다. ​ 토큰 사용량 및 토큰 점유율만 중요한 것이 아니라 해당 AI Labs의 모델이 얼마나 수익성이 있는 워크로드에 많이 쓰이고 있는가도 중요합니다. 그런 의미에서 AI Labs의 ARR이 가장 중요하다고 보는데요. 이런 점에서 가장 우수한 기업이 앤트로픽입니다. 앤트로픽의 토큰 사용량, 토큰 점유율을 신경쓰는 사람은 없지만 ARR은 Top 2인 것을 생각하시면 도움이 되실 것 같습니다. 오픈AI의 사용 사례는 앤트로픽의 꽤나 상업적 사용 패턴과 구글의 보편적 사용 패턴(정보 검색엔진으로 주로 쓰이는 패턴)의 사이에 위치해 있습니다. 오픈AI가 워크로드를 점점 더 고부가가치 작업에 잘 맞도록 집중하고 있다는 의미입니다. 지역별 LLM 사용량 북미 47%, 아시아 29%, 유럽 21% 지역별 LLM 사용량 분포 OpenRouter 사용자 기반에 한정한 데이터이긴 하지만, 나름 100조 토큰을 갖고 통계를 매긴 것이기 때문에 꽤나 유의미한 통계라고 생각합니다. LLM 사용량 분포를 보시면 AI 추론 시장이 점점 더 세계화되는 중입니다. 북미는 여전히 단일 지역 중 가장 큰 사용량을 보이고 있지만, 아시아의 비중이 매우 빠르게 증가하는 중입니다. 인구수가 많아서이기도 한데 2024년 10월에는 아시아가 전 세계 토큰 사용량의 13%였는데 → 2025년 11월 말에는 31%까지 상승했습니다. ​ 국가별 토큰 사용량을 매겨보면 미국 47.2% > 싱가포르 9.2% (중국 사용량이 많이 잡힐 것) > 독일 7.5% > 중국 6.0% > 한국 2.9% > 네덜란드 2.7% > 영국 2.5% > 캐나다 1.9% > 일본 1.8% > 인도 1.6% > 기타 16.8% ​ 대륙별 LLM 사용량을 보면 북아메리카 47.2% > 아시아 28.6% > 유럽 21.3% > 남아메리카 1.2% > 오세아니아 1.2% > 아프리카 0.5% 왜 '1위' 모델이 되는 게 중요한가? 선발주자 이점과 신데렐라의 '유리 구두' 현상 LLM 사용자 유지율 분석 왼쪽 위부터 오른쪽으로 순서대로 Claude 4 Sonnet, Gemini 2.5 Pro, Gemini 2.5 Flash, OpenAI GPT-4o, DeepSeek-R1, Llama 4 Maverick입니다. 이 유지율(Retention Rate) 차트는 특정 기간에 해당 모델을 쓰기 시작한 사용자 기반(Cohort)이 시간이 지남에 따라 얼마나 해당 모델에 남아있느냐를 보여주는 차트입니다. ​ 언뜻 보면 이탈율이 매우 높고 초기 사용자 코호트 감소가 두드러져 보이지만, 핵심은 해당 구간별로 1위 모델은 소수의 초기 사용자들이 꽤 오랫동안 높은 유지율을 보인다는 것입니다. 여러 모델들이 출시되고 있지만 기존 모델로는 풀리지 않던 고가치 워크로드들이 항상 존재한다는 걸 보여주는 증거입니다. 새로 개발되는 1위 모델들은 미해결 문제에 대해서 시험해보려는 사람들이 몰리는 효과를 낳습니다. 그리고 그 모델이 이전에 풀리지 않던 문제를 풀 수 있게 됐을 때 마치 유리 구두를 신은 듯한 완벽한 적합성을 얻게 됩니다. ​ 그래서 그 특정 워크로드는 생각보다 오랫동안 유지됩니다. 각 모델의 시스템, 데이터 파이프라인, 사용자 경험은 문제를 처음 해결해준 모델에 고정됩니다. 일례로 Claude 4 Sonnet은 코딩에서 안 풀리던 문제들을 상당히 많이 풀게 해준 모델이었고 도구 사용 안정성도 높았으며, Gemini 2.5 Pro는 보다 값싼 Reasoning 모델이었기에 타 모델들에 비해서 초기 사용자들의 유지율이 꽤 높게 나타납니다. 폐쇄소스와 오픈소스의 공존 그동안 단일 모델이 사용량을 지배한 적은 없었습니다. 특히 폐쇄소스와 오픈소스간 균형이 인상적입니다. 오픈소스는 꾸준히 점유율 30%를 차지하고 있습니다. 오픈AI와 앤트로픽이 프로그래밍 및 지식노동자들의 워크플로우에 통합되는 사례에서 선두를 차지하고 있지만(ARR을 높일 수 있는 고부가가치 작업들), DeepSeek, Qwen 등 오픈소스 모델들도 토큰 사용량의 상당부분을 차지하고 있습니다. 개발자들은 유연성을 유지하고 여러 모델을 통합하여 사용하고 있으며 각 작업에 가장 적합한 모델을 출시하고 있습니다. ​ 생각보다 캐주얼한 사용 사례가 많다 오픈소스 모델 사용량의 50% 이상이 롤플레이 및 스토리텔링에서 나왔습니다. ChatGPT의 초기 사용 사례 중 상당부분도 캐주얼한 용도였습니다. LLM을 코드 작성 같이 생산성을 높이는 분야에만 쓸 것 같은 느낌과는 조금 다른 결과들입니다. 생각보다 많은 비중이 검색, 건강 관련 질문(지식iN, StackOverflow 같은 것을 완벽히 대체 중), 쇼핑 관련 가벼운 질문 등에 쓰입니다. ​ Reasoning 및 Agentic AI LLM이 단순한 답을 내놓는 수준을 넘어서 여러 단계를 거쳐서 답변하는 Reasoning, 여러 단계를 거쳐 계획-추론-실행-피드백하며 최종 결과물을 내놓는 Agentic AI로까지 발전하고 있습니다. 이제 모델은 점차 도구를 사용하여 외부 데이터에 액세스하여 목표를 달성할 때까지 출력을 반복합니다. CY2026의 핵심은 Agentic AI일 것으로 보며, 폭발적으로 Agentic AI 침투가 증가하는 시기는 Reasoning의 도입이 GB200 NVL72의 온라인 시기와 겹쳤던 것처럼, VR200 NVL72가 온라인되는 시기와 겹칠 것으로 예상합니다. 하드웨어가 소프트웨어를 주도하는 시대입니다. ​ 지리적 변화 LLM 사용량은 북미를 넘어서 점점 더 세계화되고 있습니다. 점차 많은 국가와 기업들이 AI를 쓰기 시작하고, 추론시장으로 바뀌어감에 따라 그렇습니다. 아시아의 토큰 수요 점유율은 13% → 31%까지 증가했습니다. ​ 신데렐라의 '유리 구두' 파운데이션 모델은 사전훈련에 따라 비약적으로 발전하기 때문에, 유지율이 AI Labs 경쟁력의 척도입니다. 모델의 성능 향상은 해당 모델이 고부가가치 워크로드에 완벽하게 적합할 수 있는 짧은 순간을 만들어냅니다. 대략 1~3개월 정도인데, 사용자가 적합성을 발견하면 비교적 그 모델을 계속해서 사용할 가능성이 높습니다. 원래 Product-Market Fit이라 부르던 조합은 AI Labs들 입장에서 Workload-Model Fit과도 같습니다. 문제를 최초로 풀 수 있는 모델이 되는 것이 중요합니다. 점점 더 빠르게 변화하는 시장에서 여전히 모델 주도권을 지키는 게 중요한 이유입니다.