2026.01.09 · 네이버 프리미엄 콘텐츠 · 올바른 미국주식 by SAPIENS

100조 개 토큰으로 살펴보는 진짜 LLM 사용법

유형
네이버 프리미엄 콘텐츠
날짜
2026.01.09
강연자/작성자
올바른 미국주식 by SAPIENS
분석 주제
미지정
자료 길이
본문 10,616자
1

문서 전체 조망

핵심 구조

LLM 경쟁은 토큰 점유율보다 각 작업에 맞는 모델과 지속 사용으로 이동한다

OpenRouter의 100조 토큰 실사용 데이터를 통해 오픈·폐쇄소스의 공존, Reasoning과 프로그래밍의 확대, AI Labs별 사용처를 살핀다. 모델 성능이 아니라 어떤 고가치 작업을 먼저 풀고 사용자를 남기는지가 경쟁력을 가르는 이유를 짚는다.

오픈소스는 약 30%의 사용 비중을 지키며 폐쇄소스와 공존한다

오픈소스는 꾸준히 약 30%입니다. 미국 AI Labs가 전체 토큰 사용량 대부분을 차지해도 규제·보안·데이터 주권, 자체 호스팅의 비용과 유연성 때문에 오픈소스 수요가 남는다. 중국 모델은 빠른 업데이트로 사용량을 키웠지만 2025년 8월 이후에는 한 모델이 오픈소스 점유율 25%를 넘지 못할 만큼 경쟁이 빨라졌다.

Reasoning과 긴 맥락 처리가 LLM의 기본 사용 방식이 된다

Reasoning이 표준이 됐고, 모델이 처리한 토큰의 비중은 50%를 넘었다. 요청당 프롬프트와 완료 토큰도 각각 4배와 약 3배 늘었으며, 단순 글쓰기보다 코드베이스·문서·녹취록을 넣어 분석하는 복잡한 작업이 늘면서 프로그래밍은 전체 토큰의 절반을 넘겼다.

AI Labs별 경쟁은 사용량보다 수익성 있는 워크로드의 위치가 중요하다

앤트로픽은 코딩·기술 작업에, 구글은 폭넓은 검색형 사용에, OpenAI는 과학에서 프로그래밍·기술 작업으로 무게를 옮기는 모습이 제시된다. 작성자는 토큰 점유율만이 아니라 상업적 워크로드와 ARR을 함께 봐야 한다고 평가한다.

먼저 문제를 푸는 모델의 유지율이 Workload-Model Fit을 만든다

특정 고가치 문제를 처음 해결한 모델은 사용자의 시스템·데이터 파이프라인·경험에 자리 잡아 일부 초기 사용자의 유지율을 높일 수 있다. 이 짧은 적합성 순간을 선점하는 일이 AI Labs에게 Product-Market Fit에 해당하는 Workload-Model Fit이라는 설명이다.

ANALYSIS VIEW사건별 사실과 작성자의 판단, 지속 정보를 나누어 읽기
2
발생·예정 사건과 출처별 관점

이슈 분석

이 자료가 이슈의 어떤 사실을 다루고, 작성자가 무슨 결론을 어떤 근거로 내렸는지 원문에 붙여 읽습니다.

발생진행 중발생월 24-9

24-9 오픈AI o1-preview의 Test-time compute 적용

작성자의 핵심 판단

작성자는 o1 이후 Reasoning이 업계의 기본값이 됐으며, 그 뒤 이를 대체할 새 패러다임은 아직 나오지 않았다고 본다.

근거 보기 3
  1. 원문 구간 1

    ​ 100조 개 토큰을 살펴보다 OpenRouter를 통한 LLM 산업분석 ​ LLM 시장은 어디서 와서 어디로 가고 있는가? 이번 자료는 OpenRouter가 자사 플랫폼을 통해서 실제로 고객사들이 2024년 11월 3일부터 2025년 11월 30일까지 쓴 100조 개의 토큰을 분석하여, LLM 모델에 대한 전반적인 뷰를 얻기 위한 자료입니다. ​ OpenAI o1, "Strawberry 🍓" 1년 전만 하더라도 LLM 업계는 지금과 완전히 달랐습니다. ​ 오픈AI의 o1(코드명 Strawberry)가 나오기 전(2024년 9월에 o1-preview 출시)까지만 해도 LLM은 단순하게 사전훈련된 데이터에서 질문을 받자마자 곧바로 답을 출력하는 방식이었습니다. o1은 현재 'Reasoning'으로 불리는 Test-time compute를 선보였습니다. 최종 출력물을 말하기 전에 내부적으로 여러 단계에 걸쳐 숙고하고, 반복적으로 스스로 되묻는 과정을 거치면서 보다 정돈된 답을 내놓는 첫 모델이었습니다. 이후 24년 12월 Gemini 2.0 Flash Thinking(preview)이 출시되고, 2025년 1월에 DeepSeek-R1이 출시된 흐름입니다.

  2. 원문 구간 2

    ​ 그리고 오픈AI가 2024년 12월에 병렬식(Parallel) test-time compute 구조인 o1-pro를 발표했었습니다. 여러 모델이 서로 검증하면서 최선의 답을 내놓는 구조입니다. 이후에 다시 이 구조가 2025년 5월 20일에 Gemini 2.5 Deep Think에 채택되고, 5월 23일 Claude 4에 채택됐으며, 7월 9일에 Grok 4 Heavy에서 쓰였습니다. 이후 업계를 주도할 새로운 패러다임이 나오진 않았습니다. LLM 사용에 대한 실증 연구 논문 보통은 설문조사를 통한 내용이 많았는데 실제 사용자들의 데이터를 살펴본 건 이번 OpenRouter 자료가 처음입니다. OpenRouter 자체가 다양한 모델들의 요청을 오케스트레이션 하는 플랫폼이기 때문에 개발자와 최종 사용자들이 다양한 작업을 위해서 실제로 어떤 모델 API를 불러오는지를 살펴볼 수 있는 플랫폼이기 때문입니다. ​ 오픈소스 모델 vs 폐쇄소스 모델 에이전트 기반 추론 사용 사례 카테고리별 모델 사용 지리적 분석

  3. 원문 구간 3

    또한 점차 사용자들은 단순히 텍스트를 생성하는 모델이 아닌 에이전트 방식의 워크플로우를 지원하는 모델을 점점 더 선호하고 있습니다. ​ *왼쪽: 프롬프트 토큰 수가 증가하고 있습니다. 평균 프롬프트 길이는 2024년 초 이후 4배 가까이 늘었으며, 이는 점점 더 사람들이 AI에 컨텍스트 정보를 더 많이 요하는/더 높은 지능과 해석을 요하는 작업을 늘리고 있다는 의미입니다. **오른쪽: 완료 토큰 수도 3배로 증가했습니다. 토큰 사용량의 증가는 대부분 프로그래밍 때문 프롬프트 토큰(input)와 완료 토큰(output) 수 모두 크게 증가했지만 규모는 좀 다릅니다. 요청당 평균 프롬프트 토큰 수는 2024년 1월 1,500개 → 2025년 11월 6,000개로 4배 증가했고, 완료 토큰은 같은 기간 150개 → 400개로 약 3배 증가했습니다. 이전보다 사용자들이 좀더 복잡한 작업을 시키고 있다는 의미입니다. 일례로 '에세이를 써주세요' 같은 요청이 아닌, 코드베이스, 문서, 녹취록 등 다양하고 큰 문서들을 쭉 넣고 분석 및 통찰을 뽑아내주길 원하고 있다는 것입니다.

이 자료에서 다룬 사실

오픈AI는 2024년 9월 o1-preview를 출시했고, 이 모델은 최종 답변 전 여러 단계로 숙고하고 스스로 되묻는 Test-time compute를 선보였다고 소개했다.

근거 보기 1
  1. 원문 구간 1

    ​ 100조 개 토큰을 살펴보다 OpenRouter를 통한 LLM 산업분석 ​ LLM 시장은 어디서 와서 어디로 가고 있는가? 이번 자료는 OpenRouter가 자사 플랫폼을 통해서 실제로 고객사들이 2024년 11월 3일부터 2025년 11월 30일까지 쓴 100조 개의 토큰을 분석하여, LLM 모델에 대한 전반적인 뷰를 얻기 위한 자료입니다. ​ OpenAI o1, "Strawberry 🍓" 1년 전만 하더라도 LLM 업계는 지금과 완전히 달랐습니다. ​ 오픈AI의 o1(코드명 Strawberry)가 나오기 전(2024년 9월에 o1-preview 출시)까지만 해도 LLM은 단순하게 사전훈련된 데이터에서 질문을 받자마자 곧바로 답을 출력하는 방식이었습니다. o1은 현재 'Reasoning'으로 불리는 Test-time compute를 선보였습니다. 최종 출력물을 말하기 전에 내부적으로 여러 단계에 걸쳐 숙고하고, 반복적으로 스스로 되묻는 과정을 거치면서 보다 정돈된 답을 내놓는 첫 모델이었습니다. 이후 24년 12월 Gemini 2.0 Flash Thinking(preview)이 출시되고, 2025년 1월에 DeepSeek-R1이 출시된 흐름입니다.

그렇게 판단한 이유

Gemini 2.0 Flash Thinking, DeepSeek-R1, o1-pro의 병렬식 구조와 이를 채택한 Gemini 2.5 Deep Think·Claude 4·Grok 4 Heavy의 출시 흐름을 근거로 든다.

근거 보기 2
  1. 원문 구간 1

    ​ 100조 개 토큰을 살펴보다 OpenRouter를 통한 LLM 산업분석 ​ LLM 시장은 어디서 와서 어디로 가고 있는가? 이번 자료는 OpenRouter가 자사 플랫폼을 통해서 실제로 고객사들이 2024년 11월 3일부터 2025년 11월 30일까지 쓴 100조 개의 토큰을 분석하여, LLM 모델에 대한 전반적인 뷰를 얻기 위한 자료입니다. ​ OpenAI o1, "Strawberry 🍓" 1년 전만 하더라도 LLM 업계는 지금과 완전히 달랐습니다. ​ 오픈AI의 o1(코드명 Strawberry)가 나오기 전(2024년 9월에 o1-preview 출시)까지만 해도 LLM은 단순하게 사전훈련된 데이터에서 질문을 받자마자 곧바로 답을 출력하는 방식이었습니다. o1은 현재 'Reasoning'으로 불리는 Test-time compute를 선보였습니다. 최종 출력물을 말하기 전에 내부적으로 여러 단계에 걸쳐 숙고하고, 반복적으로 스스로 되묻는 과정을 거치면서 보다 정돈된 답을 내놓는 첫 모델이었습니다. 이후 24년 12월 Gemini 2.0 Flash Thinking(preview)이 출시되고, 2025년 1월에 DeepSeek-R1이 출시된 흐름입니다.

  2. 원문 구간 2

    ​ 그리고 오픈AI가 2024년 12월에 병렬식(Parallel) test-time compute 구조인 o1-pro를 발표했었습니다. 여러 모델이 서로 검증하면서 최선의 답을 내놓는 구조입니다. 이후에 다시 이 구조가 2025년 5월 20일에 Gemini 2.5 Deep Think에 채택되고, 5월 23일 Claude 4에 채택됐으며, 7월 9일에 Grok 4 Heavy에서 쓰였습니다. 이후 업계를 주도할 새로운 패러다임이 나오진 않았습니다. LLM 사용에 대한 실증 연구 논문 보통은 설문조사를 통한 내용이 많았는데 실제 사용자들의 데이터를 살펴본 건 이번 OpenRouter 자료가 처음입니다. OpenRouter 자체가 다양한 모델들의 요청을 오케스트레이션 하는 플랫폼이기 때문에 개발자와 최종 사용자들이 다양한 작업을 위해서 실제로 어떤 모델 API를 불러오는지를 살펴볼 수 있는 플랫폼이기 때문입니다. ​ 오픈소스 모델 vs 폐쇄소스 모델 에이전트 기반 추론 사용 사례 카테고리별 모델 사용 지리적 분석

원문에서 직접 연결한 대상OpenAILLM 산업
발생진행 중발생월 24-12

24-12 오픈AI o1-pro의 병렬식 Test-time compute 발표

작성자의 핵심 판단

작성자는 이 병렬식 구조가 채택된 뒤 업계를 주도할 새로운 패러다임은 아직 나오지 않았다고 평가한다.

근거 보기 1
  1. 원문 구간 1

    ​ 그리고 오픈AI가 2024년 12월에 병렬식(Parallel) test-time compute 구조인 o1-pro를 발표했었습니다. 여러 모델이 서로 검증하면서 최선의 답을 내놓는 구조입니다. 이후에 다시 이 구조가 2025년 5월 20일에 Gemini 2.5 Deep Think에 채택되고, 5월 23일 Claude 4에 채택됐으며, 7월 9일에 Grok 4 Heavy에서 쓰였습니다. 이후 업계를 주도할 새로운 패러다임이 나오진 않았습니다. LLM 사용에 대한 실증 연구 논문 보통은 설문조사를 통한 내용이 많았는데 실제 사용자들의 데이터를 살펴본 건 이번 OpenRouter 자료가 처음입니다. OpenRouter 자체가 다양한 모델들의 요청을 오케스트레이션 하는 플랫폼이기 때문에 개발자와 최종 사용자들이 다양한 작업을 위해서 실제로 어떤 모델 API를 불러오는지를 살펴볼 수 있는 플랫폼이기 때문입니다. ​ 오픈소스 모델 vs 폐쇄소스 모델 에이전트 기반 추론 사용 사례 카테고리별 모델 사용 지리적 분석

이 자료에서 다룬 사실

오픈AI는 2024년 12월 여러 모델이 서로 검증해 최선의 답을 내놓는 병렬식 Test-time compute 구조의 o1-pro를 발표했고, 이 구조는 2025년 Gemini 2.5 Deep Think·Claude 4·Grok 4 Heavy에도 채택됐다고 적었다.

근거 보기 1
  1. 원문 구간 1

    ​ 그리고 오픈AI가 2024년 12월에 병렬식(Parallel) test-time compute 구조인 o1-pro를 발표했었습니다. 여러 모델이 서로 검증하면서 최선의 답을 내놓는 구조입니다. 이후에 다시 이 구조가 2025년 5월 20일에 Gemini 2.5 Deep Think에 채택되고, 5월 23일 Claude 4에 채택됐으며, 7월 9일에 Grok 4 Heavy에서 쓰였습니다. 이후 업계를 주도할 새로운 패러다임이 나오진 않았습니다. LLM 사용에 대한 실증 연구 논문 보통은 설문조사를 통한 내용이 많았는데 실제 사용자들의 데이터를 살펴본 건 이번 OpenRouter 자료가 처음입니다. OpenRouter 자체가 다양한 모델들의 요청을 오케스트레이션 하는 플랫폼이기 때문에 개발자와 최종 사용자들이 다양한 작업을 위해서 실제로 어떤 모델 API를 불러오는지를 살펴볼 수 있는 플랫폼이기 때문입니다. ​ 오픈소스 모델 vs 폐쇄소스 모델 에이전트 기반 추론 사용 사례 카테고리별 모델 사용 지리적 분석

그렇게 판단한 이유

Gemini 2.5 Deep Think는 2025년 5월 20일, Claude 4는 5월 23일, Grok 4 Heavy는 7월 9일에 같은 구조를 채택한 출시 흐름을 든다.

근거 보기 1
  1. 원문 구간 1

    ​ 그리고 오픈AI가 2024년 12월에 병렬식(Parallel) test-time compute 구조인 o1-pro를 발표했었습니다. 여러 모델이 서로 검증하면서 최선의 답을 내놓는 구조입니다. 이후에 다시 이 구조가 2025년 5월 20일에 Gemini 2.5 Deep Think에 채택되고, 5월 23일 Claude 4에 채택됐으며, 7월 9일에 Grok 4 Heavy에서 쓰였습니다. 이후 업계를 주도할 새로운 패러다임이 나오진 않았습니다. LLM 사용에 대한 실증 연구 논문 보통은 설문조사를 통한 내용이 많았는데 실제 사용자들의 데이터를 살펴본 건 이번 OpenRouter 자료가 처음입니다. OpenRouter 자체가 다양한 모델들의 요청을 오케스트레이션 하는 플랫폼이기 때문에 개발자와 최종 사용자들이 다양한 작업을 위해서 실제로 어떤 모델 API를 불러오는지를 살펴볼 수 있는 플랫폼이기 때문입니다. ​ 오픈소스 모델 vs 폐쇄소스 모델 에이전트 기반 추론 사용 사례 카테고리별 모델 사용 지리적 분석

원문에서 직접 연결한 대상OpenAILLM 산업
3
사실·구조, 해석·전망, 시점 관찰, 판단 방법

지식·관점

사건 밖에서도 다시 참고하거나 다른 자료와 비교할 가치가 있는 내용을 대상과 반복 가능한 논점으로 묶습니다.

사실·구조OpenRouter 기반 LLM 실사용 데이터주 대상 · 산업·업종 · LLM 산업

100조 토큰 표본은 LLM 사용을 어떤 범위에서 보여주는가?

이 자료가 더한 내용

OpenRouter가 2024년 11월 3일부터 2025년 11월 30일까지 플랫폼 고객사가 쓴 100조 토큰을 분석했으며, 다양한 모델 API 요청을 오케스트레이션하는 플랫폼이어서 실제 개발자·최종사용자의 호출을 볼 수 있다고 설명한다.

근거 보기 2
  1. 원문 구간 1

    ​ 100조 개 토큰을 살펴보다 OpenRouter를 통한 LLM 산업분석 ​ LLM 시장은 어디서 와서 어디로 가고 있는가? 이번 자료는 OpenRouter가 자사 플랫폼을 통해서 실제로 고객사들이 2024년 11월 3일부터 2025년 11월 30일까지 쓴 100조 개의 토큰을 분석하여, LLM 모델에 대한 전반적인 뷰를 얻기 위한 자료입니다. ​ OpenAI o1, "Strawberry 🍓" 1년 전만 하더라도 LLM 업계는 지금과 완전히 달랐습니다. ​ 오픈AI의 o1(코드명 Strawberry)가 나오기 전(2024년 9월에 o1-preview 출시)까지만 해도 LLM은 단순하게 사전훈련된 데이터에서 질문을 받자마자 곧바로 답을 출력하는 방식이었습니다. o1은 현재 'Reasoning'으로 불리는 Test-time compute를 선보였습니다. 최종 출력물을 말하기 전에 내부적으로 여러 단계에 걸쳐 숙고하고, 반복적으로 스스로 되묻는 과정을 거치면서 보다 정돈된 답을 내놓는 첫 모델이었습니다. 이후 24년 12월 Gemini 2.0 Flash Thinking(preview)이 출시되고, 2025년 1월에 DeepSeek-R1이 출시된 흐름입니다.

  2. 원문 구간 2

    ​ 그리고 오픈AI가 2024년 12월에 병렬식(Parallel) test-time compute 구조인 o1-pro를 발표했었습니다. 여러 모델이 서로 검증하면서 최선의 답을 내놓는 구조입니다. 이후에 다시 이 구조가 2025년 5월 20일에 Gemini 2.5 Deep Think에 채택되고, 5월 23일 Claude 4에 채택됐으며, 7월 9일에 Grok 4 Heavy에서 쓰였습니다. 이후 업계를 주도할 새로운 패러다임이 나오진 않았습니다. LLM 사용에 대한 실증 연구 논문 보통은 설문조사를 통한 내용이 많았는데 실제 사용자들의 데이터를 살펴본 건 이번 OpenRouter 자료가 처음입니다. OpenRouter 자체가 다양한 모델들의 요청을 오케스트레이션 하는 플랫폼이기 때문에 개발자와 최종 사용자들이 다양한 작업을 위해서 실제로 어떤 모델 API를 불러오는지를 살펴볼 수 있는 플랫폼이기 때문입니다. ​ 오픈소스 모델 vs 폐쇄소스 모델 에이전트 기반 추론 사용 사례 카테고리별 모델 사용 지리적 분석

사실·구조오픈소스와 폐쇄소스 LLM의 사용 균형주 대상 · 산업·업종 · LLM 산업

오픈소스 점유율이 약 30%로 유지되는 배경은 무엇인가?

이 자료가 더한 내용

미국 AI Labs 모델이 전체 토큰 사용량의 대부분을 차지하지만 오픈소스 비율은 약 30%를 유지했다. 규제·보안·데이터 주권으로 외부 API가 제한되는 기업과 비용·벤더 락인·커스터마이징상 자체 호스팅이 유리한 워크로드가 그 배경으로 제시됐다.

근거 보기 1
  1. 원문 구간 1

    모델의 유지 패턴 ​ 다섯 가지를 정리해봤습니다. 오픈소스 모델 vs 폐쇄소스 모델 30% vs 70% *오픈소스(OSS)냐 폐쇄소스 유형별 총 토큰 볼륨 점유율을 시각화한 차트입니다. 밝은 파란색은 오픈소스 모델이고 그 중에서 중국 OSS와 기타 국가 OSS를 시각화했습니다. 진한 파란색은 폐쇄소스 모델입니다. 세로 선들은 주요 모델들을 보여주는 차트입니다. ​ 오픈소스와 폐쇄소스간 균형 AI 생태계의 핵심 중 하나는 오픈소스 모델과 폐쇄소스 모델 간 점유율 변화, 그리고 오픈소스 모델 내에서 중국 모델이 차지하는 점유율 변화입니다. 전체 모델 사용량을 보자면 여전히 미국 AI Labs들의 모델이 토큰 사용량 대부분을 차지하고 있지만, 오픈소스 모델의 비율은 꾸준히 30% 정도를 유지하고 있습니다. ​ 이건 생각해보면 (1) 규제·보안·데이터 주권 때문에 외부 API 호출이 제한되는 기업들이나, (2) 비용·벤더 락인·커스터마이징 관점에서 자체 호스팅이 경제적으로 매력적인 워크로드가 늘고 있어서 그렇습니다.

시점 관찰중국 오픈소스 모델의 경쟁 구도주 대상 · 기술·제품 · 중국 오픈소스 LLM관련 대상 · 산업·업종 · LLM 산업기준 2025.11

중국 오픈소스 모델은 사용량과 경쟁 환경에서 어떤 위치를 차지하는가?

이 자료가 더한 내용

중국 모델은 2024년 말 점유율 약 1.2%에서 일부 시점 거의 30%까지 올랐고 연평균 토큰 볼륨의 13.0%를 차지했다. Qwen·DeepSeek의 빠르고 촘촘한 업데이트가 새 워크로드 적응력의 배경으로 제시됐으며, 2025년 8월 이후에는 단일 오픈소스 모델이 25%를 넘지 못하는 경쟁 구도가 이어졌다.

근거 보기 2
  1. 원문 구간 1

    ​ 오픈소스 모델 사용량이 단기간에 오르는 시점은 Llama 3.3 70B, DeepSeek V3/R1, Kimi K2, Qwen 3, gpt-oss 등 상대적으로 경쟁력 있는 오픈소스 모델이 출시되는 시점과 관련이 높습니다. ​ *위는 점유율 관점에서 본 것이라면, 여기는 볼륨 관점에서 본 것입니다. 진한 빨간색은 폐쇄형, 주황색은 중국 오픈소스, 청록색은 중국 외의 오픈소스 모델 주간 토큰 사용량입니다. ​ 볼륨 관점으로 본 오픈/폐쇄소스 사용량 오픈소스 모델 성장의 상당부분은 중국 AI Labs에서 개발된 모델에서 나오고 있습니다. 2024년 말에는 점유율 1.2%정도 수준이었는데 일부 시점에는 점유율이 거의 30%에 달하기도 했고, 연간으로 보자면 중국 모델이 평균 토큰 볼륨의 13.0%를 차지했습니다. 오픈AI의 gpt-oss, 메타의 Llama, 프랑스 Mistral 등 중국 외 국가 모델들은 평균 13.7%를 차지했습니다. ​ 중국 AI Labs들의 오픈소스 모델의 경쟁력은 모델의 퀄리티도 있지만, 빠르고 촘촘한 모델 업데이트 사이클 덕분이기도 합니다.

  2. 원문 구간 2

    Qwen, DeepSeek는 상대적으로 정기적인 모델 출시로 새로운 워크로드에 신속하게 적응하는 데 초점을 맞추고 있습니다. ​ *상위 15개 오픈소스 모델 간 점유율 추이들을 보여주는 차트입니다. 25년 하반기부터 매우 경쟁적인 환경이 됐습니다. ​ 지난 1년 동안의 Top 15 오픈소스 모델 점유율 2024년 말부터 메타의 Llama 모델에서 점차 주도권이 DeepSeek V3, R1 모델으로 넘어가기 시작했고, 2025년 상반기에도 DeepSeek 모델의 점유율이 상당히 높았던 시기였습니다. 메타의 점유율은 이미 상당히 훼손된 모습을 확인하실 수 있습니다. 이 시점쯤이 저커버그가 MSL을 설립하면서 본격적으로 피벗한 시기입니다. ​ 그러다가 2025년 8월부터는 매우 경쟁적인 시장으로 바뀌기 시작해 지금까지 비슷한 트렌드를 유지하고 있습니다. 추론 수요가 크게 늘어남에 따라 시장이 크게 넓어지고 사용 사례도 다양해졌습니다. 대표적인 모델도 많습니다. DeepSeek, Qwen, Kimi, MiniMax, GLM, gpt-oss입니다.

사실·구조오픈소스 LLM의 모델 크기와 역할극 사용주 대상 · 기술·제품 · 오픈소스 LLM

오픈소스 사용은 모델 크기와 역할극 수요에서 어떤 모습을 보이는가?

이 자료가 더한 내용

소형은 15B 미만, 중형은 15~70B, 대형은 70B 이상으로 구분했고 1Q25부터 중형 모델 사용량이 늘었다고 정리했다. 오픈소스 토큰의 평균 52%는 스토리텔링·캐릭터 역할극·게임 시나리오 같은 Roleplay에 쓰였으며, 파인튜닝 적합성과 상대적으로 낮은 검열이 배경으로 언급됐다.

근거 보기 2
  1. 원문 구간 1

    단일 모델이 오픈소스 토큰 점유율 25%를 넘기는 경우가 없어졌고, 사용자들이 점점 더 재빠르게 더 좋은 모델을 택하고 있습니다. 유능한 오픈소스 모델을 만들 수만 있다면 몇 주만에 오픈소스 업계 Top 1이 될 수도 있는 시대입니다. ​ *오픈소스 모델의 사이즈별로 사용량 점유율을 보여주는 것입니다. 위부터 대형, 중형, 소형 모델이 처리한 전체 오픈소스 토큰 볼륨의 점유율입니다. ​ Medium is the New Small 1년 전만 해도 오픈소스 모델 생태계는 소수의 강력한 대형 모델 & 다수의 작고 빠른 소형 모델들이 있는 구도였습니다. 소형은 파라미터 수가 15B 미만이고, 중형은 15~70B이며, 대형은 70B 이상인 모델을 뜻합니다. 그러다가 시장이 성숙해짐에 따라서 점차 상대적으로 모델의 평균 규모가 점점 더 커지는 중입니다. 거대모델의 사용량이 늘었고, 1Q25부터는 중형 모델의 사용량이 점점 늘어나고 있습니다. ​ 오픈소스 모델 사용량 중 평균 52%가 Roleplay

  2. 원문 구간 2

    오픈소스 모델 사용량 중 대략 절반 이상이 Roleplay에 쓰이고 있습니다. 사용자들이 스토리텔링, 캐릭터 역할극, 게임 시나리오 등입니다. 오픈소스 모델은 상대적으로 파인튜닝에 적합하기도 하고 콘텐츠 검열이 적어서 판타지나 엔터테인먼트에 잘 맞아서입니다. Reasoning이 새로운 기본값 더 길어진 시퀀스, 프로그래밍이 메인이다 *Non-Reasoning 토큰과 Reasoning 기반 모델 토큰의 추세, 모델들이 출력한 토큰 중에서 Reasoning 토큰의 비율을 본 것이 아니라 Reasoning 모델이 처리한 토큰의 비율을 보여주는 것입니다. ​ Reasoning 모델이 전체 LLM 사용량의 절반 o1-preview가 출시된 시점은 2024년 9월이지만 1Q25까지만 하더라도 Reasoning 모델을 사용하는 비율이 매우 낮았으나 시간이 지나면서 비중이 점차 늘며 현재는 50%를 넘겼습니다. GPT-5, Claude 4.5, Gemini 3 같은 모델들이 이어지면서 이제는 Reasoning 모델이 표준이 된 시대입니다.

해석·전망Reasoning 모델과 프로그래밍 워크로드주 대상 · 산업·업종 · LLM 산업

Reasoning 확산과 토큰 길이 증가는 어떤 사용 변화를 뜻하는가?

이 자료가 더한 내용

Reasoning 모델이 처리한 토큰 비중은 1Q25의 낮은 수준에서 50%를 넘었고, 평균 프롬프트는 2024년 1월 1,500개에서 2025년 11월 6,000개로 4배, 완료 토큰은 150개에서 400개로 약 3배 늘었다. 작성자는 코드베이스·문서·녹취록처럼 큰 맥락을 넣어 분석·통찰을 구하는 복잡한 작업 증가로 해석했다.

근거 보기 1
  1. 원문 구간 1

    또한 점차 사용자들은 단순히 텍스트를 생성하는 모델이 아닌 에이전트 방식의 워크플로우를 지원하는 모델을 점점 더 선호하고 있습니다. ​ *왼쪽: 프롬프트 토큰 수가 증가하고 있습니다. 평균 프롬프트 길이는 2024년 초 이후 4배 가까이 늘었으며, 이는 점점 더 사람들이 AI에 컨텍스트 정보를 더 많이 요하는/더 높은 지능과 해석을 요하는 작업을 늘리고 있다는 의미입니다. **오른쪽: 완료 토큰 수도 3배로 증가했습니다. 토큰 사용량의 증가는 대부분 프로그래밍 때문 프롬프트 토큰(input)와 완료 토큰(output) 수 모두 크게 증가했지만 규모는 좀 다릅니다. 요청당 평균 프롬프트 토큰 수는 2024년 1월 1,500개 → 2025년 11월 6,000개로 4배 증가했고, 완료 토큰은 같은 기간 150개 → 400개로 약 3배 증가했습니다. 이전보다 사용자들이 좀더 복잡한 작업을 시키고 있다는 의미입니다. 일례로 '에세이를 써주세요' 같은 요청이 아닌, 코드베이스, 문서, 녹취록 등 다양하고 큰 문서들을 쭉 넣고 분석 및 통찰을 뽑아내주길 원하고 있다는 것입니다.

시점 관찰LLM 프로그래밍 사용과 모델 경쟁주 대상 · 산업·업종 · LLM 산업관련 대상 · 기업·종목 · Anthropic기준 2025.12

프로그래밍은 LLM 사용에서 어떤 비중과 경쟁 특성을 보이는가?

이 자료가 더한 내용

프로그래밍은 전체 토큰의 2025년 5월 11%에서 12월 50%를 넘었고, 앤트로픽이 코딩 요청에서 약 60% 점유율로 가장 많으며 오픈AI·구글이 뒤를 이었다고 적었다. 모델 품질·지연시간의 작은 변화도 주간 점유율을 바꾸고 개발진은 거의 매월 코딩 모델을 바꾼다는 설명을 덧붙였다.

근거 보기 2
  1. 원문 구간 1

    LLM은 어디에 가장 많이 쓰이나? AI Labs들은 각각 어느 워크로드에 가장 많이 쓰이나? 프로그래밍: 25년 5월 11% → 25년 12월 50% 모든 LLM 사용 사례 중 독보적으로 많이 쓰이는 사용 사례가 프로그래밍입니다. 2025년 5월 기준 전체 토큰량의 11%를 차지했는데 2025년 12월쯤에는 50%를 넘겼습니다. 주요 AI Labs들 중 프로그래밍에 가장 집중하고 있고 가장 많은 점유율을 차지하고 있는 AI Lab은 앤트로픽입니다. ​ 다만, 최근에 시장 점유율에 변화가 생기는 중입니다. ​ Anthropic, 프로그래밍 시장 점유율 60% 앤트로픽의 Claude 모델이 가장 많은 코딩 요청을 처리하고 있고 오픈AI와 구글이 뒤를 잇고, MiniMax의 점유율오 조금씩 증가하는 중입니다. Grok Code Fast는 사용량 자체는 많지만 무료로 뿌리고 있어서 사용량이 많은 것이므로 이를 제외한 시장점유율입니다. 워낙 경쟁적인 환경이기 때문에 모델 품질이나 지연 시간의 작은 변화들도 매주 시장 점유율을 바꿀 정도입니다.

  2. 원문 구간 2

    Groq 창업자인 조나단 로스가 말하기로, 유능한 개발진들은 거의 매월 코딩 모델을 바꾸고 있을 정도로 매우 민감하게 대응 중이라고 말했습니다. ​ AI Labs들의 모델별 주요 사용 사례 Anthropic, Google, OpenAI, xAI, DeepSeek, Qwen의 주요 모델들이 어디에 많이 쓰이고 있는지를 보여주는 차트입니다. 순서대로 (1) 앤트로픽은 프로그래밍 및 기술 관련 작업에 80% 이상 사용되고 있습니다. (2) 구글은 롤플레이, 프로그래밍, 테크, 법률, 과학 등 광범위하게 쓰이고 있습니다. 상대적으로 정보 검색엔진으로 많이 쓰이고 있다는 의미입니다. (3) 오픈AI는 시간이 지나면서 프로그래밍 및 기술 관련 토큰 사용량이 증가하고, 롤플레이나 가벼운 대화 비중은 줄어들고 있습니다. (4) xAI는 프로그래밍에 집중되어 있으나 이는 Grok Code Fast 모델을 무료로 풀어서 그렇습니다. (5) DeepSeek 모델은 역할극 및 캐주얼한 상호작용에 주로 쓰이고 있습니다.

사실·구조AI Labs별 워크로드 포지셔닝주 대상 · 산업·업종 · AI Labs관련 대상 · 기업·종목 · Anthropic관련 대상 · 기업·종목 · Google관련 대상 · 기업·종목 · OpenAI

주요 AI Labs 모델은 어떤 작업에 집중되고 있는가?

이 자료가 더한 내용

앤트로픽은 프로그래밍·기술 작업이 80% 이상, 구글은 롤플레이·프로그래밍·기술·법률·과학에 폭넓게 쓰였다. xAI의 프로그래밍 집중은 무료 Grok Code Fast 영향으로, DeepSeek은 역할극·캐주얼 상호작용, Qwen은 프로그래밍 40~60% 비중으로 각각 설명했다.

근거 보기 2
  1. 원문 구간 1

    Groq 창업자인 조나단 로스가 말하기로, 유능한 개발진들은 거의 매월 코딩 모델을 바꾸고 있을 정도로 매우 민감하게 대응 중이라고 말했습니다. ​ AI Labs들의 모델별 주요 사용 사례 Anthropic, Google, OpenAI, xAI, DeepSeek, Qwen의 주요 모델들이 어디에 많이 쓰이고 있는지를 보여주는 차트입니다. 순서대로 (1) 앤트로픽은 프로그래밍 및 기술 관련 작업에 80% 이상 사용되고 있습니다. (2) 구글은 롤플레이, 프로그래밍, 테크, 법률, 과학 등 광범위하게 쓰이고 있습니다. 상대적으로 정보 검색엔진으로 많이 쓰이고 있다는 의미입니다. (3) 오픈AI는 시간이 지나면서 프로그래밍 및 기술 관련 토큰 사용량이 증가하고, 롤플레이나 가벼운 대화 비중은 줄어들고 있습니다. (4) xAI는 프로그래밍에 집중되어 있으나 이는 Grok Code Fast 모델을 무료로 풀어서 그렇습니다. (5) DeepSeek 모델은 역할극 및 캐주얼한 상호작용에 주로 쓰이고 있습니다.

  2. 원문 구간 2

    검열이 덜한 모델이어서 그렇기도 합니다. (6) Qwen은 프로그래밍에 집중하고 있습니다. 전체 기간 동안 프로그래밍 관련 볼륨이 40~60%를 꾸준히 차지하고 있습니다. ​ 2025년 내내 오픈AI 모델의 사용 양상이 가장 많이 변했습니다. 2025년 초에는 과학 관련 작업이 오픈AI 토큰 사용량의 50% 이상을 차지했는데 → 2025년 말에는 과학 비중이 15%로 줄었습니다. 대신 프로그래밍 및 기술 분야 사용량은 이제 전체 사용량의 58%를 차지할 정도로 커졌습니다. 개발자 워크플로우, 생산성 도구, 각종 전문 애플리케이션에 더 잘 통합되고 있다는 의미입니다. ​ 토큰 사용량 및 토큰 점유율만 중요한 것이 아니라 해당 AI Labs의 모델이 얼마나 수익성이 있는 워크로드에 많이 쓰이고 있는가도 중요합니다. 그런 의미에서 AI Labs의 ARR이 가장 중요하다고 보는데요. 이런 점에서 가장 우수한 기업이 앤트로픽입니다. 앤트로픽의 토큰 사용량, 토큰 점유율을 신경쓰는 사람은 없지만 ARR은 Top 2인 것을 생각하시면 도움이 되실 것 같습니다.

시점 관찰OpenAI 모델의 사용 양상 변화주 대상 · 기업·종목 · OpenAI기준 2025.12

OpenAI 모델의 사용 목적은 2025년에 어떻게 바뀌었는가?

이 자료가 더한 내용

2025년 초 OpenAI 토큰 사용량의 50% 이상이 과학 작업이었으나 연말에는 15%로 줄었고, 프로그래밍·기술 분야는 58%까지 커졌다. 작성자는 개발자 워크플로우·생산성 도구·전문 애플리케이션 통합이 늘어난 것으로 해석하며, 토큰 점유율보다 수익성 있는 워크로드와 ARR을 함께 봐야 한다고 적었다.

근거 보기 2
  1. 원문 구간 1

    검열이 덜한 모델이어서 그렇기도 합니다. (6) Qwen은 프로그래밍에 집중하고 있습니다. 전체 기간 동안 프로그래밍 관련 볼륨이 40~60%를 꾸준히 차지하고 있습니다. ​ 2025년 내내 오픈AI 모델의 사용 양상이 가장 많이 변했습니다. 2025년 초에는 과학 관련 작업이 오픈AI 토큰 사용량의 50% 이상을 차지했는데 → 2025년 말에는 과학 비중이 15%로 줄었습니다. 대신 프로그래밍 및 기술 분야 사용량은 이제 전체 사용량의 58%를 차지할 정도로 커졌습니다. 개발자 워크플로우, 생산성 도구, 각종 전문 애플리케이션에 더 잘 통합되고 있다는 의미입니다. ​ 토큰 사용량 및 토큰 점유율만 중요한 것이 아니라 해당 AI Labs의 모델이 얼마나 수익성이 있는 워크로드에 많이 쓰이고 있는가도 중요합니다. 그런 의미에서 AI Labs의 ARR이 가장 중요하다고 보는데요. 이런 점에서 가장 우수한 기업이 앤트로픽입니다. 앤트로픽의 토큰 사용량, 토큰 점유율을 신경쓰는 사람은 없지만 ARR은 Top 2인 것을 생각하시면 도움이 되실 것 같습니다.

  2. 원문 구간 2

    오픈AI의 사용 사례는 앤트로픽의 꽤나 상업적 사용 패턴과 구글의 보편적 사용 패턴(정보 검색엔진으로 주로 쓰이는 패턴)의 사이에 위치해 있습니다. 오픈AI가 워크로드를 점점 더 고부가가치 작업에 잘 맞도록 집중하고 있다는 의미입니다. 지역별 LLM 사용량 북미 47%, 아시아 29%, 유럽 21% 지역별 LLM 사용량 분포 OpenRouter 사용자 기반에 한정한 데이터이긴 하지만, 나름 100조 토큰을 갖고 통계를 매긴 것이기 때문에 꽤나 유의미한 통계라고 생각합니다. LLM 사용량 분포를 보시면 AI 추론 시장이 점점 더 세계화되는 중입니다. 북미는 여전히 단일 지역 중 가장 큰 사용량을 보이고 있지만, 아시아의 비중이 매우 빠르게 증가하는 중입니다. 인구수가 많아서이기도 한데 2024년 10월에는 아시아가 전 세계 토큰 사용량의 13%였는데 → 2025년 11월 말에는 31%까지 상승했습니다. ​ 국가별 토큰 사용량을 매겨보면 미국 47.2% > 싱가포르 9.2% (중국 사용량이 많이 잡힐 것) > 독일 7.5% > 중국 6.0% > 한국 2.9% > 네덜란드 2.7% > 영국 2.5% > 캐나다 1.9% > 일본 1.8% > 인도 1.6% > 기타 16.8%

시점 관찰지역별 LLM 토큰 사용주 대상 · 산업·업종 · LLM 산업기준 2025.11

LLM 추론 수요는 지역별로 어떻게 분포하고 변화했는가?

이 자료가 더한 내용

OpenRouter 사용자 기반에서 북아메리카 47.2%, 아시아 28.6%, 유럽 21.3%였고, 아시아 비중은 2024년 10월 13%에서 2025년 11월 말 31%까지 상승했다. 국가별로는 미국 47.2%, 싱가포르 9.2%, 독일 7.5%, 중국 6.0%, 한국 2.9% 등이 제시됐다.

근거 보기 2
  1. 원문 구간 1

    ​ 대륙별 LLM 사용량을 보면 북아메리카 47.2% > 아시아 28.6% > 유럽 21.3% > 남아메리카 1.2% > 오세아니아 1.2% > 아프리카 0.5% 왜 '1위' 모델이 되는 게 중요한가? 선발주자 이점과 신데렐라의 '유리 구두' 현상 LLM 사용자 유지율 분석 왼쪽 위부터 오른쪽으로 순서대로 Claude 4 Sonnet, Gemini 2.5 Pro, Gemini 2.5 Flash, OpenAI GPT-4o, DeepSeek-R1, Llama 4 Maverick입니다. 이 유지율(Retention Rate) 차트는 특정 기간에 해당 모델을 쓰기 시작한 사용자 기반(Cohort)이 시간이 지남에 따라 얼마나 해당 모델에 남아있느냐를 보여주는 차트입니다. ​ 언뜻 보면 이탈율이 매우 높고 초기 사용자 코호트 감소가 두드러져 보이지만, 핵심은 해당 구간별로 1위 모델은 소수의 초기 사용자들이 꽤 오랫동안 높은 유지율을 보인다는 것입니다.

  2. 원문 구간 2

    아시아의 토큰 수요 점유율은 13% → 31%까지 증가했습니다. ​ 신데렐라의 '유리 구두' 파운데이션 모델은 사전훈련에 따라 비약적으로 발전하기 때문에, 유지율이 AI Labs 경쟁력의 척도입니다. 모델의 성능 향상은 해당 모델이 고부가가치 워크로드에 완벽하게 적합할 수 있는 짧은 순간을 만들어냅니다. 대략 1~3개월 정도인데, 사용자가 적합성을 발견하면 비교적 그 모델을 계속해서 사용할 가능성이 높습니다. 원래 Product-Market Fit이라 부르던 조합은 AI Labs들 입장에서 Workload-Model Fit과도 같습니다. 문제를 최초로 풀 수 있는 모델이 되는 것이 중요합니다. 점점 더 빠르게 변화하는 시장에서 여전히 모델 주도권을 지키는 게 중요한 이유입니다.

판단 방법LLM 모델 유지율과 Workload-Model Fit주 대상 · 산업·업종 · LLM 산업관련 대상 · 기업·종목 · Anthropic관련 대상 · 기업·종목 · Google

특정 워크로드의 모델 유지율은 경쟁력을 어떻게 설명하는가?

이 자료가 더한 내용

유지율은 특정 시점에 모델을 쓰기 시작한 코호트가 시간이 지나도 남는 정도이며, 구간별 1위 모델은 일부 초기 사용자가 높은 유지율을 보인다고 설명했다. 작성자는 이전에 풀리지 않던 고가치 문제를 처음 푼 모델이 1~3개월의 적합성 순간을 만들고 시스템·데이터 파이프라인·사용자 경험이 그 모델에 고정될 수 있다고 보며 이를 Workload-Model Fit으로 부른다.

근거 보기 2
  1. 원문 구간 1

    여러 모델들이 출시되고 있지만 기존 모델로는 풀리지 않던 고가치 워크로드들이 항상 존재한다는 걸 보여주는 증거입니다. 새로 개발되는 1위 모델들은 미해결 문제에 대해서 시험해보려는 사람들이 몰리는 효과를 낳습니다. 그리고 그 모델이 이전에 풀리지 않던 문제를 풀 수 있게 됐을 때 마치 유리 구두를 신은 듯한 완벽한 적합성을 얻게 됩니다. ​ 그래서 그 특정 워크로드는 생각보다 오랫동안 유지됩니다. 각 모델의 시스템, 데이터 파이프라인, 사용자 경험은 문제를 처음 해결해준 모델에 고정됩니다. 일례로 Claude 4 Sonnet은 코딩에서 안 풀리던 문제들을 상당히 많이 풀게 해준 모델이었고 도구 사용 안정성도 높았으며, Gemini 2.5 Pro는 보다 값싼 Reasoning 모델이었기에 타 모델들에 비해서 초기 사용자들의 유지율이 꽤 높게 나타납니다. 폐쇄소스와 오픈소스의 공존 그동안 단일 모델이 사용량을 지배한 적은 없었습니다.

  2. 원문 구간 2

    아시아의 토큰 수요 점유율은 13% → 31%까지 증가했습니다. ​ 신데렐라의 '유리 구두' 파운데이션 모델은 사전훈련에 따라 비약적으로 발전하기 때문에, 유지율이 AI Labs 경쟁력의 척도입니다. 모델의 성능 향상은 해당 모델이 고부가가치 워크로드에 완벽하게 적합할 수 있는 짧은 순간을 만들어냅니다. 대략 1~3개월 정도인데, 사용자가 적합성을 발견하면 비교적 그 모델을 계속해서 사용할 가능성이 높습니다. 원래 Product-Market Fit이라 부르던 조합은 AI Labs들 입장에서 Workload-Model Fit과도 같습니다. 문제를 최초로 풀 수 있는 모델이 되는 것이 중요합니다. 점점 더 빠르게 변화하는 시장에서 여전히 모델 주도권을 지키는 게 중요한 이유입니다.

해석·전망Agentic AI 침투와 하드웨어 세대주 대상 · 산업·업종 · LLM 산업

작성자는 Agentic AI 침투 시점과 하드웨어를 어떻게 연결하는가?

이 자료가 더한 내용

작성자는 Reasoning을 여러 단계를 거쳐 답하는 방식, Agentic AI를 계획·추론·실행·피드백을 거쳐 결과를 내는 방식으로 설명한다. CY2026의 핵심은 Agentic AI일 것이며, 침투가 폭발적으로 증가할 시점은 VR200 NVL72 온라인 시기와 겹칠 것으로 예상해 하드웨어가 소프트웨어를 주도한다고 본다.

근거 보기 1
  1. 원문 구간 1

    ​ Reasoning 및 Agentic AI LLM이 단순한 답을 내놓는 수준을 넘어서 여러 단계를 거쳐서 답변하는 Reasoning, 여러 단계를 거쳐 계획-추론-실행-피드백하며 최종 결과물을 내놓는 Agentic AI로까지 발전하고 있습니다. 이제 모델은 점차 도구를 사용하여 외부 데이터에 액세스하여 목표를 달성할 때까지 출력을 반복합니다. CY2026의 핵심은 Agentic AI일 것으로 보며, 폭발적으로 Agentic AI 침투가 증가하는 시기는 Reasoning의 도입이 GB200 NVL72의 온라인 시기와 겹쳤던 것처럼, VR200 NVL72가 온라인되는 시기와 겹칠 것으로 예상합니다. 하드웨어가 소프트웨어를 주도하는 시대입니다. ​ 지리적 변화 LLM 사용량은 북미를 넘어서 점점 더 세계화되고 있습니다. 점차 많은 국가와 기업들이 AI를 쓰기 시작하고, 추론시장으로 바뀌어감에 따라 그렇습니다.

4

시간흐름대로 모든 내용을 살려 정리

시간흐름대로 모든 내용을 살려 정리

1
자료의 범위와 질문

안녕하세요 올바른입니다. AI 심화편 자료입니다. 2024년 초부터 2025년 말까지의 LLM 실사용량 데이터를 기반으로 100조 개의 토큰을 분석하여, 현재 LLM 시장이 어떤 모습인지를 정리한 자료입니다. 폐쇄소스 모델과 오픈소스 모델 간의 점유율, LLM 사용량 중 Reasoning이 차지하는 비율, AI Labs의 주요 모델들이 각각 주로 어느 카테고리에 강한지가 담겨 있습니다. 돈이 되는 워크로드는 어디로 흐르는지, Product-Market Fit의 시대를 지나 Workload-Model Fit의 시대로 가고 있는 이유, 지역별 토큰 사용량 점유율에 대해서도 살펴봤습니다.

2
함께 제시한 읽을거리

살펴보셨으면 하는 글들로 2026-01-02 ‘엔비디아가 $20B를 주고 데려온 남자 : Groq 창업자 조나단 로스의 통찰’, 2025-12-24 ‘구글 AI 인프라 책임자의 경고 : 우리는 여전히 수요를 심각하게 과소평가하고 있다’, 12-19 ‘블랙록 2026 전망 : AI CAPEX $8T 시대를 열기 위한 금융 보릿고개를 지나는 중’, 12-17 ‘AI 버블론을 잠재우는 숫자들 : 엔터프라이즈 AI $37B 시장의 현주소’를 연결했습니다. 12-04에는 ‘엔비디아 펀더멘탈 체크 : 구글 TPU의 추격? 시장점유율에 대한 생각, 아시아 공급망 체크’, 10-08에는 ‘오픈AI 퇴사자의 글 #1 : 2027년 AGI가 온다’를 제시했습니다. 10-03 ‘엔비디아 CEO 젠슨황 인터뷰 : 오픈AI 10GW 동맹 x 극한의 풀스택 공동 설계’, 09-26 ‘AI 사이클 한 눈에 보기, SemiAnalysis 인터뷰 : 승부사 젠슨황 그리고 화웨이의 역습’도 함께 제시했습니다.

3
유의문과 목차

투자자문 서비스에 따른 투자에서는 원금 손실이 발생할 수 있고, 투자 손익의 책임은 전적으로 고객에게 귀속되며 과거의 투자수익이 미래 수익률을 보장하지 않는다고 적었습니다. 신규 구독 전에는 아래 투자자문계약 권유문서의 계약 관련 제반 사항을 반드시 읽고 충분히 검토하라고 했고, 링크는 https://naver.me/5ZST47Qf 입니다. 목차는 ‘100조 개 토큰을 살펴보다 : OpenRouter를 통한 LLM 산업분석’, 오픈소스 대 폐쇄소스 30% 대 70%, Reasoning·길어진 시퀀스·프로그래밍, AI Labs별 사용 사례, 북미 47%·아시아 29%·유럽 21%의 지역 사용량, 1위 모델과 선발주자 이점·신데렐라의 유리 구두 현상입니다.

4
100조 토큰 표본과 o1의 등장

LLM 시장은 어디서 와서 어디로 가고 있는가? 이번 자료는 OpenRouter가 자사 플랫폼을 통해 실제로 고객사들이 2024년 11월 3일부터 2025년 11월 30일까지 쓴 100조 개 토큰을 분석해, LLM 모델에 대한 전반적인 뷰를 얻기 위한 자료입니다. 1년 전만 하더라도 LLM 업계는 지금과 완전히 달랐습니다. 오픈AI의 o1(코드명 Strawberry)이 나오기 전, 즉 2024년 9월 o1-preview 출시 전까지 LLM은 사전훈련된 데이터에서 질문을 받자마자 곧바로 답을 출력하는 방식이었습니다. o1은 최종 출력물을 말하기 전에 내부적으로 여러 단계에 걸쳐 숙고하고, 반복적으로 스스로 되묻는 과정을 거쳐 더 정돈된 답을 내놓는 첫 모델이었습니다. 이것이 현재 Reasoning으로 불리는 Test-time compute입니다. 이후 2024년 12월 Gemini 2.0 Flash Thinking(preview), 2025년 1월 DeepSeek-R1이 출시된 흐름입니다.

5
병렬 추론과 실사용 연구의 의의

오픈AI는 2024년 12월 병렬식(Parallel) test-time compute 구조인 o1-pro를 발표했습니다. 여러 모델이 서로 검증하면서 최선의 답을 내놓는 구조입니다. 이 구조는 2025년 5월 20일 Gemini 2.5 Deep Think, 5월 23일 Claude 4, 7월 9일 Grok 4 Heavy에 채택됐고, 이후 업계를 주도할 새로운 패러다임은 나오지 않았습니다. 보통 설문조사 자료가 많았지만 실제 사용자 데이터를 살펴본 것은 이번 OpenRouter 자료가 처음이라고 봅니다. OpenRouter는 다양한 모델 요청을 오케스트레이션하는 플랫폼이라 개발자와 최종 사용자가 여러 작업에 실제로 어떤 모델 API를 불러오는지 볼 수 있기 때문입니다. 오픈·폐쇄소스, 에이전트 기반 추론, 사용 사례 카테고리, 지리적 분석, 모델 유지 패턴 다섯 가지를 정리해봤습니다.

6
오픈소스와 폐쇄소스의 균형

30% 대 70% 차트는 오픈소스(OSS)와 폐쇄소스 유형별 총 토큰 볼륨 점유율을 시각화한 것입니다. 밝은 파란색은 오픈소스 모델이며 그 안에 중국 OSS와 기타 국가 OSS가 있고, 진한 파란색은 폐쇄소스 모델입니다. 세로 선들은 주요 모델들을 표시합니다. AI 생태계의 핵심 중 하나는 오픈·폐쇄소스 간 점유율 변화와 오픈소스 안에서 중국 모델이 차지하는 비중 변화입니다. 미국 AI Labs 모델이 전체 토큰 사용량 대부분을 차지해도 오픈소스는 꾸준히 약 30%입니다. 규제·보안·데이터 주권 때문에 외부 API 호출이 제한되는 기업, 비용·벤더 락인·커스터마이징 관점에서 자체 호스팅이 경제적으로 매력적인 워크로드가 늘기 때문입니다. Llama 3.3 70B, DeepSeek V3/R1, Kimi K2, Qwen 3, gpt-oss처럼 상대적으로 경쟁력 있는 모델이 출시되는 시점과 사용량의 단기 상승이 관련이 높습니다.

7
중국 모델이 이끈 오픈소스 볼륨

위 차트가 점유율 관점이라면, 여기서는 볼륨 관점도 봅니다. 진한 빨간색은 폐쇄형, 주황색은 중국 오픈소스, 청록색은 중국 외 오픈소스 모델의 주간 토큰 사용량입니다. 오픈소스 모델 성장의 상당 부분은 중국 AI Labs에서 개발한 모델에서 나왔습니다. 2024년 말 중국 모델 점유율은 약 1.2% 수준이었지만 일부 시점에는 거의 30%에 달했고, 연간으로는 평균 토큰 볼륨의 13.0%를 차지했습니다. OpenAI의 gpt-oss, 메타의 Llama, 프랑스 Mistral 등 중국 외 국가 모델은 평균 13.7%를 차지했습니다. 중국 AI Labs의 오픈소스 경쟁력은 모델 퀄리티도 있지만 빠르고 촘촘한 모델 업데이트 사이클 덕분이기도 합니다. Qwen과 DeepSeek는 상대적으로 정기적인 모델 출시로 새로운 워크로드에 신속하게 적응하는 데 초점을 맞추고 있습니다.

8
빠르게 바뀌는 오픈소스 선두

상위 15개 오픈소스 모델의 점유율 추이는 2025년 하반기부터 매우 경쟁적인 환경이 됐음을 보여줍니다. 2024년 말부터 메타 Llama에서 DeepSeek V3·R1로 주도권이 넘어가기 시작했고, 2025년 상반기에도 DeepSeek 점유율이 상당히 높았습니다. 메타의 점유율은 이미 상당히 훼손된 모습이며, 이 시점쯤 저커버그가 MSL을 설립하면서 본격적으로 피벗한 시기라고 연결합니다. 2025년 8월부터는 추론 수요가 크게 늘어 시장이 넓어지고 사용 사례도 다양해지면서 DeepSeek·Qwen·Kimi·MiniMax·GLM·gpt-oss가 경쟁합니다. 단일 모델이 오픈소스 토큰 점유율 25%를 넘기는 경우가 없어졌고, 사용자들은 점점 더 재빠르게 더 좋은 모델을 택합니다. 유능한 오픈소스 모델을 만들 수만 있다면 몇 주 만에 오픈소스 업계 Top 1이 될 수도 있는 시대입니다.

9
중형 모델의 확대

Medium is the New Small입니다. 크기별 차트는 위부터 대형·중형·소형 모델이 처리한 전체 오픈소스 토큰 볼륨의 점유율입니다. 1년 전 오픈소스 생태계는 소수의 강력한 대형 모델과 다수의 작고 빠른 소형 모델이 있는 구도였습니다. 소형은 파라미터 수 15B 미만, 중형은 15~70B, 대형은 70B 이상인 모델을 뜻합니다. 시장이 성숙하면서 상대적으로 모델의 평균 규모가 점점 더 커지는 중입니다. 거대모델의 사용량이 늘었고, 1Q25부터는 중형 모델의 사용량도 점점 늘고 있습니다.

10
오픈소스의 역할극 수요

오픈소스 모델 사용량 중 평균 52%가 Roleplay입니다. 대략 절반 이상이 스토리텔링, 캐릭터 역할극, 게임 시나리오 등에 쓰이고 있습니다. 오픈소스 모델은 상대적으로 파인튜닝에 적합하기도 하고 콘텐츠 검열이 적어서 판타지나 엔터테인먼트에 잘 맞기 때문입니다.

11
Reasoning과 길어진 요청

Reasoning이 새로운 기본값이고, 더 길어진 시퀀스에서 프로그래밍이 메인입니다. 여기서 보는 것은 모델들이 출력한 토큰 가운데 Reasoning 토큰 비율이 아니라, Non-Reasoning 토큰과 Reasoning 기반 모델 토큰의 추세 및 Reasoning 모델이 처리한 토큰의 비율입니다. o1-preview는 2024년 9월에 나왔지만 1Q25까지만 해도 Reasoning 모델을 쓰는 비율은 매우 낮았습니다. 시간이 지나면서 비중이 점차 늘어 현재는 50%를 넘었습니다. GPT-5, Claude 4.5, Gemini 3 같은 모델들이 이어지며 이제 Reasoning 모델이 표준이 된 시대입니다. 또한 사용자는 단순히 텍스트를 생성하는 모델이 아니라 에이전트 방식의 워크플로우를 지원하는 모델을 점점 더 선호합니다. 왼쪽 차트에서는 평균 프롬프트 길이가 2024년 초 이후 4배 가까이 늘어 사람들이 AI에 더 많은 컨텍스트 정보와 더 높은 지능·해석을 요하는 작업을 시킨다는 뜻이고, 오른쪽 완료 토큰 수도 3배 증가했습니다.

12
프로그래밍이 만든 토큰 증가

토큰 사용량 증가는 대부분 프로그래밍 때문입니다. 프롬프트 토큰(input)과 완료 토큰(output) 수 모두 크게 증가했지만 규모는 좀 다릅니다. 요청당 평균 프롬프트 토큰 수는 2024년 1월 1,500개에서 2025년 11월 6,000개로 4배 증가했고, 완료 토큰은 같은 기간 150개에서 400개로 약 3배 증가했습니다. 이전보다 사용자가 더 복잡한 작업을 시키고 있다는 의미입니다. ‘에세이를 써주세요’ 같은 요청보다 코드베이스·문서·녹취록처럼 다양하고 큰 문서를 쭉 넣고 분석과 통찰을 뽑아내길 원한다는 것입니다. 모든 LLM 사용 사례 중 독보적으로 많이 쓰이는 사례는 프로그래밍입니다. 프로그래밍은 2025년 5월 전체 토큰의 11%에서 12월 50%를 넘었고, 이 분야에 가장 집중하고 가장 큰 점유율을 차지한 AI Lab은 앤트로픽입니다.

13
코딩 모델의 민감한 경쟁

앤트로픽의 Claude 모델이 가장 많은 코딩 요청을 처리하고 OpenAI와 구글이 뒤를 이으며 MiniMax 점유율도 조금씩 증가합니다. 앤트로픽의 프로그래밍 시장 점유율은 60%입니다. Grok Code Fast는 사용량 자체는 많지만 무료로 뿌려 사용량이 많은 것이므로 이를 제외한 시장점유율이라는 조건입니다. 워낙 경쟁적이라 모델 품질이나 지연시간의 작은 변화도 매주 점유율을 바꿀 정도입니다. Groq 창업자 조나단 로스의 말로 유능한 개발진은 거의 매월 코딩 모델을 바꾸고 있을 정도로 민감하게 대응한다고 전합니다.

14
모델별 사용 사례의 차이

이 차트는 Anthropic, Google, OpenAI, xAI, DeepSeek, Qwen의 주요 모델이 어디에 많이 쓰이는지를 보여줍니다. 앤트로픽은 프로그래밍·기술 관련 작업에 80% 이상 쓰입니다. 구글은 역할극·프로그래밍·테크·법률·과학 등 광범위하게 쓰이며, 상대적으로 정보 검색엔진으로 많이 쓰인다는 의미입니다. OpenAI는 시간이 지나며 프로그래밍·기술 관련 토큰 사용량이 증가하고 역할극·가벼운 대화 비중은 줄고 있습니다. xAI의 프로그래밍 집중은 Grok Code Fast 모델을 무료로 풀어서 그렇고, DeepSeek은 역할극·캐주얼 상호작용, Qwen은 전체 기간 동안 프로그래밍 관련 볼륨이 40~60%를 꾸준히 차지합니다.

15
OpenAI의 사용처 전환과 ARR

2025년 내내 OpenAI 모델의 사용 양상이 가장 많이 변했습니다. 2025년 초에는 과학 관련 작업이 OpenAI 토큰 사용량의 50% 이상이었지만 연말에는 과학 비중이 15%로 줄었습니다. 대신 프로그래밍·기술 분야는 전체 사용량의 58%를 차지할 정도로 커졌습니다. 개발자 워크플로우, 생산성 도구, 각종 전문 애플리케이션에 더 잘 통합되고 있다는 의미입니다. 토큰 사용량·점유율만큼 해당 AI Labs 모델이 얼마나 수익성 있는 워크로드에 쓰이는지도 중요하고, 그런 의미에서 ARR이 가장 중요하다고 봅니다. 앤트로픽은 토큰 사용량·점유율을 신경 쓰는 사람이 많지 않아도 ARR은 Top 2입니다. OpenAI 사용 사례는 앤트로픽의 꽤 상업적 사용 패턴과 구글의 보편적 사용 패턴, 즉 정보 검색엔진으로 주로 쓰이는 패턴의 사이에 있으며, OpenAI가 워크로드를 더 고부가가치 작업에 맞게 집중하고 있다는 의미입니다.

16
지역별 추론 수요

OpenRouter 사용자 기반에 한정한 데이터이긴 하지만, 100조 토큰을 갖고 통계를 매긴 것이므로 꽤나 유의미한 통계라고 봅니다. AI 추론 시장은 점점 더 세계화되는 중입니다. 북미는 여전히 단일 지역 중 가장 큰 사용량을 보이지만, 아시아 비중은 빠르게 늘어 2024년 10월 전 세계 토큰 사용량의 13%에서 2025년 11월 말 31%까지 올랐습니다. 국가는 미국 47.2%, 싱가포르 9.2%(중국 사용량이 많이 잡힐 것), 독일 7.5%, 중국 6.0%, 한국 2.9%, 네덜란드 2.7%, 영국 2.5%, 캐나다 1.9%, 일본 1.8%, 인도 1.6%, 기타 16.8%입니다. 대륙별로 북아메리카 47.2%, 아시아 28.6%, 유럽 21.3%, 남아메리카·오세아니아 각 1.2%, 아프리카 0.5%입니다.

17
유지율과 유리 구두

유지율 차트는 왼쪽 위부터 Claude 4 Sonnet, Gemini 2.5 Pro, Gemini 2.5 Flash, OpenAI GPT-4o, DeepSeek-R1, Llama 4 Maverick 순입니다. 특정 기간에 해당 모델을 쓰기 시작한 사용자 기반, 즉 코호트가 시간이 지나도 얼마나 그 모델에 남는지 봅니다. 언뜻 이탈률이 높고 초기 사용자 코호트 감소가 두드러져 보여도, 핵심은 구간별 1위 모델의 소수 초기 사용자가 꽤 오랫동안 높은 유지율을 보인다는 점입니다. 기존 모델로는 풀리지 않던 고가치 워크로드가 항상 존재하고, 새 1위 모델은 그 미해결 문제를 시험하려는 사람이 몰리게 합니다. 그 모델이 이전에 풀리지 않던 문제를 풀면 마치 유리 구두를 신은 듯한 완벽한 적합성을 얻습니다. Claude 4 Sonnet은 코딩의 안 풀리던 문제와 도구 사용 안정성을, Gemini 2.5 Pro는 더 값싼 Reasoning 모델이라는 점을 들어 초기 사용자 유지율이 높게 나타났다고 합니다.

18
공존과 예상 밖의 캐주얼 사용

그동안 단일 모델이 사용량을 지배한 적은 없었습니다. 특히 폐쇄소스와 오픈소스 간 균형이 인상적이며, 오픈소스는 꾸준히 점유율 30%를 차지합니다. OpenAI와 앤트로픽은 프로그래밍·지식노동자 워크플로우에 통합되는 사례에서 선두를 차지하지만, 이는 ARR을 높일 수 있는 고부가가치 작업들입니다. DeepSeek·Qwen 등 오픈소스 모델도 토큰 사용량의 상당 부분을 차지합니다. 개발자들은 유연성을 유지하고 여러 모델을 통합해 각 작업에 가장 적합한 모델을 사용하고 있습니다. 생각보다 캐주얼한 사용 사례가 많다. 오픈소스 모델 사용량의 50% 이상은 롤플레이·스토리텔링에서 나왔고, ChatGPT 초기 사용 사례도 상당 부분 캐주얼한 용도였습니다. LLM을 코드 작성처럼 생산성을 높이는 분야에만 쓸 것 같은 느낌과는 조금 다른 결과이며, 검색·건강 관련 질문(지식iN, StackOverflow 같은 것을 완벽히 대체 중)·쇼핑 관련 가벼운 질문에도 많이 쓰입니다.

19
Agentic AI와 하드웨어 전망

Reasoning 및 Agentic AI를 봅니다. LLM은 단순한 답을 내놓는 수준을 넘어 여러 단계를 거쳐 답변하는 Reasoning, 여러 단계를 거쳐 계획·추론·실행·피드백하며 최종 결과물을 내놓는 Agentic AI로까지 발전하고 있습니다. 이제 모델은 점차 도구를 사용해 외부 데이터에 액세스하고 목표를 달성할 때까지 출력을 반복합니다. CY2026의 핵심은 Agentic AI일 것으로 봅니다. 폭발적으로 Agentic AI 침투가 증가하는 시기는 Reasoning의 도입이 GB200 NVL72의 온라인 시기와 겹쳤던 것처럼 VR200 NVL72가 온라인되는 시기와 겹칠 것으로 예상합니다. 하드웨어가 소프트웨어를 주도하는 시대입니다.

20
세계화와 Workload-Model Fit의 결론

LLM 사용량은 북미를 넘어 점점 더 세계화되고 있습니다. 많은 국가와 기업이 AI를 쓰기 시작하고 추론시장으로 바뀌어가기 때문이며, 아시아 토큰 수요 점유율은 13%에서 31%까지 증가했습니다. 신데렐라의 유리 구두를 다시 보면, 파운데이션 모델은 사전훈련에 따라 비약적으로 발전하므로 유지율이 AI Labs 경쟁력의 척도입니다. 모델 성능 향상은 고부가가치 워크로드에 완벽하게 적합할 수 있는 짧은 순간을 만듭니다. 대략 1~3개월인데 사용자가 적합성을 발견하면 비교적 그 모델을 계속 쓸 가능성이 높습니다. 각 모델의 시스템·데이터 파이프라인·사용자 경험은 문제를 처음 해결해준 모델에 고정되고, 특정 워크로드는 생각보다 오래 유지됩니다. Product-Market Fit이라 부르던 조합은 AI Labs 입장에서 Workload-Model Fit과 같습니다. 문제를 최초로 풀 수 있는 모델이 되는 것, 빠르게 변하는 시장에서 모델 주도권을 지키는 일이 중요한 이유입니다.

5

그럼에도 빠진내용 정리

잡담·곁다리 내용
  • 잡담, 화면 설명, 불확실한 표현을 무작정 버리지 않는다.
생략 기록
  • 없음. 모든 sourceCoverage 구간은 flow에서 순서대로 회수했다.

그럼에도 빠진내용 정리

압축/생략
목차의 과거 연결 글 제목과 투자 유의문, 본문 수치·기간·조건은 각 sourceCoverage 구간에 맞춰 flow에 남겼다.
잡담/운영
OpenRouter 표본은 해당 플랫폼 사용자 기반이라는 한계를 원문의 표현대로 유지했고, 싱가포르 수치는 중국 사용량이 많이 잡힐 수 있다는 원문 괄호도 보존했다.
전사 오류 가능성
Agentic AI의 침투 시기와 VR200 NVL72의 연관은 작성자의 전망이며, 실제 도입 또는 산업 결과로 확정하지 않았다.
원문 확인

document_work_runner prepare가 입력 원문을 수정 없이 보존했다.