24-9 오픈AI o1-preview의 Test-time compute 적용
작성자의 핵심 판단
작성자는 o1 이후 Reasoning이 업계의 기본값이 됐으며, 그 뒤 이를 대체할 새 패러다임은 아직 나오지 않았다고 본다.
근거 보기 3
- 원문 구간 1
100조 개 토큰을 살펴보다 OpenRouter를 통한 LLM 산업분석 LLM 시장은 어디서 와서 어디로 가고 있는가? 이번 자료는 OpenRouter가 자사 플랫폼을 통해서 실제로 고객사들이 2024년 11월 3일부터 2025년 11월 30일까지 쓴 100조 개의 토큰을 분석하여, LLM 모델에 대한 전반적인 뷰를 얻기 위한 자료입니다. OpenAI o1, "Strawberry 🍓" 1년 전만 하더라도 LLM 업계는 지금과 완전히 달랐습니다. 오픈AI의 o1(코드명 Strawberry)가 나오기 전(2024년 9월에 o1-preview 출시)까지만 해도 LLM은 단순하게 사전훈련된 데이터에서 질문을 받자마자 곧바로 답을 출력하는 방식이었습니다. o1은 현재 'Reasoning'으로 불리는 Test-time compute를 선보였습니다. 최종 출력물을 말하기 전에 내부적으로 여러 단계에 걸쳐 숙고하고, 반복적으로 스스로 되묻는 과정을 거치면서 보다 정돈된 답을 내놓는 첫 모델이었습니다. 이후 24년 12월 Gemini 2.0 Flash Thinking(preview)이 출시되고, 2025년 1월에 DeepSeek-R1이 출시된 흐름입니다.
- 원문 구간 2
그리고 오픈AI가 2024년 12월에 병렬식(Parallel) test-time compute 구조인 o1-pro를 발표했었습니다. 여러 모델이 서로 검증하면서 최선의 답을 내놓는 구조입니다. 이후에 다시 이 구조가 2025년 5월 20일에 Gemini 2.5 Deep Think에 채택되고, 5월 23일 Claude 4에 채택됐으며, 7월 9일에 Grok 4 Heavy에서 쓰였습니다. 이후 업계를 주도할 새로운 패러다임이 나오진 않았습니다. LLM 사용에 대한 실증 연구 논문 보통은 설문조사를 통한 내용이 많았는데 실제 사용자들의 데이터를 살펴본 건 이번 OpenRouter 자료가 처음입니다. OpenRouter 자체가 다양한 모델들의 요청을 오케스트레이션 하는 플랫폼이기 때문에 개발자와 최종 사용자들이 다양한 작업을 위해서 실제로 어떤 모델 API를 불러오는지를 살펴볼 수 있는 플랫폼이기 때문입니다. 오픈소스 모델 vs 폐쇄소스 모델 에이전트 기반 추론 사용 사례 카테고리별 모델 사용 지리적 분석
- 원문 구간 3
또한 점차 사용자들은 단순히 텍스트를 생성하는 모델이 아닌 에이전트 방식의 워크플로우를 지원하는 모델을 점점 더 선호하고 있습니다. *왼쪽: 프롬프트 토큰 수가 증가하고 있습니다. 평균 프롬프트 길이는 2024년 초 이후 4배 가까이 늘었으며, 이는 점점 더 사람들이 AI에 컨텍스트 정보를 더 많이 요하는/더 높은 지능과 해석을 요하는 작업을 늘리고 있다는 의미입니다. **오른쪽: 완료 토큰 수도 3배로 증가했습니다. 토큰 사용량의 증가는 대부분 프로그래밍 때문 프롬프트 토큰(input)와 완료 토큰(output) 수 모두 크게 증가했지만 규모는 좀 다릅니다. 요청당 평균 프롬프트 토큰 수는 2024년 1월 1,500개 → 2025년 11월 6,000개로 4배 증가했고, 완료 토큰은 같은 기간 150개 → 400개로 약 3배 증가했습니다. 이전보다 사용자들이 좀더 복잡한 작업을 시키고 있다는 의미입니다. 일례로 '에세이를 써주세요' 같은 요청이 아닌, 코드베이스, 문서, 녹취록 등 다양하고 큰 문서들을 쭉 넣고 분석 및 통찰을 뽑아내주길 원하고 있다는 것입니다.
이 자료에서 다룬 사실
오픈AI는 2024년 9월 o1-preview를 출시했고, 이 모델은 최종 답변 전 여러 단계로 숙고하고 스스로 되묻는 Test-time compute를 선보였다고 소개했다.
근거 보기 1
- 원문 구간 1
100조 개 토큰을 살펴보다 OpenRouter를 통한 LLM 산업분석 LLM 시장은 어디서 와서 어디로 가고 있는가? 이번 자료는 OpenRouter가 자사 플랫폼을 통해서 실제로 고객사들이 2024년 11월 3일부터 2025년 11월 30일까지 쓴 100조 개의 토큰을 분석하여, LLM 모델에 대한 전반적인 뷰를 얻기 위한 자료입니다. OpenAI o1, "Strawberry 🍓" 1년 전만 하더라도 LLM 업계는 지금과 완전히 달랐습니다. 오픈AI의 o1(코드명 Strawberry)가 나오기 전(2024년 9월에 o1-preview 출시)까지만 해도 LLM은 단순하게 사전훈련된 데이터에서 질문을 받자마자 곧바로 답을 출력하는 방식이었습니다. o1은 현재 'Reasoning'으로 불리는 Test-time compute를 선보였습니다. 최종 출력물을 말하기 전에 내부적으로 여러 단계에 걸쳐 숙고하고, 반복적으로 스스로 되묻는 과정을 거치면서 보다 정돈된 답을 내놓는 첫 모델이었습니다. 이후 24년 12월 Gemini 2.0 Flash Thinking(preview)이 출시되고, 2025년 1월에 DeepSeek-R1이 출시된 흐름입니다.
그렇게 판단한 이유
Gemini 2.0 Flash Thinking, DeepSeek-R1, o1-pro의 병렬식 구조와 이를 채택한 Gemini 2.5 Deep Think·Claude 4·Grok 4 Heavy의 출시 흐름을 근거로 든다.
근거 보기 2
- 원문 구간 1
100조 개 토큰을 살펴보다 OpenRouter를 통한 LLM 산업분석 LLM 시장은 어디서 와서 어디로 가고 있는가? 이번 자료는 OpenRouter가 자사 플랫폼을 통해서 실제로 고객사들이 2024년 11월 3일부터 2025년 11월 30일까지 쓴 100조 개의 토큰을 분석하여, LLM 모델에 대한 전반적인 뷰를 얻기 위한 자료입니다. OpenAI o1, "Strawberry 🍓" 1년 전만 하더라도 LLM 업계는 지금과 완전히 달랐습니다. 오픈AI의 o1(코드명 Strawberry)가 나오기 전(2024년 9월에 o1-preview 출시)까지만 해도 LLM은 단순하게 사전훈련된 데이터에서 질문을 받자마자 곧바로 답을 출력하는 방식이었습니다. o1은 현재 'Reasoning'으로 불리는 Test-time compute를 선보였습니다. 최종 출력물을 말하기 전에 내부적으로 여러 단계에 걸쳐 숙고하고, 반복적으로 스스로 되묻는 과정을 거치면서 보다 정돈된 답을 내놓는 첫 모델이었습니다. 이후 24년 12월 Gemini 2.0 Flash Thinking(preview)이 출시되고, 2025년 1월에 DeepSeek-R1이 출시된 흐름입니다.
- 원문 구간 2
그리고 오픈AI가 2024년 12월에 병렬식(Parallel) test-time compute 구조인 o1-pro를 발표했었습니다. 여러 모델이 서로 검증하면서 최선의 답을 내놓는 구조입니다. 이후에 다시 이 구조가 2025년 5월 20일에 Gemini 2.5 Deep Think에 채택되고, 5월 23일 Claude 4에 채택됐으며, 7월 9일에 Grok 4 Heavy에서 쓰였습니다. 이후 업계를 주도할 새로운 패러다임이 나오진 않았습니다. LLM 사용에 대한 실증 연구 논문 보통은 설문조사를 통한 내용이 많았는데 실제 사용자들의 데이터를 살펴본 건 이번 OpenRouter 자료가 처음입니다. OpenRouter 자체가 다양한 모델들의 요청을 오케스트레이션 하는 플랫폼이기 때문에 개발자와 최종 사용자들이 다양한 작업을 위해서 실제로 어떤 모델 API를 불러오는지를 살펴볼 수 있는 플랫폼이기 때문입니다. 오픈소스 모델 vs 폐쇄소스 모델 에이전트 기반 추론 사용 사례 카테고리별 모델 사용 지리적 분석