26-9 앤스로픽 Claude Sonnet 5.5 공개
작성자의 핵심 판단
Sonnet 5.5의 벤치마크 성능은 높지만, 작업당 실제 비용과 토큰 사용량까지 보면 경쟁력이 생각만큼 명확하지 않다는 평가다.
근거 보기 3
- 원문 구간 1
이 관점에서 보면 Sonnet 5.5의 경쟁력이 생각만큼 명확한지는 조금 더 살펴봐야 할 것 같습니다. 벤치마크 점수 자체는 상당히 좋아 보이지만, 그 점수를 어떻게 만들어냈는가가 더 중요하기 때문입니다. *첨부자료 3, 4* 이를 가장 잘 보여주는 지표가 ⓐCost per Task(작업당 비용) & ⓑOutput Tokens per Task(작업당 토큰 수, CoT가 output tokens에 잡힘) 지표입니다. ⓐ작업당 비용을 보시면, Sonnet 5.5는 작업당 $7.60을 사용합니다. Fable 5.1의 $7.63과 거의 비슷하고, 심지어 Opus 5.5의 $5.98보다도 비쌉니다. Opus 5.5는 input/output 기준 $4/$20, Sonnet 5.5는 $2/$10입니다. 토큰 하나의 가격은 Sonnet이 정확히 절반인데, 실제 작업 하나를 끝내는 데 드는 비용은 오히려 Sonnet이 더 비쌉니다. 결국 API의 백만 토큰당 가격만 봐서는 모델의 실제 경제성을 알기 어렵다는 이야기입니다. 중요한 것은 그 모델이 그 가격의 토큰을 몇 개나 써야 원하는 수준의 답을 만들어내느냐입니다. ⓑ작업당 토큰 수를 보시면 왜 이런 현상이 생기는지가 더 명확합니다.
- 원문 구간 2
output tokens를 보시면 Opus 5.5가 119K(생각 84K + 답변 35K)인데, Sonnet 5.5가 193K(생각 142K + 답변 50K)입니다. Sonnet 5.5는 Opus 5.5와 비슷한 수준의 벤치마크 성능에 접근하기 위해 훨씬 더 긴 생각 시간을 사용하고 있습니다. 같은 모델이라도 reasoning budget을 늘려 test-time compute를 확장하면 성능은 올라갈 수 있습니다. 문제는 이 방식 역시 공짜가 아니라는 점입니다. AI 모델의 성능을 높이는 데에는 크게 세 군데에서 컴퓨트를 쓸 수 있습니다. (ㄱ) Pre-training: 더 많은 데이터와 학습 컴퓨트, 더 나은 아키텍처를 통해 weights 자체의 기본 능력을 높이는 방법입니다. (ㄴ) RL/Post-training: RL과 양질의 작업별 데이터를 통해 이미 학습한 모델이 실제 문제를 더 정확하고 효율적으로 풀도록 만드는 방법입니다. (ㄷ) Test-time compute: 모델이 실제 답을 낼 때 reasoning budget을 늘려 더 오래 생각하도록 만드는 방법입니다. 세 방법 모두 성능을 높일 수 있지만, 모두 어느 순간부터 추가로 투입하는 $1당 얻을 수 있는 지능의 한계효용이 떨어집니다.
- 원문 구간 3
특히 (ㄷ)는 모델을 추론하는 시점에 더 많은 컴퓨트를 사용하고, 그 결과가 reasoning tokens와 API 비용으로 바로 나타납니다. 그래서 벤치마크 점수를 볼 때는 단순히 누가 몇 점을 받았느냐보다 그 점수를 얻기 위해 몇 개의 토큰과 몇 달러를 사용했는가를 같이 봐야 합니다. 결과적으로 GPT-6 Sol과 Sonnet 5.5의 벤치마크상으로는 Sonnet 5.5가 앞서는 것 같아 보이기 때문에 GPT-6 Sol이 빛을 잃는 게 아닌가 싶으실 수 있지만, 실제 기업들이 지불할 작업당 비용으로 비교하자면 GPT-6 Sol은 $1.06, Sonnet 5.5는 $7.60으로 격차가 매우 큽니다. 오픈AI는 (ㄱ) + (ㄴ)에 집중하면서 성능을 끌어올리고 있는 과정입니다. output tokens 기준 GPT-6 Astra는 27K(생각 17K + 답변 11K), GPT-6 Sol은 31K(생각 21K + 답변 10K), GPT-6 Luna는 51K(생각 39K + 답변 11K)입니다. 소형모델에 distillation 하고나서 부족한 지능을 (ㄷ)를 통해서 끌어올리고 있기는 하지만 전체적으로 (ㄱ) + (ㄴ)에 집중하는 방향입니다.
이 자료에서 다룬 사실
앤스로픽은 Sonnet 5.5를 공개했고, 원문은 Terminal-Bench 4.0에서 70.6%로 Opus 5.5의 66.4%보다 높았다고 적었다. Sonnet 5.5의 작업당 비용은 7.60달러, 작업당 출력 토큰은 193K로 제시됐다.
근거 보기 3
- 원문 구간 1
주요 모델 API 가격 업데이트(2026-09-29) → GPT-6 Astra $10/$50 = Mythos/Fable 5.1 $10/$50 > Opus 5.5 $4/$20 > Kimi-K3 $3/$15 > Gemini 3.1 Pro $2/$12 > GPT-6 Sol $2/$10 = Sonnet 5.5 $2/$10 > Qwen 3.8-Max-0902 $2/$6 = Grok 4.7 $2/$6 > GLM-5.3 $1.4/$4.4 > Muse Spark 1.3 $1.25/$4.25 > DeepSeek-V4-Pro-0813 $1.32/$3.96 > Gemini 3.8 Flash $0.75/$3.75 > DeepSeek-V4.1-Flash $0.30/$1.20 > GPT-6 Luna $0.10/$0.50 이번 주 주간전략보고에서 앤스로픽과 오픈AI가 컴퓨트 효율을 어디에 쓰고 있는가에 대해서 정리드린 것처럼, 이번에는 API 가격 업데이트도 같이 볼 필요가 있습니다. 지난주에는 GPT-6 Sol이 API 가격을 $2/$10으로 낮추면서 Sonnet 5.5와 백만 토큰당 단가가 같아졌습니다. 그런데 더 중요한 것은 백만 토큰당 얼마인가보다 같은 수준의 작업을 끝내기 위해 실제로 몇 개의 토큰을 쓰고 최종적으로 고객에게 얼마의 비용이 발생하는가입니다.
- 원문 구간 2
이 관점에서 보면 Sonnet 5.5의 경쟁력이 생각만큼 명확한지는 조금 더 살펴봐야 할 것 같습니다. 벤치마크 점수 자체는 상당히 좋아 보이지만, 그 점수를 어떻게 만들어냈는가가 더 중요하기 때문입니다. *첨부자료 3, 4* 이를 가장 잘 보여주는 지표가 ⓐCost per Task(작업당 비용) & ⓑOutput Tokens per Task(작업당 토큰 수, CoT가 output tokens에 잡힘) 지표입니다. ⓐ작업당 비용을 보시면, Sonnet 5.5는 작업당 $7.60을 사용합니다. Fable 5.1의 $7.63과 거의 비슷하고, 심지어 Opus 5.5의 $5.98보다도 비쌉니다. Opus 5.5는 input/output 기준 $4/$20, Sonnet 5.5는 $2/$10입니다. 토큰 하나의 가격은 Sonnet이 정확히 절반인데, 실제 작업 하나를 끝내는 데 드는 비용은 오히려 Sonnet이 더 비쌉니다. 결국 API의 백만 토큰당 가격만 봐서는 모델의 실제 경제성을 알기 어렵다는 이야기입니다. 중요한 것은 그 모델이 그 가격의 토큰을 몇 개나 써야 원하는 수준의 답을 만들어내느냐입니다. ⓑ작업당 토큰 수를 보시면 왜 이런 현상이 생기는지가 더 명확합니다.
- 원문 구간 3
output tokens를 보시면 Opus 5.5가 119K(생각 84K + 답변 35K)인데, Sonnet 5.5가 193K(생각 142K + 답변 50K)입니다. Sonnet 5.5는 Opus 5.5와 비슷한 수준의 벤치마크 성능에 접근하기 위해 훨씬 더 긴 생각 시간을 사용하고 있습니다. 같은 모델이라도 reasoning budget을 늘려 test-time compute를 확장하면 성능은 올라갈 수 있습니다. 문제는 이 방식 역시 공짜가 아니라는 점입니다. AI 모델의 성능을 높이는 데에는 크게 세 군데에서 컴퓨트를 쓸 수 있습니다. (ㄱ) Pre-training: 더 많은 데이터와 학습 컴퓨트, 더 나은 아키텍처를 통해 weights 자체의 기본 능력을 높이는 방법입니다. (ㄴ) RL/Post-training: RL과 양질의 작업별 데이터를 통해 이미 학습한 모델이 실제 문제를 더 정확하고 효율적으로 풀도록 만드는 방법입니다. (ㄷ) Test-time compute: 모델이 실제 답을 낼 때 reasoning budget을 늘려 더 오래 생각하도록 만드는 방법입니다. 세 방법 모두 성능을 높일 수 있지만, 모두 어느 순간부터 추가로 투입하는 $1당 얻을 수 있는 지능의 한계효용이 떨어집니다.
그렇게 판단한 이유
백만 토큰당 API 단가가 같거나 낮아도 같은 작업을 끝내는 토큰 수가 많으면 비용이 커진다. 특히 test-time compute는 추론 때 reasoning budget을 늘리는 방식이어서 토큰과 비용으로 바로 나타난다는 논리다.
근거 보기 3
- 원문 구간 1
이 관점에서 보면 Sonnet 5.5의 경쟁력이 생각만큼 명확한지는 조금 더 살펴봐야 할 것 같습니다. 벤치마크 점수 자체는 상당히 좋아 보이지만, 그 점수를 어떻게 만들어냈는가가 더 중요하기 때문입니다. *첨부자료 3, 4* 이를 가장 잘 보여주는 지표가 ⓐCost per Task(작업당 비용) & ⓑOutput Tokens per Task(작업당 토큰 수, CoT가 output tokens에 잡힘) 지표입니다. ⓐ작업당 비용을 보시면, Sonnet 5.5는 작업당 $7.60을 사용합니다. Fable 5.1의 $7.63과 거의 비슷하고, 심지어 Opus 5.5의 $5.98보다도 비쌉니다. Opus 5.5는 input/output 기준 $4/$20, Sonnet 5.5는 $2/$10입니다. 토큰 하나의 가격은 Sonnet이 정확히 절반인데, 실제 작업 하나를 끝내는 데 드는 비용은 오히려 Sonnet이 더 비쌉니다. 결국 API의 백만 토큰당 가격만 봐서는 모델의 실제 경제성을 알기 어렵다는 이야기입니다. 중요한 것은 그 모델이 그 가격의 토큰을 몇 개나 써야 원하는 수준의 답을 만들어내느냐입니다. ⓑ작업당 토큰 수를 보시면 왜 이런 현상이 생기는지가 더 명확합니다.
- 원문 구간 2
output tokens를 보시면 Opus 5.5가 119K(생각 84K + 답변 35K)인데, Sonnet 5.5가 193K(생각 142K + 답변 50K)입니다. Sonnet 5.5는 Opus 5.5와 비슷한 수준의 벤치마크 성능에 접근하기 위해 훨씬 더 긴 생각 시간을 사용하고 있습니다. 같은 모델이라도 reasoning budget을 늘려 test-time compute를 확장하면 성능은 올라갈 수 있습니다. 문제는 이 방식 역시 공짜가 아니라는 점입니다. AI 모델의 성능을 높이는 데에는 크게 세 군데에서 컴퓨트를 쓸 수 있습니다. (ㄱ) Pre-training: 더 많은 데이터와 학습 컴퓨트, 더 나은 아키텍처를 통해 weights 자체의 기본 능력을 높이는 방법입니다. (ㄴ) RL/Post-training: RL과 양질의 작업별 데이터를 통해 이미 학습한 모델이 실제 문제를 더 정확하고 효율적으로 풀도록 만드는 방법입니다. (ㄷ) Test-time compute: 모델이 실제 답을 낼 때 reasoning budget을 늘려 더 오래 생각하도록 만드는 방법입니다. 세 방법 모두 성능을 높일 수 있지만, 모두 어느 순간부터 추가로 투입하는 $1당 얻을 수 있는 지능의 한계효용이 떨어집니다.
- 원문 구간 3
특히 (ㄷ)는 모델을 추론하는 시점에 더 많은 컴퓨트를 사용하고, 그 결과가 reasoning tokens와 API 비용으로 바로 나타납니다. 그래서 벤치마크 점수를 볼 때는 단순히 누가 몇 점을 받았느냐보다 그 점수를 얻기 위해 몇 개의 토큰과 몇 달러를 사용했는가를 같이 봐야 합니다. 결과적으로 GPT-6 Sol과 Sonnet 5.5의 벤치마크상으로는 Sonnet 5.5가 앞서는 것 같아 보이기 때문에 GPT-6 Sol이 빛을 잃는 게 아닌가 싶으실 수 있지만, 실제 기업들이 지불할 작업당 비용으로 비교하자면 GPT-6 Sol은 $1.06, Sonnet 5.5는 $7.60으로 격차가 매우 큽니다. 오픈AI는 (ㄱ) + (ㄴ)에 집중하면서 성능을 끌어올리고 있는 과정입니다. output tokens 기준 GPT-6 Astra는 27K(생각 17K + 답변 11K), GPT-6 Sol은 31K(생각 21K + 답변 10K), GPT-6 Luna는 51K(생각 39K + 답변 11K)입니다. 소형모델에 distillation 하고나서 부족한 지능을 (ㄷ)를 통해서 끌어올리고 있기는 하지만 전체적으로 (ㄱ) + (ㄴ)에 집중하는 방향입니다.