26-8 GPT-5.6 Sol Ultrafast 시험 서비스 시작
작성자의 핵심 판단
정식 출시 뒤 시장 반응과 흥행 여부가 Cerebras의 단기 핵심 변수라는 평가다. 흥행하면 AWS·AMD의 도입과 OpenAI 추가 계약이 가속될 수 있다는 가능성을 제시한다.
근거 보기 1
- 원문 구간 1
5. 투자 포인트 미개척 빠른 추론 시장 Cerebras 성장의 핵심은 빠른 추론 시장이 얼마나 성장할 것인지 입니다. 지금은 GPT 5.3 Spark 정도에만 제한적으로 적용되어 있지만 AI Agent 에서 빠른 추론이 단축할 수 있는 작업 속도가 굉장히 크다는 것이 밝혀지며 빠른 추론에 대한 지불 의사도 커지고 있습니다. 보수적으로 전망하는 곳에서도 추론 시장의 10% 이상은 빠른 추론 시장이 될 것으로 보고 있기 때문에 지금부터는 빠른 추론 시장이 어떻게 흘러가는지 잘 보아야 합니다. 시장이 아직까지 기대하고 있지 않으면서도 기술적으로 무르익은 하드웨어 부분은 이 부분 정도라고 생각됩니다. 오픈AI 가 Cerebras 로 처음 소개한 빠른 추론 서비스는 GPT-5.3 Codex Spark 입니다. 해당 서비스는 큰 흥행을 하지는 못 했습니다. Codex 에 제한되어서 라기보다는 GPT 5.3 이라는 구형 모델에 제한되었기 때문으로 생각됩니다. 하지만, Cerebras 의 본격적인 도입이라는 측면에서 긍정적이었는데요 지금부터 중요한 이유는 8월 중순부터 가장 프론티어 모델인 GPT-5.6 Sol 모델에 Ultrafast 모드란 이름으로 시험 서비스가 시작되었기 때문입니다. 8월 13일 부터 Cerebras 칩 기반의 GPT-5.6 Sol 추론 서비스가 시험적으로 시작됩니다. 아직 공식 런칭은 아니지만 공식 런칭되고 시장에서 어떤 반응을 얻는지가 Cerebras 에게 굉장히 중요할 것으로 보입니다. 만약 흥행한다면 이미 업무 협약을 맺은 AWS, AMD 에서 도입을 가속화 할 뿐만 아니라 OpenAI 에서도 추가 계약을 할 수 있기 때문입니다. 할라피뇨가 잠재력 높은 칩이기는 하지만 당장 서비스를 지원할 정도로 구축이 되려면 적어도 내년 말은 되어야 합니다. Cerebras 기반으로 작동하는 GPT-5.6 Sol 은 기존 엔비디아 대비 최대 14배 정도 빠를 것으로 보입니다. 채널 체크를 해보면 빠른 추론에 대한 수요가 어느 정도는 있는 것으로 보입니다. 따라서 OpenAI 의 GPT-5.6 Sol 의 Ultrafast 모드가 공식 출시되고 얼마나 인기를 얻는지가 Cerebras 올해 주가에 중요할 것으로 보입니다. 빠른 추론 / Cerebras 수요 조사 주제 조사 내용 에이전틱 추론 비중 증가 > 에이전틱 추론에서 빠른 추론 효과 더 큼 OpenAI 엔터프라이즈 출력 토큰에서 에이전틱 비중이 2025년 8월 0% → 2026년 6월 64% 2026년 4월에는 에이전틱 지출이 ChatGPT 지출 추월 에이전틱 워크로드 구조 5개 에이전틱 벤치마크에서 컨텍스트 캐시 적중률 84.6~99.5% 전체 LLM 실행시간의 91.0~98.6%가 decode
이 자료에서 다룬 사실
GPT-5.6 Sol에 Cerebras 칩 기반 Ultrafast 모드가 8월 13일부터 시험적으로 시작됐으며, 최대 750 tok/s와 Standard 대비 최대 14배 빠른 속도로 제시됐다.
근거 보기 2
- 원문 구간 1
5. 투자 포인트 미개척 빠른 추론 시장 Cerebras 성장의 핵심은 빠른 추론 시장이 얼마나 성장할 것인지 입니다. 지금은 GPT 5.3 Spark 정도에만 제한적으로 적용되어 있지만 AI Agent 에서 빠른 추론이 단축할 수 있는 작업 속도가 굉장히 크다는 것이 밝혀지며 빠른 추론에 대한 지불 의사도 커지고 있습니다. 보수적으로 전망하는 곳에서도 추론 시장의 10% 이상은 빠른 추론 시장이 될 것으로 보고 있기 때문에 지금부터는 빠른 추론 시장이 어떻게 흘러가는지 잘 보아야 합니다. 시장이 아직까지 기대하고 있지 않으면서도 기술적으로 무르익은 하드웨어 부분은 이 부분 정도라고 생각됩니다. 오픈AI 가 Cerebras 로 처음 소개한 빠른 추론 서비스는 GPT-5.3 Codex Spark 입니다. 해당 서비스는 큰 흥행을 하지는 못 했습니다. Codex 에 제한되어서 라기보다는 GPT 5.3 이라는 구형 모델에 제한되었기 때문으로 생각됩니다. 하지만, Cerebras 의 본격적인 도입이라는 측면에서 긍정적이었는데요 지금부터 중요한 이유는 8월 중순부터 가장 프론티어 모델인 GPT-5.6 Sol 모델에 Ultrafast 모드란 이름으로 시험 서비스가 시작되었기 때문입니다. 8월 13일 부터 Cerebras 칩 기반의 GPT-5.6 Sol 추론 서비스가 시험적으로 시작됩니다. 아직 공식 런칭은 아니지만 공식 런칭되고 시장에서 어떤 반응을 얻는지가 Cerebras 에게 굉장히 중요할 것으로 보입니다. 만약 흥행한다면 이미 업무 협약을 맺은 AWS, AMD 에서 도입을 가속화 할 뿐만 아니라 OpenAI 에서도 추가 계약을 할 수 있기 때문입니다. 할라피뇨가 잠재력 높은 칩이기는 하지만 당장 서비스를 지원할 정도로 구축이 되려면 적어도 내년 말은 되어야 합니다. Cerebras 기반으로 작동하는 GPT-5.6 Sol 은 기존 엔비디아 대비 최대 14배 정도 빠를 것으로 보입니다. 채널 체크를 해보면 빠른 추론에 대한 수요가 어느 정도는 있는 것으로 보입니다. 따라서 OpenAI 의 GPT-5.6 Sol 의 Ultrafast 모드가 공식 출시되고 얼마나 인기를 얻는지가 Cerebras 올해 주가에 중요할 것으로 보입니다. 빠른 추론 / Cerebras 수요 조사 주제 조사 내용 에이전틱 추론 비중 증가 > 에이전틱 추론에서 빠른 추론 효과 더 큼 OpenAI 엔터프라이즈 출력 토큰에서 에이전틱 비중이 2025년 8월 0% → 2026년 6월 64% 2026년 4월에는 에이전틱 지출이 ChatGPT 지출 추월 에이전틱 워크로드 구조 5개 에이전틱 벤치마크에서 컨텍스트 캐시 적중률 84.6~99.5% 전체 LLM 실행시간의 91.0~98.6%가 decode
- 원문 구간 2
Decode 는 SRAM 기반이 유리한 구조 고객사 실사용 Cerebras가 고객사 AI Assistant 트래픽의 40% 처리 제약이 없으면 80%까지 배정 의향. 현재 지출 약 $1~5M, 1년 내 2배, 1~2년 내 2~3배 예상 가격 지불 의사 경쟁 제공사보다 10~15배 빠름. 동일 모델 기준 가격은 약 30% 비싸지만, 속도를 위해 50~100% 프리미엄 지불 의사 속도 프리미엄 상품화 OpenAI Fast mode는 Standard보다 최대 2.5배 빠르고 가격은 2배. Anthropic도 Fast mode를 통상 가격의 약 2배로 제공 Cerebras 전용 Ultrafast GPT-5.6 Sol을 최대 750 tok/s, Standard 대비 최대 14배 빠르게 제공. 초기 사용사에 Jane Street·Podium·Basis·Rogo 포함 기본적으로 빠른 추론에 대한 평가는 좋으며 이를 위한 프리미엄 지불의사들이 확인되고 있습니다. 비 Nvidia 진영 AWS, AMD, OpenAI 의 선택 - Cerebras 빠른 추론 시장이 개화한다면 수혜주는 1차적으로 당연히 Groq 입니다. SRAM 기반의 고속 가속기는 결국 아직 디코드 영역에 쓰이는데 그러면 Prefill 을 해줄 파트가 같이 있어야 하기 때문입니다. 또한 이미 많이 깔려있는 엔비디아의 인프라와 같이 사용될 수 있기 때문입니다. 하지만, 엔비디아 Groq 이외의 진영에서는 디코드 를 위한 제품이 준비되어 있지 않기 때문에 단기간에서는 Cerebras 와 손잡으려는 노력을 할 것으로 보입니다. 결국 Groq 이 잘 되면 Cerebras 도 잘 될 수 있는 구조라고 생각됩니다. 6. 리스크 할라피뇨 실제 칩 모습 (출처 : OpenAI) 할라피뇨 OpenAI 는 꽤 오래 전부터 자체 반도체 설계에 대한 관심을 나타내왔습니다. 그러던 OpenAI 의 자체 AI 가속기에 대한 구체적인 성능과 정보들이 공개되었습니다. 결론적으로는 경쟁 관계가 아닌 것으로 생각되었던 Cerebras 까지 위협할 수 있는 잠재력을 가지고 있었습니다. 그리고 추론 시장에서 프론티어 AI 랩들은 자체적인 가속기로 충분히 풀스택 역량을 구축할 가능성이 있음이 확인되었습니다. 앤트로픽도 OpenAI 와 같은 길을 걸어갈 수 밖에 없을 것 같습니다. 다만, 당장 벌어질 일은 아니고 2028년부터 유의미하게 영향을 줄 것으로 보입니다. 내년까지는 CoWoS 캐파 제약이 커서 올해까지는 엔비디아 독주 구도 내년은 엔비디아와 TPU 투 톱 구조 2028년부터 엔비디아, TPU 투 톱 속에서 다양한 가속기들의 부상이 예상됩니다. 할라피뇨 현세대 성능 모델 Jalapeño 속도 Peak mixed TPS/kW
그렇게 판단한 이유
에이전틱 AI에서 작업 속도 단축 효과와 속도 프리미엄 지불 의사가 확인되고 있다는 조사 결과를 근거로 든다.
근거 보기 2
- 원문 구간 1
5. 투자 포인트 미개척 빠른 추론 시장 Cerebras 성장의 핵심은 빠른 추론 시장이 얼마나 성장할 것인지 입니다. 지금은 GPT 5.3 Spark 정도에만 제한적으로 적용되어 있지만 AI Agent 에서 빠른 추론이 단축할 수 있는 작업 속도가 굉장히 크다는 것이 밝혀지며 빠른 추론에 대한 지불 의사도 커지고 있습니다. 보수적으로 전망하는 곳에서도 추론 시장의 10% 이상은 빠른 추론 시장이 될 것으로 보고 있기 때문에 지금부터는 빠른 추론 시장이 어떻게 흘러가는지 잘 보아야 합니다. 시장이 아직까지 기대하고 있지 않으면서도 기술적으로 무르익은 하드웨어 부분은 이 부분 정도라고 생각됩니다. 오픈AI 가 Cerebras 로 처음 소개한 빠른 추론 서비스는 GPT-5.3 Codex Spark 입니다. 해당 서비스는 큰 흥행을 하지는 못 했습니다. Codex 에 제한되어서 라기보다는 GPT 5.3 이라는 구형 모델에 제한되었기 때문으로 생각됩니다. 하지만, Cerebras 의 본격적인 도입이라는 측면에서 긍정적이었는데요 지금부터 중요한 이유는 8월 중순부터 가장 프론티어 모델인 GPT-5.6 Sol 모델에 Ultrafast 모드란 이름으로 시험 서비스가 시작되었기 때문입니다. 8월 13일 부터 Cerebras 칩 기반의 GPT-5.6 Sol 추론 서비스가 시험적으로 시작됩니다. 아직 공식 런칭은 아니지만 공식 런칭되고 시장에서 어떤 반응을 얻는지가 Cerebras 에게 굉장히 중요할 것으로 보입니다. 만약 흥행한다면 이미 업무 협약을 맺은 AWS, AMD 에서 도입을 가속화 할 뿐만 아니라 OpenAI 에서도 추가 계약을 할 수 있기 때문입니다. 할라피뇨가 잠재력 높은 칩이기는 하지만 당장 서비스를 지원할 정도로 구축이 되려면 적어도 내년 말은 되어야 합니다. Cerebras 기반으로 작동하는 GPT-5.6 Sol 은 기존 엔비디아 대비 최대 14배 정도 빠를 것으로 보입니다. 채널 체크를 해보면 빠른 추론에 대한 수요가 어느 정도는 있는 것으로 보입니다. 따라서 OpenAI 의 GPT-5.6 Sol 의 Ultrafast 모드가 공식 출시되고 얼마나 인기를 얻는지가 Cerebras 올해 주가에 중요할 것으로 보입니다. 빠른 추론 / Cerebras 수요 조사 주제 조사 내용 에이전틱 추론 비중 증가 > 에이전틱 추론에서 빠른 추론 효과 더 큼 OpenAI 엔터프라이즈 출력 토큰에서 에이전틱 비중이 2025년 8월 0% → 2026년 6월 64% 2026년 4월에는 에이전틱 지출이 ChatGPT 지출 추월 에이전틱 워크로드 구조 5개 에이전틱 벤치마크에서 컨텍스트 캐시 적중률 84.6~99.5% 전체 LLM 실행시간의 91.0~98.6%가 decode
- 원문 구간 2
Decode 는 SRAM 기반이 유리한 구조 고객사 실사용 Cerebras가 고객사 AI Assistant 트래픽의 40% 처리 제약이 없으면 80%까지 배정 의향. 현재 지출 약 $1~5M, 1년 내 2배, 1~2년 내 2~3배 예상 가격 지불 의사 경쟁 제공사보다 10~15배 빠름. 동일 모델 기준 가격은 약 30% 비싸지만, 속도를 위해 50~100% 프리미엄 지불 의사 속도 프리미엄 상품화 OpenAI Fast mode는 Standard보다 최대 2.5배 빠르고 가격은 2배. Anthropic도 Fast mode를 통상 가격의 약 2배로 제공 Cerebras 전용 Ultrafast GPT-5.6 Sol을 최대 750 tok/s, Standard 대비 최대 14배 빠르게 제공. 초기 사용사에 Jane Street·Podium·Basis·Rogo 포함 기본적으로 빠른 추론에 대한 평가는 좋으며 이를 위한 프리미엄 지불의사들이 확인되고 있습니다. 비 Nvidia 진영 AWS, AMD, OpenAI 의 선택 - Cerebras 빠른 추론 시장이 개화한다면 수혜주는 1차적으로 당연히 Groq 입니다. SRAM 기반의 고속 가속기는 결국 아직 디코드 영역에 쓰이는데 그러면 Prefill 을 해줄 파트가 같이 있어야 하기 때문입니다. 또한 이미 많이 깔려있는 엔비디아의 인프라와 같이 사용될 수 있기 때문입니다. 하지만, 엔비디아 Groq 이외의 진영에서는 디코드 를 위한 제품이 준비되어 있지 않기 때문에 단기간에서는 Cerebras 와 손잡으려는 노력을 할 것으로 보입니다. 결국 Groq 이 잘 되면 Cerebras 도 잘 될 수 있는 구조라고 생각됩니다. 6. 리스크 할라피뇨 실제 칩 모습 (출처 : OpenAI) 할라피뇨 OpenAI 는 꽤 오래 전부터 자체 반도체 설계에 대한 관심을 나타내왔습니다. 그러던 OpenAI 의 자체 AI 가속기에 대한 구체적인 성능과 정보들이 공개되었습니다. 결론적으로는 경쟁 관계가 아닌 것으로 생각되었던 Cerebras 까지 위협할 수 있는 잠재력을 가지고 있었습니다. 그리고 추론 시장에서 프론티어 AI 랩들은 자체적인 가속기로 충분히 풀스택 역량을 구축할 가능성이 있음이 확인되었습니다. 앤트로픽도 OpenAI 와 같은 길을 걸어갈 수 밖에 없을 것 같습니다. 다만, 당장 벌어질 일은 아니고 2028년부터 유의미하게 영향을 줄 것으로 보입니다. 내년까지는 CoWoS 캐파 제약이 커서 올해까지는 엔비디아 독주 구도 내년은 엔비디아와 TPU 투 톱 구조 2028년부터 엔비디아, TPU 투 톱 속에서 다양한 가속기들의 부상이 예상됩니다. 할라피뇨 현세대 성능 모델 Jalapeño 속도 Peak mixed TPS/kW