2026.05.14 · 네이버 프리미엄 콘텐츠 · 올바른 미국주식 by SAPIENS

세레브라스 IPO 분석 : 엔비디아 킬러인가?

유형
네이버 프리미엄 콘텐츠
날짜
2026.05.14
강연자/작성자
올바른 미국주식 by SAPIENS
분석 주제
미지정
자료 길이
본문 20,632자
1

문서 전체 조망

핵심 구조

세레브라스의 상장 프리미엄은 저지연 추론의 실제 경제성 검증에 달려 있다

세레브라스는 오픈AI와 AWS가 추론용 WSE를 시험하는 국면에서 대규모 IPO에 나선다. 빠른 디코드가 Agentic AI의 생산성으로 이어질 수 있지만, 작은 SRAM과 제한된 외부 연결이 대형 모델·클라우드 경제성의 경계를 정한다.

오픈AI 계약은 추론 진입의 계기다

기존 훈련 수요 중심이던 세레브라스는 오픈AI가 Decode 병목을 풀기 위한 하드웨어로 WSE를 택하면서 추론 사용 사례를 얻었다. 다만 750MW 구매와 연동된 워런트는 성장 가시성과 주주 희석을 함께 봐야 하는 구조다. 왜냐하면 계약의 경제성과 워런트 가치를 같은 기준에서 봐야 하기 때문이다.

속도는 생산성의 차이가 된다

Agentic AI와 기업용 API에서는 코드 작성·실행·수정이 반복돼 단계별 지연이 누적된다. 원문은 이 구간에서 Tokens per second/User가 사용자 경험뿐 아니라 토큰당 수익성과 연결되는 변수라고 본다.

WSE의 강점은 낮은 배치의 디코드다

WSE-3는 44GB on-wafer SRAM과 21PB/s급 내부 대역폭으로 가중치와 KV Cache가 칩 안에 함께 들어가는 작업에서 빠른 토큰 생성을 겨냥한다. Prefill의 대량 병렬 연산과 달리 Decode는 순차적으로 메모리를 읽는 단계이기 때문에 메모리 구조가 성능의 기준이 된다.

44GB SRAM이 적용 범위를 제한한다

대형 모델과 긴 컨텍스트에서는 KV Cache까지 SRAM에 담기 어렵고, 여러 WSE를 잇는 off-wafer I/O도 좁다. 따라서 FP16 중심 설계와 MoE의 전체 파라미터 탑재 필요성도 원문이 든 대형 모델 추론의 제약이 된다.

매출 성장은 본업 이익과 다르다

CY25 매출은 $510M으로 전년보다 76% 늘었지만, 순이익에는 선도계약부채 재평가·소멸에 따른 비현금성 Other Income 약 $391M이 반영됐다. 반면 하드웨어와 클라우드는 매출 인식·비용 구조와 마진 방향이 다르게 제시된다.

추정치보다 기술증명과 공급 능력이 앞선다

오픈AI 용량이 예정대로 온라인되고 AWS 계약이 실제 계약으로 전환된다는 가정에서는 매출·이익 추정이 가능하지만, 원문은 이를 이익증명 전의 기술증명 단계로 본다. 결국 Powered Shell 확보, Trainium과 WSE의 분산 구조, TCO 대비 성능이 핵심 확인점이 된다.

ANALYSIS VIEW사건별 사실과 작성자의 판단, 지속 정보를 나누어 읽기
2
발생·예정 사건과 출처별 관점

이슈 분석

이 자료가 이슈의 어떤 사실을 다루고, 작성자가 무슨 결론을 어떤 근거로 내렸는지 원문에 붙여 읽습니다.

발생 예정발표·발생 전발생일 26-5-14

26-5 세레브라스 IPO 공모가 확정 및 상장

작성자의 핵심 판단

작성자는 IPO 가격만으로 판단하지 않고, WSE가 실제 추론 워크로드에서 경제성을 입증할 수 있는지를 중심으로 봐야 한다고 평가한다.

근거 보기 3
  1. 원문 구간 1

    밸류가 상당히 높은 상태이긴 합니다. ​ 물론, AWS도 계약하면서 매출 추정이 달라질 경우 이익 추정이 바뀌니 밸류 기준은 크게 달라집니다. 그래서 사실 추정의 큰 의미는 없는 단계입니다. 이익추정이 잘 맞으려면 이익증명 단계일 때가 효과적인데, 지금은 개인적으로 생각하는 기업의 사이클 ⓐ개념증명 → ⓑ기술증명 → ⓒ매출증명 → ⓓ이익증명 중에서 거의 ⓑ인 기술증명을 해가는 단계로 보고 있습니다. 지금 매출이 나오는 기업이니 ⓒ라고 볼 수도 있겠지만, Organic Sales가 아니기도 하고 decode-heavy 워크로드에 잘 먹힐지 아닐지가 TAM에 매우 지대한 영향을 줄 것이기에 ⓑ Phase로 보고 있습니다. ​ *지난주 월요일에 S-1 파일을 제출할 당시에는 주당 $115~$125정도에 2,800만 주를 매각할 계획이었습니다 → 그러다가 이번 주 월요일에는 이를 주당 $150~$160에 3,000만 주를 매각하는 것으로 규모를 키웠고 → 오늘은 주당 $185에 3,000만 주를 매각할 예정입니다.

  2. 원문 구간 2

    오픈AI와 AWS가 써보면서 실제로 WSE-3의 한계인 44GB SRAM 용량과 off-wafer I/O를 극복할 수 있을 것인가가 중요합니다. 어느 만큼 쓸만한가에 따라서 매출 추정이 달라질 경우 이익 추정이 바뀌니 밸류 기준은 크게 달라집니다. 그래서 사실 추정의 큰 의미는 없는 단계입니다. 이익추정이 잘 맞으려면 이익증명 단계일 때가 효과적인데, 지금은 개인적으로 생각하는 기업의 사이클 ⓐ개념증명 → ⓑ기술증명 → ⓒ매출증명 → ⓓ이익증명 중에서 거의 ⓑ인 기술증명을 해가는 단계로 보고 있습니다. 지금 매출이 나오는 기업이니 ⓒ라고 볼 수도 있겠지만, Organic Sales가 아니기도 하고 decode-heavy 워크로드에 잘 먹힐지 아닐지가 TAM에 매우 지대한 영향을 줄 것이기에 ⓑ Phase로 보고 있습니다.

  3. 원문 구간 3

    적자기업이고, 기술적으로 사실 한계가 많으며, 새로 생기는 시장에서 엔비디아의 점유율을 크게 해칠 기술력을 갖고 있다고 보지 않습니다. 물론 시총이 작으니 투기적으로 움직일 수는 있겠고, 기술이라는 게 어떻게 적용하느냐에 따라 새로운 사용 사례를 만들 수도 있는 것(아마 음성모델에는 잘 맞을 겁니다)이긴 합니다만, 밸류를 감안하면 그닥 매력적이게 느껴지진 않았습니다.

이 자료에서 다룬 사실

원문은 세레브라스가 이날 밤 상장하며, 공모가가 초기 $115~$125에서 $185로 두 차례 상향됐다고 적었다.

근거 보기 2
  1. 원문 구간 1

    [원문 유형] 네이버 프리미엄 콘텐츠 [채널] 올바른 미국주식 by SAPIENS [게시일] 2026.05.14. 오후 4:57 [원문 URL] https://contents.premium.naver.com/sapiens/sapiensasset/contents/260514165730368xj [제목] 세레브라스 IPO 분석 : 엔비디아 킬러인가? [수집 기준] 승인된 구독 열람권으로 실제 본문을 보존했다. 이미지·첨부는 별도 미디어 원장에 보관하며 시각적 의미 검토 여부를 구분한다. [구독 원문 본문] ​ 안녕하세요 올바른입니다. ​ 오늘 밤 상장하는 세레브라스(CBRS) IPO 분석입니다. CY26 YTD 최대 규모 IPO입니다. 공모가도 2주 사이에 두 번이나 상향돼서, 초기에는 $115~$125였던 것이 $185가 됐습니다. ​ 현 시점에서 세레브라스는 어떻게 봐야 하는지? 웨이퍼를 칩으로 만든 것이지만 GPU가 아닌 WSE에 대해, 재무상태 체크와 가벼운 미래 추정, 체크리스트를 정리해봤습니다.

  2. 원문 구간 2

    ​ Agentic AI 시대에 속도는 생산성의 격차로 변했습니다. Groq을 인수한 엔비디아가 느꼈던 문제의식을, Non-NVDA가 해결해보려는 시도에 대해 생각해본 자료입니다. 큰 흐름 읽기 2026-04-22 엔비디아 CEO 젠슨황 인터뷰 : 'TPU도 Trainium도, 그렇게 자신 있으면 공개로 붙어보자' (바로가기) 2026-03-27 앤스로픽 CEO 다리오 아모데이 인터뷰 : "Extremely fast, but not infinitely fast" (바로가기) 2026-03-05 AI 사이클 한 눈에 보기, SemiAnalysis 인터뷰 : "거품은 없다. ARR $100B가 온다" (바로가기) 2025-10-08 오픈AI 퇴사자의 글 #1 : 2027년 AGI가 온다 (바로가기) 엔비디아 (NVDA) 2026-04-22

그렇게 판단한 이유

공모 규모는 $5.55B, 완전희석 기준 가치는 약 $56B로 제시됐고, 이후 매출·이익 추정은 오픈AI 용량과 AWS 계약에 따라 크게 달라진다고 설명한다.

근거 보기 3
  1. 원문 구간 1

    그럼 세레브라스가 앞으로 얼마나 벌 수 있을까를 가정하려면, 오픈AI가 2GW를 모두 온라인한다고 가정할 시 오픈AI에게서 기대하는 매출만 감안할 경우 CY26 $0.9B(서비스 용량 250MW) → CY27 $2.5B(서비스 용량 500MW) → CY28 $3.4B(서비스 용량 750MW)입니다. ​ 전사 GPM이 40%인데 워런트로 주주가치 희석 등을 고려하면 사실 실질 마진율은 더 낮습니다. 어쨌든 CY27부터 순이익이 나온다고 보고 GPM 40%, NPM 15%를 가정하고 놓고 보더라도 순이익은 CY27 $375M → CY28 $510M입니다. 오늘 올린 IPO 가격 $185를 기준으로 보자면 완전 희석가치 기준 기업가치가 $56B이므로 CY27 순익 대비 149배 → CY28 110배입니다.

  2. 원문 구간 2

    밸류가 상당히 높은 상태이긴 합니다. ​ 물론, AWS도 계약하면서 매출 추정이 달라질 경우 이익 추정이 바뀌니 밸류 기준은 크게 달라집니다. 그래서 사실 추정의 큰 의미는 없는 단계입니다. 이익추정이 잘 맞으려면 이익증명 단계일 때가 효과적인데, 지금은 개인적으로 생각하는 기업의 사이클 ⓐ개념증명 → ⓑ기술증명 → ⓒ매출증명 → ⓓ이익증명 중에서 거의 ⓑ인 기술증명을 해가는 단계로 보고 있습니다. 지금 매출이 나오는 기업이니 ⓒ라고 볼 수도 있겠지만, Organic Sales가 아니기도 하고 decode-heavy 워크로드에 잘 먹힐지 아닐지가 TAM에 매우 지대한 영향을 줄 것이기에 ⓑ Phase로 보고 있습니다. ​ *지난주 월요일에 S-1 파일을 제출할 당시에는 주당 $115~$125정도에 2,800만 주를 매각할 계획이었습니다 → 그러다가 이번 주 월요일에는 이를 주당 $150~$160에 3,000만 주를 매각하는 것으로 규모를 키웠고 → 오늘은 주당 $185에 3,000만 주를 매각할 예정입니다.

  3. 원문 구간 3

    총 자금조달 규모는 $5.55B이며 주당 $185에 상장된다고 하면 RSU, 스톡옵션, 워런트를 모두 포함하여 완전희석가치 기준 $56B 밸류(대략 3.05억 주)입니다. 체크리스트 앞으로 '진짜'가 되기 위해서 확인해야 할 것들 ​ 가장 중요한 건, 결국 진짜 쓸만할 것인가 우선, 위에 전해드린 WSE를 추론에 쓰는 구조가 어느 정도로 매력적인지가 중요합니다. ​ 세레브라스는 언제든 칩을 사실상 무료로 줄 준비가 되어 있기 때문에 오픈AI, AWS 등이 이를 ML/System co-design 해보면서 최대의 성능을 끌어올릴 수 있는 워크로드는 찾겠지만 그 시장규모가 어느 만큼 될 것인가는 알 수 없습니다. 세레브라스 팀보다 더 훌륭한 SRAM 솔루션을 갖고 있던 Groq 팀을 엔비디아가 인수하여 Rubin과 내재화 중이기에, 엔비디아의 LPX 솔루션이 얼마나 매력적인가가 결국 오픈AI와 AWS가 수고로움을 감안하면서까지 co-design에 뛰어들게 할 것인가를 결정할 것입니다.

원문에서 직접 연결한 대상세레브라스
발생진행 중발생일 미확인

오픈AI와 세레브라스의 추론 용량 계약 및 워런트

작성자의 핵심 판단

작성자는 이 계약이 세레브라스에 추론 성장 가시성을 주지만, 워런트 때문에 컴퓨팅을 사실상 무료에 가깝게 제공하는 구조라고 본다.

근거 보기 3
  1. 원문 구간 1

    ​ 오픈AI가 찾아오다 : 겉과 속이 다른 계약의 의미 그러다가 오픈AI가 Decode 병목을 풀기 위해 추론용 하드웨어로 세레브라스를 택하며 많은 것들이 바뀌었습니다. 추론만을 위해서 체결한 계약이기 때문입니다. 이제 세레브라스 하드웨어가 추론에 쓰이기 시작했다는 의미입니다. 오픈AI 딜은 겉과 속의 의미를 구분해서 볼 수 있습니다. ​ 겉으로는 Agentic AI 워크로드를 다루면서 Prefill은 AWS Trainium에서 연산하고 Decode는 WSE-3에서 연산하여 Agentic AI 워크로드에 대응하기 위함입니다. (당장은 AWS가 계약을 확정짓지 않았기에 세레브라스 자체 클라우드에서 서빙 예정) 속으로는 세레브라스에 상당한 규모의 워런트를 받아 안그래도 GPM 45%인 칩을 사실상 무료에 가깝게 이용하고, 세레브라스는 대신 오픈AI를 통해서 성장 가시성을 확보함과 동시에 기업가치를 띄우기 위함입니다.

  2. 원문 구간 2

    ​ 오픈AI는 Class N 비의결권 주식 33,445,026주를 주당 $0.00001에 행사할 수 있습니다 세레브라스가 오픈AI로부터 운전자본 대출을 수령할 경우 → 4,459,337주 (13.33% / 세레브라스 시총의 2.0%) 세레브라스 시총 $40B 초과(30-day VWAP) 또는 특정 수수료 지급 조건 충족 시 → 5,574,171주 (16.67% / 2.5%) 기존 계약 컴퓨팅 750MW에 더해, 2030년 내로 1,250MW를 구매 시 → 23,411,518주 (70.00% / 10.5%) ​ 5월 11일 기준 공모가는 $150~$160인데, 만약 세레브라스 주가가 $300이 된다고 하면 오픈AI는 총 $10B 가량을 받아가는 셈입니다. 세레브라스가 인식한 오픈AI의 RPO가 $24.6B이고, GPM이 45%입니다. 세레브라스가 오픈AI로부터 받는 이익금은 11.07B인데 $10B 가량을 주는 것이므로 세레브라스는 사실상 무료로 오픈AI에게 컴퓨팅을 파는 것입니다.

  3. 원문 구간 3

    물론 정확히 말하자면 AMD 딜과 비슷하게 세레브라스 '주주들의 돈'으로 지급하는 것이긴 합니다. ​ AWS는 세레브라스 HW를 AWS 데이터센터에 배치해서 Amazon Bedrock에서 서비스하는 조건으로 약정을 맺었습니다. AWS도 Class N 비의결권 주식 2,696,678주를 받지만 문제는 주당 $100에 살 수 있는 워런트입니다. 오픈AI처럼 공짜가 아니고 AWS가 행사하려면 약 $270M 정도를 납입해야 합니다. 물론 AWS도 만약 세레브라스 주가가 $300이 된다고 치면 약 $540M정도의 이익을 얻습니다. 아마존의 I/S에 비하면 아주 작아서 큰 의미는 없긴 합니다. ​ WSE가 진짜 강한 영역 : low-batch decode 워크로드 그래도 어쨌든 많고 많은 칩 중에서 세레브라스의 WSE가 꼽힌 이유는 있습니다. ​ 세레브라스가 오픈AI 게약, AWS 논의로까지 이어질 수 있었던 이유는 이것이 앞으로 본격 개화할 Agentic AI 시대에 LLM 추론에서 가장 까다로운 병목 중 하나인 Decode-heavy 워크로드를 전용 하드웨어로 풀어보려는 시도이기 때문입니다.

이 자료에서 다룬 사실

원문은 오픈AI가 Decode 병목을 풀기 위한 추론용 하드웨어로 세레브라스를 택했고, 기존 750MW에 더해 2030년 내 1,250MW 구매 조건과 연동된 Class N 주식 워런트가 있다고 적었다.

근거 보기 2
  1. 원문 구간 1

    ​ 오픈AI가 찾아오다 : 겉과 속이 다른 계약의 의미 그러다가 오픈AI가 Decode 병목을 풀기 위해 추론용 하드웨어로 세레브라스를 택하며 많은 것들이 바뀌었습니다. 추론만을 위해서 체결한 계약이기 때문입니다. 이제 세레브라스 하드웨어가 추론에 쓰이기 시작했다는 의미입니다. 오픈AI 딜은 겉과 속의 의미를 구분해서 볼 수 있습니다. ​ 겉으로는 Agentic AI 워크로드를 다루면서 Prefill은 AWS Trainium에서 연산하고 Decode는 WSE-3에서 연산하여 Agentic AI 워크로드에 대응하기 위함입니다. (당장은 AWS가 계약을 확정짓지 않았기에 세레브라스 자체 클라우드에서 서빙 예정) 속으로는 세레브라스에 상당한 규모의 워런트를 받아 안그래도 GPM 45%인 칩을 사실상 무료에 가깝게 이용하고, 세레브라스는 대신 오픈AI를 통해서 성장 가시성을 확보함과 동시에 기업가치를 띄우기 위함입니다.

  2. 원문 구간 2

    ​ 오픈AI는 Class N 비의결권 주식 33,445,026주를 주당 $0.00001에 행사할 수 있습니다 세레브라스가 오픈AI로부터 운전자본 대출을 수령할 경우 → 4,459,337주 (13.33% / 세레브라스 시총의 2.0%) 세레브라스 시총 $40B 초과(30-day VWAP) 또는 특정 수수료 지급 조건 충족 시 → 5,574,171주 (16.67% / 2.5%) 기존 계약 컴퓨팅 750MW에 더해, 2030년 내로 1,250MW를 구매 시 → 23,411,518주 (70.00% / 10.5%) ​ 5월 11일 기준 공모가는 $150~$160인데, 만약 세레브라스 주가가 $300이 된다고 하면 오픈AI는 총 $10B 가량을 받아가는 셈입니다. 세레브라스가 인식한 오픈AI의 RPO가 $24.6B이고, GPM이 45%입니다. 세레브라스가 오픈AI로부터 받는 이익금은 11.07B인데 $10B 가량을 주는 것이므로 세레브라스는 사실상 무료로 오픈AI에게 컴퓨팅을 파는 것입니다.

그렇게 판단한 이유

원문은 오픈AI RPO $24.6B와 GPM 45%를 놓고, 주가 $300 가정 시 워런트 가치 약 $10B가 이익금 약 $11.07B에 가까워진다는 계산을 제시한다.

근거 보기 2
  1. 원문 구간 1

    ​ 오픈AI는 Class N 비의결권 주식 33,445,026주를 주당 $0.00001에 행사할 수 있습니다 세레브라스가 오픈AI로부터 운전자본 대출을 수령할 경우 → 4,459,337주 (13.33% / 세레브라스 시총의 2.0%) 세레브라스 시총 $40B 초과(30-day VWAP) 또는 특정 수수료 지급 조건 충족 시 → 5,574,171주 (16.67% / 2.5%) 기존 계약 컴퓨팅 750MW에 더해, 2030년 내로 1,250MW를 구매 시 → 23,411,518주 (70.00% / 10.5%) ​ 5월 11일 기준 공모가는 $150~$160인데, 만약 세레브라스 주가가 $300이 된다고 하면 오픈AI는 총 $10B 가량을 받아가는 셈입니다. 세레브라스가 인식한 오픈AI의 RPO가 $24.6B이고, GPM이 45%입니다. 세레브라스가 오픈AI로부터 받는 이익금은 11.07B인데 $10B 가량을 주는 것이므로 세레브라스는 사실상 무료로 오픈AI에게 컴퓨팅을 파는 것입니다.

  2. 원문 구간 2

    물론 정확히 말하자면 AMD 딜과 비슷하게 세레브라스 '주주들의 돈'으로 지급하는 것이긴 합니다. ​ AWS는 세레브라스 HW를 AWS 데이터센터에 배치해서 Amazon Bedrock에서 서비스하는 조건으로 약정을 맺었습니다. AWS도 Class N 비의결권 주식 2,696,678주를 받지만 문제는 주당 $100에 살 수 있는 워런트입니다. 오픈AI처럼 공짜가 아니고 AWS가 행사하려면 약 $270M 정도를 납입해야 합니다. 물론 AWS도 만약 세레브라스 주가가 $300이 된다고 치면 약 $540M정도의 이익을 얻습니다. 아마존의 I/S에 비하면 아주 작아서 큰 의미는 없긴 합니다. ​ WSE가 진짜 강한 영역 : low-batch decode 워크로드 그래도 어쨌든 많고 많은 칩 중에서 세레브라스의 WSE가 꼽힌 이유는 있습니다. ​ 세레브라스가 오픈AI 게약, AWS 논의로까지 이어질 수 있었던 이유는 이것이 앞으로 본격 개화할 Agentic AI 시대에 LLM 추론에서 가장 까다로운 병목 중 하나인 Decode-heavy 워크로드를 전용 하드웨어로 풀어보려는 시도이기 때문입니다.

원문에서 직접 연결한 대상세레브라스오픈AI
발생 가능진행 중발생일 미확인

아마존 트레이니움·세레브라스 프리필·디코드 협업 계약

작성자의 핵심 판단

작성자는 AWS 약정이 확정 계약이 아닌 텀시트이며, Trainium의 Prefill과 WSE-3의 Decode 조합이 매력적인지 검증한 뒤 실제 계약으로 갈지를 봐야 한다고 평가한다.

근거 보기 1
  1. 원문 구간 1

    이걸 해보고 실제 계약으로 넘어갈 것으로 예상합니다. AWS 입장에서는 일단 뭔가와 TCO 대비 퍼포먼스를 비교를 하려고 해도 기준이 있어야 하니 기준은 엔비디아의 Vera Rubin + LPX 조합이 될 것입니다. ​ 투자의 생각 : 세레브라스(CBRS) ​ 세레브라스(CBRS), 완전희석시총 기준 CY27 순이익 대비 149배 : IPO 기업을 다루는 것이다보니 투자의견은 없습니다. 원래는 가볍게 "이런 기업 IPO합니다"라고 전해드리려 시작한 분석자료인데, 엔비디아의 경쟁자로 볼 수 있는 시나리오가 있나 없나를 살펴보느라고 생각보다 진해졌습니다.

이 자료에서 다룬 사실

원문은 AWS가 세레브라스 하드웨어를 AWS 데이터센터에 배치해 Amazon Bedrock에서 서비스하는 조건으로 약정했으며, AWS의 워런트는 주당 $100 행사 조건이라고 적었다.

근거 보기 1
  1. 원문 구간 1

    물론 정확히 말하자면 AMD 딜과 비슷하게 세레브라스 '주주들의 돈'으로 지급하는 것이긴 합니다. ​ AWS는 세레브라스 HW를 AWS 데이터센터에 배치해서 Amazon Bedrock에서 서비스하는 조건으로 약정을 맺었습니다. AWS도 Class N 비의결권 주식 2,696,678주를 받지만 문제는 주당 $100에 살 수 있는 워런트입니다. 오픈AI처럼 공짜가 아니고 AWS가 행사하려면 약 $270M 정도를 납입해야 합니다. 물론 AWS도 만약 세레브라스 주가가 $300이 된다고 치면 약 $540M정도의 이익을 얻습니다. 아마존의 I/S에 비하면 아주 작아서 큰 의미는 없긴 합니다. ​ WSE가 진짜 강한 영역 : low-batch decode 워크로드 그래도 어쨌든 많고 많은 칩 중에서 세레브라스의 WSE가 꼽힌 이유는 있습니다. ​ 세레브라스가 오픈AI 게약, AWS 논의로까지 이어질 수 있었던 이유는 이것이 앞으로 본격 개화할 Agentic AI 시대에 LLM 추론에서 가장 까다로운 병목 중 하나인 Decode-heavy 워크로드를 전용 하드웨어로 풀어보려는 시도이기 때문입니다.

그렇게 판단한 이유

원문은 AWS가 TCO 대비 성능을 비교할 기준으로 엔비디아 Vera Rubin과 LPX 조합을 보게 될 것이라고 설명한다.

근거 보기 1
  1. 원문 구간 1

    이걸 해보고 실제 계약으로 넘어갈 것으로 예상합니다. AWS 입장에서는 일단 뭔가와 TCO 대비 퍼포먼스를 비교를 하려고 해도 기준이 있어야 하니 기준은 엔비디아의 Vera Rubin + LPX 조합이 될 것입니다. ​ 투자의 생각 : 세레브라스(CBRS) ​ 세레브라스(CBRS), 완전희석시총 기준 CY27 순이익 대비 149배 : IPO 기업을 다루는 것이다보니 투자의견은 없습니다. 원래는 가볍게 "이런 기업 IPO합니다"라고 전해드리려 시작한 분석자료인데, 엔비디아의 경쟁자로 볼 수 있는 시나리오가 있나 없나를 살펴보느라고 생각보다 진해졌습니다.

원문에서 직접 연결한 대상세레브라스AWS
3
사실·구조, 해석·전망, 시점 관찰, 판단 방법

지식·관점

사건 밖에서도 다시 참고하거나 다른 자료와 비교할 가치가 있는 내용을 대상과 반복 가능한 논점으로 묶습니다.

사실·구조세레브라스의 초기 고객·워크로드 구조주 대상 · 기업·종목 · 세레브라스

세레브라스의 설계 출발점은 무엇이었나?

이 자료가 더한 내용

CY25 매출의 86%가 UAE의 G42와 MBZUAI에서 나왔고 그 수요 대부분은 훈련 수요였다고 원문은 적는다. 이 출발점 때문에 FP16, Unstructured Sparsity, 범용 서버 연결 수준의 SwarmX·MemoryX 설계가 강조됐다고 설명한다.

근거 보기 2
  1. 원문 구간 1

    웨이퍼를 칩으로 만들다 : WSE는 큰 GPU가 아니다, 훈련 전략 실패, FP16, MoE... 가능성 재무상태 체크 : Other Income 착시효과일뿐 여전히 적자성장주이다 체크리스트 : 앞으로 '진짜'가 되기 위해서 확인해야 할 것들 투자의 생각 : 세레브라스(CBRS) ​ Cerebras를 둘러싼 배경 현 시점에서 세레브라스는 어떻게 봐야 하는가? ​ 세레브라스, 원래는 훈련 워크로드 시장을 목표로 했었다 세레브라스는 CY25 연간 매출의 86%가 UAE의 G42와 MBZUAI(Mohamed bin Zayed University of Artificial Intelligence, 아부다비의 AI 대학교)에서 나왔으며, 이 수요 대부분이 훈련 수요였습니다. 뒤에 조금 더 자세한 파트에서 설명드리겠지만 세레브라스는 훈련용 워크로드를 타겟으로 했기에 ⓐ그래서 FP16 중심으로 설계했고(추론에서는 FP8, FP4 사용), ⓑ그래서 Unstructured Sparsity라는 고유의 아키텍처를 강조했었으며(훈련부터 해당 구조로 해야 추론도 효율 높아지는 구조), ⓒ그래서 off-wafer I/O를 신경쓰기 보다는 SwarmX와 MemoryX는 AMD의 범용 서버를 연결하는 형태로 적당히만 설계했습니다.

  2. 원문 구간 2

    ​ 오픈AI가 찾아오다 : 겉과 속이 다른 계약의 의미 그러다가 오픈AI가 Decode 병목을 풀기 위해 추론용 하드웨어로 세레브라스를 택하며 많은 것들이 바뀌었습니다. 추론만을 위해서 체결한 계약이기 때문입니다. 이제 세레브라스 하드웨어가 추론에 쓰이기 시작했다는 의미입니다. 오픈AI 딜은 겉과 속의 의미를 구분해서 볼 수 있습니다. ​ 겉으로는 Agentic AI 워크로드를 다루면서 Prefill은 AWS Trainium에서 연산하고 Decode는 WSE-3에서 연산하여 Agentic AI 워크로드에 대응하기 위함입니다. (당장은 AWS가 계약을 확정짓지 않았기에 세레브라스 자체 클라우드에서 서빙 예정) 속으로는 세레브라스에 상당한 규모의 워런트를 받아 안그래도 GPM 45%인 칩을 사실상 무료에 가깝게 이용하고, 세레브라스는 대신 오픈AI를 통해서 성장 가시성을 확보함과 동시에 기업가치를 띄우기 위함입니다.

해석·전망Agentic AI의 저지연 추론 수요주 대상 · 기술·제품 · Agentic AI관련 대상 · 산업·업종 · AI 추론 인프라

왜 속도가 사용자 경험을 넘어 수익화 변수로 바뀌는가?

이 자료가 더한 내용

원문은 B2B API·코딩·자동화에서 속도가 업무 생산성과 연결되고, 에이전트의 반복 작업에서는 단계별 지연이 누적된다고 해석한다. 그래서 Tokens per second/User를 사용자 경험·프리미엄 전환·API 사용량·토큰당 매출총이익을 함께 좌우하는 축으로 본다.

근거 보기 5
  1. 원문 구간 1

    ​ 속도가 사용자 경험의 질을 결정한다 AI 서비스에서 속도는 이제 단순한 기술 지표가 아닙니다. 사용자 경험의 질을 결정하는 핵심 변수이자, 토큰당 매출총이익을 높이는 데 기여하는 수익화 변수가 되고 있습니다. ​ 원래도 속도는 사용자 경험에서 중요한 차이를 만들었습니다. 사용자가 프롬프트를 입력한 뒤 결과가 얼마나 빠르게 돌아오는지가 곧 체감 품질을 결정하기 때문입니다. 같은 수준의 지능을 가진 모델이라도 응답이 느리면 사용자는 답답함을 느낍니다. 반대로 즉각적으로 반응하는 모델은 실제 성능 이상으로 더 똑똑하고, 더 안정적이며, 더 신뢰할 수 있는 서비스처럼 인식됩니다. ​ 다만 과거에는 이러한 속도의 경제성이 제한적이었습니다. 응답 속도를 높이기 위해서는 더 많은 컴퓨팅 자원을 투입해야 했고, 그만큼 비용은 크게 올라갔습니다. 그런데 수익화 모델은 대부분 ChatGPT 구독료나 무료 사용자 기반 확대에 머물러 있었습니다.

  2. 원문 구간 2

    즉, 더 빠른 토큰을 제공하더라도 그 비용에 상응하는 매출과 이익을 충분히 회수하기 어려웠습니다. ​ 그래서 이전까지 속도는 '좋으면 좋은' 기능에 가까웠습니다. 사용자 경험을 개선하는 요소이긴 했지만, LLM 기업들이 사용자당 토큰을 훨씬 더 빠르게 제공해야 할 만큼 강한 경제적 유인은 부족했습니다. ​ 고지능/고마진 서비스일수록, 속도는 생산성의 차이가 된다 하지만 Agentic AI와 B2B 워크로드가 커지면서 상황이 달라지고 있습니다. LLM 서비스의 수익성은 워크로드별로 크게 다릅니다. 무료 챗봇, 캐릭터 대화, 롤플레잉처럼 대중 사용자 기반을 넓히기 위한 B2C 서비스는 토큰 사용량은 많지만 토큰당 수익성은 낮은 편입니다. ​ 반면 API, 코딩, 기업용 자동화, 개발자 워크플로우처럼 실제 업무 생산성과 연결되는 B2B 서비스는 토큰당 이익이 훨씬 높습니다. 여기서 속도는 단순한 편의성이 아니라 생산성 그 자체가 됩니다.

  3. 원문 구간 3

    코드 생성이 더 빨라지고, 에이전트의 반복 작업이 더 짧아지고, 사용자가 기다리는 시간이 줄어들수록 고객이 체감하는 경제적 가치는 커집니다. ​ 앤스로픽이 빠르게 치고 올라온 이유도 여기에 있습니다. Claude Code와 같은 고부가가치 워크로드에서 강한 사용성을 입증하면서, 단순 트래픽이 아니라 추론 매출총이익률이 더 높은 토큰 수요를 먼저 확보​했습니다. 오픈AI 역시 뒤늦게라도 기업용 API, 코딩, 에이전트 워크플로우에서 점유율을 높이려는 이유가 여기에 있습니다. 결국 LLM 시장의 경쟁은 단순히 누가 더 많은 사용자를 보유했는가에서 누가 더 높은 이익률의 토큰을 더 많이 처리하는가로 이동하고 있습니다. 그리고 이 고마진 토큰 시장에서는 지능만큼이나 속도가 중요합니다. ​ Agentic AI는 더 많은 토큰뿐 아니라 더 낮은 지연시간을 요구한다 Agentic AI는 단순히 더 많은 토큰을 소비하는 흐름이 아닙니다.

  4. 원문 구간 4

    더 중요한 변화는 더 낮은 지연시간으로 더 많은 상호작용을 처리해야 한다는 것입니다. ​ 기존 챗봇은 사용자가 질문을 입력하면 모델이 한 번에 긴 답변을 생성하는 구조였습니다. 이 경우 다소 느리더라도 사용자가 감내할 수 있는 여지가 있었습니다. 하지만 Agentic AI는 다릅니다. 코드를 작성하고, 실행하고, 오류를 확인하고, 다시 수정하고, 파일을 읽고, 다음 행동을 결정하는 과정을 반복합니다. 이 과정에서는 매 단계의 지연시간이 누적되어 전체 생산성의 차이로 이어집니다. ​ 따라서 Agentic AI에서는 토큰을 얼마나 빠르고 안정적으로 계속 생성할 수 있는가가 더 중요해집니다. 위에 기본 전해드린 것처럼 Decode 단계에서는 다음 토큰을 하나씩 순차적으로 생성해야 하기 때문에, 낮은 지연시간과 빠른 메모리 접근 능력이 핵심 병목으로 부각됩니다. ​ 이 지점에서 Decode-heavy 워크로드를 잘 처리하는 하드웨어의 가치가 올라갑니다.

  5. 원문 구간 5

    세레브라스의 WSE, Groq식 LPU 아키텍처 통합을 통한 엔비디아의 저지연 추론 강화 전략은 모두 같은 방향에서 이해할 수 있습니다. AI 서비스의 수익성이 높아질수록, 그리고 사용자가 실시간에 가까운 반응을 요구할수록, 저지연 토큰 생성 능력은 단순한 성능 지표가 아니라 수익화의 핵심 축이 됩니다. ​ 정리하면, 과거의 속도는 사용자 경험을 개선하는 요소였습니다. 하지만 Agentic AI 이후의 속도(Tokens per second/User)는 다릅니다. 이제 속도는 사용자 경험, 업무 생산성, 프리미엄 요금제 전환, 기업용 API 사용량, 그리고 AI Labs의 토큰당 매출총이익을 동시에 결정하는 인프라 경쟁력이 되고 있습니다. ​ 물론, 엔비디아는 이미 Rubin-LPX 통합을 통해서 이러한 파레토 프론티어를 드라마틱하게 끌어올릴 준비를 마쳤습니다. 이것이 GTC 2026에서 젠슨 황이 말하고자 했던 것입니다.

사실·구조WSE의 메모리·연결 구조주 대상 · 기술·제품 · Cerebras WSE관련 대상 · 기업·종목 · 세레브라스

WSE의 빠른 Decode와 적용 한계는 무엇으로 갈리는가?

이 자료가 더한 내용

원문은 WSE-3의 44GB on-wafer SRAM과 21PB/s 내부 대역폭이 가중치·KV Cache를 칩 안에 둘 수 있을 때 빠른 Decode를 가능하게 한다고 설명한다. 반면 외부 연결 대역폭과 SRAM 용량은 대형 모델·긴 컨텍스트에서 병목이 될 수 있다고 제시한다.

근거 보기 5
  1. 원문 구간 1

    ​ 첫 번째 병목 : 44GB SRAM, SRAM이 가장 귀하다 세레브라스 WSE-3의 강점은 44GB on-wafer SRAM에서 나오는 21PB/s급 메모리 대역폭입니다. 덕분에 모델 가중치와 KV Cache를 토큰당 매우 반복적으로 빠르게 읽어내야 하는 작업에서는 매우 높은 TPS/user를 낼 수 있습니다. 하지만 WSE로 엮은 구조 때문에 속도를 얻은 대신 메모리 용량이 매우 작은 한계가 있습니다. SRAM은 HBM보다 훨씬 덜 조밀하기에 하나의 전체 WSE에서 44GB밖에 담지 못합니다. ​ WSE-3의 44GB SRAM 용량은 on-chip SRAM을 기준으로 삼자면 매우 크지만(84개 칩당 on-chip SRAM으로 보자면 520MB정도라서 레티클 면적당 SRAM 용량은 LP30과 같습니다), 대신 HBM 기반 가속기들에 비교하면 매우 작습니다. GB300과 TPU v8i도 288GB, Trainium3도 144GB입니다.

  2. 원문 구간 2

    ​ LLM 추론 시 메모리에 올라가는 것은 모델 가중치만이 아닙니다. 각 사용자 요청마다 생성되는 KV Cache도 함께 메모리에 저장돼야 합니다. 컨텍스트가 길어지거나 동시 요청 수가 늘어날수록 KV Cache는 빠르게 커집니다. 세레브라스 WSE의 장점은 웨이퍼 전체에 깔린 44GB SRAM과 21PB/s급 초고속 내부 메모리 대역폭입니다. 문제는 이 44GB SRAM 안에 각 WSE가 담당하는 모델 레이어의 가중치와 해당 레이어의 KV Cache가 함께 들어가느냐입니다. ​ 이 조건이 충족되면 WSE는 매우 강력합니다. 가중치와 KV Cache가 모두 on-wafer SRAM 안에 있기 때문에 외부 메모리를 거의 기다리지 않고 빠르게 decode를 처리할 수 있습니다. ​ 반대로 KV cache가 SRAM 안에 들어가지 못해 외부 메모리로 나가야 하는 순간, 세레브라스의 가치제안은 크게 약해집니다.

  3. 원문 구간 3

    WSE도 KV cache를 외부에 저장할 수는 있지만, GPU가 HBM을 decode의 주 메모리처럼 쓰는 것처럼 외부 메모리를 긴밀하게 활용하기는 어렵습니다. ​ 여기서 두 번째 병목이 발생합니다. ​ 두 번째 병목 : off-wafer I/O, 여러 WSE를 연결할 때의 병목 대형 모델은 당연히 WSE의 44GB SRAM 안에 들어가지 않습니다. 그렇다면 여러 WSE를 연결해야 합니다. 여기서 두 번째 병목인 off-wafer I/O가 나타납니다. ​ WSE 내부 SRAM 대역폭은 21PB/s인데, WSE 바깥으로 나가는 대역폭은 150GB/s 수준입니다. Blackwell NVLink5의 GPU당 900GB/s 대비 6분의 1 수준입니다. 칩 내부는 대역폭이 매우 높은데 칩 바깥으로 나가는 통로는 매우 좁은 상태인 겁니다. ​ 조금 더 구체적으로 예를 들어서, Irrational Analysis 계산으로는 Llama 3.1 70B 기준 KV Cache Streaming을 하려면 WSE당 33.8Tb/s가 필요하다고 봤는데, 실제 WSE-3 I/O는 1.2Tb/s이니 28배 부족합니다.

  4. 원문 구간 4

    GPT-oss-120B도 48.4Tb/s가 필요하니 실제 I/O 대비 40배 부족하기 때문입니다. ​ 그렇다면 on-chip SRAM 규모를 키우면 되는 게 아닌가 싶으실 수 있는데, ​ SRAM 메모리 용량을 늘릴 수 없다 생산 구조상 SRAM은 전공정의 영향을 받습니다. WSE-1는 TSMC 16nm에서 18GB SRAM을 탑재했었고 → WSE-2는 7nm에서 40GB로 늘렸으며 → WSE-3에서는 5nm에서 44GB를 탑재하게 생산했습니다. 그런데 현재 WSE-3를 제조하는 5nm 이하로 간다고 해도 칩/웨이퍼당 SRAM을 더 이상 거의 키울 수 없습니다. ​ 칩은 메모리를 다른 die나 패키징에서 보완할 수 있기에 상대적으로 스케일링이 자유로운데, 웨이퍼 구조는 현 상태로는 SRAM 용량을 늘리려면 compute core를 줄여서 SRAM 할당비중을 키우는 정도로만 대응이 가능합니다.

  5. 원문 구간 5

    SRAM 스케일링의 정체가 구조적인 문제입니다. ​ 이에 장기적인 해법은 두 가지입니다: 하나는 하이브리드 본딩을 사용하여 지금 WSE에 붙여서 추가 SRAM 타일을 추가하거나(엔비디아가 Groq LP40 로드맵에 기재한 방식), 다른 하나는 WSE도 웨이퍼 간 접합을 통해서 메모리 용량을 추가하는 방법입니다. 그렇게 할 수는 있겠는데 문제는 세레브라스가 그러한 열역학/기계적인 어려움을 공급망을 관리해가며 극복하여 엔비디아와 비슷한 타이밍에 제품을 출시할 수 있겠냐는 것이 남습니다. 칩에서 하고 있는 것보다도 훨씬 더 어려운 패키징 혁신을 필요로 하는데 엔비디아, 구글, AWS 같은 플레이어들과 비슷한 타이밍에 제품화할 수 있겠느냐입니다. ​ 다시 돌아와서, 그럼 얼마정도의 파라미터를 가진 모델이면 세레브라스 WSE가 가진 장점은 살릴 수 있겠느냐가 중요한 포인트입니다.

사실·구조LLM 추론의 정밀도·MoE와 메모리주 대상 · 기술·제품 · LLM 추론관련 대상 · 기술·제품 · Cerebras WSE

FP16과 MoE 구조가 WSE의 대형 모델 경제성에 어떤 제약을 주는가?

이 자료가 더한 내용

원문은 FP16이 FP8보다 2배, FP4보다 4배 메모리를 쓰며 GPT-oss 120B 예에서 FP16은 WSE 13개, FP8은 7개가 필요하다고 계산한다. MoE도 토큰당 일부 expert만 활성화하지만 전체 파라미터를 SRAM에 올려야 하므로 WSE 간 이동이 남는다고 설명한다.

근거 보기 4
  1. 원문 구간 1

    ​ 거대모델 추론에는 아쉬운 WSE #1 : FP16 중심 일반적으로 추론에서 WSE가 매우 작은 시장에만 유효할 거라고 보게 하는 몇 가지 한계점들이 있습니다. 쭉 살펴보다보면, 대표적인 게 두 가지 있습니다. ⓐ저정밀 포맷이 제한적이라는 점, ⓑMoE 추론의 이점을 거의 살릴 수 없을 것이라는 점입니다. ​ 첫 번째 약점은 FP16까지만 지원한다는 점입니다. 저정밀 포맷을 지원하지 않습니다. 훈련에서는 FP16이 자연스러운데 추론에서는 상당히 아쉬운 설계입니다. ​ 초점을 잃지 않기 위해서 쭉 다시 정리하자면, 세레브라스의 강점은 44GB on-wafer SRAM과 21PB/s급 메모리 대역폭이고, 모델 가중치와 KV Cache를 SRAM 위에 올릴 수 있다면 decode 단계에서 압도적인 속도의 토큰 생성이 가능합니다. 여기서 44GB SRAM이 매우 귀한 자원이라는 게 문제입니다.

  2. 원문 구간 2

    추론 시에는 KV Cache도 메모리에 올려야 하기 때문입니다. GPU는 그래서 KV Cache offloading을 하여 대응 중인데, WSE는 off-wafer I/O가 낮으니 칩 외부로 KV Cache를 옮기려면 병목이 너무 큽니다. ​ 이런 구조에서는 FP16/BF16 중심 설계는 비용이자 성능 문제입니다. 거대모델 추론에는 최소 FP8, 요즘은 FP4로 서빙하고 있습니다. 같은 모델이라도 FP16로 저장하면 FP8 대비 2배, FP4 대비로는 4배의 메모리를 먹습니다. WSE처럼 SRAM 용량이 제한적인 상태라면 이 차이가 곧 하나의 모델을 서빙하기 위해서 필요한 WSE의 수, 시스템 비용, 지연시간을 결정합니다. ​ 예를 들어서, GPT-oss 120B 모델을 서비스한다면 모델 가중치로만 233.6GB를 필요로 하고 총 SRAM 필요량은 557.6GB입니다.

  3. 원문 구간 3

    WSE가 13개 필요합니다. FP8로 서비스할 경우 가중치는 120GB, 총 SRAM 필요량은 295GB이므로 WSE는 7개면 됩니다. 같은 모델을 몇 개의 WSE로 서빙할 수 있느냐를 결정하는 요소입니다. 더 많은 WSE로 서빙하려면? 다시금 off-wafer I/O가 아쉬운 게 부각됩니다. ​ 엔비디아의 Blackwell이 FP4를 하드웨어상에서 Native로 지원하는 최초의 칩이 되게 만들었던 것도 이렇게 추론의 경제성을 크게 끌어올리기 위함이었는데, 세레브라스는 이 분야에서 꽤나 뒤처져 있다는 의미입니다. ​ 거대모델 추론에는 아쉬운 WSE #2 : MoE 모델의 효율성을 누리기 어렵다 WSE는 MoE가 주는 핵심 이점을 GPU-HBM 구조처럼 누리기 어렵습니다. MoE의 장점은 전체 파라미터 중에서 토큰당 일부 expert만 활성화해서 토큰당 유효 컴퓨팅 규모를 크게 낮출 수 있는 데 있습니다.

  4. 원문 구간 4

    얼마 전의 4월 27일 주간전략보고에서 Technical Report를 해석해드린 DeepSeek-V4-Pro를 예로 들자면 전체 파라미터는 1.6T인데 추론 시 활성화되는 파라미터(Active Parameter)는 49B입니다. ​ 문제는 한 번 요청할 때야 일부만 활성화하여 연산량을 줄일 수 있지만, 시스템에는 전체 파라미터를 칩 위에 올려놔야 한다는 데 있습니다. WSE가 빠르려면 SRAM 안에 가중치와 KV Cache를 같이 담아두고(전체 모델을 담진 못하니 같은 Layer를 담아두는 구조) WSE 바깥으로 데이터를 내보내는 것은 최소화해야 합니다. 그런데 전체를 얹으려면 결국 또 여러 WSE를 오가게끔 해야 하기에 MoE의 이점을 누리지 못합니다. 재무상태 체크 Other Income 착시효과일뿐 여전히 적자성장주이다

사실·구조세레브라스의 매출·마진·회계상 이익주 대상 · 기업·종목 · 세레브라스

매출 성장과 CY25 순이익은 본업의 수익성을 어떻게 보여주는가?

이 자료가 더한 내용

원문은 CY25 매출 $510M 중 하드웨어가 $358.4M(70%), 클라우드·기타 서비스가 $151.6M(30%)라고 적는다. 순이익에는 G42 주식매입 약정의 선도계약부채가 재평가·소멸되며 생긴 비현금성 Other Income 약 $391M이 반영됐다고 설명한다.

근거 보기 7
  1. 원문 구간 1

    세레브라스의 매출은 CY24 $290M → CY25 $510M로 YoY 76% 성장했습니다. CY25 기준으로 구분해보자면 Hardware가 $358.4M로 매출비중 70%, Cloud and other services $151.6M로 비중 30%입니다. ​ 매출구성 #1 하드웨어 (Hardware) 세레브라스의 하드웨어 매출은 고객이 자기 데이터센터에 설치해서 쓰는 AI 시스템 판매 매출입니다. CS-3, WSE, 관련 장비 판매 매출이 잡힙니다. 고객이 구매하면 인도 시점에 크게 인식되는 성격입니다. 매출원가는 웨이퍼, 패키징, 조립, 물류, 테스트, 재고비용, 관련 인력 및 시설비가 들어갑니다. 반도체 기업으로서의 세레브라스를 살펴볼 때 가장 중요한 부분입니다. ​ 매출구성 #2 클라우드와 기타 서비스 (Cloud and other services)

  2. 원문 구간 2

    세레브라스가 직접 또는 파트너 채널을 통해 제공하는 AI 컴퓨팅 사용료와 서비스성 매출입니다. 2024년 8월에 출시한 세레브라스 클라우드(Cerebras Cloud)가 핵심입니다. 세레브라스가 직접 운영하는 것이기 때문에 데이터센터 비용, 장비 감가상각, 클라우드 운영 인력, 시설비 등이 듭니다. 일종의 네오클라우드입니다. ​ 목적은 하드웨어로 판매할 때는 고객이 시스템을 직접 사서 개발자들을 두고 운영도 직접해야 하는 만큼, 고객 입장에서 사실 허들이 높고 채택이 더뎠기에 WSE를 API/클라우드 방식으로 사용할 수 있게 만든 것입니다. 고객 입장에서는 초기 CapEx 부담이 줄어드는 효과이기도 하고, 각종 클라우드나 파트너 채널을 통해서 세레브라스 하드웨어를 깔아두고 서빙했기에 접근성을 넓히는 만큼 더 넓은 고객군에 접근할 수 있었습니다.

  3. 원문 구간 3

    ​ 고객은 세레브라스 클라우드 용량을 두 가지 방식으로 구매할 수 있습니다: ​ 하나는 장기 약정인 Dedicated Capacity입니다. 고객이 일정 기간 특정 컴퓨팅 용량을 전용으로 사용하는 방식입니다. 흔히 보이는 장기계약입니다. 다른 하나는 On-demand입니다. 필요할 때마다 사용량 기반으로 사용하는 것입니다. 세레브라스에서 직접 구매할 수도 있고, 각종 클라우드 파트너 채널 통해서도 접근 가능합니다. ​ 세레브라스, 마진 : GPM 39% 세레브라스의 전사 GPM은 CY24 42.3% → CY25 39.0%로 약간 감소했습니다. 사업부가 하드웨어와 클라우드 두 가지로 나뉘는 만큼 각각의 GPM도 다른데, 하드웨어가 CY24 35.2% → CY25 42.9%로 마진이 소폭 상승했고 클라우드는 CY24 61.4% → CY25 29.9%로 마진이 크게 하락한 것이 특징입니다.

  4. 원문 구간 4

    ​ 하드웨어 : 세레브라스 하드웨어의 매출원가를 설명드린 것에서부터 생각해보면, 생산량을 늘리고 제조 공정을 안정화시키면 시스템당 원가가 낮아지는 효과로 이어집니다. 초기 생산 단계에서는 수율, 조립, 테스트, 공급망 부담 비용이 컸겠지만 생산량이 늘어남에 따라 칩당 단가는 낮아지는 효과로 나왔습니다. 또한 CY24 하드웨어 마진은 UAE의 G42향으로 시스템을 판매할 때 가격할인을 해줬던 영향도 있습니다. 클라우드 : 클라우드 사업자로서 초기비용이 많이 드는 길을 택했습니다. 추론 용량을 제공하려면 세레브라스가 데이터센터 공간, 전력, 네트워크, 서버/시스템, 운영인력, 장비 감가상각을 부담해야 합니다. 이제 막 추론 서비스 용량을 늘려가던 때라서 CY25는 클라우드 및 기타 서비스의 매출도 늘었지만 각종 비용이 먼저 더 크게 늘면서 마진이 눌렸던 해입니다.

  5. 원문 구간 5

    ​ 흑자인가? 적자인가? → 적자기업 세레브라스의 I/S를 슥 훑어보다가 흑자기업인가 싶었는데, 자세히 살펴보다보니 CY25에 순이익이 남았던 이유는 영업외이익이 $391M 가량 잡혔기 때문입니다. 회계상으로만 잡힌 이익입니다. ​ 이 회계상 이익은 어디서 왔는가? 세레브라스는 2024년에도 한 번 S-1을 올린 적 있습니다. 당시 2024년 IPO를 준비하던 시점에 세레브라스는 G42와 단순한 고객 계약만 맺은 것이 아니었습니다. G42는 세레브라스의 핵심 고객이면서 동시에 잠재적 대주주가 될 수 있는 구조였습니다. ​ 구체적으로 보자면, G42는 세레브라스의 칩을 꽤 많이 할인받아 상당량 구매하면서 동시에 세레브라스의 비의결권 Series F-2 우선주 22,851,296주를 주당 $14.66에 매입하기로 했었습니다.

  6. 원문 구간 6

    총 매입금액은 $335M이었습니다. 이 매입이 IPO 이후에 이뤄지면 비의결권 Class N 보통주를 받는 구조였습니다. Class N은 아예 이렇게 세레브라스가 '우리 이렇게 잘나간다' 하며 펌핑 후 파트너사에게 주기 위한 용도의 주식으로 의결권은 없지만, 보유자가 원하면 Class A common stock으로 1:1 전환할 수 있는 주식입니다. ​ 간단하게 보자면, 세레브라스가 당시 G42에게 "우리 칩과 시스템을 대규모로 사주는 전략 고객이 되어주면, 당신에게도 IPO 이후 주가 상승에 참여할 수 있는 권리를 주겠다"고 말한 것과 같습니다. 심지어는 G42가 직접 혹은 G42가 지정한 제3자가 일정규모 이상의 세레브라스 클러스터를 구매할 경우 G42가 추가로 주식을 더 살 수 있는 옵션도 부여되는 구조였습니다.

  7. 원문 구간 7

    ​ *사실 생각해보면, 지금 오픈AI를 통해서 하려는 것과 비슷합니다. ​ 중요한 건 이 주식매입 약정이 세레브라스 입장에서는 미래에 정해진 가격으로 주식을 발행해야 하는 계약이었고, 이것이 선도계약부채(forward contract liability)로 잡혔었습니다. ​ CY24에는 영업외이익이 -$378M으로 잡히며 순손실을 키웠던 요인이고, 같은 계정이 CY25에는 반대가 되면서 영업외이익으로 잡혔습니다. 해당 부채가 재평가 및 소멸되면서 비현금성 영업외이익을 회계상 인식한 것입니다. 본업의 수익성을 보여주는 게 아니므로 꼭 감안하셔야 할 부분입니다. ​ 대략의 미래 매출 추정 세레브라스는 자신의 Cerebras Cloud를 통해서 Powered Shell을 구축하고 오픈AI에게 서비스할 예정이며 CY26~CY28에 걸쳐서 750MW의 추론 용량을 구매하고, 향후 1.25GW 옵션도 있으니 전체 규모는 2GW까지 열려있습니다.

해석·전망세레브라스의 사업 증명 단계주 대상 · 기업·종목 · 세레브라스

원문은 세레브라스가 무엇을 확인해야 하는 단계라고 보는가?

이 자료가 더한 내용

원문은 2GW 가정의 매출·이익·밸류 추정이 AWS 계약과 실제 사용성에 따라 달라진다고 보며, 세레브라스를 매출·이익증명보다 기술증명에 가까운 단계로 평가한다. Powered Shell 확보와 AWS 분산 구조의 실제 검증을 핵심 확인점으로 든다.

근거 보기 8
  1. 원문 구간 1

    그럼 세레브라스가 앞으로 얼마나 벌 수 있을까를 가정하려면, 오픈AI가 2GW를 모두 온라인한다고 가정할 시 오픈AI에게서 기대하는 매출만 감안할 경우 CY26 $0.9B(서비스 용량 250MW) → CY27 $2.5B(서비스 용량 500MW) → CY28 $3.4B(서비스 용량 750MW)입니다. ​ 전사 GPM이 40%인데 워런트로 주주가치 희석 등을 고려하면 사실 실질 마진율은 더 낮습니다. 어쨌든 CY27부터 순이익이 나온다고 보고 GPM 40%, NPM 15%를 가정하고 놓고 보더라도 순이익은 CY27 $375M → CY28 $510M입니다. 오늘 올린 IPO 가격 $185를 기준으로 보자면 완전 희석가치 기준 기업가치가 $56B이므로 CY27 순익 대비 149배 → CY28 110배입니다.

  2. 원문 구간 2

    밸류가 상당히 높은 상태이긴 합니다. ​ 물론, AWS도 계약하면서 매출 추정이 달라질 경우 이익 추정이 바뀌니 밸류 기준은 크게 달라집니다. 그래서 사실 추정의 큰 의미는 없는 단계입니다. 이익추정이 잘 맞으려면 이익증명 단계일 때가 효과적인데, 지금은 개인적으로 생각하는 기업의 사이클 ⓐ개념증명 → ⓑ기술증명 → ⓒ매출증명 → ⓓ이익증명 중에서 거의 ⓑ인 기술증명을 해가는 단계로 보고 있습니다. 지금 매출이 나오는 기업이니 ⓒ라고 볼 수도 있겠지만, Organic Sales가 아니기도 하고 decode-heavy 워크로드에 잘 먹힐지 아닐지가 TAM에 매우 지대한 영향을 줄 것이기에 ⓑ Phase로 보고 있습니다. ​ *지난주 월요일에 S-1 파일을 제출할 당시에는 주당 $115~$125정도에 2,800만 주를 매각할 계획이었습니다 → 그러다가 이번 주 월요일에는 이를 주당 $150~$160에 3,000만 주를 매각하는 것으로 규모를 키웠고 → 오늘은 주당 $185에 3,000만 주를 매각할 예정입니다.

  3. 원문 구간 3

    총 자금조달 규모는 $5.55B이며 주당 $185에 상장된다고 하면 RSU, 스톡옵션, 워런트를 모두 포함하여 완전희석가치 기준 $56B 밸류(대략 3.05억 주)입니다. 체크리스트 앞으로 '진짜'가 되기 위해서 확인해야 할 것들 ​ 가장 중요한 건, 결국 진짜 쓸만할 것인가 우선, 위에 전해드린 WSE를 추론에 쓰는 구조가 어느 정도로 매력적인지가 중요합니다. ​ 세레브라스는 언제든 칩을 사실상 무료로 줄 준비가 되어 있기 때문에 오픈AI, AWS 등이 이를 ML/System co-design 해보면서 최대의 성능을 끌어올릴 수 있는 워크로드는 찾겠지만 그 시장규모가 어느 만큼 될 것인가는 알 수 없습니다. 세레브라스 팀보다 더 훌륭한 SRAM 솔루션을 갖고 있던 Groq 팀을 엔비디아가 인수하여 Rubin과 내재화 중이기에, 엔비디아의 LPX 솔루션이 얼마나 매력적인가가 결국 오픈AI와 AWS가 수고로움을 감안하면서까지 co-design에 뛰어들게 할 것인가를 결정할 것입니다.

  4. 원문 구간 4

    이런식으로 써보려고 했다가 잘 안 된 케이스가 MI300~350였습니다. 모델과 워크로드는 바뀌더라도 TCO 대비 퍼포먼스라는 축에서의 경쟁은 모든 플레이어들에게 동일하게 적용됩니다. 가장 혁신을 많이 하는 플레이어가 살아남을 뿐입니다. ​ 그리고 세레브라스가 앞으로 나아가는 과정에서 중요한 것들이 있습니다. ​ 첫 번쨰, 문제는 세레브라스가 확보한 Powered Shell의 규모 세레브라스는 올해까지 250MW → CY27에 추가로 250MW(누적 500MW) → CY28에도 추가 250MW(누적 750MW)를 서비스하기 위해서 Powered Shell을 확보해야 합니다. 그러나 문제는 SemiAnalysis 추정에 따르면 세레브라스는 2026년 4월 기준 CY27까지 온라인될 Powered Shell을 180MW정도 확보했습니다.

  5. 원문 구간 5

    CY26 말까지 온라인될 규모는 43MW 정도 확보한 상태이고, AWS에 배포된 용량도 일부 있긴 하지만 10MW를 넘지 않을 것이므로 실제로 서비스할 수 있는 용량을 제때 확보할 수 있겠냐가 남습니다. ​ 두 번쨰, AWS Trainium + WSE의 분산 구조가 잘 작동하는가? AWS와 맺은 계약은 오픈AI처럼 나름 확정된 계약이 아니라 텀시트(Term sheet, 예비 합의서)입니다. 아마존은 세레브라스를 운영해보면서 Prefill에 AWS Trainium를 사용하고, Decode에 WSE-3를 사용해가면서 Agentic AI용 워크로드를 수행하기에 충분히 매력적인 칩인지를 검증할 것입니다.

  6. 원문 구간 6

    이걸 해보고 실제 계약으로 넘어갈 것으로 예상합니다. AWS 입장에서는 일단 뭔가와 TCO 대비 퍼포먼스를 비교를 하려고 해도 기준이 있어야 하니 기준은 엔비디아의 Vera Rubin + LPX 조합이 될 것입니다. ​ 투자의 생각 : 세레브라스(CBRS) ​ 세레브라스(CBRS), 완전희석시총 기준 CY27 순이익 대비 149배 : IPO 기업을 다루는 것이다보니 투자의견은 없습니다. 원래는 가볍게 "이런 기업 IPO합니다"라고 전해드리려 시작한 분석자료인데, 엔비디아의 경쟁자로 볼 수 있는 시나리오가 있나 없나를 살펴보느라고 생각보다 진해졌습니다.

  7. 원문 구간 7

    오픈AI와 AWS가 써보면서 실제로 WSE-3의 한계인 44GB SRAM 용량과 off-wafer I/O를 극복할 수 있을 것인가가 중요합니다. 어느 만큼 쓸만한가에 따라서 매출 추정이 달라질 경우 이익 추정이 바뀌니 밸류 기준은 크게 달라집니다. 그래서 사실 추정의 큰 의미는 없는 단계입니다. 이익추정이 잘 맞으려면 이익증명 단계일 때가 효과적인데, 지금은 개인적으로 생각하는 기업의 사이클 ⓐ개념증명 → ⓑ기술증명 → ⓒ매출증명 → ⓓ이익증명 중에서 거의 ⓑ인 기술증명을 해가는 단계로 보고 있습니다. 지금 매출이 나오는 기업이니 ⓒ라고 볼 수도 있겠지만, Organic Sales가 아니기도 하고 decode-heavy 워크로드에 잘 먹힐지 아닐지가 TAM에 매우 지대한 영향을 줄 것이기에 ⓑ Phase로 보고 있습니다.

  8. 원문 구간 8

    적자기업이고, 기술적으로 사실 한계가 많으며, 새로 생기는 시장에서 엔비디아의 점유율을 크게 해칠 기술력을 갖고 있다고 보지 않습니다. 물론 시총이 작으니 투기적으로 움직일 수는 있겠고, 기술이라는 게 어떻게 적용하느냐에 따라 새로운 사용 사례를 만들 수도 있는 것(아마 음성모델에는 잘 맞을 겁니다)이긴 합니다만, 밸류를 감안하면 그닥 매력적이게 느껴지진 않았습니다.

4

시간흐름대로 모든 내용을 살려 정리

시간흐름대로 모든 내용을 살려 정리

1
자료 성격과 상장 전제

[원문 유형] 네이버 프리미엄 콘텐츠
[채널] 올바른 미국주식 by SAPIENS
[게시일] 2026.05.14. 오후 4:57
[원문 URL] https://contents.premium.naver.com/sapiens/sapiensasset/contents/260514165730368xj
[제목] 세레브라스 IPO 분석 : 엔비디아 킬러인가?
[수집 기준] 승인된 구독 열람권으로 실제 본문을 보존했다. 이미지·첨부는 별도 미디어 원장에 보관하며 시각적 의미 검토 여부를 구분한다.

[구독 원문 본문]

안녕하세요 올바른입니다.

오늘 밤 상장하는 세레브라스(CBRS) IPO 분석입니다. CY26 YTD 최대 규모 IPO입니다. 공모가도 2주 사이에 두 번이나 상향돼서, 초기에는 $115~$125였던 것이 $185가 됐습니다.

현 시점에서 세레브라스는 어떻게 봐야 하는지? 웨이퍼를 칩으로 만든 것이지만 GPU가 아닌 WSE에 대해, 재무상태 체크와 가벼운 미래 추정, 체크리스트를 정리해봤습니다.

2
연관 자료와 투자자문 고지

​

Agentic AI 시대에 속도는 생산성의 격차로 변했습니다. Groq을 인수한 엔비디아가 느꼈던 문제의식을, Non-NVDA가 해결해보려는 시도에 대해 생각해본 자료입니다.

큰 흐름 읽기

2026-04-22

엔비디아 CEO 젠슨황 인터뷰 : 'TPU도 Trainium도, 그렇게 자신 있으면 공개로 붙어보자' (바로가기)

2026-03-27

앤스로픽 CEO 다리오 아모데이 인터뷰 : "Extremely fast, but not infinitely fast" (바로가기)

2026-03-05

AI 사이클 한 눈에 보기, SemiAnalysis 인터뷰 : "거품은 없다. ARR $100B가 온다" (바로가기)

2025-10-08

오픈AI 퇴사자의 글 #1 : 2027년 AGI가 온다 (바로가기)

엔비디아 (NVDA)

2026-04-22

3
원문의 다섯 갈래 목차

엔비디아 CEO 젠슨황 인터뷰 : 'TPU도 Trainium도, 그렇게 자신 있으면 공개로 붙어보자' (바로가기)

2026-03-17

엔비디아 GTC 2026 : 7개의 칩, 5개의 랙 시스템, 그리고 하나의 AI 슈퍼컴퓨터 (바로가기)

2026-02-26

엔비디아 4Q25 실적발표 : 담백한 실적발표, 핵심은 모두 그린라이트 (바로가기)

2026-01-02

엔비디아가 $20B를 주고 데려온 남자 : Groq 창업자 조나단 로스의 통찰 (바로가기)

광학 (Optics)

2026-05-07

루멘텀 1Q26 실적발표 : 3Q OCS, 4Q CPO, 차례로 점화를 기다리는 고성능 엔진들 (바로가기)

2026-04-30

비아비 솔루션스 1Q26 실적발표 : 본격 개화하는 빛의 시대, 물만난 테스트 수요 (바로가기)

2026-04-17

4
기존 훈련 수요와 설계 출발점

'빛💡'의 시대 : 광학 밸류체인 한 눈에 보기 (바로가기)

2026-03-20

OFC 2026 : 광학이 중요해지고 있는 이유들, 태풍의 눈에 있는 두 가지 기업 분석 (바로가기)

2026-03-13

AI 인프라의 새로운 병목 '광학' : 앞으로의 2~3년 가파른 채택곡선 (트랜시버, OCS, CPO) (바로가기)

메모리 (Memory)

2026-03-19

마이크론 1Q26 실적발표 : 흔들릴 이유가 없는 어닝서프라이즈, 구조적 성장주로 거듭나기 (바로가기)

2025-01-21

추론의 시대, 핵심이 된 메모리 : 메모리 쇼티지를 떠받치고 있는 힘 (바로가기)

2026-01-07

엔비디아 CES 2026 : Vera Rubin의 시대, ICMS가 불러올 메모리 지각변동 (바로가기)

네오클라우드 (Neocloud)

5
오픈AI 추론 계약의 표면과 이면

2026-05-08

코어위브 1Q26 실적발표 : 적자만 보면 놓치는 코어위브의 진짜 변화 (바로가기)

2026-02-22

네오클라우드 뜯어보기 #2 : 새로운 시대의 AI 계급도, 전력을 돈으로 바꾼 Powered Shell (바로가기)

2026-02-10

네오클라우드 뜯어보기 : GPU 임대의 경제학, 네오클라우드 BIG 4 비교분석 (바로가기)

투자자문 서비스에 따른 투자 시 원금 손실이 발생할 수 있으며, 투자 손익에 대한 책임은 전적으로 고객에게 귀속됩니다. 또한 과거의 투자수익이 미래의 수익률을 보장하지 않습니다.

신규 구독 전에, 아래 투자자문계약 권유문서의 계약 관련 제반 사항을 반드시 읽으시고 충분히 검토하시기 바랍니다.

*투자자문계약 권유문서 : https://naver.me/5ZST47Qf

목차

Cerebras를 둘러싼 배경 : 현 시점에서 세레브라스는 어떻게 봐야 하는가?

6
오픈AI 워런트 조건

웨이퍼를 칩으로 만들다 : WSE는 큰 GPU가 아니다, 훈련 전략 실패, FP16, MoE... 가능성

재무상태 체크 : Other Income 착시효과일뿐 여전히 적자성장주이다

체크리스트 : 앞으로 '진짜'가 되기 위해서 확인해야 할 것들

투자의 생각 : 세레브라스(CBRS)

Cerebras를 둘러싼 배경

현 시점에서 세레브라스는 어떻게 봐야 하는가?

세레브라스, 원래는 훈련 워크로드 시장을 목표로 했었다

세레브라스는 CY25 연간 매출의 86%가 UAE의 G42와 MBZUAI(Mohamed bin Zayed University of Artificial Intelligence, 아부다비의 AI 대학교)에서 나왔으며, 이 수요 대부분이 훈련 수요였습니다. 뒤에 조금 더 자세한 파트에서 설명드리겠지만 세레브라스는 훈련용 워크로드를 타겟으로 했기에 ⓐ그래서 FP16 중심으로 설계했고(추론에서는 FP8, FP4 사용), ⓑ그래서 Unstructured Sparsity라는 고유의 아키텍처를 강조했었으며(훈련부터 해당 구조로 해야 추론도 효율 높아지는 구조), ⓒ그래서 off-wafer I/O를 신경쓰기 보다는 SwarmX와 MemoryX는 AMD의 범용 서버를 연결하는 형태로 적당히만 설계했습니다.

7
워런트와 RPO를 보는 계산

오픈AI가 찾아오다 : 겉과 속이 다른 계약의 의미

그러다가 오픈AI가 Decode 병목을 풀기 위해 추론용 하드웨어로 세레브라스를 택하며 많은 것들이 바뀌었습니다. 추론만을 위해서 체결한 계약이기 때문입니다. 이제 세레브라스 하드웨어가 추론에 쓰이기 시작했다는 의미입니다. 오픈AI 딜은 겉과 속의 의미를 구분해서 볼 수 있습니다.

겉으로는 Agentic AI 워크로드를 다루면서 Prefill은 AWS Trainium에서 연산하고 Decode는 WSE-3에서 연산하여 Agentic AI 워크로드에 대응하기 위함입니다. (당장은 AWS가 계약을 확정짓지 않았기에 세레브라스 자체 클라우드에서 서빙 예정) 속으로는 세레브라스에 상당한 규모의 워런트를 받아 안그래도 GPM 45%인 칩을 사실상 무료에 가깝게 이용하고, 세레브라스는 대신 오픈AI를 통해서 성장 가시성을 확보함과 동시에 기업가치를 띄우기 위함입니다.

8
AWS 약정과 워런트 구조

오픈AI는 Class N 비의결권 주식 33,445,026주를 주당 $0.00001에 행사할 수 있습니다

세레브라스가 오픈AI로부터 운전자본 대출을 수령할 경우 → 4,459,337주 (13.33% / 세레브라스 시총의 2.0%)

세레브라스 시총 $40B 초과(30-day VWAP) 또는 특정 수수료 지급 조건 충족 시 → 5,574,171주 (16.67% / 2.5%)

기존 계약 컴퓨팅 750MW에 더해, 2030년 내로 1,250MW를 구매 시 → 23,411,518주 (70.00% / 10.5%)

5월 11일 기준 공모가는 $150~$160인데, 만약 세레브라스 주가가 $300이 된다고 하면 오픈AI는 총 $10B 가량을 받아가는 셈입니다. 세레브라스가 인식한 오픈AI의 RPO가 $24.6B이고, GPM이 45%입니다. 세레브라스가 오픈AI로부터 받는 이익금은 11.07B인데 $10B 가량을 주는 것이므로 세레브라스는 사실상 무료로 오픈AI에게 컴퓨팅을 파는 것입니다.

9
저지연 추론을 찾는 배경

물론 정확히 말하자면 AMD 딜과 비슷하게 세레브라스 '주주들의 돈'으로 지급하는 것이긴 합니다.

AWS는 세레브라스 HW를 AWS 데이터센터에 배치해서 Amazon Bedrock에서 서비스하는 조건으로 약정을 맺었습니다. AWS도 Class N 비의결권 주식 2,696,678주를 받지만 문제는 주당 $100에 살 수 있는 워런트입니다. 오픈AI처럼 공짜가 아니고 AWS가 행사하려면 약 $270M 정도를 납입해야 합니다. 물론 AWS도 만약 세레브라스 주가가 $300이 된다고 치면 약 $540M정도의 이익을 얻습니다. 아마존의 I/S에 비하면 아주 작아서 큰 의미는 없긴 합니다.

WSE가 진짜 강한 영역 : low-batch decode 워크로드

그래도 어쨌든 많고 많은 칩 중에서 세레브라스의 WSE가 꼽힌 이유는 있습니다.

세레브라스가 오픈AI 게약, AWS 논의로까지 이어질 수 있었던 이유는 이것이 앞으로 본격 개화할 Agentic AI 시대에 LLM 추론에서 가장 까다로운 병목 중 하나인 Decode-heavy 워크로드를 전용 하드웨어로 풀어보려는 시도이기 때문입니다.

10
속도와 수익화의 관계

비슷한 관점에서 엔비디아가 기술 라이선스와 핵심 인재 영입을 통해 흡수한 Groq의 LPU 역시 같은 문제의식 위에 놓여 있습니다.

이전에 <추론의 시대, 핵심이 된 메모리 : 메모리 쇼티지를 떠받치고 있는 힘>에서 전해드렸듯, Transformer 아키텍처 특성상 기본적인 연산 과정은 모델들마다 거의 똑같습니다.

LLM 추론은 크게 두 가지로 나뉩니다:

Prefill : 한 번에 대량의 텍스트를 병렬로 처리하므로 막대한 연산 능력(Compute-bound)이 필요합니다.

Decode : Decode는 토큰을 하나씩 만들 때마다 모델의 가중치아 KV Cache를 반복적으로 읽어야 합니다. 연산량 자체는 적지만 앞선 결과를 기다려야 하는 순차적 작업(Autoregressive)이므로 batch size를 키우더라도 어쨌든 순차적인 작업이므로 Prefill에 비해서 병목이 발생할 수밖에 없고, 토큰을 만들 때마다 데이터를 필요로 하니 메모리에서 데이터를 얼마나 빨리 가져오느냐(Memory-bound)가 관건입니다.

11
기존 속도 경제성의 한계

속도가 사용자 경험의 질을 결정한다

AI 서비스에서 속도는 이제 단순한 기술 지표가 아닙니다. 사용자 경험의 질을 결정하는 핵심 변수이자, 토큰당 매출총이익을 높이는 데 기여하는 수익화 변수가 되고 있습니다.

원래도 속도는 사용자 경험에서 중요한 차이를 만들었습니다. 사용자가 프롬프트를 입력한 뒤 결과가 얼마나 빠르게 돌아오는지가 곧 체감 품질을 결정하기 때문입니다. 같은 수준의 지능을 가진 모델이라도 응답이 느리면 사용자는 답답함을 느낍니다. 반대로 즉각적으로 반응하는 모델은 실제 성능 이상으로 더 똑똑하고, 더 안정적이며, 더 신뢰할 수 있는 서비스처럼 인식됩니다.

다만 과거에는 이러한 속도의 경제성이 제한적이었습니다. 응답 속도를 높이기 위해서는 더 많은 컴퓨팅 자원을 투입해야 했고, 그만큼 비용은 크게 올라갔습니다. 그런데 수익화 모델은 대부분 ChatGPT 구독료나 무료 사용자 기반 확대에 머물러 있었습니다.

12
B2B 고부가 서비스의 변화

즉, 더 빠른 토큰을 제공하더라도 그 비용에 상응하는 매출과 이익을 충분히 회수하기 어려웠습니다.

그래서 이전까지 속도는 '좋으면 좋은' 기능에 가까웠습니다. 사용자 경험을 개선하는 요소이긴 했지만, LLM 기업들이 사용자당 토큰을 훨씬 더 빠르게 제공해야 할 만큼 강한 경제적 유인은 부족했습니다.

고지능/고마진 서비스일수록, 속도는 생산성의 차이가 된다

하지만 Agentic AI와 B2B 워크로드가 커지면서 상황이 달라지고 있습니다. LLM 서비스의 수익성은 워크로드별로 크게 다릅니다. 무료 챗봇, 캐릭터 대화, 롤플레잉처럼 대중 사용자 기반을 넓히기 위한 B2C 서비스는 토큰 사용량은 많지만 토큰당 수익성은 낮은 편입니다.

반면 API, 코딩, 기업용 자동화, 개발자 워크플로우처럼 실제 업무 생산성과 연결되는 B2B 서비스는 토큰당 이익이 훨씬 높습니다. 여기서 속도는 단순한 편의성이 아니라 생산성 그 자체가 됩니다.

13
에이전트 워크로드의 지연시간

코드 생성이 더 빨라지고, 에이전트의 반복 작업이 더 짧아지고, 사용자가 기다리는 시간이 줄어들수록 고객이 체감하는 경제적 가치는 커집니다.

앤스로픽이 빠르게 치고 올라온 이유도 여기에 있습니다. Claude Code와 같은 고부가가치 워크로드에서 강한 사용성을 입증하면서, 단순 트래픽이 아니라 추론 매출총이익률이 더 높은 토큰 수요를 먼저 확보​했습니다. 오픈AI 역시 뒤늦게라도 기업용 API, 코딩, 에이전트 워크플로우에서 점유율을 높이려는 이유가 여기에 있습니다.

결국 LLM 시장의 경쟁은 단순히 누가 더 많은 사용자를 보유했는가에서 누가 더 높은 이익률의 토큰을 더 많이 처리하는가로 이동하고 있습니다. 그리고 이 고마진 토큰 시장에서는 지능만큼이나 속도가 중요합니다.

Agentic AI는 더 많은 토큰뿐 아니라 더 낮은 지연시간을 요구한다

Agentic AI는 단순히 더 많은 토큰을 소비하는 흐름이 아닙니다.

14
저지연 토큰 생성의 의미

더 중요한 변화는 더 낮은 지연시간으로 더 많은 상호작용을 처리해야 한다는 것입니다.

기존 챗봇은 사용자가 질문을 입력하면 모델이 한 번에 긴 답변을 생성하는 구조였습니다. 이 경우 다소 느리더라도 사용자가 감내할 수 있는 여지가 있었습니다. 하지만 Agentic AI는 다릅니다. 코드를 작성하고, 실행하고, 오류를 확인하고, 다시 수정하고, 파일을 읽고, 다음 행동을 결정하는 과정을 반복합니다. 이 과정에서는 매 단계의 지연시간이 누적되어 전체 생산성의 차이로 이어집니다.

따라서 Agentic AI에서는 토큰을 얼마나 빠르고 안정적으로 계속 생성할 수 있는가가 더 중요해집니다. 위에 기본 전해드린 것처럼 Decode 단계에서는 다음 토큰을 하나씩 순차적으로 생성해야 하기 때문에, 낮은 지연시간과 빠른 메모리 접근 능력이 핵심 병목으로 부각됩니다.

이 지점에서 Decode-heavy 워크로드를 잘 처리하는 하드웨어의 가치가 올라갑니다.

15
Rubin·LPX와 경쟁 축

세레브라스의 WSE, Groq식 LPU 아키텍처 통합을 통한 엔비디아의 저지연 추론 강화 전략은 모두 같은 방향에서 이해할 수 있습니다. AI 서비스의 수익성이 높아질수록, 그리고 사용자가 실시간에 가까운 반응을 요구할수록, 저지연 토큰 생성 능력은 단순한 성능 지표가 아니라 수익화의 핵심 축이 됩니다.

정리하면, 과거의 속도는 사용자 경험을 개선하는 요소였습니다. 하지만 Agentic AI 이후의 속도(Tokens per second/User)는 다릅니다. 이제 속도는 사용자 경험, 업무 생산성, 프리미엄 요금제 전환, 기업용 API 사용량, 그리고 AI Labs의 토큰당 매출총이익을 동시에 결정하는 인프라 경쟁력이 되고 있습니다.

물론, 엔비디아는 이미 Rubin-LPX 통합을 통해서 이러한 파레토 프론티어를 드라마틱하게 끌어올릴 준비를 마쳤습니다. 이것이 GTC 2026에서 젠슨 황이 말하고자 했던 것입니다.

16
차트가 보여주는 파레토 변화

*이 차트에서 GB200/300 NVL72까지만 하더라도 Interactivity를 높이는 사용 사례에서 파레토 프론티어가 사실상 0에 가까웠는데, Rubin + LPX 조합을 통해서 이를 매우 크고 넓게 확장한 모습이 핵심입니다.

웨이퍼를 칩으로 만들다

WSE는 큰 GPU가 아니다, 훈련 전략 실패, FP16, MoE... 가능성

Wafer-Scale Engine, "WSE"

세레브라스 기술의 핵심은 WSE입니다. 세레브라스의 전략은 단일 실리콘 웨이퍼에서 레티클의 한계가 있으니 이를 여러 칩으로 분할하지 않고 아예 웨이퍼 전체를 하나의 칩으로 만들자는 것입니다. 가로 12개 x 세로 7개로 총 84개의 compute die가 하나의 WSE를 구성합니다. 실리콘 면적의 50%는 compute core, 나머지 50%는 SRAM에 사용됩니다.

세레브라스의 S-1 파일 내 마케팅 코멘트 자체는 마치 "가장 큰 AI 가속기이니 가장 좋다"고 하고 있지만, 특성 자체가 WSE는 GPU와 다른 구조입니다.

17
WSE의 SRAM 강점과 한계

첫 번째 병목 : 44GB SRAM, SRAM이 가장 귀하다

세레브라스 WSE-3의 강점은 44GB on-wafer SRAM에서 나오는 21PB/s급 메모리 대역폭입니다. 덕분에 모델 가중치와 KV Cache를 토큰당 매우 반복적으로 빠르게 읽어내야 하는 작업에서는 매우 높은 TPS/user를 낼 수 있습니다. 하지만 WSE로 엮은 구조 때문에 속도를 얻은 대신 메모리 용량이 매우 작은 한계가 있습니다. SRAM은 HBM보다 훨씬 덜 조밀하기에 하나의 전체 WSE에서 44GB밖에 담지 못합니다.

WSE-3의 44GB SRAM 용량은 on-chip SRAM을 기준으로 삼자면 매우 크지만(84개 칩당 on-chip SRAM으로 보자면 520MB정도라서 레티클 면적당 SRAM 용량은 LP30과 같습니다), 대신 HBM 기반 가속기들에 비교하면 매우 작습니다. GB300과 TPU v8i도 288GB, Trainium3도 144GB입니다.

18
WSE와 LP30의 비교

Cerebras WSE-3 vs Groq LP30 비교

가격 → WSE-3 $1,000,000 vs LP30 $20,000 (50배 = LP30 50개가 WSE-3 1개랑 같다)

FLOPS → WSE-3 15.6PFLOPS vs LP30 1.2PFLOPS (13배 = LP30이 3.85배 좋다)

SRAM 용량 → WSE-3 44GB vs LP30 0.5GB (88배 = 같은 금액이라면 WSE-3이 1.76배 더 많다)

On-chip 대역폭 → WSE-3 21,000TB/s vs LP30 150TB/s (140배 = WSE-3 2.8배 더 좋다)

Scale-out 대역폭 → WSE-3 1.2Tb/s vs LP30 9.6Tb/s (LP30이 8배 더 넓은 대역폭을 가졌다)

KV Cache가 경제성을 좌우한다

세레브라스의 경제성 및 가치제안을 좌우하는 핵심은 결국 각 WSE가 담당하는 모델 레이어의 가중치와 그 레이어의 KV Cache를 같은 44GB SRAM 안에 넣을 수 있느냐 그렇지 않느냐에 있습니다.

19
KV Cache가 만드는 조건

LLM 추론 시 메모리에 올라가는 것은 모델 가중치만이 아닙니다. 각 사용자 요청마다 생성되는 KV Cache도 함께 메모리에 저장돼야 합니다. 컨텍스트가 길어지거나 동시 요청 수가 늘어날수록 KV Cache는 빠르게 커집니다. 세레브라스 WSE의 장점은 웨이퍼 전체에 깔린 44GB SRAM과 21PB/s급 초고속 내부 메모리 대역폭입니다. 문제는 이 44GB SRAM 안에 각 WSE가 담당하는 모델 레이어의 가중치와 해당 레이어의 KV Cache가 함께 들어가느냐입니다.

이 조건이 충족되면 WSE는 매우 강력합니다. 가중치와 KV Cache가 모두 on-wafer SRAM 안에 있기 때문에 외부 메모리를 거의 기다리지 않고 빠르게 decode를 처리할 수 있습니다.

반대로 KV cache가 SRAM 안에 들어가지 못해 외부 메모리로 나가야 하는 순간, 세레브라스의 가치제안은 크게 약해집니다.

20
off-wafer I/O 병목

WSE도 KV cache를 외부에 저장할 수는 있지만, GPU가 HBM을 decode의 주 메모리처럼 쓰는 것처럼 외부 메모리를 긴밀하게 활용하기는 어렵습니다.

여기서 두 번째 병목이 발생합니다.

두 번째 병목 : off-wafer I/O, 여러 WSE를 연결할 때의 병목

대형 모델은 당연히 WSE의 44GB SRAM 안에 들어가지 않습니다. 그렇다면 여러 WSE를 연결해야 합니다. 여기서 두 번째 병목인 off-wafer I/O가 나타납니다.

WSE 내부 SRAM 대역폭은 21PB/s인데, WSE 바깥으로 나가는 대역폭은 150GB/s 수준입니다. Blackwell NVLink5의 GPU당 900GB/s 대비 6분의 1 수준입니다. 칩 내부는 대역폭이 매우 높은데 칩 바깥으로 나가는 통로는 매우 좁은 상태인 겁니다.

조금 더 구체적으로 예를 들어서, Irrational Analysis 계산으로는 Llama 3.1 70B 기준 KV Cache Streaming을 하려면 WSE당 33.8Tb/s가 필요하다고 봤는데, 실제 WSE-3 I/O는 1.2Tb/s이니 28배 부족합니다.

21
대역폭 부족과 SRAM 확장 난점

GPT-oss-120B도 48.4Tb/s가 필요하니 실제 I/O 대비 40배 부족하기 때문입니다.

그렇다면 on-chip SRAM 규모를 키우면 되는 게 아닌가 싶으실 수 있는데,

SRAM 메모리 용량을 늘릴 수 없다

생산 구조상 SRAM은 전공정의 영향을 받습니다. WSE-1는 TSMC 16nm에서 18GB SRAM을 탑재했었고 → WSE-2는 7nm에서 40GB로 늘렸으며 → WSE-3에서는 5nm에서 44GB를 탑재하게 생산했습니다. 그런데 현재 WSE-3를 제조하는 5nm 이하로 간다고 해도 칩/웨이퍼당 SRAM을 더 이상 거의 키울 수 없습니다.

칩은 메모리를 다른 die나 패키징에서 보완할 수 있기에 상대적으로 스케일링이 자유로운데, 웨이퍼 구조는 현 상태로는 SRAM 용량을 늘리려면 compute core를 줄여서 SRAM 할당비중을 키우는 정도로만 대응이 가능합니다.

22
구조적 SRAM 한계와 장기 해법

SRAM 스케일링의 정체가 구조적인 문제입니다.

이에 장기적인 해법은 두 가지입니다: 하나는 하이브리드 본딩을 사용하여 지금 WSE에 붙여서 추가 SRAM 타일을 추가하거나(엔비디아가 Groq LP40 로드맵에 기재한 방식), 다른 하나는 WSE도 웨이퍼 간 접합을 통해서 메모리 용량을 추가하는 방법입니다. 그렇게 할 수는 있겠는데 문제는 세레브라스가 그러한 열역학/기계적인 어려움을 공급망을 관리해가며 극복하여 엔비디아와 비슷한 타이밍에 제품을 출시할 수 있겠냐는 것이 남습니다. 칩에서 하고 있는 것보다도 훨씬 더 어려운 패키징 혁신을 필요로 하는데 엔비디아, 구글, AWS 같은 플레이어들과 비슷한 타이밍에 제품화할 수 있겠느냐입니다.

다시 돌아와서, 그럼 얼마정도의 파라미터를 가진 모델이면 세레브라스 WSE가 가진 장점은 살릴 수 있겠느냐가 중요한 포인트입니다.

23
파이프라인 병렬화의 남은 제약

물론 구체적으로 들어가면. tensor 병렬은 못쓰더라도 pipeline 병렬화는 가능하기에 activation을 옮기면 off-wafer i/o에 구애받지 않기에 쓸만해진다 등 설명이 추가되겠지만 이렇게 하더라도 어쨌든 KV Cache를 외부로 뺄 수가 없기 때문에 컨텍스트 윈도우를 길게 쓸 수가 없는 만큼 모델 가중치와 KV Cache를 한 번에 실을 수 있는 WSE의 메모리 용량 자체가 부족한 게 문제입니다.

결과적으로는 돌고 돌아서 세레브라스 하드웨어로 서비스하기에 매력적이려면 WSE에 얹어서 서비스할 모델 그 자체가 꽤나 작아야합니다. 따로 몇 개 모델들을 살펴보고 있었는데 마침 SemiAnalysis 자료가 올라와서 세레브라스가 서비스한 모델들 리스트를 한 눈에 쭉 살펴볼 수 있었습니다.

얼마의 크기인 모델은 경제성이 있나?

24
경제성이 가능한 모델 크기

"120B 파라미터 이하"

간단하게 결론만 정리하자면, 대략 파라미터가 120B 이상인 모델(MoE로 Active Parameter를 말하는 것이 아니라 Total Parameter 기준이라 정말 작습니다)이면 경제성이 크게 떨어집니다. 그 이상을 서비스할 수도 있겠지만 아직 압축 및 동시에 다양한 사용자의 요청을 처리하는 세레브라스의 기술력이 호응하고 있지 못하기에 Qwen 3 235B(Total 235B, Active 22B), GLM 4.7(Total 355B, Active 32B)는 Preview로만 제공 중입니다.

오픈AI가 2월 12일에 공개한 GPT-5.3-Codex-Spark Preview 버전은 GPT-oss 120B 모델을 코딩용으로 사후훈련하여 만든 모델입니다. 이름만 비슷할뿐 GPT-5.3-Codex와 전혀 다르고 10배 이상의 작은 크기의 모델입니다.

25
대형 모델 수요와의 거리

문제는 현재 많이 사용되는 Claude Sonnet 4.7의 파라미터가 1T, Claude Opus 4.7의 경우 5T(일론 머스크 주장)입니다. GPT-5.5-Codex도 대략 1~1.5T 정도의 모델일 것으로 예상합니다. 지금 많이 쓰고 있는 모델을 갖고 세레브라스 칩으로 서빙하면 경제성이 안 맞는다는 의미입니다.

생각해보자면 최고의 지능을 가진 모델을 빠르게 실행하고자 하는 것이 메인 수요처이지(이것을 Rubin + LPX가 가능케 할 것), 지능이 상대적으로 뒤처지는 모델을 빠르게 실행하고자 하는 수요(AWS Trainium + Cerebras WSE-3로 만들려고 하는 것, 다만 이건 AWS가 옵션느낌으로 해보는 것이지 아직 메인 프로젝트는 아닌 것 같네요)는 매우 작기에 세레브라스의 칩을 기반으로 얼마나 많은 모델이 경쟁력 있게 실행될 수 있을지는 의문이 있습니다.

26
FP16 중심 설계의 제약

거대모델 추론에는 아쉬운 WSE #1 : FP16 중심

일반적으로 추론에서 WSE가 매우 작은 시장에만 유효할 거라고 보게 하는 몇 가지 한계점들이 있습니다. 쭉 살펴보다보면, 대표적인 게 두 가지 있습니다. ⓐ저정밀 포맷이 제한적이라는 점, ⓑMoE 추론의 이점을 거의 살릴 수 없을 것이라는 점입니다.

첫 번째 약점은 FP16까지만 지원한다는 점입니다. 저정밀 포맷을 지원하지 않습니다. 훈련에서는 FP16이 자연스러운데 추론에서는 상당히 아쉬운 설계입니다.

초점을 잃지 않기 위해서 쭉 다시 정리하자면, 세레브라스의 강점은 44GB on-wafer SRAM과 21PB/s급 메모리 대역폭이고, 모델 가중치와 KV Cache를 SRAM 위에 올릴 수 있다면 decode 단계에서 압도적인 속도의 토큰 생성이 가능합니다. 여기서 44GB SRAM이 매우 귀한 자원이라는 게 문제입니다.

27
정밀도와 KV Cache의 비용

추론 시에는 KV Cache도 메모리에 올려야 하기 때문입니다. GPU는 그래서 KV Cache offloading을 하여 대응 중인데, WSE는 off-wafer I/O가 낮으니 칩 외부로 KV Cache를 옮기려면 병목이 너무 큽니다.

이런 구조에서는 FP16/BF16 중심 설계는 비용이자 성능 문제입니다. 거대모델 추론에는 최소 FP8, 요즘은 FP4로 서빙하고 있습니다. 같은 모델이라도 FP16로 저장하면 FP8 대비 2배, FP4 대비로는 4배의 메모리를 먹습니다. WSE처럼 SRAM 용량이 제한적인 상태라면 이 차이가 곧 하나의 모델을 서빙하기 위해서 필요한 WSE의 수, 시스템 비용, 지연시간을 결정합니다.

예를 들어서, GPT-oss 120B 모델을 서비스한다면 모델 가중치로만 233.6GB를 필요로 하고 총 SRAM 필요량은 557.6GB입니다.

28
120B 모델의 WSE 수 계산

WSE가 13개 필요합니다. FP8로 서비스할 경우 가중치는 120GB, 총 SRAM 필요량은 295GB이므로 WSE는 7개면 됩니다. 같은 모델을 몇 개의 WSE로 서빙할 수 있느냐를 결정하는 요소입니다. 더 많은 WSE로 서빙하려면? 다시금 off-wafer I/O가 아쉬운 게 부각됩니다.

엔비디아의 Blackwell이 FP4를 하드웨어상에서 Native로 지원하는 최초의 칩이 되게 만들었던 것도 이렇게 추론의 경제성을 크게 끌어올리기 위함이었는데, 세레브라스는 이 분야에서 꽤나 뒤처져 있다는 의미입니다.

거대모델 추론에는 아쉬운 WSE #2 : MoE 모델의 효율성을 누리기 어렵다

WSE는 MoE가 주는 핵심 이점을 GPU-HBM 구조처럼 누리기 어렵습니다. MoE의 장점은 전체 파라미터 중에서 토큰당 일부 expert만 활성화해서 토큰당 유효 컴퓨팅 규모를 크게 낮출 수 있는 데 있습니다.

29
MoE의 활성 파라미터와 전체 탑재

얼마 전의 4월 27일 주간전략보고에서 Technical Report를 해석해드린 DeepSeek-V4-Pro를 예로 들자면 전체 파라미터는 1.6T인데 추론 시 활성화되는 파라미터(Active Parameter)는 49B입니다.

문제는 한 번 요청할 때야 일부만 활성화하여 연산량을 줄일 수 있지만, 시스템에는 전체 파라미터를 칩 위에 올려놔야 한다는 데 있습니다. WSE가 빠르려면 SRAM 안에 가중치와 KV Cache를 같이 담아두고(전체 모델을 담진 못하니 같은 Layer를 담아두는 구조) WSE 바깥으로 데이터를 내보내는 것은 최소화해야 합니다. 그런데 전체를 얹으려면 결국 또 여러 WSE를 오가게끔 해야 하기에 MoE의 이점을 누리지 못합니다.

재무상태 체크

Other Income 착시효과일뿐 여전히 적자성장주이다

30
기회와 경제성에 대한 중간 결론

Cerebras, 재무상태 체크에 앞서...

위의 내용을 정리하면 왜 지금 세레브라스가 주목받는가에 대한 내용입니다.

오픈AI 덕에 새로운 기회를 얻게 됐고, 그 기회는 Agentic AI 워크로드 수요가 크게 증가함에 따라서 이를 해결해줄 수 있는 칩으로 오픈AI가 세레브라스의 칩을 써보고자 하기 때문입니다.

다만, 경제성이 나오는 워크로드는 매우 제한적일 것으로 예상합니다. GPT-5.3-Codex-Spark도 아예 batch size 1에 특화시켜서 한 사람만을 위한 HW로 판매하는 것을 기준으로 잡고 있습니다. 클라우드에서 굴리기엔 경제성이 얼마나 나올지 혹은 매우 작은 모델을 서빙해야 하기에 지능격차가 유의미할 것이라 이것을 어떻게 극복할지 등등을 중요하게 봐야 합니다.

세레브라스, 매출 : $510M, 전사 매출성장률 YoY 76%

31
매출 성장과 구성

세레브라스의 매출은 CY24 $290M → CY25 $510M로 YoY 76% 성장했습니다. CY25 기준으로 구분해보자면 Hardware가 $358.4M로 매출비중 70%, Cloud and other services $151.6M로 비중 30%입니다.

매출구성 #1 하드웨어 (Hardware)

세레브라스의 하드웨어 매출은 고객이 자기 데이터센터에 설치해서 쓰는 AI 시스템 판매 매출입니다. CS-3, WSE, 관련 장비 판매 매출이 잡힙니다. 고객이 구매하면 인도 시점에 크게 인식되는 성격입니다. 매출원가는 웨이퍼, 패키징, 조립, 물류, 테스트, 재고비용, 관련 인력 및 시설비가 들어갑니다. 반도체 기업으로서의 세레브라스를 살펴볼 때 가장 중요한 부분입니다.

매출구성 #2 클라우드와 기타 서비스 (Cloud and other services)

32
클라우드 사업의 역할

세레브라스가 직접 또는 파트너 채널을 통해 제공하는 AI 컴퓨팅 사용료와 서비스성 매출입니다. 2024년 8월에 출시한 세레브라스 클라우드(Cerebras Cloud)가 핵심입니다. 세레브라스가 직접 운영하는 것이기 때문에 데이터센터 비용, 장비 감가상각, 클라우드 운영 인력, 시설비 등이 듭니다. 일종의 네오클라우드입니다.

목적은 하드웨어로 판매할 때는 고객이 시스템을 직접 사서 개발자들을 두고 운영도 직접해야 하는 만큼, 고객 입장에서 사실 허들이 높고 채택이 더뎠기에 WSE를 API/클라우드 방식으로 사용할 수 있게 만든 것입니다. 고객 입장에서는 초기 CapEx 부담이 줄어드는 효과이기도 하고, 각종 클라우드나 파트너 채널을 통해서 세레브라스 하드웨어를 깔아두고 서빙했기에 접근성을 넓히는 만큼 더 넓은 고객군에 접근할 수 있었습니다.

33
전용 용량과 사용량 기반 구매

고객은 세레브라스 클라우드 용량을 두 가지 방식으로 구매할 수 있습니다:

하나는 장기 약정인 Dedicated Capacity입니다. 고객이 일정 기간 특정 컴퓨팅 용량을 전용으로 사용하는 방식입니다. 흔히 보이는 장기계약입니다.

다른 하나는 On-demand입니다. 필요할 때마다 사용량 기반으로 사용하는 것입니다. 세레브라스에서 직접 구매할 수도 있고, 각종 클라우드 파트너 채널 통해서도 접근 가능합니다.

세레브라스, 마진 : GPM 39%

세레브라스의 전사 GPM은 CY24 42.3% → CY25 39.0%로 약간 감소했습니다. 사업부가 하드웨어와 클라우드 두 가지로 나뉘는 만큼 각각의 GPM도 다른데, 하드웨어가 CY24 35.2% → CY25 42.9%로 마진이 소폭 상승했고 클라우드는 CY24 61.4% → CY25 29.9%로 마진이 크게 하락한 것이 특징입니다.

34
사업부별 마진 변화

하드웨어 : 세레브라스 하드웨어의 매출원가를 설명드린 것에서부터 생각해보면, 생산량을 늘리고 제조 공정을 안정화시키면 시스템당 원가가 낮아지는 효과로 이어집니다. 초기 생산 단계에서는 수율, 조립, 테스트, 공급망 부담 비용이 컸겠지만 생산량이 늘어남에 따라 칩당 단가는 낮아지는 효과로 나왔습니다. 또한 CY24 하드웨어 마진은 UAE의 G42향으로 시스템을 판매할 때 가격할인을 해줬던 영향도 있습니다.

클라우드 : 클라우드 사업자로서 초기비용이 많이 드는 길을 택했습니다. 추론 용량을 제공하려면 세레브라스가 데이터센터 공간, 전력, 네트워크, 서버/시스템, 운영인력, 장비 감가상각을 부담해야 합니다. 이제 막 추론 서비스 용량을 늘려가던 때라서 CY25는 클라우드 및 기타 서비스의 매출도 늘었지만 각종 비용이 먼저 더 크게 늘면서 마진이 눌렸던 해입니다.

35
회계상 순이익의 성격

흑자인가? 적자인가? → 적자기업

세레브라스의 I/S를 슥 훑어보다가 흑자기업인가 싶었는데, 자세히 살펴보다보니 CY25에 순이익이 남았던 이유는 영업외이익이 $391M 가량 잡혔기 때문입니다. 회계상으로만 잡힌 이익입니다.

이 회계상 이익은 어디서 왔는가?

세레브라스는 2024년에도 한 번 S-1을 올린 적 있습니다. 당시 2024년 IPO를 준비하던 시점에 세레브라스는 G42와 단순한 고객 계약만 맺은 것이 아니었습니다. G42는 세레브라스의 핵심 고객이면서 동시에 잠재적 대주주가 될 수 있는 구조였습니다.

구체적으로 보자면, G42는 세레브라스의 칩을 꽤 많이 할인받아 상당량 구매하면서 동시에 세레브라스의 비의결권 Series F-2 우선주 22,851,296주를 주당 $14.66에 매입하기로 했었습니다.

36
G42 계약과 주식 약정

총 매입금액은 $335M이었습니다. 이 매입이 IPO 이후에 이뤄지면 비의결권 Class N 보통주를 받는 구조였습니다. Class N은 아예 이렇게 세레브라스가 '우리 이렇게 잘나간다' 하며 펌핑 후 파트너사에게 주기 위한 용도의 주식으로 의결권은 없지만, 보유자가 원하면 Class A common stock으로 1:1 전환할 수 있는 주식입니다.

간단하게 보자면, 세레브라스가 당시 G42에게 "우리 칩과 시스템을 대규모로 사주는 전략 고객이 되어주면, 당신에게도 IPO 이후 주가 상승에 참여할 수 있는 권리를 주겠다"고 말한 것과 같습니다. 심지어는 G42가 직접 혹은 G42가 지정한 제3자가 일정규모 이상의 세레브라스 클러스터를 구매할 경우 G42가 추가로 주식을 더 살 수 있는 옵션도 부여되는 구조였습니다.

37
선도계약부채 재평가

*사실 생각해보면, 지금 오픈AI를 통해서 하려는 것과 비슷합니다.

중요한 건 이 주식매입 약정이 세레브라스 입장에서는 미래에 정해진 가격으로 주식을 발행해야 하는 계약이었고, 이것이 선도계약부채(forward contract liability)로 잡혔었습니다.

CY24에는 영업외이익이 -$378M으로 잡히며 순손실을 키웠던 요인이고, 같은 계정이 CY25에는 반대가 되면서 영업외이익으로 잡혔습니다. 해당 부채가 재평가 및 소멸되면서 비현금성 영업외이익을 회계상 인식한 것입니다. 본업의 수익성을 보여주는 게 아니므로 꼭 감안하셔야 할 부분입니다.

대략의 미래 매출 추정

세레브라스는 자신의 Cerebras Cloud를 통해서 Powered Shell을 구축하고 오픈AI에게 서비스할 예정이며 CY26~CY28에 걸쳐서 750MW의 추론 용량을 구매하고, 향후 1.25GW 옵션도 있으니 전체 규모는 2GW까지 열려있습니다.

38
가정에 따른 미래 매출 추정

그럼 세레브라스가 앞으로 얼마나 벌 수 있을까를 가정하려면, 오픈AI가 2GW를 모두 온라인한다고 가정할 시 오픈AI에게서 기대하는 매출만 감안할 경우 CY26 $0.9B(서비스 용량 250MW) → CY27 $2.5B(서비스 용량 500MW) → CY28 $3.4B(서비스 용량 750MW)입니다.

전사 GPM이 40%인데 워런트로 주주가치 희석 등을 고려하면 사실 실질 마진율은 더 낮습니다. 어쨌든 CY27부터 순이익이 나온다고 보고 GPM 40%, NPM 15%를 가정하고 놓고 보더라도 순이익은 CY27 $375M → CY28 $510M입니다. 오늘 올린 IPO 가격 $185를 기준으로 보자면 완전 희석가치 기준 기업가치가 $56B이므로 CY27 순익 대비 149배 → CY28 110배입니다.

39
밸류 계산과 기술증명 단계

밸류가 상당히 높은 상태이긴 합니다.

물론, AWS도 계약하면서 매출 추정이 달라질 경우 이익 추정이 바뀌니 밸류 기준은 크게 달라집니다. 그래서 사실 추정의 큰 의미는 없는 단계입니다. 이익추정이 잘 맞으려면 이익증명 단계일 때가 효과적인데, 지금은 개인적으로 생각하는 기업의 사이클 ⓐ개념증명 → ⓑ기술증명 → ⓒ매출증명 → ⓓ이익증명 중에서 거의 ⓑ인 기술증명을 해가는 단계로 보고 있습니다. 지금 매출이 나오는 기업이니 ⓒ라고 볼 수도 있겠지만, Organic Sales가 아니기도 하고 decode-heavy 워크로드에 잘 먹힐지 아닐지가 TAM에 매우 지대한 영향을 줄 것이기에 ⓑ Phase로 보고 있습니다.

*지난주 월요일에 S-1 파일을 제출할 당시에는 주당 $115~$125정도에 2,800만 주를 매각할 계획이었습니다 → 그러다가 이번 주 월요일에는 이를 주당 $150~$160에 3,000만 주를 매각하는 것으로 규모를 키웠고 → 오늘은 주당 $185에 3,000만 주를 매각할 예정입니다.

40
IPO 가격·공모 규모 변화

총 자금조달 규모는 $5.55B이며 주당 $185에 상장된다고 하면 RSU, 스톡옵션, 워런트를 모두 포함하여 완전희석가치 기준 $56B 밸류(대략 3.05억 주)입니다.

체크리스트

앞으로 '진짜'가 되기 위해서 확인해야 할 것들

가장 중요한 건, 결국 진짜 쓸만할 것인가

우선, 위에 전해드린 WSE를 추론에 쓰는 구조가 어느 정도로 매력적인지가 중요합니다.

세레브라스는 언제든 칩을 사실상 무료로 줄 준비가 되어 있기 때문에 오픈AI, AWS 등이 이를 ML/System co-design 해보면서 최대의 성능을 끌어올릴 수 있는 워크로드는 찾겠지만 그 시장규모가 어느 만큼 될 것인가는 알 수 없습니다. 세레브라스 팀보다 더 훌륭한 SRAM 솔루션을 갖고 있던 Groq 팀을 엔비디아가 인수하여 Rubin과 내재화 중이기에, 엔비디아의 LPX 솔루션이 얼마나 매력적인가가 결국 오픈AI와 AWS가 수고로움을 감안하면서까지 co-design에 뛰어들게 할 것인가를 결정할 것입니다.

41
사용성·TCO 경쟁의 확인점

이런식으로 써보려고 했다가 잘 안 된 케이스가 MI300~350였습니다. 모델과 워크로드는 바뀌더라도 TCO 대비 퍼포먼스라는 축에서의 경쟁은 모든 플레이어들에게 동일하게 적용됩니다. 가장 혁신을 많이 하는 플레이어가 살아남을 뿐입니다.

그리고 세레브라스가 앞으로 나아가는 과정에서 중요한 것들이 있습니다.

첫 번쨰, 문제는 세레브라스가 확보한 Powered Shell의 규모

세레브라스는 올해까지 250MW → CY27에 추가로 250MW(누적 500MW) → CY28에도 추가 250MW(누적 750MW)를 서비스하기 위해서 Powered Shell을 확보해야 합니다. 그러나 문제는 SemiAnalysis 추정에 따르면 세레브라스는 2026년 4월 기준 CY27까지 온라인될 Powered Shell을 180MW정도 확보했습니다.

42
Powered Shell 확보 과제

CY26 말까지 온라인될 규모는 43MW 정도 확보한 상태이고, AWS에 배포된 용량도 일부 있긴 하지만 10MW를 넘지 않을 것이므로 실제로 서비스할 수 있는 용량을 제때 확보할 수 있겠냐가 남습니다.

두 번쨰, AWS Trainium + WSE의 분산 구조가 잘 작동하는가?

AWS와 맺은 계약은 오픈AI처럼 나름 확정된 계약이 아니라 텀시트(Term sheet, 예비 합의서)입니다. 아마존은 세레브라스를 운영해보면서 Prefill에 AWS Trainium를 사용하고, Decode에 WSE-3를 사용해가면서 Agentic AI용 워크로드를 수행하기에 충분히 매력적인 칩인지를 검증할 것입니다.

43
AWS 텀시트의 검증 과제

이걸 해보고 실제 계약으로 넘어갈 것으로 예상합니다. AWS 입장에서는 일단 뭔가와 TCO 대비 퍼포먼스를 비교를 하려고 해도 기준이 있어야 하니 기준은 엔비디아의 Vera Rubin + LPX 조합이 될 것입니다.

투자의 생각 : 세레브라스(CBRS)

세레브라스(CBRS), 완전희석시총 기준 CY27 순이익 대비 149배 : IPO 기업을 다루는 것이다보니 투자의견은 없습니다. 원래는 가볍게 "이런 기업 IPO합니다"라고 전해드리려 시작한 분석자료인데, 엔비디아의 경쟁자로 볼 수 있는 시나리오가 있나 없나를 살펴보느라고 생각보다 진해졌습니다.

44
최종 투자 판단과 유보

오픈AI와 AWS가 써보면서 실제로 WSE-3의 한계인 44GB SRAM 용량과 off-wafer I/O를 극복할 수 있을 것인가가 중요합니다. 어느 만큼 쓸만한가에 따라서 매출 추정이 달라질 경우 이익 추정이 바뀌니 밸류 기준은 크게 달라집니다. 그래서 사실 추정의 큰 의미는 없는 단계입니다. 이익추정이 잘 맞으려면 이익증명 단계일 때가 효과적인데, 지금은 개인적으로 생각하는 기업의 사이클 ⓐ개념증명 → ⓑ기술증명 → ⓒ매출증명 → ⓓ이익증명 중에서 거의 ⓑ인 기술증명을 해가는 단계로 보고 있습니다. 지금 매출이 나오는 기업이니 ⓒ라고 볼 수도 있겠지만, Organic Sales가 아니기도 하고 decode-heavy 워크로드에 잘 먹힐지 아닐지가 TAM에 매우 지대한 영향을 줄 것이기에 ⓑ Phase로 보고 있습니다.

45

적자기업이고, 기술적으로 사실 한계가 많으며, 새로 생기는 시장에서 엔비디아의 점유율을 크게 해칠 기술력을 갖고 있다고 보지 않습니다. 물론 시총이 작으니 투기적으로 움직일 수는 있겠고, 기술이라는 게 어떻게 적용하느냐에 따라 새로운 사용 사례를 만들 수도 있는 것(아마 음성모델에는 잘 맞을 겁니다)이긴 합니다만, 밸류를 감안하면 그닥 매력적이게 느껴지진 않았습니다.

5

그럼에도 빠진내용 정리

잡담·곁다리 내용
  • 수치·계산은 원문이 제시한 전제와 조건을 유지했다.
생략 기록
  • 원문에 없는 외부 기술 검증, 후속 실적, 주가 정보는 추가하지 않았다.
  • 앞부분의 연관 콘텐츠 링크와 투자자문 고지는 flow에 보존했으며 별도 분석 단위로 확대하지 않았다.

그럼에도 빠진내용 정리

원문 외 자료
외부 자료나 후속 정보는 추가하지 않았다.
반복 고지와 연관 링크
원문 앞부분의 연관 자료 목록·투자자문 고지와 URL은 flow에 보존했다.
계산과 전망의 성격
매출·이익·밸류 수치는 원문이 명시한 가정에 따른 추정이며 확정 사실로 바꾸지 않았다.
원문 확인

document_work_runner prepare가 입력 원문을 수정 없이 보존했다.