Gemini 3.5 Flash 공개
작성자의 핵심 판단
성능은 높아졌지만 가격과 토큰당 지능 압축비를 함께 보면 Gemini 3.5 Flash의 실질 가격 경쟁력은 기대보다 아쉽다고 평가한다.
근거 보기 2
- 원문 구간 1
Gemini 3.5 Flash를 공개했습니다. 모델의 지능 자체는 꽤나 좋아졌습니다. 비교하자면 구글이 2월 19일에 출시됐던 Gemini 3.1 Pro와 비슷한데 문제는 가격이 Flash 가격이 아닙니다. 두 가지 의미에서 가격 경쟁력이 낮다고 판단합니다. (ㄱ) 3.5 Flash(output token 1M당 $9.0)는 2025년 2월에 나온 2.0 Flash에 비해선 22.5배($0.40), 2025년 12월에 출시된 3.0 Flash에 비해서는 3배 비싸졌습니다($3.0). 명목상으로 보기에도 Flash치고는 비쌉니다. 오히려 Gemini 3.1 Pro와 비슷합니다($12.0). (ㄴ) 더 중요한 건 GPT-5.5 같은 경우는 파라미터가 2T에 달하는 거대모델이다보니 토큰당 지능 압축비가 굉장히 좋습니다. 근데 Flash는 소형모델이다보니 토큰당 지능 압축비가 상대적으로 낮기 때문에 같은 결과물을 내려면 훨씬 더 많은 토큰을 소비해야 합니다. (ㄱ) + (ㄴ)의 조합 때문에 실질 task output 기준으로 가격을 책정하면 이번 Gemini 3.5 Flash가 Gemini 3.1 Pro보다 비쌉니다.
- 원문 구간 2
Gemini 3.1 Pro가 GPT-5.5, Opus 4.7보다 뒤처졌음을 생각해보면 기대보다는 아쉽습니다. Gemini 3.5 Flash는 소형모델인 만큼 초당 토큰 출력량이 굉장히 많음을 장점으로 내세우고 있습니다. 다만, 고부가가치 사용 사례에서는 이미 task output을 가지고 평가하는 게 일반화되어 있다보니 B2B/코딩/Agentic AI로 얼마나 침투할지 잘 모르겠습니다. 요구 지능수준이 낮은 각종 챗봇 사용 사례에는 중국 open weights 모델 중에서 Kimi K2.6정도, 미국에서는 성능은 조금 더 낮지만 어차피 저부가가치 사용 사례이므로 gpt-oss-120B, Nemotron-3 Super를 쓰는 게 기업 입장에서는 더 저렴할 것이라고 보입니다. 마찬가지로 워낙 일단 나온지 초기니 조금 더 반응을 봐야겠지만 좀 아쉬운 지표들입니다. 성능 자체는 끌어올린 건데 토큰당 지능 압축비가 높지 않은 게 이슈입니다. GB200 NVL72로 훈련한 Kimi K2.6, GPT-5.5는 압축비 매우 좋고, Trainium으로 훈련했지만 Opus 4.7도 매우 좋습니다.
이 자료에서 다룬 사실
구글은 Gemini 3.5 Flash를 공개했고, 출력 토큰 100만 개당 가격은 9달러라고 제시했다. TPU v8i 서빙 시 평균 800tok/s, 최대 1,480tok/s로 구동됐다고 시연했다.
근거 보기 2
- 원문 구간 1
Gemini 3.5 Flash를 공개했습니다. 모델의 지능 자체는 꽤나 좋아졌습니다. 비교하자면 구글이 2월 19일에 출시됐던 Gemini 3.1 Pro와 비슷한데 문제는 가격이 Flash 가격이 아닙니다. 두 가지 의미에서 가격 경쟁력이 낮다고 판단합니다. (ㄱ) 3.5 Flash(output token 1M당 $9.0)는 2025년 2월에 나온 2.0 Flash에 비해선 22.5배($0.40), 2025년 12월에 출시된 3.0 Flash에 비해서는 3배 비싸졌습니다($3.0). 명목상으로 보기에도 Flash치고는 비쌉니다. 오히려 Gemini 3.1 Pro와 비슷합니다($12.0). (ㄴ) 더 중요한 건 GPT-5.5 같은 경우는 파라미터가 2T에 달하는 거대모델이다보니 토큰당 지능 압축비가 굉장히 좋습니다. 근데 Flash는 소형모델이다보니 토큰당 지능 압축비가 상대적으로 낮기 때문에 같은 결과물을 내려면 훨씬 더 많은 토큰을 소비해야 합니다. (ㄱ) + (ㄴ)의 조합 때문에 실질 task output 기준으로 가격을 책정하면 이번 Gemini 3.5 Flash가 Gemini 3.1 Pro보다 비쌉니다.
- 원문 구간 2
흥미로웠던 건, TPU v8i에 Gemini 3.5 Flash를 얹어서 서빙했을 때 평균 800 tok/s(TPS = token per second = tok/s 다 같은 단어입니다)~최대 1480 tok/s로 구동됐습니다. 거의 Cerebras + Kimi K2.6 속도(~981 tok/s)로 서빙 가능함을 강조했습니다. CoT 토큰을 뱉는 것까지를 TPS로 잡고 있는데 @solipsnisyn 리뷰, @CryptoPainter 리뷰, @artoriatech 리뷰를 보시면 아시겠지만 굳이 안 해도 될 말을 해가면서 생각하는 것까지 잡힙니다. 사용자 입장에서는 영양가 없이 tok/s가 빠른 게 중요하지 않고, '양질의 output'을 얼마나 빨리 받느냐가 중요한데 이런 점에서는 아직 Antigravity + Gemini 3.5 Flash 조합이 경쟁력 있어보이진 않습니다. Antigravity CLI도 좀 개선되긴 했지만 Codex, Claude Code 대비로는 꽤나 아쉽습니다. 마치 광학 기업들 중 루멘텀만 유일하게 고출력 레이저들의 실제 데이터들을 공개하는 것처럼, 컴퓨팅 기업들 중에서는 엔비디아만 유일하게(AMD도 많이 공개하지만 유리한 것만 공개, 편견없이 보려고 혹시 AMD가 해냈나?
그렇게 판단한 이유
3.5 Flash 가격은 2.0 Flash의 22.5배, 3.0 Flash의 3배이며 Gemini 3.1 Pro와도 가깝다. 소형 모델은 같은 결과를 위해 더 많은 토큰을 쓸 수 있으므로, 토큰 속도보다 실제 과업 산출물 기준의 비용과 품질을 봐야 한다고 연결했다.
근거 보기 3
- 원문 구간 1
Gemini 3.5 Flash를 공개했습니다. 모델의 지능 자체는 꽤나 좋아졌습니다. 비교하자면 구글이 2월 19일에 출시됐던 Gemini 3.1 Pro와 비슷한데 문제는 가격이 Flash 가격이 아닙니다. 두 가지 의미에서 가격 경쟁력이 낮다고 판단합니다. (ㄱ) 3.5 Flash(output token 1M당 $9.0)는 2025년 2월에 나온 2.0 Flash에 비해선 22.5배($0.40), 2025년 12월에 출시된 3.0 Flash에 비해서는 3배 비싸졌습니다($3.0). 명목상으로 보기에도 Flash치고는 비쌉니다. 오히려 Gemini 3.1 Pro와 비슷합니다($12.0). (ㄴ) 더 중요한 건 GPT-5.5 같은 경우는 파라미터가 2T에 달하는 거대모델이다보니 토큰당 지능 압축비가 굉장히 좋습니다. 근데 Flash는 소형모델이다보니 토큰당 지능 압축비가 상대적으로 낮기 때문에 같은 결과물을 내려면 훨씬 더 많은 토큰을 소비해야 합니다. (ㄱ) + (ㄴ)의 조합 때문에 실질 task output 기준으로 가격을 책정하면 이번 Gemini 3.5 Flash가 Gemini 3.1 Pro보다 비쌉니다.
- 원문 구간 2
Gemini 3.1 Pro가 GPT-5.5, Opus 4.7보다 뒤처졌음을 생각해보면 기대보다는 아쉽습니다. Gemini 3.5 Flash는 소형모델인 만큼 초당 토큰 출력량이 굉장히 많음을 장점으로 내세우고 있습니다. 다만, 고부가가치 사용 사례에서는 이미 task output을 가지고 평가하는 게 일반화되어 있다보니 B2B/코딩/Agentic AI로 얼마나 침투할지 잘 모르겠습니다. 요구 지능수준이 낮은 각종 챗봇 사용 사례에는 중국 open weights 모델 중에서 Kimi K2.6정도, 미국에서는 성능은 조금 더 낮지만 어차피 저부가가치 사용 사례이므로 gpt-oss-120B, Nemotron-3 Super를 쓰는 게 기업 입장에서는 더 저렴할 것이라고 보입니다. 마찬가지로 워낙 일단 나온지 초기니 조금 더 반응을 봐야겠지만 좀 아쉬운 지표들입니다. 성능 자체는 끌어올린 건데 토큰당 지능 압축비가 높지 않은 게 이슈입니다. GB200 NVL72로 훈련한 Kimi K2.6, GPT-5.5는 압축비 매우 좋고, Trainium으로 훈련했지만 Opus 4.7도 매우 좋습니다.
- 원문 구간 3
흥미로웠던 건, TPU v8i에 Gemini 3.5 Flash를 얹어서 서빙했을 때 평균 800 tok/s(TPS = token per second = tok/s 다 같은 단어입니다)~최대 1480 tok/s로 구동됐습니다. 거의 Cerebras + Kimi K2.6 속도(~981 tok/s)로 서빙 가능함을 강조했습니다. CoT 토큰을 뱉는 것까지를 TPS로 잡고 있는데 @solipsnisyn 리뷰, @CryptoPainter 리뷰, @artoriatech 리뷰를 보시면 아시겠지만 굳이 안 해도 될 말을 해가면서 생각하는 것까지 잡힙니다. 사용자 입장에서는 영양가 없이 tok/s가 빠른 게 중요하지 않고, '양질의 output'을 얼마나 빨리 받느냐가 중요한데 이런 점에서는 아직 Antigravity + Gemini 3.5 Flash 조합이 경쟁력 있어보이진 않습니다. Antigravity CLI도 좀 개선되긴 했지만 Codex, Claude Code 대비로는 꽤나 아쉽습니다. 마치 광학 기업들 중 루멘텀만 유일하게 고출력 레이저들의 실제 데이터들을 공개하는 것처럼, 컴퓨팅 기업들 중에서는 엔비디아만 유일하게(AMD도 많이 공개하지만 유리한 것만 공개, 편견없이 보려고 혹시 AMD가 해냈나?
작성자가 예상한 다음 전개
6월 출시를 예고한 Gemini 3.5 Pro 성능이 중요하며, 초기 반응을 더 볼 필요가 있다고 적었다.
근거 보기 1
- 원문 구간 1
TPU v8i는 3Q26부터 양산 예정이라 엔비디아의 Rubin과 경쟁할 칩입니다. 바이트댄스의 SEEDANCE 2.0 vs Gemini Omni 비교는 @JSFILMZ0412에서 보실 수 있습니다. 이번에 6월 내로 출시를 예고한 Gemini 3.5 Pro 성능이 어떨지가 중요할 듯 합니다. 현재 구글 내부적으로 사용 중이라 말했습니다. AI HW: (1) 모건스탠리의 AI HW BOM 분석을 보시면 *자료 1, 2, 3* 앞으로도 많이 쓸 숫자들이 있습니다: 데이터센터 1GW를 구축하는 데 VR200로 채울 경우 41B, GB300 $33B, B200 $24B, H100 $23B가 들고 / TPU v7 $27B, Trainium3 $15B가 들 것으로 추정됩니다. 가속기별 1GW 데이터센터의 BOM을 분석해보면: VR200 : 서버/랙 61%(HBM, CPU 제외), 네트워킹 19%, Powered Shell 6%, 냉각 2%, DRAM 5%, HBM 4%, CPU 3%