2026.09.30 · 네이버 프리미엄 콘텐츠 · 미국주식 사관학교

AI 성능 경쟁에서 처참하게 밀리는 구글, 대체 무슨 생각인 걸까?

유형
네이버 프리미엄 콘텐츠
날짜
2026.09.30
강연자/작성자
미국주식 사관학교
분석 주제
미지정
자료 길이
본문 5,739자
1

문서 전체 조망

핵심 구조

구글의 Flash 전략은 최고 성능 경쟁보다 AI 호출량을 키우는 데 초점이 있다

Gemini Flash는 최고 난도 작업에서 경쟁 모델에 밀리는 구간이 있지만, 빠르고 싼 범용 모델을 서비스와 기업 업무 곳곳에 넣어 데이터센터 사용량을 늘리려는 전략으로 읽힌다. 이 전략이 성립하면 구글의 대규모 CAPEX는 모델 성능 순위가 아니라 API·TPU·클라우드의 동시 수익화로 평가해야 한다는 문제의식이다.

성능 격차는 존재하지만 제미나이가 쓸모없다는 뜻은 아니다

Gemini 3.8 Flash High는 9월 말 Artificial Analysis 지수에서 41점으로 GLM-5.3 Flash의 42점보다 낮았고, 복잡한 코딩과 다단계 실행에서는 약점이 확인된다. 다만 글쓰기·일반 질의응답·긴 문서·멀티모달 처리와 출력 속도에서는 강점이 있어, 최고 난도 성능과 실제 사용 범위를 구분해야 한다.

Flash는 반복 호출되는 범용 업무를 겨냥한다

AI 에이전트는 한 번의 지시 뒤 ERP 조회, 비교, 재조회, 보고서 작성까지 수십 번 모델을 호출할 수 있으므로 모든 단계를 가장 큰 모델로 돌리면 원가를 감당하기 어렵다. 복잡한 판단에는 큰 모델을 쓰고 분류·추출·검색 선별 같은 반복 작업에는 빠르고 싼 Flash를 쓰는 구성이 현실적이라는 설명이다.

비용 하락은 토큰 소비를 더 크게 만들 수 있다

호출 단가가 낮아지면 고객센터, 메일 요약, ERP 분석, 에이전트 간 반복 질의처럼 이전에는 AI를 붙이지 않던 업무가 늘 수 있다. 비용 하락이 활용처와 전체 사용량을 키우는 제번스 역설처럼, 구글은 토큰을 비싸게 파는 시장보다 토큰이 대량 소비되는 시장을 노릴 수 있다는 관점이다.

중국 저가 모델과의 경쟁 속에서 속도와 인프라 수익을 함께 본다

중국 업체는 저가 반복 업무층에서 범용 업무층까지 빠르게 올라오지만, Gemini Flash는 GLM보다 약 5배 빠른 토큰 처리 속도와 더 짧은 벤치마크 완료 시간을 제시한다. Flash 확산으로 데이터센터 가동률을 높이고 API·TPU·클라우드를 함께 팔 수 있다면, 대규모 투자도 최고 성능 경쟁의 패배로만 볼 수 없다는 판단이다.

ANALYSIS VIEW사건별 사실과 작성자의 판단, 지속 정보를 나누어 읽기
2
발생·예정 사건과 출처별 관점

이슈 분석

이 자료가 이슈의 어떤 사실을 다루고, 작성자가 무슨 결론을 어떤 근거로 내렸는지 원문에 붙여 읽습니다.

발생발표·발생 후발생월 26-9

26-9 Anthropic의 AI 인프라 의무 보도

작성자의 핵심 판단

클로드 사용자가 늘어나도 구글이 인프라에서 수익을 얻는 구조가 될 수 있다는 점을 구글 전략의 중요한 근거로 본다.

근거 보기 1
  1. 원문 구간 1

    심지어 TPU도 팔고, 클라우드도 팔고, 앤트로픽에도 클라우드를 파니까요. 사진 출처: radardigital.ai 참고로 2026년 9월 공개한 자료를 보면 앤트로픽은 장기간에 걸쳐 구글에 최소 1,111억 달러 규모의 인프라 비용을 지급하기로 약정했습니다. 심지어 클로드 사용자가 늘어도 구글이 돈을 버는 구조라는 뜻이죠. ​ 결국 구글이 노리는 승리는 "세상에서 가장 똑똑한 AI를 만들었다" 는 타이틀이 아니고 사용량일 가능성이 높습니다. 정확히는, AI가 조금 더 똑똑해져서 사람들이 하루에 한 번 더 감탄하는 것보다 가성비로 쓸 만한 AI가 싸져서 구글 서비스 곳곳에서 1인당 하루 수십 번씩 호출되는 편이 구글에게는 훨씬 중요할 수 있습니다. 구글은 이미 전 세계 수십억 명의 사람들을 고객으로 확보하고 있음 굳이 오픈AI나 앤트로픽처럼 사람 한 명을 새로 데려오지 않아도 기존 사용자에게서 AI 사용량이 계속 늘어나기만 하면 됨 구글 입장에서 진짜 큰 시장은 "AI를 쓰는 사람의 수" 보다 "한 사람이 하루에 AI를 몇 번 호출하느냐" 일 수도 있다는 것 ​ 그래서 Flash 전략을 최고 성능 경쟁에서 밀린 결과로만 보지 말고 이런 관점에서도 보면 어떨까 생각됩니다. 처음부터 목표가 달랐을 수 있다는 거죠. 사진 출처: 나무위키 순다 피차이: 제가 다 생각이 있어서 그런겁니다 휴먼. ​ AI 성능 경쟁은 때려치우고 오로지 "AI가 호출되는 빈도와 속도" 에만 집중하면 제미나이 API 비용은 물론 TPU, 데이터센터, 클라우드에서 동시다발적으로 돈이 벌리니 성공하기만 하면 정말 무서운 전략입니다. ​ 저는 구글을 볼 때는 Flash의 저열한(?) 성능만 보지 말고 이 부분도 기억해둬야 한다고 생각합니다. 구글 투자자 분들께 도움이 되는 내용이었기를 바랍니다! ​ 읽어주셔서 감사합니다. ^^

이 자료에서 다룬 사실

2026년 9월 공개 자료에서 앤트로픽이 장기간에 걸쳐 구글에 최소 1,111억 달러 규모의 인프라 비용을 지급하기로 약정했다고 적었다.

근거 보기 1
  1. 원문 구간 1

    심지어 TPU도 팔고, 클라우드도 팔고, 앤트로픽에도 클라우드를 파니까요. 사진 출처: radardigital.ai 참고로 2026년 9월 공개한 자료를 보면 앤트로픽은 장기간에 걸쳐 구글에 최소 1,111억 달러 규모의 인프라 비용을 지급하기로 약정했습니다. 심지어 클로드 사용자가 늘어도 구글이 돈을 버는 구조라는 뜻이죠. ​ 결국 구글이 노리는 승리는 "세상에서 가장 똑똑한 AI를 만들었다" 는 타이틀이 아니고 사용량일 가능성이 높습니다. 정확히는, AI가 조금 더 똑똑해져서 사람들이 하루에 한 번 더 감탄하는 것보다 가성비로 쓸 만한 AI가 싸져서 구글 서비스 곳곳에서 1인당 하루 수십 번씩 호출되는 편이 구글에게는 훨씬 중요할 수 있습니다. 구글은 이미 전 세계 수십억 명의 사람들을 고객으로 확보하고 있음 굳이 오픈AI나 앤트로픽처럼 사람 한 명을 새로 데려오지 않아도 기존 사용자에게서 AI 사용량이 계속 늘어나기만 하면 됨 구글 입장에서 진짜 큰 시장은 "AI를 쓰는 사람의 수" 보다 "한 사람이 하루에 AI를 몇 번 호출하느냐" 일 수도 있다는 것 ​ 그래서 Flash 전략을 최고 성능 경쟁에서 밀린 결과로만 보지 말고 이런 관점에서도 보면 어떨까 생각됩니다. 처음부터 목표가 달랐을 수 있다는 거죠. 사진 출처: 나무위키 순다 피차이: 제가 다 생각이 있어서 그런겁니다 휴먼. ​ AI 성능 경쟁은 때려치우고 오로지 "AI가 호출되는 빈도와 속도" 에만 집중하면 제미나이 API 비용은 물론 TPU, 데이터센터, 클라우드에서 동시다발적으로 돈이 벌리니 성공하기만 하면 정말 무서운 전략입니다. ​ 저는 구글을 볼 때는 Flash의 저열한(?) 성능만 보지 말고 이 부분도 기억해둬야 한다고 생각합니다. 구글 투자자 분들께 도움이 되는 내용이었기를 바랍니다! ​ 읽어주셔서 감사합니다. ^^

그렇게 판단한 이유

구글은 Gemini API뿐 아니라 TPU와 클라우드를 팔고 앤트로픽에도 클라우드를 제공하므로, 같은 AI 인프라를 여러 경로에서 수익화할 수 있다는 논리를 제시한다.

근거 보기 1
  1. 원문 구간 1

    심지어 TPU도 팔고, 클라우드도 팔고, 앤트로픽에도 클라우드를 파니까요. 사진 출처: radardigital.ai 참고로 2026년 9월 공개한 자료를 보면 앤트로픽은 장기간에 걸쳐 구글에 최소 1,111억 달러 규모의 인프라 비용을 지급하기로 약정했습니다. 심지어 클로드 사용자가 늘어도 구글이 돈을 버는 구조라는 뜻이죠. ​ 결국 구글이 노리는 승리는 "세상에서 가장 똑똑한 AI를 만들었다" 는 타이틀이 아니고 사용량일 가능성이 높습니다. 정확히는, AI가 조금 더 똑똑해져서 사람들이 하루에 한 번 더 감탄하는 것보다 가성비로 쓸 만한 AI가 싸져서 구글 서비스 곳곳에서 1인당 하루 수십 번씩 호출되는 편이 구글에게는 훨씬 중요할 수 있습니다. 구글은 이미 전 세계 수십억 명의 사람들을 고객으로 확보하고 있음 굳이 오픈AI나 앤트로픽처럼 사람 한 명을 새로 데려오지 않아도 기존 사용자에게서 AI 사용량이 계속 늘어나기만 하면 됨 구글 입장에서 진짜 큰 시장은 "AI를 쓰는 사람의 수" 보다 "한 사람이 하루에 AI를 몇 번 호출하느냐" 일 수도 있다는 것 ​ 그래서 Flash 전략을 최고 성능 경쟁에서 밀린 결과로만 보지 말고 이런 관점에서도 보면 어떨까 생각됩니다. 처음부터 목표가 달랐을 수 있다는 거죠. 사진 출처: 나무위키 순다 피차이: 제가 다 생각이 있어서 그런겁니다 휴먼. ​ AI 성능 경쟁은 때려치우고 오로지 "AI가 호출되는 빈도와 속도" 에만 집중하면 제미나이 API 비용은 물론 TPU, 데이터센터, 클라우드에서 동시다발적으로 돈이 벌리니 성공하기만 하면 정말 무서운 전략입니다. ​ 저는 구글을 볼 때는 Flash의 저열한(?) 성능만 보지 말고 이 부분도 기억해둬야 한다고 생각합니다. 구글 투자자 분들께 도움이 되는 내용이었기를 바랍니다! ​ 읽어주셔서 감사합니다. ^^

3
사실·구조, 해석·전망, 시점 관찰, 판단 방법

지식·관점

사건 밖에서도 다시 참고하거나 다른 자료와 비교할 가치가 있는 내용을 대상과 반복 가능한 논점으로 묶습니다.

시점 관찰Gemini Flash의 모델 성능 위치주 대상 · 기업·종목 · Google관련 대상 · 기술·제품 · Gemini기준 2026.09

Gemini Flash는 최고 난도 성능과 범용 작업에서 어떤 위치에 있는가?

이 자료가 더한 내용

2026년 9월 말 Artificial Analysis 지수에서 Gemini 3.8 Flash High는 41점으로 GLM-5.3 Flash의 42점보다 낮았고, 복잡한 코딩·다단계 실행에서는 밀리는 구간이 있다고 적었다. 반면 글쓰기, 일반 질의응답, 긴 문서·이미지·음성·영상 처리와 출력 속도에서는 강점이 남아 있다고 정리한다.

근거 보기 1
  1. 원문 구간 1

    근데 제미나이가 진짜 GPT나 클로드보다 뒤처지고 있을까? 당연히 그럴 것 같긴 한데. 일단 팩트 체크부터 합시다. 어느 정도는 맞습니다. 사진 출처: artificialanalysis.ai 2026년 9월 말 Artificial Analysis의 Intelligence Index에서 Gemini 3.8 Flash High는 41점을 기록했습니다. GLM-5.3 Flash는 42점이고 최신 최상위 GPT와 클로드 계열은 그보다 한참 더 위에 있습니다. 특히 복잡한 코딩이나 여러 단계를 스스로 계획하고 실행하는 작업에서 Gemini Flash가 크게 밀리는 구간이 있다는 건 팩트입니다. 반대로 글쓰기와 일반 질의응답, 긴 문서 처리, 이미지, 음성, 영상 같은 작업에서는 여전히 강하고 출력 속도도 굉장히 빠릅니다. 그러니까 제미나이가 멍청하다는 비난을 정확히 번역하면 이렇습니다. ​ ???: 현재 최고 난도의 AI 성능 경쟁에서 구글이 압도적인 모습을 보여주지 못하고 있다! ​ 이 정도가 맞습니다. ​ 그런데 아무도 제미나이를 안 쓸까요? 일단 저는 안 씁니다만, 통계를 봐야겠죠. 사진 출처: blog.google 놀랍게도 제미나이 앱은 2026년 8월 월간 활성 사용자 10억 명(!!!)을 넘겼습니다. 미국 AI 이용자의 58%가 제미나이를 쓰고 있었다고 하니 챗GPT의 60%와 큰 차이가 없습니다. ​ 2025년 제미나이 사용률이 36%였다는 점을 생각하면 성장 속도도 상당합니다. ​ 제일 똑똑하다는 평가는 못 받는데 엄청나게 많이 쓰입니다. 이게 무슨 상황일까요? 비밀은 제미나이의 주력 모델에 있습니다. 사진 출처: 구글 Fable 5.1이나 GPT-6 Astra 같은 최고급, 최상위 모델을 주력으로 미는 다른 회사들과 달리 제미나이의 주력 모델은 Flash죠. 이건 사실 아주 치밀하게 설계된 구글의 전략입니다. Flash는 빠르고 싸게 대량으로 돌리는 데 초점이 맞춰진 모델입니다.

사실·구조AI 에이전트 업무의 모델 배치주 대상 · 산업·업종 · 생성형 AI 추론 시장관련 대상 · 기술·제품 · Gemini Flash

AI 에이전트가 반복 호출하는 업무에는 어떤 모델 조합이 현실적인가?

이 자료가 더한 내용

한 번의 업무 지시 뒤 ERP 조회·비교·재조회·보고서 작성처럼 모델 호출이 수십 번 반복될 수 있으므로, 복잡한 판단에는 큰 모델을 쓰되 분류·추출·검색 결과 선별 같은 반복 업무에는 빠르고 싼 모델을 쓰는 편이 현실적이라고 본다. Flash는 이처럼 시스템 안에서 계속 돌아가는 범용 작업 엔진으로 설명된다.

근거 보기 1
  1. 원문 구간 1

    ​ 지금 우리가 AI를 쓰는 방식은 보통 질문 하나를 던지고 답 하나를 받는 겁니다. ​ 그런데 앞으로 AI 에이전트가 많아지면 완전히 달라집니다. 예를 들어 회사 대표가 AI에게 "지난달 매출이 왜 줄었는지 찾아서 보고서 만들어줘" 라고 한 번만 지시했다고 합시다. ​ 그 뒤에서는 이런 일들이 반복적으로 일어납니다. ​ ERP 데이터를 불러오고 제품별 매출을 비교하고 지역별 데이터를 확인하고 광고비와 가격 변화를 살펴보고 이상한 숫자가 있으면 다시 조회하고 마지막에 보고서까지... ​ 이렇게 되면 사람은 명령을 한 번 했지만 AI 모델은 뒤에서 수십 번 호출될 수 있습니다. ​ 이 모든 작업을 가장 비싸고 큰 모델로 돌리면 서비스 원가가 감당되지 않으니 무조건 적자가 납니다(사실 많은 스타트업들이 지금 이 문제를 겪고 있습니다). ​ 그래서 복잡한 판단에는 큰 모델을 쓰고 문서 분류나 데이터 추출, 검색 결과 선별 같은 단순 반복, 저지능(?) 작업에는 빠르고 싼 모델을 쓰는 방식이 훨씬 현실적입니다. 그리고 아마 회사들에서 하는 작업의 95% 정도는 이 단순 반복, 저지능 작업입니다. 우리가 세상을 바꾸는 나머지 5%만 보고 임팩트를 느끼니까 오오, 우와 하는 거죠. Flash가 들어갈 자리가 바로 여기입니다. 결국 Flash는 AI 시스템 안에서 계속 돌아가는 범용 작업 엔진에 가깝습니다. ​ 여기서 가격이 내려가면 재미있는 현상이 생깁니다. AI 호출 한 번에 10원이 들다가 5원으로 떨어졌다면? 사용량이 그대로라면 매출이 줄어듭니다. 그런데 5원이 되니까 그동안 AI를 쓰지 않던 업무까지 AI를 붙이기 시작하면 이야기가 아예 달라지게 됩니다. ​ 고객센터 문의마다 AI를 붙이고, 모든 메일을 요약하고, ERP 데이터도 계속 분석하고, Agent끼리 서로 수십 번 질문과 답변을 시켜도 돈을 충분히 아낄 수 있는 거죠.

해석·전망AI 호출 단가와 사용량주 대상 · 산업·업종 · 생성형 AI 추론 시장

AI 호출 비용이 낮아지면 사용량과 시장은 어떻게 달라질 수 있는가?

이 자료가 더한 내용

호출 단가가 내려가면 고객센터·메일·ERP 분석과 에이전트 간 반복 질의처럼 기존에 AI를 붙이지 않던 업무까지 활용처가 늘 수 있다고 본다. 이를 비용 하락이 전체 사용량을 오히려 키우는 제번스 역설에 빗대며, 토큰을 비싸게 파는 시장보다 토큰이 대량 소비되는 시장을 구글이 노릴 수 있다고 해석한다.

근거 보기 2
  1. 원문 구간 1

    ​ 지금 우리가 AI를 쓰는 방식은 보통 질문 하나를 던지고 답 하나를 받는 겁니다. ​ 그런데 앞으로 AI 에이전트가 많아지면 완전히 달라집니다. 예를 들어 회사 대표가 AI에게 "지난달 매출이 왜 줄었는지 찾아서 보고서 만들어줘" 라고 한 번만 지시했다고 합시다. ​ 그 뒤에서는 이런 일들이 반복적으로 일어납니다. ​ ERP 데이터를 불러오고 제품별 매출을 비교하고 지역별 데이터를 확인하고 광고비와 가격 변화를 살펴보고 이상한 숫자가 있으면 다시 조회하고 마지막에 보고서까지... ​ 이렇게 되면 사람은 명령을 한 번 했지만 AI 모델은 뒤에서 수십 번 호출될 수 있습니다. ​ 이 모든 작업을 가장 비싸고 큰 모델로 돌리면 서비스 원가가 감당되지 않으니 무조건 적자가 납니다(사실 많은 스타트업들이 지금 이 문제를 겪고 있습니다). ​ 그래서 복잡한 판단에는 큰 모델을 쓰고 문서 분류나 데이터 추출, 검색 결과 선별 같은 단순 반복, 저지능(?) 작업에는 빠르고 싼 모델을 쓰는 방식이 훨씬 현실적입니다. 그리고 아마 회사들에서 하는 작업의 95% 정도는 이 단순 반복, 저지능 작업입니다. 우리가 세상을 바꾸는 나머지 5%만 보고 임팩트를 느끼니까 오오, 우와 하는 거죠. Flash가 들어갈 자리가 바로 여기입니다. 결국 Flash는 AI 시스템 안에서 계속 돌아가는 범용 작업 엔진에 가깝습니다. ​ 여기서 가격이 내려가면 재미있는 현상이 생깁니다. AI 호출 한 번에 10원이 들다가 5원으로 떨어졌다면? 사용량이 그대로라면 매출이 줄어듭니다. 그런데 5원이 되니까 그동안 AI를 쓰지 않던 업무까지 AI를 붙이기 시작하면 이야기가 아예 달라지게 됩니다. ​ 고객센터 문의마다 AI를 붙이고, 모든 메일을 요약하고, ERP 데이터도 계속 분석하고, Agent끼리 서로 수십 번 질문과 답변을 시켜도 돈을 충분히 아낄 수 있는 거죠.

  2. 원문 구간 2

    사진 출처: 3dprint.com 경제학에서는 이런 현상을 제번스 역설이라고 부릅니다. ​ 어떤 자원을 사용하는 비용이 내려가면 활용처가 늘면서 전체 사용량은 오히려 커지는 현상이죠. 사실 역사적으로 사례는 수없이 많았습니다. ​ 컴퓨터 연산비용이 떨어지니 세상이 계산을 더 많이 하게 됨 인터넷 데이터 가격이 내려가니 사람들이 데이터를 더 막 쓰게 됨 ​ AI도 똑같이 생각하면 됩니다. 그래서 구글이 노리는 것은 토큰 하나를 가장 비싸게 파는 시장보다는 토큰이 하루에도 수조 번 소비되는 시장일 확률이 높죠. ​ 여기서 큰 문제가 하나 있는데... 사진 출처: myclaw 구글: 히히 우리는 초고성능 모델 대신 충분히 똑똑하고 저렴한 Flash를 수십억 명에게 뿌리겠다 ​ GLM, Qwen: 좋아. 그럼 그 게임 우리도 할게. 그런데 우리는 너보다 5~7배 싸게 할게 ​ 구글: 아니 진짜 상도덕보소 ​ AI 시장에는 대충 세 개의 층이 생기고 있습니다. ​ 맨 위는 frontier intelligence, 정말 어려운 코딩과 연구와 장기 에이전트 작업이고 여기는 아까 말씀드린 Fable, Astra 같은 "비싸도 되니까 제일 똑똑한 AI" 의 자리입니다. ​ 중간에는 workhorse, 회사 문서 읽기 + 코딩 + 에이전트 + 검색 + 데이터 처리 대부분입니다. 구글이 Flash를 집어넣고 싶은 곳이 정확히 여기입니다. ​ 맨 아래에는 commodity inference, 분류 + 요약 + 번역 + 수백만 번 호출하는 작업입니다. 여기부터는 지능 2점보다 토큰 가격 50% 차이가 훨씬 중요해집니다. 문제는 중국 업체들이 아래쪽에서 시작해서 말도 안 되는 속도로 중간층까지 올라오고 있다는 것입니다. GLM-5.3-Flash가 딱 이 부분을 보여주고 있습니다. 그럼 구글에는 꿈도 희망도 없는가? 그건 아닙니다. 제미나이와 GLM을 좀 자세히 보면 Google이 아직 안 썰리는 이유도 보입니다.

사실·구조AI 추론 시장의 계층 경쟁주 대상 · 산업·업종 · 생성형 AI 추론 시장관련 대상 · 기업·종목 · Google관련 대상 · 기술·제품 · GLM

최고 성능·범용 업무·저가 반복 업무 시장은 어떻게 나뉘며 경쟁은 어디서 심화되는가?

이 자료가 더한 내용

시장은 어려운 코딩·연구·장기 에이전트의 최고 성능층, 문서·코딩·검색·데이터 처리가 모인 범용 업무층, 분류·요약·번역처럼 토큰 가격이 중요한 저가 반복층으로 나뉜다고 설명한다. 구글은 Flash를 범용 업무층에 넣으려 하지만, 중국 업체들이 저가층에서 시작해 빠르게 중간층까지 올라오는 점을 문제로 든다.

근거 보기 1
  1. 원문 구간 1

    사진 출처: 3dprint.com 경제학에서는 이런 현상을 제번스 역설이라고 부릅니다. ​ 어떤 자원을 사용하는 비용이 내려가면 활용처가 늘면서 전체 사용량은 오히려 커지는 현상이죠. 사실 역사적으로 사례는 수없이 많았습니다. ​ 컴퓨터 연산비용이 떨어지니 세상이 계산을 더 많이 하게 됨 인터넷 데이터 가격이 내려가니 사람들이 데이터를 더 막 쓰게 됨 ​ AI도 똑같이 생각하면 됩니다. 그래서 구글이 노리는 것은 토큰 하나를 가장 비싸게 파는 시장보다는 토큰이 하루에도 수조 번 소비되는 시장일 확률이 높죠. ​ 여기서 큰 문제가 하나 있는데... 사진 출처: myclaw 구글: 히히 우리는 초고성능 모델 대신 충분히 똑똑하고 저렴한 Flash를 수십억 명에게 뿌리겠다 ​ GLM, Qwen: 좋아. 그럼 그 게임 우리도 할게. 그런데 우리는 너보다 5~7배 싸게 할게 ​ 구글: 아니 진짜 상도덕보소 ​ AI 시장에는 대충 세 개의 층이 생기고 있습니다. ​ 맨 위는 frontier intelligence, 정말 어려운 코딩과 연구와 장기 에이전트 작업이고 여기는 아까 말씀드린 Fable, Astra 같은 "비싸도 되니까 제일 똑똑한 AI" 의 자리입니다. ​ 중간에는 workhorse, 회사 문서 읽기 + 코딩 + 에이전트 + 검색 + 데이터 처리 대부분입니다. 구글이 Flash를 집어넣고 싶은 곳이 정확히 여기입니다. ​ 맨 아래에는 commodity inference, 분류 + 요약 + 번역 + 수백만 번 호출하는 작업입니다. 여기부터는 지능 2점보다 토큰 가격 50% 차이가 훨씬 중요해집니다. 문제는 중국 업체들이 아래쪽에서 시작해서 말도 안 되는 속도로 중간층까지 올라오고 있다는 것입니다. GLM-5.3-Flash가 딱 이 부분을 보여주고 있습니다. 그럼 구글에는 꿈도 희망도 없는가? 그건 아닙니다. 제미나이와 GLM을 좀 자세히 보면 Google이 아직 안 썰리는 이유도 보입니다.

시점 관찰Gemini Flash의 속도와 비용 경쟁주 대상 · 기술·제품 · Gemini Flash관련 대상 · 기술·제품 · GLM기준 2026.09

기업용 반복 추론에서 Gemini Flash의 속도는 가격 경쟁과 어떻게 맞물리는가?

이 자료가 더한 내용

AA 기준 Gemini 3.8 Flash High는 초당 약 239~250토큰, GLM-5.3-Flash는 약 51~53토큰이며 같은 벤치마크 완료 시간도 약 293초와 1,034초로 제시됐다. 가격이 싼 모델을 많이 돌리는 업무에서도 속도가 중요하므로, 기업에는 비용뿐 아니라 처리 시간이 경쟁 요소가 된다고 해석한다.

근거 보기 1
  1. 원문 구간 1

    사진 출처: 구글 현재 AA 기준으로 Gemini 3.8 Flash High는 약 239~250 tokens/sec 한편 GLM-5.3-Flash는 약 51~53 tokens/sec로 Gemini가 거의 5배 빠름 같은 벤치마크 작업을 끝내는 시간도 제미나이 약 293초 대 GLM 약 1,034초 수준 ​ 쉽게 말하면... ​ GLM: 5분의 1 가격으로 해줄게. 좀 기다려 ​ 제미나이: 돈 더 내. 대신 무지하게 빨리 해줄게 ㄱㄱ ​ 이런 겁니다. 이 부분에서 싼 모델을 많이 돌려야 하니까 빠른 속도도 필요한 비즈니스 시장에서는 제미나이가 확실한 우위입니다. 일반인들은 GLM을 써도 되지만 회사에게는 비용뿐 아니라 속도도 중요한 요소니까요. ​ 여기까지 잘 따라오셨다면 구글이 왜 Flash를 밀면서, 프런티어 모델들에게 치욕을 받아가면서 CAPEX를 주구장창 늘리고 있는지를 설명할 때가 되었습니다. ​ 아까 질문을 다시 봅시다. ​ ???: 제미나이가 클로드보다 한참 밀리는데 어차피 지는 싸움에 대체 왜 2,000억 달러씩 쓰는 걸까? 데이터센터 사업에서는 큰돈을 썼다는 사실보다 더 중요한 게 있습니다. 지어놓은 컴퓨팅 자원을 얼마나 많이 돌리느냐입니다. 2,000억 달러짜리 공장을 지어놓고 하루 몇 시간밖에 안 돌리면 최악의 투자입니다. 반대로 24시간 거의 쉬지 않고 돌아가면서 제품을 만들어 팔면 상황이 완전히 달라집니다. ​ Flash를 더 싸고 빠르게 만든다 → 그러면 AI를 붙일 수 있는 업무가 늘어난다 → 구글 검색도 AI를 쓰고 지메일도 AI를 쓰고 구글 워크스페이스도 AI를 쓰고 기업 고객도 AI를 쓰고 개발자들도 Gemini API를 호출...헥헥 ​ 토큰 가격은 내려가도 구글 데이터센터는 훨씬 더 바빠집니다. 그리고 구글은 같은 AI 인프라를 여러 곳에서 수익화할 수 있죠.

해석·전망구글 Flash 전략과 AI 인프라 수익화주 대상 · 기업·종목 · Google관련 대상 · 기술·제품 · Gemini Flash

구글은 Flash 확산과 대규모 CAPEX를 어떤 사용량·수익 구조로 연결하는가?

이 자료가 더한 내용

Flash를 더 싸고 빠르게 만들어 검색·Gmail·Workspace·기업 고객·개발자의 호출을 늘리면 토큰 가격이 낮아져도 데이터센터 가동률이 올라갈 수 있다고 본다. 구글의 목표는 가장 똑똑한 AI라는 타이틀보다 기존 수십억 사용자 안에서 한 사람이 하루에 AI를 호출하는 횟수를 늘리고, API·TPU·클라우드에서 동시 수익을 얻는 데 있을 수 있다는 해석이다.

근거 보기 2
  1. 원문 구간 1

    사진 출처: 구글 현재 AA 기준으로 Gemini 3.8 Flash High는 약 239~250 tokens/sec 한편 GLM-5.3-Flash는 약 51~53 tokens/sec로 Gemini가 거의 5배 빠름 같은 벤치마크 작업을 끝내는 시간도 제미나이 약 293초 대 GLM 약 1,034초 수준 ​ 쉽게 말하면... ​ GLM: 5분의 1 가격으로 해줄게. 좀 기다려 ​ 제미나이: 돈 더 내. 대신 무지하게 빨리 해줄게 ㄱㄱ ​ 이런 겁니다. 이 부분에서 싼 모델을 많이 돌려야 하니까 빠른 속도도 필요한 비즈니스 시장에서는 제미나이가 확실한 우위입니다. 일반인들은 GLM을 써도 되지만 회사에게는 비용뿐 아니라 속도도 중요한 요소니까요. ​ 여기까지 잘 따라오셨다면 구글이 왜 Flash를 밀면서, 프런티어 모델들에게 치욕을 받아가면서 CAPEX를 주구장창 늘리고 있는지를 설명할 때가 되었습니다. ​ 아까 질문을 다시 봅시다. ​ ???: 제미나이가 클로드보다 한참 밀리는데 어차피 지는 싸움에 대체 왜 2,000억 달러씩 쓰는 걸까? 데이터센터 사업에서는 큰돈을 썼다는 사실보다 더 중요한 게 있습니다. 지어놓은 컴퓨팅 자원을 얼마나 많이 돌리느냐입니다. 2,000억 달러짜리 공장을 지어놓고 하루 몇 시간밖에 안 돌리면 최악의 투자입니다. 반대로 24시간 거의 쉬지 않고 돌아가면서 제품을 만들어 팔면 상황이 완전히 달라집니다. ​ Flash를 더 싸고 빠르게 만든다 → 그러면 AI를 붙일 수 있는 업무가 늘어난다 → 구글 검색도 AI를 쓰고 지메일도 AI를 쓰고 구글 워크스페이스도 AI를 쓰고 기업 고객도 AI를 쓰고 개발자들도 Gemini API를 호출...헥헥 ​ 토큰 가격은 내려가도 구글 데이터센터는 훨씬 더 바빠집니다. 그리고 구글은 같은 AI 인프라를 여러 곳에서 수익화할 수 있죠.

  2. 원문 구간 2

    심지어 TPU도 팔고, 클라우드도 팔고, 앤트로픽에도 클라우드를 파니까요. 사진 출처: radardigital.ai 참고로 2026년 9월 공개한 자료를 보면 앤트로픽은 장기간에 걸쳐 구글에 최소 1,111억 달러 규모의 인프라 비용을 지급하기로 약정했습니다. 심지어 클로드 사용자가 늘어도 구글이 돈을 버는 구조라는 뜻이죠. ​ 결국 구글이 노리는 승리는 "세상에서 가장 똑똑한 AI를 만들었다" 는 타이틀이 아니고 사용량일 가능성이 높습니다. 정확히는, AI가 조금 더 똑똑해져서 사람들이 하루에 한 번 더 감탄하는 것보다 가성비로 쓸 만한 AI가 싸져서 구글 서비스 곳곳에서 1인당 하루 수십 번씩 호출되는 편이 구글에게는 훨씬 중요할 수 있습니다. 구글은 이미 전 세계 수십억 명의 사람들을 고객으로 확보하고 있음 굳이 오픈AI나 앤트로픽처럼 사람 한 명을 새로 데려오지 않아도 기존 사용자에게서 AI 사용량이 계속 늘어나기만 하면 됨 구글 입장에서 진짜 큰 시장은 "AI를 쓰는 사람의 수" 보다 "한 사람이 하루에 AI를 몇 번 호출하느냐" 일 수도 있다는 것 ​ 그래서 Flash 전략을 최고 성능 경쟁에서 밀린 결과로만 보지 말고 이런 관점에서도 보면 어떨까 생각됩니다. 처음부터 목표가 달랐을 수 있다는 거죠. 사진 출처: 나무위키 순다 피차이: 제가 다 생각이 있어서 그런겁니다 휴먼. ​ AI 성능 경쟁은 때려치우고 오로지 "AI가 호출되는 빈도와 속도" 에만 집중하면 제미나이 API 비용은 물론 TPU, 데이터센터, 클라우드에서 동시다발적으로 돈이 벌리니 성공하기만 하면 정말 무서운 전략입니다. ​ 저는 구글을 볼 때는 Flash의 저열한(?) 성능만 보지 말고 이 부분도 기억해둬야 한다고 생각합니다. 구글 투자자 분들께 도움이 되는 내용이었기를 바랍니다! ​ 읽어주셔서 감사합니다. ^^

4

시간흐름대로 모든 내용을 살려 정리

시간흐름대로 모든 내용을 살려 정리

1
구글이 AI 성능 경쟁에서 밀린다는 출발점

절대 안 오르는 구글의 이유는 아주 간단하다고 봅니다. 오픈AI와 앤트로픽, 중국의 GLM·Qwen까지 빠르게 올라오는데 제미나이는 어딘가 애매한 위치에 있습니다. 저도 코딩이나 복잡한 작업을 할 때 제미나이는 거들떠보지 않은 지 꽤 됐습니다. 최신 AI 성능을 따라잡지 못하는데 2026년 CAPEX를 1,950억~2,050억 달러나 쓰겠다고 선언했고, 잉여현금흐름도 흔들리니 시장이 의문을 갖는 게 당연합니다. 그런데 저는 여전히 구글이 잘하고 있다고 보는 편입니다.

2
성능 평가와 실제 사용자 수의 괴리

팩트 체크부터 합시다. 2026년 9월 말 Artificial Analysis Intelligence Index에서 Gemini 3.8 Flash High는 41점, GLM-5.3 Flash는 42점이고 최신 최상위 GPT와 클로드는 더 위에 있습니다. 복잡한 코딩이나 여러 단계를 스스로 계획·실행하는 작업에서 Gemini Flash가 크게 밀리는 구간은 팩트입니다. 반대로 글쓰기, 일반 질의응답, 긴 문서와 이미지·음성·영상에서는 강하고 출력도 굉장히 빠릅니다. 즉 최고 난도 경쟁에서 압도적이지 못하다는 뜻입니다. 제미나이 앱은 2026년 8월 월간 활성 사용자 10억 명을 넘겼고, 미국 AI 이용자 사용률도 58%로 챗GPT의 60%와 큰 차이가 없었습니다. 2025년 사용률 36%와 비교하면 성장 속도도 상당합니다. 제일 똑똑하다는 평가는 못 받아도 엄청나게 많이 쓰이고, 비밀은 주력 모델 Flash에 있습니다.

3
에이전트 시대의 Flash 역할

Fable 5.1이나 GPT-6 Astra 같은 최고급 모델을 주력으로 미는 곳과 달리 제미나이의 주력은 Flash입니다. 빠르고 싸게 대량으로 돌리는 데 초점을 맞춘 모델이죠. 지금은 질문 하나에 답 하나를 받지만, 앞으로 대표가 지난달 매출 감소 이유를 찾아 보고서로 만들라고 한 번 지시하면 ERP를 불러오고 제품·지역별 매출, 광고비와 가격 변화를 보고 이상하면 다시 조회한 뒤 보고서까지 만드는 일이 뒤에서 반복됩니다. 사람은 한 번 명령했지만 모델은 수십 번 호출될 수 있습니다. 이걸 가장 비싸고 큰 모델로 다 돌리면 서비스 원가가 감당되지 않아 무조건 적자입니다. 복잡한 판단에는 큰 모델을 쓰고 문서 분류·데이터 추출·검색 선별 같은 단순 반복에는 빠르고 싼 모델을 쓰는 편이 현실적입니다. 회사 업무의 95% 정도는 이런 단순 반복, 저지능 작업이고 Flash가 들어갈 자리가 바로 여기입니다.

4
싼 호출이 더 많은 호출을 부르는 구조와 경쟁층

AI 호출 한 번이 10원에서 5원으로 떨어지면, 사용량이 같을 때는 매출이 줄어듭니다. 하지만 그동안 AI를 쓰지 않던 업무까지 붙이기 시작하면 이야기가 달라집니다. 고객센터 문의마다 AI를 붙이고, 모든 메일을 요약하고, ERP를 계속 분석하고, 에이전트끼리 수십 번 질문과 답변을 시켜도 돈을 아낄 수 있습니다. 비용이 내려가 활용처가 늘며 전체 사용량이 커지는 제번스 역설처럼 AI도 생각하면 됩니다. 구글은 토큰 하나를 가장 비싸게 파는 시장보다 토큰이 하루에도 수조 번 소비되는 시장을 노릴 가능성이 높습니다. 문제는 GLM과 Qwen이 그 게임을 구글보다 5~7배 싸게 하겠다고 들어오는 겁니다. 시장은 어려운 코딩·연구·장기 에이전트의 frontier intelligence, 문서·코딩·검색·데이터 처리의 workhorse, 분류·요약·번역처럼 가격이 중요한 commodity inference로 나뉩니다. 구글이 Flash를 넣고 싶은 곳은 중간이고, 중국 업체들은 아래에서 시작해 말도 안 되는 속도로 중간까지 올라오고 있습니다.

5
가격만으로는 설명되지 않는 Flash의 속도

그래도 구글에 꿈도 희망도 없는 건 아닙니다. AA 기준 Gemini 3.8 Flash High는 초당 약 239~250토큰, GLM-5.3-Flash는 약 51~53토큰으로 제미나이가 거의 5배 빠릅니다. 같은 벤치마크를 끝내는 시간도 제미나이는 약 293초, GLM은 약 1,034초입니다. GLM은 5분의 1 가격으로 해줄 테니 기다리라고 하고, 제미나이는 돈을 더 내되 무지하게 빨리 해주겠다는 그림입니다. 싼 모델을 많이 돌려야 하지만 속도도 필요한 비즈니스 시장에서는 제미나이가 확실한 우위일 수 있습니다. 일반인은 GLM을 써도 되지만 회사에는 비용뿐 아니라 속도도 중요합니다.

6
CAPEX의 목적은 최고 성능 타이틀보다 사용량

제미나이가 클로드보다 밀리는데 왜 2,000억 달러씩 쓰느냐는 질문으로 돌아가 봅시다. 데이터센터는 큰돈을 썼다는 사실보다 지어놓은 컴퓨팅 자원을 얼마나 많이 돌리느냐가 중요합니다. 2,000억 달러짜리 공장을 하루 몇 시간만 돌리면 최악이지만, 24시간 거의 쉬지 않고 제품을 만들어 팔면 달라집니다. Flash를 더 싸고 빠르게 만들면 검색, Gmail, Workspace, 기업 고객, 개발자의 Gemini API 호출까지 AI를 붙일 업무가 늘어납니다. 토큰 가격은 내려가도 데이터센터는 더 바빠지고, 구글은 같은 인프라에서 TPU와 클라우드를 팔며 앤트로픽에도 클라우드를 팝니다. 2026년 9월 공개 자료에 따르면 앤트로픽은 장기간 구글에 최소 1,111억 달러의 인프라 비용을 지급하기로 약정했습니다. 클로드 사용자가 늘어도 구글이 돈을 버는 구조입니다. 결국 구글이 노리는 승리는 세상에서 가장 똑똑한 AI 타이틀이 아니라 사용량일 수 있습니다. 사람이 하루에 한 번 더 감탄하는 것보다 가성비로 쓸 만한 AI가 구글 서비스 곳곳에서 하루 수십 번씩 호출되는 편이 더 중요할 수 있습니다. 이미 수십억 명의 사용자가 있으니 새 사용자를 데려오기보다 기존 사용자의 호출량만 늘어도 됩니다. Flash의 저열한 성능만 보지 말고 이 부분도 기억해두면 어떨까 생각합니다.

5

그럼에도 빠진내용 정리

잡담·곁다리 내용
  • 잡담, 화면 설명, 불확실한 표현을 무작정 버리지 않는다.
생략 기록

별도 생략 기록이 없습니다.

그럼에도 빠진내용 정리

압축/생략
사진 출처 표시는 각 원문 구간의 이미지 근거 표기로 남아 있어 별도 시각 근거판을 만들지 않았다. 본문의 수치·사례·비유와 결론은 C001~C006 흐름에서 순서대로 회수했다.
잡담/운영
'히히', '상도덕보소', '헥헥', '휴먼' 같은 구어적 표현은 원문의 전략 설명을 살리는 범위에서 flow에 반영했고, 투자자에게 도움이 되길 바란다는 맺음말은 실질 주장과 분리해 압축했다.
전사 오류 가능성
1,950억~2,050억 달러 CAPEX, 10억 월간 활성 사용자, 58%·60% 사용률, 모델 벤치마크와 1,111억 달러 약정은 원문이 제시한 수치로만 보존했다. AI 업무의 95%와 구글의 목표·전략은 작성자의 추정 또는 해석으로 다뤘다.
원문 확인

document_work_runner prepare가 입력 원문을 수정 없이 보존했다.