26-9 구글 Gemini 4 Argon 발표
작성자의 핵심 판단
작성자는 Gemini 4 Argon이 구글을 AI Labs 3등 경쟁권으로 되돌렸다고 평가하되, 장기 에이전틱 작업과 RL 역량은 더 확인해야 한다고 본다.
근거 보기 3
- 원문 구간 1
2026-10-01 (목) 주요 지수 : 나스닥 +0.24% > S&P -0.25% > 러셀 -0.39% > 다우 -0.86% 상승종목비율 : NYSE 58%, Nasdaq 66% 🟡 (🟢🟡🔴) 섹터 - 📈강세 : 테크, 바이오텍, 반도체 - 📉약세 : 필수소비, 헬스케어, 산업재, 금융, 원자재, 유틸리티 📩 메이저 뉴스 빅테크/AI Labs: (1) 개인적으로 기대했던 Gemini 4가 출시됐습니다. 'Gemini 4 Argon'입니다 *첨부자료 1, 2*: 구글이 다시금 AI Labs 3등 자리를 차지했습니다. 1~2등 자리를 두고는 오픈AI가 GPT-6 Astra부터 적용된 Recurrent Depth의 효과로 연구 리더십을 쥐고, GPT-6.1 Sol로 파레토 프론티어를 압도하면서 ARR 1위로 올라섰듯 구글의 반격입니다.
- 원문 구간 2
블룸버그가 구글 내부적으로는 Gemini 4 Argon이 복잡한 코딩 작업에서 어려움을 겪는 듯 하다고 말하고 벤치맥싱 얘기를 흘러가듯이 '업계에서 이렇게 하고 있다~'는 느낌으로 슥 공유했는데(요즘 clickbait 기사가 늘었는데 벤치맥싱을 했다고 딱 짚은 게 아니라, '요즘 그렇다더라~' 이런 식으로 흘립니다) 이것들은 크게 신경쓰지 않습니다. 물론 코딩, 특히 장기간 에이전틱 작업이나 할루시네이션 문제에서 원래 구글이 오픈AI/앤스로픽 대비 약했었기 때문에 이번에 실제 광범위하게 배포했을 때 어떨지는 봐야겠는데 지금 봐서는 약간 관성적인 기사라고 생각합니다. 원래 개인적으로 2025년 내내 제미나이가 할루시네이션율이 다소 높고, 장기간 Agentic 작업에 적합하지 않아보인다고 전해드렸었는데 이번 Gemini 4 Argon은 AA-Omniscience Accuracy, Hallucination Rate 둘다 나름 준수하게 나왔습니다.
- 원문 구간 3
구글은 기존 3등이던 MSL과 경쟁할 역량을 갖췄습니다. TPU v7 → TPU v8t로 넘어오면서 사전학습에서 상당한 개선을 이룬 것이 주효했다고 생각합니다. 이제 진검승부가 시작됩니다. 지금은 Pre-training의 성능 향상분만 적용한 Gemini 4.0입니다. 이번 주 주간전략보고에서 코레이가 말했듯이 Pre-train checkpoint 모델 상태에서 약간의 정렬 후 빠르게 출시한 모델입니다. 여기서 제미나이의 RL 능력이 얼마나 되느냐로 4.1 → 4.2 → 4.3을 거치면서 3등 자리를 굳힐 수 있을 것인지가 결정됩니다. 메타는 10월에 지금의 Muse Spark(Avocado)를 넘어서는 Watermelon 라인업을 출시할 예정입니다.
이 자료에서 다룬 사실
Gemini 4 Argon이 출시됐고 Terminal-bench 4.0 57.4%, FrontierSWE v2 55.0%를 제시했다.
근거 보기 2
- 원문 구간 1
2026-10-01 (목) 주요 지수 : 나스닥 +0.24% > S&P -0.25% > 러셀 -0.39% > 다우 -0.86% 상승종목비율 : NYSE 58%, Nasdaq 66% 🟡 (🟢🟡🔴) 섹터 - 📈강세 : 테크, 바이오텍, 반도체 - 📉약세 : 필수소비, 헬스케어, 산업재, 금융, 원자재, 유틸리티 📩 메이저 뉴스 빅테크/AI Labs: (1) 개인적으로 기대했던 Gemini 4가 출시됐습니다. 'Gemini 4 Argon'입니다 *첨부자료 1, 2*: 구글이 다시금 AI Labs 3등 자리를 차지했습니다. 1~2등 자리를 두고는 오픈AI가 GPT-6 Astra부터 적용된 Recurrent Depth의 효과로 연구 리더십을 쥐고, GPT-6.1 Sol로 파레토 프론티어를 압도하면서 ARR 1위로 올라섰듯 구글의 반격입니다.
- 원문 구간 2
ⓐ코딩 벤치마크: Terminal-bench 4.0 기준 57.4%, FrontierSWE v2 기준 55.0%입니다. 요즘은 한 가지 벤치마크가 모든 걸 보여주는 경우가 없어서 그때그때 객관적이라 보이는 두 세 가지 정도의 벤치마크를 총체적으로 고려하고 있습니다. 코딩 성능으로 보자면 장기 에이전트 작업이나 보편적인 코딩 능력에서는 Opus 5.5/GPT-6 Astra보다는 떨어지는데 GPT-6.1 Sol, Sonnet 5.5보다는 전반적으로 비등하거나 더 나은 비슷한 수준입니다. ⓑ작업당 비용 및 작업당 생각토큰 규모: *첨부자료 3* 전반적인 벤치마크 달성까지의 작업당 비용을 평가해보면 Gemini 4 Argon는 $1.99입니다. 가격이 비싼 앤스로픽의 Sonnet 5.5($7.62)보다는 훨씬 낫고, Tier 2의 Grok 4.7($3.74), GLM-5.3($2.01), Kimi-K3($2.00)보다도 좋습니다.
그렇게 판단한 이유
TPU v8t의 사전학습 개선과 준수한 정확도·환각률을 근거로 이후 RL 성능이 관건이라고 연결했다.
근거 보기 3
- 원문 구간 1
2026-10-01 (목) 주요 지수 : 나스닥 +0.24% > S&P -0.25% > 러셀 -0.39% > 다우 -0.86% 상승종목비율 : NYSE 58%, Nasdaq 66% 🟡 (🟢🟡🔴) 섹터 - 📈강세 : 테크, 바이오텍, 반도체 - 📉약세 : 필수소비, 헬스케어, 산업재, 금융, 원자재, 유틸리티 📩 메이저 뉴스 빅테크/AI Labs: (1) 개인적으로 기대했던 Gemini 4가 출시됐습니다. 'Gemini 4 Argon'입니다 *첨부자료 1, 2*: 구글이 다시금 AI Labs 3등 자리를 차지했습니다. 1~2등 자리를 두고는 오픈AI가 GPT-6 Astra부터 적용된 Recurrent Depth의 효과로 연구 리더십을 쥐고, GPT-6.1 Sol로 파레토 프론티어를 압도하면서 ARR 1위로 올라섰듯 구글의 반격입니다.
- 원문 구간 2
블룸버그가 구글 내부적으로는 Gemini 4 Argon이 복잡한 코딩 작업에서 어려움을 겪는 듯 하다고 말하고 벤치맥싱 얘기를 흘러가듯이 '업계에서 이렇게 하고 있다~'는 느낌으로 슥 공유했는데(요즘 clickbait 기사가 늘었는데 벤치맥싱을 했다고 딱 짚은 게 아니라, '요즘 그렇다더라~' 이런 식으로 흘립니다) 이것들은 크게 신경쓰지 않습니다. 물론 코딩, 특히 장기간 에이전틱 작업이나 할루시네이션 문제에서 원래 구글이 오픈AI/앤스로픽 대비 약했었기 때문에 이번에 실제 광범위하게 배포했을 때 어떨지는 봐야겠는데 지금 봐서는 약간 관성적인 기사라고 생각합니다. 원래 개인적으로 2025년 내내 제미나이가 할루시네이션율이 다소 높고, 장기간 Agentic 작업에 적합하지 않아보인다고 전해드렸었는데 이번 Gemini 4 Argon은 AA-Omniscience Accuracy, Hallucination Rate 둘다 나름 준수하게 나왔습니다.
- 원문 구간 3
구글은 기존 3등이던 MSL과 경쟁할 역량을 갖췄습니다. TPU v7 → TPU v8t로 넘어오면서 사전학습에서 상당한 개선을 이룬 것이 주효했다고 생각합니다. 이제 진검승부가 시작됩니다. 지금은 Pre-training의 성능 향상분만 적용한 Gemini 4.0입니다. 이번 주 주간전략보고에서 코레이가 말했듯이 Pre-train checkpoint 모델 상태에서 약간의 정렬 후 빠르게 출시한 모델입니다. 여기서 제미나이의 RL 능력이 얼마나 되느냐로 4.1 → 4.2 → 4.3을 거치면서 3등 자리를 굳힐 수 있을 것인지가 결정됩니다. 메타는 10월에 지금의 Muse Spark(Avocado)를 넘어서는 Watermelon 라인업을 출시할 예정입니다.