26-9 Gemini 4 Pro 벤치마크 결과 공개
작성자의 핵심 판단
자료는 익명 테스트 모델이 Gemini 4 Pro라면 구글이 다시 최전선 경쟁력을 증명해야 하는 국면이라고 평가한다. 다만 벤치마크 표의 수치가 사실일 때라는 조건을 함께 둔다.
근거 보기 3
- 원문 구간 1
[원문 유형] CEO 분석용 텔레그램 채널별 뷰 원문 [채널] 굿트레이더의 투자 조각모음(이슈,주요일정 체크) [묶음 주기] 12시간 [통합 구간] 2026-09-18T03:00:00+00:00 ~ 2026-09-18T15:00:00+00:00 [작성 기준] 아래 글은 모두 같은 유료 채널 작성자가 시간 순서대로 이어 낸 관점이다. 여러 글을 단순 나열하지 말고, 무엇을 사실 근거로 삼았는지, 작성자가 어떻게 해석했는지, 전망·확신·조건이 구간 안에서 어떻게 이어지거나 달라졌는지를 구분해 하나의 문서로 정리한다. 외부 링크와 첨부는 작성자 판단의 근거 원문이며, 외부 원문의 주장과 작성자 자신의 뷰를 섞지 않는다. 시간흐름순 정리에서는 게시 순서와 판단 강도, 유보 조건, 인상적인 표현을 보존한다. ===== 통합 원문 1 / 3 ===== [채널] 굿트레이더의 투자 조각모음(이슈,주요일정 체크) [게시일시] 2026.09.18 12:56:45 [텔레그램 게시물] https://t.me/good_trader_x100/1996 [원문 수집 기준] 외부 링크가 있으면 링크를 따라 확보한 실제 본문·첨부 파일이 주 분석 원문이다. 텔레그램 게시물은 발견 경로와 보조 설명으로 보존하며 외부 원문과 구분해 반영한다. [현재 텔레그램 게시물 본문] >>방금, Gemini 4 Pro가 유출되어 공개 테스트에 등장! Astra와 Fable을 압도 (중국언론) •구글이 플래그십 모델 Gemini 4 Pro를 ‘gemini-3.8-flash’라는 이름으로 위장해 AI 아레나에 조용히 테스트용으로 공개한 것으로 보임.
- 원문 구간 2
Terminal-bench 2.1:4 Pro终端编码能力也是最强的95.3%; OSWorld-2.0:计算机使用能力方面,4 Pro斩获86.8%,击败了Astra和Fable。 若这张表分数属实,Gemini 4 Pro真是「地表最强」的AI了。 在价格方面,相较于Astra和Fable,也是「御三家」中最具性价比的那个。每百万Token输入价格2.25美元,每百万Token输出价格11.25美元。 AI研究员Qwinah进入Gemini 4 Pro后端后发现,它有1000万输入上限,25.6万输出上限,永久跨会话记忆,不用API即可连网。 全网首测4 Pro,登上热搜 真正比跑分更有看点的,是全网一大的波惊艳实测。 UI网页设计,品味大提升 这不,开发者Bee测完之后,直呼「Gemini 4 Pro太不真实了......」 短短14分钟,4 Pro打造了一个以素描、铅笔与石墨质感为主题的「创意展示网页」。 它竟可以将网页的「滚动即笔触」概念化,向下滑动线条逐渐加深,交互感非常丝滑。 下面这个是一个兼具赛博朋克和复古未来主义的工作网站。 4 Pro在设计过程中,首屏结合了3D网格、数据仪表盘,还有可交互的3D模型。 3D+SVG,夯爆了 全网疯传的一个经典「鹈鹕骑自行车」的测试,Gemini 4 Pro输出的效果非常震撼。 配色、日夜切换、车灯、解剖标注、踏频控制,整个完成度完全不输顶尖大模型。 Pankaj Kumar在体验后,直接总结了几个变化: 速度很快,SVG和3D生成明显进步;一次提示就能把复杂要求吃得比较准。 甚至,它已经能直接生成带完整交互逻辑、视觉效果不错的小游戏。 再来看一个像素风3D宝塔测试,有种身临其境的味道了。 下面这个是4 Pro用时10分钟,制作出的空客H145直升机3D模型。 另外,在一个3D飞行模拟的测试中,4 Pro的画面效果大幅超越了Gemini 3.8 Flash。
- 원문 구간 3
谷歌要想撑住目前4.23万亿美元的市值,保持AI实力在第一梯队至关重要。 本文来源: 新智元 ===== 통합 원문 3 / 3 ===== [채널] 굿트레이더의 투자 조각모음(이슈,주요일정 체크) [게시일시] 2026.09.18 13:18:59 [텔레그램 게시물] https://t.me/good_trader_x100/1998 [원문 수집 기준] 외부 링크가 있으면 링크를 따라 확보한 실제 본문·첨부 파일이 주 분석 원문이다. 텔레그램 게시물은 발견 경로와 보조 설명으로 보존하며 외부 원문과 구분해 반영한다. [현재 텔레그램 게시물 본문] 이익 성장이 동반되던 금리인상 사이클에서의 빅테크 주가 추이 1. 2004년 8월 ~ 2006년 6월 : 연준은 금리를 빠르게 올렸지만 배경은 경기침체가 아니라 미국 경제의 강한 성장과 고용 회복 : 금리 1.55% -> 5.05% 상승 : 빅테크 동일가중 수익률 +195% 2. 2015년 12월 ~ 2018년 12월 : 연준은 정책금리를 0%대에서 2%대로 올렸지만 미국 경제는 비교적 안정적으로 성장 : 금리 0.20% -> 2.40% : 빅테크 동일가중 수익률 +108% -> 두 구간 모두 금리 상승에 따른 할인율 부담보다 빅테크의 이익 성장과 산업구조 변화가 훨씬 막강했음 이번 금리인상 사이클은 AI가 산업구조 변화를 주도하는 상태 (2022년 금리인상기때는 기업들의 이익 성장이 꺾였던 사이클임에 빅테크들의 주가도 크게 부진했음)
이 자료에서 다룬 사실
자료는 구글이 ‘gemini-3.8-flash’ 이름으로 AI 아레나에 테스트 모델을 올렸을 가능성과, 이 모델이 코딩·에이전트·추론 벤치마크 및 UI·SVG·3D·게임 생성 테스트에서 Astra와 Fable 5.1을 앞섰다는 보도를 소개한다.
근거 보기 5
- 원문 구간 1
[원문 유형] CEO 분석용 텔레그램 채널별 뷰 원문 [채널] 굿트레이더의 투자 조각모음(이슈,주요일정 체크) [묶음 주기] 12시간 [통합 구간] 2026-09-18T03:00:00+00:00 ~ 2026-09-18T15:00:00+00:00 [작성 기준] 아래 글은 모두 같은 유료 채널 작성자가 시간 순서대로 이어 낸 관점이다. 여러 글을 단순 나열하지 말고, 무엇을 사실 근거로 삼았는지, 작성자가 어떻게 해석했는지, 전망·확신·조건이 구간 안에서 어떻게 이어지거나 달라졌는지를 구분해 하나의 문서로 정리한다. 외부 링크와 첨부는 작성자 판단의 근거 원문이며, 외부 원문의 주장과 작성자 자신의 뷰를 섞지 않는다. 시간흐름순 정리에서는 게시 순서와 판단 강도, 유보 조건, 인상적인 표현을 보존한다. ===== 통합 원문 1 / 3 ===== [채널] 굿트레이더의 투자 조각모음(이슈,주요일정 체크) [게시일시] 2026.09.18 12:56:45 [텔레그램 게시물] https://t.me/good_trader_x100/1996 [원문 수집 기준] 외부 링크가 있으면 링크를 따라 확보한 실제 본문·첨부 파일이 주 분석 원문이다. 텔레그램 게시물은 발견 경로와 보조 설명으로 보존하며 외부 원문과 구분해 반영한다. [현재 텔레그램 게시물 본문] >>방금, Gemini 4 Pro가 유출되어 공개 테스트에 등장! Astra와 Fable을 압도 (중국언론) •구글이 플래그십 모델 Gemini 4 Pro를 ‘gemini-3.8-flash’라는 이름으로 위장해 AI 아레나에 조용히 테스트용으로 공개한 것으로 보임.
- 원문 구간 2
벤치마크 결과 코딩, 에이전트, 추론 등 여러 능력에서 OpenAI의 Astra와 Anthropic의 Fable 5.1을 전면적으로 앞선 것으로 나타났으며, ‘현존 최강’으로 평가할 만한 수준임. 실제 테스트에서도 4 Pro는 UI 디자인, SVG/3D 생성 및 게임 개발 등에서 뛰어난 성능을 보였음. 구글이 이미 RSI(재귀적 자기개선) 폐쇄 루프를 구현해 Gemini 4의 사전학습을 앞당겨 완료했다는 이야기도 나옴 >刚刚,Gemini 4 Pro偷跑上线!碾压Astra和Fable https://wallstreetcn.com/articles/3782055#from=ios [외부 원문 1] [URL] https://wallstreetcn.com/articles/3782055#from=ios [제목] 刚刚,Gemini 4 Pro偷跑上线!碾压Astra和Fable - 华尔街见闻 谷歌疑似将旗舰模型Gemini 4 Pro以"gemini-3.8-flash"为名,悄然在AI竞技场Arena上线测试。基准数据显示,其在编码、智能体、推理等多项能力上全面超越OpenAI的Astra和Anthropic的Fable 5.1,堪称"地表最强"。实测中,4 Pro在UI设计、SVG/3D生成及游戏开发等方面表现惊艳。据称谷歌已实现RSI(递归自我改进)闭环,才能提前完成Gemini 4的预训练。 真是深藏不漏! 这一次,谷歌终于把底牌扔出来了。 就在这两天,大模型竞技场Arena悄然杀入一款新模型,名字竟挂着「gemini-3.8-flash」。 上手实测的AI大佬和开发者交手几轮后,几乎倒吸一口气—— 这极有可能是谷歌DeepMind,悟了整整半年的下一代旗舰Gemini 4 Pro!
- 원문 구간 3
一张疯传全网的基准图,简直堪称「恐怖」。 Gemini 4 Pro完全杀疯,编码、智能体、推理等领域实力,全面碾压GPT-6 Astra、Claude Fable 5.1。 开发者Vidhi体验过后,被Gemini 4 Pro完全震惊到了。 一张猫咪的SVG图,就证明了一切。GPT-6 Astra直接扔出了一只「大猫咪」(似猫非猫,更像laofu)。 正如传言所说,谷歌内部实现了RSI,Gemini 4 Pro才能和Astra/Fable正面对打。 沉寂许久的巨兽,真的强势回归了! Gemini 4 Pro匿名偷跑,击败Astra和Fable AI圈许久未有这么兴奋了。 要知道,谷歌上一个大版本更新Gemini 3.1 Pro,已经是7个月前(2月19日)的事儿了。 谷歌I/O大会上,劈柴曾预告:Gemini 3.5 Pro将在6月上线。 未曾想,这一重大发布鸽了又鸽,最终「胎死腹中」! 就在这个月初,WSJ独家爆料,Gemini 3.5 Pro取消了,原因很简单—— 3.5 Pro的进化程度,连Flash都比不上。 好在,Gemini 4在预训练中评估优秀,后训练还在顺利进行中。 如今,Gemini 4 Pro竟穿上了gemini-3.8-flash的「马甲」,在Arena上首个检查点现身了。 毕竟Gemini 3.8 Flash这款模型,早在9月初发布,同名再出现极不寻常。 一大波上手体验后的开发者们,对4 Pro印象深刻,甚至体感超越了Astra和Fable。 从泄露的基准测试图中,可以发现,4 Pro实现了全面压制,成绩单非常亮眼—— DeepSWE v1.1:AI智能体编码任务上,4 Pro拿下了最高88.%分,比Astra还要多近2%; GDPval-AA v2:在真实知识工作任务中,4 Pro唯一获得了2064 Elo;
- 원문 구간 4
Terminal-bench 2.1:4 Pro终端编码能力也是最强的95.3%; OSWorld-2.0:计算机使用能力方面,4 Pro斩获86.8%,击败了Astra和Fable。 若这张表分数属实,Gemini 4 Pro真是「地表最强」的AI了。 在价格方面,相较于Astra和Fable,也是「御三家」中最具性价比的那个。每百万Token输入价格2.25美元,每百万Token输出价格11.25美元。 AI研究员Qwinah进入Gemini 4 Pro后端后发现,它有1000万输入上限,25.6万输出上限,永久跨会话记忆,不用API即可连网。 全网首测4 Pro,登上热搜 真正比跑分更有看点的,是全网一大的波惊艳实测。 UI网页设计,品味大提升 这不,开发者Bee测完之后,直呼「Gemini 4 Pro太不真实了......」 短短14分钟,4 Pro打造了一个以素描、铅笔与石墨质感为主题的「创意展示网页」。 它竟可以将网页的「滚动即笔触」概念化,向下滑动线条逐渐加深,交互感非常丝滑。 下面这个是一个兼具赛博朋克和复古未来主义的工作网站。 4 Pro在设计过程中,首屏结合了3D网格、数据仪表盘,还有可交互的3D模型。 3D+SVG,夯爆了 全网疯传的一个经典「鹈鹕骑自行车」的测试,Gemini 4 Pro输出的效果非常震撼。 配色、日夜切换、车灯、解剖标注、踏频控制,整个完成度完全不输顶尖大模型。 Pankaj Kumar在体验后,直接总结了几个变化: 速度很快,SVG和3D生成明显进步;一次提示就能把复杂要求吃得比较准。 甚至,它已经能直接生成带完整交互逻辑、视觉效果不错的小游戏。 再来看一个像素风3D宝塔测试,有种身临其境的味道了。 下面这个是4 Pro用时10分钟,制作出的空客H145直升机3D模型。 另外,在一个3D飞行模拟的测试中,4 Pro的画面效果大幅超越了Gemini 3.8 Flash。
- 원문 구간 5
从这一点,就可以证明,Gemini 3.8 Flash和竞技场上的gemini-3.8-flash不是同一款。 一键直出可玩的游戏 在游戏生成方面,Gemini 4 Pro也没有落下。 「我的世界」从页面搭建,大游戏中每个模块的设计,完全不输此前放出的Astra的测试。 还有下面这个3D卡丁车竞速游戏,看起来比跑跑卡丁车这些曾风靡一时赛车游戏更现代;而这,是Gemini 4 Pro花了很短时间做出来的。 谷歌真正押注的,叫 RSI 一旦RSI这个循环真能持续转起来,模型升级的节奏可能彻底变掉。 上个月,Google DeepMind首席战略官Jasjeet Sekhon在伯克利的活动上,直接把话挑明了—— RSI(递归自我改进),已成为AI巨额投资逻辑里的关键一环。 整个行业押注的,是能力曲线继续向上。 而如果真正撞上递归自我改进,这条曲线甚至可能从「指数增长」进一步加速。 就在最近,全网流传着更激进的说法: Gemini 4之所以提前完成预训练,正是因为谷歌DeepMind在训练中实现「RSI闭环了」。 有意思的是,就在14日,谷歌一项名为Dream-RSI的研究也公开了。 它研究的正是,如何让Agent在探索过程中不断改进自己的搜索策略,从经验中继续升级下一轮探索。 可以确认的是,谷歌DeepMind已经公开把RSI摆到了非常重要的位置。 而且,AI参与改进AI的迹象越来越多。 「御三家」要回来了? 所以,Gemini 4 Pro面对的是一个已经彻底变样的牌桌。 OpenAI有Astra;Anthropic有Fable 5.1。 两大巨头已经把竞争从单纯聊天,卷到长任务、Agent、代码、推理乃至自主科研。 谷歌如果只是做出一个「比Gemini 3.8更强」的模型,已经不够了。 Gemini 4 Pro必须重新证明一件事:Gemini还在最前沿!
그렇게 판단한 이유
동일 이름의 Gemini 3.8 Flash가 이미 공개된 상태에서 아레나의 모델 성능이 크게 다르다는 점, 유출된 벤치마크와 개발자 테스트 사례를 연결해 해당 모델을 차세대 Gemini 4 Pro로 추정한다.
근거 보기 4
- 원문 구간 1
벤치마크 결과 코딩, 에이전트, 추론 등 여러 능력에서 OpenAI의 Astra와 Anthropic의 Fable 5.1을 전면적으로 앞선 것으로 나타났으며, ‘현존 최강’으로 평가할 만한 수준임. 실제 테스트에서도 4 Pro는 UI 디자인, SVG/3D 생성 및 게임 개발 등에서 뛰어난 성능을 보였음. 구글이 이미 RSI(재귀적 자기개선) 폐쇄 루프를 구현해 Gemini 4의 사전학습을 앞당겨 완료했다는 이야기도 나옴 >刚刚,Gemini 4 Pro偷跑上线!碾压Astra和Fable https://wallstreetcn.com/articles/3782055#from=ios [외부 원문 1] [URL] https://wallstreetcn.com/articles/3782055#from=ios [제목] 刚刚,Gemini 4 Pro偷跑上线!碾压Astra和Fable - 华尔街见闻 谷歌疑似将旗舰模型Gemini 4 Pro以"gemini-3.8-flash"为名,悄然在AI竞技场Arena上线测试。基准数据显示,其在编码、智能体、推理等多项能力上全面超越OpenAI的Astra和Anthropic的Fable 5.1,堪称"地表最强"。实测中,4 Pro在UI设计、SVG/3D生成及游戏开发等方面表现惊艳。据称谷歌已实现RSI(递归自我改进)闭环,才能提前完成Gemini 4的预训练。 真是深藏不漏! 这一次,谷歌终于把底牌扔出来了。 就在这两天,大模型竞技场Arena悄然杀入一款新模型,名字竟挂着「gemini-3.8-flash」。 上手实测的AI大佬和开发者交手几轮后,几乎倒吸一口气—— 这极有可能是谷歌DeepMind,悟了整整半年的下一代旗舰Gemini 4 Pro!
- 원문 구간 2
一张疯传全网的基准图,简直堪称「恐怖」。 Gemini 4 Pro完全杀疯,编码、智能体、推理等领域实力,全面碾压GPT-6 Astra、Claude Fable 5.1。 开发者Vidhi体验过后,被Gemini 4 Pro完全震惊到了。 一张猫咪的SVG图,就证明了一切。GPT-6 Astra直接扔出了一只「大猫咪」(似猫非猫,更像laofu)。 正如传言所说,谷歌内部实现了RSI,Gemini 4 Pro才能和Astra/Fable正面对打。 沉寂许久的巨兽,真的强势回归了! Gemini 4 Pro匿名偷跑,击败Astra和Fable AI圈许久未有这么兴奋了。 要知道,谷歌上一个大版本更新Gemini 3.1 Pro,已经是7个月前(2月19日)的事儿了。 谷歌I/O大会上,劈柴曾预告:Gemini 3.5 Pro将在6月上线。 未曾想,这一重大发布鸽了又鸽,最终「胎死腹中」! 就在这个月初,WSJ独家爆料,Gemini 3.5 Pro取消了,原因很简单—— 3.5 Pro的进化程度,连Flash都比不上。 好在,Gemini 4在预训练中评估优秀,后训练还在顺利进行中。 如今,Gemini 4 Pro竟穿上了gemini-3.8-flash的「马甲」,在Arena上首个检查点现身了。 毕竟Gemini 3.8 Flash这款模型,早在9月初发布,同名再出现极不寻常。 一大波上手体验后的开发者们,对4 Pro印象深刻,甚至体感超越了Astra和Fable。 从泄露的基准测试图中,可以发现,4 Pro实现了全面压制,成绩单非常亮眼—— DeepSWE v1.1:AI智能体编码任务上,4 Pro拿下了最高88.%分,比Astra还要多近2%; GDPval-AA v2:在真实知识工作任务中,4 Pro唯一获得了2064 Elo;
- 원문 구간 3
Terminal-bench 2.1:4 Pro终端编码能力也是最强的95.3%; OSWorld-2.0:计算机使用能力方面,4 Pro斩获86.8%,击败了Astra和Fable。 若这张表分数属实,Gemini 4 Pro真是「地表最强」的AI了。 在价格方面,相较于Astra和Fable,也是「御三家」中最具性价比的那个。每百万Token输入价格2.25美元,每百万Token输出价格11.25美元。 AI研究员Qwinah进入Gemini 4 Pro后端后发现,它有1000万输入上限,25.6万输出上限,永久跨会话记忆,不用API即可连网。 全网首测4 Pro,登上热搜 真正比跑分更有看点的,是全网一大的波惊艳实测。 UI网页设计,品味大提升 这不,开发者Bee测完之后,直呼「Gemini 4 Pro太不真实了......」 短短14分钟,4 Pro打造了一个以素描、铅笔与石墨质感为主题的「创意展示网页」。 它竟可以将网页的「滚动即笔触」概念化,向下滑动线条逐渐加深,交互感非常丝滑。 下面这个是一个兼具赛博朋克和复古未来主义的工作网站。 4 Pro在设计过程中,首屏结合了3D网格、数据仪表盘,还有可交互的3D模型。 3D+SVG,夯爆了 全网疯传的一个经典「鹈鹕骑自行车」的测试,Gemini 4 Pro输出的效果非常震撼。 配色、日夜切换、车灯、解剖标注、踏频控制,整个完成度完全不输顶尖大模型。 Pankaj Kumar在体验后,直接总结了几个变化: 速度很快,SVG和3D生成明显进步;一次提示就能把复杂要求吃得比较准。 甚至,它已经能直接生成带完整交互逻辑、视觉效果不错的小游戏。 再来看一个像素风3D宝塔测试,有种身临其境的味道了。 下面这个是4 Pro用时10分钟,制作出的空客H145直升机3D模型。 另外,在一个3D飞行模拟的测试中,4 Pro的画面效果大幅超越了Gemini 3.8 Flash。
- 원문 구간 4
从这一点,就可以证明,Gemini 3.8 Flash和竞技场上的gemini-3.8-flash不是同一款。 一键直出可玩的游戏 在游戏生成方面,Gemini 4 Pro也没有落下。 「我的世界」从页面搭建,大游戏中每个模块的设计,完全不输此前放出的Astra的测试。 还有下面这个3D卡丁车竞速游戏,看起来比跑跑卡丁车这些曾风靡一时赛车游戏更现代;而这,是Gemini 4 Pro花了很短时间做出来的。 谷歌真正押注的,叫 RSI 一旦RSI这个循环真能持续转起来,模型升级的节奏可能彻底变掉。 上个月,Google DeepMind首席战略官Jasjeet Sekhon在伯克利的活动上,直接把话挑明了—— RSI(递归自我改进),已成为AI巨额投资逻辑里的关键一环。 整个行业押注的,是能力曲线继续向上。 而如果真正撞上递归自我改进,这条曲线甚至可能从「指数增长」进一步加速。 就在最近,全网流传着更激进的说法: Gemini 4之所以提前完成预训练,正是因为谷歌DeepMind在训练中实现「RSI闭环了」。 有意思的是,就在14日,谷歌一项名为Dream-RSI的研究也公开了。 它研究的正是,如何让Agent在探索过程中不断改进自己的搜索策略,从经验中继续升级下一轮探索。 可以确认的是,谷歌DeepMind已经公开把RSI摆到了非常重要的位置。 而且,AI参与改进AI的迹象越来越多。 「御三家」要回来了? 所以,Gemini 4 Pro面对的是一个已经彻底变样的牌桌。 OpenAI有Astra;Anthropic有Fable 5.1。 两大巨头已经把竞争从单纯聊天,卷到长任务、Agent、代码、推理乃至自主科研。 谷歌如果只是做出一个「比Gemini 3.8更强」的模型,已经不够了。 Gemini 4 Pro必须重新证明一件事:Gemini还在最前沿!