Gemini 3 Deep Think 출시
작성자의 핵심 판단
작성자는 단일 추론 모델과 병렬 추론 모델의 벤치마크를 같은 비교군으로 볼 수 없다고 평가한다.
근거 보기 1
- 원문 구간 1
그래서 저 벤치마크상 정확한 의미의 비교군은 아니긴 합니다. 토큰을 훨씬 더 많이 쓰는 모델입니다. (2) 오픈AI가 한 달마다 GPT-5.1, GPT-5.2, GPT-5.3까지 사후훈련 값을 잘 내놓는 걸 보면 내부적으로 체크포인트 모델이야 갖고 있겠지만 아직 공개적으로 벤치마크를 공개하지 않았기에 그럴뿐입니다. 최근 상대적으로 정렬을 덜 거치는(미국은 보통 2~3개월, 중국은 ~1개월, 이 격차 때문에 빠르게 따라잡힌 것 같지만 시간이 지나서 보면 미국 모델이 우수한 상황이 지속되어 온 사이클), 상당히 우수한 퍼포먼스를 보이고 있는 중국 모델들(e.g. GLM-5)이 춘절을 앞두고 줄줄이 출시되고 있는데 1월 20일에 MSL도 Avocado 사전훈련이 끝났던 것을 생각해보면, 이제 엔비디아의 GB200 NVL72로 사전훈련된 모델들이 출시되고 있는 것이라고 생각합니다. 새로운 모델에 쓸 알고리즘들 연구(GPU 규모를 log scale로 계속 늘려가면서 수십~수백만 개 XPU에도 적합할 경우 새로운 Foundation Model에 투입)~사전훈련~사후훈련~정렬 등이 모델 출시 이전까지의 전체 과정입니다.
이 자료에서 다룬 사실
구글 딥마인드가 Gemini 3 Pro Deep Think를 출시했고 수학·과학·코딩에서 좋은 성능을 보인다고 적었다.
근거 보기 2
- 원문 구간 1
섹터 - 📈강세 : 유틸리티, 필수소비 - 📉약세 : 적자성장주, 테크, 반도체, 금융, 커뮤니케이션 📩 메이저 뉴스 보시는 순서는 이렇습니다. 제목 - 참고를 위해 살펴보는 기업군 주가 : 그날의 생각 빅테크: (1) 구글 딥마인드가 Gemini 3 Pro Deep Think 모델을 출시했습니다. 수학/과학/코딩 분야에서는 매우 좋은 퍼포먼스입니다. 다만, 벤치마크상 감안하셔야 할 부분은 Deep Think는 병렬 연산 Reasoning 모델입니다. 1개의 모델이 CoT로 단일 Reasoning 하는 모델들이 Gemini 3 Pro-Thinking-high, GPT-5.3-xhigh, Opus 4.6-Thinking-Max이고, 최소 3개 이상의 모델들이 서로 Reasoning하고 검증하면서 병렬로 추론하는 게 GPT-5.2-pro, Gemini 3 Deep Think입니다.
- 원문 구간 2
그래서 저 벤치마크상 정확한 의미의 비교군은 아니긴 합니다. 토큰을 훨씬 더 많이 쓰는 모델입니다. (2) 오픈AI가 한 달마다 GPT-5.1, GPT-5.2, GPT-5.3까지 사후훈련 값을 잘 내놓는 걸 보면 내부적으로 체크포인트 모델이야 갖고 있겠지만 아직 공개적으로 벤치마크를 공개하지 않았기에 그럴뿐입니다. 최근 상대적으로 정렬을 덜 거치는(미국은 보통 2~3개월, 중국은 ~1개월, 이 격차 때문에 빠르게 따라잡힌 것 같지만 시간이 지나서 보면 미국 모델이 우수한 상황이 지속되어 온 사이클), 상당히 우수한 퍼포먼스를 보이고 있는 중국 모델들(e.g. GLM-5)이 춘절을 앞두고 줄줄이 출시되고 있는데 1월 20일에 MSL도 Avocado 사전훈련이 끝났던 것을 생각해보면, 이제 엔비디아의 GB200 NVL72로 사전훈련된 모델들이 출시되고 있는 것이라고 생각합니다. 새로운 모델에 쓸 알고리즘들 연구(GPU 규모를 log scale로 계속 늘려가면서 수십~수백만 개 XPU에도 적합할 경우 새로운 Foundation Model에 투입)~사전훈련~사후훈련~정렬 등이 모델 출시 이전까지의 전체 과정입니다.
그렇게 판단한 이유
Deep Think는 최소 세 모델이 서로 추론·검증하는 병렬 구조라 토큰을 훨씬 더 많이 쓴다고 설명했다.
근거 보기 1
- 원문 구간 1
그래서 저 벤치마크상 정확한 의미의 비교군은 아니긴 합니다. 토큰을 훨씬 더 많이 쓰는 모델입니다. (2) 오픈AI가 한 달마다 GPT-5.1, GPT-5.2, GPT-5.3까지 사후훈련 값을 잘 내놓는 걸 보면 내부적으로 체크포인트 모델이야 갖고 있겠지만 아직 공개적으로 벤치마크를 공개하지 않았기에 그럴뿐입니다. 최근 상대적으로 정렬을 덜 거치는(미국은 보통 2~3개월, 중국은 ~1개월, 이 격차 때문에 빠르게 따라잡힌 것 같지만 시간이 지나서 보면 미국 모델이 우수한 상황이 지속되어 온 사이클), 상당히 우수한 퍼포먼스를 보이고 있는 중국 모델들(e.g. GLM-5)이 춘절을 앞두고 줄줄이 출시되고 있는데 1월 20일에 MSL도 Avocado 사전훈련이 끝났던 것을 생각해보면, 이제 엔비디아의 GB200 NVL72로 사전훈련된 모델들이 출시되고 있는 것이라고 생각합니다. 새로운 모델에 쓸 알고리즘들 연구(GPU 규모를 log scale로 계속 늘려가면서 수십~수백만 개 XPU에도 적합할 경우 새로운 Foundation Model에 투입)~사전훈련~사후훈련~정렬 등이 모델 출시 이전까지의 전체 과정입니다.