2026.06.03 · 네이버 프리미엄 콘텐츠 · 올바른 미국주식 by SAPIENS

엔비디아 컴퓨텍스 2026 : 사람을 위한 CPU의 시대를 넘어, GPU를 굶기지 않는 CPU 'Vera'

유형
네이버 프리미엄 콘텐츠
날짜
2026.06.03
강연자/작성자
올바른 미국주식 by SAPIENS
분석 주제
미지정
자료 길이
본문 11,353자
1

문서 전체 조망

핵심 구조

에이전트형 AI에서는 CPU가 GPU를 쉬지 않게 만드는 시스템 부품이 된다

이 글은 Agentic AI가 단순한 챗봇을 넘어 실제 작업을 수행하면서 컴퓨팅 구조와 AI 팩토리의 수익성 기준을 어떻게 바꾸는지 설명한다. 그 변화 속에서 Vera CPU는 GPU의 토큰 생산을 막지 않는 CPU라는 역할로 제시되며, 칩 하나보다 시스템 가동·전력·운영 경험이 중요해진다는 점이 핵심이다.

에이전트는 컴퓨터를 쓰는 방식을 바꾼다

에이전트는 LLM이 생각하고 하네스가 도구·런타임을 조율해 실제 일을 처리하는 구조다. 모델·CPU·GPU·메모리·스토리지가 분산돼 움직이므로, 앱을 클릭하던 컴퓨팅에서 의도를 전달해 작업물을 만드는 컴퓨팅으로 옮겨간다고 설명한다.

AI 팩토리에서는 토큰 생산성이 수익성이다

토큰이 매출을 만들기 때문에 첫 추론까지의 시간, 와트당 토큰, 중단 없이 운용하는 시간, 자산의 유효 수명이 중요해진다. 하드웨어 구매가 아니라 실제 Production Token이 나오는 시점과 고정 전력에서의 토큰 생산량이 투자 회수의 기준이 된다는 관점이다.

클러스터 경쟁력은 칩 성능표만으로 정해지지 않는다

대형 클러스터는 케이블·서버·네트워크·전력·냉각·복구 소프트웨어가 함께 움직여야 하므로, 부품 하나의 신뢰성보다 중단을 감지하고 우회해 작업을 재개하는 시스템 역량이 중요하다. 엔비디아의 반복 배포 경험과 CUDA 생태계는 가동·유효 수명 측면의 강점으로 제시된다.

Vera는 GPU 활용률을 높이는 다섯 조건을 겨냥한다

Vera는 IPC·단일 스레드 성능, 코어당·시스템 대역폭, 전성비, 생태계를 묶어 GPU가 대기하지 않도록 설계됐다고 설명한다. 따라서 CPU는 GPU 앞을 가로막으면 안 됩니다. 이 점이 Vera의 숨은 강점입니다.

  • 코어당 메모리 대역폭은 Vera 13.6GB/s, AMD Turin 3.2GB/s, Intel Granite Rapids 6.6GB/s로 제시된다.
  • SQL 3배와 실시간 데이터 처리 6배는 엔비디아가 제시한 특정 조건의 워크로드 수치라는 유보를 함께 둔다.
ANALYSIS VIEW사건별 사실과 작성자의 판단, 지속 정보를 나누어 읽기
2
발생·예정 사건과 출처별 관점

이슈 분석

이 자료가 이슈의 어떤 사실을 다루고, 작성자가 무슨 결론을 어떤 근거로 내렸는지 원문에 붙여 읽습니다.

발생발표·발생 후발생일 26-6-1

26-6 엔비디아 GTC 타이베이 Vera CPU 발표

작성자의 핵심 판단

작성자는 Vera를 GPU의 토큰 생산을 막지 않도록 CPU가 실행 흐름과 데이터 이동을 조율하는 제품으로 평가한다. Grace 전환으로 이미 검증된 CPU 생태계 위에서 출발한다는 점을 숨은 강점으로 본다.

근거 보기 2
  1. 원문 구간 1

    ​ AI 팩토리의 경제성은 결국 단위 시간당 얼마나 많은 토큰을 생성할 수 있느냐에서 결정됩니다. 그리고 토큰은 GPU에서 만들어집니다. 따라서 CPU는 GPU 앞을 가로막으면 안 됩니다. CPU가 느리면 GPU가 대기하게 되고, GPU가 대기하면 토큰 생산량이 줄고, 토큰 생산량이 줄면 AI 팩토리의 ROI가 떨어집니다. 이 관점에서 CPU는 더 이상 부수적인 부품이 아니라 가장 비싼 자산인 GPU의 활용률을 결정하는 핵심 인프라입니다. ​ 이 배경에서 Vera를 정의하는 특성은 다섯 가지입니다: ​ 첫째, IPC와 단일 스레드 성능 Agentic AI에서는 지연시간이 매우 중요합니다. 에이전트가 툴을 호출하고, 코드를 실행하고, 데이터베이스를 조회하고, 다음 행동을 결정하는 과정은 짧은 작업이 연속적으로 이어지는 구조입니다. 이런 워크로드에서는 단순히 코어 수를 많이 늘리는 것만으로는 충분하지 않습니다. 각각의 작업을 빠르게 처리하는 단일 스레드 성능이 중요합니다. ​ Vera는 GPU 옆에서 즉각적으로 반응해야 하는 CPU이기에 클럭당 더 많은 명령어를 가져오고, 해독하고, 실행할 수 있도록 설계됐습니다.

  2. 원문 구간 2

    고객 입장에서는 소프트웨어 호환성, 보안 검증, 운영 안정성, 장애 대응, 기존 인프라와의 통합을 모두 다시 확인해야 하기 때문입니다. ​ 엔비디아는 이 전환을 상당 부분 완료했습니다. 그리고 Vera는 이 기반 위에서 출발합니다. 완전히 낯선 CPU 생태계를 처음부터 설득해야 하는 것이 아니라 이미 Grace를 통해 엔비디아 CPU를 검증한 고객들에게 다음 세대 CPU로 들어가는 구조입니다. 이 점이 Vera의 숨은 강점입니다. ​ 실제 성능 향상 사례 : SQL 3배, 실시간 데이터 스트리밍 6배 x86 CPU로 쓰이던 워크로드에서 의미 있는 성능 향상을 보였습니다. ​ SQL 3배 속도 향상 → SQL은 세계에서 가장 널리 쓰이는 데이터베이스의 엔진입니다. 기업 데이터베이스, 분석 시스템, 애플리케이션 백엔드, 금융 시스템, 클라우드 서비스 대부분이 SQL 기반 워크로드를 사용합니다.

이 자료에서 다룬 사실

이 자료는 엔비디아 COMPUTEX 2026을 리뷰하며 Vera를 에이전트를 위한 CPU로 소개하고, IPC·단일 스레드 성능, 코어당 메모리 대역폭, 시스템 대역폭, 전성비, 생태계의 다섯 특성을 짚는다.

근거 보기 3
  1. 원문 구간 1

    [원문 유형] 네이버 프리미엄 콘텐츠 [채널] 올바른 미국주식 by SAPIENS [게시일] 2026.06.03. 오후 3:22 [원문 URL] https://contents.premium.naver.com/sapiens/sapiensasset/contents/260603152236408hq [제목] 엔비디아 컴퓨텍스 2026 : 사람을 위한 CPU의 시대를 넘어, GPU를 굶기지 않는 CPU 'Vera' [수집 기준] 승인된 구독 열람권으로 실제 본문을 보존했다. 이미지·첨부는 별도 미디어 원장에 보관하며 시각적 의미 검토 여부를 구분한다. [구독 원문 본문] ​ 안녕하세요 올바른입니다. ​ 엔비디아 COMPUTEX 2026 리뷰입니다. 지금까지의 모든 CPU는 사람을 위한 것이었고, Vera는 에이전트를 위한 첫 CPU라는 데에 의의가 있습니다. ​ 이전의 소프트웨어들을 다루던 컴퓨팅 방식에서, 이제는 모든 소프트웨어가 Agentic AI 워크플로우를 잘 다루는 컴퓨팅으로 전환되어가고 있습니다. ​ Vera CPU가 가진 고유한 다섯 가지 강점: ⓐIPC와 단일 스레드 성능, ⓑ코어당 메모리 대역폭, ⓒ시스템 대역폭, ⓓ전성비, ⓔ생태계의 이점을 짚어봤습니다.

  2. 원문 구간 2

    새로운 모델, 라이브러리, 프레임워크, 최적화 기법이 나올 때도 대부분 엔비디아 환경을 우선적으로 지원합니다. 시장점유율의 문제가 아니라 자산이 오래 쓸모 있게 남을 가능성을 높여주는 구조적 장점입니다. ​ Vera CPU Agentic AI에 가장 잘 맞는 CPU 에이전트 시대를 위한 첫 CPU, "베라(Vera)" "지금까지의 모든 CPU는 사람을 위해 만들어졌다. Vera는 에이전트를 위해 만들어진 최초의 CPU이다" 젠슨 황, COMPUTEX 2026 Keynote 中 기존 데이터센터에서 CPU는 사람이 요청한 작업을 처리하고 여러 사용자가 나눠서 쓰는 범용 컴퓨팅 자원이었습니다. 서버 한 대에 최대한 많은 코어를 넣고, 이를 가상화해서 시간 단위로 임대하는 방식이 중요했습니다. ​ 하지만 Agentic AI는 에이전트가 스스로 도구를 호출하고, 데이터베이스에 접근하고, 코드를 실행하고, 외부 시스템을 확인하고, 여러 단계의 추론을 반복합니다. 이 과정에서 GPU는 토큰을 생성하지만 그 GPU가 쉬지 않고 일하게 만들기 위해서는 CPU가 뒤에서 모델 실행 흐름을 조율하고, KV cache를 관리하고, 데이터와 스토리지를 빠르게 연결하고, 수많은 툴 호출을 지연 없이 처리해야 합니다.

  3. 원문 구간 3

    ​ AI 팩토리의 경제성은 결국 단위 시간당 얼마나 많은 토큰을 생성할 수 있느냐에서 결정됩니다. 그리고 토큰은 GPU에서 만들어집니다. 따라서 CPU는 GPU 앞을 가로막으면 안 됩니다. CPU가 느리면 GPU가 대기하게 되고, GPU가 대기하면 토큰 생산량이 줄고, 토큰 생산량이 줄면 AI 팩토리의 ROI가 떨어집니다. 이 관점에서 CPU는 더 이상 부수적인 부품이 아니라 가장 비싼 자산인 GPU의 활용률을 결정하는 핵심 인프라입니다. ​ 이 배경에서 Vera를 정의하는 특성은 다섯 가지입니다: ​ 첫째, IPC와 단일 스레드 성능 Agentic AI에서는 지연시간이 매우 중요합니다. 에이전트가 툴을 호출하고, 코드를 실행하고, 데이터베이스를 조회하고, 다음 행동을 결정하는 과정은 짧은 작업이 연속적으로 이어지는 구조입니다. 이런 워크로드에서는 단순히 코어 수를 많이 늘리는 것만으로는 충분하지 않습니다. 각각의 작업을 빠르게 처리하는 단일 스레드 성능이 중요합니다. ​ Vera는 GPU 옆에서 즉각적으로 반응해야 하는 CPU이기에 클럭당 더 많은 명령어를 가져오고, 해독하고, 실행할 수 있도록 설계됐습니다.

그렇게 판단한 이유

에이전트 작업에서는 CPU가 느리면 GPU가 대기해 토큰 생산과 AI 팩토리 ROI가 줄어들며, 단일 스레드 성능·코어당 대역폭·시스템 대역폭·전성비·호환 생태계가 그 병목을 줄이는 조건이라는 연결을 든다.

근거 보기 5
  1. 원문 구간 1

    ​ AI 팩토리의 경제성은 결국 단위 시간당 얼마나 많은 토큰을 생성할 수 있느냐에서 결정됩니다. 그리고 토큰은 GPU에서 만들어집니다. 따라서 CPU는 GPU 앞을 가로막으면 안 됩니다. CPU가 느리면 GPU가 대기하게 되고, GPU가 대기하면 토큰 생산량이 줄고, 토큰 생산량이 줄면 AI 팩토리의 ROI가 떨어집니다. 이 관점에서 CPU는 더 이상 부수적인 부품이 아니라 가장 비싼 자산인 GPU의 활용률을 결정하는 핵심 인프라입니다. ​ 이 배경에서 Vera를 정의하는 특성은 다섯 가지입니다: ​ 첫째, IPC와 단일 스레드 성능 Agentic AI에서는 지연시간이 매우 중요합니다. 에이전트가 툴을 호출하고, 코드를 실행하고, 데이터베이스를 조회하고, 다음 행동을 결정하는 과정은 짧은 작업이 연속적으로 이어지는 구조입니다. 이런 워크로드에서는 단순히 코어 수를 많이 늘리는 것만으로는 충분하지 않습니다. 각각의 작업을 빠르게 처리하는 단일 스레드 성능이 중요합니다. ​ Vera는 GPU 옆에서 즉각적으로 반응해야 하는 CPU이기에 클럭당 더 많은 명령어를 가져오고, 해독하고, 실행할 수 있도록 설계됐습니다.

  2. 원문 구간 2

    젠슨 황은 이를 클럭당 10개의 명령어를 처리할 수 있는 구조라고 설명했습니다. ​ 둘째, 코어당 메모리 대역폭 CPU 코어가 아무리 빠르더라도 필요한 데이터가 제때 들어오지 않으면 성능은 나오지 않습니다. 에이전트는 메모리에 접근하고, 데이터베이스를 조회하고, 스토리지에서 문서를 불러오고, GPU와 데이터를 주고받고, 때로는 샌드박스 환경에서 코드를 실행합니다. ​ 이때 중요한 것은 단순한 총 대역폭이 아니라 각 CPU 코어가 실제로 사용할 수 있는 대역폭입니다. 코어 수만 많고 코어당 데이터 공급이 부족하면 많은 코어가 동시에 굶는 상황이 생깁니다. Vera CPU의 코어당 메모리 대역폭은 13.6GB/s입니다. 반면 AMD Turin은 3.2GB/s, Intel Granite Rapids는 6.6GB/s입니다. Vera는 코어당 메모리 접근 능력에서 AMD 대비 약 4.3배, Intel 대비 약 2.1배 높습니다. ​ 셋째, 전체 시스템의 대역폭

  3. 원문 구간 3

    Agentic AI 시스템은 본질적으로 분산형입니다. 하나의 거대한 칩 안에서 모든 일이 끝나는 것이 아니라, CPU, GPU, 메모리, 스토리지, 네트워크, 데이터베이스, 외부 툴이 계속 연결됩니다. 컴퓨팅이 분산될수록 가장 큰 병목은 네트워크와 데이터 이동입니다. 내부와 외부의 대역폭이 매우 중요하단 의미입니다. ​ CPU 코어끼리 빠르게 통신해야 하고, CPU와 GPU 사이도 빠르게 연결돼야 하며, CPU와 스토리지 사이에서도 병목이 없어야 합니다. 에이전트가 여러 작업을 동시에 수행하고, 실시간 데이터를 처리하고, 긴 컨텍스트와 외부 데이터를 계속 참조하려면 CPU 주변의 데이터 이동 능력이 가장 중요합니다. ​ 넷째, 에너지 효율 전력이 고정되어 있는 데이터센터 클러스터 특성상 같은 전력 안에서 얼마나 많은 토큰을 생산하느냐가 경제성을 결정합니다. 구리를 광으로 바꾸고 CPO를 도입하는 것도 에너지 효율 차원에서 개선하기 위함이기도 합니다. 1GW에 네트워킹이 가져가는 전력의 점유율이 줄어들면 그만큼 컴퓨팅을 더 많이 넣을 수 있고 더 많은 토큰을 생산하여 ROI를 높일 수 있기 때문입니다.

  4. 원문 구간 4

    ​ Vera가 Arm 기반 CPU + LPDDR 메모리 조합을 쓰기에 전성비가 가장 좋습니다. x86에 비해서 ARM 조합이 전성비가 좋고, 일반적인 서버 CPU는 DDR 메모리를 중심으로 설계되지만 LPDDR은 모바일/저전력 환경에서 발전해온 메모리이기 때문에 전성비가 좋은 조합입니다. ​ 다섯째, 이미 검증된 생태계 성능만큼 중요한 것이 검증된 생태계입니다. 데이터센터 CPU는 단순히 성능이 좋다고 바로 대규모로 채택되는 제품이 아닙니다. 클라우드, 엔터프라이즈, 보안 스택, 운영체제, 가상화, 컨테이너, AI 프레임워크, 스토리지, 네트워킹까지 모두 검증을 거쳐야 합니다. ​ 엔비디아는 이미 중요한 전환을 한 번 성공시켰습니다. Grace Blackwell 전환 당시 가장 큰 리스크는 외부 x86 CPU에서 엔비디아의 Grace CPU로 넘어가는 것이었습니다. GPU는 엔비디아가 원래 강한 영역이었지만 CPU를 자체 플랫폼 안으로 끌어들이는 것은 훨씬 어려운 일입니다.

  5. 원문 구간 5

    고객 입장에서는 소프트웨어 호환성, 보안 검증, 운영 안정성, 장애 대응, 기존 인프라와의 통합을 모두 다시 확인해야 하기 때문입니다. ​ 엔비디아는 이 전환을 상당 부분 완료했습니다. 그리고 Vera는 이 기반 위에서 출발합니다. 완전히 낯선 CPU 생태계를 처음부터 설득해야 하는 것이 아니라 이미 Grace를 통해 엔비디아 CPU를 검증한 고객들에게 다음 세대 CPU로 들어가는 구조입니다. 이 점이 Vera의 숨은 강점입니다. ​ 실제 성능 향상 사례 : SQL 3배, 실시간 데이터 스트리밍 6배 x86 CPU로 쓰이던 워크로드에서 의미 있는 성능 향상을 보였습니다. ​ SQL 3배 속도 향상 → SQL은 세계에서 가장 널리 쓰이는 데이터베이스의 엔진입니다. 기업 데이터베이스, 분석 시스템, 애플리케이션 백엔드, 금융 시스템, 클라우드 서비스 대부분이 SQL 기반 워크로드를 사용합니다.

원문에서 직접 연결한 대상엔비디아Vera CPU
3
사실·구조, 해석·전망, 시점 관찰, 판단 방법

지식·관점

사건 밖에서도 다시 참고하거나 다른 자료와 비교할 가치가 있는 내용을 대상과 반복 가능한 논점으로 묶습니다.

사실·구조Agentic AI의 분산형 작업 구조주 대상 · 기술·제품 · Agentic AI

에이전트형 AI는 기존 애플리케이션 컴퓨팅과 어떻게 다른가?

이 자료가 더한 내용

에이전트는 LLM과 하네스, 도구, 런타임으로 구성되며, 하네스가 상황 파악·추론·실행계획을 조율한다. 모델은 GPU에서 생각하고, 도구 사용은 CPU·GPU에서, 전체 작업의 지휘와 조율은 CPU에서 이뤄지는 분산형 구조라고 설명한다.

근거 보기 2
  1. 원문 구간 1

    ​ 무언가 요청이 들어오면 에이전트는 이해하고, 관찰하고, 추론하고, 행동하고, 도구를 사용합니다. 여기서 '도구'란 스프레드시트, 크롬 브라우저, 데이터처리 엔진, 데이터베이스 등입니다. ​ LLM은 모든 종류의 생각을 담당하고, 하네스는 마치 이전의 OS처럼 모든 것을 연결하고 오케스트레이션합니다. 구체적으로 보자면 하네스에서는 정보가 오갈 때마다 지금 무슨 상황인지를 파악하고, 무엇을 할지를 추론하고, 실행 계획을 수립하고, 실행하는 경로를 짭니다. 이러한 작업 구조를 에이전트라고 부릅니다. ​ 핵심은 컴퓨터를 다루는 방식 자체가 바뀐다는 것입니다. 예전에는 앱을 실행하고, 클릭하고, 타이핑했습니다. 이제는 AI에게 내가 어떤 작업물을 원하는지 의도를 설명하면 알아서 코드를 짜주고, 도구를 사용해 결과물을 만들어냅니다. 이것이 앞으로 인류가 컴퓨터와 함께 일하는 방식입니다. ​ 에이전트 = 궁극의 분산형 컴퓨팅 모델 그렇다면 Agentic AI로 인해 소프트웨어가 어떻게 작동하는지가 곧 앞으로의 컴퓨팅 시스템이 어떻게 바뀌느냐와도 같습니다. 그런데 이 에이전트는 컴퓨팅 패턴 자체가 다릅니다.

  2. 원문 구간 2

    분산형 컴퓨팅(disaggregated) 모델의 시작입니다. 작업 하나를 처리하기 위해 수많은 서로 다른 유형의 컴퓨터가 동시에 작동해서 처리하는 모델입니다. ​ 에이전트는 ⓐ모델 ⓑ하네스 ⓒ도구 ⓓ런타임으로 이루어져 있습니다. 모델은 두뇌와 같고, 하니스는 두뇌의 지시를 실행에 옮기는 틀 느낌으로 몸통과 같으며, 도구와 런타임은 실제 일을 처리하는 공간과 도구입니다. 이 요소들은 AI 팩토리(=데이터센터) 안의 서로 다른 위치에서 따로따로 돌아갑니다. ​ LLM이 생각할 때 → GPU 도구를 사용할 때 → ​CPU, GPU 전체의 모든 작업 지휘/조율 → CPU ​ 그리고 이 구조에서 가장 까다로운 부분이 메모리입니다. 에이전트는 이 과정에서 사람처럼 단기기억(작업기억)과 장기기억을 함께 다루기에 메모리 관리 시스템이 대단히 중요합니다. KV cache를 ms 단위로 담아둘 HBM > 수 초 단위로 담아둘 DRAM > 몇 분 단위로 담아둘 SSD > 1시간 단위로 담아둘 HDD 구조에 맞춰서 어떤 것을 기억하고, 어떻게 압축할 것이며, 어떻게 다시 꺼내올 것인가를 생각해야 합니다.

사실·구조AI 팩토리의 토큰 생산 경제성주 대상 · 산업·업종 · AI 데이터센터

AI 팩토리의 투자 회수와 수익성은 무엇으로 결정되는가?

이 자료가 더한 내용

AI 팩토리에서는 토큰이 매출을 만들므로 가동 속도(TTFI), 와트당 토큰(Token/Watt), 중단 사이 평균 시간(MTBI), 자산의 유효 수명이 수익성을 결정한다고 정리한다. 고정된 전력 안에서 토큰을 더 생산하고 실제 가동까지의 시간을 줄이는 것이 투자 회수와 연결된다는 설명이다.

근거 보기 6
  1. 원문 구간 1

    토크노믹스 Compute is Revenue "Compute is Revenue" AI 시대에는 컴퓨팅 그 자체가 곧 매출입니다. AI 팩토리가 만들어내는 토큰이 하나하나 다 돈이 되기 때문입니다. 토큰을 많이, 빠르게, 효율적으로 뽑아낼수록 매출과 이익이 높아집니다. 반대로 놀고 있는 컴퓨팅, 멈춰있는 설비는 그대로 손실입니다. 요즘 말씀드리는 것처럼 이미 엄청난 산업이 됐기 때문에 이제부터는 무언가를 구현하느냐 못하느냐가 문제가 아니라 투자 대비 얼마나 회수하느냐가 가장 중요합니다. ​ AI 팩토리의 수익성은 네 가지로 결정됩니다: ​ 얼마나 빨리 가동되는가 → TTFI(Time-to-First-Inference) *요청 단위로는 TTFT를 더 많이 쓰긴 합니다* 와트당 토큰을 얼마나 뽑아내는가 → Token/Watt 멈추지 않고 안정적으로 돌아가는가 → MTBI(Mean Time Between Interruptions) 얼마나 오랫동안 쓸모있는가 → Useful Life ​ 가동 속도 - TTFI : 첫 추론까지 걸리는 시간 고객사 입장에서 AI 인프라는 장비를 들여놓는다고 끝나는 문제가 아닙니다.

  2. 원문 구간 2

    실제로 중요한 것은 클러스터가 설치된 뒤, 훈련이나 추론 작업을 통해 첫 번째 Production Token이 나오기까지 얼마나 걸리느냐입니다. 즉, 하드웨어 구매 시점이 아니라 실제 매출과 서비스로 연결되는 시점까지의 시간이 핵심입니다. ​ 이 관점에서 엔비디아의 강점은 단순히 GPU를 잘 만드는 데 있지 않습니다. 엔비디아는 개별 칩을 판매하는 기업이라기보다 AI 데이터센터 전체를 하나의 시스템으로 설계한 뒤 이를 서버, 네트워킹, 전력, 냉각, 소프트웨어, 랙 단위 인프라로 분해해 공급망 기업들과 함께 제품화하는 기업입니다. ​ GPU가 실제 데이터센터 안에서 어떻게 연결되고, 어떻게 통신하고, 어떻게 냉각되고, 어떻게 스케줄링되며, 어떻게 대규모 클러스터로 작동하는지까지 통째로 공동 설계합니다. 그리고 이 구조를 실제로 수많은 고객사 환경에서 반복적으로 배포하고 검증해왔습니다. 데이터센터 투자 회수 기간과 직결되는 경제적 장점입니다. ​ *SemiAnalysis에 따르면, AMD의 첫 랙 스케일 제품인 MI450X(Helios 랙)은 출시 및 매출인식은 2H26이지만 사실 고객사 입장에서 가장 중요한 Production Token이 나오는 시점은 1Q27쯤 예정입니다.

  3. 원문 구간 3

    이걸 공식적으로 말하진 못하지만 TTFI를 집어넣은 데에는 이것을 강조하고자 하는 함의가 있어 보입니다. ​ 전력 효율 - Token/Watt : 와트당 토큰이 곧 매출 AI 팩토리의 한계는 전력입니다. 1GW 데이터센터는 1GW가 전부입니다. 전력이 고정되어 있다면 같은 와트로 토큰을 얼마나 뽑아낼 수 있는가가 곧 매출을 결정합니다. 즉, 하이퍼스케일러 입장에서는 (ㄱ) 올해 온라인 가능한 GW x (ㄴ) Tokens per Watt = (ㄷ) 올해에 더해질 증분 매출입니다. ​ 고객사 입장에서는 단순히 칩이 싸다는 이유만으로 아키텍처를 선택하기 어렵습니다. 초기 장비 가격은 아끼지만 전력당 토큰 생산량이 낮으면 장기적으로는 오히려 손해가 될 수 있기 때문입니다. ​ 신뢰성 - MTBI : 얼마나 오래 멈추지 않고 돌릴 수 있는가 데이터센터 안에는 수백만 개의 케이블, 서버, 스위치, NIC, 전원장치, 냉각장치 등 수많은 부품이 동시에 맞물려 돌아갑니다. 개별 부품의 MTBF(평균 무고장 시간)을 높이는 것도 중요하지만, 현실적으로 모든 부품의 신뢰성을 무한정 끌어올릴 수는 없습니다.

  4. 원문 구간 4

    일정 수준을 넘어가면 비용 대비 효과가 급격히 떨어지고, 설령 개별 부품의 신뢰성을 크게 높인다 해도 클러스터 전체 규모가 워낙 크기 때문에 전체 시스템이 1년 내내 아무 문제 없이 돌아가는 것은 사실상 불가능합니다. ​ 그래서 고객사 입장에서 더 중요한 지표는 개별 부품의 MTBF가 아니라, 클러스터 단위의 MTBI입니다. MTBI는 한 번 가동이 중단된 뒤 다음 중단이 발생하기까지 걸리는 평균 시간을 의미합니다. 다시 말해, 고객이 실제로 체감하는 신뢰성은 '부품 하나가 얼마나 오래 버티느냐'보다 '전체 AI 클러스터가 얼마나 오랫동안 의미 있는 중단 없이 계속 훈련/추론 작업을 수행할 수 있느냐'입니다. ​ 좋은 부품을 많이 넣는다고 해결되진 않습니다. 대규모 AI 클러스터에서는 GPU, 네트워크, 스토리지, 전력, 냉각, 스케줄링 소프트웨어, 장애 감지 및 복구 시스템이 모두 하나의 유기적인 시스템처럼 움직여야 합니다. 특정 노드나 링크에 문제가 생겼을 때 작업을 얼마나 빠르게 우회하고, 장애를 얼마나 빨리 감지하며, 전체 학습 작업을 얼마나 적은 손실로 재개할 수 있는지가 핵심입니다.

  5. 원문 구간 5

    ​ 이 영역에서는 엔비디아처럼 초대형 AI 클러스터를 오랫동안 운영해온 기업의 경험이 중요한 차별점이 됩니다. 하드웨어 설계, 네트워킹 구조, 시스템 소프트웨어, 클러스터 운영 노하우가 축적될수록 단순한 부품 성능을 넘어 멈추지 않고 계속 돌아가는 AI 인프라를 만들 수 있기 때문입니다. ​ 자산 수명 - Useful Life : 얼마나 오래 쓸모 있는가 AI 인프라에서 가장 판단하기 어려운 부분은 자산의 유효 수명입니다. GPU나 서버를 한 번 구매했다고 해서 그 설비가 내구연한 6년 동안 동일한 경제성을 유지한다는 보장이 없습니다. AI 소프트웨어와 모델 구조가 너무 빠르게 바뀌기 때문입니다. 앞으로 등장할 새로운 워크로드에도 얼마나 유연하게 대응할 수 있느냐도 중요하다는 의미입니다. 아키텍처가 폐쇄적이거나 소프트웨어 생태계가 빈약하다면 그 설비가 3년 뒤에도 충분히 쓸모 있을지 예측하기 어렵습니다. 특정 모델이나 특정 연산 방식에는 효율적이더라도 AI의 방향이 바뀌는 순간 활용도가 빠르게 떨어질 수 있기 때문입니다. ​ 엔비디아 시스템은 이미 전 세계 AI 인프라에 광범위하게 깔려 있고, 개발자 생태계도 CUDA를 중심으로 형성되어 있습니다.

  6. 원문 구간 6

    새로운 모델, 라이브러리, 프레임워크, 최적화 기법이 나올 때도 대부분 엔비디아 환경을 우선적으로 지원합니다. 시장점유율의 문제가 아니라 자산이 오래 쓸모 있게 남을 가능성을 높여주는 구조적 장점입니다. ​ Vera CPU Agentic AI에 가장 잘 맞는 CPU 에이전트 시대를 위한 첫 CPU, "베라(Vera)" "지금까지의 모든 CPU는 사람을 위해 만들어졌다. Vera는 에이전트를 위해 만들어진 최초의 CPU이다" 젠슨 황, COMPUTEX 2026 Keynote 中 기존 데이터센터에서 CPU는 사람이 요청한 작업을 처리하고 여러 사용자가 나눠서 쓰는 범용 컴퓨팅 자원이었습니다. 서버 한 대에 최대한 많은 코어를 넣고, 이를 가상화해서 시간 단위로 임대하는 방식이 중요했습니다. ​ 하지만 Agentic AI는 에이전트가 스스로 도구를 호출하고, 데이터베이스에 접근하고, 코드를 실행하고, 외부 시스템을 확인하고, 여러 단계의 추론을 반복합니다. 이 과정에서 GPU는 토큰을 생성하지만 그 GPU가 쉬지 않고 일하게 만들기 위해서는 CPU가 뒤에서 모델 실행 흐름을 조율하고, KV cache를 관리하고, 데이터와 스토리지를 빠르게 연결하고, 수많은 툴 호출을 지연 없이 처리해야 합니다.

해석·전망엔비디아 AI 클러스터의 시스템 배포·운영 역량주 대상 · 기업·종목 · 엔비디아관련 대상 · 산업·업종 · AI 데이터센터

AI 인프라에서 개별 칩 성능 외에 시스템 경험과 생태계가 왜 중요한가?

이 자료가 더한 내용

엔비디아는 GPU뿐 아니라 서버·네트워킹·전력·냉각·소프트웨어·랙을 함께 설계하고 고객 환경에 반복 배포해왔다는 점을 장점으로 든다. 대규모 클러스터에서는 부품의 평균 무고장 시간보다 장애 감지·우회·복구를 포함해 의미 있는 중단 없이 전체 작업을 지속하는 MTBI가 중요하며, CUDA 중심 생태계는 새 모델과 프레임워크가 나와도 자산 활용 기간을 늘릴 구조적 장점이라고 평가한다.

근거 보기 4
  1. 원문 구간 1

    실제로 중요한 것은 클러스터가 설치된 뒤, 훈련이나 추론 작업을 통해 첫 번째 Production Token이 나오기까지 얼마나 걸리느냐입니다. 즉, 하드웨어 구매 시점이 아니라 실제 매출과 서비스로 연결되는 시점까지의 시간이 핵심입니다. ​ 이 관점에서 엔비디아의 강점은 단순히 GPU를 잘 만드는 데 있지 않습니다. 엔비디아는 개별 칩을 판매하는 기업이라기보다 AI 데이터센터 전체를 하나의 시스템으로 설계한 뒤 이를 서버, 네트워킹, 전력, 냉각, 소프트웨어, 랙 단위 인프라로 분해해 공급망 기업들과 함께 제품화하는 기업입니다. ​ GPU가 실제 데이터센터 안에서 어떻게 연결되고, 어떻게 통신하고, 어떻게 냉각되고, 어떻게 스케줄링되며, 어떻게 대규모 클러스터로 작동하는지까지 통째로 공동 설계합니다. 그리고 이 구조를 실제로 수많은 고객사 환경에서 반복적으로 배포하고 검증해왔습니다. 데이터센터 투자 회수 기간과 직결되는 경제적 장점입니다. ​ *SemiAnalysis에 따르면, AMD의 첫 랙 스케일 제품인 MI450X(Helios 랙)은 출시 및 매출인식은 2H26이지만 사실 고객사 입장에서 가장 중요한 Production Token이 나오는 시점은 1Q27쯤 예정입니다.

  2. 원문 구간 2

    일정 수준을 넘어가면 비용 대비 효과가 급격히 떨어지고, 설령 개별 부품의 신뢰성을 크게 높인다 해도 클러스터 전체 규모가 워낙 크기 때문에 전체 시스템이 1년 내내 아무 문제 없이 돌아가는 것은 사실상 불가능합니다. ​ 그래서 고객사 입장에서 더 중요한 지표는 개별 부품의 MTBF가 아니라, 클러스터 단위의 MTBI입니다. MTBI는 한 번 가동이 중단된 뒤 다음 중단이 발생하기까지 걸리는 평균 시간을 의미합니다. 다시 말해, 고객이 실제로 체감하는 신뢰성은 '부품 하나가 얼마나 오래 버티느냐'보다 '전체 AI 클러스터가 얼마나 오랫동안 의미 있는 중단 없이 계속 훈련/추론 작업을 수행할 수 있느냐'입니다. ​ 좋은 부품을 많이 넣는다고 해결되진 않습니다. 대규모 AI 클러스터에서는 GPU, 네트워크, 스토리지, 전력, 냉각, 스케줄링 소프트웨어, 장애 감지 및 복구 시스템이 모두 하나의 유기적인 시스템처럼 움직여야 합니다. 특정 노드나 링크에 문제가 생겼을 때 작업을 얼마나 빠르게 우회하고, 장애를 얼마나 빨리 감지하며, 전체 학습 작업을 얼마나 적은 손실로 재개할 수 있는지가 핵심입니다.

  3. 원문 구간 3

    ​ 이 영역에서는 엔비디아처럼 초대형 AI 클러스터를 오랫동안 운영해온 기업의 경험이 중요한 차별점이 됩니다. 하드웨어 설계, 네트워킹 구조, 시스템 소프트웨어, 클러스터 운영 노하우가 축적될수록 단순한 부품 성능을 넘어 멈추지 않고 계속 돌아가는 AI 인프라를 만들 수 있기 때문입니다. ​ 자산 수명 - Useful Life : 얼마나 오래 쓸모 있는가 AI 인프라에서 가장 판단하기 어려운 부분은 자산의 유효 수명입니다. GPU나 서버를 한 번 구매했다고 해서 그 설비가 내구연한 6년 동안 동일한 경제성을 유지한다는 보장이 없습니다. AI 소프트웨어와 모델 구조가 너무 빠르게 바뀌기 때문입니다. 앞으로 등장할 새로운 워크로드에도 얼마나 유연하게 대응할 수 있느냐도 중요하다는 의미입니다. 아키텍처가 폐쇄적이거나 소프트웨어 생태계가 빈약하다면 그 설비가 3년 뒤에도 충분히 쓸모 있을지 예측하기 어렵습니다. 특정 모델이나 특정 연산 방식에는 효율적이더라도 AI의 방향이 바뀌는 순간 활용도가 빠르게 떨어질 수 있기 때문입니다. ​ 엔비디아 시스템은 이미 전 세계 AI 인프라에 광범위하게 깔려 있고, 개발자 생태계도 CUDA를 중심으로 형성되어 있습니다.

  4. 원문 구간 4

    새로운 모델, 라이브러리, 프레임워크, 최적화 기법이 나올 때도 대부분 엔비디아 환경을 우선적으로 지원합니다. 시장점유율의 문제가 아니라 자산이 오래 쓸모 있게 남을 가능성을 높여주는 구조적 장점입니다. ​ Vera CPU Agentic AI에 가장 잘 맞는 CPU 에이전트 시대를 위한 첫 CPU, "베라(Vera)" "지금까지의 모든 CPU는 사람을 위해 만들어졌다. Vera는 에이전트를 위해 만들어진 최초의 CPU이다" 젠슨 황, COMPUTEX 2026 Keynote 中 기존 데이터센터에서 CPU는 사람이 요청한 작업을 처리하고 여러 사용자가 나눠서 쓰는 범용 컴퓨팅 자원이었습니다. 서버 한 대에 최대한 많은 코어를 넣고, 이를 가상화해서 시간 단위로 임대하는 방식이 중요했습니다. ​ 하지만 Agentic AI는 에이전트가 스스로 도구를 호출하고, 데이터베이스에 접근하고, 코드를 실행하고, 외부 시스템을 확인하고, 여러 단계의 추론을 반복합니다. 이 과정에서 GPU는 토큰을 생성하지만 그 GPU가 쉬지 않고 일하게 만들기 위해서는 CPU가 뒤에서 모델 실행 흐름을 조율하고, KV cache를 관리하고, 데이터와 스토리지를 빠르게 연결하고, 수많은 툴 호출을 지연 없이 처리해야 합니다.

사실·구조Vera CPU의 에이전트형 AI 설계주 대상 · 기술·제품 · Vera CPU관련 대상 · 기업·종목 · 엔비디아

Vera CPU는 GPU 활용률을 위해 어떤 특성을 겨냥하는가?

이 자료가 더한 내용

GPU가 토큰을 생성하는 동안 CPU는 모델 실행을 조율하고 KV cache·데이터·스토리지·도구 호출을 처리해 GPU가 대기하지 않게 해야 한다고 설명한다. Vera의 다섯 특성으로 IPC와 단일 스레드 성능, 코어당 메모리 대역폭, 시스템 대역폭, 에너지 효율, 검증된 생태계를 제시하며, 코어당 메모리 대역폭은 13.6GB/s로 AMD Turin 3.2GB/s와 Intel Granite Rapids 6.6GB/s보다 높다고 적었다.

근거 보기 6
  1. 원문 구간 1

    ​ AI 팩토리의 경제성은 결국 단위 시간당 얼마나 많은 토큰을 생성할 수 있느냐에서 결정됩니다. 그리고 토큰은 GPU에서 만들어집니다. 따라서 CPU는 GPU 앞을 가로막으면 안 됩니다. CPU가 느리면 GPU가 대기하게 되고, GPU가 대기하면 토큰 생산량이 줄고, 토큰 생산량이 줄면 AI 팩토리의 ROI가 떨어집니다. 이 관점에서 CPU는 더 이상 부수적인 부품이 아니라 가장 비싼 자산인 GPU의 활용률을 결정하는 핵심 인프라입니다. ​ 이 배경에서 Vera를 정의하는 특성은 다섯 가지입니다: ​ 첫째, IPC와 단일 스레드 성능 Agentic AI에서는 지연시간이 매우 중요합니다. 에이전트가 툴을 호출하고, 코드를 실행하고, 데이터베이스를 조회하고, 다음 행동을 결정하는 과정은 짧은 작업이 연속적으로 이어지는 구조입니다. 이런 워크로드에서는 단순히 코어 수를 많이 늘리는 것만으로는 충분하지 않습니다. 각각의 작업을 빠르게 처리하는 단일 스레드 성능이 중요합니다. ​ Vera는 GPU 옆에서 즉각적으로 반응해야 하는 CPU이기에 클럭당 더 많은 명령어를 가져오고, 해독하고, 실행할 수 있도록 설계됐습니다.

  2. 원문 구간 2

    젠슨 황은 이를 클럭당 10개의 명령어를 처리할 수 있는 구조라고 설명했습니다. ​ 둘째, 코어당 메모리 대역폭 CPU 코어가 아무리 빠르더라도 필요한 데이터가 제때 들어오지 않으면 성능은 나오지 않습니다. 에이전트는 메모리에 접근하고, 데이터베이스를 조회하고, 스토리지에서 문서를 불러오고, GPU와 데이터를 주고받고, 때로는 샌드박스 환경에서 코드를 실행합니다. ​ 이때 중요한 것은 단순한 총 대역폭이 아니라 각 CPU 코어가 실제로 사용할 수 있는 대역폭입니다. 코어 수만 많고 코어당 데이터 공급이 부족하면 많은 코어가 동시에 굶는 상황이 생깁니다. Vera CPU의 코어당 메모리 대역폭은 13.6GB/s입니다. 반면 AMD Turin은 3.2GB/s, Intel Granite Rapids는 6.6GB/s입니다. Vera는 코어당 메모리 접근 능력에서 AMD 대비 약 4.3배, Intel 대비 약 2.1배 높습니다. ​ 셋째, 전체 시스템의 대역폭

  3. 원문 구간 3

    Agentic AI 시스템은 본질적으로 분산형입니다. 하나의 거대한 칩 안에서 모든 일이 끝나는 것이 아니라, CPU, GPU, 메모리, 스토리지, 네트워크, 데이터베이스, 외부 툴이 계속 연결됩니다. 컴퓨팅이 분산될수록 가장 큰 병목은 네트워크와 데이터 이동입니다. 내부와 외부의 대역폭이 매우 중요하단 의미입니다. ​ CPU 코어끼리 빠르게 통신해야 하고, CPU와 GPU 사이도 빠르게 연결돼야 하며, CPU와 스토리지 사이에서도 병목이 없어야 합니다. 에이전트가 여러 작업을 동시에 수행하고, 실시간 데이터를 처리하고, 긴 컨텍스트와 외부 데이터를 계속 참조하려면 CPU 주변의 데이터 이동 능력이 가장 중요합니다. ​ 넷째, 에너지 효율 전력이 고정되어 있는 데이터센터 클러스터 특성상 같은 전력 안에서 얼마나 많은 토큰을 생산하느냐가 경제성을 결정합니다. 구리를 광으로 바꾸고 CPO를 도입하는 것도 에너지 효율 차원에서 개선하기 위함이기도 합니다. 1GW에 네트워킹이 가져가는 전력의 점유율이 줄어들면 그만큼 컴퓨팅을 더 많이 넣을 수 있고 더 많은 토큰을 생산하여 ROI를 높일 수 있기 때문입니다.

  4. 원문 구간 4

    ​ Vera가 Arm 기반 CPU + LPDDR 메모리 조합을 쓰기에 전성비가 가장 좋습니다. x86에 비해서 ARM 조합이 전성비가 좋고, 일반적인 서버 CPU는 DDR 메모리를 중심으로 설계되지만 LPDDR은 모바일/저전력 환경에서 발전해온 메모리이기 때문에 전성비가 좋은 조합입니다. ​ 다섯째, 이미 검증된 생태계 성능만큼 중요한 것이 검증된 생태계입니다. 데이터센터 CPU는 단순히 성능이 좋다고 바로 대규모로 채택되는 제품이 아닙니다. 클라우드, 엔터프라이즈, 보안 스택, 운영체제, 가상화, 컨테이너, AI 프레임워크, 스토리지, 네트워킹까지 모두 검증을 거쳐야 합니다. ​ 엔비디아는 이미 중요한 전환을 한 번 성공시켰습니다. Grace Blackwell 전환 당시 가장 큰 리스크는 외부 x86 CPU에서 엔비디아의 Grace CPU로 넘어가는 것이었습니다. GPU는 엔비디아가 원래 강한 영역이었지만 CPU를 자체 플랫폼 안으로 끌어들이는 것은 훨씬 어려운 일입니다.

  5. 원문 구간 5

    고객 입장에서는 소프트웨어 호환성, 보안 검증, 운영 안정성, 장애 대응, 기존 인프라와의 통합을 모두 다시 확인해야 하기 때문입니다. ​ 엔비디아는 이 전환을 상당 부분 완료했습니다. 그리고 Vera는 이 기반 위에서 출발합니다. 완전히 낯선 CPU 생태계를 처음부터 설득해야 하는 것이 아니라 이미 Grace를 통해 엔비디아 CPU를 검증한 고객들에게 다음 세대 CPU로 들어가는 구조입니다. 이 점이 Vera의 숨은 강점입니다. ​ 실제 성능 향상 사례 : SQL 3배, 실시간 데이터 스트리밍 6배 x86 CPU로 쓰이던 워크로드에서 의미 있는 성능 향상을 보였습니다. ​ SQL 3배 속도 향상 → SQL은 세계에서 가장 널리 쓰이는 데이터베이스의 엔진입니다. 기업 데이터베이스, 분석 시스템, 애플리케이션 백엔드, 금융 시스템, 클라우드 서비스 대부분이 SQL 기반 워크로드를 사용합니다.

  6. 원문 구간 6

    매우 성숙한 영역이기 때문에 SQL 성능을 5%나 10% 개선하는 것도 쉽지 않습니다. 아마 3배 개선은 엔비디아가 제시한 특정 조건의 워크로드 기준으로 봐야 하겠지만 어쨌든 에이전트에 특화된 CPU임을 실질 지표로 확인해주는 값입니다. 에이전트가 기업의 업무를 자동화하려면 데이터베이스와 연결될 수밖에 없는데 이를 매우 빠르게 가져와주는 최적의 CPU가 Vera라는 게 주요 메시지입니다. ​ 데이터 실시간 처리 6배 향상 → 앞으로 AI는 저장해둔 문서만 읽는 게 아니라 공장이나 거래소에서 실시간으로 들어오는 데이터도 처리해야 합니다. 이런 실시간 데이터 처리도 Vera CPU가 우수하다는 것입니다. ​ 주요 구매자 목록 AI Labs : 오픈AI, 앤스로픽, 스페이스X(xAI) 클라우드 : 네비우스, 오라클, 코어위브, 엔스케일, 크루소, 람다 등

해석·전망Vera CPU의 성능 사례와 Grace 기반 전환주 대상 · 기술·제품 · Vera CPU관련 대상 · 기업·종목 · 엔비디아

Vera의 채택 논리는 성능 수치와 기존 CPU 전환 경험에서 어떻게 제시되는가?

이 자료가 더한 내용

SQL 3배와 실시간 데이터 처리 6배 향상은 엔비디아가 제시한 특정 조건의 워크로드 기준으로 보아야 한다는 유보와 함께, 에이전트가 데이터베이스·실시간 데이터를 다룰 때의 지표로 제시된다. 작성자는 Grace Blackwell 전환으로 고객이 엔비디아 CPU의 호환성·보안·운영을 상당 부분 검증했고, Vera는 그 기반 위의 다음 세대 CPU라는 점을 숨은 강점으로 본다.

근거 보기 2
  1. 원문 구간 1

    고객 입장에서는 소프트웨어 호환성, 보안 검증, 운영 안정성, 장애 대응, 기존 인프라와의 통합을 모두 다시 확인해야 하기 때문입니다. ​ 엔비디아는 이 전환을 상당 부분 완료했습니다. 그리고 Vera는 이 기반 위에서 출발합니다. 완전히 낯선 CPU 생태계를 처음부터 설득해야 하는 것이 아니라 이미 Grace를 통해 엔비디아 CPU를 검증한 고객들에게 다음 세대 CPU로 들어가는 구조입니다. 이 점이 Vera의 숨은 강점입니다. ​ 실제 성능 향상 사례 : SQL 3배, 실시간 데이터 스트리밍 6배 x86 CPU로 쓰이던 워크로드에서 의미 있는 성능 향상을 보였습니다. ​ SQL 3배 속도 향상 → SQL은 세계에서 가장 널리 쓰이는 데이터베이스의 엔진입니다. 기업 데이터베이스, 분석 시스템, 애플리케이션 백엔드, 금융 시스템, 클라우드 서비스 대부분이 SQL 기반 워크로드를 사용합니다.

  2. 원문 구간 2

    매우 성숙한 영역이기 때문에 SQL 성능을 5%나 10% 개선하는 것도 쉽지 않습니다. 아마 3배 개선은 엔비디아가 제시한 특정 조건의 워크로드 기준으로 봐야 하겠지만 어쨌든 에이전트에 특화된 CPU임을 실질 지표로 확인해주는 값입니다. 에이전트가 기업의 업무를 자동화하려면 데이터베이스와 연결될 수밖에 없는데 이를 매우 빠르게 가져와주는 최적의 CPU가 Vera라는 게 주요 메시지입니다. ​ 데이터 실시간 처리 6배 향상 → 앞으로 AI는 저장해둔 문서만 읽는 게 아니라 공장이나 거래소에서 실시간으로 들어오는 데이터도 처리해야 합니다. 이런 실시간 데이터 처리도 Vera CPU가 우수하다는 것입니다. ​ 주요 구매자 목록 AI Labs : 오픈AI, 앤스로픽, 스페이스X(xAI) 클라우드 : 네비우스, 오라클, 코어위브, 엔스케일, 크루소, 람다 등

4

시간흐름대로 모든 내용을 살려 정리

시간흐름대로 모든 내용을 살려 정리

1
자료의 범위와 Vera의 문제의식

안녕하세요 올바른입니다. 엔비디아 COMPUTEX 2026 리뷰입니다. 지금까지의 모든 CPU는 사람을 위한 것이었고, Vera는 에이전트를 위한 첫 CPU라는 데 의의가 있습니다. 이전 소프트웨어를 다루던 컴퓨팅에서 모든 소프트웨어가 Agentic AI 워크플로우를 잘 다루는 컴퓨팅으로 전환되고 있습니다. Vera의 고유한 강점은 IPC·단일 스레드 성능, 코어당 메모리 대역폭, 시스템 대역폭, 전성비, 생태계입니다.

2
연결 자료와 큰 흐름

큰 흐름 읽기에는 2026년 5월 27일 ‘LLM 추론 토큰 가격의 비밀 : MoE의 시대, 엔비디아 NVL72가 중요한 이유’, 4월 22일 ‘엔비디아 CEO 젠슨황 인터뷰 : TPU도 Trainium도, 그렇게 자신 있으면 공개적으로 붙자’, 3월 27일 앤스로픽 CEO 다리오 아모데이 인터뷰 ‘Extremely fast, but not infinitely fast’, 3월 5일 SemiAnalysis 인터뷰 ‘거품은 없다. ARR $100B가 온다’, 2025년 10월 8일 ‘오픈AI 퇴사자의 글 #1 : 2027년 AGI가 온다’를 바로가기 자료로 연결했습니다.

3
엔비디아와 인프라 분야의 이전 글

엔비디아 항목에는 2026년 5월 21일 ‘엔비디아 1Q26 실적발표 : 젠슨황, 하이퍼스케일러 CapEx보다 더 빠르게 성장’, 3월 17일 ‘엔비디아 GTC 2026 : 7개의 칩, 5개의 랙 시스템, 그리고 하나의 AI 슈퍼컴퓨터’, 2월 26일 4Q25 실적발표, 1월 2일 Groq 창업자 조나단 로스의 글을 남겼습니다. 광학에는 4월 17일 ‘빛의 시대’ 밸류체인, 3월 20일 OFC 2026, 3월 13일 AI 인프라의 새로운 병목인 광학, 3월 6일 비아비 솔루션스 분석을, 메모리에는 3월 19일 마이크론 1Q26, 1월 21일 추론 시대 메모리, 1월 7일 엔비디아 CES 2026과 Vera Rubin·ICMS 글을 연결했습니다.

4
네오클라우드 자료와 고지

네오클라우드에는 2026년 2월 22일 ‘네오클라우드 뜯어보기 #2 : 새로운 시대의 AI 계급도, 전력을 돈으로 바꾼 Powered Shell’과 2월 10일 ‘네오클라우드 뜯어보기 : GPU 임대의 경제학, 네오클라우드 BIG 4 비교분석’을 연결합니다. 투자자문 서비스에 따른 투자 시 원금 손실이 발생할 수 있고 투자 손익 책임은 전적으로 고객에게 귀속되며 과거 투자수익이 미래 수익률을 보장하지 않는다고 고지합니다. 신규 구독 전에는 아래 투자자문계약 권유문서 https://naver.me/5ZST47Qf 의 계약 관련 제반 사항을 반드시 읽고 충분히 검토하라고 안내합니다.

5
생산적인 일을 하는 AI

Agentic AI의 시대가 도래했습니다. 이젠 AI에게 무언가를 물었을 때 답하는 챗봇 수준을 넘어서 실제로 생산적인 일을 해내는 AI를 뜻합니다. 그 첫 번째 대표 사례가 바로 소프트웨어 코딩입니다. GitHub는 전 세계 개발자 대부분이 코드를 올리고 공유하는 플랫폼입니다. 위 차트를 보시면 두 가지가 핵심입니다. Pull requests는 코드를 내려받아 수정하는 것을 의미하고, Commits은 수정한 코드를 다시 올리는 것입니다. 얼마나 코드를 작성했느냐의 기준으로는 주로 이 Commit 수가 개발 활동량을 보여주는 지표입니다. 2023년 3억 건, 2024년 4억 건, 2025년 5억 건, 2026년 초에는 14억 건입니다. 전 세계의 소프트웨어 전문 개발자는 3~4천만 명이고, 이들의 연봉을 합치면 약 연간 3조달러 규모입니다. 이 3조달러 인건비는 다른 산업을 움직이는 IT 인프라로서 작동해 전체 100조달러 규모의 전 세계 산업에 영향을 줍니다.

6
코드 생산성과 토큰 수요

이러한 의미를 젠슨 황식 계산으로 보자면 이렇습니다. 같은 3조달러를 주는데 거의 3배의 결과물이 만들어지고 있습니다. 3조달러의 인건비로 사실상 9조달러 규모의 생산물을 뽑아내는 셈입니다. AI가 일자리를 뺏는다고 하지만 현실은 반대입니다. 소프트웨어 엔지니어는 오히려 늘고 있습니다. 논리는 단순합니다. 이제 엔지니어 한 명을 고용하면 이전보다 3배에 가까운 일을 할 수 있기에 더 많이 뽑고 싶어하는 것입니다. 생산성 곡선이 평평했다면 사람을 줄였겠지만 결과물이 워낙 가파르게 나오니 더 많은 인력을 원하게 되는 효과입니다. 산업적인 시각으로 본다면 토큰 수요의 폭증을 의미합니다. 이제 토큰은 매출을 만드는 단위가 됐고 돈이 되기 때문에 더 많은 AI 팩토리를 짓습니다. 컴퓨팅 수요가 치솟고 관련 기업이 호황을 누리는 이유입니다. 이 모든 변화의 밑바탕에는 완전히 새로운 방식의 컴퓨팅 구조가 있습니다. 예전에는 OS 위에서 애플리케이션이 돌아가고 그 안에서 코드가 실행됐지만, 새로운 방식은 하나 혹은 여러 개의 LLM이 하네스 안에 들어가 있고 하네스가 LLM이 생산적인 일을 잘 할 수 있게끔 전체를 오케스트레이션하는 구조입니다.

7
LLM과 하네스의 역할

무언가 요청이 들어오면 에이전트는 이해하고, 관찰하고, 추론하고, 행동하고, 도구를 사용합니다. 여기서 도구란 스프레드시트, 크롬 브라우저, 데이터처리 엔진, 데이터베이스 등입니다. LLM은 모든 종류의 생각을 담당하고, 하네스는 마치 이전의 OS처럼 모든 것을 연결하고 오케스트레이션합니다. 구체적으로 보자면 하네스에서는 정보가 오갈 때마다 지금 무슨 상황인지를 파악하고, 무엇을 할지를 추론하고, 실행 계획을 수립하고, 실행하는 경로를 짭니다. 이러한 작업 구조를 에이전트라고 부릅니다. 핵심은 컴퓨터를 다루는 방식 자체가 바뀐다는 것입니다. 예전에는 앱을 실행하고, 클릭하고, 타이핑했습니다. 이제는 AI에게 내가 어떤 작업물을 원하는지 의도를 설명하면 알아서 코드를 짜주고, 도구를 사용해 결과물을 만들어냅니다. 이것이 앞으로 인류가 컴퓨터와 함께 일하는 방식입니다.

8
궁극의 분산형 컴퓨팅 모델

에이전트는 궁극의 분산형 컴퓨팅 모델입니다. 소프트웨어가 어떻게 작동하느냐가 앞으로 컴퓨팅 시스템이 어떻게 바뀌느냐와 연결되고, 에이전트의 컴퓨팅 패턴은 작업 하나를 위해 서로 다른 유형의 컴퓨터가 동시에 작동하는 분산형 모델의 시작입니다. 에이전트는 모델·하네스·도구·런타임으로 이뤄집니다. 모델은 두뇌, 하네스는 두뇌의 지시를 실행에 옮기는 몸통 같은 틀이고, 도구와 런타임은 실제 일을 처리하는 공간과 도구입니다. 이 요소들은 AI 팩토리, 즉 데이터센터의 서로 다른 위치에서 따로 돌아갑니다. LLM이 생각할 때는 GPU, 도구를 사용할 때는 CPU와 GPU, 전체 작업을 지휘·조율할 때는 CPU가 담당합니다. 가장 까다로운 부분은 메모리입니다. 사람처럼 단기기억과 장기기억을 함께 다루므로 KV cache는 ms 단위 HBM, 수 초 단위 DRAM, 몇 분 단위 SSD, 1시간 단위 HDD에 맞춰 무엇을 기억·압축·재호출할지 관리해야 합니다.

9
Compute is Revenue

토크노믹스의 표현은 ‘Compute is Revenue’입니다. AI 시대에는 컴퓨팅 그 자체가 곧 매출입니다. AI 팩토리가 만들어내는 토큰이 하나하나 다 돈이 되기 때문입니다. 토큰을 많이, 빠르게, 효율적으로 뽑아낼수록 매출과 이익이 높아지고, 반대로 놀고 있는 컴퓨팅과 멈춰있는 설비는 그대로 손실입니다. 이미 엄청난 산업이 됐기 때문에 이제부터는 무언가를 구현하느냐 못하느냐가 아니라 투자 대비 얼마나 회수하느냐가 가장 중요합니다. AI 팩토리 수익성은 얼마나 빨리 가동되는가인 TTFI(Time-to-First-Inference, 요청 단위로는 TTFT를 더 많이 쓰기도 합니다), 와트당 토큰을 얼마나 뽑는가인 Token/Watt, 멈추지 않고 안정적으로 돌아가는가인 MTBI(Mean Time Between Interruptions), 얼마나 오래 쓸모 있는가인 Useful Life 네 가지로 결정됩니다.

10
가동 속도와 엔비디아의 시스템 배포

TTFI는 첫 추론까지 걸리는 시간입니다. 고객사에서 AI 인프라는 장비를 들여놓는다고 끝나는 문제가 아닙니다. 클러스터 설치 뒤 훈련이나 추론을 거쳐 첫 번째 Production Token이 나오기까지 얼마나 걸리는지가 중요합니다. 하드웨어 구매 시점이 아니라 실제 매출과 서비스로 연결되는 시점까지의 시간입니다. 이 관점에서 엔비디아 강점은 GPU를 잘 만드는 데만 있지 않습니다. 엔비디아는 개별 칩을 판매하는 기업이라기보다 AI 데이터센터 전체를 하나의 시스템으로 설계하고 이를 서버·네트워킹·전력·냉각·소프트웨어·랙 단위 인프라로 분해해 공급망 기업들과 함께 제품화합니다. GPU가 데이터센터에서 어떻게 연결·통신·냉각·스케줄링되고 대규모 클러스터로 작동하는지까지 통째로 공동 설계하며, 이를 수많은 고객 환경에 반복 배포·검증해왔습니다. 이것이 데이터센터 투자 회수 기간과 직결되는 경제적 장점입니다.

11
전력당 토큰의 경제성

SemiAnalysis에 따르면 AMD의 첫 랙 스케일 제품 MI450X(Helios 랙)은 출시와 매출 인식이 2H26이지만, 고객사에서 가장 중요한 Production Token이 나오는 시점은 1Q27쯤 예정입니다. 이걸 공식적으로 말하진 못하지만 TTFI를 집어넣은 데에는 이것을 강조하려는 함의가 있어 보입니다. 전력 효율은 Token/Watt, 곧 와트당 토큰이 매출입니다. AI 팩토리 한계는 전력이고 1GW 데이터센터는 1GW가 전부입니다. 전력이 고정돼 있다면 같은 와트에서 토큰을 얼마나 뽑는가가 매출을 결정합니다. 하이퍼스케일러 입장에서는 (ㄱ) 올해 온라인 가능한 GW에 (ㄴ) Tokens per Watt를 곱한 값이 (ㄷ) 올해 더해질 증분 매출입니다. 칩이 싸다고 아키텍처를 고르기 어렵고, 초기 장비 가격을 아껴도 전력당 토큰 생산이 낮으면 장기적으로 오히려 손해일 수 있습니다.

12
MTBI와 클러스터 신뢰성

신뢰성은 MTBI, 얼마나 오래 멈추지 않고 돌릴 수 있느냐입니다. 데이터센터에는 수백만 개의 케이블·서버·스위치·NIC·전원장치·냉각장치가 동시에 맞물립니다. 개별 부품 MTBF, 평균 무고장 시간을 높이는 일도 중요하지만 모든 부품 신뢰성을 무한정 끌어올릴 수는 없습니다. 일정 수준을 넘으면 비용 대비 효과가 급격히 떨어지고, 개별 부품 신뢰성을 크게 높여도 클러스터 규모가 워낙 커서 전체 시스템이 1년 내내 아무 문제 없이 돌아가기는 사실상 불가능합니다. 그래서 고객사에는 부품 MTBF보다 클러스터 단위 MTBI가 더 중요합니다. MTBI는 한 번 가동이 중단된 뒤 다음 중단이 생기기까지 평균 시간입니다. 고객이 체감하는 신뢰성은 부품 하나가 오래 버티는가보다 전체 AI 클러스터가 의미 있는 중단 없이 훈련·추론을 계속하는가입니다.

13
장애 우회와 자산 수명

좋은 부품을 많이 넣는다고 해결되진 않습니다. 대규모 AI 클러스터에서는 GPU·네트워크·스토리지·전력·냉각·스케줄링 소프트웨어·장애 감지 및 복구 시스템이 하나의 유기적 시스템처럼 움직여야 합니다. 특정 노드나 링크에 문제가 생겼을 때 작업을 얼마나 빨리 우회하고, 장애를 얼마나 빨리 감지하고, 전체 학습 작업을 얼마나 적은 손실로 재개하는지가 핵심입니다. 이 영역에서는 엔비디아처럼 초대형 AI 클러스터를 오랫동안 운영해온 기업의 경험이 중요한 차별점입니다. 하드웨어 설계·네트워킹 구조·시스템 소프트웨어·클러스터 운영 노하우가 축적될수록 단순한 부품 성능을 넘어 멈추지 않고 계속 돌아가는 AI 인프라를 만들 수 있습니다. 자산 유효 수명도 어렵습니다. GPU나 서버를 샀다고 내구연한 6년 동안 같은 경제성을 유지한다는 보장은 없습니다. AI 소프트웨어와 모델 구조가 빠르게 바뀌므로 새 워크로드에 유연하게 대응해야 하며, 폐쇄적 아키텍처나 빈약한 생태계라면 3년 뒤에도 충분히 쓸모 있을지 예측하기 어렵습니다.

14
CUDA 생태계와 Vera의 출발점

특정 모델이나 연산 방식에는 효율적이어도 AI 방향이 바뀌는 순간 활용도가 빨리 떨어질 수 있습니다. 엔비디아 시스템은 이미 전 세계 AI 인프라에 광범위하게 깔렸고, 개발자 생태계도 CUDA 중심으로 형성돼 있습니다. 새 모델·라이브러리·프레임워크·최적화 기법이 나와도 대부분 엔비디아 환경을 우선 지원합니다. 이는 시장점유율만의 문제가 아니라 자산이 오래 쓸모 있게 남을 가능성을 높여주는 구조적 장점입니다. 이제 Vera CPU를 보겠습니다. ‘지금까지의 모든 CPU는 사람을 위해 만들어졌다. Vera는 에이전트를 위해 만들어진 최초의 CPU이다’라는 젠슨 황의 COMPUTEX 2026 키노트 발언을 제시합니다. 기존 데이터센터 CPU는 사람이 요청한 작업을 처리하고 여러 사용자가 나눠 쓰는 범용 자원이었으며, 서버 한 대에 최대한 많은 코어를 넣어 가상화하고 시간 단위로 임대하는 방식이 중요했습니다.

15
GPU를 굶기지 않는 CPU

하지만 Agentic AI에서는 에이전트가 스스로 도구를 호출하고 데이터베이스에 접근하고 코드를 실행하고 외부 시스템을 확인하며 여러 단계의 추론을 반복합니다. GPU는 토큰을 생성하지만 GPU가 쉬지 않고 일하게 하려면 CPU가 뒤에서 모델 실행 흐름을 조율하고 KV cache를 관리하고 데이터와 스토리지를 빠르게 연결하고 수많은 툴 호출을 지연 없이 처리해야 합니다. AI 팩토리 경제성은 단위 시간당 토큰을 얼마나 만드는가에 달렸고 토큰은 GPU에서 만들어집니다. 따라서 CPU는 GPU 앞을 가로막으면 안 됩니다. CPU가 느리면 GPU가 대기하고, GPU가 대기하면 토큰 생산이 줄고, 토큰 생산이 줄면 AI 팩토리 ROI가 떨어집니다. CPU는 더 이상 부수적 부품이 아니라 가장 비싼 자산인 GPU 활용률을 결정하는 핵심 인프라입니다. 이 배경에서 Vera 특성 다섯 가지를 봅니다.

16
IPC와 코어당 메모리 대역폭

첫째는 IPC와 단일 스레드 성능입니다. Agentic AI에서는 지연시간이 중요합니다. 에이전트가 툴을 호출하고 코드를 실행하고 데이터베이스를 조회하고 다음 행동을 결정하는 과정은 짧은 작업이 연속됩니다. 이런 워크로드에서는 코어 수만 늘려서는 충분하지 않고 각각의 작업을 빠르게 처리하는 단일 스레드 성능이 중요합니다. Vera는 GPU 옆에서 즉각 반응해야 하므로 클럭당 더 많은 명령어를 가져오고 해독하고 실행하도록 설계됐고, 젠슨 황은 클럭당 10개 명령어를 처리할 수 있는 구조라고 설명했습니다. 둘째는 코어당 메모리 대역폭입니다. CPU 코어가 빨라도 필요한 데이터가 제때 들어오지 않으면 성능은 나오지 않습니다. 에이전트는 메모리·데이터베이스·스토리지에 접근하고 GPU와 데이터를 주고받으며 때로 샌드박스에서 코드를 실행합니다. 총 대역폭보다 코어 하나가 실제 쓸 수 있는 대역폭이 중요하고, 코어만 많고 데이터 공급이 모자라면 많은 코어가 동시에 굶습니다. Vera는 13.6GB/s, AMD Turin은 3.2GB/s, Intel Granite Rapids는 6.6GB/s로, Vera가 AMD 대비 약 4.3배, Intel 대비 약 2.1배입니다.

17
시스템 대역폭과 데이터 이동

셋째는 전체 시스템 대역폭입니다. Agentic AI 시스템은 하나의 거대한 칩에서 모든 일이 끝나는 것이 아니라 CPU·GPU·메모리·스토리지·네트워크·데이터베이스·외부 툴이 계속 연결되는 분산형 시스템입니다. 컴퓨팅이 분산될수록 가장 큰 병목은 네트워크와 데이터 이동이고, 내부와 외부의 대역폭이 중요합니다. CPU 코어끼리 빠르게 통신해야 하고 CPU와 GPU 사이도 빠르게 연결돼야 하며 CPU와 스토리지 사이에도 병목이 없어야 합니다. 에이전트가 여러 작업을 동시에 수행하고 실시간 데이터를 처리하고 긴 컨텍스트와 외부 데이터를 계속 참조하려면 CPU 주변의 데이터 이동 능력이 가장 중요합니다. 넷째는 에너지 효율입니다. 전력이 고정된 데이터센터 클러스터에서는 같은 전력 안에서 토큰을 얼마나 생산하느냐가 경제성을 결정합니다. 구리를 광으로 바꾸고 CPO를 도입하는 것도 네트워킹 전력 점유율을 줄여 컴퓨팅을 더 넣고 토큰을 더 생산해 ROI를 높이려는 개선입니다.

18
전성비와 Arm·LPDDR 조합

Vera는 Arm 기반 CPU와 LPDDR 메모리 조합을 써 전성비가 가장 좋다고 설명합니다. x86에 비해서 Arm 조합이 전성비가 좋고, 일반 서버 CPU는 DDR 메모리를 중심으로 설계되지만 LPDDR은 모바일·저전력 환경에서 발전한 메모리이므로 전성비가 좋은 조합이라는 설명입니다. 다섯째는 이미 검증된 생태계입니다. 데이터센터 CPU는 단순히 성능이 좋다고 바로 대규모로 채택되는 제품이 아닙니다. 클라우드·엔터프라이즈·보안 스택·운영체제·가상화·컨테이너·AI 프레임워크·스토리지·네트워킹까지 모두 검증을 거쳐야 합니다.

19
검증된 생태계와 Grace 전환

엔비디아는 이미 중요한 전환을 한 번 성공시켰습니다. Grace Blackwell 전환에서 가장 큰 리스크는 외부 x86 CPU에서 엔비디아 Grace CPU로 넘어가는 일이었습니다. GPU는 원래 강한 영역이었지만 CPU를 자체 플랫폼 안으로 끌어들이는 일은 훨씬 어렵습니다. 고객은 소프트웨어 호환성·보안 검증·운영 안정성·장애 대응·기존 인프라 통합을 모두 다시 확인해야 하기 때문입니다. 엔비디아는 이 전환을 상당 부분 완료했고 Vera는 그 기반에서 출발합니다. 완전히 낯선 CPU 생태계를 처음부터 설득하는 것이 아니라 Grace를 통해 엔비디아 CPU를 검증한 고객에게 다음 세대 CPU로 들어가는 구조입니다. 이 점이 Vera의 숨은 강점입니다. x86 CPU로 쓰이던 워크로드에서는 의미 있는 성능 향상도 제시합니다.

20
성능 사례와 주요 구매자

x86 CPU로 쓰이던 워크로드에서 의미 있는 성능 향상을 보였다고 하며, SQL은 3배 속도 향상됐다고 제시합니다. SQL은 세계에서 가장 널리 쓰이는 데이터베이스 엔진으로 기업 데이터베이스·분석 시스템·애플리케이션 백엔드·금융 시스템·클라우드 서비스 대부분이 SQL 기반 워크로드를 씁니다. 매우 성숙한 영역이라 SQL 성능을 5%나 10% 개선하는 일도 쉽지 않습니다. 다만 3배 개선은 엔비디아가 제시한 특정 조건의 워크로드 기준으로 봐야 합니다. 그럼에도 에이전트 특화 CPU임을 실질 지표로 확인해주는 값이고, 에이전트가 기업 업무를 자동화하려면 데이터베이스와 연결될 수밖에 없는데 이를 매우 빠르게 가져오는 최적의 CPU가 Vera라는 것이 주요 메시지입니다. 실시간 데이터 처리도 6배 향상됐다고 제시합니다. 앞으로 AI는 저장해둔 문서만 읽는 것이 아니라 공장이나 거래소에서 실시간으로 들어오는 데이터도 처리해야 하며, 이 처리에서도 Vera CPU가 우수하다는 설명입니다. 주요 구매자 목록에는 AI Labs의 오픈AI·앤스로픽·스페이스X(xAI), 클라우드의 네비우스·오라클·코어위브·엔스케일·크루소·람다 등이 있습니다.

5

그럼에도 빠진내용 정리

잡담·곁다리 내용
  • 원문에 언급된 차트와 주요 구매자 목록은 실제 이미지·첨부를 추가 판독하지 않고 본문 텍스트 범위에서만 정리했다.
생략 기록
  • 원문의 외부 연결 글·투자자문계약 문서는 실제 본문이 이 보존 원문에 없으므로 분석 근거로 사용하지 않았다.

그럼에도 빠진내용 정리

압축/생략
연결 자료의 제목·날짜와 투자자문계약 URL은 원문 순서에 맞춰 flow에 남겼고, 연결 자료의 본문은 이 문서의 근거로 확장하지 않았다.
잡담/운영
원금 손실·손익 책임·과거 수익률 비보장 고지와 주요 구매자 목록은 원문에 있는 범위에서 보존했다.
전사 오류 가능성
AMD MI450X의 Production Token 시점은 SemiAnalysis에 따른 작성자의 해석이며, Vera의 SQL 3배는 엔비디아가 제시한 특정 조건의 워크로드 수치라는 유보를 유지했다.
원문 확인

document_work_runner prepare가 입력 원문을 수정 없이 보존했다.