2026.03.26 · 네이버 프리미엄 콘텐츠 · 올바른 미국주식 by SAPIENS

유형
네이버 프리미엄 콘텐츠
날짜
2026.03.26
강연자/작성자
올바른 미국주식 by SAPIENS
분석 주제
미지정
자료 길이
본문 10,142자
1

문서 전체 조망

핵심 구조

AI 인프라의 병목은 사라지기보다 메모리·전력·운영 방식으로 옮겨간다

이 보고서는 AI 하드웨어의 단기 가격 논쟁보다 에이전틱 AI가 요구하는 KV Cache, 서버 구성, 전력과 공급 계약을 따라간다. 압축 기술이 있어도 실제 워크로드의 성능·비용 조건과 공급 부족이 함께 남는지가 메모리와 인프라를 읽는 기준이 되며, 따라서 가격 변화만으로 수요 변화를 단정하지 않는다.

시장 밸류에이션의 하락과 이익의 상승을 분리해서 본다

S&P 500 선행 주가수익비율은 2025년 4월 관세 하락기 수준까지 낮아졌지만 EPS는 크게 올랐고 지수는 횡보·하락했다. AI 하드웨어 안에서도 메모리·광학으로만 상승이 몰린 좁은 시장 폭이 이를 설명하며, 작성자는 성장성 대비 미국 주식의 밸류에이션이 매력적이라고 본다.

KV Cache 압축은 수요 소멸보다 병목을 옮기는 기술이다

추론의 체인오브쏘트가 길어지고 에이전틱 AI가 확산되면 쿼리당 컨텍스트 메모리와 KV Cache가 커져 서버당 동시 서비스 인원이 줄어든다. 압축·조회 기술은 재연산과 지연을 낮추려는 해법이지만, 하이퍼스케일러가 같은 예산으로 더 높은 성능을 택하고 Agentic AI의 침투율도 낮다는 해석이 함께 제시된다.

TurboQuant는 메모리가 모자란 환경과 성능 우선 환경을 다르게 본다

구글의 TurboQuant는 내적 값을 보존하면서 KV Cache를 압축하도록 설계됐지만, 긴 컨텍스트에서 랜덤회전 부하가 커진다는 실무자 의견 때문에 에이전틱 AI 전면 적용은 제한적일 수 있다고 본다.

  • 메모리 절약이 필요한 로컬 LLM에는 맞을 수 있으나, 메모리가 충분한 AI Labs의 순수 성능 향상에는 도움이 덜할 수 있다는 구분이다.

메모리·CPU 공급은 가격과 장기 조달의 문제로 이어진다

난야테크 증자에는 샌디스크·키옥시아·솔리다임·시스코가 참여했고, NAND 중심 업체는 SSD용 DDR4 조달을 위해 신규 팹 물량의 우선 장기공급계약을 맺는 구조로 설명된다. DRAM·NAND 현물가는 계약가보다 높은 상태에서 보합이고, 인텔·AMD의 CPU 가격 인상과 긴 납기는 공급 부족이 지속된다는 보도와 연결된다.

ANALYSIS VIEW사건별 사실과 작성자의 판단, 지속 정보를 나누어 읽기
2
발생·예정 사건과 출처별 관점

이슈 분석

이 자료가 이슈의 어떤 사실을 다루고, 작성자가 무슨 결론을 어떤 근거로 내렸는지 원문에 붙여 읽습니다.

발생발표·발생 후발생일 미확인

Meta Small Business 출시

이 자료에서 다룬 사실

메타가 중소기업의 AI 도입 촉진을 위해 Meta Small Business를 출시했다고 전했다.

근거 보기 1
  1. 원문 구간 1

    오픈AI IP를 갖고 있고 GPT를 API 비용 지불없이 자체 GPU 가동비용만 내고 무료로 돌릴 수 있는 마이크로소프트에서도 유의미한 모델이 안 나오고 있는 것을 생각해보시면 됩니다. ​ (3) 메타 관련 짤막한 보도들도 나왔습니다: 메타가 중소기업들의 AI 도입 촉진을 위해서 Meta Small Business를 출시했습니다. 메타가 회사 전반에 걸쳐서 수백 명의 직원을 해고할 예정입니다. 4Q25 기준 7만 8천 명의 직원 중에서 수백 명이므로 감원 규모가 많진 않습니다. AI HW: ​ (1) 최근 KV Cache 압축에 대한 시장의 관심도가 높습니다: 펀더멘탈상 영향이 있을 이슈는 아닙니다. 두 가지 생각을 남기시면 될 것 같습니다: ⓐ시장이'메모리 수요가 지금처럼 높은 상태를 유지할 수 있을까'에 대해서 많은 관심을 보이고 있구나, ⓑ플레이어들이 '다들 많이 담아둔 상태에서 차익실현 빌미를 찾고 싶어하는 상태였구나' 정도입니다. "사람들이 몰라서 그렇다"라고 보면 스트레스를 많이 받습니다.

원문에서 직접 연결한 대상Meta
발생 가능진행 중발생일 미확인

메타의 전사 인력 감원 준비

작성자의 핵심 판단

4Q25 기준 직원 7만8천 명 가운데 수백 명이어서 감원 규모가 많지는 않다고 평가한다.

근거 보기 1
  1. 원문 구간 1

    오픈AI IP를 갖고 있고 GPT를 API 비용 지불없이 자체 GPU 가동비용만 내고 무료로 돌릴 수 있는 마이크로소프트에서도 유의미한 모델이 안 나오고 있는 것을 생각해보시면 됩니다. ​ (3) 메타 관련 짤막한 보도들도 나왔습니다: 메타가 중소기업들의 AI 도입 촉진을 위해서 Meta Small Business를 출시했습니다. 메타가 회사 전반에 걸쳐서 수백 명의 직원을 해고할 예정입니다. 4Q25 기준 7만 8천 명의 직원 중에서 수백 명이므로 감원 규모가 많진 않습니다. AI HW: ​ (1) 최근 KV Cache 압축에 대한 시장의 관심도가 높습니다: 펀더멘탈상 영향이 있을 이슈는 아닙니다. 두 가지 생각을 남기시면 될 것 같습니다: ⓐ시장이'메모리 수요가 지금처럼 높은 상태를 유지할 수 있을까'에 대해서 많은 관심을 보이고 있구나, ⓑ플레이어들이 '다들 많이 담아둔 상태에서 차익실현 빌미를 찾고 싶어하는 상태였구나' 정도입니다. "사람들이 몰라서 그렇다"라고 보면 스트레스를 많이 받습니다.

이 자료에서 다룬 사실

메타가 회사 전반에서 수백 명의 직원을 해고할 예정이라고 전했다.

근거 보기 1
  1. 원문 구간 1

    오픈AI IP를 갖고 있고 GPT를 API 비용 지불없이 자체 GPU 가동비용만 내고 무료로 돌릴 수 있는 마이크로소프트에서도 유의미한 모델이 안 나오고 있는 것을 생각해보시면 됩니다. ​ (3) 메타 관련 짤막한 보도들도 나왔습니다: 메타가 중소기업들의 AI 도입 촉진을 위해서 Meta Small Business를 출시했습니다. 메타가 회사 전반에 걸쳐서 수백 명의 직원을 해고할 예정입니다. 4Q25 기준 7만 8천 명의 직원 중에서 수백 명이므로 감원 규모가 많진 않습니다. AI HW: ​ (1) 최근 KV Cache 압축에 대한 시장의 관심도가 높습니다: 펀더멘탈상 영향이 있을 이슈는 아닙니다. 두 가지 생각을 남기시면 될 것 같습니다: ⓐ시장이'메모리 수요가 지금처럼 높은 상태를 유지할 수 있을까'에 대해서 많은 관심을 보이고 있구나, ⓑ플레이어들이 '다들 많이 담아둔 상태에서 차익실현 빌미를 찾고 싶어하는 상태였구나' 정도입니다. "사람들이 몰라서 그렇다"라고 보면 스트레스를 많이 받습니다.

원문에서 직접 연결한 대상Meta
발생발표·발생 후발생일 26-4-8

26-4 난야테크 DRAM 장기공급체계 구축

작성자의 핵심 판단

NAND만 생산하는 샌디스크와 키옥시아가 SSD용 DDR4 조달 어려움에 대응해 신규 팹 물량의 우선 장기공급계약을 맺는 지분투자형 파트너십 사례로 본다.

근거 보기 1
  1. 원문 구간 1

    키옥시아 : 보통주 70,000,000주를 주당 NT$223.9에 인수 솔리다임 : 보통주 71,393,000주를 주당 NT$223.9에 인수 시스코 : 보통주 71,500,000주를 주당 NT$223.9에 인수했습니다. 이들이 전체 배정받은 규모는 351,578,000주로 난야 테크 주식의 11% 정도입니다. 난야 테크의 실제 자본 증자 및 신주발행 기준일은 2026년 4월 8일입니다. 난야 테크는 메모리 반도체 공장을 새롭게 짓고 설비 구축에 돈을 쓸 예정입니다. 샌디스크와 키옥시아는 NAND만 생산하기 때문에 DRAM, NAND를 같이 생산하는 기업과 달리 자사 고사양 NVMe eSSD 제품에 탑재되는 DDR4 제품 조달에 어려움을 겪어왔었습니다. 4TB 스토리지 SSD당 512MB~1GB 정도의 DRAM Cache가 필요합니다. 지분투자형 파트너십으로 신규 팹에서 나올 물량에 대해 우선 장기 공급계약을 맺는 구조 사례입니다.

이 자료에서 다룬 사실

샌디스크·키옥시아·솔리다임·시스코가 난야테크 3자 배정 유상증자에 총 3억5,157만8,000주, 주당 NT$223.9로 참여했고 이는 난야테크 주식 약 11%다. 실제 증자와 신주발행 기준일은 2026년 4월 8일이라고 적었다.

근거 보기 1
  1. 원문 구간 1

    키옥시아 : 보통주 70,000,000주를 주당 NT$223.9에 인수 솔리다임 : 보통주 71,393,000주를 주당 NT$223.9에 인수 시스코 : 보통주 71,500,000주를 주당 NT$223.9에 인수했습니다. 이들이 전체 배정받은 규모는 351,578,000주로 난야 테크 주식의 11% 정도입니다. 난야 테크의 실제 자본 증자 및 신주발행 기준일은 2026년 4월 8일입니다. 난야 테크는 메모리 반도체 공장을 새롭게 짓고 설비 구축에 돈을 쓸 예정입니다. 샌디스크와 키옥시아는 NAND만 생산하기 때문에 DRAM, NAND를 같이 생산하는 기업과 달리 자사 고사양 NVMe eSSD 제품에 탑재되는 DDR4 제품 조달에 어려움을 겪어왔었습니다. 4TB 스토리지 SSD당 512MB~1GB 정도의 DRAM Cache가 필요합니다. 지분투자형 파트너십으로 신규 팹에서 나올 물량에 대해 우선 장기 공급계약을 맺는 구조 사례입니다.

그렇게 판단한 이유

4TB 스토리지 SSD당 512MB~1GB의 DRAM Cache가 필요하고, DRAM과 NAND를 함께 생산하지 않는 업체는 고사양 NVMe eSSD용 DDR4 조달이 어려웠다는 설명을 든다.

근거 보기 1
  1. 원문 구간 1

    키옥시아 : 보통주 70,000,000주를 주당 NT$223.9에 인수 솔리다임 : 보통주 71,393,000주를 주당 NT$223.9에 인수 시스코 : 보통주 71,500,000주를 주당 NT$223.9에 인수했습니다. 이들이 전체 배정받은 규모는 351,578,000주로 난야 테크 주식의 11% 정도입니다. 난야 테크의 실제 자본 증자 및 신주발행 기준일은 2026년 4월 8일입니다. 난야 테크는 메모리 반도체 공장을 새롭게 짓고 설비 구축에 돈을 쓸 예정입니다. 샌디스크와 키옥시아는 NAND만 생산하기 때문에 DRAM, NAND를 같이 생산하는 기업과 달리 자사 고사양 NVMe eSSD 제품에 탑재되는 DDR4 제품 조달에 어려움을 겪어왔었습니다. 4TB 스토리지 SSD당 512MB~1GB 정도의 DRAM Cache가 필요합니다. 지분투자형 파트너십으로 신규 팹에서 나올 물량에 대해 우선 장기 공급계약을 맺는 구조 사례입니다.

원문에서 직접 연결한 대상난야테크샌디스크키옥시아
발생발표·발생 후발생일 미확인

인텔 PC용 CPU 가격 인상 보도

작성자의 핵심 판단

하반기에는 인텔이 데이터센터용에서 기존 PC용으로 돌렸던 공급을 늘릴 수 있다고 유보하면서도 공급 부족은 지속 중이며 Agentic AI에서 CPU 중요성도 높아진다고 본다.

근거 보기 1
  1. 원문 구간 1

    마침 Nikkei Asia에 따르면 인텔, AMD 모두 3월에 CPU 가격을 추가 인상했습니다. 누적 가격 인상률이 10~15%에 달했으며 납기일도 2주 → 6개월까지 급증하여 공급부족이 지속 중입니다. 하반기가 되면 인텔이 데이터센터향 PC에서 기존 PC향으로 돌렸던 공급이 늘어나기 시작할 것이긴 합니다만, Agentic AI로 갈 때 CPU가 이전보다 더 중요해지는 것도 맞습니다. ​ Enterprise/GPU IaaS: ​ (1) 오늘 업계의 다른 뉴스들은 없었습니다. 신재생/전력기기: ​ (1) Barclays 애널리스트가 DCD Connect 컨퍼런스 당시 주요 발언들을 정리했습니다: 전력 공급이 여전히 중요한 상태이다. 1년 안에 확보할 수 있을 거라고 생각했던 데이터센터향 전력이 이제는 5년 간 받더라도 충분히 다 못 받는다고 해서 프로젝트를 BTM으로 선회했다는 고객이 있었다.

이 자료에서 다룬 사실

Nikkei Asia에 따르면 인텔과 AMD가 모두 3월 CPU 가격을 추가 인상했고 누적 인상률은 10~15%, 납기일은 2주에서 6개월까지 늘어났다고 전했다.

근거 보기 1
  1. 원문 구간 1

    마침 Nikkei Asia에 따르면 인텔, AMD 모두 3월에 CPU 가격을 추가 인상했습니다. 누적 가격 인상률이 10~15%에 달했으며 납기일도 2주 → 6개월까지 급증하여 공급부족이 지속 중입니다. 하반기가 되면 인텔이 데이터센터향 PC에서 기존 PC향으로 돌렸던 공급이 늘어나기 시작할 것이긴 합니다만, Agentic AI로 갈 때 CPU가 이전보다 더 중요해지는 것도 맞습니다. ​ Enterprise/GPU IaaS: ​ (1) 오늘 업계의 다른 뉴스들은 없었습니다. 신재생/전력기기: ​ (1) Barclays 애널리스트가 DCD Connect 컨퍼런스 당시 주요 발언들을 정리했습니다: 전력 공급이 여전히 중요한 상태이다. 1년 안에 확보할 수 있을 거라고 생각했던 데이터센터향 전력이 이제는 5년 간 받더라도 충분히 다 못 받는다고 해서 프로젝트를 BTM으로 선회했다는 고객이 있었다.

원문에서 직접 연결한 대상IntelAMDCPU 산업
3
사실·구조, 해석·전망, 시점 관찰, 판단 방법

지식·관점

사건 밖에서도 다시 참고하거나 다른 자료와 비교할 가치가 있는 내용을 대상과 반복 가능한 논점으로 묶습니다.

시점 관찰미국 주식 밸류에이션과 시장 폭주 대상 · 시장·자산 · 미국 주식시장기준 2026.03.26

EPS 상승과 좁은 시장 폭은 선행 P/E 하락을 어떻게 해석하게 하는가?

이 자료가 더한 내용

S&P 500 Forward P/E가 2025년 4월 관세 하락기 수준까지 내려왔고 EPS 상승과 지수 횡보·하락, 메모리·광학 중심의 얕은 시장 폭을 함께 제시했다. 작성자는 성장성 대비 미국 주식 밸류에이션이 매력적이라고 본다.

근거 보기 1
  1. 원문 구간 1

    그동안 EPS는 워낙 많이 올라있는데 지수 기준 주가는 횡보 내지는 하락했기 때문입니다. Market Breadth가 얕은 상태에서의 상승을 보이고 있었다보니, AI HW 중에서 메모리와 광학 위주로 몰려서 상승했던 것들을 제외하면 대부분의 주식은 약간씩 하락하던 추세인 게 자연스럽습니다. 미국주식 전체로 보자면 성장성 대비 밸류가 매력적인 때입니다. ​ (2) 애플과 구글의 AI 파트너십은 생각보다 여러 가지 계약을 포함하고 있습니다: 애플은 자사 데이터센터에서 굴리는 제미나이 모델에 대해 완전한 접근 권한을 갖고 있습니다. 제미나이를 가져다가 distillation용으로 사용할 수도 있습니다. 특정 사용 사례에 맞는 모델을 만들거나, 기기에서 서 로컬로 실행될 수 있을 만큼의 소형 모델을 만드는 식입니다. 다만 distillation을 한다고 하더라도 이것도 파운데이션 모델 자체를 잘 만들어야 잘 할 수 있는 것이지, 지금처럼 모델을 빌드한 경험들이 없는 상태에서 좋은 소형 모델을 만들 수는 없을 거라 생각합니다.

해석·전망애플·구글 AI 파트너십주 대상 · 기업·종목 · Apple관련 대상 · 기업·종목 · Google관련 대상 · 기술·제품 · Gemini

제미나이 접근 권한과 distillation은 소형 모델 개발에 어떤 조건을 남기는가?

이 자료가 더한 내용

애플이 자체 데이터센터의 제미나이에 완전한 접근 권한을 갖고 distillation·특정 사용 사례·온디바이스 소형 모델에 쓸 수 있다고 설명한다. 다만 좋은 소형 모델에는 파운데이션 모델을 잘 만드는 역량이 필요해 모델 빌드 경험이 없는 상태에서는 어렵다고 평가한다.

근거 보기 1
  1. 원문 구간 1

    오픈AI IP를 갖고 있고 GPT를 API 비용 지불없이 자체 GPU 가동비용만 내고 무료로 돌릴 수 있는 마이크로소프트에서도 유의미한 모델이 안 나오고 있는 것을 생각해보시면 됩니다. ​ (3) 메타 관련 짤막한 보도들도 나왔습니다: 메타가 중소기업들의 AI 도입 촉진을 위해서 Meta Small Business를 출시했습니다. 메타가 회사 전반에 걸쳐서 수백 명의 직원을 해고할 예정입니다. 4Q25 기준 7만 8천 명의 직원 중에서 수백 명이므로 감원 규모가 많진 않습니다. AI HW: ​ (1) 최근 KV Cache 압축에 대한 시장의 관심도가 높습니다: 펀더멘탈상 영향이 있을 이슈는 아닙니다. 두 가지 생각을 남기시면 될 것 같습니다: ⓐ시장이'메모리 수요가 지금처럼 높은 상태를 유지할 수 있을까'에 대해서 많은 관심을 보이고 있구나, ⓑ플레이어들이 '다들 많이 담아둔 상태에서 차익실현 빌미를 찾고 싶어하는 상태였구나' 정도입니다. "사람들이 몰라서 그렇다"라고 보면 스트레스를 많이 받습니다.

사실·구조AI 컴퓨팅의 KV Cache 병목주 대상 · 기술·제품 · KV Cache관련 대상 · 산업·업종 · AI 컴퓨팅

KV Cache는 AI 컴퓨팅의 병목을 어떻게 옮기고 완화하는가?

이 자료가 더한 내용

AI 컴퓨팅은 로직·메모리·하드웨어·소프트웨어·네트워킹 가운데 병목을 푸는 조합의 최적점을 찾는 과정이며, 한쪽을 개선하면 다른 병목이 생긴다고 설명한다. KV Cache는 GPU 연산 병목을 줄이기 위해 메모리에서 병목을 해결하려 나온 방법으로 소개한다.

근거 보기 2
  1. 원문 구간 1

    시계열을 얼마로 잡느냐의 차이는 있겠으나 시차를 두고 주가는 높은 확률로 펀더멘탈을 따라갑니다. 물론 펀더멘탈이 앵커링 없이 판단한 것이 맞느냐를 늘 되묻는 과정이 가장 고통스러운 고민입니다. 엔비디아 KVTC에 대한 생각은 이번 주 주간전략보고에 남겨드린 바 있습니다. 여기에서 좀 더 강조드리고 싶은 맥락은 Bird's-eye view를 유지하시는 게 좋다는 것입니다. 고민한 흔적이 다 깊이로 남습니다. 펀드가 아니면 기본적으로는 여러분들이 운전석에 앉아 계시기 때문에 고민은 직접해보셔야 합니다. 기본적으로는 늘 2012년 AlexNet을 통해 AI/ML의 시대가 개화한 이후 (ㄱ) 컴퓨팅 성능 개선을 통한 FLOPS 향상 x (ㄴ) 알고리즘 최적화를 통한 효율 향상을 통해서 발전해온 역사입니다. 현 시대의 AI 컴퓨팅이라는 건 결국 로직-메모리, 하드웨어-소프트웨어-네트워킹 조합을 통해서 어디에서 병목을 해결해줄 것인가를 두고 파레토 프론티어 최적점을 찾아나가는 과정입니다. 암달의 법칙처럼 한쪽의 병목을 해결하여 10x 모먼트를 발견한다고 하더라도 다른 쪽에서 새로운 병목이 생기고, 또 해결하고 그런 것의 반복입니다.

  2. 원문 구간 2

    "KV Cache"라는 것 자체도 로직(GPU)에서의 연산 병목을 줄이기 위해서 메모리에서 병목을 해결해주는 방법으로 나왔던 것입니다. Chatbot → Reasoning → Agentic AI로 넘어가는 과정에서 CoT의 길이가 길어지면서 추론당 요구하는 컨텍스트 메모리 규모(KV Cache)가 훨씬 커졌습니다. 침투율이 높아지며 사용자, 사용량이 증가하는 것 말고, 한 번의 쿼리당 생각하는 토큰의 양이 10배 이상씩 많아집니다. 그런데 하나의 서버, 하나의 도메인(노드)에서 처리할 수 있는 토큰의 throughput은 정해져 있습니다(물론 이것도 시계열을 넣어서 보면 계속 알고리즘 효율이 높아지며 토큰 throughput은 계속 많아집니다). 그러면 서버당 서비스할 수 있는 사용자의 수(interactivity)를 줄이게 되어 있습니다. 그냥 러프한 숫자들로, 예를 들어 Chatbot으로만 쓸 때에는 원래는 HGX H100 8-GPU 서버 1개에서 초당 토큰 출력량이 10만 개일 때 이를 1,000 token/user/s로 두고 100명에게 서비스했다면 → Reasoning으로 가면서는 CoT도 결국 token 사용이기 때문에 사용량이 평균 10배 증가한다고 하면 같은 HGX H100 8-GPU 서버 기준 10,000 token/user/s로 10명에게 서비스할 수 있습니다.

사실·구조Reasoning 추론의 서버 경제성주 대상 · 기술·제품 · AI 추론

쿼리당 토큰 사용량 증가는 서버당 동시 서비스와 가격·지연시간 선택을 어떻게 바꾸는가?

이 자료가 더한 내용

Reasoning에서 CoT가 길어져 쿼리당 KV Cache와 토큰 사용량이 커지면 서버당 동시 서비스 인원이 줄어든다고 설명한다. H100 8-GPU 서버의 토큰 처리량을 예시로 가격 인상과 latency 조절, 사용자 수 사이의 선택 및 구독 전환율의 관계를 제시한다.

근거 보기 2
  1. 원문 구간 1

    "KV Cache"라는 것 자체도 로직(GPU)에서의 연산 병목을 줄이기 위해서 메모리에서 병목을 해결해주는 방법으로 나왔던 것입니다. Chatbot → Reasoning → Agentic AI로 넘어가는 과정에서 CoT의 길이가 길어지면서 추론당 요구하는 컨텍스트 메모리 규모(KV Cache)가 훨씬 커졌습니다. 침투율이 높아지며 사용자, 사용량이 증가하는 것 말고, 한 번의 쿼리당 생각하는 토큰의 양이 10배 이상씩 많아집니다. 그런데 하나의 서버, 하나의 도메인(노드)에서 처리할 수 있는 토큰의 throughput은 정해져 있습니다(물론 이것도 시계열을 넣어서 보면 계속 알고리즘 효율이 높아지며 토큰 throughput은 계속 많아집니다). 그러면 서버당 서비스할 수 있는 사용자의 수(interactivity)를 줄이게 되어 있습니다. 그냥 러프한 숫자들로, 예를 들어 Chatbot으로만 쓸 때에는 원래는 HGX H100 8-GPU 서버 1개에서 초당 토큰 출력량이 10만 개일 때 이를 1,000 token/user/s로 두고 100명에게 서비스했다면 → Reasoning으로 가면서는 CoT도 결국 token 사용이기 때문에 사용량이 평균 10배 증가한다고 하면 같은 HGX H100 8-GPU 서버 기준 10,000 token/user/s로 10명에게 서비스할 수 있습니다.

  2. 원문 구간 2

    이렇게 해야 같은 latency로 서비스를 받게 될 것입니다. 그렇다면 문제는 이 경우 원래 대략 $300K를 주고 HGX H100 8-GPU 서버 1개를 사와서 백만 토큰당 $5.0에 100명에게 서비스해서 돈을 받다가, 10명한테만 서비스할 수 있게 되니 매출과 마진을 고려하자면 몇 가지 선택을 할 수 있습니다. ⓐ그대로 백만 토큰당 가격을 $50으로 10배 높일 것인가 ⓑ사용자들이 불만을 최소화할 정도로 latency를 낮춰서 5,000 token/user/s로 하면 20명에게 서비스할 수 있으니 이렇게 하고 백만 토큰당 가격을 $25로 5배 높일 것인가 등등입니다. 초당 더 많은 토큰을 출력받느냐 그렇지 않느냐는 Free 요금제 사용자들의 ChatGPT Plus, Pro 구독전환율과 밀접하게 관련이 있기에 외연 확장 혹은 구독전환 등의 다양한 제한적인 환경에서 파레토 프론티어 최적점을 그때그때 잘 찾는 게 중요합니다. 초기 세팅은 이렇게 하겠지만, 줄곧 알고리즘 효율을 높이고 H100 → GB200 NVL72로 추론 HW 세팅을 옮겨가면서 점차 같은 서버 기준 TPS/user를 높입니다.

해석·전망Agentic AI와 메모리 계층주 대상 · 기술·제품 · Agentic AI관련 대상 · 산업·업종 · DRAM관련 대상 · 기술·제품 · eSSD

에이전틱 AI 수요 증가는 KV Cache 보관·조회와 서버 메모리 구성에 어떤 변화를 요구하는가?

이 자료가 더한 내용

2025년 9월부터 Agentic AI 수요가 커지며 KV Cache 사용량이 Reasoning보다 다시 10배 늘었다고 적는다. GPU-HBM에 가까운 DRAM 탑재 확대, 저장 후 lookup, Engram의 hit rate 연구와 고성능 eSSD 활용을 재연산·지연을 낮추는 흐름으로 설명한다.

근거 보기 2
  1. 원문 구간 1

    그러다가 2025년 9월쯤부터는 Agentic AI 수요가 크게 증가하기 시작했습니다. KV Cache 사용량이 Reasoning에 비해서 또 한 번 10배 증가하는 국면이 된 것입니다. 원래 신제품이 나올 때마다 메모리 용량도 높이고 대역폭을 높여왔는데 이런 발전 속도가 일종의 Scale-up적인 발전 방향이라면, Agentic AI 수요가 높아지면서 scale-out적인 발전으로 GPU-HBM(G1)과 최대한 가까이에 더 많은 DRAM(G2)을 붙이려고 서버당 더 많은 DRAM을 탑재했던 것입니다. 이전까지는 KV Cache를 그때그때 그냥 연산해서 쓰게끔 했는데, KV Cache 사용량이 하도 많아지니 재연산으로 인한 병목이 길어졌고, G1를 넘어서 G2, G3, G4까지 가는 Latency penalty도 부각되기 시작했었습니다. 그러자 이제는 KV Cache를 더 많이 저장해놓고 재연산하지 않고 조회(lookup)해서 가져오는 게 훨씬 더 저렴한 게 됐습니다.

  2. 원문 구간 2

    DeepSeek의 Engram 논문이 바로 이런 방향이었습니다. KV Cache hit rate를 높이려는 연구들입니다. 그러면서 읽고 쓰는 게 상대적으로 빠른 고성능 eSSD들까지도 가져다가 KV Cache hit rate를 높이기 위해서 저장용으로 쓰이고 있습니다. KV Cache 재연산의 필요성을 없애는 것이 GPU MFU를 높일 수 있는 방향이기도 하므로 실질적으로 하이퍼스케일러/AI Labs 입장에서는 퍼포먼스를 크게 높이는 길입니다. 이제 Agentic AI의 침투율은 기껏해야 1~3% 정도일 것입니다(의외로 GPT-5가 나오기 전까지 ChatGPT Plus 사용자들도 7%만 Reasoning 모델을 사용했었고, 무료 사용자는 1% 미만이 사용했습니다). Claude Code, Codex ARR이 매월 50%~100%씩 성장하는 트렌드인 것을 생각해보면 앞으로 여전히 10x 모먼트가 끝나지 않았다는 의미입니다. 토큰당 지능 압축도를 높이는 건 더 많은 FLOPS/파라미터/데이터로 pre-training run을 돌리는 것이므로 아직 Agentic AI의 가장 가파른 S-curve는 시작하지 않은 셈입니다.

시점 관찰Agentic AI 침투율주 대상 · 기술·제품 · Agentic AI기준 2026.03.26

Reasoning·Agentic AI의 침투 단계는 수요 확대를 어떻게 읽게 하는가?

이 자료가 더한 내용

작성자는 Agentic AI 침투율을 1~3% 정도로 보고, GPT-5 전 ChatGPT Plus의 Reasoning 사용 7%와 무료 사용 1% 미만을 든다. Claude Code·Codex ARR의 월 50~100% 성장 트렌드와 Reasoning 침투·CSP CapEx 상향 시기를 함께 제시하며 10배 모먼트가 끝나지 않았다고 해석한다.

근거 보기 1
  1. 원문 구간 1

    Reasoning의 시작은 2024년 9월~2025년 1월이었지만 본격적 침투는 2025년 2월~2025년 8월이었습니다. 그때가 CSP들이 수요-공급 초과를 호소하기 시작하고 CapEx가 줄상향됐던 시기입니다. ​ (2) 위의 1번에는 쭉 KVTC, TurboQuant에 대한 논문을 다시 살펴보고나서 남긴 생각부터 정리드린 것이고, 구글이 2025년 4월 28일에 발표했던 TurboQuant에 대해서 살펴보면 이렇습니다: 몇 가지 먼저 고려하실 현실적인 부분은 : ⓐTurboQuant는 2025년 4월 28일에 공개한 자료입니다. ⓑ대부분의 경우 AI Labs들이 폐쇄소스로 운영하고 있고 워낙 큰 금액을 놓고 경쟁 중이기에 당연히 핵심 알고리즘에 대해서는 공개하지 않습니다. 오픈소스 진영이 새롭게 뜯어보는 중이지만 이들은 메인 구매자가 아니고, 컴퓨팅 메인 구매자인 하이퍼스케일러/AI Labs 입장에서는 이미 알고 있던 내용입니다.

해석·전망TurboQuant KV Cache 압축주 대상 · 기술·제품 · TurboQuant관련 대상 · 기술·제품 · KV Cache

KV Cache 압축은 메모리 제약과 긴 컨텍스트 성능 사이에서 어떤 조건에 맞는가?

이 자료가 더한 내용

TurboQuant는 랜덤회전·양자화·1-bit 보정으로 내적 값을 거의 유지하며 KV Cache를 압축하도록 설계됐다고 설명한다. 작성자는 긴 컨텍스트에서 랜덤회전 병목이 커져 속도가 떨어질 수 있으므로 메모리가 부족한 환경에는 맞지만 메모리가 충분한 하이퍼스케일러·AI Labs의 성능 향상에는 도움이 덜할 수 있다고 본다.

근거 보기 3
  1. 원문 구간 1

    이미 업계는 엔비디아 주도로 FP8 KV Cache를 쓰고 있고, NVFP4로의 전환도 적극 추진 중입니다. ⓒ해당 자료가 공개되고 나서도 로직 반도체 가까이에 더 많은 DRAM을 넣으려고 했던 것이고, 모두가 그러다보니 P 상승도 나왔지만 여전히 업계는 DRAM 수요가 공급을 초과하는 상태에 놓여 있습니다. 플레이어들이 같은 양의 퍼포먼스를 낼 수 있는 더 적은 예산을 택하는 것이 아니라, 같은 예산으로 더 높은 퍼포먼스를 내길 택하고 있다는 것을 매우 짧게 줄인 것이 '제번스의 역설'입니다. KV Cache를 압축할 때에는 데이터 크기를 줄이는 것을 넘어서, 압축 후에 복원했을 때에 내적 값이 원래의 값과 거의 동일하게 유지되어야 합니다. 이것을 위해서 TurboQuant는 몇 가지 과정들(랜덤회전, 양자화, 1-bit 보정)을 거쳐서 내적 값과 거의 비슷한 정도를 유지하면서 KV Cache를 압축할 수 있도록 만들었습니다.

  2. 원문 구간 2

    실시간 처리가 가능하고 가속기 친화적으로 설계됐습니다. 적용하기가 쉽습니다. 실무자들의 얘기를 보면, 랜덤회전 작업의 병목 커서 실제로 Agentic AI 워크로드에 전면 적용이 될 것 같진 않습니다. 2,000 토큰 이하의 컨텍스트에서는 괜찮은데, 컨텍스트가 길어질수록 결국 랜덤회전 과정에 드는 부하가 커져서 컨텍스트가 2배가 될 때마다 속도가 2~7%씩 느려집니다. 논문에는 짧거나 중간 정도의 컨텍스트에서만 썼는데 397B 규모의 거대 모델을 돌려봤더니 몇 시간 만에 긴 컨텍스트에서 속도 저하가 두드러졌습니다. 요약하면 TurboQuant는 메모리가 부족해서 성능을 희생하는 대신 KV Cache를 더 많이 압축시키고 싶을 때에는 적절하지만, 메모리는 이미 충분히 확보한 상태인데 퍼포먼스만 높이고 싶을 때에는 생각보다 랜덤회전 과정에서 생기는 병목만 더해질 뿐입니다. 로컬 LLM을 굴릴 때는 같은 용량의 메모리당 더 많이 KV Cache를 가질테니 좋겠지만, 하이퍼스케일러/AI Labs는 상대적으로 메모리는 이미 충분하게 갖춘 상태이기 때문에 성능향상엔 생각보다 도움이 덜 된다는 의미입니다.

  3. 원문 구간 3

    ​ (3) 목적 자체는 Engram, CMX, Dynamo, KVTC, TurboQuant, LPX 등등 다 비슷한 결입니다. Chatbot/Reasoning을 넘어서 사용 사례의 평균값이 Agentic AI로 넘어감에 있어서 워낙 많은 연산과 KV Cache 보관, 전송이 필요하게 되니 이것들을 어떻게 분산해서 각각의 파츠에서 해결할 수 있을까입니다. KV Cache를 손실을 최소화하면서 더 많이 압축하려 하고, 더 가까이 KV Cache를 보관해두어 G1~G2~G3~G4로 이동할 때 생기는 latency penalty를 최소화하려 하며, 모델이 KV Cache를 재연산하지 않고 더 빠르게 토큰을 생성할 수 있게끔 cache hit rate를 높이기 위해 노력하는 방향입니다. 그리고 지금 나오는 KV Cache 효율화들이 실제 힘을 강력하게 발휘하는 지점들은 Reasoning처럼 단일 혹은 3개 정도의 모델이 단일/병렬 추론하는 환경이 아니라 멀티 에이전트 환경입니다.

사실·구조멀티 에이전트 KV Cache 효율화주 대상 · 기술·제품 · 멀티 에이전트 AI관련 대상 · 기술·제품 · KV Cache

멀티 에이전트 환경에서 KV Cache 압축·근접 저장·hit rate가 중요한 이유는 무엇인가?

이 자료가 더한 내용

거대 모델의 Planning·Orchestration과 소형 모델의 기능 작업이 나뉜 멀티 에이전트에서는 통신·이력 공유·수정 루프가 컨텍스트를 크게 만든다고 설명한다. task-specific 작업은 높은 해상도의 문맥이 꼭 필요하지 않아 적극 압축해도 품질에 큰 영향이 없을 것이라는 견해다.

근거 보기 2
  1. 원문 구간 1

    ​ (3) 목적 자체는 Engram, CMX, Dynamo, KVTC, TurboQuant, LPX 등등 다 비슷한 결입니다. Chatbot/Reasoning을 넘어서 사용 사례의 평균값이 Agentic AI로 넘어감에 있어서 워낙 많은 연산과 KV Cache 보관, 전송이 필요하게 되니 이것들을 어떻게 분산해서 각각의 파츠에서 해결할 수 있을까입니다. KV Cache를 손실을 최소화하면서 더 많이 압축하려 하고, 더 가까이 KV Cache를 보관해두어 G1~G2~G3~G4로 이동할 때 생기는 latency penalty를 최소화하려 하며, 모델이 KV Cache를 재연산하지 않고 더 빠르게 토큰을 생성할 수 있게끔 cache hit rate를 높이기 위해 노력하는 방향입니다. 그리고 지금 나오는 KV Cache 효율화들이 실제 힘을 강력하게 발휘하는 지점들은 Reasoning처럼 단일 혹은 3개 정도의 모델이 단일/병렬 추론하는 환경이 아니라 멀티 에이전트 환경입니다.

  2. 원문 구간 2

    멀티 에이전트로 가게 되면 같은 성능에 효율을 높이기 위해서 Planning 및 Orchestration은 거대모델(Opus, GPT-xhigh)이 하고, 코드 생성처럼 각각 기능에 초점을 맞춘 작업들은 소형모델(Sonnet/Haiku, GPT-mini/GPT-nano)이 하는 구조가 기본입니다. 그러면 에이전트들끼리 서로 커뮤니케이션하고, 이력을 공유하며, 수정하는 루프를 할 때마다 컨텍스트가 이전보다 훨씬 더 크게 증가합니다. 이 과정에서 엄청난 양의 KV Cache가 나오긴 하지만, 이들은 매우 좁고 명확한 작업(task-specific)을 수행하기에 높은 해상도의 문맥을 필요로 하는 것이 아니므로 보다 적극적인 압축을 걸어도 결과물의 퀄리티에는 큰 영향을 주지 않을 것입니다. ​ (4) 샌디스크, 키옥시아, 솔리다임, 시스코가 난야 테크에 3자 배정 유상증자를 발표했습니다. 샌디스크 : 보통주 138,685,000주를 주당 NT$223.9에 인수

시점 관찰DRAM·NAND 현물·계약가격주 대상 · 산업·업종 · DRAM관련 대상 · 산업·업종 · NAND기준 2026.03.26

현물가와 계약가의 관계는 다음 계약가격을 어떻게 추적하게 하는가?

이 자료가 더한 내용

TrendForce DRAM·NAND 현물가는 보합이고 3월 계약가격은 유지되며, 현물가격은 이미 계약가격보다 높다고 적었다. 4월 계약가격이 다시 오를 경우 현물 가격 추이를 계속 지켜볼 일이라는 관찰이다.

근거 보기 1
  1. 원문 구간 1

    ​ (5) TrendForce DRAM, NAND 현물가들은 보합세를 유지 중입니다. 3월 계약 가격이 유지되고 있고, 현물가격이 이미 계약가격보다 높은 상태에서 거래되고 있습니다. 4월에는 다시 계약가격이 상승하면 현물 가격 추이가 어떻게 되는지 계속 지켜볼 일입니다. ​ (6) GF증권이 TPU 출하량 전망치를 CY26 450만 개 → CY27 790만 개로 예상했습니다. 원래 CY27 600만 개였음을 감안하면 30% 정도 추가 상향한 것입니다. 브로드컴이 설계한 TPU 출하량은 CY26 410만 개/CY27 580만 개일 것으로 전망했습니다. 메타의 MTIA 출하량 전망치는 CY26 30만 개/CY27 50만 개로 최근 지속 하향 중입니다. ​ (7) AI HW 섹터 내의 기업들 EPS는 꾸준히 같이 좋아지고 있었는데, 어디로 모멘텀이 옮겨다니고 있는가를 생각하자면 메모리가 둔화될 때 GPU, CPU 등 로직 쪽이 부각받을 수 있다는 생각은 가볍게 하고 있습니다.

시점 관찰TPU 출하량 전망주 대상 · 기술·제품 · TPU관련 대상 · 기업·종목 · Broadcom관련 대상 · 기업·종목 · Meta기준 2026.03.26

GF증권의 TPU 출하량 전망은 브로드컴 TPU와 메타 MTIA의 전망을 어떻게 구분해 제시하는가?

이 자료가 더한 내용

GF증권은 TPU 출하량을 CY26 450만개, CY27 790만개로 예상했고 CY27 전망은 기존 600만개보다 약 30% 상향했다. 브로드컴 설계 TPU는 CY26 410만개·CY27 580만개, 메타 MTIA는 CY26 30만개·CY27 50만개로 최근 지속 하향 중이라는 전망을 함께 제시했다.

근거 보기 1
  1. 원문 구간 1

    ​ (5) TrendForce DRAM, NAND 현물가들은 보합세를 유지 중입니다. 3월 계약 가격이 유지되고 있고, 현물가격이 이미 계약가격보다 높은 상태에서 거래되고 있습니다. 4월에는 다시 계약가격이 상승하면 현물 가격 추이가 어떻게 되는지 계속 지켜볼 일입니다. ​ (6) GF증권이 TPU 출하량 전망치를 CY26 450만 개 → CY27 790만 개로 예상했습니다. 원래 CY27 600만 개였음을 감안하면 30% 정도 추가 상향한 것입니다. 브로드컴이 설계한 TPU 출하량은 CY26 410만 개/CY27 580만 개일 것으로 전망했습니다. 메타의 MTIA 출하량 전망치는 CY26 30만 개/CY27 50만 개로 최근 지속 하향 중입니다. ​ (7) AI HW 섹터 내의 기업들 EPS는 꾸준히 같이 좋아지고 있었는데, 어디로 모멘텀이 옮겨다니고 있는가를 생각하자면 메모리가 둔화될 때 GPU, CPU 등 로직 쪽이 부각받을 수 있다는 생각은 가볍게 하고 있습니다.

해석·전망데이터센터 전력 확보주 대상 · 산업·업종 · 데이터센터 전력

전력 확보 지연과 BYOP의 신뢰도 목표는 프로젝트 조건을 어떻게 바꾸는가?

이 자료가 더한 내용

DCD Connect 발언을 인용해 전력 공급이 여전히 중요하고, 예상보다 긴 전력 확보 기간 때문에 BTM으로 선회한 고객이 있었다고 전한다. 숙련 인력 부족·지역 반대와 천연가스 파이프라인 위험 속에서 많은 BYOP 프로젝트가 비용 때문에 five 9s 대신 three 9s를 목표로 한다는 설명이다.

근거 보기 1
  1. 원문 구간 1

    배관공, 전기공 등 숙련 노동인력 부족을 느끼고 있다. 이제 NIMBY(Not-In-My-Back-Yard)를 넘어서, BANANA(Build-Absolutely-Nothing-Anywhere-Near-Anyone)으로 향하고 있고, 동네마다 전력가격 상승을 이유로 짚으며 데이터센터 건설 금지 요구가 점점 더 강해지고 있다. BYOP(Bring-Your-Own-Power)는 주로 천연가스에 의존하기에 천연가스 파이프라인 중단 위험을 고려할 때 어떻게 BTM 발전이 99.999%(five 9's)를 유지할 수 있을 것인가에 대해서 중요한 과제가 있었는데, BYOP 관련 패널 토론에서 대부분의 전문가가 현재 많은 수의 BYOP 프로젝트에서 99.9%(three 9's)만을 목표로 하고 있다고 말했습니다. five 9's를 하기 위해서 드는 추가비용이 너무 많아서입니다.

시점 관찰트랜스메딕스 비행 건수주 대상 · 기업·종목 · TransMedics기준 2026.03.26

트랜스메딕스의 일간 비행 데이터에서 성장 속도를 어떻게 읽는가?

이 자료가 더한 내용

1Q26 누적 비행은 2,385건, 일간 데이터는 34건 증가, 84일 기준 일평균은 28.40건이라고 적었다. 최근 비행 데이터 성장세는 미적지근해 좋지 않다는 관찰이다.

근거 보기 1
  1. 원문 구간 1

    광고/이커머스: ​ (1) S&P 500 기업들의 Forward P/E가 낮음을 느끼는 건 엔비디아, 이커머스 기업들, 피겨테크 등을 보면 비슷하게 이미 느끼고 있긴 합니다. 의료기기/핀테크/코인: ​ (1) 오늘 트랜스메딕스의 1Q26 누적 비행은 2385건입니다. 오늘의 일간 비행데이터는 +34건입니다. 1Q는 84일이 지났으며 일평균 비행속도는 28.40건 속도입니다. 최근 비행 데이터 성장세는 미적지근한 상태라서 좋진 않습니다. 4Q25 실적발표에 대한 생각은 3월 2일 주간전략보고에 있습니다. ​ (2) 오늘의 서클 USDC 유통량은 $78.69B, CCTP 전송량은 30일 기준 $13.0B입니다. USDC 유통량 자체는 29주간 횡보 중입니다. 횡보를 뚫는 기준은 MoM 기준 20% 이상의 성장세를 1주간 유지하는가입니다.

시점 관찰USDC 유통량주 대상 · 시장·자산 · USDC기준 2026.03.26

USDC 유통량의 횡보 탈피는 어떤 성장 기준으로 판단하는가?

이 자료가 더한 내용

USDC 유통량은 786.9억달러, 30일 CCTP 전송량은 130억달러이고 29주 횡보 중이다. 작성자는 전월 대비 20% 이상 성장세가 1주 유지되는지를 횡보 탈피 기준으로 두며, 당시 주간 변화는 -1.17%, 월간 변화는 +5.68%라고 적었다.

근거 보기 1
  1. 원문 구간 1

    오늘 주간 기준 -1.17%, 월간 기준 +5.68% 수준입니다. ​ (3) 오늘 피겨 테크의 ⓐHELOC 발행량 방향을 알 수 있는 Provenance TVL 볼륨은 $1.55B입니다. 계단식으로 상승하곤 했기에 매일 살펴볼 지표는 아닙니다만 트래킹 차원입니다. ⓑFigure Markets가 잘 돌아가고 있는지를 파악할 수 있는 YLDS 유통량 $583M입니다. 마찬가지로 계단식으로 상승하곤 했기에 매일 살펴볼 지표는 아닙니다만 트래킹 차원입니다. 저희의 생각을 담아서 랩을 운용하고 있습니다 메리츠증권 : https://naver.me/xQiZ5UHt SK증권 : https://naver.me/FlcOtVGm

시점 관찰Figure 운영 지표주 대상 · 기업·종목 · Figure Technology기준 2026.03.26

HELOC 발행과 Figure Markets의 흐름은 어떤 지표로 추적하는가?

이 자료가 더한 내용

HELOC 발행량 방향을 보는 Provenance TVL은 15.5억달러, Figure Markets의 운영을 보는 YLDS 유통량은 5.83억달러라고 적었다. 두 지표는 계단식으로 오르는 특성이 있어 매일 보는 지표가 아니라 추적용으로 둔다.

근거 보기 1
  1. 원문 구간 1

    오늘 주간 기준 -1.17%, 월간 기준 +5.68% 수준입니다. ​ (3) 오늘 피겨 테크의 ⓐHELOC 발행량 방향을 알 수 있는 Provenance TVL 볼륨은 $1.55B입니다. 계단식으로 상승하곤 했기에 매일 살펴볼 지표는 아닙니다만 트래킹 차원입니다. ⓑFigure Markets가 잘 돌아가고 있는지를 파악할 수 있는 YLDS 유통량 $583M입니다. 마찬가지로 계단식으로 상승하곤 했기에 매일 살펴볼 지표는 아닙니다만 트래킹 차원입니다. 저희의 생각을 담아서 랩을 운용하고 있습니다 메리츠증권 : https://naver.me/xQiZ5UHt SK증권 : https://naver.me/FlcOtVGm

4

시간흐름대로 모든 내용을 살려 정리

시간흐름대로 모든 내용을 살려 정리

1
데일리의 범위와 유의사항

안녕하세요 올바른입니다. 2026년 3월 26일 목요일, 데일리 전해드립니다. 주간전략보고는 2026-03-23자 ‘투자의 생각 (3월 23일~3월 27일)’이고, 일간보고는 2026-03-25자 ‘투자의 생각 (260325)’, 2026-03-24자 ‘투자의 생각 (260324)’ 바로가기를 남깁니다. 투자자문 서비스에 따른 투자 시 원금 손실이 발생할 수 있으며 투자 손익 책임은 전적으로 고객에게 귀속됩니다. 과거 투자수익도 미래 수익률을 보장하지 않습니다. 신규 구독 전에는 투자자문계약 권유문서 https://naver.me/5ZST47Qf의 계약 관련 제반 사항을 반드시 읽고 충분히 검토하시기 바랍니다.

2
지수·시장 폭과 섹터

일간보고 : 투자의 생각, 2026-03-26 (목)입니다. 주요 지수는 러셀 +1.23% > 나스닥 +0.77% > 다우 +0.66% > S&P +0.54%입니다. 상승종목비율은 NYSE 235%, Nasdaq 213% 🟢 (🟢🟡🔴)로 적었습니다. 강세는 바이오텍, 원자재, 적자성장주, 반도체, 헬스케어, 임의소비이고 약세는 에너지입니다. 메이저 뉴스는 제목 - 참고를 위해 살펴보는 기업군 주가 : 그날의 생각 순서로 봅니다.

3
선행 P/E와 좁은 상승

S&P 500 Forward P/E는 2025년 4월 관세 하락기 수준까지 내려와 있습니다. 그동안 EPS는 워낙 많이 올라있는데 지수 기준 주가는 횡보 내지는 하락했기 때문입니다. Market Breadth가 얕은 상태에서의 상승을 보이고 있었으니, AI HW 중 메모리와 광학 위주로 몰려서 상승했던 것을 제외하면 대부분 주식은 약간씩 하락하던 추세인 게 자연스럽습니다. 미국주식 전체로 보자면 성장성 대비 밸류가 매력적인 때입니다.

4
애플·구글 AI 파트너십과 메타 소식

애플은 자사 데이터센터에서 굴리는 제미나이 모델에 대해 완전한 접근 권한을 갖고 있습니다. 제미나이를 가져다가 distillation용으로 쓸 수도 있고, 특정 사용 사례에 맞는 모델이나 기기에서 로컬로 실행될 수 있을 만큼의 소형 모델을 만드는 식입니다. 다만 distillation을 하더라도 파운데이션 모델 자체를 잘 만들어야 잘할 수 있는 것이지, 지금처럼 모델을 빌드한 경험이 없는 상태에서 좋은 소형 모델을 만들 수는 없을 거라 생각합니다. 오픈AI IP를 갖고 GPT를 API 비용 없이 자체 GPU 가동비용만 내고 무료로 돌릴 수 있는 마이크로소프트에서도 유의미한 모델이 안 나오는 점을 생각해보시면 됩니다. 메타는 중소기업들의 AI 도입 촉진을 위해 Meta Small Business를 출시했고, 회사 전반에 걸쳐 수백 명 직원을 해고할 예정입니다. 4Q25 기준 7만8천 명 중 수백 명이므로 감원 규모가 많진 않습니다.

5
KV Cache 압축을 읽는 태도

최근 KV Cache 압축에 시장 관심이 높지만 펀더멘탈상 영향이 있을 이슈는 아닙니다. 시장이 메모리 수요가 지금처럼 높게 유지될지를 궁금해하고, 많이 담아둔 플레이어들이 차익실현 빌미를 찾는 상태였다고 남기면 됩니다. 사람들이 몰라서 그렇다고 보면 스트레스를 많이 받습니다. 시계열의 차이는 있어도 주가는 시차를 두고 높은 확률로 펀더멘탈을 따라가며, 그 펀더멘탈을 앵커링 없이 판단했는지를 되묻는 과정이 가장 고통스러운 고민입니다. 엔비디아 KVTC 생각은 이번 주 주간전략보고에 남겼습니다.

6
AI 컴퓨팅의 병목 이동

Bird's-eye view를 유지하시는 게 좋습니다. 고민한 흔적이 다 깊이로 남습니다. 펀드가 아니면 기본적으로 여러분들이 운전석에 앉아 계시기 때문에 고민은 직접해보셔야 합니다. 기본적으로는 늘 2012년 AlexNet을 통해 AI/ML의 시대가 개화한 이후 컴퓨팅 성능 개선을 통한 FLOPS 향상과 알고리즘 최적화를 통한 효율 향상으로 발전해온 역사입니다. 현 시대의 AI 컴퓨팅은 결국 로직-메모리, 하드웨어-소프트웨어-네트워킹 조합을 통해 어디에서 병목을 해결해줄 것인가를 두고 파레토 프론티어 최적점을 찾아나가는 과정입니다. 암달의 법칙처럼 한쪽 병목을 해결하여 10x 모먼트를 발견하더라도 다른 쪽에서 새로운 병목이 생기고, 또 해결하고 그런 것의 반복입니다. KV Cache 자체도 로직(GPU) 연산 병목을 줄이기 위해 메모리에서 병목을 해결하는 방법으로 나왔던 것입니다.

7
Reasoning의 서버당 경제성

Chatbot → Reasoning → Agentic AI로 넘어가는 과정에서 CoT 길이가 길어지며 추론당 요구하는 컨텍스트 메모리 규모인 KV Cache가 훨씬 커졌습니다. 침투율이 높아져 사용자와 사용량이 증가하는 것 말고도, 한 번의 쿼리당 생각하는 토큰 양이 10배 이상씩 많아집니다. 하나의 서버, 하나의 도메인(노드)에서 처리할 수 있는 token throughput은 정해져 있습니다. 물론 시계열을 넣어 보면 알고리즘 효율이 높아지면서 token throughput도 계속 많아집니다. 그래도 서버당 서비스할 수 있는 사용자 수(interactivity)는 줄어듭니다. 러프한 숫자로, Chatbot만 쓸 때 HGX H100 8-GPU 서버 1개가 초당 토큰 10만개를 출력하고 1,000 token/user/s로 100명을 서비스했다면, Reasoning에서는 CoT도 token 사용이므로 사용량이 평균 10배 증가한다고 할 때 같은 서버에서 10,000 token/user/s로 10명에게 서비스할 수 있습니다. 이렇게 해야 같은 latency로 서비스를 받게 됩니다.

8
가격·지연시간·구독 전환의 선택

대략 30만달러를 주고 HGX H100 8-GPU 서버 한 대를 사와 백만 토큰당 5달러에 100명을 서비스하다가 10명에게만 서비스할 수 있게 되면, 매출과 마진을 고려해 몇 가지 선택을 할 수 있습니다. 그대로 백만 토큰당 가격을 50달러로 10배 높일 것인가, 사용자 불만을 최소화할 정도로 latency를 낮춰 5,000 token/user/s로 20명에게 서비스하고 백만 토큰당 25달러로 5배 높일 것인가 등입니다. 초당 더 많은 토큰을 출력받느냐는 Free 요금제 사용자의 ChatGPT Plus·Pro 구독전환율과 밀접하게 관련 있기에, 외연 확장 혹은 구독전환이라는 제한적인 환경에서 파레토 프론티어 최적점을 그때그때 잘 찾는 게 중요합니다. 초기 세팅은 이렇게 하겠지만 줄곧 알고리즘 효율을 높이고 H100에서 GB200 NVL72로 추론 HW 세팅을 옮겨가며 같은 서버 기준 TPS/user를 높입니다.

9
Agentic AI가 만드는 메모리 계층

2025년 9월쯤부터 Agentic AI 수요가 크게 증가하기 시작했고 KV Cache 사용량은 Reasoning에 비해 또 한 번 10배 증가하는 국면이 됐습니다. 신제품이 나올 때마다 메모리 용량과 대역폭을 높여온 발전이 scale-up 방향이라면, Agentic AI 수요가 높아지면서 GPU-HBM(G1)과 최대한 가까이에 더 많은 DRAM(G2)을 붙이려는 scale-out 방향으로 서버당 DRAM 탑재량을 늘렸던 것입니다. 이전에는 KV Cache를 그때그때 연산해서 쓰게 했지만 사용량이 많아지며 재연산 병목이 길어졌고, G1을 넘어 G2·G3·G4까지 갈 때의 latency penalty도 부각됐습니다. 그래서 더 많이 저장해 재연산하지 않고 lookup해서 가져오는 편이 훨씬 저렴해졌습니다. DeepSeek Engram은 cache hit rate를 높이려는 연구이고, 읽고 쓰기가 상대적으로 빠른 고성능 eSSD도 저장용으로 쓰입니다. KV Cache 재연산 필요성을 없애 GPU MFU를 높이는 것이 하이퍼스케일러·AI Labs 입장에서는 퍼포먼스를 크게 높이는 길입니다.

10
침투율과 다음 10배

이제 Agentic AI 침투율은 기껏해야 1~3% 정도일 것입니다. 의외로 GPT-5가 나오기 전까지 ChatGPT Plus 사용자도 7%만 Reasoning 모델을 썼고, 무료 사용자는 1% 미만이 사용했습니다. Claude Code, Codex ARR이 매월 50~100%씩 성장하는 트렌드를 생각하면 앞으로도 10x 모먼트가 끝나지 않았다는 의미입니다. 토큰당 지능 압축도를 높이는 건 더 많은 FLOPS·파라미터·데이터로 pre-training run을 돌리는 것이므로 아직 Agentic AI의 가장 가파른 S-curve는 시작하지 않은 셈입니다. Reasoning의 시작은 2024년 9월~2025년 1월이었지만 본격 침투는 2025년 2월~2025년 8월이었습니다. 그때가 CSP들이 수요-공급 초과를 호소하기 시작하고 CapEx가 줄상향됐던 시기입니다.

11
TurboQuant의 공개 범위와 시장 맥락

위의 1번에는 KVTC, TurboQuant 논문을 다시 살펴보고 남긴 생각부터 정리했습니다. 구글 TurboQuant는 2025년 4월 28일 공개 자료입니다. AI Labs는 대부분 폐쇄소스로 운영하고 워낙 큰 금액을 놓고 경쟁하므로 핵심 알고리즘을 공개하지 않습니다. 오픈소스 진영이 새롭게 뜯어보는 중이지만 이들은 메인 구매자가 아니며, 컴퓨팅 메인 구매자인 하이퍼스케일러·AI Labs 입장에서는 이미 알고 있던 내용입니다. 이미 업계는 엔비디아 주도로 FP8 KV Cache를 쓰고 있고 NVFP4 전환도 적극 추진 중입니다. 자료가 공개된 뒤에도 로직 반도체 가까이에 더 많은 DRAM을 넣으려 했고, 모두가 그러다 보니 P 상승도 나왔지만 업계는 여전히 DRAM 수요가 공급을 초과하는 상태입니다. 같은 양의 퍼포먼스를 낼 더 적은 예산을 택하는 것이 아니라 같은 예산으로 더 높은 퍼포먼스를 내길 택한다는 것을 매우 짧게 줄인 말이 제번스의 역설입니다.

12
압축의 원리와 긴 컨텍스트 제약

KV Cache를 압축할 때는 데이터 크기를 줄이는 것을 넘어서 압축 후 복원했을 때 내적 값이 원래 값과 거의 동일하게 유지되어야 합니다. TurboQuant는 랜덤회전·양자화·1-bit 보정 과정을 거쳐 내적 값을 거의 비슷하게 유지하며 KV Cache를 압축하도록 만들었습니다. 실시간 처리가 가능하고 가속기 친화적으로 설계돼 적용하기 쉽습니다. 다만 실무자들 얘기로는 랜덤회전 작업 병목이 커 실제 Agentic AI 워크로드에 전면 적용될 것 같진 않습니다. 2,000토큰 이하 컨텍스트는 괜찮지만 길어질수록 랜덤회전 부하가 커져 컨텍스트가 2배가 될 때마다 속도가 2~7%씩 느려집니다. 논문은 짧거나 중간 정도 컨텍스트에서만 썼는데, 397B 규모 거대 모델을 돌려보니 몇 시간 만에 긴 컨텍스트 속도 저하가 두드러졌습니다.

13
압축 기술의 맞는 자리

TurboQuant는 메모리가 부족해 성능을 희생하면서 KV Cache를 더 압축하고 싶을 때 적절합니다. 반대로 메모리를 충분히 확보했는데 퍼포먼스만 높이고 싶다면 랜덤회전 병목만 더할 수 있습니다. 로컬 LLM은 같은 메모리 용량에서 더 많은 KV Cache를 둘 수 있어 좋지만, 하이퍼스케일러와 AI Labs는 상대적으로 메모리가 충분해 성능 향상에는 도움이 덜하다는 의미입니다. Engram·CMX·Dynamo·KVTC·TurboQuant·LPX도 결국 Agentic AI에서 커진 연산·KV Cache 보관·전송을 각 파트에 어떻게 분산할지라는 같은 결입니다.

14
멀티 에이전트에서의 cache 효율화

Chatbot·Reasoning을 넘어 사용 사례의 평균값이 Agentic AI로 넘어가면서 워낙 많은 연산과 KV Cache 보관·전송이 필요해졌습니다. Engram·CMX·Dynamo·KVTC·TurboQuant·LPX의 목적은 이것들을 어떻게 분산해 각각의 파츠에서 해결할지라는 비슷한 결입니다. KV Cache는 손실을 최소화해 더 압축하고, G1~G2~G3~G4로 이동할 때 생기는 latency penalty를 최소화하도록 더 가까이 보관하며, 재연산 없이 빠르게 토큰을 생성하도록 cache hit rate를 높이려는 방향입니다. 실제 효율화가 강하게 작동하는 지점은 Reasoning처럼 단일 혹은 세 개 정도 모델이 단일·병렬 추론하는 환경이 아니라 멀티 에이전트 환경입니다. Planning·Orchestration은 Opus·GPT-xhigh 같은 거대 모델이 하고, 코드 생성처럼 기능에 초점을 맞춘 작업은 Sonnet·Haiku·GPT-mini·GPT-nano 같은 소형 모델이 합니다. 서로 커뮤니케이션하고 이력을 공유하며 수정하는 루프마다 컨텍스트는 훨씬 커지지만, 이들은 매우 좁고 명확한 task-specific 작업이어서 높은 해상도 문맥을 필요로 하지 않으니 적극 압축해도 결과물 퀄리티에는 큰 영향이 없을 것입니다.

15
난야테크 증자와 DDR4 조달

샌디스크·키옥시아·솔리다임·시스코가 난야 테크 3자 배정 유상증자를 발표했습니다. 샌디스크는 보통주 1억3,868만5,000주, 키옥시아 7,000만주, 솔리다임 7,139만3,000주, 시스코 7,150만주를 모두 주당 NT$223.9에 인수했습니다. 총 3억5,157만8,000주로 난야 테크 주식 약 11%이고 실제 자본 증자와 신주발행 기준일은 2026년 4월 8일입니다. 난야 테크는 새 메모리 반도체 공장과 설비에 자금을 쓸 예정입니다. NAND만 생산하는 샌디스크·키옥시아는 고사양 NVMe eSSD의 DDR4 조달에 어려움을 겪었고, 4TB SSD당 DRAM Cache가 512MB~1GB 필요합니다. 신규 팹 물량 우선 장기공급계약을 맺는 지분투자형 파트너십 사례입니다.

16
현물·계약가격과 TPU 전망

TrendForce DRAM, NAND 현물가는 보합세를 유지 중입니다. 3월 계약가격이 유지되고 있고, 현물가격은 이미 계약가격보다 높은 상태에서 거래됩니다. 4월에는 다시 계약가격이 상승하면 현물가격 추이가 어떻게 되는지 계속 지켜볼 일입니다. GF증권은 TPU 출하량 전망치를 CY26 450만개 → CY27 790만개로 예상했습니다. 원래 CY27 600만개였음을 감안하면 30% 정도 추가 상향한 것입니다. 브로드컴이 설계한 TPU 출하량은 CY26 410만개/CY27 580만개일 것으로 전망했습니다. 메타 MTIA 출하량 전망치는 CY26 30만개/CY27 50만개로 최근 지속 하향 중입니다.

17
CPU 가격과 AI HW의 모멘텀 이동

AI HW 기업들의 EPS는 꾸준히 같이 좋아졌지만 메모리가 둔화될 때 GPU·CPU 같은 로직이 부각될 수 있다는 생각은 가볍게 하고 있습니다. Nikkei Asia에 따르면 인텔과 AMD는 모두 3월 CPU 가격을 추가 인상했습니다. 누적 인상률은 10~15%이고 납기일은 2주에서 6개월까지 급증해 공급 부족이 이어집니다. 하반기에는 인텔이 데이터센터용에서 기존 PC용으로 돌렸던 공급을 늘릴 수 있지만, Agentic AI에서 CPU가 전보다 중요해지는 것도 맞습니다. Enterprise/GPU IaaS에는 오늘 다른 업계 뉴스가 없었습니다.

18
전력 확보의 시간과 신뢰도

DCD Connect에서 Barclays 애널리스트가 정리한 주요 발언입니다. 전력 공급은 여전히 중요하고, 1년 안에 받을 줄 알았던 데이터센터 전력을 5년간 받아도 충분히 못 받아 프로젝트를 BTM으로 선회한 고객이 있었다고 합니다. 배관공·전기공 같은 숙련 인력도 부족합니다. NIMBY를 넘어 BANANA, 즉 누구 근처 어디에도 아무것도 짓지 말자는 흐름으로 가며 전력가격을 이유로 데이터센터 건설 금지 요구가 강해지고 있습니다. 천연가스 의존 BYOP는 파이프라인 중단 위험 속 99.999% 신뢰도를 어떻게 유지할지가 과제였는데, 패널에서는 많은 프로젝트가 추가비용 때문에 99.9%만 목표로 한다고 말했습니다.

19
낮은 P/E 관찰과 비행 데이터

광고·이커머스에서는 S&P 500 기업들의 Forward P/E가 낮다고 느끼는 것은 엔비디아, 이커머스 기업들, 피겨테크 등을 보면 비슷하게 이미 느끼고 있습니다. 의료기기·핀테크·코인에서는 오늘 트랜스메딕스의 1Q26 누적 비행이 2,385건입니다. 오늘 일간 비행데이터는 +34건이고, 1Q는 84일이 지났으며 일평균 비행속도는 28.40건 속도입니다. 최근 비행 데이터 성장세는 미적지근한 상태라서 좋진 않습니다. 4Q25 실적발표에 대한 생각은 3월 2일 주간전략보고에 있습니다.

20
USDC와 Figure 추적 지표

서클 USDC 유통량은 786.9억달러, CCTP 30일 전송량은 130억달러입니다. 유통량은 29주간 횡보했고, 횡보를 뚫는 기준은 월간 20% 이상 성장세가 1주 유지되는가입니다. 오늘은 주간 -1.17%, 월간 +5.68%입니다. 피겨 테크는 HELOC 발행량 방향을 알 수 있는 Provenance TVL 볼륨이 15.5억달러이고, Figure Markets를 볼 수 있는 YLDS 유통량은 5.83억달러입니다. 둘 다 계단식으로 오르는 지표라 매일 볼 것은 아니지만 트래킹 차원에서 봅니다. 저희의 생각을 담아 랩을 운용하며 메리츠증권 https://naver.me/xQiZ5UHt, SK증권 https://naver.me/FlcOtVGm 링크를 남깁니다.

5

그럼에도 빠진내용 정리

잡담·곁다리 내용

별도 참고사항이 없습니다.

생략 기록

별도 생략 기록이 없습니다.

그럼에도 빠진내용 정리

별도 이슈가 없는 구역
Enterprise/GPU IaaS에는 다른 업계 뉴스가 없다는 한 문장과 광고·이커머스의 밸류에이션 관찰은 flow에 보존했다.
원문상 수치의 성격
HGX H100 서비스 인원·가격, Agentic AI 침투율, TurboQuant 성능 저하는 작성자의 예시·가정·실무자 의견으로, 확인된 계약·사건과 구분해 흐름에 남겼다.
이미지·첨부
보존된 텍스트에는 이 자료의 이미지·첨부 내용이 포함되지 않아 그 내용을 해석하거나 보완하지 않았다.
원문 확인

document_work_runner prepare가 입력 원문을 수정 없이 보존했다.