2025.10.21 · 네이버 프리미엄 콘텐츠 · 올바른 미국주식 by SAPIENS

(아카이브) 휴머노이드 산업분석 : AI가 몸을 찾고 있습니다

유형
네이버 프리미엄 콘텐츠
날짜
2025.10.21
강연자/작성자
올바른 미국주식 by SAPIENS
분석 주제
미지정
자료 길이
본문 17,421자
1

문서 전체 조망

핵심 구조

월드모델과 시뮬레이터가 휴머노이드 개발의 병목을 겨냥한다

이 자료는 신경망의 스케일링 가설에서 출발해 NVIDIA Cosmos, 휴머노이드 훈련과 공급망까지 연결한다. 현실을 이해하는 월드모델과 실제 작업을 수행하는 손·액추에이터가 갖춰져야 AI가 몸을 얻는다는 점이 중요하며, 이것이 개발·공급망을 판단하는 기준이 된다.

딥러닝의 출발점은 빠른 인간 작업을 신경망으로 옮길 수 있다는 가설이다

텍스트 자기회귀모델, 거대한 신경망, 거대한 데이터셋의 조합이 현재 AI의 기반이며, 인간이 순식간에 하는 일은 충분한 층의 신경망으로 재현하고 복제해 확장할 수 있다는 생각이 그 바탕에 놓인다. 이 가설이 스케일링의 출발점이기 때문이다.

월드모델은 언어를 넘어 물리와 인과를 다루는 훈련 기반이다

로봇이 현실에서 행동하려면 중력·마찰·관성, 공간 관계와 물체의 지속성을 다뤄야 한다. Cosmos는 현실 데이터만으로 쌓을 때의 비용을 줄이도록 물리적 AI용 월드모델과 데이터 처리·합성·평가 도구를 묶었다. 현실 데이터의 비용이 병목이기 때문이다.

오픈소스는 직접 매출보다 개발 범위를 넓히는 방식으로 작동한다

작성자는 Llama 2가 기업의 생성형 AI 연구 문을 열었던 사례에 비춰 Cosmos를 로보틱스의 오픈소스 전환점으로 본다. 다만 엔비디아가 직접 시장을 주도한다기보다 고객의 시장 개척 속도와 가속기·Jetson·CUDA 생태계를 넓히는 효과를 구분한다는 점이 판단의 조건이다.

걷기보다 손으로 실제 일을 하는 학습이 더 어렵다

보행은 목표와 보상으로 강화학습할 수 있지만, 관절 수가 많은 팔과 손가락은 물체·힘·궤적을 이해해야 하므로 사람 동작을 따르는 모방학습 데이터가 필요하다. 따라서 수천 환경의 시뮬레이션과 물리 모델은 이 데이터와 검증의 범위를 넓히는 도구다.

개발은 학습·시뮬레이션·탑재 컴퓨터의 세 층으로 나뉜다

원문은 DGX에서 GR00T를 학습하고, OVX·Omniverse에서 현실을 모사해 훈련한 뒤, AGX Jetson에서 환경·경로·시각 데이터를 처리하며 로봇을 가동하는 구조를 제시한다.

하드웨어의 중심은 관절과 근육 역할을 하는 액추에이터다

옵티머스의 생산 목표와 부품 구성을 통해 휴머노이드가 센서·모터·나사·감속기 등으로 이루어진다는 점을 짚는다. 전동식의 대량생산·정밀 제어 장점과 유압식의 한계, 자유도를 좌우하는 액추에이터의 역할이 공급망을 읽는 기준으로 제시된다.

ANALYSIS VIEW사건별 사실과 작성자의 판단, 지속 정보를 나누어 읽기
2
발생·예정 사건과 출처별 관점

이슈 분석

이 자료가 이슈의 어떤 사실을 다루고, 작성자가 무슨 결론을 어떤 근거로 내렸는지 원문에 붙여 읽습니다.

발생발표·발생 후발생일 25-1-6

25-1 NVIDIA Cosmos 공개

작성자의 핵심 판단

Cosmos의 공개는 휴머노이드 개발자가 물리 법칙을 반영한 시뮬레이션과 합성 데이터를 활용할 길을 넓혔고, 작성자는 이것이 고객의 새 시장 개척 속도를 높여 엔비디아에도 긍정적일 수 있다고 본다. 다만 오픈소스이므로 엔비디아가 이를 통해 시장을 직접 주도하는 효과는 제한적이라고 구분했다.

근거 보기 3
  1. 원문 구간 1

    우리는 Physical AI를 민주화하고 모든 개발자가 로보틱스를 활용할 수 있도록 NVIDIA Cosmos를 만들었습니다." 2025-01-06, 젠슨 황, NVIDIA Cosmos 발표 보도자료 中 엔비디아의 코스모스Cosmos는 모든 기업들이 월드모델을 만들 수 있도록 돕는 플랫폼입니다. 월드모델 + 데이터로 모델을 학습시키기 위한 도구Autoregressive Model, Diffusion Model, Video Tokenizaers, Video Processing and Curation Pipeline로 구성된 플랫폼입니다. 실제 세상에 적용되는 보편적인 물리법칙들에 대해 훈련하여 일부 이해하고 있는 모델입니다. 코스모스의 월드모델 자체는 2,000만 시간 분량의 로보틱스 및 주행 데이터를 포함하여 9,000조 개 토큰으로 학습했습니다.

  2. 원문 구간 2

    ​ NVIDIA Cosmos는 오픈소스이기에 당장 엔비디아가 이를 통해 직접적으로 뭔가를 주도할 것은 적습니다. AI 가속기를 통해 AI가 더 많은 애플리케이션에 쓰이도록 하는 미션에 초점을 맞춘 것입니다. 이에 따라 최근 6개월 동안 각종 휴머노이드 개발이 훨씬 더 많아졌습니다. ​ 모든 로보틱스 회사는 세 가지를 가져야 한다 젠슨황은 모든 로보틱스 기업은 향후 세 가지 컴퓨터를 갖게 될 거라고 봤는데, 테슬라가 따라온 길과도 같습니다. 훈련을 위한 슈퍼컴퓨터 + FSD 신경망 + 추론 칩/Fleet 중에 FSD가 월드모델을 만들어가는 길이었기 때문입니다. 자율주행을 완벽한 수준으로 해결하기 위해서는 월드모델을 구축함이 필요하고, 이것을 해결하는 과정에서 옵티머스의 완성도 자연스러운 그림이었습니다.

  3. 원문 구간 3

    여러모로 코스모스가 긍정적인 영향을 미칠 것으로 예상하는 이유입니다. 오픈소스이기에 엔비디아가 시장에 직접적인 영향을 미치는 건 거의 없지만 고객들의 새로운 시장 개척속도를 더 빠르게 한다는 점에서 엔비디아에게는 긍정적훈련용 Hopper/Blackwell, 추론용 Jetson, CUDA 생태계 확장입니다. ​ 주요 휴머노이드 제조사 Tesla, Figure, Unitree, UBTech ​ 주요 휴머노이드 개발기업 현재까지 서방진영 휴머노이드 대표 기업은 테슬라Tesla, 피규어Figure, 보스턴 다이내믹스Boston Dynamics, 어질리티 로보틱스Agility Robotics, 앱트로닉Apptronik, 1X1X, 뉴라 로보틱스Neura Robotics, 생츄어리Sanctuary AI, 멘티Mentee가 있습니다.

이 자료에서 다룬 사실

엔비디아는 2025년 1월 6일 로보틱스와 자율주행 개발을 위한 NVIDIA Cosmos를 발표했다. 원문은 Cosmos가 로보틱스·주행 데이터 2,000만 시간과 9,000조 토큰으로 학습된 4B~14B 월드모델 및 학습·처리 도구로 구성됐다고 소개했다.

근거 보기 2
  1. 원문 구간 1

    우리는 Physical AI를 민주화하고 모든 개발자가 로보틱스를 활용할 수 있도록 NVIDIA Cosmos를 만들었습니다." 2025-01-06, 젠슨 황, NVIDIA Cosmos 발표 보도자료 中 엔비디아의 코스모스Cosmos는 모든 기업들이 월드모델을 만들 수 있도록 돕는 플랫폼입니다. 월드모델 + 데이터로 모델을 학습시키기 위한 도구Autoregressive Model, Diffusion Model, Video Tokenizaers, Video Processing and Curation Pipeline로 구성된 플랫폼입니다. 실제 세상에 적용되는 보편적인 물리법칙들에 대해 훈련하여 일부 이해하고 있는 모델입니다. 코스모스의 월드모델 자체는 2,000만 시간 분량의 로보틱스 및 주행 데이터를 포함하여 9,000조 개 토큰으로 학습했습니다.

  2. 원문 구간 2

    매개변수 크기는 4B부터 14B에 이르기까지 다양합니다. ​ 물리적 AI의 성능은 양질의 데이터를 얼마나 많이 확보할 수 있는가와 연관 있습니다. 그러나 리얼월드 데이터로만 처음부터 모든 것을 쌓으려면 너무 많은 비용이 들기 때문에 코스모스를 활용하여 각 기업들이 개발하기 쉽도록 돕습니다. 리얼월드 데이터를 모으고 테스트 하는 것은 각자가 해야겠지만 이를 처리하는 방법, 방대한 양의 합성 데이터를 생성하는 것, 모델을 훈련하고나서 평가하는 방법을 하나의 패키지로 제공합니다. ​ 엔비디아 코스모스 WFMWorld Foundation Model을 기반으로 자신의 데이터를 모아 미세조정하여 새로운 AI로 만들 수도 있습니다. 로보틱스 분야의 Llama 2 모멘트입니다.

그렇게 판단한 이유

현실 데이터만으로 물리적 AI를 만들면 비용이 크므로, Cosmos가 데이터 처리·합성 데이터 생성·훈련과 평가 방법을 패키지로 제공한다는 점을 근거로 들었다. Llama 2가 오픈소스로 기업의 생성형 AI 투자를 늘린 사례에 비춰 로보틱스의 Llama 2 모멘트로 해석했다.

근거 보기 3
  1. 원문 구간 1

    매개변수 크기는 4B부터 14B에 이르기까지 다양합니다. ​ 물리적 AI의 성능은 양질의 데이터를 얼마나 많이 확보할 수 있는가와 연관 있습니다. 그러나 리얼월드 데이터로만 처음부터 모든 것을 쌓으려면 너무 많은 비용이 들기 때문에 코스모스를 활용하여 각 기업들이 개발하기 쉽도록 돕습니다. 리얼월드 데이터를 모으고 테스트 하는 것은 각자가 해야겠지만 이를 처리하는 방법, 방대한 양의 합성 데이터를 생성하는 것, 모델을 훈련하고나서 평가하는 방법을 하나의 패키지로 제공합니다. ​ 엔비디아 코스모스 WFMWorld Foundation Model을 기반으로 자신의 데이터를 모아 미세조정하여 새로운 AI로 만들 수도 있습니다. 로보틱스 분야의 Llama 2 모멘트입니다.

  2. 원문 구간 2

    생성형AI의 시작은 ChatGPT 2022년 말가 했다면, 실제 기업들이 업계에서 느끼기에 그보다 훨씬 더 중요했던 건 오픈소스로 풀렸던 메타의 Llama 2 2023년 7월였습니다. ChatGPT로 얼마나 뛰어난지는 알겠지만 어떻게 개발할지 방법이 없었던 전 세계 기업들이 Llama 2를 사용해보면서 투자규모를 크게 늘렸었습니다. ​ 패트릭 콜리슨 (2024-05-22, 인터뷰) "메타가 지난주 라마 3를 출시해서 많은 관심을 받았는데, 제가 볼 때는 지금까지 발표된 오픈소스 모델 중에는 가장 인상적이던데 오픈소스 모델에 대해서 어떻게 생각하세요?" ​ 엔비디아 CEO, 젠슨황 (2024-05-22, 인터뷰) "지난 몇 년 동안 가장 중요한 사건이 무엇이냐고 묻는다면 당연히 ChatGPT가 먼저 나오고, 강화학습(Reinforcement Learning), 사람의 피드백구조(Human Feedback)에 대한 기술을 습득한 거라 말할 수 있습니다.

  3. 원문 구간 3

    덕분에 컴퓨팅이 민주화됐습니다. 이제 누구나 프로그래머가 될 수 있습니다. GPT와 오픈AI가 해낸 일들이 자랑스럽습니다." "그리고 두 번째로 중요한 사건은 라마(Llama)입니다. 라마1도 아니고 라마2입니다. 라마2는 거의 모든 산업에서 쓰였고 기업들이 생성형AI 연구에 뛰어들도록 만들었습니다. 모든 산업에서 생성형AI를 써볼 수 있는 문이 열린 것이죠. 의료, 금융, 제조, 고객서비스, 소매업 등 모든 산업입니다. 오픈소스였기에 가능했습니다. "ChatGPT가 컴퓨팅의 민주화를 이끌었다면, 라마는 생성형AI를 민주화시켰습니다. 메타의 라마가 없었더라면 안전에 대한 모든 연구, 추론방식에 대한 연구, 현재 개발되는 모든 추론 기술과 강화학습 방법들에 대한 연구가 이렇게 크게 활성화되지 않았을 거라고 생각합니다."

원문에서 직접 연결한 대상NVIDIA휴머노이드 로보틱스
3
사실·구조, 해석·전망, 시점 관찰, 판단 방법

지식·관점

사건 밖에서도 다시 참고하거나 다른 자료와 비교할 가치가 있는 내용을 대상과 반복 가능한 논점으로 묶습니다.

사실·구조딥러닝 스케일링 가설주 대상 · 기술·제품 · 딥러닝

인간이 빠르게 하는 직관적 작업을 신경망으로 확장할 수 있다는 가설은 무엇인가?

이 자료가 더한 내용

원문은 텍스트 자기회귀모델·거대한 신경망·거대한 데이터셋의 조합을 현재 AI의 경로로 제시했다. 인간이 1초 안에 끝내는 작업은 10층 신경망도 할 수 있고, 하나가 풀면 복제로 확장할 수 있다는 가설과 생물학적 스케일링 법칙을 함께 설명했다.

근거 보기 5
  1. 원문 구간 1

    AI : The Core Idea 제프리 힌튼이 영감을 주고 현직에서 일리야 수츠케버Ilya Sutskever와 함께 신경망, 딥러닝을 믿어온 사람들은 처음부터 생물학적 뉴런과 인공 뉴런이 비슷하다면 인간의 뇌는 거대한 인공신경망과 같다고 믿었습니다. ​ 지금까지 걸어온 길을 크게 보면 세 가지입니다. 텍스트에 대해 학습한 자기회귀모델Autoregressive model trained on text, 거대한 신경망Large neural network, 거대한 데이터셋Large dataset의 조합입니다. ​ *맞았던 것 #1 : 딥러닝에 대한 가설, '인간이 0.1초 안에 할 수 있는 일은 인공신경망도 할 수 있을 것이다' ​ 이 슬라이드는 일리야 수츠케버가 10년 전에 만들었던 딥러닝에 대한 가설입니다.

  2. 원문 구간 2

    이때의 내용은 만약 거대한 신경망을 구축할 수 있다면, '10개의 층으로 구성된 신경망10-layer neural networks이 있다면 인간이 할 수 있는 모든 일들을 순식간에 처리할 수 있는 레벨이 될 것'이란 가설이었습니다. ​ *코멘트 → 자기회귀모델이란 예측할 대상의 이전 값들을 사용하여 다음 값을 예측하는 일련의 모델을 일컫습니다. 트랜스포머(Transformer) 기반으로 나온 GPT 시리즈들이 대표적인 자기회귀모델 중 하나입니다. 이전 단어들을 바탕으로 확률적으로 다음에 올 단어를 예측하는 모델입니다. ​ 인간의 인지과정은 매우 순식간에 일어납니다. 직관적이거나 무의식적으로 빠르게 일어나는 일얼굴 인식, 이미지 분류, 언어 이해 등들입니다. 이것이 중요한 이유는, 인공 뉴런과 생물학적 뉴런이 비슷하거나 적어도 크게 다르지 않다는 딥러닝의 도그마를 믿는다면 생물학적 뉴런이 수행할 수 있는 일을 인공신경망도 유사한 방식으로 수행할 수 있다는 것이기 때문입니다.

  3. 원문 구간 3

    ​ 생물학적 뉴런은 신호 전달 속도가 매우 느리기 때문에 만약 인간이 어떠한 작업을 매우 빠르게 수행할 수 있다는 건, 인공신경망을 기준으로 했을 때 10개의 층으로 쌓으면 충분히 해결할 수 있다는 생각이었습니다. 전 세계에서 단 한 명의 인간이라도 특정 작업을 1초 안에 할 수 있는 거라면 10층짜리 신경망도 할 수 있다는 의미입니다. 하나의 신경망만 이를 해결할 수 있어도 이를 복제하여 전체 신경망으로 확장하면 됩니다. ​ 즉, 인간이 순식간에 처리하는 직관적인 모든 일들은 10층으로 쌓은 인공신경망도 가능할 것이라는 게 우리가 지금까지 개발해온 딥러닝의 가설 핵심이었습니다. 이때 10층 신경망에 집중했던 이유는 그당시 훈련할 수 있었던 신경망의 크기가 10층 정도였기 때문입니다.

  4. 원문 구간 4

    ​ 그리고 전 세계에서 단 한 명의 인간이라도 특정 작업을 1초 이내에 끝낼 수 있다면, 인공 신경망도 이를 할 수 있다고 여겼습니다. 그리고 단 한 개의 신경망만 이를 해결할 수 있어도 이를 복제하여 전체 신경망으로 확장하면 됩니다. 인간이 순식간에 처리하고 있는 직관적인 모든 일은 인공신경망도 가능할 것이라는 게 지금까지 개발해온 딥러닝의 가설 핵심이었습니다. ​ *자연계에 있는 스케일링 법칙 : 포유류의 몸 크기(X축)와 뇌 크기(Y축) 간의 관계를 질량으로 나타낸 것 ​ 생물학에서 모든 것이 무작위에 가깝지만, 신기하게도 포유류의 몸 크기와 뇌 크기 사이에는 일종의 스케일링 법칙이 적용되고 있습니다. X축과 Y축은 모두 로그 스케일이란 점입니다. 신체의 크기도 100g, 1000g, 10000g으로 표시되고, 뇌의 크기도 1g, 10g, 100g, 1000g까지 구성되어 있습니다.

  5. 원문 구간 5

    10배 더 많은 신체 질량을 갖게 되면, 10배 더 많은 뇌 질량을 갖는 것이 최적이도록 진화해왔습니다. 현재 LLM 업계에서 10배 좋아져야 1세대씩 좋아질 거라는 스케일링 법칙은 여기서부터 시작된 것입니다. ​ 지구가 낳은 ASI, 인간 오픈AI의 공동창업자인 보이치에흐 자렘바Wojciech Zaremba도 진화에서 영감을 얻었습니다. 여기서부턴 자렘바의 생각을 따라가봅니다. 유기체의 전체 진화 과정을 생각해보면 단세포 생물에서 다세포 생물로 전환하는데 수십억 년이 걸렸습니다. 다세포 생물은 그보다 조금 더 짧은 10억 년 동안 존재했습니다. 진화의 시간이 점점 더 빨라져오는 역사입니다. 인류 발전의 역사만 봐도 비슷합니다. 호모 사피엔스는 20만 년 동안 존재했고, 최초의 도시는 2만 년 전에 등장했습니다.

사실·구조물리적 AI의 월드모델주 대상 · 기술·제품 · 월드모델관련 대상 · 산업·업종 · 휴머노이드 로보틱스

휴머노이드가 현실에서 행동하려면 무엇을 이해해야 하는가?

이 자료가 더한 내용

원문은 로봇이 중력·마찰·관성, 공간 관계, 인과관계와 물체 영속성을 이해해야 하며, 시뮬레이터가 현실에 가깝게 작동하려면 그런 가중치를 가진 월드모델이 필요하다고 설명했다. 로봇별 경험과 기억을 쌓는 사후학습 루프도 앞으로의 과제로 제시했다.

근거 보기 4
  1. 원문 구간 1

    이 전체의 과정을 "본다"라고 합니다. ​ 숨쉬듯 자연스레 이뤄지지만, 실제론 신호를 받아 현실세계World에 대한 시뮬레이터​Model or Simulator를 만든 것과도 같습니다. ​ 여기서 현실을 인식하기 위해서는 시뮬레이션을 경험하는 "나", 즉 자의식이 필요합니다. 자신의 존재를 시뮬레이션 안에서 갖게 되어야 인식할 수 있습니다. 일리야 수츠케버가 NeurIPS 2024에서 "앞으로 AI가 자의식을 갖게 될 것"이라 말했던 것도 같은 맥락입니다. 뇌 자체가 현실과 맞닿아 있는 구조가 아님(뇌는 머리 속에 있지만, 모든 것을 느낍니다. 이 구조 자체가 뇌는 간접적으로 경험하는 구조란 의미)을 생각해보면 이해가 쉽습니다. 현실과 맞닿은 "누군가"를 만들어내야 하고 그것이 자의식입니다.

  2. 원문 구간 2

    우리는 그것이 나라고 생각하며 살아갑니다. 그것이 한 번도 틀린 적 없기에 당연하다고 생각하며 살아갑니다. ​ 휴머노이드의 현실 인식 지금까지의 모든 로봇은 다른 사람들이 만든 데이터로 훈련한 것을 가지고 살아갑니다. 사람은 살아가면서 내가 경험하며 얻은 것으로 살아가는 것과 가장 큰 차이가 여기서 벌어집니다. 그래서 오픈AI 자렘바​는 LLM이 이미 충분한 수준의 지능에 도달했다면 로봇마다 개별적인 경험을 하는 사이클이 필요할 것으로 예상하고 있습니다. 일종의 사후학습Post-training입니다. ​ 엄청난 양의 데이터로 훈련받지만 그 안에 자신이 만든 데이터가 없기 때문에 영화 <메멘토Memento>의 단기기억 상실증 남자처럼 몸에 새긴 문신 같은 것들을 보며 그때그때 명령을 기억하는 것과도 같습니다.

  3. 원문 구간 3

    ​ 여기서도 o1과 같은 발전이 있을 것으로 예상합니다. 모델들이 자신이 훈련한 데이터를 기억할 수 있다면, 즉 엄청난 양의 컨텍스트 윈도우를 가질 수 있다면 자의식을 가지고 경험한 기억을 가질 수 있기 때문입니다. 그 안에서 자의식이 강해짐으로써 한 단계 진화할 수 있습니다. 엔비디아는 앞으로 더 많은 컴퓨팅이 필요할 것이라 보고 있습니다. 종래에는 새로운 종류의 사전학습-사후학습-추론 루프가 된다는 의미입니다. ​ 로봇을 위한 월드모델 : NVIDIA Cosmos 로봇이 세상을 보기 위해서는 시뮬레이터가 필요하고, 시뮬레이터가 현실과 가깝게 제대로 작동하기 위해서는 각종 행동과 물리법칙에 대한 가중치를 갖고 있는 월드모델이 필요합니다. 휴머노이드는 인간과 비슷하게 행동하는 Physical AI를 원했기에 행동에 대해서 가장 많은 데이터를 갖고 있는 인간의 모습을 그대로 땄습니다.

  4. 원문 구간 4

    ​ 언어를 이해하는 것뿐만 아니라 중력, 마찰, 관성 등 역학을 이해해야 하고, 기하학적이고 공간적인 관계, 원인과 결과에 대한 이해가 필요합니다. 무언가를 떨어뜨리면 깨지고, 찌르면 터지며, 뒤집어지기도 합니다. 또한 물체의 영속성에 대해서도 이해할 수 있어야 합니다. 볼링공으로 핀을 쓰러뜨리고 나면 그 공은 우주로 사라진 게 아니라, 여전히 그 밑에 남아있음을 이해해야 합니다. 이런 모든 유형들은 현재의 모델들이 직관적으로 이해하기 매우 힘들어하는 분야이며, 그래서 엔비디아가 만들어서 공개오픈소스했습니다. "로보틱스를 위한 ChatGPT 순간이 다가오고 있습니다. 거대언어모델과 마찬가지로 월드모델은 로봇 및 자율주행 개발을 발전시키는 데 기초가 될 것입니다.

사실·구조휴머노이드 훈련주 대상 · 산업·업종 · 휴머노이드 로보틱스

보행과 실제 작업을 위한 상체 조작은 왜 다른 훈련 문제인가?

이 자료가 더한 내용

행동·시각·자연어·환경·감정 데이터를 모은 Isaac GR00T와 Omniverse 시뮬레이션을 소개했다. 보행은 목표와 보상으로 강화학습하기 비교적 쉽지만, 관절이 많은 팔·손가락은 모방학습과 물체·힘·궤적에 대한 정교한 데이터가 필요하다고 구분했다.

근거 보기 5
  1. 원문 구간 1

    로봇들은 NVIDIA Omniverse를 통해서 현실과 비슷한 시뮬레이터에서 훈련하고 있었습니다. Omniverse에 이번에 출시한 코스모스를 더할 것이므로 시뮬레이터에서 만들 합성 데이터의 완성도는 더 높아질 예정입니다. 코스모스는 물리법칙에 대해 따로 배운 월드모델입니다. 현실세계를 위한 시뮬레이터에 물리법칙을 추가했다는 의미입니다. ​ 휴머노이드 훈련은 어떻게 이뤄지나 그동안 휴머노이드 훈련은 인간의 능력들을 제각기 훈련시키는 것에 가까웠습니다. 대표적으로 필요한 데이터는 행동 데이터, 시각 데이터, 자연어 데이터, 환경 데이터, 감정 데이터 등을 예로 들 수 있습니다. ​ 행동 데이터는 사람의 움직임을 담은 모션 캡처 데이터, 역학에 대한 시뮬레이션 데이터, 보행에 대한 데이터가 있습니다.

  2. 원문 구간 2

    시각 데이터는 이미지 및 비디오 데이터셋, 3D 데이터, 물체 인식 데이터가 있습니다. 자연어 데이터는 사람과의 대화를 위한 데이터입니다. 환경 데이터는 로봇이 특정한 환경에 대해 인식하고 상호작용하는 방법들입니다. 예를 들어 벽이 있을 때 행동하는 법, 계단을 오르고 내리는 것 등입니다. 감정 데이터는 사람의 감정이나 표정을 인식하기 위한 데이터입니다. ​ 이것들을 최대한 모아 파운데이션 모델을 만들었던 것이 NVIDIA Isaac GR00T입니다. ​ 하체는 상대적으로 쉽다 이 영상을 한 번 보시길 권해드립니다. 자막을 켜시면 한글자막이 있습니다. 걷는 방법을 모션캡처로 알려주지 않고, 강화학습을 통해 처음부터 훈련시키는 과정에 대한 느낌을 아실 수 있습니다.

  3. 원문 구간 3

    ​ 영상을 보셔서 아실 수 있겠지만 비교적 보행은 많이 발전했습니다. '목적지까지 도달해야 한다', '넘어지지 않아야 한다', '왼발과 오른발을 번갈아 움직여야 한다' 등 조건들을 주고 목표를 충족시켰을 때 보상을 주는 식입니다. 상대적인 얘기지만 어디서나 넘어지지 않고 걸을 수 있는 다리를 갖는 건 쉽습니다. ​ 특히 위에 말씀드린 것처럼 수천 가지 환경에서 동시에 NVIDIA Omniverse에서 시뮬레이션한 데이터를 받게 되고, 여기에 물리법칙이라 할 수 있는 코스모스가 합쳐지니 이제 어디서나 걸을 수 있는 알고리즘을 갖기란 더 쉬워집니다. ​ 상체는 진짜 어렵다 그러나 실제 "일"을 해야 하는 상체, 팔과 손가락에 대한 학습은 쉽지 않습니다.

  4. 원문 구간 4

    훨씬 더 많은 관절로 이뤄져있기 때문에 목표와 조건으로는 구현하기 어렵습니다. 자유도DoF, Degree of Freedom라는 개념처럼 훨씬 더 많은 관절로 무수한 움직임을 구현할 수 있기 때문입니다. 그래서 사람이 행동하는 걸 로봇이 따라하는 모방학습Imitation Learning이 필요합니다. ​ ​ 휴머노이드를 개발하고 있는 테슬라 연구소 내에는 수십명의 사람이 모션 캡처 슈트를 착용한 채로 특정 작업들을 반복합니다. 물건을 집어서 옮기는 작업을 하거나, 팔을 뻗었다가 접거나, 빨래를 개거나, 4680 배터리 셀을 집어서 옮기거나 하는 동작들을 취합니다. 테슬라 옵티머스Optimus는 사람의 동작을 그대로 모방하며 책상 위 실제 물건을 옮기는 작업을 합니다.

  5. 원문 구간 5

    가장 사람다운 데이터를 뽑는 과정입니다. ​ ​ 현실적인 문제는 정교함에 있습니다. 프롬프트로 "냉장고를 열어서 우유를 꺼낸 다음 컵에 따라줘"라고 하면 → 우선 냉장고, 우유, 컵을 이해하고 있어야 합니다. 그리고 열기, 꺼내기, 따르기에 대한 행동을 이해하고 있어야 합니다. 각 행동별 움직임에 대해 모방학습 데이터를 저장하는 일입니다. 조금 더 깊게 보자면 냉장고를 열 때의 최적의 팔/손 모양과 힘의 강도, 우유곽을 집을 때의 최적의 팔/손 모양과 힘의 강도, 컵에 따를 때의 최적의 팔/손 모양과 우유의 궤적을 이해하고 있어야 합니다. ​ 사람의 역할을 대체하려면, 사람이 속해있는 현실세계의 물리법칙에 대해 이해하고 있어야 합니다.

사실·구조엔비디아 로봇 플랫폼주 대상 · 기업·종목 · 엔비디아관련 대상 · 산업·업종 · 휴머노이드 로보틱스

로봇 개발에서 DGX·OVX·AGX는 각각 어떤 역할을 하는가?

이 자료가 더한 내용

DGX는 Isaac GR00T 기반 행동 토큰을 학습시키고, OVX는 Omniverse·Isaac Sim에서 시간과 비용이 큰 현실 훈련을 대신하는 시뮬레이션 환경이며, AGX Jetson은 환경·경로·시각 데이터를 처리해 로봇 안에서 모델을 가동하는 칩이라고 설명했다.

근거 보기 3
  1. 원문 구간 1

    중국 휴머노이드 대표 기업은 유니트리Unitree, 샤오펑Xpeng, 로봇에라RobotEra, 푸리에Fourier, 유비테크UBTech가 있습니다. ​ 특징들을 하나씩 꼽아보면 다음과 같습니다. ​ 로봇 개발 플랫폼 : NVIDIA 대부분의 기업이 엔비디아 플랫폼을 통해서 휴머노이드를 개발하고 있다는 게 특징입니다. 12월 중순에는 구글 딥마인드가 앱트로닉과의 전략적 파트너십을 맺었던 부분, 12월 말에는 오픈AI가 피규어와 1X에 투자한 것을 넘어서 자체 개발을 목표로 하고 있다는 소식도 있었습니다. ​ 로봇 중에 자체 사용을 포함해서 기업고객이 있는 기업은 테슬라Tesla, 피규어BMW, 보스턴 다이내믹스Hyundai, 어질리티 로보틱스Amazon, GXO Logistics, 앱트로닉Mercedes-Benz, GXO Logistics, 1XEveron, 생츄어리Magna International, 샤오펑Xpeng, 유비테크BYD, Geely, Nio가 있습니다.

  2. 원문 구간 2

    ​ 엔비디아의 로봇 플랫폼 : 3가지의 컴퓨터 엔비디아의 개발방식은 세 가지의 컴퓨터를 필요로 합니다. 로봇을 학습시키는 NVIDIA DGXNVIDIA GR00T, 현실 세계에 대해 배우고 익히기 위한 체육관인 NVIDIA OVXNVIDIA Omniverse Digital Twin, 로봇에 탑재되어 세상을 보고 느끼는 NVIDIA AGXNVIDIA Jetson Thor입니다. ​ DGX : 로봇의 두뇌NVIDIA Isaac GR00T Foundation Model를 가르치는 컴퓨터입니다. 모델은 LLM로 명령을 받으면 이에 대해서 로봇이 해야 할 다음 행동에 대한 토큰을 생성하도록 훈련합니다.

  3. 원문 구간 3

    DGX와 OVX는 기본적으로 테슬라 Cortex와 유사한 역할입니다. OVX : 로봇을 가르치고 시뮬레이션NVIDIA Omniverse 내의 Isaac Sim하는 플랫폼입니다. 로봇이 리얼월드에서 훈련하려면 시간과 비용이 많이 들기에, 강화학습을 통해 더 잘 작동하도록 훈련받는 일종의 체육관입니다. AGX : 로봇이 가동하는데 필요한 환경 데이터, 경로 계획, 시각적인 데이터들을 처리하도록 설계된 칩NVIDIA Jetson입니다. DGX에서 훈련, OVX에서의 시뮬레이션을 거치고 난 모델이 AGX 내에서 가동됩니다. AGX는 테슬라의 HW4와 비슷한 역할입니다. ​ 가장 앞서있는 휴머노이드 : Tesla Optimus

시점 관찰테슬라 옵티머스주 대상 · 기업·종목 · Tesla기준 2025.10.21

옵티머스의 생산 목표와 하드웨어 비용 구조는 어떻게 제시됐는가?

이 자료가 더한 내용

원문은 테슬라·피규어·유니트리·유비테크를 선도 그룹으로 보며, 옵티머스는 2025년 실제 약 1천 대, 2026년 5~10만 대, 2027년 50~100만 대 생산 목표를 제시했다고 적었다. 2024년 기준 BoM은 5만~6만달러 추정, 28개 액추에이터와 2.3kWh 배터리라는 구성도 함께 소개했다.

근거 보기 5
  1. 원문 구간 1

    테슬라 봇 컨셉 YouTube : 작동하는 프로토타입은 없었지만, 컨셉적인 "Tesla Bot"을 공개했습니다. 범블비 YouTube : 처음 작동하는 프로토타입 "Bumble-C"를 공개했던 때입니다. 옵티머스 1세대 YouTube : 자체 설계 액추에이터를 사용하기 시작했습니다. 2023년 3월 Investor Day에 걸었습니다. 옵티머스 2세대 YouTube : 센서와 액추에이터를 직접 쓰고, 다리와 손가락의 정교함이 크게 올라갔습니다. ​ 유니트리Unitree, 유비테크UBTech, 피규어Figure AI, 테슬라 Optimus가 휴머노이드 중 현재로서는 가장 앞서 있다고 판단합니다.

  2. 원문 구간 2

    그중 테슬라 옵티머스는 가장 인체에 가깝도록 설계된 범용 휴머노이드입니다. 인간과 유사한 걸음걸이, 머리 크기, 질감과 질량을 느낄 수 있는 손과 손가락을 갖고 있습니다. 일론 머스크Elon Musk는 2025년 5천 대(실제로는 1천 대) → 2026년 5~10만대 → 2027년 50~100만대 생산을 목표로 하고 있습니다. 장기적으로 대량생산 시 $20~30K로 갈 수 있다는 목표인데, 아직은 갈 길이 멀긴 합니다. ​ *왼쪽 : 2024년 기준 테슬라 Optimus의 BoM은 $50~60K 정도로 추정됩니다. (자료: Morgan Stanley) *중간 : 빨간색은 액추에이터, 파란색은 전기시스템, 몸통의 파란색은 배터리팩입니다.

  3. 원문 구간 3

    *오른쪽 : 옵티머스는 총 28개의 액추에이터를 사용하는데, 자체 개발한 6가지 액추에이터로 구성되어 있습니다. *왼쪽 : 옵티머스용 배터리는 2.3kWh입니다. 모델3/Y의 배터리가 60~80kWh임을 감안하여 평균 70kWh라고 보면, 배터리 입장에서 옵티머스 30대가 모델3/Y 1대와 같습니다. 옵티머스 1억대는 모델3/Y 333만대정도 규모입니다. *오른쪽 : 옵티머스에 사용된 6가지 액추에이터 디자인입니다. 3가지는 회전형(Rotary), 3가지는 선형(Linear)입니다. ​ 옵티머스의 모든 것 옵티머스 구성의 특징은 크게 FSD, 배터리, 액추에이터, 손으로 나눌 수 있습니다.

  4. 원문 구간 4

    ​ 뇌, FSD : 옵티머스 안에는 휴머노이드 폼팩터에 맞게 수정된 FSD 하드웨어와 소프트웨어가 있습니다. 시각, 촉각 등 각종 데이터가 들어오면 순식간에 결정을 내릴 수 있으며, Wi-Fi 및 LTE 연결이 가능합니다. 배터리 : 2.3kWh, 52V 배터리를 탑재하고 있습니다. 옵티머스는 앉아있을 땐 100W, 걸을 땐 500W를 소모합니다. 아직 개발 단계이기 때문에 작동시간에 대해서는 구체적으로 알려져 있지 않습니다. 액추에이터 : 옵티머스는 자체 설계한 액추에이터가 가장 큰 특징입니다. 관절 및 근육 역할을 합니다. 자동차 설계의 교훈을 살려 에너지/질량/비용에 대한 최적의 값으로 설계했습니다.

  5. 원문 구간 5

    자체 액추에이터를 설계제조는 하청업체에 아웃소싱 할 수 있습니다할 수 있어야 휴머노이드에 맞는 최적의 힘과 동작 범위를 설계할 수 있다는 게 테슬라의 입장이었습니다. 전기차를 설계하면서 모터에 관한 노하우를 많이 갖고 있기 때문이기도 합니다. 손 : 옵티머스의 손은 인간의 손과 비슷하게 설계됐습니다. 6가지 액추에이터로 11개의 자유도가 가능합니다. 옵티머스 2세대부터는 모든 손가락에 촉각 센서를 갖춰서 로봇이 보다 섬세한 물건을 다룰 수 있도록 설계됐습니다. 차세대 옵티머스에서는 자유도를 22개까지 높일 예정인데 머스크는 이 경우 인간이 할 수 있는 거의 모든 동작을 할 수 있을 거라고 평가했습니다.

사실·구조휴머노이드 액추에이터 공급망주 대상 · 산업·업종 · 휴머노이드 액추에이터

액추에이터의 기능·원가 비중·기술 구분은 무엇인가?

이 자료가 더한 내용

휴머노이드는 전동식과 유압식으로 나뉘며, 최근 보스턴 다이내믹스도 전동식으로 전환하는 흐름을 언급했다. 액추에이터는 센서·모터·나사·감속기·인코더·베어링의 조합이고, 옵티머스 2세대 BoM에서는 센서 37.0%, 모터 20.3%, 나사 20.2%, 감속기 12.6%로 제시됐다.

근거 보기 8
  1. 원문 구간 1

    ​ 휴머노이드 공급망 두뇌에서 신체까지 *오른쪽 : 모건스탠리가 꼽은 휴머노이드 밸류체인입니다. "클릭 후 더블클릭"하시면 크게 보실 수 있습니다. ​ 두뇌 Brain 휴머노이드는 최종적으로 인간처럼 생각하고 행동하도록 설계됐습니다. 고도로 발전한 파운데이션 모델이 로봇의 뇌 기능을 함으로써 훨씬 더 다양한 일들에서 인간을 물리적으로 대체하거나 지원할 수 있을 거라는 생각입니다. 세상을 이해하기 위해서는 LLM과 월드모델혹은 월드시뮬레이터이 필요합니다. ​ 인간이 만든 세상이기 때문에 가장 인간스럽게 만들어야 가장 유용할 거란 생각에서 시작됐고, 학습을 위해서도 인간에 대한 데이터가 가장 많으니까 인간의 모습을 가지도록 설계했습니다.

  2. 원문 구간 2

    AI 시스템은 대부분 엔비디아의 시스템을 쓰고 있습니다. "세상에 적응하기 가장 쉬운 로봇은 휴머노이드 로봇입니다. 왜냐하면 인간이 인간을 위해 세상을 만들었기 때문입니다. 다른 유형의 로봇보다 휴머노이드를 훈련할 수 있는 데이터가 가장 많습니다. 우리랑 같은 체격을 갖고 있기 때문입니다." 2024-03-20, 젠슨 황 CNBC 짐 크레이머 인터뷰 중 "언젠가는 움직이는 모든 것이 자율화될 것입니다. 모든 공장이 로봇화될 것입니다. 공장은 로봇을 조율하고, 그 로봇은 로봇 제품을 만들 것입니다. 로봇이 로봇과 상호작용하여 로봇 제품을 만드는 식입니다."

  3. 원문 구간 3

    2024-06-02, 젠슨 황 COMPUTEX 2024 기조연설 중 신체 Body 하드웨어적으로는 전동식Electric Drive과 유압식Hydraulic Drive으로 구분됩니다. 특징들로만 간단히 구분하자면 전동식은 모터가 휴머노이드의 관절 및 움직임을 담당합니다. 장점은 대량생산이 가능하고, 제어 정밀도가 높고 응답속도도 빠르며 신뢰성도 높습니다. 복잡한 움직임도 구현할 수 있습니다. 다만 단점으로는 전력 소비와 토크 제한이 이슈였습니다. ​ 유압식은 액체 압축 펌프로 고압의 액체를 통해 힘을 만들어내는 식입니다. 중량이 큰 것들을 다루거나 특수 용도에 쓰입니다.

  4. 원문 구간 4

    유압 실린더와 유압 모터가 쓰입니다. 단점은 설계가 복잡하고 유지보수도 복잡하다는 점이며 대량생산에 적합하지 않습니다. 원래는 전동식엔 테슬라 옵티머스가, 유압식엔 보스턴 다이내믹스처음에 미군 보병을 지원하는 로봇이 목표였기에 유압식이었습니다가 대표적인 기업이었는데 최근 보스턴 다이내믹스도 전동식으로 넘어오면서 전동식 휴머노이드로 획일화된 모습입니다. ​ 휴머노이드의 하드웨어에서는 액추에이터가 핵심입니다. 인간처럼 행동하기 위해서는, 인간처럼 다양한 동작을 하는 게 핵심인데 액추에이터가 관절과 근육에 해당하는 부품입니다. 따라서 로봇의 자유도는 일반적으로 액추에이터의 수가 결정합니다.

  5. 원문 구간 5

    회전 운동을 할 수 있게 하는 회전 관절Rotary Actuators과 선형 운동을 할 수 있게 하는 직선 관절Linear Actuators의 조합으로 이뤄집니다. 현재 개발 중인 휴머노이드는 보통 16~60개의 자유도를 갖고 있습니다. ​ *옵티머스 2세대 BoM : 센서 37.0%, 모터 20.3%, 나사 20.2%, 감속기 12.6%, 인코더 3.9%, 베어링 0.8%, 배터리 0.5% ​ 액추에이터의 구성요소 하드웨어의 핵심인 액추에이터는 센서Sensor, 모터Motor, 나사Screw, 감속기Reducer, 인코더Encoder, 베어링Bearing의 조합으로 구성됩니다.

  6. 원문 구간 6

    옵티머스 $50~60K 비용 중 센서가 37%, 모터 20%, 나사 20%, 감속기 13%, 인코더 4%, 베어링 1%, 배터리 0.5% 정도입니다. 따라서 휴머노이드 산업이 잘 될 때 부각받는 부품체인은 센서, 모터, 나사, 감속기라고 꼽을 수 있습니다. ​ 센서 : 휴머노이드 내엔 비전, 힘, 관성, 온도 센서 등을 포함해서 많은 센서가 들어있습니다. 휴머노이드 자체의 위치 데이터 인식과 외부의 시각/청각/촉각 데이터 인식에 주로 쓰입니다. 모터 : 모터는 토크를 생성하는 데 쓰입니다. 모터는 크게 프레임리스 토크 모터Freamless Torque Motor와 코어리스 모터Coreless Motor로 나뉩니다.

  7. 원문 구간 7

    프레임리스 토크는 기술장벽이 비교적 낮은 분야입니다. 미드/로우레인지 애플리케이션에서 중국 모터가 쓰입니다. 코어리스 모터는 기술장벽이 비교적 높은 분야입니다. 의료 및 군사장비에 쓰입니다. 나사 : 회전 운동과 선형 운동을 변환하는 데 쓰입니다. CNC 공작기계, 제조장비, 로봇, 정밀기기 등 기타 애플리케이션에 널리 쓰이는 나사를 씁니다. 진입장벽이 높고 생산 장비나 원자재가 비싼 나사는 유럽 및 일본 회사가 주도합니다. 다만 여기도 중국 기업들이 계속해서 고급 시장으로 진출하려 노력하고 있습니다.

  8. 원문 구간 8

    감속기 : 휴머노이드의 토크 출력과 각종 동작의 정교함을 높이는 데 쓰입니다. 감속기에서는 세 가지가 대표적입니다. 유성감속기Planetary Reducers, 하모닉 감속기Harmonic Reducers, RV 감속기RV Reducers입니다. 주요 카테고리들은 일본 기업들이 주도하고 있지만, 중국 내에서 리더드라이브Leaderdrive 같은 기업들이 침투하고 있습니다. ​ *휴머노이드에 들어가는 액추에이터 공급망 내 주요 기업입니다. (자료: Morgan Stanley)

사실·구조로봇 물류 자동화와 시뮬레이션주 대상 · 기업·종목 · Amazon관련 대상 · 산업·업종 · 휴머노이드 로보틱스

현실 배포 전 시뮬레이션은 대규모 로봇 운영에서 어떤 역할을 하는가?

이 자료가 더한 내용

원문은 아마존이 2012년 Kiva Systems를 인수한 뒤 로봇 기업 인수를 이어가 2023년 물류로봇 75만 대를 사용했고, 제품의 4분의 3이 로봇을 거쳐 배달된다고 소개했다. 실제 배포 전에는 Omniverse의 Isaac Sim에서 자율창고를 자동화·최적화·계획하는 디지털 트윈을 만들었다고 설명했다.

근거 보기 2
  1. 원문 구간 1

    그 결과 2023년 기준 물류로봇 75만대를 사용하고 있고, 아마존 제품의 4분의 3이 로봇을 거쳐 배달됩니다. 여전히 AI 로봇 스타트업을 매우 적극적으로 인수 중인 기업이기도 합니다. 2023년에만 $9B정도의 CAPEX를 로봇에 썼을 것으로 추정되며, 휴머노이드가 아닌 산업용 로봇이지만 로봇을 가장 잘 사용하는 사례입니다. ​ 이렇게 물류자동화를 할 수 있었던 것은 엔비디아의 NVIDIA Isaac Sim 덕분에 가능했습니다. 현실 세계에 로봇을 배포하기 전에 가상 환경에서 자율 창고를 자동화, 최적화, 계획하기 위한 디지털 트윈을 만들기 위해 NVIDIA Omniverse 속의 Isaac Sim을 사용했습니다. ​ 많은 수의 휴머노이드 개발자들이 NVIDIA Isaac GR00T를 통해 체계적인 개발을 하고 있습니다.

  2. 원문 구간 2

    로봇들은 NVIDIA Omniverse를 통해서 현실과 비슷한 시뮬레이터에서 훈련하고 있었습니다. Omniverse에 이번에 출시한 코스모스를 더할 것이므로 시뮬레이터에서 만들 합성 데이터의 완성도는 더 높아질 예정입니다. 코스모스는 물리법칙에 대해 따로 배운 월드모델입니다. 현실세계를 위한 시뮬레이터에 물리법칙을 추가했다는 의미입니다. ​ 휴머노이드 훈련은 어떻게 이뤄지나 그동안 휴머노이드 훈련은 인간의 능력들을 제각기 훈련시키는 것에 가까웠습니다. 대표적으로 필요한 데이터는 행동 데이터, 시각 데이터, 자연어 데이터, 환경 데이터, 감정 데이터 등을 예로 들 수 있습니다. ​ 행동 데이터는 사람의 움직임을 담은 모션 캡처 데이터, 역학에 대한 시뮬레이션 데이터, 보행에 대한 데이터가 있습니다.

사실·구조휴머노이드 개발 생태계주 대상 · 산업·업종 · 휴머노이드 로보틱스

휴머노이드 개발사와 기업 고객은 어떤 방식으로 연결돼 있는가?

이 자료가 더한 내용

원문은 서방과 중국의 주요 휴머노이드 개발사를 열거하고, 대부분이 엔비디아 플랫폼으로 개발한다고 적었다. 테슬라·피규어·보스턴 다이내믹스·어질리티·앱트로닉·1X·생츄어리·샤오펑·유비테크에는 자체 사용 또는 기업 고객이 있다고 함께 제시했다.

근거 보기 2
  1. 원문 구간 1

    중국 휴머노이드 대표 기업은 유니트리Unitree, 샤오펑Xpeng, 로봇에라RobotEra, 푸리에Fourier, 유비테크UBTech가 있습니다. ​ 특징들을 하나씩 꼽아보면 다음과 같습니다. ​ 로봇 개발 플랫폼 : NVIDIA 대부분의 기업이 엔비디아 플랫폼을 통해서 휴머노이드를 개발하고 있다는 게 특징입니다. 12월 중순에는 구글 딥마인드가 앱트로닉과의 전략적 파트너십을 맺었던 부분, 12월 말에는 오픈AI가 피규어와 1X에 투자한 것을 넘어서 자체 개발을 목표로 하고 있다는 소식도 있었습니다. ​ 로봇 중에 자체 사용을 포함해서 기업고객이 있는 기업은 테슬라Tesla, 피규어BMW, 보스턴 다이내믹스Hyundai, 어질리티 로보틱스Amazon, GXO Logistics, 앱트로닉Mercedes-Benz, GXO Logistics, 1XEveron, 생츄어리Magna International, 샤오펑Xpeng, 유비테크BYD, Geely, Nio가 있습니다.

  2. 원문 구간 2

    ​ 엔비디아의 로봇 플랫폼 : 3가지의 컴퓨터 엔비디아의 개발방식은 세 가지의 컴퓨터를 필요로 합니다. 로봇을 학습시키는 NVIDIA DGXNVIDIA GR00T, 현실 세계에 대해 배우고 익히기 위한 체육관인 NVIDIA OVXNVIDIA Omniverse Digital Twin, 로봇에 탑재되어 세상을 보고 느끼는 NVIDIA AGXNVIDIA Jetson Thor입니다. ​ DGX : 로봇의 두뇌NVIDIA Isaac GR00T Foundation Model를 가르치는 컴퓨터입니다. 모델은 LLM로 명령을 받으면 이에 대해서 로봇이 해야 할 다음 행동에 대한 토큰을 생성하도록 훈련합니다.

4

시간흐름대로 모든 내용을 살려 정리

시간흐름대로 모든 내용을 살려 정리

1
흐름 1

[원문 유형] 네이버 프리미엄 콘텐츠 [채널] 올바른 미국주식 by SAPIENS [게시일] 2025.10.21. 오후 1:17 [원문 URL] https://contents.premium.naver.com/sapiens/sapiensasset/contents/251021131732942rv [제목] (아카이브) 휴머노이드 산업분석 : AI가 몸을 찾고 있습니다 [수집 기준] 승인된 구독 열람권으로 실제 본문을 보존했다. 이미지·첨부는 별도 미디어 원장에 보관하며 시각적 의미 검토 여부를 구분한다.

[구독 원문 본문]

안녕하세요 사피엔스입니다.

이전에 2025년 1월에 전해드렸던 휴머노이드 섹터에 대한 분석자료를 바탕으로 현재 사피엔스투자자문의 시각에서 업데이트하여 작성한 자료입니다.

2
흐름 2

지구는 생물학적 컴퓨팅으로 인간을 낳았고, 이제 인간은 가속컴퓨팅으로 초지능을 빚고 있으며, 동시에 먼 미래에 초지능이 담길 몸을 만들어가는 중입니다.

엔비디아 젠슨황의 표현에 따르면 대량생산될 로봇은 크게 세 가지로 나뉩니다. 자율주행차, 드론, 휴머노이드입니다. NVIDIA Cosmos로 로보틱스의 Llama 2 모멘트가 시작됐습니다.

주간전략보고

2025-10-20

주간전략보고 : 투자의 생각 (10월 20일~10월 24일) (바로가기)

엔비디아 (NVDA)

2025-10-15

엔비디아 펀더멘탈 체크 : Rubin 양산 지연 가능성, 대만 공급망 체크 (바로가기)

2025-10-03

엔비디아 CEO 젠슨황 인터뷰 : 오픈AI 10GW 동맹 x 극한의 풀스택 공동 설계 (바로가기)

3
흐름 3

2025-09-26

AI 사이클 한 눈에 보기, SemiAnalysis 인터뷰 : 승부사 젠슨황 그리고 화웨이의 역습 (바로가기)

2025-08-28

엔비디아 2Q25 실적발표 : Blackwell 12개월치 SOLD OUT, AI CAPEX $3~4T를 말하다 (바로가기)

투자자문 서비스에 따른 투자 시 원금 손실이 발생할 수 있으며, 투자 손익에 대한 책임은 전적으로 고객에게 귀속됩니다. 또한 과거의 투자수익이 미래의 수익률을 보장하지 않습니다.

신규 구독 전에, 아래 투자자문계약 권유문서의 계약 관련 제반 사항을 반드시 읽으시고 충분히 검토하시기 바랍니다.

*투자자문계약 권유문서 : https://naver.me/5ZST47Qf

목차

4
흐름 4

휴머노이드의 원대한 꿈 : 전체적으로 휴머노이드 산업 살펴보기

AI, 핵심 아이디어 : 신경망(Neural Network)

월드모델이란 무엇일까 : NVIDIA Cosmos의 탄생을 생각하다

현실 속 로봇과 휴머노이드 : 휴머노이드로 가기 위한 길

주요 휴머노이드 제조사 : Tesla, Figure, Agility, Apptronik, Unitree, UBTech

휴머노이드 공급망 : 두뇌에서 신체까지

휴머노이드의 원대한 꿈

전체적으로 휴머노이드 산업 살펴보기

AI, 핵심 아이디어

신경망(Neural Network)

*지금까지 걸어온 길(What we did) : ①텍스트에 대한 Autoregressive 모델 + ②거대한 신경망 + ③거대한 데이터셋

5
흐름 5

AI : The Core Idea

제프리 힌튼이 영감을 주고 현직에서 일리야 수츠케버Ilya Sutskever와 함께 신경망, 딥러닝을 믿어온 사람들은 처음부터 생물학적 뉴런과 인공 뉴런이 비슷하다면 인간의 뇌는 거대한 인공신경망과 같다고 믿었습니다.

지금까지 걸어온 길을 크게 보면 세 가지입니다. 텍스트에 대해 학습한 자기회귀모델Autoregressive model trained on text, 거대한 신경망Large neural network, 거대한 데이터셋Large dataset의 조합입니다.

*맞았던 것 #1 : 딥러닝에 대한 가설, '인간이 0.1초 안에 할 수 있는 일은 인공신경망도 할 수 있을 것이다'

이 슬라이드는 일리야 수츠케버가 10년 전에 만들었던 딥러닝에 대한 가설입니다.

6
흐름 6

이때의 내용은 만약 거대한 신경망을 구축할 수 있다면, '10개의 층으로 구성된 신경망10-layer neural networks이 있다면 인간이 할 수 있는 모든 일들을 순식간에 처리할 수 있는 레벨이 될 것'이란 가설이었습니다.

*코멘트 → 자기회귀모델이란 예측할 대상의 이전 값들을 사용하여 다음 값을 예측하는 일련의 모델을 일컫습니다. 트랜스포머(Transformer) 기반으로 나온 GPT 시리즈들이 대표적인 자기회귀모델 중 하나입니다. 이전 단어들을 바탕으로 확률적으로 다음에 올 단어를 예측하는 모델입니다.

인간의 인지과정은 매우 순식간에 일어납니다. 직관적이거나 무의식적으로 빠르게 일어나는 일얼굴 인식, 이미지 분류, 언어 이해 등들입니다. 이것이 중요한 이유는, 인공 뉴런과 생물학적 뉴런이 비슷하거나 적어도 크게 다르지 않다는 딥러닝의 도그마를 믿는다면 생물학적 뉴런이 수행할 수 있는 일을 인공신경망도 유사한 방식으로 수행할 수 있다는 것이기 때문입니다.

7
흐름 7

생물학적 뉴런은 신호 전달 속도가 매우 느리기 때문에 만약 인간이 어떠한 작업을 매우 빠르게 수행할 수 있다는 건, 인공신경망을 기준으로 했을 때 10개의 층으로 쌓으면 충분히 해결할 수 있다는 생각이었습니다. 전 세계에서 단 한 명의 인간이라도 특정 작업을 1초 안에 할 수 있는 거라면 10층짜리 신경망도 할 수 있다는 의미입니다. 하나의 신경망만 이를 해결할 수 있어도 이를 복제하여 전체 신경망으로 확장하면 됩니다.

즉, 인간이 순식간에 처리하는 직관적인 모든 일들은 10층으로 쌓은 인공신경망도 가능할 것이라는 게 우리가 지금까지 개발해온 딥러닝의 가설 핵심이었습니다. 이때 10층 신경망에 집중했던 이유는 그당시 훈련할 수 있었던 신경망의 크기가 10층 정도였기 때문입니다.

8
흐름 8

그리고 전 세계에서 단 한 명의 인간이라도 특정 작업을 1초 이내에 끝낼 수 있다면, 인공 신경망도 이를 할 수 있다고 여겼습니다. 그리고 단 한 개의 신경망만 이를 해결할 수 있어도 이를 복제하여 전체 신경망으로 확장하면 됩니다. 인간이 순식간에 처리하고 있는 직관적인 모든 일은 인공신경망도 가능할 것이라는 게 지금까지 개발해온 딥러닝의 가설 핵심이었습니다.

*자연계에 있는 스케일링 법칙 : 포유류의 몸 크기(X축)와 뇌 크기(Y축) 간의 관계를 질량으로 나타낸 것

생물학에서 모든 것이 무작위에 가깝지만, 신기하게도 포유류의 몸 크기와 뇌 크기 사이에는 일종의 스케일링 법칙이 적용되고 있습니다. X축과 Y축은 모두 로그 스케일이란 점입니다. 신체의 크기도 100g, 1000g, 10000g으로 표시되고, 뇌의 크기도 1g, 10g, 100g, 1000g까지 구성되어 있습니다.

9
흐름 9

10배 더 많은 신체 질량을 갖게 되면, 10배 더 많은 뇌 질량을 갖는 것이 최적이도록 진화해왔습니다. 현재 LLM 업계에서 10배 좋아져야 1세대씩 좋아질 거라는 스케일링 법칙은 여기서부터 시작된 것입니다.

지구가 낳은 ASI, 인간

오픈AI의 공동창업자인 보이치에흐 자렘바Wojciech Zaremba도 진화에서 영감을 얻었습니다. 여기서부턴 자렘바의 생각을 따라가봅니다. 유기체의 전체 진화 과정을 생각해보면 단세포 생물에서 다세포 생물로 전환하는데 수십억 년이 걸렸습니다. 다세포 생물은 그보다 조금 더 짧은 10억 년 동안 존재했습니다. 진화의 시간이 점점 더 빨라져오는 역사입니다. 인류 발전의 역사만 봐도 비슷합니다. 호모 사피엔스는 20만 년 동안 존재했고, 최초의 도시는 2만 년 전에 등장했습니다.

10
흐름 10

산업화는 200~300년 전에 등장했으며, 컴퓨터는 60~70년 전에 등장했습니다. 각 단계가 점점 더 짧아지고 있습니다.

인간은 엄청나게 효율적인 컴퓨팅을 하고 있습니다. 인간의 뇌는 20W를 사용합니다. AI는 따라잡을 수 없습니다. 그런 면에서 AI는 태생부터 결함이 있는 존재라고 볼 수도 있습니다. 새의 비행 효율과 비행기의 비행 효율을 비교하는 것과도 같습니다. 새는 매우 가볍고 펄럭이며 곡예비행을 쉽게 할 수 있습니다. 새가 나무 속을 뚫으면서 나는 방법은 신기합니다. 비행기는 무겁습니다. 무게는 수 톤에 달합니다. 그러나 인간은 하늘을 지나 400명을 먼 바다까지 옮길 수 있는 기술을 개발했습니다.

지능적인 차원에서 생각해본다면 인간의 뇌는 우리의 현실세계를 효과적으로 다루는 수많은 정보, 즉 인공지능으로 따지자면 가중치를 DNA 내에 갖고 있습니다.

11
흐름 11

매우 효율적인 데이터 보관방법입니다. DNA에는 선대로부터 내려온 수십억 명의 사람들의 훈련 데이터가 들어가있습니다.

컴퓨팅으로 볼 때 효율적이진 않지만 수십억 년에 걸친 규모를 통해 가능했습니다. 동물 중에 가장 지능이 높은 생물을 진화시킨다는 차원에서 본다면, 지구 전체가 컴퓨터라고도 볼 수 있습니다. 지구에는 다양한 유기체가 존재하고 진화를 통해 지능이 발견되고 있습니다. 재밌는 건 지구적인 차원에서 돌린 컴퓨팅으로 지구는 일반지능을 6번이나 발견해낼 수 있었습니다. 인간, 코끼리, 원숭이, 까마귀, 돌고래, 문어가 예시입니다. AGI를 6번 발견한 것과 같다고 생각합니다.

이제 인류는 지구라는 컴퓨터 속에서 자신만의 컴퓨터를 만들고 자신만의 지능을 구축하는 첫 번째 유기체입니다.

12
흐름 12

초지능ASI을 한 번 발견한 것과 같다고 생각합니다. 엄청난 양의 데이터나 컴퓨팅 파워가 필요하고, 이를 통해 더 우수한 가치를 뽑아내는 과정입니다. 신경망, 딥러닝, 스케일링 법칙은 여기에 베팅하고 있습니다.

월드모델이란 무엇일까

NVIDIA Cosmos의 탄생을 생각하다

인간의 "현실" 인식

보편적인 인간의 현실 인식은 빛이 눈에 들어오는 것으로부터 시작됩니다. 시신경과 감각신경이 활성화되며 모든 정보들이 뇌에 전기 신호, 비트로 전달됩니다. 뇌의 관점에서만 생각해본다면 동일한 비트를 만들어 케이블로 뇌에 전달하더라도 우리는 똑같은 걸 보고 느낀다는 의미입니다. 뇌에 전달된 신호들을 통해서 우리 뇌는 현실에 대한 시뮬레이션을 만들어 우리에게 보여주고 있는 셈입니다.

13
흐름 13

이 전체의 과정을 "본다"라고 합니다.

숨쉬듯 자연스레 이뤄지지만, 실제론 신호를 받아 현실세계World에 대한 시뮬레이터Model or Simulator를 만든 것과도 같습니다.

여기서 현실을 인식하기 위해서는 시뮬레이션을 경험하는 "나", 즉 자의식이 필요합니다. 자신의 존재를 시뮬레이션 안에서 갖게 되어야 인식할 수 있습니다. 일리야 수츠케버가 NeurIPS 2024에서 "앞으로 AI가 자의식을 갖게 될 것"이라 말했던 것도 같은 맥락입니다. 뇌 자체가 현실과 맞닿아 있는 구조가 아님(뇌는 머리 속에 있지만, 모든 것을 느낍니다. 이 구조 자체가 뇌는 간접적으로 경험하는 구조란 의미)을 생각해보면 이해가 쉽습니다. 현실과 맞닿은 "누군가"를 만들어내야 하고 그것이 자의식입니다.

14
흐름 14

우리는 그것이 나라고 생각하며 살아갑니다. 그것이 한 번도 틀린 적 없기에 당연하다고 생각하며 살아갑니다.

휴머노이드의 현실 인식

지금까지의 모든 로봇은 다른 사람들이 만든 데이터로 훈련한 것을 가지고 살아갑니다. 사람은 살아가면서 내가 경험하며 얻은 것으로 살아가는 것과 가장 큰 차이가 여기서 벌어집니다. 그래서 오픈AI 자렘바는 LLM이 이미 충분한 수준의 지능에 도달했다면 로봇마다 개별적인 경험을 하는 사이클이 필요할 것으로 예상하고 있습니다. 일종의 사후학습Post-training입니다.

엄청난 양의 데이터로 훈련받지만 그 안에 자신이 만든 데이터가 없기 때문에 영화 <메멘토Memento>의 단기기억 상실증 남자처럼 몸에 새긴 문신 같은 것들을 보며 그때그때 명령을 기억하는 것과도 같습니다.

15
흐름 15

여기서도 o1과 같은 발전이 있을 것으로 예상합니다. 모델들이 자신이 훈련한 데이터를 기억할 수 있다면, 즉 엄청난 양의 컨텍스트 윈도우를 가질 수 있다면 자의식을 가지고 경험한 기억을 가질 수 있기 때문입니다. 그 안에서 자의식이 강해짐으로써 한 단계 진화할 수 있습니다. 엔비디아는 앞으로 더 많은 컴퓨팅이 필요할 것이라 보고 있습니다. 종래에는 새로운 종류의 사전학습-사후학습-추론 루프가 된다는 의미입니다.

로봇을 위한 월드모델 : NVIDIA Cosmos

로봇이 세상을 보기 위해서는 시뮬레이터가 필요하고, 시뮬레이터가 현실과 가깝게 제대로 작동하기 위해서는 각종 행동과 물리법칙에 대한 가중치를 갖고 있는 월드모델이 필요합니다. 휴머노이드는 인간과 비슷하게 행동하는 Physical AI를 원했기에 행동에 대해서 가장 많은 데이터를 갖고 있는 인간의 모습을 그대로 땄습니다.

16
흐름 16

언어를 이해하는 것뿐만 아니라 중력, 마찰, 관성 등 역학을 이해해야 하고, 기하학적이고 공간적인 관계, 원인과 결과에 대한 이해가 필요합니다. 무언가를 떨어뜨리면 깨지고, 찌르면 터지며, 뒤집어지기도 합니다. 또한 물체의 영속성에 대해서도 이해할 수 있어야 합니다. 볼링공으로 핀을 쓰러뜨리고 나면 그 공은 우주로 사라진 게 아니라, 여전히 그 밑에 남아있음을 이해해야 합니다. 이런 모든 유형들은 현재의 모델들이 직관적으로 이해하기 매우 힘들어하는 분야이며, 그래서 엔비디아가 만들어서 공개오픈소스했습니다.

"로보틱스를 위한 ChatGPT 순간이 다가오고 있습니다. 거대언어모델과 마찬가지로 월드모델은 로봇 및 자율주행 개발을 발전시키는 데 기초가 될 것입니다.

17
흐름 17

우리는 Physical AI를 민주화하고 모든 개발자가 로보틱스를 활용할 수 있도록 NVIDIA Cosmos를 만들었습니다."

2025-01-06, 젠슨 황, NVIDIA Cosmos 발표 보도자료 中

엔비디아의 코스모스Cosmos는 모든 기업들이 월드모델을 만들 수 있도록 돕는 플랫폼입니다. 월드모델 + 데이터로 모델을 학습시키기 위한 도구Autoregressive Model, Diffusion Model, Video Tokenizaers, Video Processing and Curation Pipeline로 구성된 플랫폼입니다. 실제 세상에 적용되는 보편적인 물리법칙들에 대해 훈련하여 일부 이해하고 있는 모델입니다. 코스모스의 월드모델 자체는 2,000만 시간 분량의 로보틱스 및 주행 데이터를 포함하여 9,000조 개 토큰으로 학습했습니다.

18
흐름 18

매개변수 크기는 4B부터 14B에 이르기까지 다양합니다.

물리적 AI의 성능은 양질의 데이터를 얼마나 많이 확보할 수 있는가와 연관 있습니다. 그러나 리얼월드 데이터로만 처음부터 모든 것을 쌓으려면 너무 많은 비용이 들기 때문에 코스모스를 활용하여 각 기업들이 개발하기 쉽도록 돕습니다. 리얼월드 데이터를 모으고 테스트 하는 것은 각자가 해야겠지만 이를 처리하는 방법, 방대한 양의 합성 데이터를 생성하는 것, 모델을 훈련하고나서 평가하는 방법을 하나의 패키지로 제공합니다.

엔비디아 코스모스 WFMWorld Foundation Model을 기반으로 자신의 데이터를 모아 미세조정하여 새로운 AI로 만들 수도 있습니다. 로보틱스 분야의 Llama 2 모멘트입니다.

19
흐름 19

생성형AI의 시작은 ChatGPT 2022년 말가 했다면, 실제 기업들이 업계에서 느끼기에 그보다 훨씬 더 중요했던 건 오픈소스로 풀렸던 메타의 Llama 2 2023년 7월였습니다. ChatGPT로 얼마나 뛰어난지는 알겠지만 어떻게 개발할지 방법이 없었던 전 세계 기업들이 Llama 2를 사용해보면서 투자규모를 크게 늘렸었습니다.

패트릭 콜리슨 (2024-05-22, 인터뷰)

"메타가 지난주 라마 3를 출시해서 많은 관심을 받았는데, 제가 볼 때는 지금까지 발표된 오픈소스 모델 중에는 가장 인상적이던데 오픈소스 모델에 대해서 어떻게 생각하세요?"

엔비디아 CEO, 젠슨황 (2024-05-22, 인터뷰)

"지난 몇 년 동안 가장 중요한 사건이 무엇이냐고 묻는다면 당연히 ChatGPT가 먼저 나오고, 강화학습(Reinforcement Learning), 사람의 피드백구조(Human Feedback)에 대한 기술을 습득한 거라 말할 수 있습니다.

20
흐름 20

덕분에 컴퓨팅이 민주화됐습니다. 이제 누구나 프로그래머가 될 수 있습니다. GPT와 오픈AI가 해낸 일들이 자랑스럽습니다."

"그리고 두 번째로 중요한 사건은 라마(Llama)입니다. 라마1도 아니고 라마2입니다. 라마2는 거의 모든 산업에서 쓰였고 기업들이 생성형AI 연구에 뛰어들도록 만들었습니다. 모든 산업에서 생성형AI를 써볼 수 있는 문이 열린 것이죠. 의료, 금융, 제조, 고객서비스, 소매업 등 모든 산업입니다. 오픈소스였기에 가능했습니다.

"ChatGPT가 컴퓨팅의 민주화를 이끌었다면, 라마는 생성형AI를 민주화시켰습니다. 메타의 라마가 없었더라면 안전에 대한 모든 연구, 추론방식에 대한 연구, 현재 개발되는 모든 추론 기술과 강화학습 방법들에 대한 연구가 이렇게 크게 활성화되지 않았을 거라고 생각합니다."

21
흐름 21

NVIDIA Cosmos는 오픈소스이기에 당장 엔비디아가 이를 통해 직접적으로 뭔가를 주도할 것은 적습니다. AI 가속기를 통해 AI가 더 많은 애플리케이션에 쓰이도록 하는 미션에 초점을 맞춘 것입니다. 이에 따라 최근 6개월 동안 각종 휴머노이드 개발이 훨씬 더 많아졌습니다.

모든 로보틱스 회사는 세 가지를 가져야 한다

젠슨황은 모든 로보틱스 기업은 향후 세 가지 컴퓨터를 갖게 될 거라고 봤는데, 테슬라가 따라온 길과도 같습니다. 훈련을 위한 슈퍼컴퓨터 + FSD 신경망 + 추론 칩/Fleet 중에 FSD가 월드모델을 만들어가는 길이었기 때문입니다. 자율주행을 완벽한 수준으로 해결하기 위해서는 월드모델을 구축함이 필요하고, 이것을 해결하는 과정에서 옵티머스의 완성도 자연스러운 그림이었습니다.

22
흐름 22

AGI를 향해가는 주자들도 월드모델 개발에 속도를 더하고 있습니다. 언제부터 처음 개발하기 시작했는가를 보면 오픈AI는 Sora에서 이것이 월드모델의 초기 시뮬레이터임을 밝혔었고, 메타, 구글 딥마인드도 물리적 AI를 이해할 수 있는 월드모델을 개발하고 있습니다.

현실 속 로봇과 휴머노이드

휴머노이드로 가기 위한 길

*왼쪽 : 미국 제조업 분야에서 노동비는 2014년부터 지난 10년간 꾸준히 늘어왔습니다.

*오른쪽 : 아마존은 인간 노동자 대비 로봇 비중을 크게 늘려, 2023년 기준 75만개의 로봇을 사용하고 있습니다.

로봇과 시뮬레이터

전 세계에서 로봇을 가장 많이 쓰는 기업 중 하나가 아마존Amazon입니다. 2012년 $775M에 Kiva Systems를 인수한 이후 계속해서 로봇 스타트업을 인수합병해왔습니다.

23
흐름 23

그 결과 2023년 기준 물류로봇 75만대를 사용하고 있고, 아마존 제품의 4분의 3이 로봇을 거쳐 배달됩니다. 여전히 AI 로봇 스타트업을 매우 적극적으로 인수 중인 기업이기도 합니다. 2023년에만 $9B정도의 CAPEX를 로봇에 썼을 것으로 추정되며, 휴머노이드가 아닌 산업용 로봇이지만 로봇을 가장 잘 사용하는 사례입니다.

이렇게 물류자동화를 할 수 있었던 것은 엔비디아의 NVIDIA Isaac Sim 덕분에 가능했습니다. 현실 세계에 로봇을 배포하기 전에 가상 환경에서 자율 창고를 자동화, 최적화, 계획하기 위한 디지털 트윈을 만들기 위해 NVIDIA Omniverse 속의 Isaac Sim을 사용했습니다.

많은 수의 휴머노이드 개발자들이 NVIDIA Isaac GR00T를 통해 체계적인 개발을 하고 있습니다.

24
흐름 24

로봇들은 NVIDIA Omniverse를 통해서 현실과 비슷한 시뮬레이터에서 훈련하고 있었습니다. Omniverse에 이번에 출시한 코스모스를 더할 것이므로 시뮬레이터에서 만들 합성 데이터의 완성도는 더 높아질 예정입니다. 코스모스는 물리법칙에 대해 따로 배운 월드모델입니다. 현실세계를 위한 시뮬레이터에 물리법칙을 추가했다는 의미입니다.

휴머노이드 훈련은 어떻게 이뤄지나

그동안 휴머노이드 훈련은 인간의 능력들을 제각기 훈련시키는 것에 가까웠습니다. 대표적으로 필요한 데이터는 행동 데이터, 시각 데이터, 자연어 데이터, 환경 데이터, 감정 데이터 등을 예로 들 수 있습니다.

행동 데이터는 사람의 움직임을 담은 모션 캡처 데이터, 역학에 대한 시뮬레이션 데이터, 보행에 대한 데이터가 있습니다.

25
흐름 25

시각 데이터는 이미지 및 비디오 데이터셋, 3D 데이터, 물체 인식 데이터가 있습니다. 자연어 데이터는 사람과의 대화를 위한 데이터입니다. 환경 데이터는 로봇이 특정한 환경에 대해 인식하고 상호작용하는 방법들입니다. 예를 들어 벽이 있을 때 행동하는 법, 계단을 오르고 내리는 것 등입니다. 감정 데이터는 사람의 감정이나 표정을 인식하기 위한 데이터입니다.

이것들을 최대한 모아 파운데이션 모델을 만들었던 것이 NVIDIA Isaac GR00T입니다.

하체는 상대적으로 쉽다

이 영상을 한 번 보시길 권해드립니다. 자막을 켜시면 한글자막이 있습니다. 걷는 방법을 모션캡처로 알려주지 않고, 강화학습을 통해 처음부터 훈련시키는 과정에 대한 느낌을 아실 수 있습니다.

26
흐름 26

영상을 보셔서 아실 수 있겠지만 비교적 보행은 많이 발전했습니다. '목적지까지 도달해야 한다', '넘어지지 않아야 한다', '왼발과 오른발을 번갈아 움직여야 한다' 등 조건들을 주고 목표를 충족시켰을 때 보상을 주는 식입니다. 상대적인 얘기지만 어디서나 넘어지지 않고 걸을 수 있는 다리를 갖는 건 쉽습니다.

특히 위에 말씀드린 것처럼 수천 가지 환경에서 동시에 NVIDIA Omniverse에서 시뮬레이션한 데이터를 받게 되고, 여기에 물리법칙이라 할 수 있는 코스모스가 합쳐지니 이제 어디서나 걸을 수 있는 알고리즘을 갖기란 더 쉬워집니다.

상체는 진짜 어렵다

그러나 실제 "일"을 해야 하는 상체, 팔과 손가락에 대한 학습은 쉽지 않습니다.

27
흐름 27

훨씬 더 많은 관절로 이뤄져있기 때문에 목표와 조건으로는 구현하기 어렵습니다. 자유도DoF, Degree of Freedom라는 개념처럼 훨씬 더 많은 관절로 무수한 움직임을 구현할 수 있기 때문입니다. 그래서 사람이 행동하는 걸 로봇이 따라하는 모방학습Imitation Learning이 필요합니다.

휴머노이드를 개발하고 있는 테슬라 연구소 내에는 수십명의 사람이 모션 캡처 슈트를 착용한 채로 특정 작업들을 반복합니다. 물건을 집어서 옮기는 작업을 하거나, 팔을 뻗었다가 접거나, 빨래를 개거나, 4680 배터리 셀을 집어서 옮기거나 하는 동작들을 취합니다. 테슬라 옵티머스Optimus는 사람의 동작을 그대로 모방하며 책상 위 실제 물건을 옮기는 작업을 합니다.

28
흐름 28

가장 사람다운 데이터를 뽑는 과정입니다.

현실적인 문제는 정교함에 있습니다. 프롬프트로 "냉장고를 열어서 우유를 꺼낸 다음 컵에 따라줘"라고 하면 → 우선 냉장고, 우유, 컵을 이해하고 있어야 합니다. 그리고 열기, 꺼내기, 따르기에 대한 행동을 이해하고 있어야 합니다. 각 행동별 움직임에 대해 모방학습 데이터를 저장하는 일입니다. 조금 더 깊게 보자면 냉장고를 열 때의 최적의 팔/손 모양과 힘의 강도, 우유곽을 집을 때의 최적의 팔/손 모양과 힘의 강도, 컵에 따를 때의 최적의 팔/손 모양과 우유의 궤적을 이해하고 있어야 합니다.

사람의 역할을 대체하려면, 사람이 속해있는 현실세계의 물리법칙에 대해 이해하고 있어야 합니다.

29
흐름 29

여러모로 코스모스가 긍정적인 영향을 미칠 것으로 예상하는 이유입니다. 오픈소스이기에 엔비디아가 시장에 직접적인 영향을 미치는 건 거의 없지만 고객들의 새로운 시장 개척속도를 더 빠르게 한다는 점에서 엔비디아에게는 긍정적훈련용 Hopper/Blackwell, 추론용 Jetson, CUDA 생태계 확장입니다.

주요 휴머노이드 제조사

Tesla, Figure, Unitree, UBTech

주요 휴머노이드 개발기업

현재까지 서방진영 휴머노이드 대표 기업은 테슬라Tesla, 피규어Figure, 보스턴 다이내믹스Boston Dynamics, 어질리티 로보틱스Agility Robotics, 앱트로닉Apptronik, 1X1X, 뉴라 로보틱스Neura Robotics, 생츄어리Sanctuary AI, 멘티Mentee가 있습니다.

30
흐름 30

중국 휴머노이드 대표 기업은 유니트리Unitree, 샤오펑Xpeng, 로봇에라RobotEra, 푸리에Fourier, 유비테크UBTech가 있습니다.

특징들을 하나씩 꼽아보면 다음과 같습니다.

로봇 개발 플랫폼 : NVIDIA

대부분의 기업이 엔비디아 플랫폼을 통해서 휴머노이드를 개발하고 있다는 게 특징입니다. 12월 중순에는 구글 딥마인드가 앱트로닉과의 전략적 파트너십을 맺었던 부분, 12월 말에는 오픈AI가 피규어와 1X에 투자한 것을 넘어서 자체 개발을 목표로 하고 있다는 소식도 있었습니다.

로봇 중에 자체 사용을 포함해서 기업고객이 있는 기업은 테슬라Tesla, 피규어BMW, 보스턴 다이내믹스Hyundai, 어질리티 로보틱스Amazon, GXO Logistics, 앱트로닉Mercedes-Benz, GXO Logistics, 1XEveron, 생츄어리Magna International, 샤오펑Xpeng, 유비테크BYD, Geely, Nio가 있습니다.

31
흐름 31

엔비디아의 로봇 플랫폼 : 3가지의 컴퓨터

엔비디아의 개발방식은 세 가지의 컴퓨터를 필요로 합니다. 로봇을 학습시키는 NVIDIA DGXNVIDIA GR00T, 현실 세계에 대해 배우고 익히기 위한 체육관인 NVIDIA OVXNVIDIA Omniverse Digital Twin, 로봇에 탑재되어 세상을 보고 느끼는 NVIDIA AGXNVIDIA Jetson Thor입니다.

DGX : 로봇의 두뇌NVIDIA Isaac GR00T Foundation Model를 가르치는 컴퓨터입니다. 모델은 LLM로 명령을 받으면 이에 대해서 로봇이 해야 할 다음 행동에 대한 토큰을 생성하도록 훈련합니다.

32
흐름 32

DGX와 OVX는 기본적으로 테슬라 Cortex와 유사한 역할입니다.

OVX : 로봇을 가르치고 시뮬레이션NVIDIA Omniverse 내의 Isaac Sim하는 플랫폼입니다. 로봇이 리얼월드에서 훈련하려면 시간과 비용이 많이 들기에, 강화학습을 통해 더 잘 작동하도록 훈련받는 일종의 체육관입니다.

AGX : 로봇이 가동하는데 필요한 환경 데이터, 경로 계획, 시각적인 데이터들을 처리하도록 설계된 칩NVIDIA Jetson입니다. DGX에서 훈련, OVX에서의 시뮬레이션을 거치고 난 모델이 AGX 내에서 가동됩니다. AGX는 테슬라의 HW4와 비슷한 역할입니다.

가장 앞서있는 휴머노이드 : Tesla Optimus

33
흐름 33

테슬라 봇 컨셉 YouTube : 작동하는 프로토타입은 없었지만, 컨셉적인 "Tesla Bot"을 공개했습니다.

범블비 YouTube : 처음 작동하는 프로토타입 "Bumble-C"를 공개했던 때입니다.

옵티머스 1세대 YouTube : 자체 설계 액추에이터를 사용하기 시작했습니다. 2023년 3월 Investor Day에 걸었습니다.

옵티머스 2세대 YouTube : 센서와 액추에이터를 직접 쓰고, 다리와 손가락의 정교함이 크게 올라갔습니다.

유니트리Unitree, 유비테크UBTech, 피규어Figure AI, 테슬라 Optimus가 휴머노이드 중 현재로서는 가장 앞서 있다고 판단합니다.

34
흐름 34

그중 테슬라 옵티머스는 가장 인체에 가깝도록 설계된 범용 휴머노이드입니다. 인간과 유사한 걸음걸이, 머리 크기, 질감과 질량을 느낄 수 있는 손과 손가락을 갖고 있습니다. 일론 머스크Elon Musk는 2025년 5천 대(실제로는 1천 대) → 2026년 5~10만대 → 2027년 50~100만대 생산을 목표로 하고 있습니다. 장기적으로 대량생산 시 $20~30K로 갈 수 있다는 목표인데, 아직은 갈 길이 멀긴 합니다.

*왼쪽 : 2024년 기준 테슬라 Optimus의 BoM은 $50~60K 정도로 추정됩니다. (자료: Morgan Stanley)

*중간 : 빨간색은 액추에이터, 파란색은 전기시스템, 몸통의 파란색은 배터리팩입니다.

35
흐름 35

*오른쪽 : 옵티머스는 총 28개의 액추에이터를 사용하는데, 자체 개발한 6가지 액추에이터로 구성되어 있습니다.

*왼쪽 : 옵티머스용 배터리는 2.3kWh입니다. 모델3/Y의 배터리가 60~80kWh임을 감안하여 평균 70kWh라고 보면, 배터리 입장에서 옵티머스 30대가 모델3/Y 1대와 같습니다. 옵티머스 1억대는 모델3/Y 333만대정도 규모입니다.

*오른쪽 : 옵티머스에 사용된 6가지 액추에이터 디자인입니다. 3가지는 회전형(Rotary), 3가지는 선형(Linear)입니다.

옵티머스의 모든 것

옵티머스 구성의 특징은 크게 FSD, 배터리, 액추에이터, 손으로 나눌 수 있습니다.

36
흐름 36

뇌, FSD : 옵티머스 안에는 휴머노이드 폼팩터에 맞게 수정된 FSD 하드웨어와 소프트웨어가 있습니다. 시각, 촉각 등 각종 데이터가 들어오면 순식간에 결정을 내릴 수 있으며, Wi-Fi 및 LTE 연결이 가능합니다.

배터리 : 2.3kWh, 52V 배터리를 탑재하고 있습니다. 옵티머스는 앉아있을 땐 100W, 걸을 땐 500W를 소모합니다. 아직 개발 단계이기 때문에 작동시간에 대해서는 구체적으로 알려져 있지 않습니다.

액추에이터 : 옵티머스는 자체 설계한 액추에이터가 가장 큰 특징입니다. 관절 및 근육 역할을 합니다. 자동차 설계의 교훈을 살려 에너지/질량/비용에 대한 최적의 값으로 설계했습니다.

37
흐름 37

자체 액추에이터를 설계제조는 하청업체에 아웃소싱 할 수 있습니다할 수 있어야 휴머노이드에 맞는 최적의 힘과 동작 범위를 설계할 수 있다는 게 테슬라의 입장이었습니다. 전기차를 설계하면서 모터에 관한 노하우를 많이 갖고 있기 때문이기도 합니다.

손 : 옵티머스의 손은 인간의 손과 비슷하게 설계됐습니다. 6가지 액추에이터로 11개의 자유도가 가능합니다. 옵티머스 2세대부터는 모든 손가락에 촉각 센서를 갖춰서 로봇이 보다 섬세한 물건을 다룰 수 있도록 설계됐습니다. 차세대 옵티머스에서는 자유도를 22개까지 높일 예정인데 머스크는 이 경우 인간이 할 수 있는 거의 모든 동작을 할 수 있을 거라고 평가했습니다.

38
흐름 38

휴머노이드 공급망

두뇌에서 신체까지

*오른쪽 : 모건스탠리가 꼽은 휴머노이드 밸류체인입니다. "클릭 후 더블클릭"하시면 크게 보실 수 있습니다.

두뇌 Brain

휴머노이드는 최종적으로 인간처럼 생각하고 행동하도록 설계됐습니다. 고도로 발전한 파운데이션 모델이 로봇의 뇌 기능을 함으로써 훨씬 더 다양한 일들에서 인간을 물리적으로 대체하거나 지원할 수 있을 거라는 생각입니다. 세상을 이해하기 위해서는 LLM과 월드모델혹은 월드시뮬레이터이 필요합니다.

인간이 만든 세상이기 때문에 가장 인간스럽게 만들어야 가장 유용할 거란 생각에서 시작됐고, 학습을 위해서도 인간에 대한 데이터가 가장 많으니까 인간의 모습을 가지도록 설계했습니다.

39
흐름 39

AI 시스템은 대부분 엔비디아의 시스템을 쓰고 있습니다.

"세상에 적응하기 가장 쉬운 로봇은 휴머노이드 로봇입니다. 왜냐하면 인간이 인간을 위해 세상을 만들었기 때문입니다. 다른 유형의 로봇보다 휴머노이드를 훈련할 수 있는 데이터가 가장 많습니다. 우리랑 같은 체격을 갖고 있기 때문입니다."

2024-03-20, 젠슨 황 CNBC 짐 크레이머 인터뷰 중

"언젠가는 움직이는 모든 것이 자율화될 것입니다. 모든 공장이 로봇화될 것입니다. 공장은 로봇을 조율하고, 그 로봇은 로봇 제품을 만들 것입니다. 로봇이 로봇과 상호작용하여 로봇 제품을 만드는 식입니다."

40
흐름 40

2024-06-02, 젠슨 황 COMPUTEX 2024 기조연설 중

신체 Body

하드웨어적으로는 전동식Electric Drive과 유압식Hydraulic Drive으로 구분됩니다. 특징들로만 간단히 구분하자면 전동식은 모터가 휴머노이드의 관절 및 움직임을 담당합니다. 장점은 대량생산이 가능하고, 제어 정밀도가 높고 응답속도도 빠르며 신뢰성도 높습니다. 복잡한 움직임도 구현할 수 있습니다. 다만 단점으로는 전력 소비와 토크 제한이 이슈였습니다.

유압식은 액체 압축 펌프로 고압의 액체를 통해 힘을 만들어내는 식입니다. 중량이 큰 것들을 다루거나 특수 용도에 쓰입니다.

41
흐름 41

유압 실린더와 유압 모터가 쓰입니다. 단점은 설계가 복잡하고 유지보수도 복잡하다는 점이며 대량생산에 적합하지 않습니다. 원래는 전동식엔 테슬라 옵티머스가, 유압식엔 보스턴 다이내믹스처음에 미군 보병을 지원하는 로봇이 목표였기에 유압식이었습니다가 대표적인 기업이었는데 최근 보스턴 다이내믹스도 전동식으로 넘어오면서 전동식 휴머노이드로 획일화된 모습입니다.

휴머노이드의 하드웨어에서는 액추에이터가 핵심입니다. 인간처럼 행동하기 위해서는, 인간처럼 다양한 동작을 하는 게 핵심인데 액추에이터가 관절과 근육에 해당하는 부품입니다. 따라서 로봇의 자유도는 일반적으로 액추에이터의 수가 결정합니다.

42
흐름 42

회전 운동을 할 수 있게 하는 회전 관절Rotary Actuators과 선형 운동을 할 수 있게 하는 직선 관절Linear Actuators의 조합으로 이뤄집니다. 현재 개발 중인 휴머노이드는 보통 16~60개의 자유도를 갖고 있습니다.

*옵티머스 2세대 BoM : 센서 37.0%, 모터 20.3%, 나사 20.2%, 감속기 12.6%, 인코더 3.9%, 베어링 0.8%, 배터리 0.5%

액추에이터의 구성요소

하드웨어의 핵심인 액추에이터는 센서Sensor, 모터Motor, 나사Screw, 감속기Reducer, 인코더Encoder, 베어링Bearing의 조합으로 구성됩니다.

43
흐름 43

옵티머스 $50~60K 비용 중 센서가 37%, 모터 20%, 나사 20%, 감속기 13%, 인코더 4%, 베어링 1%, 배터리 0.5% 정도입니다. 따라서 휴머노이드 산업이 잘 될 때 부각받는 부품체인은 센서, 모터, 나사, 감속기라고 꼽을 수 있습니다.

센서 : 휴머노이드 내엔 비전, 힘, 관성, 온도 센서 등을 포함해서 많은 센서가 들어있습니다. 휴머노이드 자체의 위치 데이터 인식과 외부의 시각/청각/촉각 데이터 인식에 주로 쓰입니다.

모터 : 모터는 토크를 생성하는 데 쓰입니다. 모터는 크게 프레임리스 토크 모터Freamless Torque Motor와 코어리스 모터Coreless Motor로 나뉩니다.

44
흐름 44

프레임리스 토크는 기술장벽이 비교적 낮은 분야입니다. 미드/로우레인지 애플리케이션에서 중국 모터가 쓰입니다. 코어리스 모터는 기술장벽이 비교적 높은 분야입니다. 의료 및 군사장비에 쓰입니다.

나사 : 회전 운동과 선형 운동을 변환하는 데 쓰입니다. CNC 공작기계, 제조장비, 로봇, 정밀기기 등 기타 애플리케이션에 널리 쓰이는 나사를 씁니다. 진입장벽이 높고 생산 장비나 원자재가 비싼 나사는 유럽 및 일본 회사가 주도합니다. 다만 여기도 중국 기업들이 계속해서 고급 시장으로 진출하려 노력하고 있습니다.

45
흐름 45

감속기 : 휴머노이드의 토크 출력과 각종 동작의 정교함을 높이는 데 쓰입니다. 감속기에서는 세 가지가 대표적입니다. 유성감속기Planetary Reducers, 하모닉 감속기Harmonic Reducers, RV 감속기RV Reducers입니다. 주요 카테고리들은 일본 기업들이 주도하고 있지만, 중국 내에서 리더드라이브Leaderdrive 같은 기업들이 침투하고 있습니다.

*휴머노이드에 들어가는 액추에이터 공급망 내 주요 기업입니다. (자료: Morgan Stanley)

5

그럼에도 빠진내용 정리

잡담·곁다리 내용
  • 잡담, 화면 설명, 불확실한 표현을 무작정 버리지 않는다.
생략 기록

별도 생략 기록이 없습니다.

그럼에도 빠진내용 정리

압축/생략
원문에 열거된 관련 과거 글의 제목과 투자자문 고지는 flow에 남겼다. 이미지 자체의 세부 도표·영상의 실제 장면은 별도 미디어 원장 대상이며, 본문이 제공한 숫자와 설명만 복원했다.
잡담/운영
사피엔스가 2025년 1월 분석을 현재 관점으로 업데이트했다는 도입, 구독·계약 검토 안내, 관련 자료 링크와 원문 URL을 보존했다.
전사 오류 가능성
일부 영문 제품명과 붙어 쓴 기업명, ‘실제 1천 대’처럼 괄호로 덧붙인 수치는 원문 표기를 따랐다. 이미지 기반 BoM·공급망 도표는 본문에 명시된 수치 외에는 확정하지 않았다.
원문 확인

document_work_runner prepare가 입력 원문을 수정 없이 보존했다.