2026.04.15 · 네이버 프리미엄 콘텐츠 · 올바른 미국주식 by SAPIENS

오픈AI의 두뇌, 일리야의 후계자 야쿠브 파초키 : Spud 출시 직전, 대전략을 바꾸다

유형
네이버 프리미엄 콘텐츠
날짜
2026.04.15
강연자/작성자
올바른 미국주식 by SAPIENS
분석 주제
미지정
자료 길이
본문 41,587자
1

문서 전체 조망

핵심 구조

오픈AI는 모델 성능의 과시에서 경제적 확산과 AI 연구 자동화까지 연구의 기준을 넓히고 있다

야쿠브 파초키 인터뷰는 실제 코딩 도구 활용, 더 긴 자율 작업, In-context Learning을 통해 모델을 현실 업무와 과학 연구에 연결하려는 방향을 다룬다. 다만 기술 발전이 빠르더라도 기업 도입과 사회적 적응은 별도의 시간과 실행 조건을 필요로 한다.

연구의 목표가 벤치마크 밖으로 넓어진다

오픈AI는 수학·코딩처럼 검증 가능한 능력을 계속 중시하면서도, 다음 세대 모델이 경제 활동과 과학적 생산성을 얼마나 높이는지를 연구 컴퓨팅 배분의 기준으로 함께 본다. 모델의 점수뿐 아니라 실전에서 쓸 수 있는 결과가 중요해졌다는 문제의식이다.

코딩 도구는 자율성의 출발점으로 제시된다

내부에서 실제 코딩 작업의 상당 부분을 코딩 도구로 수행한다는 설명은, 생산성 기여가 이미 관찰되는 영역을 보여준다. 다만 연구 인턴 수준은 구체적 과제를 오래 수행하는 단계이고, 열린 문제를 스스로 정의하는 자동화 연구원과는 구분된다.

스케일링과 현실 연결을 함께 확장한다

사전훈련과 강화학습의 확장을 계속 신뢰하면서, 긴 컨텍스트·도구·권한·메모리·컴퓨트가 연결된 실행 환경에서 모델이 현실과 상호작용해야 한다고 본다. 알고리즘을 키우는 일과 배포 환경을 만드는 일은 대립하지 않는다는 관점이다.

기업의 학습 방식은 자체 재훈련보다 맥락 제공으로 기울 수 있다

특정 업무의 강화학습은 성능을 높일 수 있지만, 지침과 예시를 컨텍스트에 넣어 모델이 적응하는 In-context Learning이 더 데이터 효율적인 방법일 수 있다고 설명한다. 좋은 데이터와 평가 기준을 정하는 일은 여전히 남는다.

AI가 AI 연구를 돕는 루프가 초기 단계에서 보인다

내부 GPT-5 Pro 계열 시스템에서 의미 있는 아이디어가 나왔지만 기대하는 수준과 비교하면 아직 초기라고 평가한다. 연구 과정에서 모델의 즉각적 품질이 중요해지면서 연구 조직과 컴퓨팅 배분을 다시 설계해야 한다는 주장으로 이어진다.

과학·로봇·사회로 갈수록 실행과 통제가 과제가 된다

First Proof 같은 미공개 수학 문제와 과학 연구의 활용 가능성은 모델이 새로운 아이디어를 낼 수 있는지 시험하는 장면으로 다뤄진다. 로봇공학과 지적 노동 자동화에는 낙관을 보이지만, 일자리·부의 집중·정렬과 모니터링은 정책과 사회가 함께 풀 문제로 남긴다.

ANALYSIS VIEW사건별 사실과 작성자의 판단, 지속 정보를 나누어 읽기
2
사실·구조, 해석·전망, 시점 관찰, 판단 방법

지식·관점

사건 밖에서도 다시 참고하거나 다른 자료와 비교할 가치가 있는 내용을 대상과 반복 가능한 논점으로 묶습니다.

사실·구조OpenAI의 코딩 도구 활용주 대상 · 기업·종목 · OpenAI

Codex의 실제 코딩 활용은 어떤 단계로 설명되는가

이 자료가 더한 내용

야쿠브 파초키는 오픈AI 내부에서 실제 코딩 작업의 상당 부분을 Codex로 수행하는 단계에 들어섰으며, 코딩 도구의 발전을 AI가 생산성에 기여하는 방향이 계획대로 진행된 신호로 본다고 말했다.

근거 보기 1
  1. 원문 구간 1

    ​ 야쿠브 파초키 Jakub Pachocki : 네, 지난 몇 달 동안 실제로 가장 크게 느낀 변화 중 하나는 코딩 도구가 폭발적으로 발전했다는 점입니다. 오픈AI 내부에서도 이제는 분명히 실제 코딩 작업의 상당 부분을 Codex로 수행하는 단계에 들어섰습니다. 대부분의 사람들에게 프로그래밍이라는 일 자체가 예전과는 꽤 다르게 바뀌고 있다고 생각합니다. 코딩뿐만 아니라 AI가 생산성에 기여하는 큰 방향에서는 무언가가 계획대로 잘 진행되고 있다는 분명한 신호로 보고 있습니다. ​ 그리고 지난 몇 달 동안 개인적으로 또 매우 흥미롭게 본 변화는 수학 연구 역량이 크게 개선된 것입니다. 물리학이나 그 밖의 다른 분야에서 확인한 결과들도 마찬가지입니다. 일정 수준 이상의 역량과 통찰을 만들어내는 능력은 결국 인프라에 대한 접근성, 그리고 아마 지금의 코딩 도구들이 보여주듯 추론 시점에 더 많은 연산 자원을 투입할 수 있는 능력과 결합되면서 더 강해질 것이라고 보고 있습니다. ​ 저는 앞으로 몇 달 안에 범용 지능 측면에서도 상당히 강한 개선이 나타날 것으로 기대하고 있습니다. 저희가 지금도 매우 촘촘하게 계획을 세우고 있고, 높은 집중도를 유지하며 밀어붙이고 있는 부분이기도 합니다. ​ 제이콥 에프론 : 그리고 목표한 수준에 도달했다는 것을 어떻게 알 수 있습니까? 이를테면, 우리가 이제 연구 인턴 수준의 역량을 확보했다고 판단하기 위해 당신이 살펴보는 작업 흐름 같은 것이 무엇인지 궁금합니다.

해석·전망AI 연구 자동화주 대상 · 기술·제품 · AI 연구 자동화관련 대상 · 기업·종목 · OpenAI

연구 인턴 수준과 자동화 연구원은 무엇으로 구분되는가

이 자료가 더한 내용

연구 인턴 수준은 구체적 기술 과제를 장시간 자율 수행하는 능력으로, 완전히 자동화된 연구원은 중요한 문제·가설·평가 기준과 다음 연구 방향을 독립적으로 정하는 능력으로 구분한다. 현재 가까운 목표는 전자가 더 현실적이라는 해석을 제시한다.

근거 보기 2
  1. 원문 구간 1

    ​ 야쿠브 파초키 Jakub Pachocki : 제가 연구 인턴 수준의 AI와 완전히 자동화된 연구원 수준의 AI를 구분할 때 가장 중요하게 보는 기준은, 시스템이 얼마나 오랫동안 자율적으로 작동할 수 있는지, 그리고 주어지는 과제가 얼마나 구체적인지입니다. 그래서 지금 단계에서 시스템에 단순히 "모델 성능을 개선해라"라든지 "정렬 문제를 해결해라"처럼 매우 큰 목표만 던져주고, 그것을 스스로 끝까지 해내기를 기대하는 것은 아닙니다. 적어도 올해 안에는 그렇습니다. 언젠가는 그런 지점에 도달할 수 있다고 생각하지만, 지금은 훨씬 더 구체적인 기술적 아이디어가 중요하다고 보고 있습니다. ​ 예를 들어 모델을 어떻게 개선할지에 대한 특정한 아이디어가 있다든지, 평가를 지금과는 다른 방식으로 수행하는 방법이 있다든지 하는 식의 보다 명확한 문제 설정이 필요하다는 뜻입니다. 제 생각에는 그런 방향으로 가기 위해 필요한 핵심 요소들은 이미 대부분 갖춰져 있습니다. 이제 남은 것은 그 요소들을 하나의 시스템으로 잘 통합해내는 일이라고 보고 있습니다. ​ *코멘트 → 야쿠브 파초키가 정리한 말은, 적어도 당장의 목표가 아무 말 없이 알아서 과학을 혁신하는 AI는 아니라는 점입니다. 더 현실적으로 보고 있는 가까운 목표는, 명확하게 정의된 과제를 꽤 오랫동안 자율적으로 수행할 수 있는 연구 인턴 수준의 시스템입니다. 핵심은 실무적으로 자율성의 지속시간과 과제의 명확성을 강화하는 것입니다.

  2. 원문 구간 2

    수학과 코딩은 그럴듯하게 말하는 실력만 늘어난 건지, 아니면 실제로 뭔가를 이해하고 있는 것인지를 판단하기에 좋은 지표입니다. 소프트웨어 엔지니어들부터 채택이 늘어나는 이유도 이들은 즉각즉가 한 주에 몇 주의 코드를 썼고 얼마나 기여했는가가 객관적인 지표로 보이기 때문입니다. 보통의 사무직은 당장 얼마의 돈을 썼는지만 보이고, 생산성이 얼마나 늘었는가는 느끼기가 어려운데 개발자들은 생산성이 늘어난 것이 정량적으로 평가됩니다. ​ *코멘트 → AI 연구원 수준은 구체적인 업무를 잘 수행하는가의 단편적인 능력만 갖고 평가합니다. 예를 들자면 명확히 정의된 실험 목표를 받고, 관련 코드베이스를 읽고, 실험을 설정하고, 결과를 수집하고, 실패 로그를 해석하고, 몇 번의 수정과 재실행을 거쳐 의미 있는 개선안을 제안하는 것입니다. 여기서 더 나아가서 '완전히 자동화된 AI 연구원'으로 넘어가면 판단이 붙습니다. 무엇이 중요한 문제인지 스스로 판단하고, 어떤 가설이 유망한지 고르고, 평가 기준 자체를 정의하고, 애매한 결과를 해석하며, 다음 연구 방향을 독립적으로 설계해야 합니다. 닫힌 문제를 푸는 연구원 단계를 넘어서서 → 열린 문제에 대해서 정의할 수 있는 주체로 넘어갈 수 있느냐가 중요한 포인트입니다. ​ 제이콥 에프론 : 안드레 카파시가 이와 관련해 꽤 화제가 된 사례를 공개한 적이 있습니다. 당신들이 여기서 구축하고 있는 시스템에 비하면 훨씬 단순한 모델이기는 했지만, 그 역시 이런 모델들을 활용해 자신의 모델을 개선하는 과정을 보여주었습니다.

판단 방법AI 모델 평가주 대상 · 기술·제품 · AI 모델 평가

수학과 코딩은 왜 모델 발전의 평가 기준이 되는가

이 자료가 더한 내용

수학은 정답 판별이 명확하면서도 난도를 높일 수 있어 기술 발전의 북극성 역할을 하며, 코딩도 결과 검증이 가능해 강화학습 적용에 적합하다고 설명한다. 수학적 추론 향상이 AI 연구 역량으로 전이될 수 있다는 관점도 함께 제시한다.

근거 보기 3
  1. 원문 구간 1

    ​ 야쿠브 파초키 Jakub Pachocki : 수학 벤치마크에 집중해 온 가장 큰 이유는, 그것이 이 기술을 어디까지 발전시켜야 하는지를 보여주는 매우 좋은 기준이자 일종의 북극성 역할을 해왔기 때문입니다. 수학은 무엇보다 측정이 매우 쉽습니다. 문제를 실제로 풀었는지 아닌지를 판별하는 일은, 예를 들어 훌륭한 소프트웨어를 만들었는지를 평가하는 것보다 훨씬 명확합니다. 동시에 문제의 난이도는 매우 높게 설정할 수 있습니다. 즉, 정답 여부는 분명하지만 실제 해결은 얼마든지 어렵게 만들 수 있는 과제라는 뜻입니다. ​ 얼마 전까지만 해도 제 생각은 이랬습니다. 우리 모델은 아직 간단한 수학 문제조차 제대로 풀지 못할 수 있다는 것이었습니다. 그런데 이후에는, 충분히 쉬운 문제는 풀 수 있지만 국제수학올림피아드, 즉 IMO 수준의 문제는 아직 풀지 못한다는 쪽으로 관점이 바뀌었습니다. 다시 말해 이 모델들의 지능 수준에는 분명한 간극이 있었고, 수학은 그 간극을 아주 명확하게 측정하고 도전할 수 있는 목표였습니다. 무엇을 개선해야 하는지도 비교적 분명했습니다. 그래서 수학은 추론 모델을 발전시키는 과정에서 일종의 북극성 같은 역할을 해왔습니다. ​ 물론 지금은 상황이 꽤 달라졌습니다. 저희는 그동안 주요 이정표로 삼아왔던 IMO 수준, 이를테면 IMO 6번 문제를 푸는 단계에서 더 나아가 연구 수준의 수학으로 향하는 구간에 어느 정도 도달해가고 있습니다.

  2. 원문 구간 2

    이런 시점에서도 수학을 통해 발전 속도를 계속 측정하는 것은 여전히 분명한 의미가 있다고 생각합니다. 그리고 수학적 추론 능력의 향상이 실제 AI 연구 역량의 향상으로 이어지는 전이 효과도 분명히 존재한다고 봅니다. 실제로 저희의 뛰어난 연구원들 중 상당수는 수학 훈련을 받았거나 다른 이론 중심 분야 출신입니다. ​ 다만 이제는 이런 목표를 바라보는 방식 자체가 크게 바뀌고 있습니다. 저희는 다음 세대 모델이 현실 세계에서 실제로 어떻게 유용하게 쓰일 수 있을지에 훨씬 더 집중하고 있습니다. 여기에는 연구 분야는 물론이고, 경제적 가치가 큰 여러 활동들, 그리고 다양한 과학 분야가 포함됩니다. 그중에서도 특히 응용 과학 분야에서의 활용 가능성에 많은 관심을 두고 있습니다. ​ 이런 변화가 생긴 이유는, 모델이 아직 모든 면에서 사람만큼 똑똑하지 않더라도 이제는 실제 경제를 바꾸고 일하는 방식을 바꿀 수 있을 만큼 충분한 역량에 가까워졌다고 보기 때문입니다. 그래서 저희는 이 지점에 대해 상당한 시급함을 갖고 접근하고 있습니다. ​ *코멘트 → 이제는 당장의 다음 세대 모델을 통해 경제적으로 달성할 수 있는 성과(ARR)의 크기를 키우기 위해서 제품 개발에 힘쓰는 것도 중요해졌음을 말하고 있습니다. 오픈AI 연구용 컴퓨팅 할당의 중심이 약간 바뀌었음을 말한 내용이었습니다. 이전까지는 새로운 모델을 발표할 때마다 벤치마크 점수를 기준으로 사람들을 놀래키기 위해서 노력해왔었다면, 이제는 실전에 투입하여 경제 활동과 과학적 생산성을 어디까지 끌어올릴 수 있느냐가 우선순위가 되고 있습니다.

  3. 원문 구간 3

    ​ 제이콥 에프론 : 저 역시 초기에는 수학처럼, 풀기는 매우 어렵지만 맞았는지 틀렸는지는 비교적 쉽게 검증할 수 있는 분야를 택하는 것이 가장 적절한 출발점이었다고 생각합니다. 그리고 코딩도 본질적으로는 이런 특성을 상당 부분 공유한다고 봅니다. 결과를 확인하고 검증할 수 있으며, 그렇기 때문에 강화학습을 적용하기에도 매우 좋은 영역입니다. ​ 많은 분들이 지금 궁금해하는 핵심 질문도 바로 여기 있다고 생각합니다. ​ 우리는 이미 검증이 비교적 쉬운 이런 분야들에서는 강화학습이 놀라울 정도로 잘 작동하는 모습을 봐왔습니다. 그렇다면 이제 다음 질문이 생깁니다. 세상에서 경제적으로/사회적으로 가치 있는 일들 가운데는 의학, 법률, 금융처럼 어느 정도는 검증이 가능하지만, 수학이나 코드만큼 명확하게 정답을 가릴 수는 없는 영역들이 많습니다. 과연 이런 분야들에서도 우리가 비슷한 형태의 발전 경로를 보게 될 것인가 하는 점입니다. ​ 야쿠브 파초키 Jakub Pachocki : 수학과 코딩을 넘어서는 작업들에서도 분명 상당한 수준의 발전이 나타날 것이라고 보고 있습니다. 오픈AI 내부에서 특히 흥미롭게 보고 있는 지점 중 하나는, 평가가 더 어려운 이런 일반적 작업들이 사실은 장기 과제와 많은 공통점을 갖고 있다는 점입니다. ​ 예를 들어 수학이나 코딩처럼 문제 정의가 아주 명확한 작업이라 하더라도, 그것이 1년 가까이 매달려야 하는 장기 과제라면 이야기가 달라집니다.

해석·전망AI의 경제적 확산주 대상 · 산업·업종 · AI 산업

모델 성능 향상은 현실 도입과 어떻게 다른 속도로 진행되는가

이 자료가 더한 내용

모델 능력의 발전과 경제 전반의 채택은 모두 빠를 수 있지만, 기업의 보안 권한·레거시 소프트웨어·의사결정과 예산 집행 같은 현실 조건 때문에 확산 속도가 무한히 빠를 수는 없다고 정리한다. Claude Code 도입도 경영진의 이해와 조직 내 확산을 거치는 사례로 든다.

근거 보기 4
  1. 원문 구간 1

    예를 들어 "아, 시스템 설정은 다 했는데 실제로 작동하게 하려면 사내 보안 권한을 전부 바꿔야 하네"라거나 "모델을 배포하기 전에 검수하는 오래된 레거시 소프트웨어가 있는데 이걸 다시 짜야 하네" 같은 문제들 말입니다. 물론 AI 모델이 그런 코딩도 다 해줄 수 있지만, 어쨌든 인간이 모델에게 그 일을 하라고 지시해야 하고 그 과정에는 톱니바퀴가 맞물려 돌아가는 물리적인 시간이 소요됩니다. ​ 결론적으로 지금까지 우리가 목격한 모든 현상들은 두 개의 빠른 기하급수적 곡선이 존재한다는 사실과 일치합니다. 하나는 모델 자체 능력의 기하급수적 발전이고, 그 아래에 존재하는 또 다른 하나는 모델이 실제 경제 산업 전반으로 확산되는 기하급수적 속도입니다. 즉각적이지도 않고 느리지도 않지만, 과거 인류가 겪은 그 어떤 기술보다 훨씬 빠르며 동시에 나름의 물리적 한계도 가지고 있죠. 이것이 바로 제가 앤스로픽 내부의 실적과 우리 B2B 고객들을 보며 내린 결론입니다. 기업들의 채택은 엄청나게 빠르지만, 무한하게 빠른 것은 아닙니다. ​ 저는 확산(diffusion)이 매우 현실적인 문제라고 생각하며, 이것이 전적으로 AI 모델의 기술적 한계와만 관련된 것은 아니라고 봅니다. 거듭 말씀드리지만, 확산이라는 단어를 유행어처럼 쓰면서 AI 혁신이 별거 아니라고 깎아내리는 사람들이 있는데, 제 말은 그런 뜻이 아닙니다.

  2. 원문 구간 2

    저는 AI가 과거의 어떤 기술보다 훨씬 빠르게 확산될 것이라 생각하지만, 그 속도가 마법처럼 무한하게 빠르지는 않을 것이라는 점을 말씀드리는 겁니다. ​ Claude Code를 예로 들어보죠. Claude Code는 설정하기가 엄청나게 쉽습니다. 개발자라면 그냥 바로 쓰기 시작할 수 있죠. 대기업 개발자라고 해서 스타트업 개발자나 개인 개발자보다 Claude Code 도입을 늦춰야 할 하등의 이유가 없습니다. 그리고 우리는 도입을 촉진하기 위해 할 수 있는 모든 것을 합니다. 우리는 Claude Code를 기업에 판매합니다. 대형 금융사나 대형 제약사 같은 거대 기업들 모두, 일반적인 신기술을 도입할 때보다 훨씬 빠른 속도로 Claude Code를 도입하고 있습니다. ​ 하지만 어쨌든 물리적인 시간이 걸립니다. Claude Code나 cowork 같은 특정 기능이나 제품은 트위터에 상주하는 얼리어답터 개인 개발자들이나 시리즈 A 단계의 스타트업들에게 가장 먼저 채택될 것입니다. 반면 식품 판매를 주업으로 하는 거대한 전통 대기업에 전사적으로 도입되기까지는 그보다 수개월이 더 걸리겠죠. ​ 여기에는 여러 가지 요인이 있습니다. 법무 팀의 검토를 거쳐야 하고, 모든 직원이 쓸 수 있도록 사전 세팅(프로비저닝)을 해야 합니다. 보안 및 규제 준수 테스트도 통과해야 하죠. AI 혁신의 최전선에서 한발 떨어져 있는 대기업의 리더들은 물론 미래 지향적이긴 하지만, 스스로 납득하는 과정이 필요합니다.

  3. 원문 구간 3

    "아, 우리가 여기에 5천만 달러를 쓰는 게 타당하겠군. Claude Code라는 게 이런 거구나. 이게 우리 회사에 이런 도움이 되고 생산성을 이렇게 높여주는구나"라고 말이죠. 그러고 나면 그들은 두 직급 아래의 실무 관리자들에게 이를 설명해야 합니다. "자, 우리 회사에 3,000명의 개발자가 있는데, 이들에게 어떻게 배포할지 롤아웃 계획을 세워봅시다"라고 지시해야 합니다. 우리는 앤스로픽 내부에서 매일같이 고객들과 이런 대화를 나눕니다. ​ 우리는 앤스로픽의 매출이 매년 10배가 아니라 20배, 30배씩 성장하도록 만들기 위해 영업 최전선에서 최선을 다하고 있습니다. 그리고 실제로 많은 기업 고객들이 "이건 정말 생산성이 뛰어나서 우리 회사의 평소 조달 프로세스를 단축해서라도 빨리 도입하겠다"고 말합니다. 많은 기업이 이미 사용하던 일반적인 API를 판매하려고 했을 때보다, 기업들은 지금 훨씬 더 빠르게 움직이고 있습니다. Claude Code가 훨씬 더 압도적이고 매력적인 제품이기 때문입니다. ​ 하지만 이것이 세상의 모든 마찰을 없앨 만큼 무한하게 매력적인 제품인 것은 아닙니다. 저는 심지어 AGI나 강력한 AI, 혹은 데이터센터 안의 천재 국가조차도 무한하게 빠른 도입을 이끌어내지는 못할 것이라 생각합니다. 물론 매출 규모가 수천억 달러 단위에 달할 때조차 매년 3배, 5배, 10배의 초고속 성장을 이끌어낼 만큼 엄청난 제품이긴 하겠죠.

  4. 원문 구간 4

    이 정도 규모의 성장은 비즈니스 역사상 그 어떤 기업도 해내지 못한 극도로 어려운 일입니다. 하지만, 그럼에도 불구하고 현실 세계의 도입 속도가 '무한하게' 빠를 수는 없다는 뜻입니다. ​ *다시 오픈AI Chief Scientist, 야쿠브 파초키 인터뷰로 돌아옵니다. ​ 제이콥 에프론 : 제가 여러 기업들과 이야기를 나누다 보면, 요즘 가장 자주 나오는 질문 중 하나가 바로 이것입니다. “우리가 직접 강화학습까지 해야 합니까?”라는 질문입니다. 다시 말해, 오픈소스 모델을 가져온 뒤 사람들이 실제로 수행하는 특정 업무에 대한 자사 데이터를 적용하고, 그 위에 자체적인 강화학습까지 얹는 접근이 과연 필요한가를 묻는 것입니다. 많은 기업들은 자기 도메인에 대해 꽤 깊이 이해하고 있고, 내부적으로도 나름 잘 설계된 평가 체계를 갖추고 있습니다. ​ 이런 상황에서 과연 직접 강화학습을 수행하는 것이 타당한 선택인지, 아니면 모델들이 전반적인 작업 수행 능력을 계속 높여갈 때까지 일단 기다리는 편이 더 나은지 고민하는 경우가 많습니다. 결국 이 팟캐스트를 듣고 있을 많은 개발자분들도, 강화학습에 어느 정도의 자원과 조직적 노력을 실제로 투입해야 할지를 두고 고민하고 있을 것이라고 생각합니다. 그래서 이 부분에 대해 어떤 조언을 해주실지 궁금합니다.지 고심하고 있을 이 팟캐스트의 수많은 개발자들에게 어떤 조언을 들려주고 싶으신지 궁금합니다.

사실·구조In-context Learning주 대상 · 기술·제품 · In-context Learning관련 대상 · 산업·업종 · 기업용 AI

기업은 자체 강화학습과 맥락 제공을 어떻게 조합할 수 있는가

이 자료가 더한 내용

강화학습은 특정 작업 성능을 데이터 효율적으로 높일 수 있지만, 원하는 결과의 지침과 예시를 프롬프트 안에 넣어 모델이 맥락에서 적응하는 In-context Learning이 더 근본적인 학습 방식이 될 수 있다고 설명한다. 기업의 평가 기준과 좋은 데이터·예시 마련은 계속 필요하다고 덧붙인다.

근거 보기 2
  1. 원문 구간 1

    ​ 야쿠브 파초키 Jakub Pachocki : 강화학습은 특정한 작업에서 모델 성능을 실질적으로 끌어올리는 데 꽤 데이터 효율적인 방법이 될 수 있습니다. 다만 우리가 이미 알고 있는 방법들 가운데 이보다 훨씬 더 데이터 효율적인 학습 방식이 있는데, 바로 In-context Learning(모델이 컨텍스트 내에서 모델이 스스로 맥락을 학습하고 답하는 것)입니다. 아마 앞으로 사람들이 이런 모델을 가르치는 가장 근본적인 방식도 여기에 가까워질 것이라고 생각합니다. 결국 원하는 결과물이 무엇인지에 대한 지침과 예시를 프롬프트 안에 넣어주기만 해도 모델이 그 방향으로 학습하고 적응할 수 있기 때문입니다. ​ 그리고 저는 시간이 갈수록 이 In-context Learning 자체도 훨씬 더 정교하고 강력해질 것이라고 보고 있습니다. 그래서 앞으로는 모델이 주어진 컨텍스트 안에서 얼마나 많은 데이터와 지식을 끌어내 활용할 수 있는지가 매우 중요해질 것이라고 생각합니다. 모델은 사용자가 중요하게 여기는 특정한 종류의 작업에 점점 더 잘 스스로를 맞춰갈 수 있게 될 것이고, 이런 적응 능력은 앞으로 핵심적인 경쟁력이 될 가능성이 큽니다. ​ 그런 점에서 보면, 기업들이 지금의 모델 학습 파이프라인을 거의 그대로 복제해서 직접 강화학습 시스템까지 구축하는 것이 과연 최선의 방향인지는 아직 확신하기 어렵습니다.

  2. 원문 구간 2

    다만 이 문제는 분명 저희도 매우 중요하게 보고 있고, 내부적으로도 깊이 고민하고 있는 주제 중 하나입니다. ​ 제이콥 에프론 : 결국 핵심은, 해야 할 일 자체가 사라지는 것은 아니라는 뜻으로 들립니다. 다시 말해 어떤 평가 기준이 정말 중요한지 정의하고, 좋은 데이터와 예시를 직접 모으는 작업은 앞으로도 여전히 필요하다는 것입니다. 다만 앞으로는 그 정보를 바탕으로 기업이 직접 모델을 새로 만들거나, 모델 자체를 수정하는 데까지 나아가기보다는, 그렇게 축적한 정보들을 모델의 컨텍스트 안에 효과적으로 넣어주는 쪽이 훨씬 더 좋은 결과를 내는 방향으로 발전할 가능성이 크다는 말씀이시군요. ​ 야쿠브 파초키 Jakub Pachocki : 네네, 그 방향이 꽤 타당하다고 생각합니다. ​ 제이콥 에프론 : Codex가 성공을 거두면서, 많은 분들이 이제 법률, 금융, 의료 같은 각자의 전문 도메인에서도 이런 모델을 본격적으로 활용하고 싶어 할 것 같습니다. 그렇다면 여기서 자연스럽게 생기는 질문이 있습니다. 각 도메인에 맞는 도구를 제대로 쓰려면 기업이나 개발자가 자체적으로 하네스까지 직접 구현해야 하는 것인지, 아니면 거대 모델을 그대로 가져와서 필요한 정보와 지침만 컨텍스트 안에 넣어 활용하는 방식으로도 충분한 것인지 궁금합니다. ​ 야쿠브 파초키 Jakub Pachocki : 글쎄요.

사실·구조AI 에이전트 실행 환경주 대상 · 기술·제품 · AI 에이전트

긴 호흡의 작업을 하려면 어떤 실행 환경이 필요한가

이 자료가 더한 내용

긴 작업을 위해서는 모델이 자기 작업을 점검하고 지속적인 상태를 유지하며 파일·도구·권한·메모리·컴퓨트에 연결된 런타임 안에서 일해야 한다는 해석을 제시한다. 범용 실행 환경이 갖춰지면 도메인별 하네스 구축은 장기 핵심 제약이 아닐 수 있다는 발언과 연결한다.

근거 보기 6
  1. 원문 구간 1

    저는 하네스를 직접 만들고 구현하는 일 자체가 앞으로 오랫동안 핵심 제약으로 남지는 않을 것이라고 생각합니다. 사람들이 머지않아 훨씬 더 범용적인 실행 환경을 갖게 될 것이고, 그 환경 안에서 다양한 도메인의 작업을 폭넓게 수행할 수 있게 될 것이라고 보기 때문입니다. ​ 실제로 코딩이 아닌 다른 작업에 Codex를 써보더라도 이미 꽤 잘 작동한다는 점을 확인할 수 있습니다. 그래서 장기적으로는 특정 도메인마다 완전히 별도의 하네스를 일일이 새로 구축해야 한다기보다는, 보다 일반적인 환경 위에서 모델을 활용하는 방향으로 점점 더 발전해 갈 가능성이 크다고 보고 있습니다. ​ *코멘트 → 여기서도 다리오 아모데이 인터뷰에서 드와르케시 파텔이 물었던 것을 제이콥 에프론이 물었습니다. LLM을 스케일링하면 뭐든지 할 수 있게 된다고 믿는다면서, 왜 특정 작업에 강화학습을 해서 데이터를 그때그때 추가해주어야 하는가?라는 질문입니다. 사실 여기에 야쿠브 파초키가 말하고 있는 것과 다리오 아모데이가 말한 것이 같은 의미입니다. ​ 이것에 대해서는 <주간전략보고 : 투자의 생각 (3월 30일~4월 3일)>자료 중 엔비디아 코멘트에서 요약 겸 개인적인 생각들로 다시 정리하기에 아모데이 인터뷰에서 중요했던 7가지 포인트를 정리드렸었는데요. 핵심은 두 가지입니다. ​ 3. 암기를 위한 것이 아닌, '일반화'를 위한 것

  2. 원문 구간 2

    강화학습 환경을 구축하는 이유도 특정 툴 사용법을 암기하게 하기 위해서가 아니라, 다양한 과제를 통해 모델이 일반화 능력을 획득하게 만들기 위해서입니다. 이 세상의 모든 데이터들을 LLM에게 넣고 사전훈련시켜서 LLM이 아는 도메인의 사이즈를 키우면 키울수록 창의력이 높아지며 이런저런 작업을 할 때에도 쉽게 일반화시켜 적용하는 보다 인간 같은 지능이 나오고 있습니다. GPT-1에서 부족했던 것도 ②③의 부족이었습니다. 데이터의 규모를 훨씬 키우고 규모만 키우는 게 아니라 여러 데이터들을 commoncrawl, reddit으로 넣었더니 이 세상에 대해서 더 잘 이해하게 됐습니다. ​ 강화학습도 마찬가지입니다. 일반화된 능력을 얻으려면 각종 능력들에 대해서 다루는 방법을 가르치고, 가르치면 가르칠수록 새로운 것을 배울 때 더 높은 지능을 가지고 배우는 데이터 샘플 효율성이 높아지고 있는 것입니다. 마치 백지상태인 사람에게 게임을 처음에 가르칠 때에는 어렵지만, RTS, 보드게임, MMORPG 등등 여러 가지 종류들도 다르고 장르도 다른 것들을 가르치고 나면 새로운 게임을 할 때에는 이전 게임에서 배웠던 패턴을 적용해가면서 보다 쉽게 배우는 것과도 같습니다. 따라서 LLM에서 보였던 것처럼 강화학습에서도 비슷한 일반화 능력이 길러지고 있다는 것이 아모데이의 생각입니다. ​ 4. In-context Learning + Computer Use 조합으로도 AGI는 가능하다

  3. 원문 구간 3

    사전훈련과 강화학습을 통해서 폭넓은 지식(양, 퀄리티, 분포측면)을 주입하고, 여기에 컨텍스트 윈도우를 크게 키우는 In-context Learning + AI가 컴퓨터를 사용하는 방법을 다루는 Computer Use만 붙이더라도 실무 능력이 지금까지 좋아진 속도보다 훨씬 더 급격하게 상승할 것이라 전망했습니다. 시간이 지나면서 새로운 데이터를 학습하더라도 기존 학습 내용을 잊지 않도록 하는 Continual Learning 능력을 갖추기 위해 AI Labs들이 노력 중이고 1~2년 내에 해결할 가능성이 높지만, 이것을 해결하지 못하더라도 AGI 수준에는 도달할 수 있으며 그것자체로도 수조 달러의 경제적 가치를 만들 수 있을 거란 생각입니다. ​ *다시금 야쿠브 파초키 인터뷰로 돌아옵시다. 워낙 겹치는 부분이 많아서 흥미롭게 봤던 포인트들입니다. ​ 제이콥 에프론 : 각자의 사용 사례들마다 하네스가 달라져야 한다기보다는, 범용적으로 적응하게 되는 구간이 곧 올 거라는 거군요. ​ 야쿠브 파초키 Jakub Pachocki : 생각해보면, 우리가 앞으로 모델과 상호작용하게 될 궁극적인 인터페이스가 어떤 모습이어야 하는지 자체를 더 깊이 고민해볼 필요가 있다고 생각합니다. 모델은 일종의 고유한 UI 특성을 가진 존재이기도 합니다. 필요하다면 스스로 인터페이스를 만들어낼 수도 있고, 사람이 직접 처리하려면 시간이 많이 걸리는 작업도 상당 부분 대신 수행할 수 있습니다.

  4. 원문 구간 4

    ​ 그렇다면 모델이 정말 더 긴 단계의 작업을 안정적으로 수행하려면, 어떤 조건들이 갖춰져야 한다고 보시는지 궁금합니다. 결국 무엇이 더 발전해야 하고, 어떤 요소들이 충족되어야 지금보다 훨씬 긴 호흡의 과업도 제대로 처리할 수 있게 되는지 설명해 주시면 좋겠습니다. ​ 야쿠브 파초키 Jakub Pachocki : 제 개인적인 생각으로는, 그런 전망의 상당 부분은 사실 이미 지나온 발전 경로를 바탕으로 말씀드릴 수 있는 내용이라고 봅니다. 이제는 그 변화의 구체적인 형태가 점점 더 눈에 보이기 시작하고 있습니다. 결국 핵심은 모델이 스스로 지금 작업을 제대로 수행하고 있는지를 판단할 수 있을 만큼 충분히 똑똑해지느냐에 달려 있다고 생각합니다. ​ 동시에 이것은 매우 실무적인 조건들과도 연결됩니다. 모델이 실제 작업을 수행하는 데 필요한 모든 컨텍스트와 파일, 그리고 각종 인프라에 제대로 접근할 수 있어야 합니다. 다시 말해, 지능 자체의 문제만이 아니라 실제로 일을 해낼 수 있는 작업 환경이 함께 갖춰져야 한다는 뜻입니다. 예전에 강화학습 로드맵을 논의할 때도, 저는 모델이 자신이 생성한 토큰을 바탕으로 다시 추론하도록 가르치는 일을 가장 중요한 우선순위 중 하나로 봤습니다. 그것이 장기 과제를 수행하는 능력으로 이어지는 핵심적인 출발점이라고 생각했기 때문입니다.

  5. 원문 구간 5

    ​ 물론 어느 시점에 가면 모델은 단순히 텍스트만 다루는 것을 넘어, 런타임 환경 자체를 하나의 도구로 활용할 수 있어야 합니다. 당연히 시각적 정보를 이해하도록 가르쳐야 하고, 더 나아가 언젠가는 물리적인 몸체를 사용하는 법도 익혀야 할 것입니다. 제 생각에는 지금 우리는 이미 모델이 환경과 상호작용하고, 세상을 직접 보고 이해할 수 있어야 하는 단계에 꽤 깊이 들어와 있습니다. 그리고 머지않은 시점에는 로봇 문제 역시 훨씬 더 진지하게 다루게 될 것이라고 생각합니다. ​ *코멘트 → 모델이 장기적인 업무를 수행할 수 없는 이유는, 단순히 모델의 지능이 떨어져서가 아니라 모델이 모델이 자기 작업을 점검할 수 있어야 하고, 지속적인 상태(state)를 유지해야 하며, 파일, 툴, 권한, 메모리, 컴퓨트에 연결된 실행 환경(runtime) 안에서 일해야 하기 때문입니다. 이러한 맥락에서 2026년 2월에 발표했던 OpenAI-AWS의 Stateful runtime 환경에서의 Frontier 제품 발표는 이제는 인프라 레이어에서 이러한 문제를 풀겠다는 계획입니다. 오픈AI의 엔터프라이즈AI 제품인 Frontier는 공유된 비즈니스 컨텍스트, 에이전트 실행, 평가 및 최적화, 거버넌스를 갖춘 엔터프라이즈 에이전트 플랫폼으로 소개됐고 + AWS와 공동 개발 중인 Stateful Runtime은 컨텍스트 유지, 이전 작업 기억, 도구 및 데이터 소스 작업, 컴퓨트 접근을 지원하는 구조로 설명됐습니다.

  6. 원문 구간 6

    ​ *코멘트 → 개인적으로 Agentic AI가 완성되고 나서야 Physical AI로 넘어갈 것이라 느끼는 이유는, 구조적으로 보면 이러한 stateful runtime 인프라 작업들이 로봇 이전 단계의 필수 레이어이기 때문입니다. 먼저 자아 역할을 해줄 상태를 유지하는 소프트웨어 실행체가 필요하고, 그다음에 두뇌 역할을 해줄 월드모델, 여기에 눈, 코, 입, 귀, 피부 역할을 해줄 시각과 센서가 붙으면 마지막에 물리적 액션이 움직이는 순서라고 봅니다. AI는 스스로 생각하는가? First Proof 챌린지, 2016~2017년부터 이어져온 ML의 법칙 ​ 제이콥 에프론 : 이제 여러분이 추진해 온 '과학을 위한 AI'에 대해 이야기해보고 싶습니다. 코딩 분야는 누구나 직접 체감하고 있습니다. 많은 기업들이 이미 이런 도구를 활용해 상당한 생산성 향상을 경험하고 있습니다. 반면 수학 분야의 진전은 의미가 크더라도, 대부분의 사람들은 국제수학올림피아드 같은 문제를 직접 다뤄본 적이 없기 때문에 그 돌파구가 얼마나 중요한지 직관적으로 느끼기 어려울 수 있습니다. ​ 그런 점에서, 여러분이 진행한 연구 가운데 'First Proof'와 관련된 성과는 특히 흥미롭다고 생각합니다. 이 문제는 전통적인 경시 수학과도 꽤 다른 성격을 가지고 있는 것으로 보입니다.

해석·전망AI가 돕는 AI 연구주 대상 · 기업·종목 · OpenAI관련 대상 · 기술·제품 · AI 연구 자동화

모델이 연구 과정에 들어오면서 연구 조직은 무엇을 바꾸게 되는가

이 자료가 더한 내용

파초키는 내부 GPT-5 Pro 계열에서 의미 있는 아이디어가 나온 사례가 있지만 아직 초기 단계라고 평가했다. 모델의 단기 품질이 연구 발전 속도를 좌우하고 연구 과정의 상당 부분을 맡게 될 수 있어, 연구 조직 운영과 컴퓨팅 자원 배분의 직관을 다시 구성해야 한다고 본다.

근거 보기 4
  1. 원문 구간 1

    실제로 연구를 진행하시다가 어느 날 테스트를 돌렸는데, 예상보다 훨씬 의미 있는 결과나 전혀 새로운 현상이 관측되는 순간들도 분명 있으실 것 같습니다. ​ 그렇다면 앞으로 특히 중요하게 보고 계신 이정표는 무엇인지 궁금합니다. 연구자로서 지금 가장 주의 깊게 지켜보고 있는 변화나 신호는 무엇인지, 또 어떤 지점에 도달했을 때 “이건 정말 의미 있는 진전이다”라고 판단하게 되는지 듣고 싶습니다. ​ 야쿠브 파초키 Jakub Pachocki : 제가 지금 가장 집중하고 있는 것은 결국 AI 연구원을 완성하는 문제라고 할 수 있습니다. 다시 말해, 모델이 스스로 새로운 사실을 발견할 수 있는지, 그리고 호흡이 긴 장기 연구 과제를 실제로 끝까지 수행해낼 수 있는지가 가장 중요한 관심사입니다. 저희가 내부적으로 사용하고 있는 GPT-5 Pro 계열 시스템들에서도 이미 작지 않지만 분명 의미 있는 아이디어가 나온 적은 있습니다. 실제로 어느 정도는 영향력이 있는 통찰을 준 사례들도 있었습니다. 다만 개인적으로 기대하고 있는 수준과 비교하면, 아직은 매우 초기 단계에 가깝다고 생각합니다. ​ 제이콥 에프론 : 지금 가장 앞선 모델들과 거의 연구 파트너에 가깝게 직접 상호작용하고 계신, 사실상 최초의 사람들 중 한 분이라고 할 수 있을 것 같습니다. 그래서 궁금한 것은, 이런 모델들과 함께 일하면서 “이렇게 상호작용해야 가장 잘 된다”라고 느끼게 된 방식이 따로 있는지입니다.

  2. 원문 구간 2

    그 과정에서 새롭게 깨달은 점도 분명 있으셨을 것 같습니다. ​ 아울러 모델이 계속 더 강력해진다면, 미래의 연구 조직 자체가 어떤 모습으로 바뀌게 될지에 대해서도 생각해보신 적이 있는지 궁금합니다. 연구자와 모델의 역할 분담은 어떻게 달라질지, 그리고 연구팀의 일하는 방식은 어떤 방향으로 재편될 것이라고 보시는지도 함께 듣고 싶습니다. ​ 야쿠브 파초키 Jakub Pachocki : 지금 우리는 분명 거대한 전환점에 들어서고 있습니다. 이제는 모델의 단기적이고 즉각적인 품질 자체가 연구 발전 속도를 결정하는 매우 중요한 요인이 되어가고 있다고 봅니다. 앞으로는 연구 과정의 상당 부분을 모델이 실제로 담당하게 될 가능성이 크기 때문입니다. 그렇기 때문에 이는 연구 조직을 어떻게 운영해야 하는지에 대한 기존의 직관 자체를 다시 구성할 필요가 있다는 뜻이기도 합니다. ​ 아시다시피 보통은 눈앞의 즉각적인 성과나 품질에 지나치게 매달리지 않으려 하고, 더 장기적인 관점에 무게를 두려고 합니다. 오픈AI 내부에도 장기적으로 준비해 온 매우 흥미로운 프로젝트들이 많이 있습니다. 다만 지금은 그것들을 실제로 실행에 옮기고, 동시에 더 향상된 모델 지능을 활용해 AI 연구 자체를 가속화해야 한다는 강한 시급함을 느끼고 있습니다. 특히 AI 정렬 연구를 더 빠르게 진전시켜야 한다는 점에서 그 시급함의 정도가 매우 크다고 생각합니다.

  3. 원문 구간 3

    ​ 야쿠브 파초키 Jakub Pachocki : 해야 할 일이 워낙 많기 때문에, 컴퓨팅 자원을 어떻게 배분할지는 매우 복잡하고 여러 요소를 함께 고려해야 하는 문제입니다. 그 과정에서 저희가 하나의 원칙처럼 지키고 있는 기준이 있습니다. 바로 범용적인 모델 지능을 끌어올리는 데 가장 핵심적이라고 믿는, 그리고 가장 확장 가능하다(scalable)고 판단하는 방법들에 컴퓨팅 자원의 상당 부분을 의도적으로 배정하려고 한다는 점입니다. 이것이 언제나 모든 면에서 가장 효율적인 방식이라고 말할 수는 없지만, 그럼에도 중요한 원칙이라고 생각합니다. ​ 왜냐하면 하나의 실험이나 특정한 실험군에 막대한 컴퓨팅 자원을 투입하면, 그 자원의 일부를 다른 여러 시도에 나누어 써서 얻을 수 있었던 작지만 의미 있는 진전을 놓칠 수도 있기 때문입니다. 반대로 지금 진행 중인 온갖 흥미롭고 중요한 일들에 자원을 너무 잘게 쪼개어 배분하다 보면, 결국 모든 것을 조금씩만 건드린 채 정작 가장 중요하다고 믿는 핵심 과업을 끝까지 밀어붙이지 못하게 될 위험도 있습니다. ​ 그래서 결국 가장 먼저 확인해야 하는 것은 구체적인 경험적 증거입니다. 평가 체계가 제대로 작동하고 있는지, 실험이 충분히 엄밀하게 설계되어 있는지, 그리고 결과를 정말 신뢰할 수 있는지를 먼저 점검해야 합니다. 그다음에는 몇 가지 기준을 놓고 우선순위를 조정합니다.

  4. 원문 구간 4

    예를 들어 우리가 이 접근을 얼마나 명확하게 이해하고 있는지, 실제로 충분히 확장 가능한 방법인지, 앞으로 그 위에 더 많은 것을 쌓아 올릴 수 있는 토대가 되는지, 아니면 일회성 성과에 그칠 가능성이 큰지를 함께 따져보는 것입니다. 그리고 그런 판단을 바탕으로 최종적인 우선순위를 결정하게 됩니다.도에 불과한지 등을 따져보는 것입니다. 그리고 이러한 판단을 근거로 최종적인 우선순위를 결정합니다. ​ 제이콥 에프론 : 오픈AI의 Codex에도 매우 중요한 시기였지만, 동시에 시장에서는 여전히 앤스로픽의 Claude Code가 강한 존재감을 보이고 있는 것 같습니다. 그렇다면 앤스로픽이 이 분야에서 특히 성공할 수 있었던 이유를 당신은 어떻게 보고 계신지 궁금합니다. ​ 야쿠브 파초키 Jakub Pachocki : 결국 앤스로픽이 우세했던 이슈를 해석하자면, 기술의 다음 핵심 응용처가 어디가 될 것이라고 보느냐에 따라 제품의 방향성을 어디에 둘지가 결정된다고 생각합니다. 오픈AI의 내부적인 제품 우선순위를 돌아보면, 코딩 관련 제품도 분명 계속 개발해 왔지만 전체 우선순위 안에서는 어디까지나 상대적으로 부차적인 영역에 가까웠습니다. ​ 흥미로운 점은 이런 제품 우선순위가 오픈AI 내부 연구 조직의 우선순위를 그대로 반영하는 것은 아니라는 사실입니다. ChatGPT는 분명 폭발적인 성공을 거두었습니다.

해석·전망과학을 위한 AI주 대상 · 기술·제품 · 과학을 위한 AI

미공개 수학 문제와 과학 연구에서 모델의 의미 있는 진전은 무엇인가

이 자료가 더한 내용

First Proof는 수학자와 이론 컴퓨터 과학자가 일상 연구를 대표한다고 고른 미공개 문제로 모델을 시험한 벤치마크로 소개된다. 파초키는 작지만 의미 있는 아이디어가 여러 곳에서 나오기 시작했으며 과학자와의 협업을 통해 논문·성과로 이어질 수 있다고 전망하면서도 기술적 한계 논쟁은 계속될 것으로 본다.

근거 보기 5
  1. 원문 구간 1

    그래서 청취자분들을 위해 이 분야가 무엇인지 조금 더 풀어서 설명해 주시면 좋겠습니다. 그리고 모델이 이런 영역에서 인상적인 결과를 만들어낸다는 것이 왜 중요한지, 그것이 어떤 의미를 갖는지도 함께 듣고 싶습니다. ​ 야쿠브 파초키 Jakub Pachocki : 저도 First Proof 챌린지에 대해 굉장히 큰 기대를 가지고 있었습니다. 이 챌린지는 일종의 벤치마크인데, 저명한 수학자들과 이론 컴퓨터 과학자들이 자신들의 일상적인 연구를 잘 대표한다고 생각하는 문제들을 직접 공개한 형태였습니다. 무엇보다 이 문제들은 어디에도 발표된 적이 없는 미공개 문제였기 때문에, 우리 모델이 정말로 이런 문제를 풀 수 있는지를 시험해 보기에는 매우 좋은 기회였습니다. ​ 저희는 이 챌린지에 정말 큰 열정을 갖고 있었습니다. 다만 현실적으로는 사전 예고도 거의 없이 갑작스럽게 발표되었고, 실제로 대응할 수 있는 시간도 일주일밖에 주어지지 않았습니다. 당시 내부에서는 매우 흥미로운 모델 훈련이 진행 중이었는데, 그 훈련을 맡고 있던 리더 중 한 명인 James Lee가 해당 모델에 직접 수작업으로 프롬프트를 넣기 시작했습니다. 그리고 그 모델이 실제로 문제를 풀어가는 과정을 지켜보는 것은 정말 놀라운 경험이었습니다. ​ 특히 그 문제들 가운데 하나는 제가 박사 학위를 받았던 전공 분야와 직접 맞닿아 있는 문제였습니다.

  2. 원문 구간 2

    제가 그 문제를 1주일이나 2주일 정도 붙잡고 있다가 그런 아이디어를 떠올렸다면 스스로도 꽤 자랑스럽게 여겼을 만한 수준이었는데, 모델은 그에 가까운 아이디어를 단 1시간 만에 내놓았습니다. 그 장면을 보면서 정말 묘한 감정을 느꼈습니다. 예전에 Dota 봇이 끝없이 흥미로운 플레이를 만들어내는 모습을 볼 때와 비슷한 느낌이었습니다. ​ 원래 정상적인 세상에서는 그렇게 계속해서 놀라운 일이 끝도 없이 벌어지지는 않습니다. 그런데 그때는 마치 무언가 마법 같은 일이 일어나고 있다는 기분이 들었습니다. 그것도 수학처럼, 세상에서 정말 중요하고 앞으로 우리가 하게 될 많은 일의 전조가 될 수 있는 분야에서 그런 일이 벌어지는 것을 보면서 AI 발전 속도가 정말 엄청난 수준에 와 있다는 생각이 더욱 강해졌습니다. ​ 이제는 그다음 단계로 해당 분야의 전문가들을 직접 모셔서 그 증명들이 실제로 맞는지 틀린지를 검증받아야 하는 수준까지 와 있습니다. 하지만 코딩 같은 분야와 비교하면, 수학은 우리가 실제로 진전을 이뤘는지를 판단하기가 훨씬 더 수월한 편입니다. 물론 경쟁 프로그래밍처럼 평가가 명확한 영역도 있기는 합니다. 하지만 실제 세계의 프로그래밍은 대부분 그런 식으로 이루어지지 않습니다. 설계한 추상화가 적절한지, 다양한 예외 상황을 정말 제대로 다루고 있는지, 시스템 전체 맥락에서 그 구현이 타당한지 같은 훨씬 더 복잡한 문제들이 함께 얽혀 있기 때문입니다.

  3. 원문 구간 3

    ​ 제이콥 에프론 : 불과 1년 전만 해도, 이런 모델은 결국 패턴 매칭기에 불과하다는 비판이 꽤 흔했던 것 같습니다. 물론 지금도 그런 시각이 완전히 사라진 것은 아니지만, 적어도 예전만큼 강하게 받아들여지지는 않는 것 같습니다. 당시에는 AI가 과학에 실질적으로 기여하려면 새로운 아이디어를 내놓거나, 적어도 기존에 없던 독창적인 무언가를 만들어낼 수 있어야 하는데, 단순한 패턴 매칭만으로는 그것이 불가능하다고 보는 견해가 많았습니다. ​ 그런데 지금까지의 흐름을 보면, 우리는 그런 고정관념을 계속해서 하나씩 깨 나가고 있는 것처럼 보입니다. 그렇다면 이제는 그런 주장이 근본적으로 잘못된 것이었다는 점을 점점 더 분명하게 입증해 가는 단계에 가까워지고 있다고 보시는지 궁금합니다. ​ 야쿠브 파초키 Jakub Pachocki : 패턴 매칭을 넘어서, '생각할 수 있는 시스템'이라고 생각합니다. 실제로 일정에 맞춰 작지만 분명한 진전들이 하나씩 나타나기 시작하고 있습니다. 아직 모두가 깜짝 놀랄 만큼 거대한 돌파구만 연이어 나오고 있는 단계는 아닐 수 있습니다. 하지만 여러 곳에서 작지 않은 아이디어들이 계속 등장하고 있습니다. 앞으로는 과학자들과의 협업을 통해 꽤 큰 규모의 논문이나 성과로 이어지는 사례들도 충분히 나올 수 있다고 봅니다.

  4. 원문 구간 4

    ​ 그리고 조금 더 근본적으로 생각해보면, AlphaGo나 AlphaZero 같은 시스템을 단순히 패턴 매칭기라고 부를 수 있겠느냐는 질문도 중요합니다. 그런 시스템들은 각자의 환경 안에서 실제로 새로운 전략을 만들어냈습니다. 저희 모델 역시 마찬가지로, 단순히 기존 패턴을 반복하는 수준을 넘어 새로운 방식의 해법이나 아이디어를 만들어내는 방향으로 점점 나아가고 있다고 생각합니다. ​ 제이콥 에프론 : 패턴 매칭 시스템일 뿐이라는 생각에 대해서는 사실 2016~2017년 수준부터 이미 패턴 매칭기가 아님을 입증해왔는데, 최근까지도 그런 글들을 올라왔었다는 게 참 재밌는 포인트죠. ​ 야쿠브 파초키 Jakub Pachocki : 물론 언제든 이런 시스템의 기술적 한계를 지적할 수는 있습니다. 그리고 바로 그 점이 또 흥미로운 부분이기도 합니다. 예를 들어 AlphaGo도 특정한 전략 아래에서는 공략될 수 있었고, 저희의 Dota 봇들 역시 어떤 전략에는 실제로 약점을 드러내곤 했습니다. 앞으로도 한동안은 이런 모델을 어떻게 정의해야 하는지를 둘러싼 여러 논쟁이 계속 이어질 것이라고 봅니다. ​ 다만 그와는 별개로 이 모델들이 이미 상당한 수준의 능력을 갖추고 있으며, 그 능력을 바탕으로 실제로 새로운 것을 발견할 잠재력도 충분히 가지고 있다는 점은 분명합니다.

  5. 원문 구간 5

    아주 작은 게임 환경에서 출발해, 지금처럼 훨씬 더 일반적인 과학 연구에 가까운 단계까지 오는 데는 몇 년이 걸렸습니다. 그 과정에서는 사실상 인류가 축적해 온 방대한 지식에 가까이 다가가야 했고, 인간의 언어는 물론 그 이상의 여러 층위까지 학습해야 했습니다. ​ 그럼에도 제가 보기에는 그 밑바탕에 있는 기본 원리는 상당히 유사합니다. 결국 중요한 것은 시스템이 주어진 환경 안에서 의미 있는 구조를 학습하고 그것을 바탕으로 새로운 전략이나 새로운 해법을 만들어낼 수 있느냐는 점입니다. 그런 의미에서 지금 우리가 보고 있는 흐름은 이전의 사례들과 단절된 것이 아니라, 더 넓고 더 복잡한 세계로 확장된 연속선 위에 있다고 생각합니다. ​ 제이콥 에프론 : First Proof에서 처음으로 증명 결과가 나왔을 때, 사람들이 AI가 내놓은 해답을 두고 했던 평가가 기억에 남습니다. 많은 분들이 그 풀이를 보면서, 이것이 우아하고 현대적인 수학적 기법이라기보다는 오히려 19세기 수학처럼 계산을 많이 밀어붙이는 무차별 대입형 접근에 가깝게 느껴진다고 말했습니다. 이것이 모델이 본질적으로 작동하는 방식에서 비롯된 특징인지, 아니면 아직 넘어서지 못한 일종의 한계인지는 분명하지 않은 것 같습니다. 그런 평가를 들으셨을 때, 그것이 우려스럽게 느껴지셨는지, 아니면 오히려 하나의 흥미로운 신호처럼 보이셨는지 궁금합니다.

사실·구조OpenAI 연구 조직주 대상 · 기업·종목 · OpenAI

오픈AI는 연구와 확장을 어떤 기준으로 함께 운영하는가

이 자료가 더한 내용

오픈AI는 고품질 실험과 결과에 대한 정직함을 조직 원칙으로 두며, 좋은 아이디어를 연구하는 조직을 넘어 대규모 컴퓨팅 클러스터·인프라를 확보하고 스케일링의 과학을 정립하는 단계로 전환했다고 설명한다. 기초 연구도 실제 확장 가능성을 함께 평가하는 방식으로 본다.

근거 보기 3
  1. 원문 구간 1

    이런 상황에서 장기적인 연구 몰입과 단기적인 실행 압박 사이의 균형을 실제로 어떻게 운영하고 계신지 궁금합니다. 그리고 이 조직을 총괄하는 입장에서, 이런 균형을 잡는 올바른 방식에 대해 최근 생각이 달라진 부분이 있는지도 함께 듣고 싶습니다. ​ 야쿠브 파초키 Jakub Pachocki : 저희는 무엇보다도 고품질의 실험에 집중하려고 합니다. 그리고 우리가 실제로 진전을 이루고 있는지를 제대로 인식하려고 노력합니다. 결국 중요한 것은 결과를 두고 스스로에게 정직해지는 일이라고 생각합니다. 또 그런 정직함이 조직 안에서 자연스럽게 장려되도록 만드는 것도 매우 중요하다고 봅니다. 이런 기본 원칙은 지금도 달라지지 않았습니다. ​ 물론 앞으로 오픈AI의 연구는 여러 면에서 계속 진화해 갈 것입니다. 하지만 그와 별개로, 여전히 해야 할 일은 아주 많이 남아 있다고 생각합니다. 그래서 지금 진행 중인 모든 프로젝트를 무조건 서둘러 끝내야 한다고 보지는 않습니다. 다시 말해, 연구를 운영하는 데 있어 가장 근본적인 원칙들 자체는 크게 변하지 않는다는 뜻입니다. 다만 한 가지 분명히 달라진 점이 있다면, 우리가 가장 유망하다고 판단하는 것들을 실제 성과로 연결해 내야 한다는 절박함의 수준은 이전보다 훨씬 더 높아졌다는 점입니다.

  2. 원문 구간 2

    ​ 제이콥 에프론 : 지금까지의 시간을 되돌아보면, 당시에는 정말 판단이 쉽지 않았고 거의 51대 49처럼 아슬아슬한 선택이었지만, 결과적으로는 회사의 성격 자체를 규정하게 된 결정들도 분명 있었을 것 같습니다. 그런 순간들이 무엇이었는지 궁금합니다. 조금 더 넓게 보면, 지난 7~8년을 한 편의 영화처럼 되짚어 보았을 때 특히 강하게 기억에 남는 장면들이 있을 것 같습니다. 당신에게 결정적인 전환점처럼 남아 있는 순간들은 무엇이었는지 듣고 싶습니다. ​ 야쿠브 파초키 Jakub Pachocki : 오픈AI는 어느 시점부터, 더 이상 단순히 좋은 아이디어를 연구하는 조직에 머무를 수 없게 되었습니다. 이제는 대규모 컴퓨팅 클러스터를 직접 확보해야 했고, 실제로 모든 것을 확장하는 단계로 넘어가야 했습니다. 다시 말해 스케일링의 과학 자체를 정립하고, 그것을 뒷받침할 인프라까지 직접 구축해야 하는 국면에 들어선 것입니다. 저는 그것을 두 번째 단계, 즉 본격적인 확장의 시작이라고 생각합니다. 물론 앞으로도 다양한 기초 연구 아이디어를 계속 추구하겠지만, 이제는 그것이 실제로 확장 가능한지까지 함께 따져보며 평가하게 될 것입니다. ​ 그다음에는 앞서 말씀드린 또 하나의 흥미로운 시기가 있었습니다. 바로 ChatGPT가 엄청난 반향을 일으켰던 시점입니다.

  3. 원문 구간 3

    사실 저는 상황이 조금 다르게 전개될 것이라고 예상했습니다. 텍스트 모델이 이렇게 먼저 전면에 부상한 것은 개인적으로도 꽤 반가운 놀라움이었습니다. 저는 오히려 생성형 AI의 비디오 스타일 응용이 먼저 대중적으로 주목받고, 그 과정에서 장기적인 텍스트 중심 연구를 계속 밀고 갈지, 아니면 일정 부분 절충할지를 고민해야 하는 상황이 올 것이라고 생각했었습니다. ​ 하지만 저희는 이미, 눈앞에서 어떤 기술이 큰 인기를 끌더라도 그것만으로는 충분하지 않으며, 우리가 목표로 하는 지점에 도달하려면 그 기술이 훨씬 더 발전해야 한다는 사실이 만들어내는 긴장감을 어느 정도 예상하고 있었습니다. 한동안 저희는 바로 그런 단계에 있었습니다. 그리고 이제는 그다음 단계로 들어서고 있다고 생각합니다. 실제로 AGI를 배치하거나 혹은 경제적으로 매우 큰 변화를 일으킬 수 있는 모델들을 현실 세계에 본격적으로 보급하기 시작하는 단계에 가까워지고 있다고 보고 있습니다. ​ 제이콥 에프론 : 이제 인터뷰를 마무리하면서, 늘 마지막에 드리는 짧고 빠른 질문 몇 가지로 끝맺고 싶습니다. 앞에서 충분히 다루지 못했던 조금 더 넓은 주제들을 가볍게 짚어보는 질문들입니다. 그중 첫 번째로, 지난 1년 동안 AI 분야를 바라보는 당신의 생각이 달라진 점이 있다면 무엇인지 궁금합니다.

해석·전망AI 자동화의 사회적 과제주 대상 · 거시·정책 · AI 정책

지적 노동 자동화가 정책과 사회에 남기는 과제는 무엇인가

이 자료가 더한 내용

지적 노동이 자동화되면 일자리 문제와 부의 집중이 나타날 수 있고 정책 입안자의 실질적 개입이 필요하다고 본다. 정렬과 모니터링 가능성은 연구자만의 문제가 아니라 정책과 사회 전체가 더 많이 논의해야 할 과제라는 입장이다.

근거 보기 2
  1. 원문 구간 1

    장기적으로는 좋은 일일 수 있어도, 이 전환이 생각보다 매우 빠르게 일어날 수 있다는 점이 중요합니다. ​ 또 하나 중요한 문제는 권한과 통제의 집중입니다. 만약 실제로 자동화된 연구소나, 수많은 업무를 스스로 처리할 수 있는 자동화된 기업이 등장하게 된다면, 극소수의 사람들이 엄청난 영향력을 쥐게 될 수 있습니다. 그 파급력은 매우 클 것이고, 여기에 로봇까지 결합된다면 상황은 더욱 극적으로 바뀔 것입니다. 다만 꼭 로봇이 없어도 본질은 크게 다르지 않다고 생각합니다. 소수의 인원만으로도 막대한 힘을 행사할 수 있는 조직들이 등장할 수 있기 때문입니다. ​ 그래서 앞으로는 이런 새로운 형태의 강력한 조직과 시스템에 대해 어떤 거버넌스가 필요할지를 진지하게 고민해야 한다고 봅니다. 우리는 이런 존재들을 어떤 방식으로 바라보고, 어떤 원칙 아래에서 통제하고, 또 사회적으로 어떻게 받아들여야 할지를 새롭게 정의해야 하는 단계에 들어서고 있다고 생각합니다. ​ 제이콥 에프론 : 최근 제 마음속에 가장 크게 자리 잡고 있는 질문이 하나 있습니다. 얼마 전 아이를 갖게 되었는데, 그래서 10년 뒤 그 아이의 삶이 어떤 모습일지를 자주 생각하게 됩니다. 특히 당신은 이 분야를 누구보다 가까이에서 보고 계시기 때문에 더 궁금합니다.

  2. 원문 구간 2

    결국 모든 사람에게는 일종의 기초 교육처럼 기술에 대한 기본적인 이해가 계속 중요하게 남게 될 것입니다. ​ 제이콥 에프론 : 정말 흥미로운 시간이었습니다. 오늘 이렇게 함께해 주시고, 이렇게 다양한 주제에 대해 깊이 있는 이야기를 들려주셔서 진심으로 감사드립니다. 마지막으로 청취자분들께 전하고 싶은 말씀이 있다면 자유롭게 부탁드립니다. 지금 진행 중인 연구 이야기여도 좋고, 앞으로 기대하고 계신 제품이나 방향성에 대한 이야기여도 좋습니다. 혹은 꼭 짚고 넘어가고 싶은 메시지가 있다면 그것도 좋습니다. 편하게 말씀해 주시면 됩니다. ​ 야쿠브 파초키 Jakub Pachocki : 방금까지 이야기한 문제들, 그리고 정렬과 모니터링 가능성에 관한 질문들은 앞으로 더욱 시급한 과제가 될 것이라고 생각합니다. 그리고 이것은 결코 AI 연구자들만의 과제라고 보지 않습니다. 정책 입안자들의 과제이기도 하고, 더 넓게는 우리 사회 전체가 함께 진지하게 고민해야 할 문제라고 생각합니다. 그런 점에서 이런 주제에 대한 담론이 실제로 형성되기 시작하고 있다는 사실은 매우 반가운 일입니다. 다만 앞으로는 이런 논의가 지금보다 훨씬 더 많아져야 한다고 생각합니다. 큰 흐름 읽기 (Bird's-eye view)

3

시간흐름대로 모든 내용을 살려 정리

시간흐름대로 모든 내용을 살려 정리

1
자료의 성격과 인터뷰의 문제의식

[원문 유형] 네이버 프리미엄 콘텐츠
[채널] 올바른 미국주식 by SAPIENS
[게시일] 2026.04.15. 오후 7:57
[원문 URL] https://contents.premium.naver.com/sapiens/sapiensasset/contents/260415195746736ll
[제목] 오픈AI의 두뇌, 일리야의 후계자 야쿠브 파초키 : Spud 출시 직전, 대전략을 바꾸다
[수집 기준] 승인된 구독 열람권으로 실제 본문을 보존했다. 이미지·첨부는 별도 미디어 원장에 보관하며 시각적 의미 검토 여부를 구분한다.

[구독 원문 본문]
​

안녕하세요 올바른입니다.

​

AI 심화편 자료입니다. 이번 인터뷰는 2024년부터 오픈일리야 수츠케버를 이어 오픈AI의 각종 연구를 이끌어 온 수석과학자 야쿠브 파초키입니다. 여러 큰 방향성들을 들을 수 있습니다.

​

결정적인 방향들에서 최근 앤스로픽 CEO 다리오 아모데이가 말했던 방향성들과 같습니다. 경제적 확산까지 신경쓰기 시작한 것, Spud/Mythos와 연구 경쟁력, In-context Learning입니다.

​

따끈한 인터뷰에서 앤스로픽이 Claude Code에서 앞섰던 이유, 사전훈련과 강화학습의 조합, 스케일링 법칙에 대한 자신감 등 지금 가장 중요한 부분들만 담아봤습니다.

큰 흐름 읽기 (Bird's-eye view)

2026-03-27

2
관련 읽을거리와 목차

앤스로픽 CEO 다리오 아모데이 인터뷰 : "Extremely fast, but not infinitely fast" (바로가기)

2026-03-05

AI 사이클 한 눈에 보기, SemiAnalysis 인터뷰 : "거품은 없다. ARR $100B가 온다" (바로가기)

2025-12-17

AI 버블론을 잠재우는 숫자들 : 엔터프라이즈 AI $37B 시장의 현주소 (바로가기)

2025-10-08

오픈AI 퇴사자의 글 #1 : 2027년 AGI가 온다 (바로가기)

엔비디아 (NVDA)

2026-03-17

엔비디아 GTC 2026 : 7개의 칩, 5개의 랙 시스템, 그리고 하나의 AI 슈퍼컴퓨터 (바로가기)

2026-02-26

엔비디아 4Q25 실적발표 : 담백한 실적발표, 핵심은 모두 그린라이트 (바로가기)

2026-01-02

엔비디아가 $20B를 주고 데려온 남자 : Groq 창업자 조나단 로스의 통찰 (바로가기)

광학 (Optics)

2026-03-20

OFC 2026 : 광학이 중요해지고 있는 이유들, 태풍의 눈에 있는 두 가지 기업 분석 (바로가기)

2026-03-13

AI 인프라의 새로운 병목 '광학' : 앞으로의 2~3년 가파른 채택곡선 (트랜시버, OCS, CPO) (바로가기)

3
인터뷰의 세 갈래 쟁점

2026-03-06

비아비 솔루션스(VIAV) 기업분석 : 광학의 시대, 더 많은 테스트가 필요해 (바로가기)

메모리 (Memory)

2026-03-19

마이크론 1Q26 실적발표 : 흔들릴 이유가 없는 어닝서프라이즈, 구조적 성장주로 거듭나기 (바로가기)

2025-01-21

추론의 시대, 핵심이 된 메모리 : 메모리 쇼티지를 떠받치고 있는 힘 (바로가기)

2026-01-07

엔비디아 CES 2026 : Vera Rubin의 시대, ICMS가 불러올 메모리 지각변동 (바로가기)

네오클라우드 (Neocloud)

2026-02-22

네오클라우드 뜯어보기 #2 : 새로운 시대의 AI 계급도, 전력을 돈으로 바꾼 Powered Shell (바로가기)

2026-02-10

네오클라우드 뜯어보기 : GPU 임대의 경제학, 네오클라우드 BIG 4 비교분석 (바로가기)

투자자문 서비스에 따른 투자 시 원금 손실이 발생할 수 있으며, 투자 손익에 대한 책임은 전적으로 고객에게 귀속됩니다. 또한 과거의 투자수익이 미래의 수익률을 보장하지 않습니다.

​

신규 구독 전에, 아래 투자자문계약 권유문서의 계약 관련 제반 사항을 반드시 읽으시고 충분히 검토하시기 바랍니다.

​

*투자자문계약 권유문서 : https://naver.me/5ZST47Qf

4
야쿠브 파초키와의 대화 시작

목차

​

오픈AI 대전략이 바뀌었다 : 모델들이 즉각적으로 수익으로 연결되는 시대

Spud, Mythos의 시대 : 앤스로픽이 잘했던 것, AI가 AI를 연구하는 루프가 시작됐다

AI는 스스로 생각하는가? : First Proof 챌린지, 2016~2017년부터 이어져온 ML의 법칙

연구원들이 주도하는 새로운 질서 : AI Labs의 의미, 모델은 영향을 주기 직전까지 이론일 뿐이다

야쿠브 파초키 Jakub Pachocki

2026년 4월 9일, 오픈AI Chief Scientist

오픈AI 대전략이 바뀌었다

모델들이 즉각적으로 수익으로 연결되는 시대

*코멘트 → 최근에 올라온 인터뷰 자료 중에서 2026년 4월 2일, Alex Kantrowitz와 오픈AI 사장인 Greg Brockman과의 인터뷰도 있었습니다. 다만 Greg의 인터뷰는 단어들이 직관적이긴 한데 사업의 방향성을 이끌고 팀을 꾸리는 역할들을 맡은 리더라서, 현상태를 정의하기에는 좋은 인터뷰지만 '그 너머의 방향성에 대해서 힌트를 얻기'에는 날것의 정보들이 많이 없어서 자료화하진 않았었습니다. 반면, 이번 4월 9일에 올라온 오픈AI 수석과학자 야쿠브 파초키 인터뷰는 꽤 모호한 표현들처럼 보이지만 곱씹어보면 실무를 하는 연구자이기 때문에 현재 Tier 1 AI Labs에서 하고 있는 고민들에 대해서 힌트를 얻기에는 꽤 괜찮은 인터뷰였습니다.

5
연구 인턴과 자동화 연구원의 기준

​

제이콥 에프론 Jacob Effron : 현재 AI 생태계에서 많은 분들이 가장 궁금해하는 질문들을 여쭙기에, 당신만큼 적합한 분은 없다고 생각합니다. 지금 모델의 발전 과정에서 실제로 어떤 일들이 벌어지고 있는지 궁금해하는 분들이 매우 많습니다.

​

많은 기업들은 모델이 어떤 방향으로 변화하고 있는지를 바탕으로, 자신들의 서비스를 앞으로 어떻게 설계하고 구축해야 할지 고민하고 있습니다. 사회적으로도 AI가 과학과 사회 전반에 어떤 영향을 미칠지 깊이 생각하는 분들이 많습니다. 당신은 지난 수년간 거의 모든 세대의 기술적 진보가 이루어지는 현장을 직접 지켜보며 이 분야의 최전선에 서 계셨습니다. 그래서 이번 팟캐스트에 당신을 모시게 되어 매우 기쁘고, 또 큰 기대를 갖고 있습니다.

​

야쿠브 파초키 Jakub Pachocki : 초대해주셔서 감사합니다.

​

제이콥 에프론 : 가장 흥미로웠던 주제부터 먼저 여쭙고 싶습니다. 약 4개월 전, 당신과 오픈AI 팀은 2026년 9월까지 연구원 수준의 인턴 역량을 갖춘 시스템을 만드는 것을 목표로 하고 있다고 말씀하셨습니다. 그리고 2028년 3월까지는 훨씬 더 완전한 형태의 자동화된 AI 연구원을 목표로 하고 있다고도 하셨습니다. 이제 그 시점까지는 대략 6개월 정도 남아 있는 것으로 보입니다. 그래서 4개월이 지난 지금, 그 일정과 목표를 어떻게 보고 계신지 궁금합니다.

6
코딩 도구가 바꾼 내부 작업

​

야쿠브 파초키 Jakub Pachocki : 네, 지난 몇 달 동안 실제로 가장 크게 느낀 변화 중 하나는 코딩 도구가 폭발적으로 발전했다는 점입니다. 오픈AI 내부에서도 이제는 분명히 실제 코딩 작업의 상당 부분을 Codex로 수행하는 단계에 들어섰습니다. 대부분의 사람들에게 프로그래밍이라는 일 자체가 예전과는 꽤 다르게 바뀌고 있다고 생각합니다. 코딩뿐만 아니라 AI가 생산성에 기여하는 큰 방향에서는 무언가가 계획대로 잘 진행되고 있다는 분명한 신호로 보고 있습니다.

​

그리고 지난 몇 달 동안 개인적으로 또 매우 흥미롭게 본 변화는 수학 연구 역량이 크게 개선된 것입니다. 물리학이나 그 밖의 다른 분야에서 확인한 결과들도 마찬가지입니다. 일정 수준 이상의 역량과 통찰을 만들어내는 능력은 결국 인프라에 대한 접근성, 그리고 아마 지금의 코딩 도구들이 보여주듯 추론 시점에 더 많은 연산 자원을 투입할 수 있는 능력과 결합되면서 더 강해질 것이라고 보고 있습니다.

​

저는 앞으로 몇 달 안에 범용 지능 측면에서도 상당히 강한 개선이 나타날 것으로 기대하고 있습니다. 저희가 지금도 매우 촘촘하게 계획을 세우고 있고, 높은 집중도를 유지하며 밀어붙이고 있는 부분이기도 합니다.

​

제이콥 에프론 : 그리고 목표한 수준에 도달했다는 것을 어떻게 알 수 있습니까? 이를테면, 우리가 이제 연구 인턴 수준의 역량을 확보했다고 판단하기 위해 당신이 살펴보는 작업 흐름 같은 것이 무엇인지 궁금합니다.

7
자율성의 지속시간과 과제의 구체성

​

야쿠브 파초키 Jakub Pachocki : 제가 연구 인턴 수준의 AI와 완전히 자동화된 연구원 수준의 AI를 구분할 때 가장 중요하게 보는 기준은, 시스템이 얼마나 오랫동안 자율적으로 작동할 수 있는지, 그리고 주어지는 과제가 얼마나 구체적인지입니다. 그래서 지금 단계에서 시스템에 단순히 "모델 성능을 개선해라"라든지 "정렬 문제를 해결해라"처럼 매우 큰 목표만 던져주고, 그것을 스스로 끝까지 해내기를 기대하는 것은 아닙니다. 적어도 올해 안에는 그렇습니다. 언젠가는 그런 지점에 도달할 수 있다고 생각하지만, 지금은 훨씬 더 구체적인 기술적 아이디어가 중요하다고 보고 있습니다.

​

예를 들어 모델을 어떻게 개선할지에 대한 특정한 아이디어가 있다든지, 평가를 지금과는 다른 방식으로 수행하는 방법이 있다든지 하는 식의 보다 명확한 문제 설정이 필요하다는 뜻입니다. 제 생각에는 그런 방향으로 가기 위해 필요한 핵심 요소들은 이미 대부분 갖춰져 있습니다. 이제 남은 것은 그 요소들을 하나의 시스템으로 잘 통합해내는 일이라고 보고 있습니다.

​

*코멘트 → 야쿠브 파초키가 정리한 말은, 적어도 당장의 목표가 아무 말 없이 알아서 과학을 혁신하는 AI는 아니라는 점입니다. 더 현실적으로 보고 있는 가까운 목표는, 명확하게 정의된 과제를 꽤 오랫동안 자율적으로 수행할 수 있는 연구 인턴 수준의 시스템입니다. 핵심은 실무적으로 자율성의 지속시간과 과제의 명확성을 강화하는 것입니다.

8
수학·코딩을 평가 축으로 삼는 이유

수학과 코딩은 그럴듯하게 말하는 실력만 늘어난 건지, 아니면 실제로 뭔가를 이해하고 있는 것인지를 판단하기에 좋은 지표입니다. 소프트웨어 엔지니어들부터 채택이 늘어나는 이유도 이들은 즉각즉가 한 주에 몇 주의 코드를 썼고 얼마나 기여했는가가 객관적인 지표로 보이기 때문입니다. 보통의 사무직은 당장 얼마의 돈을 썼는지만 보이고, 생산성이 얼마나 늘었는가는 느끼기가 어려운데 개발자들은 생산성이 늘어난 것이 정량적으로 평가됩니다.

​

*코멘트 → AI 연구원 수준은 구체적인 업무를 잘 수행하는가의 단편적인 능력만 갖고 평가합니다. 예를 들자면 명확히 정의된 실험 목표를 받고, 관련 코드베이스를 읽고, 실험을 설정하고, 결과를 수집하고, 실패 로그를 해석하고, 몇 번의 수정과 재실행을 거쳐 의미 있는 개선안을 제안하는 것입니다. 여기서 더 나아가서 '완전히 자동화된 AI 연구원'으로 넘어가면 판단이 붙습니다. 무엇이 중요한 문제인지 스스로 판단하고, 어떤 가설이 유망한지 고르고, 평가 기준 자체를 정의하고, 애매한 결과를 해석하며, 다음 연구 방향을 독립적으로 설계해야 합니다. 닫힌 문제를 푸는 연구원 단계를 넘어서서 → 열린 문제에 대해서 정의할 수 있는 주체로 넘어갈 수 있느냐가 중요한 포인트입니다.

​

제이콥 에프론 : 안드레 카파시가 이와 관련해 꽤 화제가 된 사례를 공개한 적이 있습니다. 당신들이 여기서 구축하고 있는 시스템에 비하면 훨씬 단순한 모델이기는 했지만, 그 역시 이런 모델들을 활용해 자신의 모델을 개선하는 과정을 보여주었습니다.

9
카파시 사례와 자율성의 방향

그래서 궁금한 것은 당신이 보시기에 그런 접근이 전반적으로 앞으로 이런 도구들이 발전해 갈 방향과 맞닿아 있다고 느끼셨는지입니다.

​

야쿠브 파초키 Jakub Pachocki : 네, 저는 그런 방향성이 맞다고 생각합니다. 현재의 Codex 수준에서 출발해 앞으로도 꽤 연속적이고 꾸준한 진화가 이어질 것으로 보고 있습니다. 결국 더 높은 수준의 자율성을 갖추고, 더 긴 시간 동안 스스로 작동할 수 있는 방향으로 발전하게 될 것이라고 생각합니다. 앞으로는 이런 종류의 활용 사례를 훨씬 더 많이 보게 될 것입니다. 전반적으로 다양한 작업 영역에서 모델들이 지금보다 훨씬 더 자율적으로 움직이고, 동시에 더 많은 컴퓨팅 자원을 활용하는 모습이 점점 일반화될 것이라고 보고 있습니다.

​

제이콥 에프론 : 방금 수학과 물리학 쪽 이야기도 언급해 주셨는데, 오픈AI는 실제로 수학 분야에서 상당히 인상적인 돌파구를 여러 차례 보여준 바 있습니다. 특히 각종 경진대회 문제나 고난도 문제를 푸는 과정에서 그런 진전이 분명하게 드러났다고 생각합니다.

​

아마 청취자분들 입장에서는, 코딩 능력의 발전이 AI 연구를 직접적으로 어떻게 돕는지는 비교적 직관적으로 이해하실 수 있을 것 같습니다. 예를 들어 코드를 더 잘 쓰고, 실험을 더 빠르게 돌리고, 연구 생산성을 높이는 방식으로 바로 연결되기 때문입니다. 그렇다면 수학과 물리학에서의 발전은 이런 흐름과 구체적으로 어떻게 연결된다고 보시는지 궁금합니다.

10
수학 벤치마크의 북극성 역할

​

야쿠브 파초키 Jakub Pachocki : 수학 벤치마크에 집중해 온 가장 큰 이유는, 그것이 이 기술을 어디까지 발전시켜야 하는지를 보여주는 매우 좋은 기준이자 일종의 북극성 역할을 해왔기 때문입니다. 수학은 무엇보다 측정이 매우 쉽습니다. 문제를 실제로 풀었는지 아닌지를 판별하는 일은, 예를 들어 훌륭한 소프트웨어를 만들었는지를 평가하는 것보다 훨씬 명확합니다. 동시에 문제의 난이도는 매우 높게 설정할 수 있습니다. 즉, 정답 여부는 분명하지만 실제 해결은 얼마든지 어렵게 만들 수 있는 과제라는 뜻입니다.

​

얼마 전까지만 해도 제 생각은 이랬습니다. 우리 모델은 아직 간단한 수학 문제조차 제대로 풀지 못할 수 있다는 것이었습니다. 그런데 이후에는, 충분히 쉬운 문제는 풀 수 있지만 국제수학올림피아드, 즉 IMO 수준의 문제는 아직 풀지 못한다는 쪽으로 관점이 바뀌었습니다. 다시 말해 이 모델들의 지능 수준에는 분명한 간극이 있었고, 수학은 그 간극을 아주 명확하게 측정하고 도전할 수 있는 목표였습니다. 무엇을 개선해야 하는지도 비교적 분명했습니다. 그래서 수학은 추론 모델을 발전시키는 과정에서 일종의 북극성 같은 역할을 해왔습니다.

​

물론 지금은 상황이 꽤 달라졌습니다. 저희는 그동안 주요 이정표로 삼아왔던 IMO 수준, 이를테면 IMO 6번 문제를 푸는 단계에서 더 나아가 연구 수준의 수학으로 향하는 구간에 어느 정도 도달해가고 있습니다.

11
수학 추론과 연구 역량의 전이

이런 시점에서도 수학을 통해 발전 속도를 계속 측정하는 것은 여전히 분명한 의미가 있다고 생각합니다. 그리고 수학적 추론 능력의 향상이 실제 AI 연구 역량의 향상으로 이어지는 전이 효과도 분명히 존재한다고 봅니다. 실제로 저희의 뛰어난 연구원들 중 상당수는 수학 훈련을 받았거나 다른 이론 중심 분야 출신입니다.

​

다만 이제는 이런 목표를 바라보는 방식 자체가 크게 바뀌고 있습니다. 저희는 다음 세대 모델이 현실 세계에서 실제로 어떻게 유용하게 쓰일 수 있을지에 훨씬 더 집중하고 있습니다. 여기에는 연구 분야는 물론이고, 경제적 가치가 큰 여러 활동들, 그리고 다양한 과학 분야가 포함됩니다. 그중에서도 특히 응용 과학 분야에서의 활용 가능성에 많은 관심을 두고 있습니다.

​

이런 변화가 생긴 이유는, 모델이 아직 모든 면에서 사람만큼 똑똑하지 않더라도 이제는 실제 경제를 바꾸고 일하는 방식을 바꿀 수 있을 만큼 충분한 역량에 가까워졌다고 보기 때문입니다. 그래서 저희는 이 지점에 대해 상당한 시급함을 갖고 접근하고 있습니다.

​

*코멘트 → 이제는 당장의 다음 세대 모델을 통해 경제적으로 달성할 수 있는 성과(ARR)의 크기를 키우기 위해서 제품 개발에 힘쓰는 것도 중요해졌음을 말하고 있습니다. 오픈AI 연구용 컴퓨팅 할당의 중심이 약간 바뀌었음을 말한 내용이었습니다. 이전까지는 새로운 모델을 발표할 때마다 벤치마크 점수를 기준으로 사람들을 놀래키기 위해서 노력해왔었다면, 이제는 실전에 투입하여 경제 활동과 과학적 생산성을 어디까지 끌어올릴 수 있느냐가 우선순위가 되고 있습니다.

12
검증 가능한 어려운 문제의 가치

​

제이콥 에프론 : 저 역시 초기에는 수학처럼, 풀기는 매우 어렵지만 맞았는지 틀렸는지는 비교적 쉽게 검증할 수 있는 분야를 택하는 것이 가장 적절한 출발점이었다고 생각합니다. 그리고 코딩도 본질적으로는 이런 특성을 상당 부분 공유한다고 봅니다. 결과를 확인하고 검증할 수 있으며, 그렇기 때문에 강화학습을 적용하기에도 매우 좋은 영역입니다.

​

많은 분들이 지금 궁금해하는 핵심 질문도 바로 여기 있다고 생각합니다.

​

우리는 이미 검증이 비교적 쉬운 이런 분야들에서는 강화학습이 놀라울 정도로 잘 작동하는 모습을 봐왔습니다. 그렇다면 이제 다음 질문이 생깁니다. 세상에서 경제적으로/사회적으로 가치 있는 일들 가운데는 의학, 법률, 금융처럼 어느 정도는 검증이 가능하지만, 수학이나 코드만큼 명확하게 정답을 가릴 수는 없는 영역들이 많습니다. 과연 이런 분야들에서도 우리가 비슷한 형태의 발전 경로를 보게 될 것인가 하는 점입니다.

​

야쿠브 파초키 Jakub Pachocki : 수학과 코딩을 넘어서는 작업들에서도 분명 상당한 수준의 발전이 나타날 것이라고 보고 있습니다. 오픈AI 내부에서 특히 흥미롭게 보고 있는 지점 중 하나는, 평가가 더 어려운 이런 일반적 작업들이 사실은 장기 과제와 많은 공통점을 갖고 있다는 점입니다.

​

예를 들어 수학이나 코딩처럼 문제 정의가 아주 명확한 작업이라 하더라도, 그것이 1년 가까이 매달려야 하는 장기 과제라면 이야기가 달라집니다.

13
장기 과제와 열린 문제의 차이

최종적으로 무엇이 성공인지는 비교적 분명할 수 있지만, 정작 첫날 무엇부터 해야 하는지는 상당히 열려 있는 문제이기 때문입니다.

​

이런 점에서 두 종류의 어려움이 결국 같은 축 위에 놓여 있다고 생각합니다. 그래서 이것이야말로 앞으로 이런 시스템들이 발전해 나갈 다음 개척지라고 보고 있습니다. 그리고 오픈AI가 이런 보다 일반적인 영역으로 강화학습을 확장해 나가는 과정에서도 꽤 고무적인 신호들을 이미 여러 차례 확인했다고 생각합니다. 동시에 이 방향의 노력은 앞으로 훨씬 더 크게 확장될 수 있고, 그 잠재력도 매우 크다고 보고 있습니다.

​

제이콥 에프론 : 다만 다른 분야로 가면, 무엇을 성공이라고 볼 것인지 자체를 정의하는 일이 오히려 가장 어려운 문제 중 하나처럼 보입니다. 코드나 수학에서는 작업이 단기적이든 장기적이든 적어도 정답이나 성공 기준이 비교적 분명한 편입니다. 하지만 그 밖의 영역에서는 그런 어려움이 훨씬 더 크게 나타날 것이라고 생각합니다.

​

예를 들어 법률이나 의료처럼 보다 현실적인 분야에서는, 단기 과제라고 하더라도 수천 번의 반복 실험을 돌려가며 그것이 정말 올바르게 수행되었는지를 판단하는 일이 훨씬 더 어렵습니다. 그리고 과제가 장기화될수록 그 난이도는 더 커질 것입니다.

​

그래서 궁금한 것은, 당신은 이런 연구 과제를 지금 어떻게 개념화하고 있는가 하는 점입니다.

14
일반 작업으로 넓히는 평가

수학이나 코드 밖의 다른 분야에서도 모델이 실제로 잘 작동하게 만들기 위해서는, 결국 어떤 문제들을 풀어야 하고 어떤 요소들을 새롭게 알아내야 한다고 보고 계신지 듣고 싶습니다.

​

야쿠브 파초키 Jakub Pachocki : 강화학습을 잠시 제외하고 보더라도, 아주 긴 컨텍스트를 요구하는 장기 과제에서 모델이 어떻게 발전하고 있는지는 이미 어느 정도 확인할 수 있습니다. 모델이 사전훈련 단계에서 순수한 지도학습만 거치더라도 만들어내는 결과의 일관성이 점점 높아지고 있습니다. 그 과정에서 모델은 올바른 중간 산출물이 어떤 모습이어야 하는지에 대한 감각도 점차 익혀가게 됩니다.

​

그래서 저는 강화학습의 규모를 지금보다 훨씬 더 크게 늘리지 않더라도, 시간이 지나면서 모델이 감당할 수 있는 작업의 시간적 범위는 자연스럽게 계속 길어질 것이라고 생각합니다. 다시 말해, 더 긴 흐름의 과제를 붙잡고 일관되게 처리하는 능력 자체는 이미 점진적으로 좋아지고 있다는 뜻입니다.

​

물론 코딩이나 수학처럼 비교적 구조화된 영역에서 나온 강화학습 관련 아이디어들을, 보다 일반적이고 범용적인 작업으로 어떻게 확장하고 적용할 것인지는 분명 중요한 연구 과제입니다. 하지만 저는 이 부분에 대해서도 전반적으로는 상당히 낙관적으로 보고 있습니다.

​

제이콥 에프론 : 말씀을 듣다 보니, 모델이 적어도 외부에서 봤을 때는 충분히 신뢰할 수 있다고 여겨질 정도의 일정한 주기로 스스로 작업 진행 상황을 점검하고, 그에 맞춰 방향을 조정하는 체계도 어느 정도 구상하고 계신 것처럼 들립니다.

15
강화학습 일반화에 남은 질문

그 점이 특히 흥미로웠습니다. 다만 한편으로는, 우리가 아직 강화학습에서 진정한 의미의 보편적 일반화를 확실히 보고 있다고 말할 수 있는지는 완전히 분명하지 않은 것 같기도 합니다.

​

야쿠브 파초키 Jakub Pachocki : 아시다시피 오픈AI는 지금도 대규모로 컴퓨팅 자원을 확보하고 있습니다. 아직 확신이 완전히 서지 않은 부분들이 없는 것은 아니지만, 그럼에도 어떤 의미에서는 저희가 그 어느 때보다 스케일링의 힘을 강하게 믿고 있다고 말할 수 있습니다. 실제로 새로운 기술적 가능성과, 그것을 더 큰 규모로 확장할 수 있는 새로운 방법들이 계속 확인되고 있기 때문입니다. 이것이 지금 저희가 이 흐름을 바라보는 가장 핵심적인 관점입니다.

​

동시에 이제는 저희가 풀어야 할, 더 정확히 말하면 이 분야 전체가 함께 씨름해야 할 새로운 복잡성이 분명히 존재한다고 생각합니다. 왜냐하면 우리는 더 이상 현실 세계와 분리된, 마치 공중에 떠 있는 순수한 지능만을 만들고 있는 단계에 머물러 있지 않기 때문입니다. 예를 들어 이 모델이 실제로 의학 연구를 수행하게 하거나, 더 나아가 언젠가 암 치료에 기여하게 만들고 싶다면, 모델은 현실 세계에 대해 의미 있는 방식으로 학습할 수 있어야 합니다. 경우에 따라서는 직접 실험을 수행하고, 그 결과로부터 다시 배우는 과정까지 필요할 수 있습니다.

​

결국 이를 위해서는 모델을 현실 세계와 실제로 어떻게 연결할 것인지 알아내야 합니다.

16
스케일링에 대한 확신

그리고 그 과정에는 방금 말씀하신 방향과 맞닿아 있는 여러 종류의 작업이 분명 포함될 것입니다. 다만 저는 이런 변화가, 저희가 지금까지 해왔던 것처럼 비교적 단순한 알고리즘적 원리를 찾아내고 그것을 대규모로 확장해 나가는 기존의 스케일링 법칙과 충돌한다고 보지는 않습니다. 오히려 그 연장선 위에서, 이제는 모델이 현실과 상호작용하는 방식까지 함께 확장해야 하는 단계로 들어가고 있다고 보고 있습니다.

​

*코멘트 → 여기에서도 앤스로픽 CEO 다리오 아모데이가 말했던 생각들이 비슷하게 드러납니다. "Extremely fast, but not infinitely fast"의 본질입니다. 다리오가 말했던 것은 ⓐ모델 자체 능력의 기하급수적 발전 x ⓑ모델이 실제 경제 전반으로 확산되는 기하급수적 채택곡선이 존재한다는 것이었습니다.

​

이에 대해서 다리오의 원문을 한 번 더 끌어오면 이렇습니다.

​

다리오 아모데이 Dario Amodei : 저는 이 규모가 경제 전반으로 확대되더라도 여전히 상당히 빠른 속도를 유지할 것이라 확신합니다. 그래서 우리는 이 중간 세계(middle world)에 대해 생각해야 합니다. 변화가 극도로 빠르긴 하지만 마법처럼 즉각적이지는 않은 세상 말입니다.

​

앞서 말씀하신 경제적 확산의 속도, 시스템의 자체 루프 완성, 그리고 기업 내부의 까다로운 변화 관리 같은 현실적인 문제들 때문에 필연적으로 시간이 걸리는 세계죠.

17
현실 세계 연결의 과제

예를 들어 "아, 시스템 설정은 다 했는데 실제로 작동하게 하려면 사내 보안 권한을 전부 바꿔야 하네"라거나 "모델을 배포하기 전에 검수하는 오래된 레거시 소프트웨어가 있는데 이걸 다시 짜야 하네" 같은 문제들 말입니다. 물론 AI 모델이 그런 코딩도 다 해줄 수 있지만, 어쨌든 인간이 모델에게 그 일을 하라고 지시해야 하고 그 과정에는 톱니바퀴가 맞물려 돌아가는 물리적인 시간이 소요됩니다.

​

결론적으로 지금까지 우리가 목격한 모든 현상들은 두 개의 빠른 기하급수적 곡선이 존재한다는 사실과 일치합니다. 하나는 모델 자체 능력의 기하급수적 발전이고, 그 아래에 존재하는 또 다른 하나는 모델이 실제 경제 산업 전반으로 확산되는 기하급수적 속도입니다. 즉각적이지도 않고 느리지도 않지만, 과거 인류가 겪은 그 어떤 기술보다 훨씬 빠르며 동시에 나름의 물리적 한계도 가지고 있죠. 이것이 바로 제가 앤스로픽 내부의 실적과 우리 B2B 고객들을 보며 내린 결론입니다. 기업들의 채택은 엄청나게 빠르지만, 무한하게 빠른 것은 아닙니다.

​

저는 확산(diffusion)이 매우 현실적인 문제라고 생각하며, 이것이 전적으로 AI 모델의 기술적 한계와만 관련된 것은 아니라고 봅니다. 거듭 말씀드리지만, 확산이라는 단어를 유행어처럼 쓰면서 AI 혁신이 별거 아니라고 깎아내리는 사람들이 있는데, 제 말은 그런 뜻이 아닙니다.

18
빠르지만 무한히 빠르지는 않은 확산

저는 AI가 과거의 어떤 기술보다 훨씬 빠르게 확산될 것이라 생각하지만, 그 속도가 마법처럼 무한하게 빠르지는 않을 것이라는 점을 말씀드리는 겁니다.

​

Claude Code를 예로 들어보죠. Claude Code는 설정하기가 엄청나게 쉽습니다. 개발자라면 그냥 바로 쓰기 시작할 수 있죠. 대기업 개발자라고 해서 스타트업 개발자나 개인 개발자보다 Claude Code 도입을 늦춰야 할 하등의 이유가 없습니다. 그리고 우리는 도입을 촉진하기 위해 할 수 있는 모든 것을 합니다. 우리는 Claude Code를 기업에 판매합니다. 대형 금융사나 대형 제약사 같은 거대 기업들 모두, 일반적인 신기술을 도입할 때보다 훨씬 빠른 속도로 Claude Code를 도입하고 있습니다.

​

하지만 어쨌든 물리적인 시간이 걸립니다. Claude Code나 cowork 같은 특정 기능이나 제품은 트위터에 상주하는 얼리어답터 개인 개발자들이나 시리즈 A 단계의 스타트업들에게 가장 먼저 채택될 것입니다. 반면 식품 판매를 주업으로 하는 거대한 전통 대기업에 전사적으로 도입되기까지는 그보다 수개월이 더 걸리겠죠.

​

여기에는 여러 가지 요인이 있습니다. 법무 팀의 검토를 거쳐야 하고, 모든 직원이 쓸 수 있도록 사전 세팅(프로비저닝)을 해야 합니다. 보안 및 규제 준수 테스트도 통과해야 하죠. AI 혁신의 최전선에서 한발 떨어져 있는 대기업의 리더들은 물론 미래 지향적이긴 하지만, 스스로 납득하는 과정이 필요합니다.

19
Claude Code의 도입 경로

"아, 우리가 여기에 5천만 달러를 쓰는 게 타당하겠군. Claude Code라는 게 이런 거구나. 이게 우리 회사에 이런 도움이 되고 생산성을 이렇게 높여주는구나"라고 말이죠. 그러고 나면 그들은 두 직급 아래의 실무 관리자들에게 이를 설명해야 합니다. "자, 우리 회사에 3,000명의 개발자가 있는데, 이들에게 어떻게 배포할지 롤아웃 계획을 세워봅시다"라고 지시해야 합니다. 우리는 앤스로픽 내부에서 매일같이 고객들과 이런 대화를 나눕니다.

​

우리는 앤스로픽의 매출이 매년 10배가 아니라 20배, 30배씩 성장하도록 만들기 위해 영업 최전선에서 최선을 다하고 있습니다. 그리고 실제로 많은 기업 고객들이 "이건 정말 생산성이 뛰어나서 우리 회사의 평소 조달 프로세스를 단축해서라도 빨리 도입하겠다"고 말합니다. 많은 기업이 이미 사용하던 일반적인 API를 판매하려고 했을 때보다, 기업들은 지금 훨씬 더 빠르게 움직이고 있습니다. Claude Code가 훨씬 더 압도적이고 매력적인 제품이기 때문입니다.

​

하지만 이것이 세상의 모든 마찰을 없앨 만큼 무한하게 매력적인 제품인 것은 아닙니다. 저는 심지어 AGI나 강력한 AI, 혹은 데이터센터 안의 천재 국가조차도 무한하게 빠른 도입을 이끌어내지는 못할 것이라 생각합니다. 물론 매출 규모가 수천억 달러 단위에 달할 때조차 매년 3배, 5배, 10배의 초고속 성장을 이끌어낼 만큼 엄청난 제품이긴 하겠죠.

20
도입 속도와 사업화 규모의 제약

이 정도 규모의 성장은 비즈니스 역사상 그 어떤 기업도 해내지 못한 극도로 어려운 일입니다. 하지만, 그럼에도 불구하고 현실 세계의 도입 속도가 '무한하게' 빠를 수는 없다는 뜻입니다.

​

*다시 오픈AI Chief Scientist, 야쿠브 파초키 인터뷰로 돌아옵니다.

​

제이콥 에프론 : 제가 여러 기업들과 이야기를 나누다 보면, 요즘 가장 자주 나오는 질문 중 하나가 바로 이것입니다. “우리가 직접 강화학습까지 해야 합니까?”라는 질문입니다. 다시 말해, 오픈소스 모델을 가져온 뒤 사람들이 실제로 수행하는 특정 업무에 대한 자사 데이터를 적용하고, 그 위에 자체적인 강화학습까지 얹는 접근이 과연 필요한가를 묻는 것입니다. 많은 기업들은 자기 도메인에 대해 꽤 깊이 이해하고 있고, 내부적으로도 나름 잘 설계된 평가 체계를 갖추고 있습니다.

​

이런 상황에서 과연 직접 강화학습을 수행하는 것이 타당한 선택인지, 아니면 모델들이 전반적인 작업 수행 능력을 계속 높여갈 때까지 일단 기다리는 편이 더 나은지 고민하는 경우가 많습니다. 결국 이 팟캐스트를 듣고 있을 많은 개발자분들도, 강화학습에 어느 정도의 자원과 조직적 노력을 실제로 투입해야 할지를 두고 고민하고 있을 것이라고 생각합니다. 그래서 이 부분에 대해 어떤 조언을 해주실지 궁금합니다.지 고심하고 있을 이 팟캐스트의 수많은 개발자들에게 어떤 조언을 들려주고 싶으신지 궁금합니다.

21
강화학습과 In-context Learning

​

야쿠브 파초키 Jakub Pachocki : 강화학습은 특정한 작업에서 모델 성능을 실질적으로 끌어올리는 데 꽤 데이터 효율적인 방법이 될 수 있습니다. 다만 우리가 이미 알고 있는 방법들 가운데 이보다 훨씬 더 데이터 효율적인 학습 방식이 있는데, 바로 In-context Learning(모델이 컨텍스트 내에서 모델이 스스로 맥락을 학습하고 답하는 것)입니다. 아마 앞으로 사람들이 이런 모델을 가르치는 가장 근본적인 방식도 여기에 가까워질 것이라고 생각합니다. 결국 원하는 결과물이 무엇인지에 대한 지침과 예시를 프롬프트 안에 넣어주기만 해도 모델이 그 방향으로 학습하고 적응할 수 있기 때문입니다.

​

그리고 저는 시간이 갈수록 이 In-context Learning 자체도 훨씬 더 정교하고 강력해질 것이라고 보고 있습니다. 그래서 앞으로는 모델이 주어진 컨텍스트 안에서 얼마나 많은 데이터와 지식을 끌어내 활용할 수 있는지가 매우 중요해질 것이라고 생각합니다. 모델은 사용자가 중요하게 여기는 특정한 종류의 작업에 점점 더 잘 스스로를 맞춰갈 수 있게 될 것이고, 이런 적응 능력은 앞으로 핵심적인 경쟁력이 될 가능성이 큽니다.

​

그런 점에서 보면, 기업들이 지금의 모델 학습 파이프라인을 거의 그대로 복제해서 직접 강화학습 시스템까지 구축하는 것이 과연 최선의 방향인지는 아직 확신하기 어렵습니다.

22
데이터·평가를 누가 맡는가

다만 이 문제는 분명 저희도 매우 중요하게 보고 있고, 내부적으로도 깊이 고민하고 있는 주제 중 하나입니다.

​

제이콥 에프론 : 결국 핵심은, 해야 할 일 자체가 사라지는 것은 아니라는 뜻으로 들립니다. 다시 말해 어떤 평가 기준이 정말 중요한지 정의하고, 좋은 데이터와 예시를 직접 모으는 작업은 앞으로도 여전히 필요하다는 것입니다. 다만 앞으로는 그 정보를 바탕으로 기업이 직접 모델을 새로 만들거나, 모델 자체를 수정하는 데까지 나아가기보다는, 그렇게 축적한 정보들을 모델의 컨텍스트 안에 효과적으로 넣어주는 쪽이 훨씬 더 좋은 결과를 내는 방향으로 발전할 가능성이 크다는 말씀이시군요.

​

야쿠브 파초키 Jakub Pachocki : 네네, 그 방향이 꽤 타당하다고 생각합니다.

​

제이콥 에프론 : Codex가 성공을 거두면서, 많은 분들이 이제 법률, 금융, 의료 같은 각자의 전문 도메인에서도 이런 모델을 본격적으로 활용하고 싶어 할 것 같습니다. 그렇다면 여기서 자연스럽게 생기는 질문이 있습니다. 각 도메인에 맞는 도구를 제대로 쓰려면 기업이나 개발자가 자체적으로 하네스까지 직접 구현해야 하는 것인지, 아니면 거대 모델을 그대로 가져와서 필요한 정보와 지침만 컨텍스트 안에 넣어 활용하는 방식으로도 충분한 것인지 궁금합니다.

​

야쿠브 파초키 Jakub Pachocki : 글쎄요.

23
하네스가 핵심 제약인가

저는 하네스를 직접 만들고 구현하는 일 자체가 앞으로 오랫동안 핵심 제약으로 남지는 않을 것이라고 생각합니다. 사람들이 머지않아 훨씬 더 범용적인 실행 환경을 갖게 될 것이고, 그 환경 안에서 다양한 도메인의 작업을 폭넓게 수행할 수 있게 될 것이라고 보기 때문입니다.

​

실제로 코딩이 아닌 다른 작업에 Codex를 써보더라도 이미 꽤 잘 작동한다는 점을 확인할 수 있습니다. 그래서 장기적으로는 특정 도메인마다 완전히 별도의 하네스를 일일이 새로 구축해야 한다기보다는, 보다 일반적인 환경 위에서 모델을 활용하는 방향으로 점점 더 발전해 갈 가능성이 크다고 보고 있습니다.

​

*코멘트 → 여기서도 다리오 아모데이 인터뷰에서 드와르케시 파텔이 물었던 것을 제이콥 에프론이 물었습니다. LLM을 스케일링하면 뭐든지 할 수 있게 된다고 믿는다면서, 왜 특정 작업에 강화학습을 해서 데이터를 그때그때 추가해주어야 하는가?라는 질문입니다. 사실 여기에 야쿠브 파초키가 말하고 있는 것과 다리오 아모데이가 말한 것이 같은 의미입니다.

​

이것에 대해서는 <주간전략보고 : 투자의 생각 (3월 30일~4월 3일)>자료 중 엔비디아 코멘트에서 요약 겸 개인적인 생각들로 다시 정리하기에 아모데이 인터뷰에서 중요했던 7가지 포인트를 정리드렸었는데요. 핵심은 두 가지입니다.

​

3. 암기를 위한 것이 아닌, '일반화'를 위한 것

24
일반화를 위한 강화학습 환경

강화학습 환경을 구축하는 이유도 특정 툴 사용법을 암기하게 하기 위해서가 아니라, 다양한 과제를 통해 모델이 일반화 능력을 획득하게 만들기 위해서입니다. 이 세상의 모든 데이터들을 LLM에게 넣고 사전훈련시켜서 LLM이 아는 도메인의 사이즈를 키우면 키울수록 창의력이 높아지며 이런저런 작업을 할 때에도 쉽게 일반화시켜 적용하는 보다 인간 같은 지능이 나오고 있습니다. GPT-1에서 부족했던 것도 ②③의 부족이었습니다. 데이터의 규모를 훨씬 키우고 규모만 키우는 게 아니라 여러 데이터들을 commoncrawl, reddit으로 넣었더니 이 세상에 대해서 더 잘 이해하게 됐습니다.

​

강화학습도 마찬가지입니다. 일반화된 능력을 얻으려면 각종 능력들에 대해서 다루는 방법을 가르치고, 가르치면 가르칠수록 새로운 것을 배울 때 더 높은 지능을 가지고 배우는 데이터 샘플 효율성이 높아지고 있는 것입니다. 마치 백지상태인 사람에게 게임을 처음에 가르칠 때에는 어렵지만, RTS, 보드게임, MMORPG 등등 여러 가지 종류들도 다르고 장르도 다른 것들을 가르치고 나면 새로운 게임을 할 때에는 이전 게임에서 배웠던 패턴을 적용해가면서 보다 쉽게 배우는 것과도 같습니다. 따라서 LLM에서 보였던 것처럼 강화학습에서도 비슷한 일반화 능력이 길러지고 있다는 것이 아모데이의 생각입니다.

​

4. In-context Learning + Computer Use 조합으로도 AGI는 가능하다

25
In-context Learning과 Computer Use

사전훈련과 강화학습을 통해서 폭넓은 지식(양, 퀄리티, 분포측면)을 주입하고, 여기에 컨텍스트 윈도우를 크게 키우는 In-context Learning + AI가 컴퓨터를 사용하는 방법을 다루는 Computer Use만 붙이더라도 실무 능력이 지금까지 좋아진 속도보다 훨씬 더 급격하게 상승할 것이라 전망했습니다. 시간이 지나면서 새로운 데이터를 학습하더라도 기존 학습 내용을 잊지 않도록 하는 Continual Learning 능력을 갖추기 위해 AI Labs들이 노력 중이고 1~2년 내에 해결할 가능성이 높지만, 이것을 해결하지 못하더라도 AGI 수준에는 도달할 수 있으며 그것자체로도 수조 달러의 경제적 가치를 만들 수 있을 거란 생각입니다.

​

*다시금 야쿠브 파초키 인터뷰로 돌아옵시다. 워낙 겹치는 부분이 많아서 흥미롭게 봤던 포인트들입니다.

​

제이콥 에프론 : 각자의 사용 사례들마다 하네스가 달라져야 한다기보다는, 범용적으로 적응하게 되는 구간이 곧 올 거라는 거군요.

​

야쿠브 파초키 Jakub Pachocki : 생각해보면, 우리가 앞으로 모델과 상호작용하게 될 궁극적인 인터페이스가 어떤 모습이어야 하는지 자체를 더 깊이 고민해볼 필요가 있다고 생각합니다. 모델은 일종의 고유한 UI 특성을 가진 존재이기도 합니다. 필요하다면 스스로 인터페이스를 만들어낼 수도 있고, 사람이 직접 처리하려면 시간이 많이 걸리는 작업도 상당 부분 대신 수행할 수 있습니다.

26
기존 인터페이스 속 AI

​

동시에 지금 사람들이 이미 편하게 사용하고 있는 기존 인터페이스에 모델이 직접 들어가 작동하게 하는 방향 역시 매우 큰 가능성이 있다고 봅니다. 예를 들어 Slack 같은 협업 도구 안에 AI가 자연스럽게 들어와서, 우리의 실제 업무 맥락에 바로 연결되고, 그 안에서 학습하며, 기존 환경을 제대로 이해하고 활용할 수 있게 되는 방향입니다. 결국 사람들이 이미 일하고 있는 공간 안에서 AI가 함께 작동하기를 원하게 될 것이라고 생각합니다.

​

물론 이 두 방향은 결국 어느 지점에선가 서로 만나게 될 것입니다. 새로운 형태의 AI 인터페이스가 생겨나는 흐름과, 기존 업무 환경 안으로 AI가 스며드는 흐름 사이에는 분명 절충 지점이 존재할 것입니다. 다만 장기적으로 보면 저는 AI가 기본적으로 사용자가 실제로 머무르며 일하는 바로 그 환경 안에서 사용자를 지원하는 방향으로 가게 될 것이라고 강하게 믿고 있습니다.

​

만약 미래가 그렇게 흘러가지 않는다면, 그것은 AI에 어떤 한계가 있어서라기보다는 우리가 지금 예상하지 못한 전혀 새로운 능력이나 상호작용 방식이 등장했기 때문일 가능성이 더 크다고 생각합니다.

Spud, Mythos의 시대

앤스로픽이 잘했던 것, AI가 AI를 연구하는 루프가 시작됐다

제이콥 에프론 : 한 가지 궁금한 점이 있습니다. 지금 이 시점에도 연구 현장에서는 거의 매일 놀라운 변화들이 나타나고 있을 것이라고 생각합니다.

27
연구에서 관측하는 이정표

실제로 연구를 진행하시다가 어느 날 테스트를 돌렸는데, 예상보다 훨씬 의미 있는 결과나 전혀 새로운 현상이 관측되는 순간들도 분명 있으실 것 같습니다.

​

그렇다면 앞으로 특히 중요하게 보고 계신 이정표는 무엇인지 궁금합니다. 연구자로서 지금 가장 주의 깊게 지켜보고 있는 변화나 신호는 무엇인지, 또 어떤 지점에 도달했을 때 “이건 정말 의미 있는 진전이다”라고 판단하게 되는지 듣고 싶습니다.

​

야쿠브 파초키 Jakub Pachocki : 제가 지금 가장 집중하고 있는 것은 결국 AI 연구원을 완성하는 문제라고 할 수 있습니다. 다시 말해, 모델이 스스로 새로운 사실을 발견할 수 있는지, 그리고 호흡이 긴 장기 연구 과제를 실제로 끝까지 수행해낼 수 있는지가 가장 중요한 관심사입니다. 저희가 내부적으로 사용하고 있는 GPT-5 Pro 계열 시스템들에서도 이미 작지 않지만 분명 의미 있는 아이디어가 나온 적은 있습니다. 실제로 어느 정도는 영향력이 있는 통찰을 준 사례들도 있었습니다. 다만 개인적으로 기대하고 있는 수준과 비교하면, 아직은 매우 초기 단계에 가깝다고 생각합니다.

​

제이콥 에프론 : 지금 가장 앞선 모델들과 거의 연구 파트너에 가깝게 직접 상호작용하고 계신, 사실상 최초의 사람들 중 한 분이라고 할 수 있을 것 같습니다. 그래서 궁금한 것은, 이런 모델들과 함께 일하면서 “이렇게 상호작용해야 가장 잘 된다”라고 느끼게 된 방식이 따로 있는지입니다.

28
AI 연구원과 연구 조직의 변화

그 과정에서 새롭게 깨달은 점도 분명 있으셨을 것 같습니다.

​

아울러 모델이 계속 더 강력해진다면, 미래의 연구 조직 자체가 어떤 모습으로 바뀌게 될지에 대해서도 생각해보신 적이 있는지 궁금합니다. 연구자와 모델의 역할 분담은 어떻게 달라질지, 그리고 연구팀의 일하는 방식은 어떤 방향으로 재편될 것이라고 보시는지도 함께 듣고 싶습니다.

​

야쿠브 파초키 Jakub Pachocki : 지금 우리는 분명 거대한 전환점에 들어서고 있습니다. 이제는 모델의 단기적이고 즉각적인 품질 자체가 연구 발전 속도를 결정하는 매우 중요한 요인이 되어가고 있다고 봅니다. 앞으로는 연구 과정의 상당 부분을 모델이 실제로 담당하게 될 가능성이 크기 때문입니다. 그렇기 때문에 이는 연구 조직을 어떻게 운영해야 하는지에 대한 기존의 직관 자체를 다시 구성할 필요가 있다는 뜻이기도 합니다.

​

아시다시피 보통은 눈앞의 즉각적인 성과나 품질에 지나치게 매달리지 않으려 하고, 더 장기적인 관점에 무게를 두려고 합니다. 오픈AI 내부에도 장기적으로 준비해 온 매우 흥미로운 프로젝트들이 많이 있습니다. 다만 지금은 그것들을 실제로 실행에 옮기고, 동시에 더 향상된 모델 지능을 활용해 AI 연구 자체를 가속화해야 한다는 강한 시급함을 느끼고 있습니다. 특히 AI 정렬 연구를 더 빠르게 진전시켜야 한다는 점에서 그 시급함의 정도가 매우 크다고 생각합니다.

29
앤스로픽과 비교한 연구 경쟁

​

*코멘트 → 여기도 앤스로픽 CEO 다리오 아모데이와 관련 의견입니다. 앤스로픽은 당시 인터뷰에서 '언젠가는 내부적으로 더 훌륭한 AI를 독점적으로 쓰는 것을 통해서 모든 면에서 다른 AI Labs들과의 격차를 유지할 수 있게 될 것'이라는 뉘앙스로 말했었습니다. 그리고 실제로 2026년 2월 24일부터 Mythos를 통해서 연구와 제품 출시를 가속화하고 있음을 알려왔었죠. 오픈AI도 Spud를 완성하고 나서 내부적으로 배포하여 먼저 사용하면서 ⓐNext-Spud의 연구를 가속화하기도 하고, ⓑ각종 컴퓨팅 효율성을 높이는 알고리즘 연구를 가속화하며, ⓒ신제품을 만들고 다듬는 상위의 모델로 쓰며, ⓓ더 나아가서는 친-오픈AI라 할 수 있는 기업들의 진영에만 Spud를 우선 배포하기 시작할 것으로 예상합니다.

​

제이콥 에프론 : 현재 회사 차원에서 막대한 규모의 컴퓨팅 자원을 보유하고 계신 한편, 사전훈련의 스케일링 법칙과 강화학습의 스케일링 역시 여전히 매우 강하게 작동하고 있는 것으로 보입니다. 동시에 그 두 축과는 직접적으로 연결되지 않지만, 충분히 의미 있을 수 있는 새로운 방식의 실험들도 내부에서 다양하게 진행되고 있을 것이라고 생각합니다.

​

그렇다면 이런 여러 가능성 사이에서 컴퓨팅 자원을 어떻게 배분할지 판단하는 기준은 무엇인지 궁금합니다. 어떤 접근에 더 많은 자원을 실어야 하는지, 또 어떤 시도는 아직 더 탐색적으로 가져가야 하는지를 연구 조직 차원에서 어떤 원칙으로 결정하고 계신지 듣고 싶습니다.

30
컴퓨팅 배분의 원칙

​

야쿠브 파초키 Jakub Pachocki : 해야 할 일이 워낙 많기 때문에, 컴퓨팅 자원을 어떻게 배분할지는 매우 복잡하고 여러 요소를 함께 고려해야 하는 문제입니다. 그 과정에서 저희가 하나의 원칙처럼 지키고 있는 기준이 있습니다. 바로 범용적인 모델 지능을 끌어올리는 데 가장 핵심적이라고 믿는, 그리고 가장 확장 가능하다(scalable)고 판단하는 방법들에 컴퓨팅 자원의 상당 부분을 의도적으로 배정하려고 한다는 점입니다. 이것이 언제나 모든 면에서 가장 효율적인 방식이라고 말할 수는 없지만, 그럼에도 중요한 원칙이라고 생각합니다.

​

왜냐하면 하나의 실험이나 특정한 실험군에 막대한 컴퓨팅 자원을 투입하면, 그 자원의 일부를 다른 여러 시도에 나누어 써서 얻을 수 있었던 작지만 의미 있는 진전을 놓칠 수도 있기 때문입니다. 반대로 지금 진행 중인 온갖 흥미롭고 중요한 일들에 자원을 너무 잘게 쪼개어 배분하다 보면, 결국 모든 것을 조금씩만 건드린 채 정작 가장 중요하다고 믿는 핵심 과업을 끝까지 밀어붙이지 못하게 될 위험도 있습니다.

​

그래서 결국 가장 먼저 확인해야 하는 것은 구체적인 경험적 증거입니다. 평가 체계가 제대로 작동하고 있는지, 실험이 충분히 엄밀하게 설계되어 있는지, 그리고 결과를 정말 신뢰할 수 있는지를 먼저 점검해야 합니다. 그다음에는 몇 가지 기준을 놓고 우선순위를 조정합니다.

31
확장 가능한 방법의 판단

예를 들어 우리가 이 접근을 얼마나 명확하게 이해하고 있는지, 실제로 충분히 확장 가능한 방법인지, 앞으로 그 위에 더 많은 것을 쌓아 올릴 수 있는 토대가 되는지, 아니면 일회성 성과에 그칠 가능성이 큰지를 함께 따져보는 것입니다. 그리고 그런 판단을 바탕으로 최종적인 우선순위를 결정하게 됩니다.도에 불과한지 등을 따져보는 것입니다. 그리고 이러한 판단을 근거로 최종적인 우선순위를 결정합니다.

​

제이콥 에프론 : 오픈AI의 Codex에도 매우 중요한 시기였지만, 동시에 시장에서는 여전히 앤스로픽의 Claude Code가 강한 존재감을 보이고 있는 것 같습니다. 그렇다면 앤스로픽이 이 분야에서 특히 성공할 수 있었던 이유를 당신은 어떻게 보고 계신지 궁금합니다.

​

야쿠브 파초키 Jakub Pachocki : 결국 앤스로픽이 우세했던 이슈를 해석하자면, 기술의 다음 핵심 응용처가 어디가 될 것이라고 보느냐에 따라 제품의 방향성을 어디에 둘지가 결정된다고 생각합니다. 오픈AI의 내부적인 제품 우선순위를 돌아보면, 코딩 관련 제품도 분명 계속 개발해 왔지만 전체 우선순위 안에서는 어디까지나 상대적으로 부차적인 영역에 가까웠습니다.

​

흥미로운 점은 이런 제품 우선순위가 오픈AI 내부 연구 조직의 우선순위를 그대로 반영하는 것은 아니라는 사실입니다. ChatGPT는 분명 폭발적인 성공을 거두었습니다.

32
ChatGPT 이후 제품 방향

하지만 2023년 당시의 ChatGPT는 저희가 바라보는 AI의 장기적 미래와 어느 정도 맞닿아 있었을 뿐 AI가 궁극적으로 구현할 수 있는 모든 가능성을 대표하는 제품은 아니었습니다. 물론 이 제품 역시 앞으로 계속 진화해 나갈 것입니다.

​

그래서 저희 연구의 상당 부분은 그보다 더 먼 미래를 향해 있었습니다. 그리고 시간이 갈수록 이런 연구의 방향은 단기적인 제품 전략과 점점 더 분리되어 가고 있다고 생각합니다. 저는 모델 지능 측면에서 저희가 연구해 온 결과와 지금 실제로 만들고 있는 것들에 대해 상당히 큰 확신을 갖고 있습니다.

​

아마 많은 분들이 궁금해하실 것은, 모델이 점점 더 긴 호흡의 작업을 수행하고 실제 성과를 축적해 갈 때 세상이 어떻게 달라질 것인가 하는 점일 것입니다. 예를 들어 3개월 뒤나 6개월 뒤에 사람들의 삶이 어떻게 달라질지, 또 Codex 같은 도구를 사람들이 어떤 방식으로 활용하게 될지가 궁금하실 것입니다. 이 분야에서는 3개월과 6개월의 차이도 매우 큽니다. 그래서 그 중간 어디쯤의 시점을 상정해 보는 것이 적절할 것 같습니다.

​

제 생각에는, 사용자가 모델에 대해 체감하는 자율성의 수준이 점진적으로 계속 높아질 것입니다. 사용자의 설명이 다소 모호하더라도 모델이 그것을 더 잘 이해하게 되고, 사람이 일일이 붙어서 감독해야 하는 정도는 점점 줄어들 것이라고 봅니다.

33
며칠 단위 자율 작업의 전망

며칠 단위로 자율적으로 작동하는 모델도 이제 그리 먼 이야기는 아니라고 생각합니다. 물론 지금보다 훨씬 더 많은 컴퓨팅 자원을 쓰게 되겠지만, 그 대신 모델이 스스로 만들어내는 결과물의 품질도 한층 더 높아질 것입니다.

​

*코멘트 → 파초키는 앤스로픽이 왜 코딩 분야에서 오픈AI를 압도할 수 있었는지에 대해, 이를 제품 우선순위의 차이로 설명했습니다. 쉽게 말해 앤스로픽은 "다음 핵심 응용처가 코딩이다"라고 보고 그쪽에 더 강하게 집중했고, OpenAI는 코딩 제품도 만들었지만 전체 우선순위에서는 상대적으로 아래에 놓았었다는 뜻입니다. 어찌보면 해명이기도 하고 어찌보면 인정이기도 한 내용이었습니다. 제품 전략을 다소 잘못내렸었다는 의미입니다.

​

제이콥 에프론 : 그렇게 며칠씩 자율적으로 작동하는 모델을 실제로 감독하려면, 여전히 소프트웨어 엔지니어링에 대한 숙련도가 필요하다고 보시는지 궁금합니다. 아니면 모델이 일정 기간 스스로 일할 수 있는 단계에 이르면, 꼭 전문적인 기술 지식이 없더라도 누구나 코딩 에이전트를 활용하고 감독하면서 원하는 결과물을 만들어낼 수 있게 된다고 보시는지도 궁금합니다.

​

야쿠브 파초키 Jakub Pachocki : 이미 많은 결과물을 만들어내는 수준까지는 꼭 많은 경험이 있어야만 가능한 단계는 아니라고 생각합니다. 하지만 여기서도 여전히 구분은 분명합니다.

34
인턴과 자율 연구원 사이의 간극

연구 인턴 수준의 활용과, 진정한 의미의 자율적인 연구원이나 소프트웨어 엔지니어 수준의 역할 사이에는 아직도 차이가 존재한다고 봅니다.

​

예를 들어 더 큰 규모의 시스템을 구축하려고 한다면, 아마도 여전히 사람의 감독이 필요할 것입니다. 전체 시스템을 관통하는 큰 그림을 유지해야 하고, 각각의 구성 요소가 전체 맥락 안에서 잘 맞는지 아닌지를 판단할 수 있어야 하기 때문입니다. 다만 앞으로 현장에서 요구되는 핵심 역량의 성격 자체는 상당히 크게 바뀔 것이라고 분명히 예상하고 있습니다. 결국 어떤 방향으로 가야 하는지에 대한 비전과, 무엇이 중요한 문제인지를 정하는 일은 여전히 사람이 맡게 될 가능성이 크다고 생각합니다.

​

제이콥 에프론 : 아마 한 달 전쯤이었던 것 같습니다. 그 당시에는 정말 많은 사람들이 지속적 학습(continual learning)에 대해 이야기하고 있었고, 일종의 시대적 흐름처럼 느껴지기도 했습니다. 실제로 그 주제에 집중하기 위해 새롭게 생겨나는 연구소들도 있었고, 오픈AI를 떠나 그 분야에 본격적으로 몰두하려는 분들도 있었던 것으로 압니다.

​

제 생각에는 이런 흐름의 배경에 하나의 문제의식이 깔려 있는 것 같습니다. 지금의 강화학습만으로는 우리가 원하는 목표에 도달하기 어렵다고 보거나, 설령 가능하더라도 그것이 매우 비효율적인 스케일링 경로일 수 있다고 보는 시각입니다.

35
인간 학습과 강화학습의 차이

그리고 이런 문제의식은, 현재의 강화학습 기반 접근이 인간이 실제로 학습하는 방식과는 분명히 다르다는 인식과도 연결되어 있는 것 같습니다. 예전에 말씀하셨던 것처럼, 지금의 강화학습은 여러 면에서 인간의 학습 방식과는 아직 큰 차이가 있으니까요.

​

그래서 이런 전체적인 흐름에 대해 당신은 어떻게 보고 계신지 궁금합니다. 지속적 학습에 대한 최근의 관심과 움직임을 어떤 맥락에서 해석하고 계신지, 또 그것이 앞으로 모델 발전에서 어느 정도 중요한 축이 될 것이라고 보시는지 듣고 싶습니다.

​

야쿠브 파초키 Jakub Pachocki : 네, 사실 그 부분에 대해서는 저도 다소 의아하게 느끼는 면이 있습니다. 제 생각에는 우리가 지금까지 품어왔던 많은 기대의 핵심 자체가 바로 이 모델 계열이 실제로 지속적 학습이 가능하다는 점에 있었기 때문입니다. GPT-3 논문의 제목만 보더라도 그 방향성은 어느 정도 드러나 있습니다. 결국 GPT 계열 모델을 계속 확장해 나가는 강력한 동력은 컨텍스트 안에서 학습하는 법을 배우는 것인 In-context Learning 능력을 키워가는 데 있었다고 생각합니다.

​

그리고 우리가 강화학습을 통해 모델을 더 잘 가르치려는 이유 역시 궁극적으로는 이 In-context Learning을 더 효율적이고 더 강력하게 만들기 위해서라는 전제가 깔려 있었습니다.

36
지속적 학습의 위치

그런 점에서 저는 지속적 학습이 정말 중요하다는 주장에는 전적으로 동의합니다. 오히려 그것은 우리가 지금 만들고 있는 시스템의 본질에 가까운 이야기라고 생각합니다. 다만 저는 이것이 현재 우리가 가고 있는 방향과 별개로 떨어져 있는 문제라거나, 지금의 주류 접근에서 소외된 주제라고 보지는 않습니다. 제 관점에서는 오히려 그것이야말로 우리가 지금 지향하고 있는 목표 그 자체에 가깝습니다.

​

제이콥 에프론 : 네, 제 생각도 사전훈련과 강화학습을 계속해서 확장해나가는 것이 목표에 도달하기 위한 유일하고도 가장 좋은 길이라 생각하고 있습니다.

​

야쿠브 파초키 Jakub Pachocki : 지금까지 가장 큰 진전을 만들어낸 것도 결국 이 방식이었다고 생각합니다. 그리고 앞으로도 여기에는 더 많은 아이디어와 더 많은 도약의 순간들이 남아 있다고 봅니다. 동시에 모델 성능의 상당 부분은 새로운 아이디어만이 아니라 단순히 스케일을 계속 확장하는 과정만으로도 자연스럽게 함께 개선될 것이라고 생각합니다.

​

제이콥 에프론 : 이 방송을 듣고 계신 분들 중에도, 모델을 활용해 비교적 단순한 작업은 이미 꽤 잘 처리해 왔지만, 100단계를 넘는 복잡한 절차나 호흡이 긴 과업을 맡겨보면 아직은 기대만큼 작동하지 않아 실망한 분들이 많을 것 같습니다. 내부에서 개발하시는 입장에서는 지속적인 발전이 분명하게 체감되겠지만, 외부 사용자들 입장에서는 이런 장기 과업 수행 능력이 아직은 꽤 먼 미래의 일처럼 느껴질 수도 있습니다.

37
긴 작업을 위한 조건

​

그렇다면 모델이 정말 더 긴 단계의 작업을 안정적으로 수행하려면, 어떤 조건들이 갖춰져야 한다고 보시는지 궁금합니다. 결국 무엇이 더 발전해야 하고, 어떤 요소들이 충족되어야 지금보다 훨씬 긴 호흡의 과업도 제대로 처리할 수 있게 되는지 설명해 주시면 좋겠습니다.

​

야쿠브 파초키 Jakub Pachocki : 제 개인적인 생각으로는, 그런 전망의 상당 부분은 사실 이미 지나온 발전 경로를 바탕으로 말씀드릴 수 있는 내용이라고 봅니다. 이제는 그 변화의 구체적인 형태가 점점 더 눈에 보이기 시작하고 있습니다. 결국 핵심은 모델이 스스로 지금 작업을 제대로 수행하고 있는지를 판단할 수 있을 만큼 충분히 똑똑해지느냐에 달려 있다고 생각합니다.

​

동시에 이것은 매우 실무적인 조건들과도 연결됩니다. 모델이 실제 작업을 수행하는 데 필요한 모든 컨텍스트와 파일, 그리고 각종 인프라에 제대로 접근할 수 있어야 합니다. 다시 말해, 지능 자체의 문제만이 아니라 실제로 일을 해낼 수 있는 작업 환경이 함께 갖춰져야 한다는 뜻입니다. 예전에 강화학습 로드맵을 논의할 때도, 저는 모델이 자신이 생성한 토큰을 바탕으로 다시 추론하도록 가르치는 일을 가장 중요한 우선순위 중 하나로 봤습니다. 그것이 장기 과제를 수행하는 능력으로 이어지는 핵심적인 출발점이라고 생각했기 때문입니다.

38
상태를 가진 런타임과 물리 세계

​

물론 어느 시점에 가면 모델은 단순히 텍스트만 다루는 것을 넘어, 런타임 환경 자체를 하나의 도구로 활용할 수 있어야 합니다. 당연히 시각적 정보를 이해하도록 가르쳐야 하고, 더 나아가 언젠가는 물리적인 몸체를 사용하는 법도 익혀야 할 것입니다. 제 생각에는 지금 우리는 이미 모델이 환경과 상호작용하고, 세상을 직접 보고 이해할 수 있어야 하는 단계에 꽤 깊이 들어와 있습니다. 그리고 머지않은 시점에는 로봇 문제 역시 훨씬 더 진지하게 다루게 될 것이라고 생각합니다.

​

*코멘트 → 모델이 장기적인 업무를 수행할 수 없는 이유는, 단순히 모델의 지능이 떨어져서가 아니라 모델이 모델이 자기 작업을 점검할 수 있어야 하고, 지속적인 상태(state)를 유지해야 하며, 파일, 툴, 권한, 메모리, 컴퓨트에 연결된 실행 환경(runtime) 안에서 일해야 하기 때문입니다. 이러한 맥락에서 2026년 2월에 발표했던 OpenAI-AWS의 Stateful runtime 환경에서의 Frontier 제품 발표는 이제는 인프라 레이어에서 이러한 문제를 풀겠다는 계획입니다. 오픈AI의 엔터프라이즈AI 제품인 Frontier는 공유된 비즈니스 컨텍스트, 에이전트 실행, 평가 및 최적화, 거버넌스를 갖춘 엔터프라이즈 에이전트 플랫폼으로 소개됐고 + AWS와 공동 개발 중인 Stateful Runtime은 컨텍스트 유지, 이전 작업 기억, 도구 및 데이터 소스 작업, 컴퓨트 접근을 지원하는 구조로 설명됐습니다.

39
Agentic AI와 Physical AI의 순서

​

*코멘트 → 개인적으로 Agentic AI가 완성되고 나서야 Physical AI로 넘어갈 것이라 느끼는 이유는, 구조적으로 보면 이러한 stateful runtime 인프라 작업들이 로봇 이전 단계의 필수 레이어이기 때문입니다. 먼저 자아 역할을 해줄 상태를 유지하는 소프트웨어 실행체가 필요하고, 그다음에 두뇌 역할을 해줄 월드모델, 여기에 눈, 코, 입, 귀, 피부 역할을 해줄 시각과 센서가 붙으면 마지막에 물리적 액션이 움직이는 순서라고 봅니다.

AI는 스스로 생각하는가?

First Proof 챌린지, 2016~2017년부터 이어져온 ML의 법칙

​

제이콥 에프론 : 이제 여러분이 추진해 온 '과학을 위한 AI'에 대해 이야기해보고 싶습니다. 코딩 분야는 누구나 직접 체감하고 있습니다. 많은 기업들이 이미 이런 도구를 활용해 상당한 생산성 향상을 경험하고 있습니다. 반면 수학 분야의 진전은 의미가 크더라도, 대부분의 사람들은 국제수학올림피아드 같은 문제를 직접 다뤄본 적이 없기 때문에 그 돌파구가 얼마나 중요한지 직관적으로 느끼기 어려울 수 있습니다.

​

그런 점에서, 여러분이 진행한 연구 가운데 'First Proof'와 관련된 성과는 특히 흥미롭다고 생각합니다. 이 문제는 전통적인 경시 수학과도 꽤 다른 성격을 가지고 있는 것으로 보입니다.

40
First Proof의 의미

그래서 청취자분들을 위해 이 분야가 무엇인지 조금 더 풀어서 설명해 주시면 좋겠습니다. 그리고 모델이 이런 영역에서 인상적인 결과를 만들어낸다는 것이 왜 중요한지, 그것이 어떤 의미를 갖는지도 함께 듣고 싶습니다.

​

야쿠브 파초키 Jakub Pachocki : 저도 First Proof 챌린지에 대해 굉장히 큰 기대를 가지고 있었습니다. 이 챌린지는 일종의 벤치마크인데, 저명한 수학자들과 이론 컴퓨터 과학자들이 자신들의 일상적인 연구를 잘 대표한다고 생각하는 문제들을 직접 공개한 형태였습니다. 무엇보다 이 문제들은 어디에도 발표된 적이 없는 미공개 문제였기 때문에, 우리 모델이 정말로 이런 문제를 풀 수 있는지를 시험해 보기에는 매우 좋은 기회였습니다.

​

저희는 이 챌린지에 정말 큰 열정을 갖고 있었습니다. 다만 현실적으로는 사전 예고도 거의 없이 갑작스럽게 발표되었고, 실제로 대응할 수 있는 시간도 일주일밖에 주어지지 않았습니다. 당시 내부에서는 매우 흥미로운 모델 훈련이 진행 중이었는데, 그 훈련을 맡고 있던 리더 중 한 명인 James Lee가 해당 모델에 직접 수작업으로 프롬프트를 넣기 시작했습니다. 그리고 그 모델이 실제로 문제를 풀어가는 과정을 지켜보는 것은 정말 놀라운 경험이었습니다.

​

특히 그 문제들 가운데 하나는 제가 박사 학위를 받았던 전공 분야와 직접 맞닿아 있는 문제였습니다.

41
짧은 시간에 나온 수학적 아이디어

제가 그 문제를 1주일이나 2주일 정도 붙잡고 있다가 그런 아이디어를 떠올렸다면 스스로도 꽤 자랑스럽게 여겼을 만한 수준이었는데, 모델은 그에 가까운 아이디어를 단 1시간 만에 내놓았습니다. 그 장면을 보면서 정말 묘한 감정을 느꼈습니다. 예전에 Dota 봇이 끝없이 흥미로운 플레이를 만들어내는 모습을 볼 때와 비슷한 느낌이었습니다.

​

원래 정상적인 세상에서는 그렇게 계속해서 놀라운 일이 끝도 없이 벌어지지는 않습니다. 그런데 그때는 마치 무언가 마법 같은 일이 일어나고 있다는 기분이 들었습니다. 그것도 수학처럼, 세상에서 정말 중요하고 앞으로 우리가 하게 될 많은 일의 전조가 될 수 있는 분야에서 그런 일이 벌어지는 것을 보면서 AI 발전 속도가 정말 엄청난 수준에 와 있다는 생각이 더욱 강해졌습니다.

​

이제는 그다음 단계로 해당 분야의 전문가들을 직접 모셔서 그 증명들이 실제로 맞는지 틀린지를 검증받아야 하는 수준까지 와 있습니다. 하지만 코딩 같은 분야와 비교하면, 수학은 우리가 실제로 진전을 이뤘는지를 판단하기가 훨씬 더 수월한 편입니다. 물론 경쟁 프로그래밍처럼 평가가 명확한 영역도 있기는 합니다. 하지만 실제 세계의 프로그래밍은 대부분 그런 식으로 이루어지지 않습니다. 설계한 추상화가 적절한지, 다양한 예외 상황을 정말 제대로 다루고 있는지, 시스템 전체 맥락에서 그 구현이 타당한지 같은 훨씬 더 복잡한 문제들이 함께 얽혀 있기 때문입니다.

42
패턴 매칭 비판에 대한 질문

​

제이콥 에프론 : 불과 1년 전만 해도, 이런 모델은 결국 패턴 매칭기에 불과하다는 비판이 꽤 흔했던 것 같습니다. 물론 지금도 그런 시각이 완전히 사라진 것은 아니지만, 적어도 예전만큼 강하게 받아들여지지는 않는 것 같습니다. 당시에는 AI가 과학에 실질적으로 기여하려면 새로운 아이디어를 내놓거나, 적어도 기존에 없던 독창적인 무언가를 만들어낼 수 있어야 하는데, 단순한 패턴 매칭만으로는 그것이 불가능하다고 보는 견해가 많았습니다.

​

그런데 지금까지의 흐름을 보면, 우리는 그런 고정관념을 계속해서 하나씩 깨 나가고 있는 것처럼 보입니다. 그렇다면 이제는 그런 주장이 근본적으로 잘못된 것이었다는 점을 점점 더 분명하게 입증해 가는 단계에 가까워지고 있다고 보시는지 궁금합니다.

​

야쿠브 파초키 Jakub Pachocki : 패턴 매칭을 넘어서, '생각할 수 있는 시스템'이라고 생각합니다. 실제로 일정에 맞춰 작지만 분명한 진전들이 하나씩 나타나기 시작하고 있습니다. 아직 모두가 깜짝 놀랄 만큼 거대한 돌파구만 연이어 나오고 있는 단계는 아닐 수 있습니다. 하지만 여러 곳에서 작지 않은 아이디어들이 계속 등장하고 있습니다. 앞으로는 과학자들과의 협업을 통해 꽤 큰 규모의 논문이나 성과로 이어지는 사례들도 충분히 나올 수 있다고 봅니다.

43
새 전략과 추론의 가능성

​

그리고 조금 더 근본적으로 생각해보면, AlphaGo나 AlphaZero 같은 시스템을 단순히 패턴 매칭기라고 부를 수 있겠느냐는 질문도 중요합니다. 그런 시스템들은 각자의 환경 안에서 실제로 새로운 전략을 만들어냈습니다. 저희 모델 역시 마찬가지로, 단순히 기존 패턴을 반복하는 수준을 넘어 새로운 방식의 해법이나 아이디어를 만들어내는 방향으로 점점 나아가고 있다고 생각합니다.

​

제이콥 에프론 : 패턴 매칭 시스템일 뿐이라는 생각에 대해서는 사실 2016~2017년 수준부터 이미 패턴 매칭기가 아님을 입증해왔는데, 최근까지도 그런 글들을 올라왔었다는 게 참 재밌는 포인트죠.

​

야쿠브 파초키 Jakub Pachocki : 물론 언제든 이런 시스템의 기술적 한계를 지적할 수는 있습니다. 그리고 바로 그 점이 또 흥미로운 부분이기도 합니다. 예를 들어 AlphaGo도 특정한 전략 아래에서는 공략될 수 있었고, 저희의 Dota 봇들 역시 어떤 전략에는 실제로 약점을 드러내곤 했습니다. 앞으로도 한동안은 이런 모델을 어떻게 정의해야 하는지를 둘러싼 여러 논쟁이 계속 이어질 것이라고 봅니다.

​

다만 그와는 별개로 이 모델들이 이미 상당한 수준의 능력을 갖추고 있으며, 그 능력을 바탕으로 실제로 새로운 것을 발견할 잠재력도 충분히 가지고 있다는 점은 분명합니다.

44
게임에서 과학으로 넓어진 학습

아주 작은 게임 환경에서 출발해, 지금처럼 훨씬 더 일반적인 과학 연구에 가까운 단계까지 오는 데는 몇 년이 걸렸습니다. 그 과정에서는 사실상 인류가 축적해 온 방대한 지식에 가까이 다가가야 했고, 인간의 언어는 물론 그 이상의 여러 층위까지 학습해야 했습니다.

​

그럼에도 제가 보기에는 그 밑바탕에 있는 기본 원리는 상당히 유사합니다. 결국 중요한 것은 시스템이 주어진 환경 안에서 의미 있는 구조를 학습하고 그것을 바탕으로 새로운 전략이나 새로운 해법을 만들어낼 수 있느냐는 점입니다. 그런 의미에서 지금 우리가 보고 있는 흐름은 이전의 사례들과 단절된 것이 아니라, 더 넓고 더 복잡한 세계로 확장된 연속선 위에 있다고 생각합니다.

​

제이콥 에프론 : First Proof에서 처음으로 증명 결과가 나왔을 때, 사람들이 AI가 내놓은 해답을 두고 했던 평가가 기억에 남습니다. 많은 분들이 그 풀이를 보면서, 이것이 우아하고 현대적인 수학적 기법이라기보다는 오히려 19세기 수학처럼 계산을 많이 밀어붙이는 무차별 대입형 접근에 가깝게 느껴진다고 말했습니다. 이것이 모델이 본질적으로 작동하는 방식에서 비롯된 특징인지, 아니면 아직 넘어서지 못한 일종의 한계인지는 분명하지 않은 것 같습니다. 그런 평가를 들으셨을 때, 그것이 우려스럽게 느껴지셨는지, 아니면 오히려 하나의 흥미로운 신호처럼 보이셨는지 궁금합니다.

45
증명의 우아함과 계산량

​

야쿠브 파초키 Jakub Pachocki : 전혀 걱정되지는 않습니다. 실제로 적어도 그 문제들 중 하나에 대해서는, 우리 모델이 원래 의도된 풀이보다 오히려 더 짧고 더 깔끔한 증명을 내놓았다고 생각합니다. 다만 전반적으로 보면, 이런 모델은 짧은 시간 안에 사람보다 훨씬 더 많은 양의 추론을 생성할 수 있다는 점을 함께 고려해야 합니다. 말 그대로 쏟아낼 수 있는 토큰의 양, 그리고 물리적으로 전개할 수 있는 사고의 양 자체가 훨씬 크다는 뜻입니다. 그래서 어떤 경우에는 다소 계산 집약적이거나 탐색을 많이 하는 방식처럼 보일 수도 있습니다. 하지만 저는 이것이 장기적으로 계속 고정된 특징으로 남을 것이라고는 생각하지 않습니다.

​

제이콥 에프론 : 지금은 과학을 위한 AI 분야 전체에 상당한 추진력이 붙고 있는 것처럼 보입니다. 앞서 말씀하신 것처럼, 결국 어느 시점에는 이런 모델들을 물리적 세계와도 실제로 연결해야 할 것입니다. 그렇다면 지금으로부터 3년 정도를 내다봤을 때, 어떤 과학 분야에서 특히 가장 큰 진전이 나타날 것이라고 보시는지 궁금합니다. 반대로, 당장은 변화의 잠재력이 크더라도 실제로 의미 있는 성과가 나타나기까지 시간이 더 필요하거나, 현실적인 채택 과정에서 병목이 클 것 같은 분야는 어디라고 보시는지도 함께 듣고 싶습니다.

46
변화가 큰 과학 분야의 기준

​

야쿠브 파초키 Jakub Pachocki : 사실 가장 쉽게 답할 수 있는 기준은 이것입니다. 지금도 여전히 사람의 수작업이 많이 들어가는 분야가 어디인지, 혹은 아직 모델이 그 연구 생태계 안에 완전히 통합되지 못한 분야가 어디인지를 보면 됩니다. 그런 곳일수록 앞으로 변화의 여지가 크다고 볼 수 있습니다. 다만 동시에 각 연구소와 연구 조직들 역시 이런 새로운 기술에 맞춰 매우 빠르게 적응해 갈 것이라고 생각합니다. 그래서 어떤 분야는 현재 기준으로는 병목이 커 보이더라도, 실제로는 생각보다 훨씬 빠르게 변화할 가능성도 충분하다고 보고 있습니다.

​

제이콥 에프론 : 생물학에서는 Isomorphic, 재료과학에서는 Periodic, 로봇공학에서는 Physical Intelligence처럼 각 분야에 맞는 서로 다른 모델 아키텍처를 바탕으로 독립적으로 접근하는 흐름이 있습니다. 반면 하나의 거대한 범용 모델 안에서 이 모든 것을 함께 풀어가려는 방향도 분명 존재합니다. 이 두 접근 가운데 어떤 쪽이 더 타당하다고 보시는지, 개인적인 직관이 궁금합니다. 앞으로는 분야별로 특화된 구조가 더 강해질 것이라고 보시는지, 아니면 결국에는 하나의 큰 모델이 여러 영역을 포괄하는 방향으로 수렴하게 될 것이라고 보시는지도 함께 듣고 싶습니다.

​

47
특화 모델과 범용 모델의 선택

야쿠브 파초키 Jakub Pachocki : 이 부분도 앞서 Codex를 위한 하네스를 따로 구축해야 하느냐는 질문에 드렸던 답변과 비슷한 맥락이라고 생각합니다. 저는 기술의 한계를 기준으로 접근하기보다는, 그 기술이 실제로 할 수 있는 역량을 중심으로 무엇을 구축해야 하는지를 생각하는 편이 맞다고 봅니다.

​

예를 들어, 어떤 시스템이 갑자기 매우 흥미롭고 의미 있는 화학 실험이나 생물학 실험을 대규모로 설계할 수 있게 되었다면, 그다음에는 당연히 그런 능력을 실제로 활용할 수 있는 실험 환경과 연구 인프라를 함께 구축하는 것이 타당할 것입니다. 모델이 고품질의 실험을 설계할 수 있는 수준에 도달했다면, 그것을 인간과 협력하는 루프 안에서 작동하게 만드는 것도 매우 자연스러운 선택입니다.

​

저는 이것을 완전히 자동화된 별개의 존재가 옆에서 독립적으로 도구를 쓰는 방식으로만 상상해서는 안 된다고 생각합니다. 오히려 특정 문제를 깊이 파고드는 AI 과학자들과 인간 연구자가 긴밀하게 협력하는 형태가 훨씬 더 자연스럽다고 봅니다. 결국 앞으로는 사람과 AI가 하나의 연구 루프 안에서 함께 문제를 정의하고, 실험을 설계하고, 결과를 해석해 나가는 방식이 점점 더 일반적인 모습이 될 가능성이 크다고 생각합니다.

​

제이콥 에프론 : 이 문제는 거의 두 가지 서로 다른 비전을 상정하게 만드는 것 같습니다.

48
자동화 연구자와 협업 도구

한쪽은 모델 자체를 학습시켜, 이런 과업들을 처음부터 끝까지 스스로 수행하게 만드는 방향입니다. 말하자면 자동화된 생물학자나 화학자처럼 작동하는 시스템을 만드는 비전입니다.

​

다른 한쪽은, 인간 연구자와 나란히 일하면서 아이디어를 제안하고, 실험을 설계하고, 실행을 돕고, 협업할 수 있는 진정한 연구 도구를 만들어가는 방향입니다. 다시 말해 사람을 완전히 대체하는 존재라기보다는, 사람과 함께 일하는 매우 강력한 파트너를 만드는 비전이라고 할 수 있습니다.

​

야쿠브 파초키 Jakub Pachocki : 음, 저는 그것을 단순히 ‘도구’라고만 부르지는 않을 것 같습니다. 물론 어떤 의미에서는 도구라고 할 수도 있겠지만, 결국에는 AI가 전체 과정에서 설계와 아이디어 구상의 상당 부분을 실제로 주도하는 단계까지 가게 될 것이라고 생각합니다.

​

그리고 서로 다른 아키텍처의 필요성에 대해 말씀드리면, 저희가 우선순위를 두고 있는 자연어 추론 같은 능력은 분명 매우 높은 수준의 범용성을 제공합니다. 다만 동시에, 특정한 대상을 더 잘 모델링하기 위해 그 목적에 맞는 별도의 모델을 학습시키는 편이 더 타당한 영역들도 분명 존재한다고 봅니다.

​

예를 들어 정말 뛰어난 유전체 모델을 만들고 싶다면, 장기적으로는 거대 언어 모델이 결국 가장 강력한 기반이 될 가능성도 있습니다.

49
범용 지능과 특화 해법

하지만 그렇다고 해서 그 경로가 반드시 가장 효율적인 방법이라고는 생각하지 않습니다. 단백질 구조 예측이나 그와 유사한 과업들도 마찬가지입니다. 결국 범용적인 지능이 매우 중요한 기반이 되기는 하겠지만, 특정한 문제를 가장 효율적으로 풀기 위해서는 그 대상에 특화된 모델이나 아키텍처가 별도로 필요해지는 경우가 충분히 있을 것이라고 생각합니다.

연구원들이 주도하는 새로운 질서

AI Labs의 의미, 모델은 영향을 주기 직전까지 이론일 뿐이다

​

제이콥 에프론 : 이제 화제를 조금 돌려서, 오픈AI 내부 이야기로 들어가 보고 싶습니다. 지난 2~3년 동안 전 세계에서 오픈AI라는 회사를 이토록 큰 관심으로 지켜본 곳은 거의 없었다고 생각합니다. 특히 많은 사람들이 궁금해한 것은, 이런 환경에서 연구 조직을 운영한다는 것이 실제로 어떤 일인가 하는 점이었습니다.

​

예전에 이 주제에 대해 잠깐 말씀하셨을 때, 연구자들이 몇 년 뒤의 모델이 어떤 모습일지를 깊이 고민할 수 있도록 충분한 안락함과 공간을 제공해, 말하자면 일종의 '동굴 속의 사람'처럼 깊이 몰입할 수 있게 해주는 것이 중요한 역할이라고 하셨던 것이 기억납니다.

​

그런데 지금은 앞서 말씀하신 것처럼 경쟁이 극도로 치열한 시기이기도 합니다. 특히 모두가 코딩 모델과 제품 개발에 강하게 집중하고 있는 국면이기도 합니다.

50
장기 연구와 실행 압박의 균형

이런 상황에서 장기적인 연구 몰입과 단기적인 실행 압박 사이의 균형을 실제로 어떻게 운영하고 계신지 궁금합니다. 그리고 이 조직을 총괄하는 입장에서, 이런 균형을 잡는 올바른 방식에 대해 최근 생각이 달라진 부분이 있는지도 함께 듣고 싶습니다.

​

야쿠브 파초키 Jakub Pachocki : 저희는 무엇보다도 고품질의 실험에 집중하려고 합니다. 그리고 우리가 실제로 진전을 이루고 있는지를 제대로 인식하려고 노력합니다. 결국 중요한 것은 결과를 두고 스스로에게 정직해지는 일이라고 생각합니다. 또 그런 정직함이 조직 안에서 자연스럽게 장려되도록 만드는 것도 매우 중요하다고 봅니다. 이런 기본 원칙은 지금도 달라지지 않았습니다.

​

물론 앞으로 오픈AI의 연구는 여러 면에서 계속 진화해 갈 것입니다. 하지만 그와 별개로, 여전히 해야 할 일은 아주 많이 남아 있다고 생각합니다. 그래서 지금 진행 중인 모든 프로젝트를 무조건 서둘러 끝내야 한다고 보지는 않습니다. 다시 말해, 연구를 운영하는 데 있어 가장 근본적인 원칙들 자체는 크게 변하지 않는다는 뜻입니다. 다만 한 가지 분명히 달라진 점이 있다면, 우리가 가장 유망하다고 판단하는 것들을 실제 성과로 연결해 내야 한다는 절박함의 수준은 이전보다 훨씬 더 높아졌다는 점입니다.

51
조직을 바꾼 51대49의 선택

​

제이콥 에프론 : 지금까지의 시간을 되돌아보면, 당시에는 정말 판단이 쉽지 않았고 거의 51대 49처럼 아슬아슬한 선택이었지만, 결과적으로는 회사의 성격 자체를 규정하게 된 결정들도 분명 있었을 것 같습니다. 그런 순간들이 무엇이었는지 궁금합니다. 조금 더 넓게 보면, 지난 7~8년을 한 편의 영화처럼 되짚어 보았을 때 특히 강하게 기억에 남는 장면들이 있을 것 같습니다. 당신에게 결정적인 전환점처럼 남아 있는 순간들은 무엇이었는지 듣고 싶습니다.

​

야쿠브 파초키 Jakub Pachocki : 오픈AI는 어느 시점부터, 더 이상 단순히 좋은 아이디어를 연구하는 조직에 머무를 수 없게 되었습니다. 이제는 대규모 컴퓨팅 클러스터를 직접 확보해야 했고, 실제로 모든 것을 확장하는 단계로 넘어가야 했습니다. 다시 말해 스케일링의 과학 자체를 정립하고, 그것을 뒷받침할 인프라까지 직접 구축해야 하는 국면에 들어선 것입니다. 저는 그것을 두 번째 단계, 즉 본격적인 확장의 시작이라고 생각합니다. 물론 앞으로도 다양한 기초 연구 아이디어를 계속 추구하겠지만, 이제는 그것이 실제로 확장 가능한지까지 함께 따져보며 평가하게 될 것입니다.

​

그다음에는 앞서 말씀드린 또 하나의 흥미로운 시기가 있었습니다. 바로 ChatGPT가 엄청난 반향을 일으켰던 시점입니다.

52
텍스트 모델이 먼저 부상한 이유

사실 저는 상황이 조금 다르게 전개될 것이라고 예상했습니다. 텍스트 모델이 이렇게 먼저 전면에 부상한 것은 개인적으로도 꽤 반가운 놀라움이었습니다. 저는 오히려 생성형 AI의 비디오 스타일 응용이 먼저 대중적으로 주목받고, 그 과정에서 장기적인 텍스트 중심 연구를 계속 밀고 갈지, 아니면 일정 부분 절충할지를 고민해야 하는 상황이 올 것이라고 생각했었습니다.

​

하지만 저희는 이미, 눈앞에서 어떤 기술이 큰 인기를 끌더라도 그것만으로는 충분하지 않으며, 우리가 목표로 하는 지점에 도달하려면 그 기술이 훨씬 더 발전해야 한다는 사실이 만들어내는 긴장감을 어느 정도 예상하고 있었습니다. 한동안 저희는 바로 그런 단계에 있었습니다. 그리고 이제는 그다음 단계로 들어서고 있다고 생각합니다. 실제로 AGI를 배치하거나 혹은 경제적으로 매우 큰 변화를 일으킬 수 있는 모델들을 현실 세계에 본격적으로 보급하기 시작하는 단계에 가까워지고 있다고 보고 있습니다.

​

제이콥 에프론 : 이제 인터뷰를 마무리하면서, 늘 마지막에 드리는 짧고 빠른 질문 몇 가지로 끝맺고 싶습니다. 앞에서 충분히 다루지 못했던 조금 더 넓은 주제들을 가볍게 짚어보는 질문들입니다. 그중 첫 번째로, 지난 1년 동안 AI 분야를 바라보는 당신의 생각이 달라진 점이 있다면 무엇인지 궁금합니다.

53
배포가 가까워질수록 생기는 긴장

​

야쿠브 파초키 Jakub Pachocki : 결국 우리가 만드는 AI 모델은 궁극적으로 세상에 실제 영향을 미치게 될 존재입니다. 그런데도 실제 배포에 아주 가까워지기 전까지는, 이 일이 상당히 이론적인 영역에 머무는 경우가 많습니다. 한동안은 알고리즘을 훈련하고 발전시키는 일 자체에 집중하게 되기 때문입니다. 저는 바로 그 지점에서 일종의 긴장감이 늘 존재한다고 생각해 왔습니다.

​

그런데 이제는 그 간극이 실제로 메워지기 시작하는 단계에 들어섰다고 보고 있습니다. 그래서 지금은 우리가 훨씬 더 많은 진전을 이뤄야 한다는 사실을 분명히 인식하고 있고, 이 기술을 현실 세계에 어떻게 배포하고 적용할 것인지에 훨씬 더 집중해야 할 시점이라고 느끼고 있습니다. 최근 들어 제가 특히 많이 고민하고 있는 주제이기도 합니다. 실제로 지난 1년을 돌아보면, 코딩 에이전트 같은 사례를 통해 AI가 우리 삶 속으로 매우 깊숙이 들어오기 시작한 것을 확인할 수 있었습니다. 단순히 흥미로운 기술이 아니라, 실제로 매우 유용하고 사람들의 삶에서 의미 있는 비중을 차지하는 무언가가 되어가고 있다는 뜻입니다.

​

그리고 이런 흐름이 계속 이어진다는 것은, 단순히 모델이 더 긴 호흡의 과업을 수행할 수 있게 된다는 의미만은 아닙니다.

54
신뢰할 수 있는 조력자의 조건

동시에 그것은 사용자가 필요할 때 언제든 의지할 수 있고 실제로 신뢰할 수 있는 조력자이자 동반자에 가까운 존재로 발전해 간다는 의미이기도 하다고 생각합니다.

​

제이콥 에프론 : 그리고 두 번째 질문입니다. 저는 특히 전형적인 LLM의 영역을 넘어서는 지점들이 무척 흥미롭다고 생각합니다. 그래서인지 요즘은 로봇공학에도 많은 관심이 쏠리고 있는 것 같습니다. 물론 로봇공학이 언제 완성된다고 정확히 짚어 말하기는 매우 어려울 것입니다. 하지만 이 분야에서도 결국 일종의 스케일링 법칙이 발견될 것이라고 보시는지, 혹은 ChatGPT 비슷한 전환점이 찾아올 것이라고 생각하시는지 궁금합니다.

​

야쿠브 파초키 Jakub Pachocki : 네, 저는 로봇공학에서도 결국 성공으로 이어질 가능성이 큰, 매우 유망한 알고리즘적 아이디어들이 분명 존재한다고 생각합니다. 그리고 그 아이디어들이 완전히 낯선 종류의 것이라기보다는, 우리가 이미 알고 있는 개념들의 연장선 위에 있는 경우가 많다고 봅니다. 그래서 로봇공학의 발전 일정에 대해서도 개인적으로는 꽤 낙관적으로 보고 있습니다. 물론 순수하게 가상 공간 안에서 작동하는 인공지능보다야 시간이 조금 더 걸릴 수는 있습니다. 하지만 그렇다고 해서 본질적으로 훨씬 더 먼 이야기라고 보지는 않습니다.

55
로봇공학과 다음 단계

​

제이콥 에프론 : 분명 지금도 모델이 앞으로 어떤 다음 단계를 수행할 수 있게 될지를 계속 고민하고 계실 것이라고 생각합니다. 그리고 이런 개선 속도가 앞으로도 계속 이어진다고 본다면, 결국 사회 전체에 어떤 영향을 미치게 될지에 대해서도 깊이 생각하고 계실 것 같습니다.

​

그렇다면 지금 우리가 사회적으로 이런 모델의 영향력을 논의할 때, 특히 놓치고 있거나 아직 충분히 깊게 고민하지 못하고 있는 부분은 무엇이라고 보시는지 궁금합니다. 어떤 지점이 실제보다 과소평가되고 있거나, 반대로 아직 제대로 프레임이 잡히지 않은 핵심 문제라고 생각하시는지도 함께 듣고 싶습니다.

​

야쿠브 파초키 Jakub Pachocki : 수많은 지적 노동이 자동화되는 시점에 이르면, 분명 매우 큰 문제들이 함께 따라올 것이라고 생각합니다. 그리고 그 문제들 가운데는 아직 뚜렷한 해법이 보이지 않는 것들도 많습니다. 가장 직접적으로는 일자리 문제와 부의 집중 현상이 나타날 가능성이 큽니다. 이는 결국 정책 입안자들이 실질적으로 개입해야 하는 문제라고 봅니다. 물론 이 변화가 장기적으로는 사회 전체에 긍정적인 결과를 가져올 수 있다는 낙관적인 시각도 있습니다.

​

하지만 더 근본적으로 보면, 과거에는 매우 가치 있고 비용도 많이 들며 사람의 숙련을 필요로 했던 일들이 이제는 훨씬 저렴하게 수행될 수 있게 된다는 점이 핵심입니다.

56
일자리·부의 집중과 통제

장기적으로는 좋은 일일 수 있어도, 이 전환이 생각보다 매우 빠르게 일어날 수 있다는 점이 중요합니다.

​

또 하나 중요한 문제는 권한과 통제의 집중입니다. 만약 실제로 자동화된 연구소나, 수많은 업무를 스스로 처리할 수 있는 자동화된 기업이 등장하게 된다면, 극소수의 사람들이 엄청난 영향력을 쥐게 될 수 있습니다. 그 파급력은 매우 클 것이고, 여기에 로봇까지 결합된다면 상황은 더욱 극적으로 바뀔 것입니다. 다만 꼭 로봇이 없어도 본질은 크게 다르지 않다고 생각합니다. 소수의 인원만으로도 막대한 힘을 행사할 수 있는 조직들이 등장할 수 있기 때문입니다.

​

그래서 앞으로는 이런 새로운 형태의 강력한 조직과 시스템에 대해 어떤 거버넌스가 필요할지를 진지하게 고민해야 한다고 봅니다. 우리는 이런 존재들을 어떤 방식으로 바라보고, 어떤 원칙 아래에서 통제하고, 또 사회적으로 어떻게 받아들여야 할지를 새롭게 정의해야 하는 단계에 들어서고 있다고 생각합니다.

​

제이콥 에프론 : 최근 제 마음속에 가장 크게 자리 잡고 있는 질문이 하나 있습니다. 얼마 전 아이를 갖게 되었는데, 그래서 10년 뒤 그 아이의 삶이 어떤 모습일지를 자주 생각하게 됩니다. 특히 당신은 이 분야를 누구보다 가까이에서 보고 계시기 때문에 더 궁금합니다.

57
다음 세대가 배울 것

AI의 발전을 가까이에서 지켜보며 일해 온 경험이, 다음 세대를 어떻게 키워야 하는지에 대한 생각에 어떤 변화를 가져왔는지 듣고 싶습니다. 앞으로의 시대를 살아갈 아이들에게 무엇이 중요해질 것이라고 보시는지, 그리고 부모나 사회가 어떤 관점으로 준비해야 한다고 생각하시는지도 궁금합니다.

​

야쿠브 파초키 Jakub Pachocki : 결국 우리 모두의 과제는 AI를 만드는 일이라고 생각합니다. 더 정확히 말하면, 인간이 주도권을 쥔 방식으로 세상을 설계하는 일입니다. 방향을 정하는 것은 결국 인간이어야 합니다. 지금 우리가 중요하게 여기고 있는 많은 기술적 과제들도, 언젠가는 어쩌면 하나의 소일거리처럼 보이게 될 수 있습니다. 하지만 지금 이 순간에는 그것이 실제로 발전을 이루기 위해 반드시 해내야 하는 일들이기도 합니다.

​

앞으로의 핵심 과제는 무엇이 정말 중요한지, 그리고 우리가 실제로 무엇을 해야 하는지를 더 잘 파악하는 쪽으로 이동하게 될 것이라고 생각합니다. 그런 세상에서는 사람들은 결국 더 많은 일을 하게 될 것이고, 동시에 지금보다 훨씬 더 흥미로운 일들을 하게 될 가능성이 크다고 봅니다.

​

그리고 그런 문제들을 깊이 있게 생각하고 다루기 위해서는, 어떤 방식으로 습득하든 일정 수준의 기술 이해는 여전히 필요할 것이라고 생각합니다.

58
인터뷰의 마무리

결국 모든 사람에게는 일종의 기초 교육처럼 기술에 대한 기본적인 이해가 계속 중요하게 남게 될 것입니다.

​

제이콥 에프론 : 정말 흥미로운 시간이었습니다. 오늘 이렇게 함께해 주시고, 이렇게 다양한 주제에 대해 깊이 있는 이야기를 들려주셔서 진심으로 감사드립니다. 마지막으로 청취자분들께 전하고 싶은 말씀이 있다면 자유롭게 부탁드립니다. 지금 진행 중인 연구 이야기여도 좋고, 앞으로 기대하고 계신 제품이나 방향성에 대한 이야기여도 좋습니다. 혹은 꼭 짚고 넘어가고 싶은 메시지가 있다면 그것도 좋습니다. 편하게 말씀해 주시면 됩니다.

​

야쿠브 파초키 Jakub Pachocki : 방금까지 이야기한 문제들, 그리고 정렬과 모니터링 가능성에 관한 질문들은 앞으로 더욱 시급한 과제가 될 것이라고 생각합니다. 그리고 이것은 결코 AI 연구자들만의 과제라고 보지 않습니다. 정책 입안자들의 과제이기도 하고, 더 넓게는 우리 사회 전체가 함께 진지하게 고민해야 할 문제라고 생각합니다. 그런 점에서 이런 주제에 대한 담론이 실제로 형성되기 시작하고 있다는 사실은 매우 반가운 일입니다. 다만 앞으로는 이런 논의가 지금보다 훨씬 더 많아져야 한다고 생각합니다.

큰 흐름 읽기 (Bird's-eye view)

59
정렬·모니터링의 사회적 과제

2026-03-27

앤스로픽 CEO 다리오 아모데이 인터뷰 : "Extremely fast, but not infinitely fast" (​바로가기)

2026-03-05

AI 사이클 한 눈에 보기, SemiAnalysis 인터뷰 : "거품은 없다. ARR $100B가 온다" (바로가기)

2025-12-17

AI 버블론을 잠재우는 숫자들 : 엔터프라이즈 AI $37B 시장의 현주소 (바로가기)

2025-10-08

오픈AI 퇴사자의 글 #1 : 2027년 AGI가 온다 (바로가기)

엔비디아 (NVDA)

2026-03-17

엔비디아 GTC 2026 : 7개의 칩, 5개의 랙 시스템, 그리고 하나의 AI 슈퍼컴퓨터 (바로가기)

2026-02-26

엔비디아 4Q25 실적발표 : 담백한 실적발표, 핵심은 모두 그린라이트 (바로가기)

2026-01-02

엔비디아가 $20B를 주고 데려온 남자 : Groq 창업자 조나단 로스의 통찰 (바로가기)

광학 (Optics)

2026-03-20

OFC 2026 : 광학이 중요해지고 있는 이유들, 태풍의 눈에 있는 두 가지 기업 분석 (바로가기)

60
본문의 관련 링크와 고지

2026-03-13

AI 인프라의 새로운 병목 '광학' : 앞으로의 2~3년 가파른 채택곡선 (트랜시버, OCS, CPO) (바로가기)

2026-03-06

비아비 솔루션스(VIAV) 기업분석 : 광학의 시대, 더 많은 테스트가 필요해 (바로가기)

메모리 (Memory)

2026-03-19

마이크론 1Q26 실적발표 : 흔들릴 이유가 없는 어닝서프라이즈, 구조적 성장주로 거듭나기 (바로가기)

2025-01-21

추론의 시대, 핵심이 된 메모리 : 메모리 쇼티지를 떠받치고 있는 힘 (바로가기)

2026-01-07

엔비디아 CES 2026 : Vera Rubin의 시대, ICMS가 불러올 메모리 지각변동 (바로가기)

네오클라우드 (Neocloud)

2026-02-22

네오클라우드 뜯어보기 #2 : 새로운 시대의 AI 계급도, 전력을 돈으로 바꾼 Powered Shell (바로가기)

2026-02-10

네오클라우드 뜯어보기 : GPU 임대의 경제학, 네오클라우드 BIG 4 비교분석 (바로가기)

4

그럼에도 빠진내용 정리

잡담·곁다리 내용
  • 모든 flow 단계는 보존 원문 구간을 문자 그대로 순서대로 연결해 인터뷰의 질문·답변·작성자 코멘트·관련 링크를 회수했다.
생략 기록
  • 이미지·표의 독립적인 시각 배치와 강조는 텍스트 원문만으로 판단하지 않았다.
  • 본문의 바로가기 대상은 추가로 열람하거나 분석하지 않았다.

그럼에도 빠진내용 정리

이미지·서식의 시각 정보
보존 텍스트에서 확인되는 문장과 링크는 flow에 그대로 회수했다. 이미지·표만으로 전달된 배치나 시각적 강조는 별도 판독하지 않았다.
과거 글과 바로가기
본문의 관련 글 제목·날짜·URL은 원문 순서대로 남겼지만, 연결된 문서의 내용을 새 근거로 추가하지 않았다.
인터뷰 발언의 성격
목표 시점, 기술 전망, 조직·사회에 대한 평가는 인터뷰 화자와 작성자의 관점으로 보존했으며 확정된 미래 사실로 바꾸지 않았다.
원문 확인

document_work_runner prepare가 입력 원문을 수정 없이 보존했다.