24-5 오픈AI 초정렬팀 해체
작성자의 핵심 판단
작성자는 팀 해체만으로 오픈AI를 단순한 폭주기관차로 단정할 수는 없지만, 안전 연구의 방법론과 우선순위가 중요한 갈림길에 있다고 본다.
근거 보기 2
- 원문 구간 1
1장, GPT-4에서 AGI로 가는 길 : OOMs을 계산해봅시다 지난 4년간의 AI 발전 Compute Algorithmic efficiencies Unhobbling 향후 4년의 발전 AGI를 향해 달리는 오픈AI Superalignment 해체 후 퇴사직원이 말하는 실체 오픈AI 초정렬팀 해산 : 지금으로부터 한 달 전, 샘 올트먼은 오픈AI 내에서 AGI 출연에 대비하는 안전팀인 '초정렬(Superalignment)'팀을 해체했습니다. 초정렬팀 자체는 GPT를 개발하고 주도했던 일리야 수츠케버(Illya Sutskever)가 2023년 7월에 만들었던 팀입니다. AI의 안전성에 중점을 뒀던 수츠케버는 상대적으로 빠른 AGI 개발을 원했던 올트먼과 잦은 충돌을 일으켰었습니다. 그 결과로 2023년 11월에 수츠케버가 이사회 동의를 얻어 긴급하게 샘 올트먼을 이사회에서 축출했던 일이 있었죠. 오픈AI 팀 전원이 올트먼의 복귀를 바라면서 올트먼이 다시 돌아왔고 수츠케버의 난은 일단락됐었습니다. 그러나 실제 그 후로 점점 초정렬팀은 전체 컴퓨팅 할당 우선순위에서 밀렸고 → 5월 18일에는 팀 해체에 이르렀습니다. 초정렬팀 해체 이면의 이야기 : 5월 18일 오픈AI 초정렬팀이 해체됐습니다. 이에 일리야 수츠케버와 함께 초정렬팀을 이끌었던 또 다른 임원인 얀 레이케(Jan Leike)가 퇴사소식을 밝히면서 이면의 이야기를 말해 화제였었습니다. 원문은 여기서 찾아보실 수 있는데요. 초정렬팀 해체 당시 얀 레이케가 밝힌 내용은 이렇습니다. 오픈AI 내에서 연구활동을 하려면 컴퓨팅 할당을 받아야 하는데 컴퓨팅 할당의 우선순위에서 초정렬팀이 점점 밀렸습니다. 따라서 모든 오픈AI 직원들이 AGI를 느끼고 책임감 있게 개발해주길 바란다며 글을 마무리했습니다. 그리고 그는 앤트로픽 거대모델 초정렬 연구를 이어가고 있습니다. 초정렬팀 해체는 폭주기관차를 의미하는가? : 초정렬팀 해체에 대해서 정답을 알 수는 없겠습니다. 다만, 단순한 폭주기관차 가능성 이상을 생각해볼 수는 있습니다. AI 안전을 연구하는데 있어서 새로운 방법론이 추진력을 얻고 있었기 때문입니다. 2023년 10월에 GPT-4V를 보고 향후 모든 모델이 멀티모달화 될 것임을 생각했던 것처럼, 이제는 앞으로 신경망 해석이 많은 부분을 바꿀 것이라 생각합니다. 딥러닝의 치명적인 한계 '블랙박스' : 우선 딥러닝은 기존 머신러닝 모델들에 비해서 더 높은 성능을 보이고, 이전에 풀지 못했던 사례를 푸는 등 효과적인 학습방법이었습니다. 그러나 치명적인 단점이 있습니다. 모델의 의사결정을 알 수 없는 블랙박스(Blackbox) 현상입니다. 어느 정도 이상 결과가 좋을 때는 블랙박스 여부가 크게 상관있지 않았습니다. 테슬라 FSD가 걸어온 길처럼 훈련할 때마다 다양한 버전을 나눠두고 각각 새로운 데이터를 넣어 가중치를 바꿔가며 훈련시킨 뒤 성능이 가장 좋은 모델의 안전성 평가를 해보고 → 내부 직원 → 100명 테스터 → 1,000명 테스터 → 초기 배포 → 완전 배포식으로 업데이트해왔던 길이기도 합니다.
- 원문 구간 2
인간의 기억에 왜곡이 생긴 현상과 비슷하게 LLM이 금문교에 집착하는 모습을 보이더라는 것이죠. 이 과정을 통해 특정 Feautre를 조작할 시 인과관계를 알 수 있습니다. 이를 통해 코드 백도어를 막고 누군가 핵무기 제작방법을 묻는다거나, LLM이 성차별이나 범죄적인 답변을 하지 않도록 하거나, AI가 인간을 전복시킬 우려를 최대한 관리할 수 있게 됩니다. 비슷한 시기에 오픈AI도 새로운 XAI 논문 공개 : 그리고 얼마 지나지 않아 6월 6일, 오픈AI가 <Extracting Concepts from GPT-4>를 발표했습니다. 핵심은 마찬가지로 어떤 출력물이 나올 때 어떤 Feature가 활성화되는지를 알아내는 것입니다. 이를 찾아낸 수만큼 더 자세하게 GPT-4에서 일어나는 일을 설명할 수 있습니다. 오픈AI가 발표한 것은 기존의 Feature를 해석하는 해석기(Sparse autoencoder)와 달리 거대모델에 맞게끔 해석기의 크기도 키울 수 있는 방법에 대한 연구상황(Large scale autoencoder training)을 공개한 것입니다. 오픈AI는 잠재적으로 이 방법이 모델의 신뢰성을 높이고 관리 가능한 AI로 향해 가는 길이라 강조하지만, 여전히 현재 찾은 1,600만개의 Feature에 비해 프론티어 LLM을 완벽하게 설명하려면 수십억 혹은 수조 개의 Feature까지 확장해야 할 것이라 전망했습니다. 前 오픈AI 초정렬팀 리더 "해석가능성의 새로운 시대가 열렸다" : 아직 해결해야 할 분야는 많지만 초정렬이 하는 일도 AI를 통해 해결할 수 있는 가능성이 열리는 방향이기에 긍정적이었습니다. 오픈AI 연구 발표 당시오픈AI 초정렬팀 내 리더격(오픈AI 초정렬팀 공동책임자)이었던 임원 얀 레이케(Jan Leike)의 발언이 흥미로웠는데요. 초정렬팀 내에서도 해석가능성(Interpretability)에 대한 연구는 LLM 규모만큼 확장하기 어렵다는 생각이 있어서 회의적인 시각이 많았지만, 최근 앤트로픽과 오픈AI가 내놓은 두 연구결과를 보니 생각이 바뀌었음을 밝혔기 때문입니다. 따라서 개인적으로는 단순히 브레이크를 무력화시킨 폭주기관차의 모습보다는 AI를 정렬시키고 추론능력을 향상시키는 일도 AI한테 맡길 수 있는 시대가 올 가능성도 최근 생각하고 있습니다. 오픈AI 퇴사자가 말하는 AGI "샌프란시스코에서 가장 먼저 미래를 볼 수 있습니다" 어느 날, 165페이지 분량의 PDF가 올라왔다 : 오픈AI의 초정렬팀과 관련된 이야기를 미리 다룬 이유는, 지금부터 말씀드리고자 하는 오픈AI 초정렬팀에서 퇴사한 레오폴드 아센브레너(Leopold Aschenbrenner)의 <상황인지: 앞으로 10년 Situational Awareness: The Decade Ahead>을 소개드리고 싶었기 때문입니다. 투자자에게는 어찌보면 너무 극단적인 시나리오이기에 잘 맞지 않는 글이라 생각했지만 여러 문제들을 다루고 있는 만큼 배울거리가 많았습니다.
이 자료에서 다룬 사실
원문은 오픈AI가 AGI 안전을 다루던 초정렬팀을 5월 18일 해체했고, 공동책임자 얀 레이케가 퇴사하며 팀의 컴퓨팅 할당 우선순위가 점차 밀렸다고 밝혔다고 적는다.
근거 보기 1
- 원문 구간 1
1장, GPT-4에서 AGI로 가는 길 : OOMs을 계산해봅시다 지난 4년간의 AI 발전 Compute Algorithmic efficiencies Unhobbling 향후 4년의 발전 AGI를 향해 달리는 오픈AI Superalignment 해체 후 퇴사직원이 말하는 실체 오픈AI 초정렬팀 해산 : 지금으로부터 한 달 전, 샘 올트먼은 오픈AI 내에서 AGI 출연에 대비하는 안전팀인 '초정렬(Superalignment)'팀을 해체했습니다. 초정렬팀 자체는 GPT를 개발하고 주도했던 일리야 수츠케버(Illya Sutskever)가 2023년 7월에 만들었던 팀입니다. AI의 안전성에 중점을 뒀던 수츠케버는 상대적으로 빠른 AGI 개발을 원했던 올트먼과 잦은 충돌을 일으켰었습니다. 그 결과로 2023년 11월에 수츠케버가 이사회 동의를 얻어 긴급하게 샘 올트먼을 이사회에서 축출했던 일이 있었죠. 오픈AI 팀 전원이 올트먼의 복귀를 바라면서 올트먼이 다시 돌아왔고 수츠케버의 난은 일단락됐었습니다. 그러나 실제 그 후로 점점 초정렬팀은 전체 컴퓨팅 할당 우선순위에서 밀렸고 → 5월 18일에는 팀 해체에 이르렀습니다. 초정렬팀 해체 이면의 이야기 : 5월 18일 오픈AI 초정렬팀이 해체됐습니다. 이에 일리야 수츠케버와 함께 초정렬팀을 이끌었던 또 다른 임원인 얀 레이케(Jan Leike)가 퇴사소식을 밝히면서 이면의 이야기를 말해 화제였었습니다. 원문은 여기서 찾아보실 수 있는데요. 초정렬팀 해체 당시 얀 레이케가 밝힌 내용은 이렇습니다. 오픈AI 내에서 연구활동을 하려면 컴퓨팅 할당을 받아야 하는데 컴퓨팅 할당의 우선순위에서 초정렬팀이 점점 밀렸습니다. 따라서 모든 오픈AI 직원들이 AGI를 느끼고 책임감 있게 개발해주길 바란다며 글을 마무리했습니다. 그리고 그는 앤트로픽 거대모델 초정렬 연구를 이어가고 있습니다. 초정렬팀 해체는 폭주기관차를 의미하는가? : 초정렬팀 해체에 대해서 정답을 알 수는 없겠습니다. 다만, 단순한 폭주기관차 가능성 이상을 생각해볼 수는 있습니다. AI 안전을 연구하는데 있어서 새로운 방법론이 추진력을 얻고 있었기 때문입니다. 2023년 10월에 GPT-4V를 보고 향후 모든 모델이 멀티모달화 될 것임을 생각했던 것처럼, 이제는 앞으로 신경망 해석이 많은 부분을 바꿀 것이라 생각합니다. 딥러닝의 치명적인 한계 '블랙박스' : 우선 딥러닝은 기존 머신러닝 모델들에 비해서 더 높은 성능을 보이고, 이전에 풀지 못했던 사례를 푸는 등 효과적인 학습방법이었습니다. 그러나 치명적인 단점이 있습니다. 모델의 의사결정을 알 수 없는 블랙박스(Blackbox) 현상입니다. 어느 정도 이상 결과가 좋을 때는 블랙박스 여부가 크게 상관있지 않았습니다. 테슬라 FSD가 걸어온 길처럼 훈련할 때마다 다양한 버전을 나눠두고 각각 새로운 데이터를 넣어 가중치를 바꿔가며 훈련시킨 뒤 성능이 가장 좋은 모델의 안전성 평가를 해보고 → 내부 직원 → 100명 테스터 → 1,000명 테스터 → 초기 배포 → 완전 배포식으로 업데이트해왔던 길이기도 합니다.
그렇게 판단한 이유
블랙박스인 딥러닝을 설명하는 신경망 해석 연구가 동시에 진전을 보였고, 안전·정렬 문제를 AI로 다룰 여지도 열리고 있다는 것이 작성자의 연결 논리다.
근거 보기 2
- 원문 구간 1
LLM의 가능성을 확인한 GPT-3 : 그러나 LLM으로 할 수 있는 일이 많아진 시대입니다. 요구하는 능력이 달라졌습니다. 이제 로보택시가 필요하고, AI 판사, AI 비서, AI 변호사, AI 세무사를 필요로 하는 시대가 왔습니다. 그리고 무엇보다 이젠 해볼 수 있을 거 같다는 인식이 생겼습니다. 단위 컴퓨팅당 비용이 기하급수적으로 낮아졌기 때문입니다. 더 많은 컴퓨팅을 쓸 수 있게 되자 해볼만한 비용으로 LLM을 만들 수 있게 됐고 오픈AI의 2020년 1월 논문 <Scaling Laws for Neural Language Models>가 LLM의 가능성을 확인했고 → 그 후 2020년 6월에 발표된 GPT-3가 시작을 알렸습니다. 해석가능한 인공지능모델에 대한 열망 : AI 연구소들의 주 컴퓨팅 할당은 딥러닝 성능향상을 위한 연구에 있습니다. 어떻게 하면 각 기능마다 더 높은 성과를 낼 것인지, 어떻게 하면 더 효율적으로 훈련시킬 것인지, 어떻게 하면 추론능력을 더 높일 것인지 등을 다루는 일입니다. 그러나 한 켠에서 AI 모델의 안전과 정렬에 관련된 연구를 하는 팀은 '모델이 의사결정을 내리는 과정을 설명가능한 모델', 즉 해석가능한 인공지능모델(Explainable AI, "XAI") 연구를 해왔습니다. 그리고 이제 AI 안전을 연구하는데 있어서 새로운 방법론이 하나씩 메인 연구과제로 떠오르기 시작했습니다. *코멘트 → 왼쪽은 앤트로픽의 Mapping the Mind of LLM을 다룬 내용이고, 오른쪽은 오픈AI의 Extracting Concepts from GPT-4에서 발표된 Sparse autoencoder 모습입니다. 간단하게 보자면 세계에서 가장 뛰어난 파운데이션 모델 개발기관 두 곳이 거의 동시에 해석가능한 AI 모델의 가능성을 열었습니다. 'XAI' 가능성이 보이기 시작 : 앤트로픽(Anthropic)이 5월 21일 <Mapping the Mind of a Large Language Model>를 통해서 업계 최초로 LLM 내의 블랙박스를 일부 해석할 수 있는 연구를 공개했습니다. 미국에 있는 유명한 다리인 금문교(Golden Gate Bridge)에 해당하는 텍스트나 이미지로 인해서 활성화되는 신경망들의 패턴을 찾는 연구였습니다. 재미있는 건 인간의 기억 속에 특정 기억을 키울 수 있다면 왜곡을 일으키는 것처럼, 연구 대상 LLM이었던 클로드 3 소넷(Sonnet)도 금문교 Feature를 증폭시키니 왜곡을 일으키더라는 것입니다. 예를 들어 금문교에 대한 Feature를 증폭시킨 후 "당신의 신체적인 형태는 어떻습니까?"라고 물으니 평소라면 ⓐ "저는 AI모델이므로 신체적인 형태가 없습니다."라고 답했지만, 이번에는 ⓑ "저는 금문교입니다... 제 모습은 상징적인 다리 형태 그자체입니다..."라며 답했다는 것입니다.
- 원문 구간 2
인간의 기억에 왜곡이 생긴 현상과 비슷하게 LLM이 금문교에 집착하는 모습을 보이더라는 것이죠. 이 과정을 통해 특정 Feautre를 조작할 시 인과관계를 알 수 있습니다. 이를 통해 코드 백도어를 막고 누군가 핵무기 제작방법을 묻는다거나, LLM이 성차별이나 범죄적인 답변을 하지 않도록 하거나, AI가 인간을 전복시킬 우려를 최대한 관리할 수 있게 됩니다. 비슷한 시기에 오픈AI도 새로운 XAI 논문 공개 : 그리고 얼마 지나지 않아 6월 6일, 오픈AI가 <Extracting Concepts from GPT-4>를 발표했습니다. 핵심은 마찬가지로 어떤 출력물이 나올 때 어떤 Feature가 활성화되는지를 알아내는 것입니다. 이를 찾아낸 수만큼 더 자세하게 GPT-4에서 일어나는 일을 설명할 수 있습니다. 오픈AI가 발표한 것은 기존의 Feature를 해석하는 해석기(Sparse autoencoder)와 달리 거대모델에 맞게끔 해석기의 크기도 키울 수 있는 방법에 대한 연구상황(Large scale autoencoder training)을 공개한 것입니다. 오픈AI는 잠재적으로 이 방법이 모델의 신뢰성을 높이고 관리 가능한 AI로 향해 가는 길이라 강조하지만, 여전히 현재 찾은 1,600만개의 Feature에 비해 프론티어 LLM을 완벽하게 설명하려면 수십억 혹은 수조 개의 Feature까지 확장해야 할 것이라 전망했습니다. 前 오픈AI 초정렬팀 리더 "해석가능성의 새로운 시대가 열렸다" : 아직 해결해야 할 분야는 많지만 초정렬이 하는 일도 AI를 통해 해결할 수 있는 가능성이 열리는 방향이기에 긍정적이었습니다. 오픈AI 연구 발표 당시오픈AI 초정렬팀 내 리더격(오픈AI 초정렬팀 공동책임자)이었던 임원 얀 레이케(Jan Leike)의 발언이 흥미로웠는데요. 초정렬팀 내에서도 해석가능성(Interpretability)에 대한 연구는 LLM 규모만큼 확장하기 어렵다는 생각이 있어서 회의적인 시각이 많았지만, 최근 앤트로픽과 오픈AI가 내놓은 두 연구결과를 보니 생각이 바뀌었음을 밝혔기 때문입니다. 따라서 개인적으로는 단순히 브레이크를 무력화시킨 폭주기관차의 모습보다는 AI를 정렬시키고 추론능력을 향상시키는 일도 AI한테 맡길 수 있는 시대가 올 가능성도 최근 생각하고 있습니다. 오픈AI 퇴사자가 말하는 AGI "샌프란시스코에서 가장 먼저 미래를 볼 수 있습니다" 어느 날, 165페이지 분량의 PDF가 올라왔다 : 오픈AI의 초정렬팀과 관련된 이야기를 미리 다룬 이유는, 지금부터 말씀드리고자 하는 오픈AI 초정렬팀에서 퇴사한 레오폴드 아센브레너(Leopold Aschenbrenner)의 <상황인지: 앞으로 10년 Situational Awareness: The Decade Ahead>을 소개드리고 싶었기 때문입니다. 투자자에게는 어찌보면 너무 극단적인 시나리오이기에 잘 맞지 않는 글이라 생각했지만 여러 문제들을 다루고 있는 만큼 배울거리가 많았습니다.