왜 수학과 코딩에서 먼저 성능이 빠르게 높아졌는가?
이 자료가 더한 내용
강화학습은 문제를 푼 뒤 정답 여부를 확인하는 방식이며, 수학의 정답 검증과 코딩의 테스트 실행처럼 보상 신호를 자동으로 만들 수 있는 과제에서 발전이 빨랐다고 설명한다.
근거 보기 2
- 원문 구간 1
강화학습에서는 모델에게 어떤 문제를 풀게 한 다음, 실제로 정답을 맞혔는지 확인합니다. 지금 말씀하신 것도 바로 이런 방식에 해당합니다. 조 론스데일 : 그런데 수학이나 컴퓨터과학에서는 답이 맞았는지 확인하기가 비교적 쉽지만, 연애나 시처럼 훨씬 주관적인 영역에서는 평가하기가 상당히 어렵지 않습니까? 숄토 더글라스 : 그래서 수학과 컴퓨터과학에서 모델의 능력이 다른 분야보다 훨씬 빠르게 발전해온 것입니다. 다만 저희는 다른 종류의 문제들도 결국 이런 강화학습의 틀 안에 넣을 수 있다고 생각합니다. 생각보다 그렇게 어려운 문제는 아닙니다. 니콜라스 마웰 : 수학과 컴퓨터과학이 먼저 발전한 데에는 분명 기술적인 이유가 있습니다. 하지만 사람과 조직의 특성으로 설명할 수 있는 부분도 꽤 크다고 생각합니다. 어떤 사람들을 모아놓고 이 문제를 풀게 했는지를 생각해보면 됩니다. 대부분 수학이나 컴퓨터과학을 전공한 사람들을 모아놓고 지능을 만들라고 했습니다. 그러면 자연스럽게 자신들이 가장 잘 이해하고 가장 관심 있는 분야의 지능부터 만들게 됩니다. 실제로 그쪽이 훨씬 다루기 쉽기도 합니다. 좋은 모델을 학습시키다 보면 모델이 실제로 어떤 답을 내놓고 어떤 방식으로 문제를 풀고 있는지 직접 읽어보는 데 놀라울 정도로 많은 시간을 씁니다. 그래야 모델의 능력이 어디까지 올라왔는지, 어떤 부분에 더 집중해야 하는지, 무엇을 개선해야 하는지를 판단할 수 있습니다. 그런데 자신이 전문가이고, 지금 모델 안에서 무슨 일이 벌어지고 있는지 이해할 수 있는 분야라면 이런 작업이 훨씬 쉬워집니다.
- 원문 구간 2
*코멘트 → 기술적으로는 강화학습의 성과가 보상 신호(Reward Signal)의 품질에 크게 좌우된다는 이야기입니다. 수학은 정답 검증, 코딩은 테스트 실행을 통해 모델의 시행착오를 자동으로 평가할 수 있지만, 현실 세계의 주관적인 과제에서는 보상 자체를 설계하기가 어렵습니다 조 론스데일 : 모델을 볼 때 일종의 사람처럼 생각하기도 합니까? 니콜라스 마웰 : 저는 개인적으로는 그렇게 생각하지 않는 편입니다. 물론 모델을 어느 정도 사람처럼 받아들이는 사람들도 있을 것이고, 앤스로픽 안에도 그런 사람이 분명 있을 겁니다. 조 론스데일 : 우리 뇌는 어느 정도 그렇게 작동하도록 만들어져 있지 않습니까. 눈앞에 있는 상대를 하나의 사람으로 인식하고, 그 사람이 어떤 감정을 느낄지 짐작하면서 대화를 이어가도록 되어 있습니다. 진화 과정에서 다른 지적 존재를 하나의 의도를 가진 존재로 받아들이도록 하는 여러 기능이 뇌에 생긴 셈입니다. 그렇다면 매일 이런 모델과 함께 일하다 보면, 어느 순간 모델을 사람처럼 생각하게 되는 것을 피하기가 꽤 어려울 것 같습니다. 숄토 더글라스 : 이걸 단순한 도구로 볼 것인지, 아니면 하나의 주체로 볼 것인지는 꽤 중요한 논쟁 중 하나입니다. 저는 개인적으로는 '주체'라는 관점이 더 유용하다고 생각합니다. 도구라면 기본적으로 사람이 계속 직접 조작해야 합니다. 그런데 이런 모델은 조금 다릅니다. 매우 지능적인 무언가를 세상에 풀어놓고, 사용자를 대신해서 스스로 행동하게 만드는 것에 가깝습니다. 그런 의미에서는 모델을 단순한 도구라기보다 하나의 주체, 혹은 에이전트로 보는 편이 훨씬 유용할 때가 많습니다.