26-4 앤스로픽 Mythos Preview 출시
작성자의 핵심 판단
Mythos Preview의 공개는 더 높은 지능의 모델을 내부에서 먼저 사용해 다른 AI 연구소보다 앞서기 시작하는 구간이라는 의미로 본다.
근거 보기 2
- 원문 구간 1
흥미로운 건 향후 Claude Cowork처럼 AI가 스스로 검색하고 인터넷이나 이메일, 폴더를 돌아다니며 작업할 때 중요한 Agentic Search and Computer Use 능력을 보는 벤치마크 중 BrowseComp를 측정할 때 토큰당 지능 압축도가 거의 3배 가까이 좋아졌다는 게 핵심입니다. Opus 4.6에서는 평균적으로 작업당 30만 개 이상의 토큰을 써서 75.8%대 정확도를 보였는데, Mythos Preview에서는 평균 작업당 ~15만 개의 토큰을 써서 84.9%의 정확도를 보이고 있습니다. 다시 한 번 사전훈련을 통해서 다시 한 번 토큰당 지능 효율을 크게 끌어올렸습니다. Claude Mythos Preview 모델에 대한 System Card는 여기서 확인하실 수 있습니다. 앤스로픽은 내부적으로 2월 24일부터 Mythos Preview 모델을 사용하고 있었다고 밝혔습니다.
- 원문 구간 2
다리오 아모데이가 인터뷰에서 말했던 것처럼 '더 높은 지능을 가진 모델을 내부적으로 사용함으로써 이것 자체로 다른 AI Labs들에 비해서 앞서가기 시작하는 구간'이 시작됐다는 의미이기도 합니다. (2) 오픈AI Codex WAU가 300만 명을 넘겼습니다. 2026년 초 50만 명 → 2월 초 100만 명 → 2월 말 160만 명 → 3월 초 200만 명 → 4월 초 300만 명으로 Claude Code와 침투 속도 자체는 비슷하게 빠릅니다. 샘 올트먼은 WAU가 1,000만 명에 달할 때까지 100만 명씩 증가할 때마다 개발자들의 주간 사용 한도를 리셋해주겠다 말했습니다. 오픈AI도 Spud를 준비 중이므로 Spud의 성과가 어떻게 나오느냐가 중요합니다. 요즘개인적으로는 성능저하를 여러 번 체감하고 나서 제미나이는 안 쓴지가 꽤 오래됐고, GPT-5.4-Pro-Extended랑 GPT-5.4-thinking-Heavy(심화추론)를 오가면서 워낙 잘 쓰고 있다보니 GPT-6이 빨리 나왔으면 좋겠네요.
이 자료에서 다룬 사실
앤스로픽은 Mythos 모델의 red team 테스트에서 소프트웨어 취약점 탐색·악용 능력이 보편적 인간 수준을 넘었다고 보고했고, Mythos Preview가 주요 OS와 웹브라우저를 포함해 수천 건의 심각한 취약점을 찾았다고 전한다. 주요 파트너 40곳에 먼저 제공해 방어 시간을 주는 Project Glasswing도 발표했다.
근거 보기 1
- 원문 구간 1
이에 주요 파트너사 40곳이랑 협업해서 이들에게 먼저 제공함으로써 방어자들이 공격자들보다 먼저 사용할 수 있게 해주겠다는 프로젝트입니다. 한 문장으로 보자면 "이 모델 퍼지면 사이버 공격이 엄청날 수 있을 것 같은데, Mythos를 먼저 줄테니 이 모델 가지고 방어할 시간을 줄게"입니다. 주요 파트너사에는 AWS, Anthropic, Apple, Broadcom, Cisco, Crowdstrike, Google, JPM, Linux Foundation, Microsoft, Nvidia, Palo Alto Networks 등이 있습니다. 그러면서 여기에 Mythos Preview 버전(2024년 9월 OpenAI o1-preview에서 그랬듯이, Mythos Preview도 향후 GA에서는 사후훈련으로 더 강화할 수도 있기에 Preview 버전임을 표시)의 벤치마크들을 몇 개 공개했는데 상당합니다. 코딩능력을 측정하는 지표들에서도 Opus 4.6을 10~20%p 격차로 크게 능가했고, Agentic AI 분야의 능력도 크게 좋아졌습니다.
그렇게 판단한 이유
코딩 지표에서 Opus 4.6을 10~20%p 앞섰고, BrowseComp에서는 작업당 토큰을 30만개 이상에서 약 15만개로 줄이면서 정확도가 75.8%에서 84.9%로 높아졌다는 수치와 2월 24일부터의 내부 사용을 든다.
근거 보기 2
- 원문 구간 1
흥미로운 건 향후 Claude Cowork처럼 AI가 스스로 검색하고 인터넷이나 이메일, 폴더를 돌아다니며 작업할 때 중요한 Agentic Search and Computer Use 능력을 보는 벤치마크 중 BrowseComp를 측정할 때 토큰당 지능 압축도가 거의 3배 가까이 좋아졌다는 게 핵심입니다. Opus 4.6에서는 평균적으로 작업당 30만 개 이상의 토큰을 써서 75.8%대 정확도를 보였는데, Mythos Preview에서는 평균 작업당 ~15만 개의 토큰을 써서 84.9%의 정확도를 보이고 있습니다. 다시 한 번 사전훈련을 통해서 다시 한 번 토큰당 지능 효율을 크게 끌어올렸습니다. Claude Mythos Preview 모델에 대한 System Card는 여기서 확인하실 수 있습니다. 앤스로픽은 내부적으로 2월 24일부터 Mythos Preview 모델을 사용하고 있었다고 밝혔습니다.
- 원문 구간 2
다리오 아모데이가 인터뷰에서 말했던 것처럼 '더 높은 지능을 가진 모델을 내부적으로 사용함으로써 이것 자체로 다른 AI Labs들에 비해서 앞서가기 시작하는 구간'이 시작됐다는 의미이기도 합니다. (2) 오픈AI Codex WAU가 300만 명을 넘겼습니다. 2026년 초 50만 명 → 2월 초 100만 명 → 2월 말 160만 명 → 3월 초 200만 명 → 4월 초 300만 명으로 Claude Code와 침투 속도 자체는 비슷하게 빠릅니다. 샘 올트먼은 WAU가 1,000만 명에 달할 때까지 100만 명씩 증가할 때마다 개발자들의 주간 사용 한도를 리셋해주겠다 말했습니다. 오픈AI도 Spud를 준비 중이므로 Spud의 성과가 어떻게 나오느냐가 중요합니다. 요즘개인적으로는 성능저하를 여러 번 체감하고 나서 제미나이는 안 쓴지가 꽤 오래됐고, GPT-5.4-Pro-Extended랑 GPT-5.4-thinking-Heavy(심화추론)를 오가면서 워낙 잘 쓰고 있다보니 GPT-6이 빨리 나왔으면 좋겠네요.