26-9 앤스로픽 Fable 5.1·Mythos 5.1 출시
작성자의 핵심 판단
피크 지능 변화는 극적이지 않지만 Cache reads 비용 인하로 같은 작업을 더 저비용으로 할 수 있다는 점이 유의미하다고 평가한다.
근거 보기 2
- 원문 구간 1
빅테크/AI Labs: (1) 앤스로픽이 Fable 5.1/Mythos 5.1을 출시했습니다 *첨부자료 1, 2*: Terminal-bench 4.0, CursorBench 3.2.0 두 가지를 중점적으로 보시면 되는데, 두 가지 모두 Fable 5와 Opus 5에 비해서 약간씩 좋아진 모델입니다. 대신 KV Cache hit read 비용을 75% 낮춘 $0.25로 잡아서 일반적인 작업부하 비용은 최대 25%, 장시간 에이전트 작업에서는 최대 45%정도 만큼 비용이 낮아질 것으로 추정됩니다. 피크 지능은 드라마틱한 수준까지는 아니지만, 전반적인 모델 지능이 높아지고 Cache reads 비용은 크게 낮췄다보니 같은 작업을 보다 저비용으로 가능하게 하는 쪽으로는 꽤 유의미합니다.
- 원문 구간 2
벤치마크 중에서 Terminal-bench 4.0 기준 Mythos 5-high가 비용 $17 정도로 40점에 가깝게 받았었는데, Mythos 5.1-low는 $6 정도로 40점을 약간 상회하는 점수를 받았습니다. (2) 오픈AI가 아마도 GPT-5.7이 될 것으로 예상하는 "Astra" 발표를 앞두고 보안 안전장치를 강화 중입니다: 사이버보안 등급 프레임워크에서 최초로 Critical 역량 기준을 충족하는 모델입니다. 오픈AI 표현에 따르면, "조만간 발표 예정(We plan to make Astra available soon)"입니다.
이 자료에서 다룬 사실
앤스로픽이 Fable 5.1과 Mythos 5.1을 출시했고, Terminal-bench 4.0과 CursorBench 3.2에서 전작보다 약간 개선됐다고 제시했다.
근거 보기 1
- 원문 구간 1
빅테크/AI Labs: (1) 앤스로픽이 Fable 5.1/Mythos 5.1을 출시했습니다 *첨부자료 1, 2*: Terminal-bench 4.0, CursorBench 3.2.0 두 가지를 중점적으로 보시면 되는데, 두 가지 모두 Fable 5와 Opus 5에 비해서 약간씩 좋아진 모델입니다. 대신 KV Cache hit read 비용을 75% 낮춘 $0.25로 잡아서 일반적인 작업부하 비용은 최대 25%, 장시간 에이전트 작업에서는 최대 45%정도 만큼 비용이 낮아질 것으로 추정됩니다. 피크 지능은 드라마틱한 수준까지는 아니지만, 전반적인 모델 지능이 높아지고 Cache reads 비용은 크게 낮췄다보니 같은 작업을 보다 저비용으로 가능하게 하는 쪽으로는 꽤 유의미합니다.
그렇게 판단한 이유
KV Cache hit read 비용을 75% 낮춘 $0.25로 잡아 일반 작업부하는 최대 25%, 장시간 에이전트 작업은 최대 45% 비용이 낮아질 수 있다고 추정했다.
근거 보기 1
- 원문 구간 1
빅테크/AI Labs: (1) 앤스로픽이 Fable 5.1/Mythos 5.1을 출시했습니다 *첨부자료 1, 2*: Terminal-bench 4.0, CursorBench 3.2.0 두 가지를 중점적으로 보시면 되는데, 두 가지 모두 Fable 5와 Opus 5에 비해서 약간씩 좋아진 모델입니다. 대신 KV Cache hit read 비용을 75% 낮춘 $0.25로 잡아서 일반적인 작업부하 비용은 최대 25%, 장시간 에이전트 작업에서는 최대 45%정도 만큼 비용이 낮아질 것으로 추정됩니다. 피크 지능은 드라마틱한 수준까지는 아니지만, 전반적인 모델 지능이 높아지고 Cache reads 비용은 크게 낮췄다보니 같은 작업을 보다 저비용으로 가능하게 하는 쪽으로는 꽤 유의미합니다.