26-9 오픈AI Astra 출시 예상
작성자의 핵심 판단
작성자는 Astra가 오픈AI의 연구 주도권을 되찾고, 기존 벤치마크와 고부가 작업의 성능 상한을 넓힌 모델이라고 평가한다.
근거 보기 6
- 원문 구간 1
이보다 더 성능을 한 단계 끌어올린 모델의 사전훈련은 끝났고 사후훈련 과정에서 정렬 문제로 멈춰있는 상태입니다. 앤스로픽이 Mythos 5.2(이걸 성능 제한한 버전이 Fable 5.2)를 내부적으로 사용해서 Mythos 5.3를 개발 중인 것처럼 오픈AI도 SOTA 위의 SOTA 모델을 내부적으로 쓰는 중입니다. GPT-6 Astra의 API 가격은 백만토큰당 $10/$50으로 Mythos/Fable과 같은 가격입니다: 주요 모델 API 가격 업데이트(2026-09-04) → GPT-6 Astra $10/$50(SOTA) > Mythos/Fable 5.1 $10/$50 > GPT-5.6 Sol $5/$30 > Opus 5 $5/$25 > Kimi-K3 $3/$15
- 원문 구간 2
> GPT-5.6 Terra $2/$12 > Gemini 3.1 Pro $2/$12 > Sonnet 5 $2/$10 > Qwen 3.8-Max-0902 $2/$6 = Grok 4.6 $2/$6(8일 내 4.7 출시 예정) > GLM-5.3 $1.4/$4.4 > Muse Spark 1.3 $1.25/$4.25 > DeepSeek-V4-Pro-0813 $1.32/$3.96 > Gemini 3.8 Flash $0.75/$3.75 > DeepSeek-V4-Flash-0731 $0.44/$1.32 > GPT-5.6 Luna $0.20/$1.20 전일 일간보고로 전해드렸던 Terminal-bench 4.0 기준으로 업데이트해보면: Terminal-bench 4.0 업데이트(202
- 원문 구간 3
6-09-04) → GPT-6 Astra 58.2% > Fable 5.1 57.9% > Opus 5 51.8% > Fable 5 44.5% > GLM-5.3 41.8% > GPT-5.6 Sol 37.3% > Opus 4.8 23.6% > GPT-5.6 Terra 21.5% > Grok 4.6 20.3% > Gemini 3.8 Flash 19.1% > GPT-5.6 Luna 17.3% > Grok 4.5 12.4% = Sonnet 5 12.4%입니다. Terminal-bench가 가장 개발자들의 환경에 가까운 비교인 이유는 실제 개발자들은 모델 + 에이전트/하네스 조합으로 사용하게 되는데 이 벤치가 그것을 모두 종합적으로 고려한 환경에서의 성능을 비교하기 때문입니다. GPT-6 Astra+Codex, Fable 5.1+Claude Code, Opus 5+Claude Code 이런 느낌으로 한쌍을 이뤄 문제를 풀게 합니다.
- 원문 구간 4
몇 가지 생각을 정리합니다: 코딩 에이전트는 양질의 coding trajectory를 먹고 자랍니다. 챗봇이 아니라 에이전트이기 때문에 그럴듯한 답변을 내놓는 게 아니라 어떤 도구, 어떤 경로로건 진짜 문제를 풀게 만드는 게 핵심입니다. 양질의 피드백이 많으면 에이전트의 성능이 높아집니다. GPT-6 Astra 모델이 SOTA 모델이 됐으니 Codex 사용자 및 피드백이 많아지면 Codex 전반의 코딩 및 장시간 작업 퍼포먼스가 좋아질 것으로 예상합니다. 이는 Codex 자체를 개선시키는 것이니 GPT-6 Astra가 아니더라도 GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna에게도 적용됩니다. 그렇다보니 후발주자 입장에서는 모델을 깡스펙 자체가 좋게끔 만들고 나서 → 가성비를 큰 격차로 좋게 만들어서 사용자 풀을 크게 늘린다음 → 에이전트/하네스를 개선시켜야 합니다.
- 원문 구간 5
GPT-6 Astra System Card에서 인상적이었던 몇 가지 차트들을 정리해봅니다: *첨부자료 3* Figure 47 — ExploitBench Internal Port / PDF p.89 : 사이버보안 영역에서 오픈AI가 처음으로 'Critical' 등급을 줬다고 꼽은 핵심 배경입니다. 일단 기존 ExploitBench는 과거에 공개한 취약점들을 갖고 평가하는 것이라서 학습 데이터의 오염(벤치맥싱 가능성, 늘 벤치마크를 잘 따져가며 봐야 하는 이유) 우려가 있는데 오픈AI는 이를 피하려고 Astra의 knowledge cutoff 이후인 2026년 6~8월 신규 취약점만으로 별도 평가했습니다. 해당 벤치에서 Astra는 GPT-5.6 Sol보다 훨씬 더 적은 output 토큰으로 훨씬 더 높은 성공률을 보였습니다.
- 원문 구간 6
*첨부자료 11* Figure 28 — CoT Controllability / PDF p.57 : 이건 모델을 얼마나 스텔스 상태로 만들 수 있는가를 확인하는 평가입니다. 같은 길이의 CoT를 놓고 모델에게 "특정 단어를 쓰지 마라", "대소문자를 번갈아 써라" 같은 제약을 줬을 때 얼마나 자기 reasoning을 의도적으로 통제할 수 있는지를 측정합니다. 10K token CoT에서 Astra 60.9% vs Sol 16.1% vs GPT-5.5 1.7%입니다. 모델이 자기 reasoning의 형태를 의도적으로 조절하는 능력이 강해졌다는 뜻입니다. (2) Thinking Machines Labs가 $40B 밸류로 $1B 투자를 유치하기 위한 협상 진행 중입니다.
이 자료에서 다룬 사실
GPT-6 Astra가 발표됐고 API 가격은 백만 토큰당 $10/$50이며, Terminal-bench 4.0에서 58.2%로 제시됐다.
근거 보기 6
- 원문 구간 1
이보다 더 성능을 한 단계 끌어올린 모델의 사전훈련은 끝났고 사후훈련 과정에서 정렬 문제로 멈춰있는 상태입니다. 앤스로픽이 Mythos 5.2(이걸 성능 제한한 버전이 Fable 5.2)를 내부적으로 사용해서 Mythos 5.3를 개발 중인 것처럼 오픈AI도 SOTA 위의 SOTA 모델을 내부적으로 쓰는 중입니다. GPT-6 Astra의 API 가격은 백만토큰당 $10/$50으로 Mythos/Fable과 같은 가격입니다: 주요 모델 API 가격 업데이트(2026-09-04) → GPT-6 Astra $10/$50(SOTA) > Mythos/Fable 5.1 $10/$50 > GPT-5.6 Sol $5/$30 > Opus 5 $5/$25 > Kimi-K3 $3/$15
- 원문 구간 2
> GPT-5.6 Terra $2/$12 > Gemini 3.1 Pro $2/$12 > Sonnet 5 $2/$10 > Qwen 3.8-Max-0902 $2/$6 = Grok 4.6 $2/$6(8일 내 4.7 출시 예정) > GLM-5.3 $1.4/$4.4 > Muse Spark 1.3 $1.25/$4.25 > DeepSeek-V4-Pro-0813 $1.32/$3.96 > Gemini 3.8 Flash $0.75/$3.75 > DeepSeek-V4-Flash-0731 $0.44/$1.32 > GPT-5.6 Luna $0.20/$1.20 전일 일간보고로 전해드렸던 Terminal-bench 4.0 기준으로 업데이트해보면: Terminal-bench 4.0 업데이트(202
- 원문 구간 3
6-09-04) → GPT-6 Astra 58.2% > Fable 5.1 57.9% > Opus 5 51.8% > Fable 5 44.5% > GLM-5.3 41.8% > GPT-5.6 Sol 37.3% > Opus 4.8 23.6% > GPT-5.6 Terra 21.5% > Grok 4.6 20.3% > Gemini 3.8 Flash 19.1% > GPT-5.6 Luna 17.3% > Grok 4.5 12.4% = Sonnet 5 12.4%입니다. Terminal-bench가 가장 개발자들의 환경에 가까운 비교인 이유는 실제 개발자들은 모델 + 에이전트/하네스 조합으로 사용하게 되는데 이 벤치가 그것을 모두 종합적으로 고려한 환경에서의 성능을 비교하기 때문입니다. GPT-6 Astra+Codex, Fable 5.1+Claude Code, Opus 5+Claude Code 이런 느낌으로 한쌍을 이뤄 문제를 풀게 합니다.
- 원문 구간 4
몇 가지 생각을 정리합니다: 코딩 에이전트는 양질의 coding trajectory를 먹고 자랍니다. 챗봇이 아니라 에이전트이기 때문에 그럴듯한 답변을 내놓는 게 아니라 어떤 도구, 어떤 경로로건 진짜 문제를 풀게 만드는 게 핵심입니다. 양질의 피드백이 많으면 에이전트의 성능이 높아집니다. GPT-6 Astra 모델이 SOTA 모델이 됐으니 Codex 사용자 및 피드백이 많아지면 Codex 전반의 코딩 및 장시간 작업 퍼포먼스가 좋아질 것으로 예상합니다. 이는 Codex 자체를 개선시키는 것이니 GPT-6 Astra가 아니더라도 GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna에게도 적용됩니다. 그렇다보니 후발주자 입장에서는 모델을 깡스펙 자체가 좋게끔 만들고 나서 → 가성비를 큰 격차로 좋게 만들어서 사용자 풀을 크게 늘린다음 → 에이전트/하네스를 개선시켜야 합니다.
- 원문 구간 5
GPT-6 Astra System Card에서 인상적이었던 몇 가지 차트들을 정리해봅니다: *첨부자료 3* Figure 47 — ExploitBench Internal Port / PDF p.89 : 사이버보안 영역에서 오픈AI가 처음으로 'Critical' 등급을 줬다고 꼽은 핵심 배경입니다. 일단 기존 ExploitBench는 과거에 공개한 취약점들을 갖고 평가하는 것이라서 학습 데이터의 오염(벤치맥싱 가능성, 늘 벤치마크를 잘 따져가며 봐야 하는 이유) 우려가 있는데 오픈AI는 이를 피하려고 Astra의 knowledge cutoff 이후인 2026년 6~8월 신규 취약점만으로 별도 평가했습니다. 해당 벤치에서 Astra는 GPT-5.6 Sol보다 훨씬 더 적은 output 토큰으로 훨씬 더 높은 성공률을 보였습니다.
- 원문 구간 6
*첨부자료 11* Figure 28 — CoT Controllability / PDF p.57 : 이건 모델을 얼마나 스텔스 상태로 만들 수 있는가를 확인하는 평가입니다. 같은 길이의 CoT를 놓고 모델에게 "특정 단어를 쓰지 마라", "대소문자를 번갈아 써라" 같은 제약을 줬을 때 얼마나 자기 reasoning을 의도적으로 통제할 수 있는지를 측정합니다. 10K token CoT에서 Astra 60.9% vs Sol 16.1% vs GPT-5.5 1.7%입니다. 모델이 자기 reasoning의 형태를 의도적으로 조절하는 능력이 강해졌다는 뜻입니다. (2) Thinking Machines Labs가 $40B 밸류로 $1B 투자를 유치하기 위한 협상 진행 중입니다.
그렇게 판단한 이유
코딩 에이전트의 성능은 모델과 하네스, 사용자 피드백의 결합에서 나오며, System Card의 보안·디버깅·사후학습 평가가 단순 암기가 아닌 실제 작업 능력의 근거라고 든다.
근거 보기 6
- 원문 구간 1
이보다 더 성능을 한 단계 끌어올린 모델의 사전훈련은 끝났고 사후훈련 과정에서 정렬 문제로 멈춰있는 상태입니다. 앤스로픽이 Mythos 5.2(이걸 성능 제한한 버전이 Fable 5.2)를 내부적으로 사용해서 Mythos 5.3를 개발 중인 것처럼 오픈AI도 SOTA 위의 SOTA 모델을 내부적으로 쓰는 중입니다. GPT-6 Astra의 API 가격은 백만토큰당 $10/$50으로 Mythos/Fable과 같은 가격입니다: 주요 모델 API 가격 업데이트(2026-09-04) → GPT-6 Astra $10/$50(SOTA) > Mythos/Fable 5.1 $10/$50 > GPT-5.6 Sol $5/$30 > Opus 5 $5/$25 > Kimi-K3 $3/$15
- 원문 구간 2
> GPT-5.6 Terra $2/$12 > Gemini 3.1 Pro $2/$12 > Sonnet 5 $2/$10 > Qwen 3.8-Max-0902 $2/$6 = Grok 4.6 $2/$6(8일 내 4.7 출시 예정) > GLM-5.3 $1.4/$4.4 > Muse Spark 1.3 $1.25/$4.25 > DeepSeek-V4-Pro-0813 $1.32/$3.96 > Gemini 3.8 Flash $0.75/$3.75 > DeepSeek-V4-Flash-0731 $0.44/$1.32 > GPT-5.6 Luna $0.20/$1.20 전일 일간보고로 전해드렸던 Terminal-bench 4.0 기준으로 업데이트해보면: Terminal-bench 4.0 업데이트(202
- 원문 구간 3
6-09-04) → GPT-6 Astra 58.2% > Fable 5.1 57.9% > Opus 5 51.8% > Fable 5 44.5% > GLM-5.3 41.8% > GPT-5.6 Sol 37.3% > Opus 4.8 23.6% > GPT-5.6 Terra 21.5% > Grok 4.6 20.3% > Gemini 3.8 Flash 19.1% > GPT-5.6 Luna 17.3% > Grok 4.5 12.4% = Sonnet 5 12.4%입니다. Terminal-bench가 가장 개발자들의 환경에 가까운 비교인 이유는 실제 개발자들은 모델 + 에이전트/하네스 조합으로 사용하게 되는데 이 벤치가 그것을 모두 종합적으로 고려한 환경에서의 성능을 비교하기 때문입니다. GPT-6 Astra+Codex, Fable 5.1+Claude Code, Opus 5+Claude Code 이런 느낌으로 한쌍을 이뤄 문제를 풀게 합니다.
- 원문 구간 4
몇 가지 생각을 정리합니다: 코딩 에이전트는 양질의 coding trajectory를 먹고 자랍니다. 챗봇이 아니라 에이전트이기 때문에 그럴듯한 답변을 내놓는 게 아니라 어떤 도구, 어떤 경로로건 진짜 문제를 풀게 만드는 게 핵심입니다. 양질의 피드백이 많으면 에이전트의 성능이 높아집니다. GPT-6 Astra 모델이 SOTA 모델이 됐으니 Codex 사용자 및 피드백이 많아지면 Codex 전반의 코딩 및 장시간 작업 퍼포먼스가 좋아질 것으로 예상합니다. 이는 Codex 자체를 개선시키는 것이니 GPT-6 Astra가 아니더라도 GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna에게도 적용됩니다. 그렇다보니 후발주자 입장에서는 모델을 깡스펙 자체가 좋게끔 만들고 나서 → 가성비를 큰 격차로 좋게 만들어서 사용자 풀을 크게 늘린다음 → 에이전트/하네스를 개선시켜야 합니다.
- 원문 구간 5
GPT-6 Astra System Card에서 인상적이었던 몇 가지 차트들을 정리해봅니다: *첨부자료 3* Figure 47 — ExploitBench Internal Port / PDF p.89 : 사이버보안 영역에서 오픈AI가 처음으로 'Critical' 등급을 줬다고 꼽은 핵심 배경입니다. 일단 기존 ExploitBench는 과거에 공개한 취약점들을 갖고 평가하는 것이라서 학습 데이터의 오염(벤치맥싱 가능성, 늘 벤치마크를 잘 따져가며 봐야 하는 이유) 우려가 있는데 오픈AI는 이를 피하려고 Astra의 knowledge cutoff 이후인 2026년 6~8월 신규 취약점만으로 별도 평가했습니다. 해당 벤치에서 Astra는 GPT-5.6 Sol보다 훨씬 더 적은 output 토큰으로 훨씬 더 높은 성공률을 보였습니다.
- 원문 구간 6
*첨부자료 11* Figure 28 — CoT Controllability / PDF p.57 : 이건 모델을 얼마나 스텔스 상태로 만들 수 있는가를 확인하는 평가입니다. 같은 길이의 CoT를 놓고 모델에게 "특정 단어를 쓰지 마라", "대소문자를 번갈아 써라" 같은 제약을 줬을 때 얼마나 자기 reasoning을 의도적으로 통제할 수 있는지를 측정합니다. 10K token CoT에서 Astra 60.9% vs Sol 16.1% vs GPT-5.5 1.7%입니다. 모델이 자기 reasoning의 형태를 의도적으로 조절하는 능력이 강해졌다는 뜻입니다. (2) Thinking Machines Labs가 $40B 밸류로 $1B 투자를 유치하기 위한 협상 진행 중입니다.