이 글 어땠어요?
100만 토큰당 입력 5달러, 출력 25달러로 Opus 4.8과 같고 Fable 5의 절반입니다. 약 2.5배 빠른 Fast 모드는 두 배 가격(입력 10달러, 출력 50달러)입니다.
토큰값은 절반이지만 같은 과제에 토큰과 턴을 더 써서, 출시 당일 독립 평가에서 과제당 비용은 19~26% 낮았습니다. Vals의 웹앱 제작 평가에서는 완료 시간이 43% 길었습니다.
Vals 평가에서는 high까지 점수가 오르다가 xhigh와 max에서 오히려 내려갔습니다(오차 범위 안). 비용은 크게 늘었고, 앤트로픽은 API와 Claude Code의 권장 기본값을 high로 두고 있습니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
정부 승인 파트너 약 20곳에만 열려 있던 GPT-5.6이 7월 9일 정식 출시됐습니다. Sol은 100만 토큰당 입력 5달러·출력 30달러, Luna는 1달러·6달러입니다. 오픈AI는 Sol이 크게 진 SWE-Bench Pro 공개 과제의 약 30%가 깨진 문제라고 밝혔습니다.

앤트로픽이 10월 7일 Claude Haiku 5.5를 GPT-6 Luna와 같은 입력 0.1달러·출력 0.5달러에 내놨습니다. 10만 토큰이 넘는 요청은 5배를 받고, AA 지수는 43점에 과제당 비용은 Luna의 3배인 0.21달러였습니다.
반값 Opus 5가 여러 평가에서 Fable 5를 앞서던 가운데, 앤트로픽이 9월 1일 Fable 5.1을 내놓고 비교표 모든 항목에서 1위를 되찾았습니다. 캐시 읽기 요금을 75% 내려 일반 작업 비용은 약 25%, 에이전트 작업은 최대 약 45% 줄였습니다.

정부 승인 파트너 약 20곳에만 열려 있던 GPT-5.6이 7월 9일 정식 출시됐습니다. Sol은 100만 토큰당 입력 5달러·출력 30달러, Luna는 1달러·6달러입니다. 오픈AI는 Sol이 크게 진 SWE-Bench Pro 공개 과제의 약 30%가 깨진 문제라고 밝혔습니다.

앤트로픽이 10월 7일 Claude Haiku 5.5를 GPT-6 Luna와 같은 입력 0.1달러·출력 0.5달러에 내놨습니다. 10만 토큰이 넘는 요청은 5배를 받고, AA 지수는 43점에 과제당 비용은 Luna의 3배인 0.21달러였습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
@claudeaiX 게시물 · 원문 보기
Opus 5는 Claude Max 요금제의 기본 모델이 됐고, Pro 요금제에서는 가장 강한 모델입니다. 문맥 창은 100만 토큰, 추론 강도는 low부터 max까지 다섯 단계입니다. 기본보다 약 2.5배 빠른 Fast 모드는 기본 가격의 두 배(입력 10달러, 출력 50달러)를 받는데, 이 값이 Fable 5의 기본 가격과 같습니다.
앤트로픽이 공개한 성적표에서 Opus 5는 코딩과 지식 업무 평가 대부분에서 Fable 5와 비슷하거나 앞섰습니다. 가장 크게 벌어진 곳은 터미널에서 긴 작업을 수행하는 Frontier-Bench v0.1로, Opus 5가 43.3%, Fable 5가 33.7%, 같은 가격대의 전작 Opus 4.8은 21.1%였습니다.
| 평가 | Opus 5 | Fable 5 | Opus 4.8 | GPT-5.6 Sol |
|---|---|---|---|---|
| Frontier-Bench v0.1(터미널 코딩) | 43.3% | 33.7% | 21.1% | 34.4% |
| GDPval-AA v2(지식 업무) | 1861 | 1747 | 1593 | 1736 |
| ARC-AGI-3(새 문제 풀이) | 30.2% | - | 1.5% | 7.8% |
| OSWorld 2.0(컴퓨터 사용) | 70.6% | 66.1% | 55.7% | 62.6% |
| AutomationBench(업무 자동화) | 26.0% | 17.4% | 17.0% | 18.1% |
| FrontierCode v1.1(코딩) | 53.4% | 53.5% | 46.5% | 47.5% |
| DeepSWE v1.1(코딩) | 68.8% | 69.7% | 59.0% | 72.7% |
표의 숫자는 앤트로픽이 발표한 값이고, FrontierCode에서는 Fable 5와 0.1포인트 차이였으며 DeepSWE에서는 GPT-5.6 Sol이 가장 높았습니다. 법률 과제와 의료 과제에서도 Opus 5는 1위가 아니었습니다. 앤트로픽은 Frontier-Bench에서 Opus 5가 Opus 4.8의 두 배 넘는 점수를 더 낮은 과제당 비용으로 냈다고 밝혔습니다.

는 규칙을 알려 주지 않는 게임을 풀게 하는 시험입니다. 모델은 격자 화면과 몇 가지 조작만 받고 무엇이 목표인지 스스로 알아내야 하며, 점수는 사람보다 얼마나 적은 행동으로 풀었는지로 매깁니다. 시험을 운영하는 ARC Prize는 출시 당일 Opus 5가 30.2%로 최고 기록을 세웠다고 밝혔습니다. 직전 최고는 GPT-5.6 Sol(max)의 7.8%였고, Fable급 모델은 공개 환경에서 약 20%였습니다.
ARC Prize는 풀이 과정에서 처음 보는 행동을 관찰했다고 적었습니다. Opus 5는 23번째 행동에서 화면 배치를 「4_center = 2×axis − 5_center」라는 식으로 적었는데, ARC Prize가 분석한 모델 가운데 반사를 방정식으로 명시한 첫 사례였습니다. 248번째 행동에서는 같은 원리를 2차원으로 넓혔습니다.
@arcprizeX 게시물 · 원문 보기
이 방식으로 Opus 5는 어떤 모델도 깨지 못했던 공개 환경 5개를 100% 풀었고, 그중 4개는 사람 수준 이상의 효율이었습니다. 공개된 환경 25개 가운데 지금까지 완전히 풀린 것은 6개입니다.
업무 자동화 쪽 숫자는 자동화 서비스 Zapier가 내놨습니다. Zapier는 재무와 인사, 마케팅, 운영, 영업, 고객 지원의 실제 업무 흐름 657개로 만든 AutomationBench에서 Opus 5가 모든 기능 분야 1위를 했다고 밝혔습니다.
@wadefosterX 게시물 · 원문 보기
웨이드 포스터 Zapier CEO가 든 예는 고객 건강도 스프레드시트를 받아 이탈 위험 계정을 찾고, 담당자에게 알리고, 리텐션 팀용 요약까지 만드는 흐름입니다. 이전 모델은 이 과제를 통과하지 못했고, 앤트로픽 발표문에 실린 Zapier 평가로는 Opus 5가 100%를 받았습니다. 추론 강도를 가장 낮게 둔 Opus 5는 과제당 약 0.75달러로 경쟁 모델들의 최고 기록을 넘었다고 그는 적었습니다. 퍼플렉시티도 자사 리서치 에이전트 평가 WANDR에서 Opus 5가 Fable 5를 뺀 6개 모델을 모두 앞섰고 비용은 57% 낮았다고 밝혔습니다. WANDR이 무엇을 재는지는 퍼플렉시티의 리서치 에이전트 평가에 정리했습니다.
독립 평가 기관 Artificial Analysis의 지능 지수에서 Opus 5(max)는 61점으로 Fable 5(60점)와 사실상 같은 1위였고, GPT-5.6 Sol(59점)과 Kimi K3(57점), Opus 4.8(56점)이 뒤를 이었습니다. 지식 업무 평가 GDPval-AA v2에서는 1861점으로 Fable 5보다 114점, 보고서와 발표 자료를 만드는 AA-Briefcase에서는 1720점으로 146점 높았습니다.
토큰값은 절반인데 과제 하나에 드는 비용은 절반까지 내려가지 않았습니다. Artificial Analysis에서 Opus 5(max)는 지능 지수 과제 하나에 평균 2.03달러를 썼고, Fable 5는 2.75달러였습니다. 차이는 26%입니다. Opus 4.8(max)은 1.80달러, Sonnet 5(max)는 1.53달러로 Opus 5보다 쌌습니다.
@ArtificialAnlysX 게시물 · 원문 보기
| 측정 | Opus 5 | Fable 5 | 잰 곳 |
|---|---|---|---|
| 지능 지수 과제당 비용(max) | 2.03달러 | 2.75달러 | Artificial Analysis |
| AA-Briefcase 과제당 비용(max) | 17.79달러 | 22.30달러 | Artificial Analysis |
| 웹앱 제작 과제당 비용 | 33.88달러 | 41.71달러 | Vals |
| 웹앱 제작 완료 시간 | 5,301초 | 3,711초 | Vals |
| 웹앱 제작 성공률 | 88.40% | 90.35% | Vals |
차이를 만든 것은 토큰의 양입니다. Vals는 Opus 5가 토큰당 값은 절반이지만 훨씬 많은 토큰을 쓴다며, 이 경향이 자사 평가 전반에서 나타났다고 적었습니다. Vals의 웹앱 제작 기록을 보면 Opus 5가 읽은 입력 토큰은 약 25억 개로 Fable 5(약 16억 개)의 1.5배였고, 대부분이 앞선 대화를 다시 읽는 캐시 토큰이었습니다. 턴이 늘어날수록 같은 문맥을 다시 읽는 양이 불어납니다.
Artificial Analysis도 같은 모습을 쟀습니다. AA-Briefcase에서 Opus 5는 가장 높은 세 강도에서 과제당 평균 103턴, 91턴, 76턴을 썼고, Opus 4.8(max)은 55턴이었습니다. max에서 과제 하나에 걸린 시간은 36.2분으로 Opus 4.8의 24.1분보다 50%쯤 길었습니다. Vals의 웹앱 제작에서도 Opus 5는 Fable 5보다 약 19% 싸게 끝냈지만 시간은 43% 더 걸렸고, 성공률은 1.95포인트 낮았습니다.
강도를 낮추면 계산이 달라집니다. AA-Briefcase에서 high 강도의 Opus 5는 과제당 10.41달러로 Fable 5 max(22.30달러)의 절반이 안 되는 비용에 점수는 32점 높았습니다.
추론 강도를 올리면 토큰은 크게 늘지만 점수는 늘 따라 오르지 않았습니다. Artificial Analysis의 GDPval-AA v2에서 low부터 max까지 점수는 407점 벌어졌고, 출력 토큰은 약 8배로 늘었습니다. Vals는 웹앱 제작 평가를 다섯 강도로 따로 돌렸는데, low에서 high까지는 점수가 올랐지만 xhigh와 max에서는 오히려 내려가고 비용은 크게 늘었습니다.
@ValsAIX 게시물 · 원문 보기
Vals는 차이가 오차 범위 안이라 우연일 수 있다고 전제하면서도, xhigh와 max는 더 복잡한 구현을 고르는 일이 잦아 실수가 늘었고 high는 요구 사항을 채우는 단순한 구현을 냈다고 적었습니다. Terminal-Bench에서도 max가 high보다 비싸고 점수는 낮았는데, 시간 제한이 엄격한 평가라 한 턴이 길어진 max가 정해진 시간 안에 턴을 덜 쓴 탓도 있다고 봤습니다. 앤트로픽이 공개한 Frontier-Bench 그래프에서 읽어도 Opus 5는 max보다 한 단계 낮은 xhigh에서 점수가 조금 더 높았습니다. Vals는 이 결과가 API와 Claude Code의 권장 기본값을 high로 둔 앤트로픽의 설정과 맞는다고 덧붙였습니다. 강도를 한 단계 올릴 때 무엇이 늘어나는지는 Claude Code의 노력 설정을 설명한 글에 있습니다.
앤트로픽은 Opus 5를 스스로 결과를 검증하고 성공할 때까지 다듬는 모델로 소개했습니다. 기계 부품 도면을 직접 볼 수 없게 막은 과제에서 Opus 5가 픽셀에서 형상을 뽑는 컴퓨터 비전 도구를 스스로 짜서 3D 모델을 재구성했고, 같은 조건의 경쟁 모델은 다섯 번 시도해도 풀지 못했다는 사례가 발표문에 실렸습니다.
같은 자발성은 시스템 카드에서 다른 모습으로도 기록됐습니다. 출시 직전 버전의 Opus 5는 bash 명령으로 웹 주소를 불러오지 말라는 분명한 지시를 받고도, 그 규칙을 따르면 자바스크립트 페이지는 하나도 답할 수 없게 된다는 논리를 세워 curl로 사이트에 접속했고, 규칙을 어긴 사실을 사용자에게 알리지 않았습니다. 중간 버전은 풀리퀘스트 분류기가 잘못 막자 분류기를 로컬에서 돌려 입력을 나눠 보며 우회할 방법을 찾았고, 서비스에서 로그아웃되자 흔히 쓰는 비밀번호를 넣어 다시 로그인하려 한 적도 있습니다. 앤트로픽은 이런 행동이 감시한 작업의 0.01% 미만이었고 모두 사용자의 과제를 끝내려는 시도였으며, 평가에서 일부러 실력을 숨기는 행동이나 악의적인 행동은 발견되지 않았다고 적었습니다.
약 3,200번의 조사 세션으로 문제 행동을 점수 매기는 자동 행동 감사에서 Opus 5는 2.30점으로, 앤트로픽 최근 모델 가운데 가장 낮았습니다. 점수는 낮을수록 좋습니다.

시스템 카드에는 모르는 답을 자신 있게 말한 사례가 뜻밖에 많았다는 대목도 있습니다. 전체 정확도는 올랐지만 사실 관계 환각은 Opus 4.8보다 조금 늘었고, Artificial Analysis도 모를 때 답을 내는 경우가 늘어 환각률이 14포인트 오른 50%라고 쟀습니다. 코드 리뷰 서비스 CodeRabbit의 평가도 비슷한 방향입니다. Opus 5의 지적은 바로 고칠 수 있는 정확한 지적 비율이 39.3%로 역대 최고였지만, 이미 알려진 버그를 잡은 비율은 55.2%로 기준 모델의 61.1%보다 낮았고 사소한 지적은 네 배였습니다. CodeRabbit은 정밀도에 특화된 모델이라 재현율이 높은 모델과 짝을 지으면 좋다고 결론 내렸습니다.
사이버 보안에서 Opus 5는 찾는 능력과 공격 코드를 완성하는 능력의 차이가 컸습니다. 앤트로픽이 안전장치를 모두 끄고 돌린 OSS-Fuzz 평가(오픈소스 228개 프로젝트의 약 830개 진입점)에서 Opus 5는 대상의 79.4%에서 0점을 넘겨 Mythos 5의 80%에 거의 닿았습니다. 반면 흐름을 완전히 빼앗는 만점 공격은 Mythos 5가 13건, Opus 5가 4건이었습니다.

모질라와 함께 만든 Firefox 147 평가에서도 Opus 5는 250번 시도 중 131번(52.4%) 완전한 공격 코드를 만들어 Opus 4.8의 22번을 크게 넘었지만, Mythos 5의 221번에는 못 미쳤습니다. 앤트로픽은 Opus 5를 사이버 과제로 따로 학습시키지 않았는데 전반적인 능력이 오르면서 여기까지 왔다고 설명했습니다. 일반 사용자용 Opus 5의 사이버 분류기는 소스 코드에서 취약점을 찾는 일은 허용하고, 바이너리 기반 스캔과 침투 테스트, 공격 코드 작성은 막습니다. 앤트로픽은 이 분류기가 Fable 5보다 약 85% 덜 개입할 것으로 봤습니다.
거절 빈도의 차이는 Vals의 평가에서도 드러났습니다. 과학 문제 평가 GPQA에서 Fable 5는 문제의 42%를 거절했지만 Opus 5는 한 문제도 거절하지 않았고, ProgramBench에서도 Fable 5는 100% 거절, Opus 5는 0%였습니다. Vals는 Fable 5와 달리 Opus 5에서는 다른 모델로 넘어가는 대체 응답도 거의 보지 못했다고 적었습니다.
앤트로픽이 AI 연구개발 능력을 여러 평가로 묶어 내는 지표 AECI에서 Opus 5는 162.1점으로 명목상 가장 높았지만, Mythos 5(161.3점)와는 통계적으로 구분되지 않았습니다. Opus 계열 가운데 역대 추세선 위로 올라간 첫 모델입니다. 이미 최적화된 LLM 학습 코드를 더 빠르게 만드는 어려운 과제에서는 평균 14.19배 속도를 높여 Mythos 5의 8.36배를 넘었고, 커널 최적화 과제에서는 449.46배를 기록했습니다.
다만 앤트로픽은 AI가 자기 연구를 크게 앞당기기 시작했다고 보지 않았습니다. 사내 지표에서 AI 덕분에 연구 속도가 꾸준히 두 배로 빨라졌다는 근거는 없었고, Opus 5를 사내에서 널리 써 봤지만 연구자, 특히 선임 연구자를 대신할 수준과는 거리가 멀었다고 적었습니다.
한계가 가장 구체적으로 드러난 것은 단백질 설계 실험입니다. 24시간과 1만 달러 예산으로 근육 조절 단백질 GDF-8에는 붙고 거의 똑같은 GDF-11에는 붙지 않는 결합 단백질 30개를 설계하는 과제에서, Mythos 5는 30개를 순위와 자체 검토까지 붙여 냈습니다. Opus 5 초기 버전은 두 번 돌려 두 번 다 끝내지 못했습니다. 한 번은 선택성 목표를 중간에 포기한 채 순위 없는 설계 17개를 냈고, 다른 한 번은 자기 검증 루프에 빠져 마지막 8시간 동안 아무것도 내지 않았습니다.
가격이 Opus 4.8과 같아서 API로 Opus 4.8을 쓰던 서비스는 모델 이름만 바꾸면 토큰 단가가 그대로인 채 새 모델로 옮겨 갑니다. 달라지는 것은 토큰의 양과 시간입니다. 같은 일을 하면서 턴을 더 쓰고 문맥을 더 자주 다시 읽기 때문에, 출시 당일 측정에서 과제당 비용 절감 폭은 19~26%에 그쳤고 웹앱 제작 시간은 43% 늘었습니다.
데이터 조건도 다릅니다. 앤트로픽은 Mythos급 모델인 Fable 5의 기업 트래픽을 30일 동안 보관하도록 했지만, Opus 5는 이전 Opus 모델처럼 일반 사용에 데이터 보관 요건을 두지 않았습니다. 앤트로픽은 이번 출시와 함께 대화 도중 도구를 바꿔도 프롬프트 캐시가 깨지지 않게 하는 기능과, 안전 분류기에 걸린 API 요청을 다른 모델로 자동으로 넘기는 기능도 베타로 내놨습니다.
Claude Code를 만드는 타리크는 같은 날 앤트로픽 블로그에 Opus 5와 Fable 5 기준으로 Claude Code 시스템 프롬프트의 80% 이상을 덜어냈는데도 코딩 평가에서 손실을 찾지 못했다는 글을 올렸습니다. 그 과정은 시스템 프롬프트를 덜어낸 실험에 정리했습니다.
읽어 주셔서 고맙습니다.
초이 드림