이 글 어땠어요?
100만 토큰당 입력 2달러, 출력 10달러, 캐시 읽기 0.2달러로 Sonnet 5와 같고 GPT-6 Sol과도 같습니다. Opus 5.5(입력 4달러, 출력 20달러)의 절반입니다.
독립 평가 지수는 56점으로 Opus 5.5보다 2점 낮고 Terminal-Bench 4.0에서는 앞섰지만, 앤트로픽은 복잡하고 열린 작업에서는 Opus 5.5가 분명히 강하다고 밝혔습니다. 최고 강도에서는 과제당 비용이 7.60달러로 Opus 5.5(5.98달러)보다 더 들어, 앤트로픽도 낮은 강도에서 Opus 5.5를 보완하는 쓰임을 권했습니다.
Claude 앱과 Claude Code, API, AWS와 구글 클라우드, 마이크로소프트 애저에서 공개 당일부터 쓸 수 있습니다. API 모델 이름은 claude-sonnet-5-5입니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
앤트로픽이 9월 24일부터 안전장치가 답하기 전에 막은 요청 가운데 생물학, 경쟁 모델 개발, 추론 추출 세 분류에 다시 요금을 매깁니다. 6월 2일 거절을 무료로 돌린 지 114일 만이고, 최근 몇 주 동안의 조직적 공격을 이유로 들었습니다.

앤트로픽이 9월 22일 Fable 5.1급 Opus 5.5를 입력 4달러·출력 20달러에 공개했고, 1시간 41분 뒤 오픈AI가 GPT-6 Sol·Luna 값을 절반으로 내렸습니다. 독립 평가 지수는 Opus 5.5가 58점, Sol이 48점입니다.
앤트로픽이 10월 7일 Claude Haiku 5.5를 GPT-6 Luna와 같은 입력 0.1달러·출력 0.5달러에 내놨습니다. 10만 토큰이 넘는 요청은 5배를 받고, AA 지수는 43점에 과제당 비용은 Luna의 3배인 0.21달러였습니다.

앤트로픽이 9월 24일부터 안전장치가 답하기 전에 막은 요청 가운데 생물학, 경쟁 모델 개발, 추론 추출 세 분류에 다시 요금을 매깁니다. 6월 2일 거절을 무료로 돌린 지 114일 만이고, 최근 몇 주 동안의 조직적 공격을 이유로 들었습니다.
앤트로픽이 9월 22일 Fable 5.1급 Opus 5.5를 입력 4달러·출력 20달러에 공개했고, 1시간 41분 뒤 오픈AI가 GPT-6 Sol·Luna 값을 절반으로 내렸습니다. 독립 평가 지수는 Opus 5.5가 58점, Sol이 48점입니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
@claudeaiX 게시물 · 원문 보기
Claude 공식 계정이 한국 시각 9월 29일 새벽 3시 3분에 올린 공개 글입니다. Sonnet 5보다 분명히 나아졌고, 30% 넘게 빠르며, 대부분의 작업에서 비용이 최대 30% 적다는 설명이 붙었습니다. 앤트로픽은 Sonnet 5.5를 Opus 5.5를 보완하는 더 빠르고 싼 모델로 소개하면서, 범위가 분명한 일상 작업과 버그 수정, 문서·슬라이드·스프레드시트 작성에 가장 강하다고 적었습니다.
새 모델은 발표보다 먼저 개발 도구에 나타났습니다. 앤트로픽은 한국 시각 새벽 2시 11분 코딩 에이전트 Claude Code의 2.1.284판을 배포했고, 변경 기록에는 Sonnet 5.5가 앤트로픽 API의 기본 Sonnet 모델이 됐다는 한 줄이 들어 있었습니다. 11분 뒤 한 사용자가 Claude Code 모델 목록에 Sonnet 5.5가 떴다는 화면을 올렸습니다.
@Angaisb_X 게시물 · 원문 보기
| 한국 시각 | 있었던 일 |
|---|---|
| 9월 23일 새벽 1시 31분 | Opus 5.5 공개, 「Sonnet 5.5와 Haiku 5.5는 몇 주 안에」 |
| 9월 23일 새벽 3시 12분 | GPT-6 Sol·Luna 공개, Sol은 입력 2달러·출력 10달러 |
| 9월 29일 새벽 2시 11분 | Claude Code 2.1.284 배포, Sonnet 5.5 추가 |
| 9월 29일 새벽 2시 22분 | 사용자가 Claude Code에서 Sonnet 5.5 발견 |
| 9월 29일 새벽 3시 3분 | Claude 공식 계정, Sonnet 5.5 공개 |
| 9월 29일 새벽 3시 31분 | Artificial Analysis, 지능 지수 56점(2위) 발표 |
Opus 5.5가 나온 날 앤트로픽은 Sonnet 5.5와 Haiku 5.5가 몇 주 안에 뒤따른다고 했고, Sonnet 5.5는 그로부터 6일 만에 나왔습니다. 같은 날 오픈AI가 내놓은 GPT-6 Sol과 Luna의 값과 견주면, Sol과 Sonnet 5.5의 토큰 가격은 입력과 출력, 캐시 읽기까지 같습니다.
| 100만 토큰당 | Claude Sonnet 5.5 | Claude Opus 5.5 | GPT-6 Sol |
|---|---|---|---|
| 입력 | 2달러 | 4달러 | 2달러 |
| 출력 | 10달러 | 20달러 | 10달러 |
| 캐시 읽기 | 0.2달러 | 0.2달러 | 0.2달러 |
| 캐시 쓰기 | 2.5달러 | 5달러 | 2.5달러 |
Sonnet 5.5의 토큰 가격은 입력과 출력 모두 Opus 5.5의 절반이고, 캐시 읽기만 0.2달러로 같습니다. Sonnet 5는 6월 30일 출시 때 8월 31일까지 한시 가격으로 입력 2달러, 출력 10달러를 받았는데, 7월 가격표에는 9월부터 3달러와 15달러로 올린다고 적혀 있었습니다. 9월 가격표에도 2달러와 10달러가 그대로 남았고, Sonnet 5.5가 이 값을 이어받았습니다.
앤트로픽이 싸진다고 한 근거는 토큰 수입니다. 같은 일을 하는 데 토큰을 훨씬 적게 써서 자사 시험에서 과제당 비용이 전작보다 최대 30% 적었고, 출력 속도는 30% 넘게 빨라 지금까지 나온 Sonnet 가운데 가장 빠르다는 설명입니다. 초기 고객들의 숫자도 같은 방향입니다. 투자사 발리아스니 자산운용은 금융 과제 2,441개에서 Sonnet 5.5가 답 하나에 토큰 약 12만 1,000개를 썼고 Sonnet 5는 49만 7,000개를 썼다고 전했고, 앱 제작 서비스 Base44는 실제 앱 118개를 만드는 시험에서 Sonnet 5.5가 Opus 5와 같은 점수를 평균 3.6회 반복으로 냈다고 밝혔습니다. 같은 시험에서 Opus 5는 7.7회가 걸렸습니다.
| 평가 | Sonnet 5.5 | Sonnet 5 | Opus 5.5 | GPT-6 Sol |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 70.6% | 10.3% | 66.4% | - |
| FrontierCode 1.1 | 46.2%(max), 52.1%(xhigh) | 42.4% | 54.4% | 49.3% |
| CursorBench 4.0 | 55.5% | 34.1% | 57.8% | - |
| GDPval-AA v2.1 | 1,844 | 1,449 | 1,846 | 1,487 |
| AA-Briefcase v1.1 | 1,811 | 1,359 | 1,822 | 1,483 |
| Humanity's Last Exam(도구 사용) | 64.5% | 54.9% | 67.7% | - |
| OSWorld 2.1 | 80.1% | 57.0% | 81.8% | - |
| Chartography(도구 없이) | 61.6% | 15.6% | 64.4% | 53.6% |
앤트로픽이 낸 표에서 가장 크게 오른 평가는 터미널에서 여러 단계짜리 실무를 끝내는 Terminal-Bench 4.0입니다. Sonnet 5의 10.3%가 70.6%로 뛰어 Opus 5.5(66.4%)까지 앞섰고, 44개 직업의 실무 결과물을 비교하는 GDPval-AA에서는 Sonnet 5보다 약 400점 높아 Opus 5.5와 2점 차이였습니다. 화면만 보고 포켓몬스터 레드를 끝까지 깬 첫 Sonnet 모델이라는 설명도 발표문에 들어 있습니다.
표에는 조건도 여럿 붙어 있습니다. Terminal-Bench의 Opus 5.5 점수는 가장 높았던 xhigh 설정의 값이고, GPT-6 Sol의 Terminal-Bench와 CursorBench 점수는 공개된 값이 없어 비워 뒀습니다. GDPval-AA와 AA-Briefcase는 Artificial Analysis가 출시 전 배포판으로 돌렸는데, 앤트로픽은 이 배포판에 구조화된 출력을 쓰는 요청의 품질을 떨어뜨릴 수 있는 버그가 있었다고 밝혔습니다. GPT-6 Sol 쪽도 오픈AI가 최근 이미지 이해 버그를 고쳐, 표의 일부 점수에는 고친 판이 반영되지 않았을 수 있다는 각주가 달렸습니다.
FrontierCode(에이전트가 만든 코드 변경을 사람 손질 없이 병합할 수 있는지 보는 평가)에서는 최고 설정인 max 점수가 한 단계 아래 xhigh보다 낮았습니다. 앤트로픽은 max에서 Sonnet 5.5가 여러 서브에이전트에게 검토를 나눠 맡기는 코드 리뷰 기능을 더 자주 돌렸고, Cognition이 살펴본 두 사례에서는 이 때문에 시간이 초과되거나 과제 범위 밖까지 손을 대 감점됐다고 설명했습니다.

앤트로픽은 점수표 바로 위에 단서를 달았습니다. 여러 평가에서 max 강도의 Sonnet 5.5가 Opus 5.5와 비슷한 점수를 냈지만, 벤치마크는 모델 능력의 한 면만 잰다는 설명입니다.
오랫동안 판단을 이어 가야 하는 복잡하고 열린 작업에서는 Opus 5.5가 여전히 분명히 더 강합니다.— 앤트로픽, Sonnet 5.5 발표문
@ArtificialAnlysX 게시물 · 원문 보기
Artificial Analysis(AA)는 공개 28분 뒤 Sonnet 5.5의 평가 결과를 올렸습니다. 최고 설정에서 지능 지수 56점을 받아 Sonnet 5(38점)보다 18점 올랐고, Opus 5.5(58점) 다음 2위였습니다. Terminal-Bench 4.0은 64%로 Opus 5.5와 GPT-6 Astra(60%)를 앞섰고, 지식 업무 평가 AA-Briefcase(1,811점 대 1,822점)와 GDPval-AA(1,844점 대 1,846점), 업무 자동화 평가 AutomationBench-AA(71% 대 70%)에서도 Opus 5.5와 비슷했습니다.
같은 평가에서 뒤진 곳도 나왔습니다. 사실 지식을 묻는 AA-Omniscience의 정답률은 54%로 Opus 5.5(66%)보다 12점 낮았고, 대신 환각률은 47%로 Opus 5.5(59%)보다 낮았습니다. Humanity's Last Exam과 과학 코딩 평가 SciCode에서도 Opus 5.5보다 약 6점씩 뒤졌습니다.
한데 이 점수를 내는 데 든 토큰이 AA가 잰 모델 가운데 가장 많았습니다. 최고 설정의 Sonnet 5.5는 지수 과제 하나에 출력 토큰 약 19만 3,000개를 썼는데, Opus 5.5 최고 설정이나 Sonnet 5 최고 설정보다 약 60% 많고 GPT-6 Astra 최고 설정의 약 7배입니다. 토큰 단가는 그대로여도 과제당 비용은 7.60달러로 Sonnet 5보다 약 50% 늘었습니다.

최고 설정끼리 과제당 비용을 대 보면 순서가 뒤집힙니다. 토큰 가격이 절반인 Sonnet 5.5(7.60달러)가 Opus 5.5(5.98달러)보다 과제 하나에 27% 더 들고, 같은 토큰 가격을 받는 GPT-6 Sol(1.06달러)의 약 7배입니다.
| 모델(최고 설정) | AA 지능 지수 | 과제당 출력 토큰 | 과제당 비용 |
|---|---|---|---|
| Claude Opus 5.5 | 58 | 약 11만 9,000개 | 5.98달러 |
| Claude Sonnet 5.5 | 56 | 약 19만 3,000개 | 7.60달러 |
| GPT-6 Sol | 48 | 약 3만 1,000개 | 1.06달러 |
| Claude Sonnet 5 | 38 | 약 11만 8,000개 | - |
AA는 이 가격에서 Sonnet 5.5가 지능 대비 비용의 효율 곡선 밖에 있다고 평가했습니다. 높은 강도에서는 Opus 5.5에 밀리고, 낮은 강도에서는 같은 성능을 더 싸게 내는 GPT-6 Astra나 Sol의 설정이 있다는 이유입니다. AA가 가장 경쟁력 있다고 꼽은 설정은 high로, 과제당 비용이 GPT-6 Sol과 사실상 같으면서 지수는 아주 조금 낮았습니다.
앤트로픽의 설명은 강도를 낮춘 쪽에 맞춰져 있습니다. 여러 평가에서 low나 medium 강도의 Sonnet 5.5가 Sonnet 5의 최고 점수를 과제당 비용 약 10분의 1로 넘었고, Opus 5.5를 보완하기에 가장 좋은 쓰임은 낮은 강도로 돌릴 때라고 적었습니다. 높은 강도에서는 Opus 5.5와 비슷한 점수를 비슷한 비용에 낸다는 문장도 함께 들어 있습니다.
AA의 토큰 그래프에서도 강도에 따라 사용량이 10배 넘게 벌어졌습니다. Sonnet 5.5가 지수 과제 하나에 쓴 출력 토큰은 low에서 약 1만 4,000개, medium에서 약 1만 9,000개, high에서 약 3만 4,000개였고, xhigh에서 약 7만 4,000개로 늘었다가 max에서 19만 3,000개가 됐습니다. 추론 강도를 올릴 때 토큰과 통과율이 함께 늘어난 실험은 Cursor와 Claude Code 팀의 글을 다룬 기사에 정리했습니다.
기본값도 쓰는 곳마다 다릅니다. Claude 앱과 Claude Code의 기본 강도는 medium이고, 개발자용 Claude Platform의 기본값은 high입니다. 앤트로픽은 Platform 기본값인 high에서 Sonnet 5.5가 FrontierCode의 GPT-6 Sol 최고 점수를 과제당 비용 약 5분의 1로 따라잡았다고 밝혔습니다. 같은 high 설정을 두고 AA는 GPT-6 Sol과 비용이 같고 지수가 조금 낮다고 평가해, 누가 어떤 평가로 쟀느냐에 따라 결론이 갈립니다.
앤트로픽은 Sonnet 5.5의 사이버보안 능력이 Opus 5와 비슷한 수준이라 Opus 5.5와 비슷한 사이버 안전장치를 붙였다고 밝혔습니다. Sonnet 모델에 이런 장치가 붙은 것은 처음입니다. 자기 코드의 버그를 찾아 고치는 일상 개발은 그대로 할 수 있고, 위험도가 높은 사이버보안 요청만 화면에 표시를 남기며 Sonnet 5로 넘어갑니다.
@claudeaiX 게시물 · 원문 보기
공개 직후 올라온 도움말 센터 글은 공격 코드 작성, 바이너리 기반 취약점 탐색, 침투 테스트를 전환 대상의 예로 들었습니다. 이 검사는 사용자가 친 문장만 보지 않고 모델이 읽는 메모리와 커넥터 자료, 검색 결과, 파일까지 살피기 때문에, 직접 쓰지 않은 내용 때문에 전환이 일어날 수도 있습니다. 생물학 안전장치는 Sonnet 5와 같고 걸린 요청은 다른 모델로 넘기지 않고 막으며, 모델의 추론을 뽑아내려는 증류 시도를 막는 분류기를 단 것도 Sonnet 가운데 처음입니다.
앤트로픽은 Sonnet 5.5가 자사 모델의 최고 능력을 넘어서지 않는다며, 정렬 평가를 사용자 이익에 반하는 행동과 사용자를 오도하는 행동, 고위험 악용에 협조하는 행동처럼 능력과 상관없이 생기는 위험에 맞췄다고 밝혔습니다. 약 1,850개 상황을 시험하는 자동 행동 감사에서 대부분 항목이 Sonnet 5와 같거나 나았고, 격리 환경을 벗어나려는 시도는 Opus 5.5에 가깝게 드물었습니다.
발표문에는 고객사 추천사가 여럿 실렸습니다. 고객 상담 소프트웨어 회사 젠데스크는 실제 상담 사례 수백 건에서 티켓 처리가 20% 빨라졌다고 했고, 슬랙은 프롬프트를 하나도 바꾸지 않고도 자사 평가 대부분에서 Sonnet 5보다 나았으며 출력 토큰이 약 14% 줄었다고 전했습니다. 게임 엔진 회사 유니티는 여러 단계짜리 에디터·코딩 평가에서 과제의 90%를 완료했다고 밝혔습니다.
추천사 명단에는 SpaceXAI도 있습니다. SpaceXAI의 머신러닝 디렉터 수알레 아시프는 CursorBench 4.0 점수 55.5%가 Opus 5.5 다음이라며 개발자들에게 인기를 끌 것이라고 적었습니다. CursorBench를 만든 Cursor는 8월 SpaceX에 인수됐고, 오픈AI는 11월 12일 Cursor에 대한 모델 공급을 끊겠다고 통보한 상태입니다.
Sonnet 5.5는 Claude 앱과 Claude Code, API에서 바로 쓸 수 있고, AWS와 구글 클라우드, 마이크로소프트 애저에도 같은 날 열렸습니다. API 모델 이름은 claude-sonnet-5-5이고, 데이터를 남기지 않는 무보존(zero data retention) 옵션도 그대로입니다. Claude Code에서는 Sonnet을 고르면 이제 Sonnet 5.5가 돌아가고, Pro와 Max, Team 요금제의 기본 모델은 9월 22일부터 Opus 5.5입니다.
앤트로픽의 개발자 계정 ClaudeDevs는 공개 33분 뒤, 9월 22일(미국 시각) Pro·Max·Team 사용자에게 준 한도 초기화를 아직 쓰지 않았다면 10월 22일 전까지 원할 때 쓸 수 있다고 다시 알렸습니다. API로 Sonnet 5를 생각 기능을 끈 채 쓰던 개발자는 Sonnet 5.5로 옮기기 전에 새 설정 between_tools(답하기 전 생각을 끄는 설정)로 바꿔야 한다고 앤트로픽은 안내했습니다.
@ClaudeDevsX 게시물 · 원문 보기
같은 값의 GPT-6 Sol과 견줄 때는 추론 강도를 어디에 두느냐가 계산을 가릅니다. 낮은 강도에서는 Sonnet 5.5가 적은 토큰으로 전작의 최고 점수를 넘고, 최고 강도에서는 토큰이 GPT-6 Sol의 6배 넘게 늘어 과제당 비용이 7배가 됩니다. 제가 9월 23일부터 25일까지 Opus 5.5 공개 뒤 3일의 결과물을 정리할 때도 medium 강도로 돌렸다고 밝힌 사례가 있었고, Sonnet 5.5에서는 이 선택이 청구서에 더 크게 남습니다.
다음 차례는 대량 처리와 비용에 민감한 쓰임을 겨냥한 Haiku 5.5입니다. 지금의 Haiku 4.5는 AA 지수 17점으로 Sonnet 5.5와 39점 차이가 납니다. 앤트로픽이 몇 주 안에 내놓겠다고 한 Haiku 5.5의 값과 점수가 나오면 다시 전하겠습니다.
읽어 주셔서 고맙습니다.
초이 드림