이 글 어땠어요?
생각만 길어지지 않고 파일 읽기, 테스트 실행과 재확인, 사용자에게 돌아오기 전에 진행하는 거리가 함께 늘어납니다. 노력을 낮추면 Claude는 스스로 알아내는 대신 사용자에게 맥락을 더 묻습니다.
블로그의 7배(약 400 대 2,800토큰)는 low와 high를 비교한 설명용 예시입니다. Opus 4.7 발표문의 사내 코딩 평가 도표에서 읽으면 이웃한 두 단계의 토큰 차이는 1.3~2배, low에서 max까지는 6배 남짓이었습니다.
프롬프트, 연결된 도구, 스킬, CLAUDE.md 같은 맥락부터 봅니다. 파일을 건너뛰거나 테스트를 돌리지 않았다면 노력을 올리고, 다 읽고도 자신 있게 틀렸다면 더 큰 모델을 고릅니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
앤트로픽 Applied AI 팀의 플레이북은 최근 실제 작업 20~50개로 에이전트 설정을 회귀 시험하고, 운영 지표가 3σ를 넘을 때만 에이전트가 PR이나 사전 승인된 롤백으로 움직이게 합니다. 플레이별 효과 수치는 없습니다.
Pi를 만드는 Earendil이 8월 20일 하네스를 네 부품으로 풀어 쓴 글을 냈습니다. 데이터브릭스 실측에서 같은 모델도 하네스에 따라 작업당 비용이 최대 2.08배 차이 났고, 앤트로픽 기본 캐시 수명 5분을 넘기면 쌓인 대화를 정가로 다시 읽습니다.
앤트로픽 Claude Code 팀이 7월 24일 Opus 5와 Fable 5용 시스템 프롬프트에서 80% 넘게 덜어내도 자사 코딩 평가에서 손실이 없었다고 밝혔습니다. 뒤집은 원칙 여섯 가지와, Free·Pro 기본 모델 Sonnet 5는 언급되지 않았다는 조건을 함께 짚었습니다.

앤트로픽 Applied AI 팀의 플레이북은 최근 실제 작업 20~50개로 에이전트 설정을 회귀 시험하고, 운영 지표가 3σ를 넘을 때만 에이전트가 PR이나 사전 승인된 롤백으로 움직이게 합니다. 플레이별 효과 수치는 없습니다.

Pi를 만드는 Earendil이 8월 20일 하네스를 네 부품으로 풀어 쓴 글을 냈습니다. 데이터브릭스 실측에서 같은 모델도 하네스에 따라 작업당 비용이 최대 2.08배 차이 났고, 앤트로픽 기본 캐시 수명 5분을 넘기면 쌓인 대화를 정가로 다시 읽습니다.
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.

글은 Claude Code 팀의 리디아 할리(Lydia Hallie)가 썼고, 앞부분의 예시 그림에 요지가 담겨 있습니다. 「실패하는 테스트를 고쳐 줘」라는 같은 요청에 low 노력은 테스트 파일 하나를 읽고 42번째 줄을 고친 뒤 돌아옵니다. high 노력은 테스트 파일과 소스 파일, 설정 파일을 읽고, 생각하고, 소스를 고치고, 테스트를 돌리고, 다시 읽어 확인한 다음 환경 변수가 로드되지 않았다는 원인까지 적어 돌아옵니다. 그림에 붙은 토큰 수는 약 400개와 2,800개로 7배 차이인데, 앤트로픽은 두 숫자 모두 설명을 위한 예시라고 표시했습니다.
많은 사용자가 노력을 답하기 전에 생각하는 시간으로 이해합니다. 블로그는 생각 시간도 노력에 들어가지만 그보다 넓은 설정이라고 적었습니다. Claude Code가 작업 중에 만드는 토큰은 세 가지로, 행동 사이사이에 흐르는 생각, Read나 Edit 같은 도구를 부르는 호출, 사용자에게 보여 주는 계획과 진행 상황과 요약입니다. 셋은 같은 계산 과정에서 나오는 똑같은 출력 토큰이고 값도 같습니다.

노력 단계는 프롬프트와 함께 요청에 실려 모델에 전달됩니다. 모델은 학습할 때 단계마다 어떻게 움직일지도 함께 배웠고, 그 행동은 가중치에 들어 있습니다. 그래서 노력은 매 턴마다 작업을 끝냈다고 판단하려면 얼마나 철저하게 확인하고 얼마나 확신해야 하는지를 정하고, 기준이 높을수록 거기까지 가는 데 토큰이 더 듭니다.
높은 노력에서 Claude는 대개 계획부터 세우지만 계획을 끝까지 고집하지는 않습니다. 가설 세 개를 세운 디버깅에서 첫 번째 확인으로 버그를 찾으면 첫 확인에서 찾았으니 나머지는 필요 없다고 적고 건너뜁니다. Claude Code의 작업 목록이 실행 도중 고쳐지는 것도 이 때문입니다. 앤트로픽은 높은 노력에서도 쉬운 일에 토큰을 부풀리지 않도록 학습 단계에서 과잉 사고를 따로 살핀다고 밝혔고, 지나친 생각은 오히려 결과를 떨어뜨린다고 적었습니다.
노력을 낮추면 Claude는 토큰을 써서 스스로 알아내는 대신 사용자에게 맥락을 더 묻습니다. 옆에서 지켜보는 사람이 있으면 이 편이 빠르고, 사람이 없는 동안 돌리는 작업이라면 질문이 답을 기다리며 멈춰 있게 됩니다.
엔터를 누르면 Claude Code는 메시지에 시스템 프롬프트, 도구 정의, CLAUDE.md, 대화 기록, 열어 둔 파일을 붙여 하나의 API 요청으로 보냅니다. 서버에서 처음 일어나는 일은 토큰화입니다. 글을 조각으로 나누고 학습 때 정해 둔 어휘표에서 조각마다 정수 하나를 대응시키는데, 블로그의 예로 const는 1978, await는 4293이 되고 이때부터 프롬프트는 정수 배열입니다.
이 배열을 확률로 바꾸는 것이 가중치(파라미터라고도 부르는, 거대한 행렬에 담긴 수십억 개의 숫자)입니다. 모델은 입력을 이 행렬에 통과시켜 어휘표의 모든 토큰에 확률을 매기는데, const x = await 다음이라면 fetch에 높은 확률을, banana에는 0에 가까운 확률을 줍니다. 가중치는 학습이 끝나면 읽기 전용이어서 프롬프트나 CLAUDE.md에 무엇을 적어도 그대로입니다. 학습 뒤에 나온 라이브러리 문서를 넣으면 Claude는 그 요청에서 문서를 활용하지만, 블로그는 이를 가르치기와 구분해 방향 잡기(steering)라고 불렀고 다음 요청으로 이어지지 않는다고 적었습니다.
모델은 답을 한 번에 만들지 않습니다. 토큰 하나를 예측해 배열 끝에 붙이고, 늘어난 배열로 다음 토큰을 다시 계산합니다. 200토큰짜리 답이면 가중치를 200번 통과하고, 기다리는 시간과 출력 비용 대부분이 여기서 나옵니다. 모델 설정이 정하는 것은 어느 가중치가 이 반복을 돌릴지와 출력 토큰 하나의 값이고, 토큰을 몇 개 만들지는 노력이 움직입니다.
그래서 두 설정은 청구서에서 곱으로 만납니다. 7월 현재 앤트로픽 가격표에 적힌 100만 토큰당 값은 다음과 같습니다.
| 모델 | 입력 | 출력 |
|---|---|---|
| Fable 5 | 10달러 | 50달러 |
| Opus 4.8 | 5달러 | 25달러 |
| Sonnet 5(8월 31일까지 도입가) | 2달러 | 10달러 |
| Sonnet 5(9월 1일부터) | 3달러 | 15달러 |
출력 단가만 보면 Fable 5는 도입가 Sonnet 5의 5배입니다. 모델을 고르면 이 단가가 정해지고, 노력을 고르면 그 단가에 곱할 토큰 수의 범위가 정해집니다.
Claude Code 문서 기준으로 Fable 5, Sonnet 5, Opus 4.8, Opus 4.7은 low, medium, high, xhigh, max 다섯 단계를 지원하고, 한 세대 전인 Opus 4.6과 Sonnet 4.6은 xhigh가 빠진 네 단계입니다. 기본값은 Opus 4.7만 xhigh이고 나머지 모델은 모두 high입니다. 문서가 단계마다 권하는 쓰임은 이렇습니다.
| 단계 | 문서가 권하는 쓰임 |
|---|---|
| low | 범위가 좁고 지연에 민감하며 높은 지능이 필요 없는 짧은 작업 |
| medium | 지능을 조금 양보하고 토큰을 줄이려는 작업 |
| high | 토큰과 지능의 균형, 대부분 모델의 기본값 |
| xhigh | 토큰을 더 써서 더 깊이 추론, Opus 4.7의 기본값 |
| max | 까다로운 작업에서 나아질 수 있지만 효과가 줄고 과잉 사고에 빠지기 쉬움 |
문서에는 단계 이름이 같아도 모델마다 눈금을 따로 맞췄다는 문장이 있습니다. Sonnet 5의 high와 Opus 4.8의 high가 같은 값을 가리키지 않는다는 이야기입니다. max는 지금 세션에만 적용되고 설정 파일에 기본값으로 저장할 수 없으며, 한 턴만 깊이 생각시키고 싶을 때는 프롬프트에 ultrathink를 넣는 방법이 따로 있습니다.
계정 종류에 따라 출발점도 다릅니다. Pro와 Team Standard 좌석은 Sonnet 5, Max와 API는 Opus 4.8로 시작하고, Fable 5는 어느 계정에서도 기본값이 아니어서 /model fable로 직접 골라야 합니다. Fable 5에서 사이버보안이나 생물학 분류기가 요청을 걸러 내면 Claude Code는 그 요청을 Opus 4.8로 다시 돌립니다.
Claude Code에서 추론의 양을 고르는 방법은 지난 1년 사이 여러 번 달라졌습니다. 2025년 4월 앤트로픽의 Claude Code 활용 안내는 프롬프트에 think, think hard, think harder, ultrathink를 적으면 순서대로 더 많은 생각 예산이 배정된다고 설명했습니다. 지금 문서에서 think와 think hard는 평범한 글자로 전달되고, ultrathink만 그 턴에 더 깊이 생각하라는 지시를 붙이는 키워드로 남았습니다.
| 날짜 | 있었던 일 |
|---|---|
| 2025년 4월 18일 | Claude Code 활용 안내, think부터 ultrathink까지 네 키워드로 생각 예산 배정 |
| 2025년 11월 24일 | Opus 4.5와 함께 API에 노력(effort) 매개변수 도입 |
| 2026년 4월 16일 | Opus 4.7, high와 max 사이에 xhigh 신설, Claude Code 기본값을 모든 요금제에서 xhigh로 |
| 2026년 5월 28일 | Opus 4.8, 기본값 high, claude.ai와 Cowork에 노력 조절 기능 |
| 2026년 6월 30일 | Sonnet 5, xhigh를 포함한 다섯 단계 지원 |
| 2026년 7월 7일 | Claude Code 팀, 모델·노력 고르는 법 블로그 공개 |
기본값이 움직인 과정이 눈에 띕니다. 앤트로픽은 4월 Opus 4.7을 내면서 Claude Code의 기본 노력을 모든 요금제에서 xhigh로 올렸고, 6주 뒤 나온 Opus 4.8은 high를 기본으로 잡았습니다. Opus 4.8 발표문은 코딩 작업에서 이 high가 Opus 4.7의 기본값과 비슷한 토큰을 쓰면서 성능은 더 낫다고 설명했고, 7월 블로그에도 같은 관찰이 실렸습니다. 모델이 새로 나오면 같은 이름의 단계가 하는 일의 양도 달라지기 때문에, 기본값은 모델과 함께 다시 정해집니다.
노력과 생각 예산을 어떻게 나눠 쓸지는 5월 샌프란시스코에서 열린 앤트로픽 개발자 행사 Code w/ Claude에서도 한 세션으로 다뤄졌습니다. 세션 소개문은 적응형 사고와 노력 조절이 개발자에게 과제마다 Claude가 얼마나 추론할지를 고르는 새 결정을 안겼다고 적고, 비용과 지연, 품질 사이의 교환을 주제로 올렸습니다.
블로그의 400 대 2,800은 low와 high, 중간의 medium을 건너뛴 두 경로를 그린 예시입니다. 앤트로픽이 실제로 잰 숫자는 모델 발표문에 있습니다. 4월 Opus 4.7 발표문에는 사람의 개입 없이 프롬프트 하나로 돌아가는 사내 코딩 평가에서 단계별 총 토큰과 점수를 찍은 도표가 실렸습니다.

도표에서 읽으면 Opus 4.7은 low에서 약 3만 3,000토큰으로 51% 안팎을, max에서 약 21만 토큰으로 75% 안팎을 받았습니다. low에서 max까지 토큰은 6배 넘게 늘었고, 이웃한 두 단계 사이의 증가는 1.3배에서 2배 사이였습니다. 가장 크게 뛴 구간은 xhigh에서 max로, 토큰이 두 배 가까이 늘 때 점수는 4%포인트 남짓 올랐습니다. 문서가 max를 두고 효과가 줄고 과잉 사고에 빠지기 쉬우니 넓게 쓰기 전에 시험해 보라고 적은 이유가 이 곡선에 있습니다.
노력 매개변수를 처음 내놓은 2025년 11월 Opus 4.5 발표문에는 모델까지 함께 바꾼 숫자가 있습니다. medium으로 둔 Opus 4.5는 SWE-bench Verified에서 Sonnet 4.5의 최고 점수와 같은 점수를 내면서 출력 토큰을 76% 덜 썼고, 가장 높은 단계에서는 Sonnet 4.5보다 4.3%포인트 높은 점수를 48% 적은 토큰으로 냈습니다. 당시 출력 단가는 Opus 4.5가 100만 토큰당 25달러, Sonnet 4.5가 15달러였으니, 단가가 1.7배인 모델이 토큰을 4분의 1만 쓰면서 출력 비용은 40% 수준으로 내려갑니다.
블로그는 이 관계를 곡선으로 그렸습니다. 쉬운 과제에서는 두 모델이 곧바로 기준을 넘어 곡선이 겹치고, 그 뒤에 쓰는 토큰은 품질 대신 재확인에 들어갑니다. 여러 단계를 거치는 어려운 과제에서는 큰 모델이 medium에서 이미 작은 모델의 max와 같은 품질에 닿습니다. 블로그는 곡선을 벤치마크 값 없이 그린 설명용이라고 밝혔습니다.

실제 가격을 붙인 도표는 6월 30일 Sonnet 5 발표문에 있습니다. 앤트로픽은 컴퓨터를 직접 조작하는 평가 OSWorld-Verified에서 Sonnet 5, Opus 4.8, Sonnet 4.6을 노력 단계별로 작업당 비용과 통과율에 찍었습니다.

도표에서 읽으면 Sonnet 5를 max로 돌린 통과율은 81% 남짓으로 Opus 4.8의 high와 비슷했고, 작업당 비용은 약 0.66달러와 0.46달러로 Sonnet 5 쪽이 더 들었습니다. 이 도표는 Sonnet 5를 9월부터 적용될 표준가로 계산했고, 앤트로픽은 8월 말까지의 도입가를 쓰면 실제 비용이 더 낮다고 덧붙였습니다. 도입가로 다시 계산하면 Sonnet 5 max는 약 0.44달러가 되어 Opus 4.8 high와 거의 같아집니다. 싼 모델을 최고 단계까지 밀면 비싼 모델의 기본값과 비슷한 돈을 쓰고 비슷한 점수에 닿았습니다.
큰 모델은 토큰당 값이 더 비싸지만, 작은 모델에 정말 버거운 과제에서는 작업 하나의 총비용이 더 낮게 나올 수 있습니다.— 리디아 할리, 앤트로픽 Claude Code 팀
오픈AI도 같은 손잡이를 둡니다. 오픈AI 개발자 문서는 추론 강도(reasoning effort)를 none부터 xhigh까지 두고 GPT-5.5의 기본값을 medium으로 잡았는데, 추론 강도는 조율하는 손잡이이고 품질을 되찾는 주된 수단으로 쓰지 말라고 적었습니다. xhigh는 늘어난 지연과 비용을 넘는 이득이 평가에서 확인될 때만 쓰라는 권고도 붙어 있어, 두 회사 문서가 결과가 나쁠 때 손잡이부터 돌리지 말라는 같은 권고를 담고 있습니다. 끝까지 파고드는 성질이 강점이면서 토큰 청구서가 된다는 이야기는 하루 전 정리한 GPT-5.6 초기 테스터 후기에도 나옵니다.
블로그가 따로 한 절을 할애한 것은 결과가 틀렸을 때의 순서입니다. 손잡이를 돌리기 전에 준 맥락부터 보라고 합니다. 프롬프트가 모호하지 않은지, 맞는 도구가 연결됐는지, 필요한 스킬을 갖췄는지, CLAUDE.md와 작업 범위가 맞는지입니다. 필요 없는 일에 노력을 올리고 있다면 고칠 곳은 대개 그보다 앞쪽이라는 설명입니다.

맥락을 충분히 줬는데도 틀렸다면 물음은 둘로 좁혀집니다. 파일 하나를 건너뛰었거나, 테스트를 돌리지 않았거나, 리팩터링을 중간에 멈췄다면 덜 해 본 것이니 노력을 올립니다. 모든 것을 읽고 분명히 애썼는데도 자신 있게 틀렸다면 덜 안 것이니 더 큰 모델로 옮깁니다. 반대로 큰 모델에서 한동안 반복 작업만 이어졌다면 작은 모델로 내려도 품질 손해 없이 빨라지고 대개 비용도 준다고 블로그는 설명합니다.
모델 셋을 사람에 빗댄 비유도 실렸습니다. Fable은 거의 아무도 겪지 못한 문제를 본 특화 전문가, Opus는 전문가, Sonnet은 아주 뛰어난 만능형이고, 노력은 그중 누구든 내 일에 시간을 얼마나 쓰는지를 정합니다. 낮은 노력의 Opus는 비슷한 문제를 많이 풀어 본 전문가와 5분 만나는 것과 같아서 코드베이스에 없는 요령을 짚어 주지만 코드는 훑고 맙니다. 높은 노력의 Sonnet은 만능형에게 오후 내내를 주는 것과 같아서 다 읽고 돌려 보고 다시 확인하지만, 전에 본 문제라는 알아봄은 덜합니다.
모델 설정은 대략 얼마나 유능한가를, 노력 설정은 대략 얼마나 철저한가를 정합니다. 실제 작업 대부분에는 둘 다 조금씩 필요합니다.— 리디아 할리, 앤트로픽 Claude Code 팀
블로그의 권고는 대부분의 작업을 모델의 기본 노력으로 두라는 것입니다. 기본값은 사람들이 한 작업에 쓰고 싶어 할 만큼 토큰을 쓰도록 맞춘 단계이고, 노력은 작업마다 고르는 값으로 쓰지 말고 하는 일의 성격에 맞춘 평소 선호로 정하라고 적었습니다. 사람이 얼마나 지켜보느냐에 따라 일을 맡기는 방식을 넷으로 나눈 흐름은 Claude Code 위임 방식을 다룬 글에 정리해 두었습니다.
월정액으로 Claude Code를 쓰는 사람에게 노력은 한도와 이어집니다. 앤트로픽은 5월 claude.ai에 노력 조절 기능을 넣으면서 낮은 노력은 더 빨리 답하고 사용 한도를 더 천천히 쓴다고 설명했고, 6월 Sonnet 5를 내면서는 높은 노력의 토큰 사용량을 감당하도록 Claude Code를 포함한 제품 전반의 사용 한도를 올렸다고 밝혔습니다. 같은 요금제라도 어느 단계에서 일하느냐에 따라 한도가 닳는 속도가 다릅니다.
API로 Claude를 붙여 서비스를 만드는 국내 개발팀에게는 단가 문제입니다. 확실한 상한은 max_tokens 하나인데, 한도에 닿으면 응답을 중간에 잘라 버리는 거친 도구라 블로그도 주로 API 개발자의 도구라고 적었습니다. 블로그가 더 쓸 만하다고 꼽은 것은 작업 예산(task budget)을 정하거나 프롬프트로 짧게 끝내 달라고 부탁하는 방법이고, 모델은 한도에 가까워지면 작업을 마무리하도록 학습돼 있습니다.
여러 사람이 쓰는 팀이라면 설정으로 기본값을 나눠 둘 수 있습니다. Claude Code 문서에 따르면 스킬이나 서브에이전트 파일에 effort 값을 적으면 그 스킬과 서브에이전트가 돌 때만 노력 단계가 달라지고, opusplan이라는 모델 별칭은 계획 모드에서 Opus를, 실행 모드에서 Sonnet을 씁니다. Claude Enterprise 관리자는 역할마다 모델별 노력 상한을 걸 수 있어서, 비싼 모델의 max를 누가 쓸지 정해 둘 수 있습니다.
블로그의 맺음말은 대부분의 시간에는 두 설정을 신경 쓰지 않아도 된다는 것입니다. 결과가 빗나가면 Claude가 덜 알았는지, 덜 해 봤는지를 묻고 그에 맞춰 조정하면 된다고 적었습니다. 비용 계산의 전제는 두 달 안에 한 번 달라집니다. Sonnet 5의 도입가는 8월 31일까지이고, 9월 1일부터 출력 단가가 100만 토큰당 10달러에서 15달러로 오르면 도입가로 계산해 비슷해 보였던 Sonnet 5 max와 Opus 4.8 high의 작업당 비용은 도표에 찍힌 그대로 다시 벌어집니다.
읽어 주셔서 고맙습니다.
초이 드림