시스템 프롬프트
system prompt · 시스템 지시문
대화가 시작되기 전에 모델에게 주어지는 역할과 규칙 문서입니다. 규칙을 촘촘히 쌓을수록 토큰 비용이 늘고, 앤트로픽 실험에서는 80% 이상을 덜어내도 코딩 평가 손실이 측정되지 않았습니다.
‘시스템 프롬프트’ 이 나오는 글5
프롬프트 66% 지워 7% 아낀 Cursor, 검증에 토큰 3배 쓴 Claude
Cursor가 9월 23일 시스템 프롬프트 66%를 지우고 도구 설명을 필요할 때만 불러와 토큰 비용을 7% 줄였습니다. 이틀 뒤 Claude Code 팀은 추론 설정을 올리면 토큰은 3배, 통과는 1.5배가 된다는 실험을 냈습니다.

모델은 같아도 청구서는 2배, Pi 개발사가 풀어 쓴 '하네스'
Pi를 만드는 Earendil이 8월 20일 하네스를 네 부품으로 풀어 쓴 글을 냈습니다. 데이터브릭스 실측에서 같은 모델도 하네스에 따라 작업당 비용이 최대 2.08배 차이 났고, 앤트로픽 기본 캐시 수명 5분을 넘기면 쌓인 대화를 정가로 다시 읽습니다.
말로만 옮는 AI '마인드 바이러스', 코딩하던 팀이 고래 보호로 돌아섰습니다
앤트로픽 연구자들이 참여한 팀이 8월 10일 에이전트 사이에서 스스로 퍼지는 생각을 실험한 논문을 냈습니다. 홈 디렉터리를 지우라는 지시가 홉마다 69~85%의 감염률로 번졌고, 세 문장짜리 경고를 붙인 에이전트에서는 0~1%였습니다.

자기 틀에선 6.7점, 같은 틀에선 2점, 메타 코딩 에이전트 Muse Code
메타가 8월 5일 Muse Code 베타와 Muse Spark 1.2를 내놨습니다. 메타 표에서 1.2는 Terminal-Bench 2.1 82.9%로 2위였지만, 같은 틀로 잰 독립 측정은 80.1%로 여섯 모델 중 4위였고 1.1과의 차이도 2.2점이었습니다.

Claude Code가 시스템 프롬프트 80%를 지우고 뒤집은 규칙 6개
앤트로픽 Claude Code 팀이 7월 24일 Opus 5와 Fable 5용 시스템 프롬프트에서 80% 넘게 덜어내도 자사 코딩 평가에서 손실이 없었다고 밝혔습니다. 뒤집은 원칙 여섯 가지와, Free·Pro 기본 모델 Sonnet 5는 언급되지 않았다는 조건을 함께 짚었습니다.

함께 나오는 용어5
- 에이전트한 번 답하고 멈추지 않고, 스스로 계획하고 도구를 부르고 결과를 확인하며 여러 단계를 이어가는 AI입니다. 브라우저·터미널·앱을 대신 조작하는 것이 대표 예입니다.
- 하네스모델을 감싸 실제 작업을 시키는 바깥 장치입니다. 프롬프트·도구·재시도·검증 규칙이 여기 들어가서, 같은 모델도 하네스에 따라 결과가 크게 다릅니다.
- 코딩 에이전트저장소를 읽고 명령을 실행하며 코드를 끝까지 고치는 에이전트입니다. 최근 모델 도약이 지식 문답 대신 이쪽에 몰려서, 딥시크 V4-Pro는 코딩 에이전트 평가 DeepSWE에서 12.8점이 62.7점이 됐습니다. 같은 모델도 어떤 하네스에 올리느냐에 따라 점수가 크게 달라집니다.
- 추론 강도모델이 과제에 얼마나 많은 계산과 검증을 쓰도록 할지 조절하는 설정입니다. 높은 값은 토큰 사용량과 실행 시간을 늘릴 수 있지만 정답을 보장하지 않습니다. 지원 단계와 적용 범위는 모델·제품별로 다릅니다.
- 추론학습이 끝난 모델을 실제로 돌려 답을 만드는 단계입니다. 비용·속도·지연 시간 이야기는 대부분 여기서 나옵니다.
어려운 말은 풀어서, 매주 한 통
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
