하네스
harness
모델을 감싸 실제 작업을 시키는 바깥 장치입니다. 프롬프트·도구·재시도·검증 규칙이 여기 들어가서, 같은 모델도 하네스에 따라 결과가 크게 다릅니다.
‘하네스’ 이 나오는 글12
딥시크 하네스, 맥·윈도 앱 공개… 공식 API 사용자 60%가 외부 플러그인
딥시크가 9월 29일 하네스 v0.2 프리뷰를 내고 맥·윈도 설치 파일을 공식 사이트에 올렸습니다. 플러그인은 패키지 이름만 입력하면 설치되고, 공식 API 사용자의 약 60%가 서드파티 플러그인을 쓴다고 밝혔습니다. 보안 감사는 아직 받지 않았습니다.

dots 키노트 도중 만든 저장소, 2일 만에 오픈소스판 OpenDots 공개
CopilotKit이 10월 1일(미국 시각) 오픈AI dots의 오픈소스 대안 OpenDots를 MIT 라이선스로 공개했습니다. 저장소는 dots 키노트 도중 만들어졌고 첫 코드는 5시간 16분 만에 합쳐졌습니다. 코드는 무료이고 모델과 대화 저장 비용은 따로 듭니다.

"가장 똑똑한 모델이 가장 싸진다" Claude Code 타리크의 하네스 전망
앤트로픽 Claude Code 팀의 타리크 시히파르가 9월 28일 Latent Space에서 검증 토큰이 줄면 가장 똑똑한 모델이 쉬운 일도 가장 싸게 하고, CLAUDE.md는 사라질 거라고 내다봤습니다. 하네스를 고치는 Claude Mods와 속도 조절 제안도 풀었습니다.

프롬프트 66% 지워 7% 아낀 Cursor, 검증에 토큰 3배 쓴 Claude
Cursor가 9월 23일 시스템 프롬프트 66%를 지우고 도구 설명을 필요할 때만 불러와 토큰 비용을 7% 줄였습니다. 이틀 뒤 Claude Code 팀은 추론 설정을 올리면 토큰은 3배, 통과는 1.5배가 된다는 실험을 냈습니다.

Grok 4.7과 같은 46점, 과제당 비용은 29분의 1… 샤오미 MiMo 공개
샤오미 MiMo-V2.6-Pro가 AA 지능 지수 46점으로 오픈웨이트 1위에 올랐습니다. 같은 점수의 Grok 4.7이 과제당 3.74달러를 쓸 때 Pro는 0.13달러였고, 강화학습 6일에 든 262만 달러까지 공개됐습니다.

Grok 4.7, 코딩 지수 9점 오를 때 종합은 2점, 과제당 비용은 2배
Grok Build에서 잰 Terminal-Bench 4.0 통과율이 17.7%에서 33.3%로 뛰었습니다. 같은 단가에 AA 지능 지수 과제 하나를 푸는 비용은 1.86달러에서 3.74달러로 늘어, 단가가 5배인 GPT-6 Astra(3.26달러)보다 많아졌습니다.

함께 나오는 용어5
- 에이전트한 번 답하고 멈추지 않고, 스스로 계획하고 도구를 부르고 결과를 확인하며 여러 단계를 이어가는 AI입니다. 브라우저·터미널·앱을 대신 조작하는 것이 대표 예입니다.
- 토큰모델이 텍스트 등을 나누어 처리하는 단위입니다. 단어 전체, 단어의 일부, 문자나 기호가 토큰으로 나뉠 수 있으며, 같은 문장도 토크나이저와 언어에 따라 개수가 달라집니다. 글자 수와 고정된 비율로 대응하지 않습니다. 입력·출력 토큰 수는 컨텍스트 한도와 API 과금의 기준으로 쓰입니다.
- 추론학습이 끝난 모델을 실제로 돌려 답을 만드는 단계입니다. 비용·속도·지연 시간 이야기는 대부분 여기서 나옵니다.
- ARC-AGI처음 보는 규칙을 몇 개 예시만으로 알아내는 능력을 재는 평가입니다. 학습 데이터 암기로는 풀리지 않도록 설계돼서, 일반화 능력을 논할 때 기준으로 쓰입니다.
- AGI사람이 하는 지적 작업 대부분을 사람 수준 이상으로 해내는 AI를 가리킵니다. 정의가 기관마다 달라서 같은 단어로 다른 시점을 말하는 경우가 많고, 이 뉴스레터에서는 특정 벤치마크 통과 시점보다 자동화된 연구 능력을 기준으로 다룹니다.
어려운 말은 풀어서, 매주 한 통
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
