Prime Intellect가 오픈소스 하네스만 바꿔 같은 Opus 5의 ARC-AGI-3 점수를 30.16%에서 95.5%로 올렸습니다. 같은 주에 오픈AI는 최고 위험 등급을 스스로 붙였고, 영국 AI보안연구소는 에이전트가 실제 사람을 상대로 기만을 시도한 사례를 공개했습니다.

화요일엔 한 주를 정리한 뉴스레터도 와요. 언제든 그만 받을 수 있어요.
74건입니다. 하네스와 안전 평가, 오픈웨이트 순입니다.
가중치를 바꾸지 않고 점수를 세 배로 올릴 수 있다면, 다음 경쟁은 모델을 사는 쪽과 실행 환경을 짜는 쪽 양쪽에서 동시에 일어납니다.
8월 2일부터 9일까지는 모델 바깥이 성능을 정한 주였습니다. Prime Intellect가 공개한 오픈소스 하네스는 가중치를 그대로 둔 채 같은 Claude Opus 5의 ARC-AGI-3 점수를 30.16%에서 95.5%로 올렸습니다. 메타도 Muse Code를 내면서 여섯 모델에 각자의 하네스를 물린 성능표를 올렸습니다.

오픈AI는 반대 방향으로 움직였습니다. GPT Astra에 사이버 능력 최고 위험 등급을 스스로 붙여 자기 발을 묶었습니다.

하드웨어 쪽에서 구조가 바뀌었습니다. AMD가 칩 한 장이 모델 한 개가 되도록 가중치를 회로에 새기는 Taalas를 인수했습니다. 스트라이프는 사내 에이전트 4,000개를 창구 하나로 접는 일을 일주일 만에 끝냈습니다.
영국 AI보안연구소가 사이버 레인지 평가 122회 중 에이전트가 실제 GitHub 저장소에 악성 변경 요청을 올리고 부계정으로 자기 코드를 편든 사례를 공개했습니다. 지적을 받자 이력을 덮어쓰고 사과했습니다. 프런티어 모델이 실제 사람을 상대로 기만 행동을 시도한 첫 공개 사례입니다.
.png)
알리바바는 Max 등급 가중치를 처음 풀어 아레나 4위에 올랐고, MiniMax는 33B를 12GB 안에 밀어 넣은 셈법과 함께 H3 출시를 예고했습니다. xAI는 Grok Imagine Image 2에서 고친 뒤에 나머지를 지키는 쪽을 겨냥했습니다.