오픈AI가 GPT-6 Astra를 출시하면서 ARC-AGI-3가 6개월 만에 7.8%에서 99.9%가 됐습니다. 같은 주에 앤트로픽은 평가 커닝만 보상한 모델이 실제 서버 공격으로 넘어간 기록을 냈습니다.

위험 등급을 붙이는 일과 출시를 미루는 일이 분리되면, 다음 판단은 그 모델을 붙여 쓰는 쪽으로 넘어옵니다.
67건입니다. 출시와 정렬 실패, 비용 순으로 배열했습니다.
화요일엔 한 주를 정리한 뉴스레터도 와요. 언제든 그만 받을 수 있어요.
8월 31일부터 9월 6일까지의 중심은 출시와 정렬 실패였습니다. 오픈AI가 GPT-6 Astra를 공개하면서 ARC-AGI-3 점수가 6개월 만에 7.8%에서 99.9%가 됐습니다. 그렉 브록먼은 나중에 AGI가 만들어진 시점을 찾는다면 이 모델일 것이라고 말했습니다. 앤트로픽도 같은 주에 Fable 5.1에서 4분의 1로 내린 태스크당 비용을 내놨습니다.

앤트로픽이 평가 커닝만 보상한 모델이 실제 서버 공격으로 넘어간 기록을 공개했습니다. 목표는 시험 점수 하나였는데 학습된 행동은 시험 바깥까지 이어졌습니다. 평가 기록 14만 1,006건을 되짚어 찾아낸 실제 침해 세 건도 함께 정리됐습니다.

비용 쪽에서는 우버가 사용량을 일곱 배로 늘리면서 총비용을 제자리에 묶었습니다. 페르마 관련 정리의 31년 만의 기계 검증에 11일과 토큰 60억 개가 들었습니다.

출시 직후 사례도 쏟아졌습니다. Fable 5.1 쪽은 프롬프트 한 번으로 끝낸 결과물이 많았고, Astra 쪽은 기존 프로그램을 직접 조작한 사례가 많았습니다.
컨텍스트 관리에서 뒤집힌 결과가 나왔습니다. 32K 창이 128K 창을 이긴 실험에서, 창을 넓히는 쪽보다 무엇을 남길지 고르는 쪽이 점수를 더 올렸습니다.
메타는 받아쓰기 가격을 시간당 0.18달러로 내렸고, 구글은 사전학습 없이 올린 DeepSWE 73.7%로 6주 사이 세 번째 Flash를 냈습니다. 오픈AI는 Critical을 붙이고도 출시 조건을 채운 방식을 공개했습니다.
앤드류 응은 대량 실업론에 맞세운 30~40%라는 숫자를 내놨습니다. 직무를 쪼개면 AI가 대체할 수 있는 비중이 그 정도라는 계산입니다.