이 글 어땠어요?
설명 없이 처음 보는 2D 퍼즐 게임을 푸는 벤치마크입니다. 에이전트는 64x64 격자·16색 화면만 받고 키 다섯 개와 되돌리기, 클릭으로 규칙과 목표를 알아내야 하며, 점수는 사람보다 얼마나 적은 조작으로 레벨을 깼는지(RHAE)로 매깁니다.
행동마다 모델의 추론 기록을 버리던 것을 Responses API로 유지하게 했고, 대화가 17만 5,000자를 넘으면 오래된 기록을 잘라내던 것을 앞부분을 요약해 이어 가는 압축으로 바꿨습니다. 공개 세트 점수는 13.3%에서 38.3%로 올랐고 출력 토큰은 6분의 1로 줄었습니다.
오픈AI가 공개 세트 25개에서 직접 잰 값입니다. ARC 재단은 공개 세트 점수를 공식 리더보드에 올리지 않으며, 재단이 반비공개 세트에서 잰 GPT-5.6 Sol의 점수는 7.78%입니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
Prime Intellect의 하네스 Prime Agent에 Claude Opus 5를 얹자 ARC-AGI-3 공개 세트 점수가 95.5%로 올랐습니다. ARC Prize가 검증한 같은 모델의 점수는 30.16%였습니다. 하네스 구조와 채점 규칙, 공개 세트라는 조건을 함께 짚습니다.

Stripe가 7월 30일 사내 AI 에이전트 플랫폼 Kai의 구조와 성과를 공개했습니다. 직원 83%가 매주 쓰고, 영업 담당자가 Kai를 쓴 주에는 성사된 거래가 39% 많았습니다. 다만 6월 세션 36만 건의 중앙값은 2턴이었습니다.
7월 8일 서울 코덱스 밋업 질의응답에서 오픈AI 발표자는 CLI를 없애지 않고 실험 기능을 CLI에서 먼저 낸다고 답했습니다. Terminal-Bench 2.1에서 코덱스 CLI와 GPT-5.5는 83.4%, 같은 모델을 공용 하네스에 얹으면 78.2%였습니다.

Prime Intellect의 하네스 Prime Agent에 Claude Opus 5를 얹자 ARC-AGI-3 공개 세트 점수가 95.5%로 올랐습니다. ARC Prize가 검증한 같은 모델의 점수는 30.16%였습니다. 하네스 구조와 채점 규칙, 공개 세트라는 조건을 함께 짚습니다.

Stripe가 7월 30일 사내 AI 에이전트 플랫폼 Kai의 구조와 성과를 공개했습니다. 직원 83%가 매주 쓰고, 영업 담당자가 Kai를 쓴 주에는 성사된 거래가 39% 많았습니다. 다만 6월 세션 36만 건의 중앙값은 2턴이었습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
오픈AI 글은 당혹감으로 시작합니다. GPT-5.6 Sol은 오픈AI가 내세운 대로 오래된 수학 미해결 문제인 순환 이중 덮개 추측(cycle double cover conjecture)을 풀었고, 게임 「포켓몬 파이어레드」를 화면만 보고 끝냈습니다. 그런 모델이 ARC-AGI-3에서는 7.8%를 받았고, 바로 앞 세대인 GPT-5.5는 0.4%로 게임을 거의 하지 못했습니다. 오픈AI 연구원들은 2D 퍼즐 게임이 유독 어려운 것인지, 다른 무언가가 있는지부터 물었습니다.
ARC 재단의 결과 페이지로 보면 차이가 더 큽니다. 7월 9일 나온 GPT-5.6 Sol은 최고 추론 단계(max)에서 앞선 두 판의 시험을 거의 다 풀었습니다. 재단은 이 모델을 ARC-AGI-3 공개 게임을 처음으로 이긴 모델(ft09, 87%)로 적었지만, 반비공개 세트 평균은 한 자릿수였습니다.
| 시험 | GPT-5.6 Sol (max) |
|---|---|
| ARC-AGI-1 | 96.5% |
| ARC-AGI-2 | 92.5% |
| ARC-AGI-3 반비공개 세트 | 7.78% |
| ARC-AGI-3 공개 세트 | 13.33% |
같은 달 GPT-5.6 Sol이 컴퓨터를 쥐고 게임을 이긴 기록도 여럿 나왔습니다. 오픈AI는 글에서 에포크 AI가 중계한 「슬레이 더 스파이어」 완주와 「바바 이즈 유」 초반 단계 통과를 들었고, 와튼스쿨의 이선 몰릭이 올린 게시물도 소개했습니다. 몰릭은 코덱스의 GPT-5.6 Sol에게 자기 컴퓨터를 맡겨 무작위 요소가 섞인 「슬레이 더 스파이어 2」의 일일 도전을 깨라고 시켰고, 모델은 5시간 동안 판단을 이어 가 이겼습니다. 이 게임은 GPT-5.6 Sol의 학습 데이터 기준일 뒤에 나왔습니다.
@emollickX 게시물 · 원문 보기
ARC 재단은 3월 24일 논문으로 ARC-AGI-3를 공개했습니다. 에이전트가 받는 것은 64x64 격자에 16색으로 그린 화면뿐이고, 규칙도 목표도 알려 주지 않습니다. 조작은 키 다섯 개와 되돌리기, 격자 좌표 하나를 고르는 클릭으로 제한되고, 실시간 반응을 재지 않도록 한 수씩 두는 턴제입니다. 모델은 어떻게 채점되는지 듣지 못하고 점수도 볼 수 없으며, 행동을 하면 화면을 글자로 옮긴 것과 지금 몇 레벨인지만 돌아옵니다. 재단은 사람 응시자가 환경을 100% 풀었지만 3월 기준 프런티어 AI는 1% 아래였다고 적었습니다.

어려운 정도는 숫자로 나옵니다. 공개 게임 ls20의 1레벨을 무작위로 눌러 통과할 확률은 정확히 355분의 1입니다. 재단은 환경마다 도달할 수 있는 상태를 그래프로 그려, 무작위로 눌러서는 풀리지 않는지를 확인했습니다. 점수는 정답률 대신 사람 대비 조작 효율(RHAE)로 매깁니다. 사람이 몇 번의 조작으로 레벨을 깼는지를 기준으로 삼고, 모델이 얼마나 적은 조작으로 같은 곳에 닿았는지를 백분율로 냅니다. 사람 중앙값 조작 수의 5배를 넘기면 그 레벨은 끝납니다.
시험지는 셋으로 나뉩니다. 누구나 해 볼 수 있는 공개 시연 세트 25개, 재단이 외부 API로 프런티어 모델을 시험하는 반비공개 세트 55개, 대회용으로 묶어 둔 완전 비공개 세트 55개입니다. ARC-AGI-2는 공개 문제가 비공개보다 약 10배 많았는데, ARC-AGI-3는 이 비율을 뒤집어 공개 세트를 학습용 자료에서 시연용 창구로 바꿨습니다. 출시 당시 공식 점수는 클로드 Opus 4.6이 0.50%, 제미나이 3.1 프로 프리뷰가 0.40%, GPT-5.4가 0.20%였습니다.
재단은 5월 1일 분석 글에서 GPT-5.5(0.43%)와 클로드 Opus 4.7(0.18%)이 어디서 막혔는지 적었습니다. 행동의 국소적인 효과는 보면서도 그것을 게임 전체의 규칙으로 엮지 못했고, 처음 보는 환경을 테트리스나 소코반 같은 아는 게임으로 착각했으며, 레벨 하나를 깨고도 게임을 이해하지 못한 채 틀린 이론을 다음 레벨로 끌고 갔다는 것입니다. Opus는 관찰을 확신에 찬 틀린 이론으로 압축했고, GPT-5.5는 압축 자체를 어려워했다고 재단은 구분했습니다.
오픈AI 연구원 일란 비지오와 테드 샌더스도 GPT-5.6 Sol의 풀이 기록을 열어 봤습니다. 처음엔 재단의 분석처럼 모델이 그리 똑똑해 보이지 않았다고 했습니다. 행동 하나에 오래 머물렀고 좀처럼 나아가지 못했습니다. 더 들여다보니 혼란의 상당 부분이 모델보다 하네스 설정에서 나왔다는 것이 오픈AI의 결론입니다.
하나는 게임에서 행동 하나를 할 때마다 모델의 비공개 추론 기록을 모두 버리는 방식이었습니다. 모델은 지난 수와 짧은 메모는 볼 수 있었지만, 그 수를 둔 계획과 깨달음은 볼 수 없어 매 수마다 게임을 처음부터 다시 파악해야 했습니다. 다른 하나는 굴러가는 잘라내기 창이었습니다. 대화가 17만 5,000자를 넘으면 가장 오래된 메시지부터 버려서, 생각에 더해 지난 행동까지 시야에서 사라졌습니다.
17만 5,000자가 얼마나 되는지는 화면 크기로 가늠할 수 있습니다. 오픈AI는 대화 글자의 대부분이 행동 뒤에 돌아오는 격자 화면이라고 적었습니다. 화면 한 장이 64x64, 셀 4,096개이니 셀 하나를 한 글자로 옮기면 17만 5,000자에는 화면 약 42장이 들어갑니다. 오픈AI는 자기 구현에서 글자 대신 토큰 17만 5,000개를 한도로 썼는데, 대화 대부분을 차지하는 격자가 거의 1글자에 1토큰으로 쪼개져 둘이 비슷하다고 적었습니다. 뒤에 나오는 로디오노프의 실험에서 에이전트가 게임 하나를 끝까지 푸는 데 쓴 조작은 109번에서 2,441번까지였습니다. 이 계산대로라면 공식 하네스의 모델은 최근 화면 40여 장만 보고, 그보다 앞서 무엇을 해 봤는지는 잊는 구조였습니다.
ARC 재단도 이 문제를 알고 있었습니다. 재단은 논문에서 맥락 관리를 이 시험의 중심 과제로 꼽고, 관찰을 단순히 굴러가는 창에 담으면 모델의 맥락 예산을 금세 다 쓴다고 적었습니다. 출시 전 협력한 한 연구팀은 모델이 파이썬 코드를 돌려 지난 행동 기록에서 필요한 정보만 꺼내 보게 하는 하네스로 공개 환경 3개를 사람과 비슷한 조작 수로 모두 풀었습니다.
벤치마크가 AI 모델만 따로 재는 일은 드뭅니다. API 설정과 하네스 설계, 프롬프트 같은 덜 보이는 선택까지 함께 잽니다.— 일란 비지오·테드 샌더스, 오픈AI
오픈AI는 같은 시험을 자사 Responses API로 다시 짰습니다. 이전 응답의 ID를 넘기면 도구 호출과 턴을 넘어 추론 기록이 유지되고, 대화가 너무 길어지면 잘라내는 대신 앞부분을 요약해 이어 가는 압축(compaction)을 켰습니다. 챗GPT와 코덱스가 실제로 돌아가는 방식이고, 모델도 이렇게 훈련된다고 오픈AI는 설명했습니다.
| 항목 | 공식 하네스 | 추론 유지 + 압축 |
|---|---|---|
| 공개 세트 점수 | 13.3% | 38.3% |
| 출력 토큰 | 기준 | 6분의 1 |
| cd82 게임 | 리더보드의 어떤 프런티어 모델도 2레벨 이상 못 깸 | 6레벨 전부 |
추론 기록이 남자 모델은 행동마다 생각하는 시간이 줄었습니다. 매 턴 게임을 다시 해석하지 않아도 됐기 때문입니다. 지난 생각을 기억하니 시간이 갈수록 배우고 일관된 전략을 쓰는 것도 나아졌다고 오픈AI는 적었습니다. ARC 재단 결과 페이지에서 공식 하네스로 잰 GPT-5.6 Sol(max)의 cd82 점수는 5%였습니다.
같은 페이지에는 재단이 검증한 추론 단계별 점수도 있습니다. GPT-5.6 Sol은 ARC-AGI-3에서 max 7.8%, extra high 7.0%, high 2.1%, medium 1.1%, low 0.3%를 받았습니다. 생각을 더 많이 하게 할수록 점수가 가파르게 올랐는데, 공식 하네스는 그렇게 만든 생각을 다음 수로 넘기지 않고 버리고 있었습니다.
출력 토큰이 6분의 1이 된 것은 비용으로도 이어집니다. 7월 중순 오픈AI API 가격표에서 GPT-5.6 Sol은 100만 토큰당 입력 5달러, 출력 30달러로 출력이 입력의 6배였습니다. 추론 기록을 남기면 그 기록이 다음 턴의 대화 기록으로 다시 들어가 입력은 늘어나는데, 오픈AI는 입력 토큰이 얼마나 늘었는지와 게임 한 판의 총비용은 밝히지 않았습니다.

한데 오픈AI의 38.3%는 공개 세트 25개에서 오픈AI가 직접 잰 값입니다. ARC 재단은 논문에서 공개 세트를 사람과 AI 모두에게 일부러 쉽게 만들었고, 비공개 세트의 게임 방식을 다 담지 않는다고 밝혔습니다. 공개 게임을 아는 사람이 하네스를 손보면 이론상 공개 세트 100%도 가능하다며, 사람의 풀이를 그대로 재생해 공개 게임을 전부 깨는 하네스를 직접 공개하기도 했습니다.
공개 세트는 ARC-AGI-3가 무엇인지 보여 주는 용도로만 써야 합니다. 그 세트로 평가한 점수는 AGI를 향한 진전의 척도가 결코 아닙니다.— ARC 재단, ARC-AGI-3 논문 (3월)
재단은 그래서 어떤 시스템의 공개 세트 점수도 공식 리더보드에 올리지 않는다는 원칙을 세웠습니다. 도구도 특수 기능도 없는 단순한 하네스를 쓰는 이유로는 모델의 약점이 그대로 드러나고 모델 사이 비교가 공정해진다는 점을 들었습니다. 오픈AI도 이 점을 글에 적고, 상업 개발사는 반대로 모델마다 특성과 버릇에 맞춰 하네스를 다듬는다고 대비했습니다. 오픈AI는 반비공개 세트에서 새 하네스로 잰 점수를 내지 않았습니다. 반비공개 세트는 재단이 외부 API로 모델을 불러 시험하는 세트입니다.
재단의 논문에는 이번 일을 미리 짚은 대목도 있습니다. 하네스 연구에서 나온 좋은 생각은 시간이 지나면 모델 API 안쪽으로 들어갈 것이라며, 딥마인드가 GPT-3를 감싸 실험한 생각의 사슬(chain of thought)이 오픈AI의 o1이라는 모델로 들어간 과정을 예로 들었습니다. 오픈AI가 이번에 켠 추론 유지와 압축도 API에 이미 들어 있는 설정입니다. 재단은 하네스로 낸 점수를 따로 모으는 커뮤니티 리더보드를 만들었지만, 이곳 점수는 자체 보고이고 AGI 진전의 증거로 읽지 말라고 적었습니다.
하네스를 바꿨을 때의 폭은 바깥 연구에도 나옵니다. 연구자 세르게이 로디오노프가 5월 6일 공개한 논문은 코딩 에이전트가 파이썬으로 짠 세계 모델(게임 규칙에 대한 가설을 돌려 볼 수 있는 코드)을 관측과 맞춰 고치고, 그 모델로 계획을 세운 뒤 움직이게 했습니다. 게임별 코드나 힌트는 넣지 않았습니다. 공개 게임 25개에서 GPT-5.5는 15개를 끝까지 풀어 평균 58.12%를, GPT-5.4는 8개를 풀어 41.29%를 받았고, cd82는 GPT-5.5로 92.91%, GPT-5.4로 100%였습니다. 같은 게임 ft09가 GPT-5.4 실행에서는 100%, GPT-5.5 실행에서는 57.80%가 나올 만큼 실행마다 편차가 컸고, 연구자는 비공개 검증 세트는 아직 돌려 보지 못했다고 밝혔습니다.
하네스가 점수를 바꾸는 일은 ARC-AGI-3만의 일이 아닙니다. 터미널에서 실제 작업을 끝내는지 보는 Terminal-Bench 2.1 리더보드(7월 9일 보관본)에는 같은 모델을 회사의 자체 하네스와 시험 주최 측의 공용 하네스 Terminus 2에서 각각 잰 점수가 함께 올라 있습니다.
| 모델 | 자체 하네스 | 공용 하네스(Terminus 2) |
|---|---|---|
| GPT-5.5 | 83.4% (코덱스 CLI) | 78.2% |
| 클로드 5 Fable | 83.1% (클로드 코드) | 80.4% |
| 클로드 Opus 4.8 | 78.9% (클로드 코드) | 74.6% |
자체 하네스에서는 GPT-5.5가 1위였고, 공용 하네스에서는 클로드 5 Fable이 GPT-5.5보다 2.2%포인트 높았습니다. 같은 표 안에서 하네스를 바꾸자 순위가 뒤집혔습니다. 이 차이는 7월 8일 서울 코덱스 밋업 질의응답을 정리한 코덱스 밋업 기사에서도 다뤘습니다.
오픈AI가 벤치마크 자체의 조건을 문제 삼은 것도 7월에만 두 번째입니다. 오픈AI는 7월 8일 코딩 벤치마크 SWE-Bench Pro를 감사한 결과 과제의 약 30%가 깨져 있다고 추정한 글을 냈고, 그 내용은 GPT-5.6 출시 기사에 있습니다. 이번 글에도 같은 일을 전에 겪었다는 문장이 있습니다. 공개 벤치마크 점수가 낮아 놀랐다가, 평가 도구가 추론 기록을 버리는 범용 하네스를 쓰고 있었다는 것을 발견한 일입니다.
하네스 쪽에서 AI의 자기 개선이 먼저 나올 수 있다고 본 연구자도 있습니다. 오픈AI에서 안전 연구 부사장을 지낸 릴리안 웽은 7월 4일 블로그에 「자기 개선을 위한 하네스 엔지니어링」이라는 글을 올렸습니다. 글에 실린 예 가운데 다윈 괴델 머신은 모델(클로드 3.5 소네트)을 고정한 채 하네스 코드만 진화시켜 SWE-bench Verified 점수를 20%에서 50%로 올렸습니다. 웽의 글은 하네스 자기개선론 기사에서 자세히 다뤘습니다.
@lilianwengX 게시물 · 원문 보기
오픈AI가 ARC-AGI-3 글을 낸 7월 29일, 테크크런치는 웽이 건강을 이유로 공동 창업한 씽킹 머신즈를 떠난 뒤 오픈AI에 다시 합류했다고 보도했습니다. 오픈AI 대변인은 웽이 회사 내부 연구를 가속하는 최상위 팀을 이끌며, AI가 스스로를 고쳐 더 강해지는 재귀적 자기 개선 연구를 지원한다고 밝혔습니다.
오픈AI가 글 끝에 남긴 권고는 세 가지입니다. 옛 Chat Completions API 대신 Responses API를 쓰고, 추론 기록을 유지하고, 압축을 켜라는 것입니다. 모델을 비교할 때도 이 설정으로 잰 평가에 기대라고 덧붙였습니다. 오픈AI 모델을 Chat Completions로 붙여 쓰는 서비스라면 에이전트가 턴마다 생각을 새로 하고 있지 않은지, 긴 대화를 잘라낼 때 무엇이 사라지는지가 첫 확인 대상입니다.
벤치마크 표로 모델을 고르는 조직에도 같은 질문이 걸립니다. 정부의 독자 AI 사업은 목표를 6개월 안에 나온 최신 글로벌 모델 대비 95% 성능으로 잡았습니다. 같은 모델의 점수가 시험 세트와 하네스, 설정에 따라 몇 배씩 갈린다는 것이 7월 한 달 동안 쌓인 기록입니다.
다음에 볼 숫자는 ARC 재단이 반비공개 세트에서 추론 유지와 압축을 켠 조건으로 GPT-5.6 Sol을 다시 잴지입니다. 공개 세트 38.3%와 반비공개 세트 7.78%의 차이가 하네스 때문인지, 시험지 난도 때문인지는 그 숫자가 나와야 가를 수 있습니다.
읽어 주셔서 고맙습니다.
초이 드림