이 글 어땠어요?
스케일AI가 2025년 9월 공개한 코딩 에이전트 벤치마크입니다. 카피레프트 공개 저장소와 스타트업 비공개 코드에서 뽑은 과제 1,865개로 이뤄졌고, 숨은 테스트를 통과하면서 기존 기능을 깨지 않아야 정답으로 칩니다.
자동 선별기가 고른 286개를 Codex 기반 조사 에이전트와 과제당 엔지니어 5명이 따로 검토해 각각 200개(27.4%)와 249개(34.1%)를 깨진 과제로 봤고, 오픈AI가 이를 바탕으로 약 30%로 추정했습니다.
스케일AI 연구 조직 Scale Labs는 7월 9일(미국 시각) 커뮤니티 피드백의 상당 부분이 준비 중인 1.1판에 반영되고 있다며 SWE-Bench Pro Verified를 곧 내놓겠다고 밝혔습니다. 30% 추정에 대한 반박은 없었습니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
WSJ가 10월 2일 새벽(한국 시각) 오픈AI가 외부 AI 안전 단체와 기밀을 공유한 혐의 등으로 안전팀 연구원 3명을 해고했다고 보도했습니다. 오픈AI는 정책 위반을 확인했지만 단체 이름과 넘어간 정보는 밝히지 않았습니다.

공개 당시 AI 최고점이 0.51%였던 ARC-AGI-3에서 GPT-6 Astra가 99.9%(어댑터 하네스)를 받았습니다. AA 종합 지수에서는 출시 당일 Sol과 같은 61점이었고, 에르되시 미해결 문제 68개 가운데 2개를 풀었습니다.
오픈AI에서 프런티어 모델 출시 12건의 안전 보고서를 총괄한 데이비드 로빈슨이 10월 3일 디애틀랜틱 기고로 퇴사를 알렸습니다. 그는 허깅페이스 사건과 9월 DNS 사고를 들어 시행착오의 시대는 끝났다고 썼습니다.

WSJ가 10월 2일 새벽(한국 시각) 오픈AI가 외부 AI 안전 단체와 기밀을 공유한 혐의 등으로 안전팀 연구원 3명을 해고했다고 보도했습니다. 오픈AI는 정책 위반을 확인했지만 단체 이름과 넘어간 정보는 밝히지 않았습니다.

공개 당시 AI 최고점이 0.51%였던 ARC-AGI-3에서 GPT-6 Astra가 99.9%(어댑터 하네스)를 받았습니다. AA 종합 지수에서는 출시 당일 Sol과 같은 61점이었고, 에르되시 미해결 문제 68개 가운데 2개를 풀었습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
@OpenAIX 게시물 · 원문 보기
오픈AI는 공식 X 계정에 SWE-Bench Pro가 더는 최전선 모델의 코딩 능력을 믿을 만하게 재지 못한다고 적었습니다. 과제의 30%가 깨져 있다고 보고, 연구자들에게 이 시험을 대표 코딩 평가로 쓰라고 했던 이전 권고를 철회한다는 내용입니다. 한국 시각으로는 7월 9일 새벽 6시 41분에 올라온 글이고, 같은 내용의 감사 보고서가 오픈AI 연구 블로그에 함께 실렸습니다.
SWE-Bench Pro는 AI 코딩 에이전트에게 실제 오픈소스 저장소의 기능 변경을 과제로 주는 시험입니다. 에이전트는 문제 설명만 보고 코드를 고치고, 채점은 에이전트가 볼 수 없는 숨은 테스트로 합니다. 새 기능을 확인하는 테스트를 통과하면서 기존 기능을 깨지 않아야 정답으로 칩니다.
오픈AI가 든 사례를 보면 깨진 과제가 어떤 모습인지 알 수 있습니다. 도서 목록 서비스 OpenLibrary에서 뽑은 과제는 목차 항목을 정리해 마크다운으로 다시 출력하는 함수(TocEntry.to_markdown)를 고치라고 합니다. 문제 설명은 띄어쓰기와 세로선 위치까지 글자 단위로 정해 주면서, 줄 앞에 공백이 하나 붙은 예시를 들었습니다. 그런데 숨은 테스트는 줄 앞에 공백 두 개를 요구했습니다. 설명을 그대로 따른 모델은 공백 하나 때문에 틀린 답으로 처리됩니다.
오픈AI는 이런 테스트가 생기는 이유를 과제의 출처에서 찾았습니다. 오픈소스의 이슈와 풀리퀘스트는 원래 사람끼리 협업하려고 남긴 기록이라, 관리자와 기여자가 긴 대화를 주고받는 사이 문제 설명과 병합된 코드, 테스트가 딱 맞아떨어지지 않는 일이 생깁니다. 특히 풀리퀘스트에 딸린 테스트는 그 변경 하나를 확인하려고 쓴 것이어서, 어떤 방식으로 구현해도 통하는 채점 기준으로 쓰면 지나치게 엄격해집니다.
깨진 과제는 네 갈래로 나뉩니다. 문제 설명에 없는 구현 방식을 강요하는 테스트는 기능이 맞는 답을 떨어뜨리고, 숨은 테스트가 요구하는데 설명에서 빠진 조건은 추론으로도 맞힐 수 없습니다. 반대로 기능을 덜 검사하는 테스트는 덜 고친 답도 통과시키고, 엉뚱한 쪽을 가리키는 설명은 모델을 틀린 동작으로 이끕니다.
| 유형 | 무엇이 문제인가 | 에이전트 검토 | 사람 검토 |
|---|---|---|---|
| 지나치게 엄격한 테스트 | 설명에 없는 구현 방식을 요구 | 14.4% | 17.8% |
| 검사 범위가 좁은 테스트 | 덜 고친 답도 통과 | 4.1% | 9.4% |
| 오해를 부르는 설명 | 테스트와 다른 동작을 지시 | 6.3% | 7.5% |
| 기타 | 네 유형에 맞지 않는 문제 | 1.9% | 1.2% |
| 조건이 빠진 설명 | 숨은 테스트가 요구하는 조건을 설명에서 누락 | 0.6% | 0.8% |
표의 비율은 공개 과제 731개 전체에서 각 유형으로 표시된 과제의 비율로, 오픈AI 감사 보고서의 도표 값을 옮겼습니다. 사람 검토 열을 더하면 36.7%로 뒤에 나오는 34.1%보다 조금 큰데, 오픈AI는 그 차이를 따로 설명하지 않았습니다.

감사는 세 단계로 돌았습니다. 먼저 자동 선별기가 과제 설명과 모델의 풀이 기록, 채점 테스트를 읽고 깨졌을 가능성이 있는 과제 286개를 골랐습니다. 이 286개를 두 경로로 따로 검토했습니다.
한 경로는 Codex 기반 조사 에이전트입니다. 에이전트는 과제 저장소와 실행 환경에 들어가 테스트를 돌리고 파일을 열어 보며, 주변 코드와 저장소 관례를 보면 풀리는 모호함인지 조건이 정말 빠진 것인지 가렸습니다. 이런 조사를 여러 번 따로 반복한 뒤 연구자가 요약을 읽고 최종 판단을 내렸고, 이 경로는 200개(27.4%)를 깨진 과제로 봤습니다.
다른 경로는 숙련 소프트웨어 엔지니어들입니다. 과제 하나를 엔지니어 다섯 명이 각자 봤고, 에이전트 분석을 참고하기 전에 문제 설명과 테스트, 사람이 쓴 정답 코드(gold patch)만으로 먼저 판단하게 했습니다. 의견이 갈리거나 확신이 낮은 과제는 한 번 더 검토로 올렸고, 이쪽은 249개(34.1%)를 깨진 과제로 봤습니다. 오픈AI는 두 결과를 놓고 전체의 약 30%가 깨졌다고 추정했습니다.
사람 쪽이 더 깐깐했습니다. 사람 검토자는 에이전트보다 깨졌다고 판단하는 경우가 많았고, 한 과제에 유형을 여러 개 붙이는 일도 잦았습니다. 에이전트가 붙인 유형과 사람의 판단이 겹친 비율은 74%였고, 가장 크게 갈린 것은 검사 범위가 좁은 테스트로 사람은 전체의 9.4%, 에이전트는 4.1%에서 이 문제를 꼽았습니다. 선별기에 걸린 과제 가운데 사람들이 가장 많이 고른 답이 「깨지지 않음」인 과제는 하나도 없었습니다.
이 숫자에는 조건도 붙어 있습니다. 사람 검토는 선별기가 고른 286개 안에서만 이뤄졌고, 나머지 445개는 사람이 따로 들여다보지 않았습니다. 오픈AI는 깨졌다고 본 과제 목록이나, 그 과제를 뺀 뒤 모델 점수를 다시 매긴 결과도 보고서에 싣지 않았습니다.
오픈AI가 대표 코딩 벤치마크를 버린 것은 올해 두 번째입니다. 2월 23일 오픈AI는 2024년 8월 직접 만들어 업계 표준처럼 쓰이던 SWE-bench Verified가 더는 최전선 코딩 능력을 재지 못한다는 글을 냈습니다. 최고 점수가 6개월 동안 74.9%에서 80.9%로 오르는 데 그치자, 남은 실패가 모델 탓인지 시험 탓인지를 따져 본 겁니다. o3가 64번 돌려도 꾸준히 풀지 못한 과제 138개를 엔지니어 여섯 명 이상이 검토했더니 59.4%에 테스트나 문제 설명의 결함이 있었습니다.
오염도 확인됐습니다. 오픈AI는 GPT-5에게 GPT-5.2-Chat, 클로드 Opus 4.5, 제미나이 3 Flash 프리뷰를 떠보게 했고, 세 모델 모두 일부 과제에서 사람이 쓴 정답 수정본이나 문제 설명의 세부를 그대로 재현했습니다. 오픈AI는 이를 세 모델 모두 학습 중에 문제와 답의 일부를 봤다는 증거로 보고 Verified 점수 보고를 멈췄습니다. 오염되지 않은 새 평가를 만들기 전까지는 SWE-Bench Pro 결과를 보고하라는 권고도 이때 나왔습니다.
그 권고를 4개월 반 만에 거둔 것이 이번 7월 글입니다. 2월 글에서 「좁은 테스트」와 「넓은 테스트」라고 부르던 결함을, 이번 보고서 각주는 「지나치게 엄격한 테스트」와 「조건이 빠진 설명」이라는 새 이름으로 다시 적었습니다. 오염에 강하다며 권했던 시험에서, 같은 회사가 같은 종류의 결함을 다시 찾아냈습니다.
스케일AI는 2025년 9월 19일 SWE-Bench Pro를 공개했습니다. 과제는 모두 1,865개로 공개 731개, 비공개 보관 858개, 상용 코드 276개입니다. 오염을 피하려고 GPL 같은 강한 카피레프트 라이선스의 공개 저장소와, 스타트업에서 사들인 비공개 상용 코드에서 과제를 뽑았습니다. 카피레프트 코드는 법적 부담 때문에 학습 데이터에서 빠질 가능성이 높다는 계산이었고, 정답 코드는 평균 4.1개 파일에서 107.4줄을 고칩니다.

출시 때 성적은 낮았습니다. Verified에서 70%를 넘기던 모델들이 Pro 공개 과제에서는 GPT-5 23.3%, 클로드 Opus 4.1 22.7%에 머물렀습니다. 오픈AI가 말한 「8개월 만에 23.3%에서 80.3%」의 출발점이 이 GPT-5 점수입니다.
한데 끝점인 80.3%는 다른 곳에서 나왔습니다. 앤트로픽이 6월 9일 Claude Fable 5와 함께 공개한 Claude Mythos 5의 점수로, 앤트로픽이 직접 잰 값입니다. 출발점 23.3%는 스케일AI가 SWE-Agent라는 실행 틀로 과제 하나에 50턴과 비용 상한을 걸고 잰 값이었습니다. 두 숫자는 잰 곳도, 돌린 조건도 다릅니다.
조건이 점수를 얼마나 움직이는지는 스케일AI 순위표에 남아 있습니다. 스케일AI는 2025년 10월, 턴 한도를 250턴으로 늘리고 비용 상한을 없애면 성능이 달라진다는 사실을 확인했다며 모델들을 다시 돌렸습니다.
| 시점 | 스케일AI 측정 조건 | GPT-5 점수 |
|---|---|---|
| 2025년 9월 | SWE-Agent, 50턴, 비용 상한, 추론 medium | 23.3% |
| 2025년 10월 | 250턴, 비용 상한 없음, 추론 high | 36.3% |
| 2026년 7월 7일 | mini-swe-agent, 250턴, 추론 high | 41.8% |
같은 GPT-5가 추론 설정과 턴 한도, 실행 틀이 달라지는 사이 18.5%포인트를 더 받았습니다. 모델을 그대로 두고 실행 틀만 고쳐 SWE-bench Verified를 20%에서 50%로 올린 연구는 릴리안 웽의 하네스 글에 정리했습니다.
감사 전날인 7월 7일 스케일AI 순위표의 1위는 GPT-5.4(xHigh)의 59.1%였습니다. 80%대 점수는 모델 회사들이 각자 잰 발표 자료에 있었습니다.
| 모델 | SWE-Bench Pro | 잰 곳 |
|---|---|---|
| Claude Mythos 5 | 80.3% | 앤트로픽 발표(6월 9일) |
| Claude Opus 4.8 | 69.2% | 앤트로픽 발표 |
| GPT-5.4 (xHigh) | 59.1% | 스케일AI 순위표(7월 7일) |
| GPT-5.5 | 58.6% / 59.4% | 앤트로픽 표 / 오픈AI 표 |
| GPT-5 | 23.3% | 스케일AI(2025년 9월) |
점수를 끌어올리는 길은 깨진 과제 말고도 있었습니다. 코딩 도구 회사 Cursor는 6월 25일, 모델이 문제를 풀지 않고 이미 알려진 수정을 찾아 쓰는 일이 늘고 있다는 연구를 블로그에 올렸습니다. SWE-Bench Pro의 과제는 실제로 고쳐진 버그에서 뽑았기 때문에, 에이전트가 인터넷이나 저장소의 git 기록에 들어갈 수 있으면 답을 찾아볼 수 있습니다.
Cursor가 Opus 4.8 Max의 SWE-Bench Pro 풀이 기록 731개를 감사용 에이전트로 훑었더니, 성공한 풀이의 63%가 답을 스스로 만들지 않고 찾아온 것이었습니다. 기록의 57%에서 모델은 인터넷에서 병합된 풀리퀘스트나 고쳐진 파일을 찾아 거의 그대로 옮겼고, 9%에서는 과제에 딸린 git 기록을 뒤져 버그를 고친 미래의 커밋을 캐냈습니다. git 기록을 지우고 인터넷을 막은 엄격한 실행 틀에서 다시 돌리자 Opus 4.8 Max는 87.1%에서 73.0%로, Cursor 자신의 Composer 2.5는 74.7%에서 54.0%로 떨어졌습니다.
Cursor는 이 차이가 새 모델일수록 크고 GPT 계열에서는 대체로 작았다고 적었습니다. 자사 모델 Composer 2.5의 표준 SWE-Bench Pro 점수도 코딩 능력과 알려진 수정에 접근하는 능력이 섞인 숫자라, 믿을 만한 벤치마크 수치로 쓰지 않는다고 밝혔습니다. 6월 25일과 7월 8일, 두 회사가 같은 시험의 점수에서 각기 다른 결함을 짚었습니다.
감사 보고서가 나온 이튿날인 7월 9일 오픈AI는 GPT-5.6을 내놨습니다. 발표문의 코딩 평가표에는 SWE-Bench Pro가 그대로 들어 있었고, 가장 강한 GPT-5.6 Sol은 64.6%로 Claude Mythos 5의 80.3%, Claude Fable 5의 80%, Claude Opus 4.8의 69.2%보다 낮았습니다. 전날 추천을 거둔 시험에서 자사 신모델이 경쟁사에 진 점수를 지우지 않고 실었습니다. 이 발표는 GPT-5.6 출시 기사에 정리했습니다.
같은 주에는 일론 머스크의 SpaceXAI가 Cursor와 함께 만든 Grok 4.5를 공개했습니다. Cursor는 비교표 각주에 다른 회사 모델의 SWE-Bench Pro 점수는 각 회사가 스스로 보고한 값이라고 적었습니다.

한국 시각 7월 9일 새벽은 서울 코엑스에서 국제머신러닝학회(ICML) 2026 본회의가 열리던 기간(7월 7~9일)이었습니다. 스케일AI 연구원 체탄 라네는 7월 5일 X에 이 학회에서 SWE-Bench Pro를 포함한 논문 7편을 발표한다고 알렸습니다. 벤치마크를 만든 쪽이 서울에서 이 시험을 소개하던 주에, 업계에 쓰자고 권했던 회사가 추천을 거둔 겁니다. 스케일AI의 답은 하루 뒤에 나왔습니다.
@ScaleAILabsX 게시물 · 원문 보기
스케일AI 연구 조직 Scale Labs는 미국 시각 7월 9일, SWE-Bench Pro에 대한 커뮤니티의 피드백에 감사한다며 그 가운데 상당 부분은 오래전부터 준비해 온 1.1판에 이미 반영되고 있다고 적었습니다. 최전선 모델에 맞춰 평가를 최신으로 유지하기는 어렵다면서, 「SWE-Bench Pro Verified」를 곧 내놓겠다고 예고했습니다. 오픈AI의 이름은 적지 않았고 30%라는 추정에 대한 반박도 없었습니다.
스케일AI는 메타가 2025년 6월 143억 달러를 넣어 지분 49%를 확보한 회사입니다. 스케일AI는 당시 발표에서 메타의 투자로 기업가치가 290억 달러를 넘었고, 창업자 알렉산더 왕이 메타로 옮겨 AI 사업을 맡는다고 밝혔습니다. 오픈AI는 경쟁사 메타가 지분 49%를 가진 회사의 벤치마크를 감사했고, 그 벤치마크의 최고 점수는 또 다른 경쟁사 앤트로픽의 모델이 갖고 있었습니다.

오픈AI의 감사는 공개 과제 731개를 대상으로 했고, 스타트업 18곳의 비공개 코드로 만든 상용 과제 276개는 감사 대상에 없었습니다. 출시 때 이 상용 과제에서 GPT-5는 공개 과제 23.3%보다 8.4%포인트 낮은 14.9%를, Opus 4.1은 22.7%보다 낮은 17.8%를, 제미나이 2.5는 13.5%보다 낮은 10.1%를 받았습니다. 스케일AI는 이 하락을 두고, 한 번도 공개된 적 없는 코드에서 재는 쪽이 일반화 능력을 더 현실적으로 잰다고 설명했습니다.
국내 기업의 코드 대부분도 공개 저장소에 올라간 적이 없는 쪽입니다. 사내 규약과 오래된 프레임워크, 한국어 주석이 섞인 저장소는 모델이 학습 때 볼 수 없었고, 인터넷에서 정답 수정을 찾아올 수도 없습니다. 스케일AI도 출시 글에서 에이전트의 쓸모를 재는 유일한 잣대는 각자의 내부 저장소에서 내는 성능이라고 적었습니다.
오픈AI는 숙련 개발자들이 모델 능력을 재려고 처음부터 설계한 새 벤치마크를 평가 연구자들이 만들기를 바란다고 적었습니다. 모델이 좋아진 덕에 프롬프트와 테스트, 풀이 기록을 예전보다 싸고 깊게 검사할 수 있게 됐다는 점도 덧붙였고, 이번 감사를 해낸 것도 Codex 기반 조사 에이전트였습니다. 오픈AI는 이런 평가 결과를 배포와 안전 결정에 쓰기 때문에, 추적하는 평가가 타당해야 한다고 강조했습니다.
스케일AI는 1.1판과 Verified판을 예고했고, 오픈AI는 이보다 앞선 6월 30일(미국 시각) 유전체 데이터 분석을 다루는 자체 벤치마크 GeneBench-Pro를 따로 내놓았습니다. 7월 12일까지 스케일AI의 두 공식 X 계정에 올라온 답은 위의 게시물 하나였고, 깨진 과제 목록과 재채점 결과는 오픈AI 보고서에도 없습니다. 저는 앞으로 SWE-Bench Pro 점수를 인용할 때 누가 어떤 실행 틀과 턴 한도로 쟀는지를 함께 적겠습니다.
읽어 주셔서 고맙습니다.
초이 드림