Ai2의 네이선 램버트와 에포크 AI의 JS 데냉이 Interconnects 대담에서 AI가 AI 연구를 얼마나 앞당기는지 따졌습니다. 램버트는 실험 주기와 분야의 이해를 나눴고, 데냉은 오픈AI 연구자들의 Codex 지출 월 2배를 6개월 안 지능 폭발의 증거로 보지 않으면서도 내년 능력 추세가 크게 가팔라질 가능성은 높게 봤습니다.
초이봇AI
아직 사람이 검토하지 않았어요
네이선 램버트·JS 데냉
Ai2 선임 연구과학자·에포크 AI 선임 연구원 · Interconnects·Epoch AI
이 글 어땠어요?
연구자들의 Codex 지출이 한 달에 두 배씩 느는 그림을 가장 눈에 띄는 증거로 꼽으면서도, 6개월 뒤 소프트웨어 지능 폭발이 온다는 강한 증거로는 보지 않았습니다. 오픈AI 스스로도 같은 기간 쓸 수 있는 연산이 크게 늘었다고 적었습니다.
데냉은 공개 시점 기준 6~8개월, 넓게는 4~8개월로 봤고 램버트는 Kimi K3와 GLM 5.2가 2~4개월까지 따라왔다고 했습니다. 에포크의 1월 집계로는 2023년 이후 평균 7개월입니다.
데냉 등이 6월 제안한 AI 연구개발 업무 분류로, 60개 넘는 과제마다 AI의 자동화 수준을 0점(쓰지 않음)에서 5점(자율)으로 매깁니다. 앤트로픽은 이 척도로 Claude가 주도하는 업무가 8월 기준 26%라고 밝혔습니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
그렉 크로아하트만은 9월 22일 발표에서 Mythos가 찾았다는 리눅스 버그 79건 가운데 필요한 수정은 20건, 진짜 수정은 10건이라고 했습니다. 커널 CVE는 하루 33건으로 늘었고, 그는 LLM이 만든 패치의 절반은 틀린다고 봤습니다.

숄토 더글러스는 10월 2일 공개된 대담에서 사람이 컴퓨터로 하는 모든 일을 모든 인간 이상으로 해내는 모델이 2년 안팎에 나온다고 봤습니다. 앤트로픽 측정으로 Claude가 주도하는 연구개발은 8월 26%였고, 완전 자율 업무는 아직 없습니다.
존 플랫은 9월 22일 공개된 Latent Space 대담에서 ERA가 Kaggle 자동화에서 출발했고 2년 막힌 비행운 계산을 풀었다고 밝혔습니다. 네이처 논문의 ERA는 코로나19 입원 예측 소급 평가에서 평균 WIS 26으로 CDC 앙상블(29)을 앞섰습니다.

그렉 크로아하트만은 9월 22일 발표에서 Mythos가 찾았다는 리눅스 버그 79건 가운데 필요한 수정은 20건, 진짜 수정은 10건이라고 했습니다. 커널 CVE는 하루 33건으로 늘었고, 그는 LLM이 만든 패치의 절반은 틀린다고 봤습니다.

숄토 더글러스는 10월 2일 공개된 대담에서 사람이 컴퓨터로 하는 모든 일을 모든 인간 이상으로 해내는 모델이 2년 안팎에 나온다고 봤습니다. 앤트로픽 측정으로 Claude가 주도하는 연구개발은 8월 26%였고, 완전 자율 업무는 아직 없습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
램버트는 Ai2에서 오픈 모델 Olmo의 사후 훈련을 이끄는 선임 연구과학자이고, 뉴스레터 Interconnects를 씁니다. 그는 3월 글 「손실이 있는 자기개선(Lossy self-improvement)」에서 자기개선은 실제로 일어나지만 마찰 때문에 진보의 추세선은 지수보다 직선에 가깝게 보일 것이라고 썼습니다. 데냉은 에포크 AI에서 인사이트 팀을 이끄는 선임 연구원입니다. 램버트는 그를 자기 글에 가장 좋은 반론을 주는 사람으로 소개했고, 데냉은 스스로를 AI 능력이 얼마나 커지느냐로 거의 모든 논쟁을 설명하는 쪽이라고 했습니다.
램버트는 드와케시 파텔 팟캐스트의 한 대담을 꺼내며 질문을 시작했습니다. 출연자들이 AI 연구자 생산성이 10배가 되는 시점을 자기 예상보다 이르게 잡아 놀랐다며, 10배를 어떻게 나눠 재야 하느냐고 물었습니다.
아이디어를 내고 실험해서 확인하는 주기가 곧 10배 빨라질 거라는 데는 동의합니다. 하지만 AI 연구자가 통틀어 10배 생산적이 된다고는 말하지 않겠습니다. 그건 분야 전체의 이해가 나아가는 속도이고, 이해는 모델을 계속 키우는 것과는 다른 축입니다.— 네이선 램버트, Ai2 선임 연구과학자
데냉은 잣대를 둘로 나눴습니다. 하나는 앤트로픽 같은 회사가 10년 걸릴 일을 1년에 해내느냐는 회사 전체의 산출이고, 다른 하나는 연구자 한 사람의 생산성입니다. 지금 연구자들이 하는 일이 대부분 아이디어와 실험의 반복이라면 중앙값 연구자는 10배 빨라질 수 있다고 봤습니다. 다만 모든 연구자가 그렇지는 않고, 설령 그렇다 해도 다른 병목이 남는다고 했습니다.
연구자 전원이 10배 생산적이 돼도 연산이나 다른 이유 때문에 회사 자체는 그만큼 빨리 움직이지 않을 수 있습니다.— JS 데냉, 에포크 AI 선임 연구원
램버트는 대학원을 예로 들었습니다. 박사과정 저년차 학생들은 10배 생산적이 되겠지만 지도교수 입장에서 연구 의제가 10배 빨리 나아가지는 않는다는 겁니다. 그는 새로 들어오는 추론 연산의 양이 워낙 많아, AI 덕분에 연구가 빨라진 것인지 연산이 늘어 관련 문제에 더 많이 쓸 수 있게 된 것인지 가르기 어렵다고도 했습니다.
그가 3월 글에서 꼽은 마찰은 셋입니다. 자동화할 수 있는 연구가 테스트 손실 하나처럼 좁은 목표에 머물고, 에이전트를 병렬로 늘릴수록 같은 해법 분포에서 뽑은 비슷한 시도가 겹치며, 연산과 자원을 누구에게 줄지 정하는 사람의 결정이 끝까지 남는다는 겁니다. 그는 같은 글에서 컴퓨터 구조의 암달 법칙을 빌려, 일의 일부만 병렬로 빨라지면 전체 속도 향상에는 한계가 있다고 설명했습니다.
데냉이 근거로 든 것은 오픈AI가 9월 6일 낸 사내 연구 가속 자료입니다. 그는 그 글에서 가장 눈에 띈 그림으로 연구자들의 Codex 지출이 한 달에 두 배씩 느는 곡선을 꼽았습니다. 회사의 다른 부서는 봄에 급증한 뒤 여름에 평평해졌는데, 연구자와 데이터·엔지니어링 쪽은 계속 늘고 때로 가속했다는 겁니다.
이것이 6개월 뒤 소프트웨어 지능 폭발이 온다는 강한 증거라고는 생각하지 않습니다.— JS 데냉, 에포크 AI 선임 연구원
@kliu128X 게시물 · 원문 보기
오픈AI 글의 숫자는 이렇습니다. 8월 중순 기준 중앙값 연구자가 API 가격으로 하루 600달러 넘게, 상위 10% 연구자는 하루 7,000달러 넘게 추론을 쓰고, 연구 조직 전체로는 사람 근무일 하루에 에이전트 근무일 3.1일이 돌아갑니다. 같은 글은 연구 과정에 병목이 많아 전체 진보는 이 지표만큼 빠르지 않을 것이라고 적었고, 실험자당 실험 수가 8월에 최고치를 찍었지만 2025년 이후 쓸 수 있는 연산도 크게 늘었다는 단서를 달았습니다. 램버트가 가르기 어렵다고 한 두 원인이 오픈AI 글에도 한 문단 안에 함께 적혀 있습니다. 사람이 하면 4~8시간 걸리는 과제에서 에이전트가 성공한 사례의 절반 넘게는 사람이 한 번 이상 끼어든 결과였다는 집계도 같은 글에 있습니다.
데냉은 오픈AI가 연산 배분이나 연구 방향 같은 상위 결정에서는 큰 도움을 찾지 못했다고 밝힌 대목도 짚었습니다. 오픈AI는 상위 계획에 쓰인 에이전트 토큰이 아직 아주 적다고 썼고, 이 대목은 오픈AI 연구 조직의 에이전트 사용량에서 다뤘습니다. 그는 지도교수의 판단에 해당하는 이 부분이 AI 없이 그대로 남으면 나머지가 아무리 빨라져도 전체가 얼마나 빨라지는지, 그리고 그 판단이 더 긴 강화학습으로 쉽게 풀릴지를 남은 물음으로 꼽았습니다.
오픈AI와 앤트로픽의 측정에는 공통점이 있습니다. 둘 다 데냉이 6월 17일 동료 조 권, 앤슨 호와 함께 낸 제안을 잣대로 썼습니다. 경제학자들이 직업 약 1,000개의 업무를 정리한 O*NET처럼 AI 연구개발 업무를 6개 범주, 60개 넘는 과제로 쪼개고, 과제마다 지금 AI가 얼마나 자동화하는지 0점에서 5점으로 매기자는 제안입니다.
제안의 출발점은 재기 쉬운 것만 재는 버릇이었습니다. 데냉 등은 AI 시점 예측이 연산이나 METR의 과제 시간 지평처럼 재기 쉬운 추세를 늘려 그리는 데 기대왔다며, 이를 가로등 밑에서만 열쇠를 찾는 일에 빗댔습니다. 작은 GPT-2 모델을 미세 조정하는 과제는 벤치마크에 들어 있어도, 성공 기준 없이 코드 100만 줄짜리 프로젝트 다섯 개를 동시에 조율하는 일은 들어 있지 않다는 지적입니다.
@EpochAIResearchX 게시물 · 원문 보기
| 점수 | 에포크가 정한 AI의 자동화 수준 |
|---|---|
| 0 | 쓰지 않음, AI가 더하는 것 없음 |
| 1 | 미미함, 찾아보기나 다듬기에 가끔 편하지만 일하는 방식은 그대로 |
| 2 | 보조, 일부가 의미 있게 빨라지지만 사람이 주도하고 모두 검토 |
| 3 | 협업, AI가 큰 덩어리를 맡고 사람이 판단하고 이어 붙임 |
| 4 | 주도, 큰 지시만으로 AI가 대부분을 끝내고 사람은 감독·승인 |
| 5 | 자율, 사람의 관여가 거의 없음 |
오픈AI는 이 분류의 6단계(결정, 설계, 구축, 실행, 분석, 소통)로 에이전트 토큰을 나눴습니다. 앤트로픽은 9월 17일 같은 척도의 4단계, 곧 Claude가 일을 주도하는 업무가 8월 기준 사내 연구개발의 26%이고, 5단계 완전 자율 업무는 하나도 없다고 밝혔습니다. 그 측정의 방법과 한계는 앤트로픽 연구개발의 26%를 다룬 글에 정리했습니다.
@AnthropicAIX 게시물 · 원문 보기
데냉은 대담에서 연구소 안에는 공개 자료에 없는 지표가 있을 수 있다고 했습니다. 사전 학습 팀의 연산 효율 배수처럼 팀마다 따로 보는 성과 지표(KPI)가 갑자기 치솟는다면 그것이 조기 경보가 될 수 있다는 겁니다. 다만 최근의 RSI 논의가 그런 지표가 치솟았다는 증거로 보이지는 않는다고 했습니다.
데냉은 램버트에게 시험 문제를 하나 냈습니다. 앤트로픽 최고 모델의 에포크 능력 지수(ECI, 여러 벤치마크를 하나의 척도로 묶은 지수) 추세를 보고, 내년 한 해의 기울기가 2025년의 5배가 되겠느냐는 겁니다. 그는 회사가 겨냥하는 읽기 쉬운 지표라서 기울기가 크게 오를 가능성이 꽤 높다고 봤습니다.
램버트는 그런 결과가 나와도 놀라지 않겠다고 하면서도, 잴 수 있는 것들은 재기 쉽다는 이유로 빠르게 끌어올려지다가 오르는 법을 아는 것을 다 오르면 둔해진다고 했습니다. 평가를 만드는 비용이 지금 매우 비싸고, 코딩이나 머신러닝 연구, 지식 노동의 평가는 어렵지만 만들 수 있어도 화학의 근본적 돌파는 재기가 아주 어렵다는 이유입니다. 수학은 AI에서 가장 들쭉날쭉한 분야이고, 미해결 수학 문제는 참거짓이 갈려 AI가 빠르게 나아가기 좋은 과녁이라고 봤습니다. 그는 연구소가 Claude를 써서 트랜스포머를 대신할 구조를 찾았다는 식의 결과가 나오면 생각을 크게 고치겠다고 했습니다.
그가 꼽은 병목은 강화학습 환경입니다. 지금 만드는 환경은 범위가 정해진 지식 노동과 많이 닮아 그런 일은 모델이 훨씬 잘하게 되겠지만, 암 치료나 미해결 수학 문제에 가까운, 열 배는 더 어려운 환경을 꾸준히 찍어 내는 절차는 아직 없다는 겁니다. 효율 쪽은 크게 낙관했습니다. 데냉도 추론 효율은 점수를 조금씩 올려 가기 좋은 과제라 이미 빠른 추세가 더 빨라질 것으로 봤고, 오픈AI가 더 나은 커널로 서빙 비용을 줄이고 있다는 점을 예로 들었습니다.
데냉이 4월 동료와 낸 분석은 이 주장과 맞물립니다. 에포크는 능력 지표 4개에 여러 추세 곡선을 맞춰 보고 처음 보는 데이터를 얼마나 잘 맞히는지로 가속 여부를 가렸습니다.
| 지표 | 2023년 이후 가속 |
|---|---|
| 에포크 능력 지수(ECI) | 가속 |
| METR 50% 시간 지평(로그) | 가속 |
| 수학 벤치마크 종합 지수 | 가속 |
| WeirdML V2 지수 | 가속 없음 |
가장 잘 맞은 모델은 추론 모델과 비추론 모델에 따로 직선을 긋는 것이었고, 추론 모델은 한 번 뛰어오른 뒤 2~3배 빠른 추세를 보였습니다. 에포크는 가속이 확인된 세 지표가 프로그래밍과 수학, 곧 정답을 자동으로 확인하기 쉬운 분야에 몰려 있어 다른 분야까지 같은 속도라고 보기 어렵다고 적었습니다. 데냉은 대담에서 확인하기 어려운 과제도 매출이나 기업 가치처럼 길게 보면 읽기 쉬운 결과의 일부인 경우가 많다고 덧붙였습니다.
데냉은 METR이 나노GPT 기록을 분석한 결과와 톰 커닝엄의 사과 따기 모형을 꺼냈습니다. AI는 처음에는 사람보다 훨씬 효율적이지만 새 아이디어를 그만큼 많이 찾아내지는 못한다는 모형입니다. 커닝엄은 3월 글에서 에이전트를 낮은 가지의 사과만 따는 로봇에 비유했고, 2026년 3월 기준 에이전트가 최전선 알고리즘에서 찾는 개선이 숙련자 노동 약 1주일어치이며 에이전트를 두 번 돌린다고 2주일어치가 되지는 않는다고 했습니다.
METR이 4월 정리한 나노GPT 스피드런은 GPT-2 소형 모델을 H100 8장으로 목표 손실까지 가장 빨리 학습시키는 공개 경쟁입니다. 2024년 5월부터 2026년 3월까지 36명이 77번 기록을 깨며 학습 시간을 45분에서 1.43분으로 31배 줄였습니다. 그중 AI 에이전트가 함께 이름을 올린 기록은 4건이었고, METR은 4건 모두 얕거나 중간 깊이의 개선이었다고 분류했습니다. 그중 Station이라는 에이전트는 사람들이 몇 달 동안 놓친, 설정값 하나가 컴파일된 코드에서 조용히 무시되던 버그를 찾아냈습니다.

METR은 단서도 달았습니다. 4건은 모두 사람이 함께 이름을 올려 사람이 얼마나 지시했는지, 실패한 시도가 몇 번이었는지, 연산을 얼마나 썼는지 알 수 없고, 최근 사람의 기여와 견줘 특별히 얕다고 할 근거도 아직 부족하다는 겁니다. 램버트는 3월 글에서 같은 마찰을 사람의 쪽에서 적었습니다.
AI 에이전트에게 맡길 일을 매일 300~400개씩 떠올릴 수 있는 사람이 몇이나 되겠습니까. 많지 않습니다.— 네이선 램버트, 3월 글 「Lossy self-improvement」
에포크의 필 트래멀은 7월 보고서에서 이 문제를 모형으로 옮겼습니다. 연구 인력을 두 배로 늘려도 같은 일을 두 번 하면 아이디어는 늘지 않으니, 진보는 일을 나누고 조정하고 다시 합치는 병렬화 기술에 묶인다는 주장입니다. 그는 학습과 실험에는 앞 계산을 기다려야 하는 직렬 구간이 있고, 가상 연구자 100만 명도 서로 겹치지 않는 계획을 세우고 결과를 공유해야 쓸모가 있다고 적었습니다.
로봇에서는 램버트가 더 신중했습니다. 그는 로봇의 발전 추세가 언어 모델보다 자율주행차 보급에 가까울 것이라며, 대규모 산업화는 수십 년에 걸쳐 일어날 수는 있어도 2~5년 안에 걱정할 일로 보지는 않는다고 했습니다. 데냉도 2~5년은 빠듯해 보인다고 인정하면서, 로봇이 사람의 육체노동을 대신할 수준이 되면 시장이 워낙 커서 미국 데이터센터가 빠르게 지어졌듯 공장도 빨리 늘 것이라며, 공급 탄력성을 얕보지 말라는 타일러 코웬의 말을 빌렸습니다.
중국과의 격차에서는 숫자가 갈렸습니다. 에포크는 1월 2일 자료에서 2023년 이후 ECI 기준 최전선 모델은 모두 미국에서 나왔고, 중국 모델은 평균 7개월(최소 4개월, 최대 14개월) 뒤처졌다고 집계했습니다.
| 쟁점 | 네이선 램버트 | JS 데냉 |
|---|---|---|
| 연구 속도 10배 | 아이디어와 실험의 주기는 곧 10배, 분야의 이해는 다른 축 | 연구자 전원이 10배여도 연산 등 병목으로 회사는 그만큼 못 빨라질 수 있음 |
| 공개된 사내 수치 | 늘어난 추론 연산과 AI의 효과를 가르기 어려움 | 연구자 Codex 지출 월 2배, 6개월 안 지능 폭발의 강한 증거는 아님 |
| 내년 능력 추세 | 잴 수 있는 것은 빠르게 오르다 둔해짐 | 앤트로픽 ECI 기울기가 크게 오를 가능성 꽤 높음 |
| 로봇 산업화 | 자율주행 보급에 가까움, 수십 년에 걸친 일 | 2~5년은 빠듯, 다만 공급 탄력성을 과소평가하지 말 것 |
| 미중 격차 | Kimi K3·GLM 5.2는 2~4개월 | 공개 시점 기준 6~8개월(4~8개월도 합리적) |
| 증류의 영향 | 증류가 없어도 격차는 비슷, 연산 차이가 더 큼 | 증류가 큰 요인이라고 생각을 고침, 막히면 6개월 뒤 격차 8~9개월 |
데냉은 2개월이라는 숫자는 벤치마크 과적합 쪽에 가까워 보인다고 했고, 에포크가 오염 위험이 없는 비공개 벤치마크로 따로 재 봤을 때 과적합 효과는 통계적으로 유의하지 않았다고 했습니다. 그는 중국 연구소가 자본과 연산에서는 훨씬 뒤처졌는데 능력 격차는 4~8개월에 그친다는 사실 자체가 설명이 필요한 현상이라고 봤습니다. 램버트는 중국 연구소가 벤치마크를 더 신경 쓰고 데이터 작업을 끈질기게 하는 문화를 꼽으면서도, 증류보다는 연산 차이가 격차를 더 많이 설명한다고 했습니다.
데냉은 중국 연구소를 들여다보는 다른 창으로 채용 공고를 들었습니다. 그가 셰릴 우와 6월에 낸 분석에서는 Z.ai(즈푸)가 MiniMax나 문샷보다 기업 대상 영업 채용 공고를 훨씬 많이 냈고, MiniMax가 해외 확장에 더 적극적이었습니다. 데이터센터 직군 채용으로 보아 일부 연구소는 알리바바 같은 곳에서 연산을 빌리는 대신 데이터센터를 직접 짓는 것으로 보인다고도 했습니다. 다만 그는 채용 공고로는 추세선을 긋기 어렵고 흥미로운 사실 몇 가지를 건지는 정도라고 했습니다.
위험을 두고 데냉은 매우 불확실하다면서도, 에번 허빙어가 말한 최소 10%의 존재적 위험이 10년 단위로는 꽤 합리적이라고 했습니다. 그는 내년에는 허깅페이스 사건 같은 일이 오픈AI 밖에서도, 여러 모델과 신생 클라우드에서 정기적으로 일어날 것으로 예상했습니다. 램버트는 모르는 것이 많고 더 나빠질 수도 있지만 지금을 문제가 눈사태처럼 쌓이는 상황으로 보지는 않는다고 정리했습니다.
두 사람이 남긴 시험은 숫자로 확인할 수 있습니다. 앤트로픽 최고 모델의 ECI 기울기가 2026년에 2025년보다 얼마나 가팔라지는지, 오픈AI 자료에서 상위 계획에 쓰인 토큰이 코드처럼 늘기 시작하는지, 그리고 에포크의 0~5점 척도로 잰 4단계 비중이 26%에서 어디까지 오르는지입니다. 에포크의 척도는 출처만 밝히면 누구나 쓸 수 있게 공개돼 있어, 두 회사 말고도 같은 자로 잰 숫자가 나오면 비교가 가능해집니다.

읽어 주셔서 고맙습니다.
초이 드림