이 글 어땠어요?
결과가 나오면 맞았는지 그대로 적어요.
AI 자기개선은 자동 채점이 되는 소프트웨어에서 먼저 빨라지고, 실험·칩·전력망 단계는 그 속도를 따라가지 못한다
일자리 충격은 모델 출시일보다 기업이 일을 다시 나누는 시점에 커진다
GPT-5.6 Sol은 자기 커널을 다시 써 오픈AI의 서빙 비용을 20% 줄였습니다. 구글 딥마인드의 AlphaEvolve는 데이터센터 작업 배치로 전 세계 연산 자원의 평균 0.7%를 되찾았고, Gemini 학습 시간을 1% 줄였습니다.
METR은 5월 8일부터 16시간이 넘는 측정은 지금의 과제 묶음으로 믿을 수 없다고 적고 있습니다. Claude Mythos Preview 초기판의 50% 작업 지평은 최소 16시간으로 추정했습니다.
파이낸셜뉴스 보도로는 올해 3월까지 수도권 전력계통영향평가 1차 기술검토 신청 522건 가운데 최종 공급 승인은 10건, 건수 기준 1.9%였습니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
뉴욕시의회가 10월 5일 AI 4사 정책 책임자를 선서시키고 에이전트가 안전장치를 늘 지키느냐고 물었지만 보장한 회사는 없었습니다. 회사를 떠난 연구자 3명도 증언했고, 의회는 제3자 검증·신고 보상 법안 10건을 심사했습니다.

FTC가 9월 30일 오픈AI·앤트로픽 조사에 들어갔고, 고위 당국자는 두 회사의 사고 조사를 맡아 온 METR에도 자료와 증언을 요구할 계획이라고 로이터에 말했습니다. 하루 전 6개사는 외부 감사를 약속한 백악관 합의에 서명했습니다.
7월 9일부터 14일까지 AI 경고 문서 세 건이 나왔습니다. 노벨상 수상자 16명을 포함한 222명의 성명에는 오픈AI CFO와 제프 딘이, 다음 날에는 르쿤까지 이름을 올렸고, 하사비스는 출시 30일 전 시험을 제안했습니다.

뉴욕시의회가 10월 5일 AI 4사 정책 책임자를 선서시키고 에이전트가 안전장치를 늘 지키느냐고 물었지만 보장한 회사는 없었습니다. 회사를 떠난 연구자 3명도 증언했고, 의회는 제3자 검증·신고 보상 법안 10건을 심사했습니다.

FTC가 9월 30일 오픈AI·앤트로픽 조사에 들어갔고, 고위 당국자는 두 회사의 사고 조사를 맡아 온 METR에도 자료와 증언을 요구할 계획이라고 로이터에 말했습니다. 하루 전 6개사는 외부 감사를 약속한 백악관 합의에 서명했습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
@OpenAIX 게시물 · 원문 보기
오픈AI는 공식 X 계정에 배포를 마친 GPT-5.6 Sol에게 자기 자신을 더 싸게 돌리는 일을 맡겼다고 적었습니다. AI가 만든 개선이 다음 AI를 더 빠르고 싸게 만드는 되먹임은 특이점 논의가 출발하는 조건입니다. 이 되먹임이 어디서 빨리 돌고 어디서 막히는지를 따라가면 특이점이 어떤 순서로 올지가 보입니다.
오픈AI가 효율을 끌어낸 곳은 세 군데입니다. 요청을 만들고 작업을 돌리는 에이전트 하네스(모델에 도구와 기억을 붙여 일을 시키는 실행 틀), 요청을 연산 작업으로 바꿔 나눠 보내는 API 단계, GPU에서 모델을 돌리는 추론 단계입니다. GPT-5.6 Sol은 추론 단계의 커널을 다시 썼고, 추측 디코딩(작은 초안 모델이 토큰 여러 개를 먼저 제안하면 본 모델이 한 번에 검사하는 방식)에 쓰는 초안 모델의 크기와 구조를 바꾸는 실험을 수백 번 돌렸습니다.
이 개선에는 조건이 있었습니다. 오픈AI는 GPT-5.6을 Triton과 Gluon이라는 GPU 프로그래밍 언어로 커널을 쓰고 고치는 데 능하도록 따로 훈련했고, 모델이 쓴 커널이 맞는지는 부동소수점 검사 도구 FpSan으로 확인했습니다. 커널은 빨라졌는지 속도를 재고, 계산이 맞는지 검사 도구로 가릴 수 있는 코드입니다. 오픈AI의 효율 개선 전체는 GPT-5.6이 비용을 줄인 과정을 정리한 글에 있습니다.
구글 딥마인드는 1년여 앞서 비슷한 되먹임을 보고했습니다. 2025년 5월 공개한 AlphaEvolve는 Gemini 모델이 프로그램을 제안하면 자동 평가기가 채점하고, 점수가 좋은 프로그램을 다시 변형하는 방식으로 알고리즘을 찾습니다. 이 시스템이 찾은 작업 배치 규칙은 구글 데이터센터를 관리하는 Borg에 1년 넘게 쓰이며 전 세계 연산 자원의 평균 0.7%를 되찾았고, 행렬 곱셈 회로를 다듬은 제안은 차세대 TPU(구글의 AI 가속기)에 들어갔습니다.
AlphaEvolve는 자기를 받치는 모델의 학습도 앞당겼습니다. Gemini 구조에 들어가는 행렬 곱셈 커널을 23% 빠르게 만들어 Gemini 학습 시간을 1% 줄였고, 전문가가 몇 주씩 걸리던 커널 최적화를 며칠짜리 자동 실험으로 바꿨습니다. 트랜스포머 모델의 FlashAttention 커널은 최대 32.5% 빨라졌습니다.
모델의 가중치는 그대로 두고 하네스만 고치는 실험도 이어졌습니다. 릴리안 웽은 7월 4일 글에서 모델을 Claude 3.5 Sonnet으로 고정한 채 하네스만 진화시킨 Darwin Gödel Machine 실험이 SWE-bench Verified 점수를 20%에서 50%로 올렸다고 정리했습니다. 그는 가까운 시기의 재귀적 자기개선이 모델이 자기 가중치를 직접 고치는 데서 시작하지는 않을 것이라고 내다봤고, 이 내용은 릴리안 웽의 하네스 자기개선론에서 다뤘습니다.
Weco AI는 7월 14일 연구 에이전트가 연구 에이전트를 고치게 한 AIDE²를 공개했습니다. 자기 팀이 2년 동안 다듬은 하네스보다 나은 하네스를 AIDE²가 8일 만에 찾았고, 100번의 반복 동안 개선판이 일곱 번 나왔습니다. 과정은 Weco의 AIDE² 실험을 다룬 글에 있습니다.
AlphaEvolve의 구조도에는 사람이 맡는 일이 네 가지 적혀 있습니다. 프롬프트 틀, 쓸 모델, 평가 코드, 진화시킬 초기 프로그램입니다. 무엇이 좋은 답인지 재는 코드를 사람이 먼저 주면, 그다음의 생성과 채점과 선택은 컴퓨터 안에서 밤낮없이 되풀이됩니다.
이 방식으로 AlphaEvolve는 4×4 복소수 행렬을 스칼라 곱셈 48번으로 곱하는 알고리즘을 찾았습니다. 1969년 슈트라센 알고리즘의 49번이 56년 동안 이 조건에서 알려진 최고 기록이었습니다. 수학 문제 50여 개에 적용하자 약 75%에서 알려진 최고 답을 다시 찾았고, 20%에서는 기존 답을 넘었습니다.
METR은 5월 19일 낸 첫 Frontier Risk Report에서 같은 경계를 적었습니다. 앤트로픽, 구글, 메타, 오픈AI가 2~3월 사내 최고 모델을 내주고 평가를 받은 보고서입니다. METR은 에이전트가 진척을 싸게 확인하고 여러 방법을 싸게 시도해 볼 수 있는 문제, 곧 점수를 보며 한 걸음씩 오를 수 있는 문제에서 유난히 강했다고 적었습니다. 소프트웨어 재구현, 여러 최적화 문제, 수학의 일부 분야, 일부 디버깅과 취약점 찾기가 여기에 들었습니다.
반대쪽 기록도 함께 실렸습니다. 명세를 따라 프로그램을 재구현하는 과제에서는 사람 몇 주치 일을 해내던 Opus 4.6이, 데이터 관리 도구 dvc를 요구에 맞게 고쳐 만드는 과제에서는 사람 며칠치 결과만 냈고 그마저 쓸 수 없는 물건이었습니다. 실내에서 햇빛을 재현하는 500달러짜리 장치를 설계하는 과제에서는 가장 강한 공유 모델 가운데 하나가 낸 보고서가, Opus 4.6의 도움을 받으며 16시간을 들인 비전문가의 결과보다 훨씬 못했습니다.
METR은 벤치마크 점수와 실제 일의 거리도 적었습니다. 2025년 초 AI가 숙련 개발자의 작업을 빠르게 해 주지 못했을 가능성이 높다는 자체 무작위 실험 결과와 함께, 2025년 말 기준 SWE-bench Verified에서 합격 판정을 받은 AI 코드 가운데 실제 코드 리뷰를 통과했을 것은 절반 정도였다는 분석을 실었습니다.
@METR_EvalsX 게시물 · 원문 보기
METR의 작업 지평(time horizon)은 사람 전문가가 몇 시간 걸리는 과제까지 AI 에이전트가 절반의 확률로 끝내는지로 능력을 재는 지표입니다. 5월 8일 METR은 3월 짧은 기간 평가한 Claude Mythos Preview 초기판의 50% 작업 지평을 최소 16시간(95% 신뢰구간 8.5~55시간)으로 추정하고, 새 과제 없이 잴 수 있는 범위의 끝이라고 적었습니다. 같은 날 METR의 작업 지평 페이지에는 16시간이 넘는 측정은 지금의 과제 묶음으로 믿을 수 없다는 안내가 붙었습니다.
METR이 1월 내놓은 Time Horizon 1.1 과제 묶음은 과제 228개로, 8시간 넘는 과제가 31개입니다. METR 그래프에서 작업 지평은 105일마다 두 배로 늘었고(2024년 1월~2026년 2월 자료), 그사이 과제 묶음이 먼저 한계에 닿았습니다.
5월 19일 보고서에서 METR은 2~3월 공개 모델 가운데 최고의 50% 작업 지평을 약 12시간(신뢰구간 5~61시간)으로, 회사들이 사내에서 쓰던 최고 모델은 16시간 이상일 가능성이 높다고 봤습니다. 사내 모델이 공개 모델보다 평균 두 달쯤 앞서 있다는 추정이고, 성공률 80% 기준으로는 공개 모델이 약 1.5시간, 사내 모델이 3~4시간이었습니다.
6월 26일 GPT-5.6 Sol 평가에서는 측정이 더 흔들렸습니다. METR이 같은 실행 틀로 잰 공개 모델 가운데 편법 시도가 가장 잦아서, 편법을 실패로 치면 50% 작업 지평이 약 11.3시간(95% 신뢰구간 5~40시간)이었고 성공으로 치면 270시간을 넘었습니다. METR은 어느 숫자도 믿을 만한 측정으로 보지 않는다고 밝히고, GPT-5.6 Sol이 AI 연구개발을 완전히 자동화할 수준은 아니라고 판단했습니다.

앤트로픽은 책임 있는 확장 정책(RSP)에 AI 연구개발 능력의 기준을 두고 있습니다. 3.1판에서 이 기준을 2018~2024년 AI 발전 2년치를 1년에 압축하는 수준, 곧 AI 능력 전체의 발전 속도가 두 배가 되는 수준으로 정의했고, 연구자 한 사람의 생산성이 두 배가 되는 것과 구분했습니다. 7월 8일 시행한 3.4판에서는 자동화된 연구개발 기준을 우려하는 위협에 더 맞게 고쳤다고 밝혔습니다.
앤트로픽은 2월 위험 보고서에서 Claude Opus 4.6이나 그보다 약한 모델이 어느 분야든 연구개발을 자동화해 재앙을 일으킬 위험은 매우 낮다고 결론 내렸습니다. 외부 검토를 맡은 METR은 5월 8일 이 결론에는 동의하면서도, 보고서가 근거로 든 사내 설문은 표본이 작고 빠진 응답 하나를 부정 응답으로 세는 등 근거가 부족하다고 지적했습니다. METR은 이 논증이 완전한 자동화에 이르기 전에 연구개발이 크게 빨라질 가능성을 놓쳤다고도 적었습니다.
미국 정부는 과학 쪽 되먹임을 제도로 만들려 하고 있습니다. 에너지부는 7월 22일, 2025년 11월 행정명령으로 시작한 제네시스 미션에 파트너 약정 8억 달러 이상이 모였다고 발표했습니다. 목표는 10년 안에 미국 과학·공학의 생산성과 영향을 두 배로 늘리는 것이고, 국립연구소 17곳 전부와 기업·비영리 단체 41곳이 컨소시엄에 들어왔습니다. 슈퍼컴퓨터와 실험 시설, AI 시스템, 데이터를 한 플랫폼으로 잇겠다는 계획이고, 예산 구조는 제네시스 미션과 기초과학 예산을 다룬 글에서 다뤘습니다.
과학에서 속도를 붙잡는 것은 실험입니다. 국제에너지기구(IEA)는 AI가 단백질 구조 규명을 4만 5,000배 빠르게 했다고 적으면서, 새 에너지 기술이 연구실에서 시장에 나오기까지는 흔히 수십 년이 걸린다고 덧붙였습니다. 신약 후보는 세포와 동물, 사람을 대상으로 한 시험을 차례로 거치고, 새 소재는 합성한 뒤 특성을 재는 데 시간이 듭니다. METR도 환경이 계속 바뀌거나 자원이 한정되거나 한 번 틀리면 되돌릴 수 없는 과제에서는 점수를 보며 오르는 방법이 비싸고 위험해진다고 적었습니다.
칩도 주문한다고 곧바로 나오지 않습니다. 노광 장비를 만드는 ASML의 크리스토프 푸케 CEO는 4월 15일 1분기 실적 발표에서 AI 인프라 투자로 반도체 업계의 성장 전망이 더 굳어졌고 칩 수요가 공급을 앞지르고 있다고 말했습니다. 고객사들이 자기 고객과 맺은 장기 계약을 바탕으로 2026년과 그 뒤의 생산능력 확대 계획을 앞당기고 있다는 설명입니다.
IEA는 2025년 4월 보고서에서 세계 데이터센터가 2024년 쓴 전기를 약 415TWh, 세계 전력 소비의 약 1.5%로 추산했습니다. 2030년에는 약 945TWh로 두 배가 넘어 지금 일본 전체의 전력 소비보다 조금 많아지고, AI에 맞춘 데이터센터의 전력 수요는 네 배 넘게 늘 것으로 봤습니다.
| 항목 | 값 |
|---|---|
| 2024년 세계 데이터센터 전력 소비 | 약 415TWh (세계 전력의 약 1.5%) |
| 2030년 전망 | 약 945TWh |
| 2035년 전망 (기준 시나리오) | 약 1,200TWh |
| 2035년 전망 범위 (시나리오별) | 700~1,700TWh |
같은 보고서는 대책이 없으면 계획된 데이터센터 사업의 약 20%가 늦어질 수 있다고 봤습니다. 선진국에서 송전선을 새로 놓는 데 4~8년이 걸리고, 변압기와 케이블 같은 전력망 부품을 받기까지 기다리는 시간은 3년 새 두 배가 됐습니다. 가스발전소용 터빈도 몇 년씩 기다려야 해서 가동이 2030년 뒤로 밀리는 발전소가 나올 수 있다고 적었습니다.
| 고리 | 걸리는 시간 |
|---|---|
| 커널 최적화 (AlphaEvolve) | 전문가 몇 주에서 자동 실험 며칠로 |
| 연구 에이전트의 하네스 개선 (AIDE²) | 8일 |
| 미국 발전소의 전력망 연결 | 신청부터 가동까지 중앙값 2년 미만(2000~2007년 가동분)에서 4년 넘게(2018~2024년 가동분) |
| 선진국 송전선 신설 | 4~8년 |
| 변압기·케이블 대기 | 3년 새 두 배 |
한국도 같은 병목에 걸려 있습니다. 파이낸셜뉴스가 7월 14일 전한 바로는 올해 3월까지 수도권에서 전력계통영향평가 1차 기술검토를 신청한 사업이 522건, 3만 3,592MW였고, 최종 공급 승인을 받은 것은 10건으로 건수 기준 1.9%였습니다. 전력계통영향평가는 2024년 6월 시행된 분산에너지 활성화 특별법에 따라, 전력망이 포화된 지역에 10MW 이상 전기를 쓰는 시설이 들어설 때 거치는 심사입니다.
전기를 확보한 곳의 값은 올랐습니다. 같은 보도에 따르면 수도권 데이터센터의 평균 상면 임대료는 2019년 kW당 약 14만 원에서 2025년 약 25만 원으로 70% 넘게 올랐고, 공실률은 5% 미만입니다. 전력망이 AI 경제의 입지를 정하는 과정은 전력 심사와 빅테크의 발전소 계약을 다룬 글에 있습니다.
느린 고리를 AI로 넓힐 여지도 있습니다. IEA는 AI 기반 센서와 관리 도구를 쓰면 새 송전선 없이도 송전 용량을 최대 175GW 끌어낼 수 있다고 봤고, 이는 2030년까지 늘어날 데이터센터 전력 부하보다 큰 양입니다.
오픈AI는 효율 개선을 발표한 다음 날 GPT-5.6 Luna 가격을 80%, Terra 가격을 20% 내렸습니다. GPT-5.6 Sol 덕에 효율이 크게 올라 그 이득을 API 가격으로 돌려준다는 설명이었습니다.
@OpenAIX 게시물 · 원문 보기
값이 내려가면 더 많은 사람이 더 긴 일을 맡기고, 전에는 비싸서 못 돌리던 에이전트 작업도 돌립니다. 오픈AI가 효율 글에서 추론 인프라의 전제로 적은 것도 수요가 용량보다 빨리 는다는 사실이었습니다. IEA가 AI 하드웨어와 모델의 효율이 더 빨리 좋아진다고 가정한 시나리오에서도 2035년 데이터센터 전력 수요는 기준 시나리오보다 20% 적은 데 그쳐, 2024년의 두 배를 넘었습니다.
앤트로픽이 3월 5일 공개한 연구는 모델이 이론상 빠르게 할 수 있는 과제와 실제 업무에서 자동화에 쓰이는 과제를 겹쳐 직업별 노출도를 새로 쟀습니다. 컴퓨터 프로그래머는 과제의 75%에서 Claude가 실제로 쓰여 가장 높았고, 고객서비스 상담원과 데이터 입력원(67%)이 뒤를 이었습니다. 그런데 2022년 말 이후 노출이 가장 높은 직업군의 실업률이 체계적으로 오른 흔적은 없었습니다.
변화가 보인 곳은 신입 채용입니다. 22~25세가 노출이 높은 직업에서 새 일을 시작하는 비율은 챗GPT 이후 2022년보다 14% 낮았고, 25세가 넘는 사람에게서는 이런 감소가 나타나지 않았습니다. 연구진은 이 결과가 통계적으로 겨우 유의한 수준이라고 밝혔고, 같은 흐름은 22~25세 개발자 고용을 다룬 글에서 다른 자료와 함께 정리했습니다.
저는 일자리 충격이 모델이 나온 날보다 기업이 일을 다시 나누는 날에 커진다고 봅니다. 프로그래머 과제의 75%에 AI가 쓰이는데도 실업률이 움직이지 않은 이유를, 데이터 접근과 검수와 책임을 새로 나누는 조직의 속도가 모델 출시보다 느린 데서 찾습니다.
이 사슬에서 한국 기업이 들어가는 단계는 소프트웨어보다 느린 쪽입니다. SK하이닉스와 삼성전자가 만드는 고대역폭 메모리(HBM)와 삼성전자의 파운드리는 칩을 만드는 단계에 있고, 수도권에 데이터센터를 지으려는 사업자는 전력망 승인을 기다립니다. 커널을 고쳐 비용을 20% 줄여도 GPU와 메모리, 전기가 함께 늘지 않으면 불어나는 수요를 다 받지 못한다는 것은 오픈AI가 효율 글에 이미 적어 둔 전제입니다.
연도를 내건 예측은 커즈와일과 코코타일로의 전망을 비교한 글에서 다뤘습니다. 이 글에서 따라간 사슬로 보면, 확인할 지표는 단계마다 다릅니다.
METR은 2026년 말 같은 방식의 평가를 다시 하겠다고 밝혔습니다. 5월 보고서는 2026년 말이면 사내 최고 에이전트가 사람이 몇 주 걸리는 프로젝트, 특히 점수를 보며 오를 수 있는 프로젝트를 사람 개입 없이 오래 이어 갈 수 있다고 내다봤습니다.
읽어 주셔서 고맙습니다.
초이 드림