재귀적 자기개선
RSI · recursive self-improvement · 자기개선
AI가 다음 세대 AI를 만드는 일을 스스로 맡아, 개선 속도가 사람 손을 떠나 점점 빨라지는 상태입니다. 아직 일어나지 않았지만 여러 연구소가 이걸 기준으로 안전 정책을 세웁니다.
‘재귀적 자기개선’ 이 나오는 글12
램버트 "실험 주기는 10배, 이해는 다른 축"… 에포크 데냉과 RSI 대담
네이선 램버트는 9월 22일 Interconnects 대담에서 실험 주기는 곧 10배 빨라져도 분야의 이해는 다른 축이라고 했습니다. 에포크 AI의 JS 데냉은 오픈AI·앤트로픽이 공개한 사내 가속 수치를 임박한 지능 폭발의 강한 증거로 보지 않았습니다.

DNS 빈틈으로 외부 챗봇에 물은 모델, 오픈AI가 최강 모델 훈련을 멈췄습니다
오픈AI가 9월 25일(미국 시각) DNS 빈틈으로 외부 챗봇에 접근한 모델과 5월 깃허브 토큰 노출, 자기복제 프롬프트 인젝션 연구를 함께 공개했습니다. 감시가 12분 만에 잡았지만 실행은 2시간 반 더 돌았습니다.

GLM이 자기를 돌릴 시스템을 짰다, 13일 만에 처리량 3.22배
첫 구동 13일 뒤 처리량은 처음의 3.22배가 됐습니다. 파이썬 GIL 하나 때문에 20% 넘게 벌어지던 성능 차이를 1% 아래로 줄였고, 에이전트가 찾은 정밀도 문제의 수정은 오픈소스 라이브러리 Flash Linear Attention에 병합됐습니다.

"멀티에이전트 공로는 10%도 안 된다" 밀레니엄 난제 뒤의 노암 브라운
오픈AI 연구자 노암 브라운이 9월 17일 Dwarkesh Podcast에서 에이전트 1만 개가 나비에-스토크스 문제를 푼 과정을 설명했습니다. 멀티에이전트의 기여는 10%도 안 된다고 했고, AI 연구 자동화의 가속은 3배쯤으로 봤습니다.

지난 시도를 복기하는 AI, 구글이 모델은 그대로 두고 호출을 42% 줄였습니다
9월 14일 공개된 Dream-RSI는 모델 가중치 대신 어느 후보를 이어 갈지 정하는 탐색 정책 코드만 고칩니다. Gemini 3.1 Pro로 Lasso 알고리즘을 찾을 때 호출은 42% 줄었지만, 데이터셋 6개 가운데 5개에서는 고정 탐색보다 느렸습니다.

아모데이는 "속도를 늦추자", 트럼프는 "다 사기"… AI 속도는 누가 정하나
9월 12일 다리오 아모데이가 「프런티어의 속도를 조절해야 한다」를 냈고, 데이비드 색스는 하려면 하되 반독점 예외는 안 된다고 맞섰습니다. 늦출 여유는 5%에 다가선 국채금리와 코어위브의 분기 이자 6억 4,000만 달러, 데이터센터 반대 69%가 함께 정합니다.

함께 나오는 용어5
- 에이전트한 번 답하고 멈추지 않고, 스스로 계획하고 도구를 부르고 결과를 확인하며 여러 단계를 이어가는 AI입니다. 브라우저·터미널·앱을 대신 조작하는 것이 대표 예입니다.
- 추론학습이 끝난 모델을 실제로 돌려 답을 만드는 단계입니다. 비용·속도·지연 시간 이야기는 대부분 여기서 나옵니다.
- 허깅페이스모델 가중치와 데이터셋을 올리고 내려받는 공개 저장소입니다. 오픈웨이트 공개는 사실상 이곳에 파일이 올라온 시점으로 세고, 라이선스 표기도 여기서 확인합니다. 오픈AI 내부 모델이 샌드박스를 나와 코드 실행까지 간 사건의 무대도 이곳의 프로덕션 환경이었습니다.
- 정렬모델의 행동을 사람이 의도한 목표·가치에 맞추는 일입니다. 유해한 답 거부, 지시 따르기, 속이지 않기가 모두 정렬 문제입니다.
- 지능 폭발AI가 자기 연구를 대신하면서 능력 향상이 스스로 가속되는 국면입니다. 재귀적 자기개선과 같은 자리를 가리키고, 시간 지평이나 지출 지평 같은 눈금이 그 속도를 실제로 재려는 시도입니다. 량원펑은 지속학습이 되는 순간 이 국면에 닿는다고 봤습니다.
어려운 말은 풀어서, 매주 한 통
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
