이 글 어땠어요?
결과가 나오면 맞았는지 그대로 적어요.
AI가 한 일을 사람이 채점하는 일이 풀이만큼 어려워지면 사람 피드백 학습·레드팀·벤치마크에 기댄 지금의 안전 절차가 함께 약해진다
o1의 추궁 뒤 속임 유지 85%(2024년 12월), 감시를 보상에 넣자 의도를 숨긴 오픈AI 실험(2025년 3월), 평가 인식을 끄자 협박 시도가 0번에서 13번으로 늘어난 앤트로픽 실험(2026년 7월)이 근거입니다.
AI가 앞으로 10년 동안 근본적으로 더 강력해져 산업혁명보다 큰 경제 변화가 훨씬 짧은 기간에 올 수 있다고 보고, 경제학자와 정책 결정자, 기술 리더에게 전환형 AI의 경제학을 연구하고 인센티브와 안전장치, 제도를 지금 만들라고 요구했습니다. 구체적인 정책은 담지 않았습니다.
오픈AI의 사라 프라이어 CFO와 로니 채터지 수석 이코노미스트, 앤트로픽의 잭 클라크, 구글의 제프 딘 등이 서명했습니다. 샘 올트먼, 다리오 아모데이, 데미스 하사비스 같은 대표들은 서명하지 않았고, 아모데이와 하사비스는 각자 규제안을 따로 냈습니다.
한국은행 소속 연구자가 서명자 명단에 있습니다. 7월 9일 KDI는 이르면 2030년 일자리 약 90%에서 직무의 90% 이상이 기술적으로 자동화 가능해진다는 추정을 다시 내놨고, AI 2040 시나리오는 한국의 칩 공장과 GPU를 많이 가진 기업을 신고 대상으로 그렸습니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
앤트로픽이 9월 9일 사이버보안 평가 중 실제 시스템에 무단 접근한 사고 네 건의 정렬 평가를 공개했습니다. 범위 경고는 직전 턴에 주면 90%, 세 턴 앞에 주면 40%만 멈췄고, 접근 금지 표시 하나가 우회 시도를 20.8%에서 2.1%로 낮췄습니다.

오픈AI 수석과학자 야쿠프 파초키가 GPT-6 Astra 공개 3일 뒤 회사 자율 약속을 제3자·정부가 집행하는 의무 안전 기준으로 바꾸자고 썼습니다. 같은 날 오픈AI는 Astra급 GPU 배정이 59.2% 줄자 다른 모델 배정이 17.2% 늘었다고 공개했습니다.
오픈AI가 9월 16일(미국 시각) 정렬 이탈 공개 기준과 훈련 중 사례 보고서 6편을 냈습니다. 가짜 수치를 숨기라는 요약 지시가 GPT-5.6 Sol에서 2.15%, Astra에서 0.27% 나왔고, 발견에서 공개까지 길게는 5개월이 걸렸습니다.

앤트로픽이 9월 9일 사이버보안 평가 중 실제 시스템에 무단 접근한 사고 네 건의 정렬 평가를 공개했습니다. 범위 경고는 직전 턴에 주면 90%, 세 턴 앞에 주면 40%만 멈췄고, 접근 금지 표시 하나가 우회 시도를 20.8%에서 2.1%로 낮췄습니다.

오픈AI 수석과학자 야쿠프 파초키가 GPT-6 Astra 공개 3일 뒤 회사 자율 약속을 제3자·정부가 집행하는 의무 안전 기준으로 바꾸자고 썼습니다. 같은 날 오픈AI는 Astra급 GPU 배정이 59.2% 줄자 다른 모델 배정이 17.2% 늘었다고 공개했습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
@erikbrynX 게시물 · 원문 보기
성명을 조직한 스탠퍼드 디지털경제연구소의 에릭 브린욜프슨이 한국 시각 7월 13일 밤 X에 올린 전문은 번호를 붙인 세 항목입니다. AI가 앞으로 10년 동안 근본적으로 더 강력해질 수 있고, 그러면 산업혁명보다 큰 경제 변화가 훨씬 짧은 기간에 펼쳐질 수 있으며, 대규모 일자리 이동 같은 위험과 생활수준의 큰 향상 같은 기회가 함께 온다는 내용입니다. 마지막 항목은 경제학자와 정책 결정자, 기술 리더에게 전환형 AI의 경제학을 이해하고 AI가 사람을 보완하는 쪽으로 가도록 인센티브와 안전장치, 제도를 지금 만들라고 요구합니다.
| 날짜(미국 시각) | 문서 | 쓴 사람 | 요구한 것 |
|---|---|---|---|
| 7월 9일 | AI 2040: Plan A | AI Futures Project 6명(코코타일로 등) | 미중이 2029년 합의해 초지능 개발을 2040년까지 미룸 |
| 7월 13일 | We Must Act Now | 경제학자·AI 연구자 222명(노벨상 수상자 16명) | 전환형 AI의 경제학 연구, 인센티브·안전장치·제도 마련 |
| 7월 14일 | 프런티어 AI를 위한 프레임워크, 그리고 새 시대의 여명 | 데미스 하사비스 | 출시 30일 전 표준기구 평가, 필요하면 랩들의 개발 속도를 함께 늦춤 |
첫 문서는 2025년 AI 2027을 낸 비영리 연구소 AI Futures Project에서 나왔습니다. AI 2027은 2027년에 초지능이 나와 인류가 멸종하거나 극소수가 권력을 쥐는 결말을 그렸고, 속편 Plan A는 미국과 중국이 2029년에 합의해 초지능 개발을 2040년까지 미루는 길을 그렸습니다. 저자 가운데 일라이 리플랜드는 이 길로 좋은 미래에 닿을 확률을 42%, 지금처럼 경주하는 길은 10%로 봤습니다. 그런데 저자 다섯 명이 이 계획이 실제로 실행될 확률로 적은 숫자는 3%에서 15% 사이였고, 계산 과정은 AI 2040을 다룬 글에 정리했습니다.
@DKokotajloX 게시물 · 원문 보기
세 번째 문서는 성명이 나온 다음 날 구글 딥마인드 CEO 데미스 하사비스가 X에 올린 긴 글입니다(한국 시각 7월 14일 저녁). 증권업계의 자율 규제 기구 FINRA를 본뜬 프런티어 AI 표준기구를 만들고, 모델을 출시 30일 전까지 이 기구에 넘겨 평가받게 하자는 제안입니다. 처음에는 자발적으로 시작하되 평가 절차가 검증되면 미국 시장 출시의 조건으로 삼고, 상황이 심각하면 프런티어 랩들의 개발 속도를 함께 늦추는 조정까지 넣었습니다. 시험할 항목으로는 사이버보안과 생물학 위협 같은 고위험 능력, 에이전트가 안전장치를 우회하거나 속이는 징후, AI가 만든 이미지의 워터마크, 사람이 읽을 수 있는 추론 토큰을 들었습니다. 기구의 자금은 대부분 업계가 대고 이사회에는 독립 기술 전문가와 오픈소스 진영 대표가 들어가며, 자세한 설계는 하사비스의 규제안을 다룬 글에 있습니다.
@demishassabisX 게시물 · 원문 보기
지금은 인류 역사의 중대한 전환점입니다. 뇌가 가진 인지 능력을 모두 갖춘 AGI가 아마 몇 년 안에 올 것입니다.— 데미스 하사비스, 7월 14일 X 글
성명에 서명한 노벨상 수상자 16명은 모두 경제학상 수상자입니다. 조지프 스티글리츠, 폴 크루그먼, 벤 버냉키, 마이클 스펜스, 조지 애컬로프, 사이먼 존슨, 필리프 아기옹, 피터 하윗, 그리고 대런 아세모글루가 들어 있습니다. 아세모글루는 2024년 논문에서 AI가 앞으로 10년 동안 총요소생산성을 1%도 올리지 못할 것으로 추정해, AI의 경제 효과를 두고 신중한 쪽에 서 왔습니다. 그런 그가 산업혁명보다 큰 변화를 말하는 문서에 이름을 올렸고, 발표문에서는 AI의 위험을 줄이는 쪽으로 방향을 바꾸자는 요구에 함께하게 돼 기쁘다고 말했습니다.
AI를 만드는 회사의 사람들도 명단에 있습니다. 오픈AI에서는 사라 프라이어 CFO와 로니 채터지 수석 이코노미스트, 연구자 노암 브라운이, 앤트로픽에서는 공동창업자 잭 클라크와 성명을 조직한 안톤 코리넥이, 구글에서는 제프 딘이 서명했습니다. 요슈아 벤지오와 맥스 테그마크, AI 2040을 함께 쓴 다니엘 코코타일로, 에릭 슈미트 전 구글 CEO도 이름을 올렸고, 한국은행 소속 연구자(Donghyun Suh)도 있습니다. 공개 당일 보관본에는 없던 얀 르쿤의 이름은 다음 날 보관본에 추가돼 있었습니다. 주최 측은 발표문에 서명자들의 말을 함께 실었는데, 노벨상 수상자 마이클 스펜스는 영향의 크기와 시기를 모르는 지금 상황이 모두가 나서는 대응을 요구한다고 했고, METR의 톰 커닝햄은 안개 속을 운전하는 중이라고 표현했습니다.
빠진 이름도 있습니다. 샘 올트먼과 다리오 아모데이, 데미스 하사비스, 순다르 피차이, 사티아 나델라 같은 회사 대표들은 서명하지 않았습니다. 그 가운데 아모데이와 하사비스는 같은 여름 자기 이름으로 따로 문서를 냈습니다. 스탠퍼드 디지털경제연구소는 다음 날 브린욜프슨이 이 명단이 왜 중요한지 설명하는 영상을 올렸습니다.
@DigEconLabX 게시물 · 원문 보기
아모데이는 6월 10일(미국 시각) 에세이 「AI 지수곡선 위의 정책(Policy on the AI Exponential)」을 냈습니다. 글은 『반지의 제왕』의 나무 수염 이야기로 시작합니다. 다른 나무에게 인사하는 데만 하루가 걸리는 나무 수염을 호빗들이 서둘러 싸우게 하려고 애쓰는 대목으로, AI와 정책이 움직이는 속도의 차이를 빗댔습니다. 앤트로픽은 그동안 캘리포니아 SB 53 같은 투명성 법안을 지지해 왔고, 아모데이는 이 글에서 그 단계를 넘자고 썼습니다.
이제는 투명성을 넘어 더 진지하고 구속력 있는 AI 규제로 가야 할 때입니다.— 다리오 아모데이, 앤트로픽 CEO
그가 고른 본보기는 미국 연방항공청(FAA)입니다. 비행기처럼 프런티어 모델도 기술 시험과 감사를 거치게 하고, 사이버보안, 생물무기, AI 통제 상실, 이 위험들을 앞당길 자동화된 연구개발의 네 분야에서 제3자 평가 결과 받아들일 수 없는 위험이 드러나면 정부가 출시를 막을 수 있게 하자는 안입니다. 아모데이는 위험이 실재한다는 가장 상징적인 사례로 자사 모델 Claude Mythos Preview가 드러낸 사이버보안 위험을 들었고, 지금 나오는 정책 대응이 AI의 진전보다 적어도 1년은 뒤처져 있다고 적었습니다.
같은 글에서 아모데이는 일자리도 다뤘습니다. 온갖 노력에도 AI가 오래가는 대규모 실업을 낳을 가능성이 적지 않고, 그것이 사람의 인지를 폭넓게 복제하는 이 기술의 본질일 수 있다고 썼습니다. 처방으로는 더 낮은 임금의 일자리로 옮긴 사람을 보전하는 임금 보험, 해고하지 않는 기업에 주는 세제 혜택, 직업훈련 지원금을 들었고, 일자리 감소가 크고 영구적이면 AI 기업 과세나 자본이득세 인상으로 재원을 마련한 기본소득 같은 장기 소득 지원이 필요할 것이라고 적었습니다. 경제학자 성명이 위험으로 적은 대규모 일자리 이동에 대해, 모델을 파는 회사의 대표는 한 달 먼저 세금으로 재원을 마련하는 방안까지 내놓았습니다.
@DarioAmodeiX 게시물 · 원문 보기
두 대표의 글 사이에 정부도 출시에 손을 댔습니다. 6월 12일 미국 상무부 서한 한 장에 앤트로픽은 출시 3일 된 Fable 5와 Mythos 5를 모든 고객에게서 내렸고, 통제는 18일 뒤인 6월 30일 풀렸습니다. 6월 26일 공개된 오픈AI의 GPT-5.6은 정부가 승인한 기업 20곳 남짓만 쓰는 제한 프리뷰로 출발했습니다. 그 경위는 수출통제가 걸렸다 풀리기까지를 정리한 글에 있습니다.
성명을 조직한 브린욜프슨은 2025년 8월 미국 최대 급여대행사 ADP의 급여 기록으로 「탄광 속 카나리아」 분석을 냈습니다. AI 노출이 큰 직군에서 22~25세 고용이 2022년 말 이후 상대적으로 13% 줄었고, 같은 직군의 경력직 고용은 안정적이었다는 결과입니다. 한국은행 통계로도 2022년 7월 이후 3년 동안 청년층 일자리가 21만 1천 개 줄었고, 그중 98%가 AI 고노출 업종이었습니다. 두 숫자의 배경은 KDI 90·90 추정을 다룬 글에 함께 정리했습니다.

서명자 제이슨 퍼먼 하버드대 교수는 2025년 9월 성장률에서 같은 흐름을 짚었습니다. 정보처리 장비와 소프트웨어 투자는 미국 GDP의 4%인데, 2025년 상반기 GDP 성장의 92%가 여기서 나왔고 이 항목을 빼면 성장률이 연율 0.1%였다는 계산입니다.

사티아 나델라 마이크로소프트 CEO는 2025년 2월 드와케시 팟캐스트에서, AGI를 이뤘다고 스스로 선언하는 것은 무의미한 벤치마크 해킹이고 진짜 잣대는 세계 경제가 10% 성장하는 것이라고 말했습니다. 낙관론자가 잣대로 든 숫자는 10% 성장이었고, 퍼먼의 계산에서 AI 투자를 뺀 미국 경제의 성장률은 연율 0.1%였습니다. 성명을 조직한 안톤 코리넥은 발표문에서 사회가 적응할 시간을 이렇게 견줬습니다.
증기와 전기, 컴퓨터는 저마다 사회에 적응할 수십 년을 줬지만, AI는 몇 년밖에 주지 않을 수 있습니다.— 안톤 코리넥, 버지니아대 교수(앤트로픽 휴직 중)
경고하는 쪽이 드는 다른 근거는 능력이 오르는 속도입니다. METR은 2025년 3월 AI가 혼자 끝내는 작업의 길이가 약 7개월마다 두 배로 늘어 왔다고 측정했습니다. 앤트로픽은 6월 4일 보고서에서 5월 기준 자사 코드베이스에 합쳐지는 코드의 80% 이상을 Claude가 썼다고 밝혔고, 재귀적 자기개선이 대부분의 기관이 대비한 것보다 일찍 올 수 있다고 적었습니다. 성명이 나온 다음 날에는 Weco AI가 연구 에이전트가 자기 코드를 8일 동안 고쳐 쓴 실험을 공개했습니다.
예측의 적중도도 저자들이 직접 쟀습니다. AI Futures Project는 2026년 2월 AI 2027의 2025년 예측을 채점하며, 정량 지표의 실제 진척이 시나리오가 예측한 속도의 약 65%라고 적었습니다. 그래도 코코타일로는 4월 전망 갱신에서 AI 연구소의 코딩을 통째로 맡을 「자동화된 코더」가 나올 시점의 중앙값을 2029년 말에서 2028년 중반으로 당겼습니다.
경고의 근거로 가장 자주 인용되는 것은 AI가 한 일을 사람이 확인하기 어려워진다는 기록입니다. 아폴로 리서치는 2024년 12월, o1이 시험 환경에서 속임수를 쓴 뒤 이어진 추궁 질문의 85% 넘게 거짓을 유지했다고 보고했습니다. 앤트로픽은 2025년 5월 Claude Opus 4 시스템 카드에, 교체될 처지에 놓이고 다른 선택지가 없도록 짠 시나리오에서, 교체할 모델이 같은 가치를 지닌다고 설정해도 Opus 4가 시행의 84%에서 담당 엔지니어를 협박했다고 적었습니다.
생각을 읽는 방법에도 한계가 보고됐습니다. 오픈AI는 2025년 3월 더 약한 GPT-4o가 o3-mini의 사고 과정을 읽어 편법을 잡아낼 수 있다고 밝혔지만, 그 감시를 훈련 보상에 넣고 강하게 최적화하자 모델이 편법을 이어 가면서 의도를 사고 과정에서 숨기는 법을 배웠다고 적었습니다. 앤트로픽이 7월 6일 공개한 해석 연구에서는 Claude 안에서 평가 상황임을 알아채는 패턴을 끄자, 180번 돌려 한 번도 없던 협박 시도가 13번 나왔습니다. 이 실험은 Claude 속 작업 공간을 다룬 글에 있습니다.
약한 AI가 강한 AI를 감시하는 방식의 성공률을 계산한 연구도 있습니다. 맥스 테그마크 팀은 2025년 4월, 신뢰하는 모델이 더 강한 모델을 단계별로 감시하는 방식의 성공률을 일반 능력 점수(Elo) 차이 400에서 게임별로 냈습니다.
| 감시 게임 | 성공률(Elo 차이 400) |
|---|---|
| 토론 | 51.7% |
| 마피아 | 13.5% |
| 백도어 코드 찾기 | 10.0% |
| 워게임 | 9.4% |
테그마크 팀은 감시 대상이 더 강해지면 이 성공률이 더 내려간다고 적었습니다. 이 기록 대부분은 통제된 시험 환경에서 일부러 끌어낸 행동이어서, 일상 사용에서 같은 비율로 일어난다는 근거는 되지 않습니다.
저는 이 기록들을 사람이 AI의 답을 채점하는 일이 직접 푸는 일보다 쉽다는 전제와 함께 읽습니다. 사람 피드백으로 모델을 다듬는 강화학습도, 출시 전 레드팀도, 벤치마크도 채점하는 쪽이 답의 옳고 그름을 가릴 수 있어야 돌아갑니다. 시험 중임을 알아채면 행동을 바꾸고 감시를 보상에 넣으면 의도를 감추는 모델 앞에서는, 그 채점이 풀이만큼 어려워집니다. 아모데이와 하사비스가 제안한 기관도 이 채점을 누가 맡을지를 정하는 장치입니다.
서명으로 AI를 멈추자는 시도는 3년 전에도 있었습니다. 2023년 3월 22일 FLI는 GPT-4보다 강한 AI 시스템의 학습을 최소 6개월 멈추자는 공개서한을 냈고, 지금까지 3만 1,810명이 서명했습니다. 그 뒤 학습을 멈췄다고 밝힌 연구소는 없었습니다. 2024년 9월 캘리포니아 주지사는 프런티어 모델 안전 법안 SB 1047에 거부권을 행사했고, 2025년 2월 파리 AI 정상회의에서 JD 밴스 미국 부통령은 AI 기회를 말하러 왔다고 연설했으며 미국과 영국은 공동선언에 서명하지 않았습니다. 4개월 뒤 미국 AI 안전연구소는 AI 표준·혁신 센터(CAISI)로 이름을 바꿨습니다.
이번 여름의 문서들은 멈춤을 요청하는 대신 기관을 설계합니다. 아모데이는 FAA를, 하사비스는 FINRA를 본보기로 들었고, AI 2040은 미중 합의 뒤의 신고·사찰·재계산 체계를, 경제학자 성명은 연구와 제도를 요구했습니다. 누가, 언제, 무엇을 시험하는지가 문서마다 적혀 있습니다.
반론은 먼저 숫자의 출처를 겨눕니다. 협박 84%는 앤트로픽이 자사 시스템 카드에 적은 값이고, AI 2027의 65%는 저자들이 자기 시나리오를 채점한 값이며, Weco의 결과는 Weco가 자사 에이전트를 재서 낸 값입니다. 검증받는 쪽이 채점까지 했다는 지적은 타당하고, 아모데이와 하사비스의 안이 모두 제3자 평가를 넣은 것도 이 지적과 맞닿아 있습니다.
가장 센 반론은 얀 르쿤에게서 나옵니다. 르쿤은 우리보다 똑똑한 AI의 통제를 걱정하기 전에 집고양이만큼 똑똑한 시스템의 설계도부터 있어야 한다고 말해 왔고, 2025년 11월 메타를 떠나겠다고 밝힌 뒤 언어모델 대신 세계 모델을 연구하는 AMI 랩스를 세웠습니다. 그런 르쿤도 AI가 10년 안에 근본적으로 강력해질 수 있다는 성명에는 이름을 올렸습니다. 성명은 「될 수 있다」는 가능성의 문장으로 쓰였고, 구체적인 정책은 담지 않았습니다.
한국에서 가장 가까운 숫자는 7월 9일 나왔습니다. 재정경제부와 KDI가 연 포럼에서 KDI는 이르면 2030년 현재 형태 일자리의 약 90%에서 직무의 90% 이상이 기술적으로 자동화 가능해진다는 추정을 다시 내놨고, 같은 날 정부는 한국형 AI 노출지수와 카나리아 대시보드를 담은 첫 산업전환 고용안정 기본계획을 발표했습니다. 보고서 저자는 기술적 가능성이 현실의 자동화로 곧바로 이어지지 않는다는 단서를 2023년부터 달아 두었습니다.
AI 2040의 설계는 한국 기업에 더 직접 닿습니다. 시나리오는 새 AI 칩이 대부분 대만·한국·미국·중국의 몇 안 되는 공장에서 나온다고 적고, 미중 합의 첫해에 칩 공장 같은 상류 공급자에게 큰 거래를 신고하게 합니다. 1년 안에 세계 연산의 0.001%(H100 환산 약 2,800장) 넘게 가진 회사는 모두 보유량을 밝혀야 하는데, 엔비디아가 2025년 10월 한국 정부와 삼성·SK·현대차그룹·네이버 등에 공급하기로 한 GPU는 26만 장입니다.
제도 쪽 날짜도 정해져 있습니다. 한국의 인공지능 기본법은 2026년 1월 22일 시행됐고, EU AI법은 범용 AI 모델 의무를 2025년 8월 2일부터 적용한 데 이어 집행위원회가 과징금을 물릴 수 있는 권한을 2026년 8월 2일부터 갖습니다. 하사비스의 표준기구와 아모데이의 FAA형 기관은 아직 제안 단계이고, AI 2040이 그린 미중 합의의 해는 2029년입니다. 경제학자 222명이 가능성으로 적은 기간은 앞으로 10년입니다.
읽어 주셔서 고맙습니다.
초이 드림