이 글 어땠어요?
결과가 나오면 맞았는지 그대로 적어요.
폐쇄형 최상위 모델과 오픈웨이트 모델의 격차가 몇 주 단위로 좁혀지다가 사라지는 시점이 온다
7월 16일 기준 아티피셜 애널리시스 지수 차이는 3점(Fable 5 60점, K3 57점)이고, AISI가 잰 사이버 역량 격차는 4~7개월이었습니다.
미국이 중국 오픈 모델을 차단하는 방식으로는 확산을 막기 어렵다
K3 가중치는 7월 27일 공개 예정이고, 한 번 풀린 가중치는 회수할 수 없습니다.
아레나 프런트엔드 코드 부문에서는 승률 76%로 1위였지만, 아티피셜 애널리시스 지능 지수는 57점으로 Fable 5(60점)와 GPT-5.6 Sol(59점) 다음 3위입니다. 문샷도 기술 블로그에서 종합 성능은 두 모델에 못 미친다고 밝혔습니다.
kimi.com과 Kimi API, 코딩 도구 Kimi Code에서 바로 쓸 수 있습니다. API는 100만 토큰당 입력 3달러, 출력 15달러이고, 누구나 내려받을 수 있는 가중치는 7월 27일까지 공개됩니다.
증류 여부를 가린 외부 조사는 없습니다. K3는 증류 대상으로 거론될 Opus 4.8과 GPT-5.5보다 지수가 높고, 뼈대 구조인 KDA와 Attention Residuals는 문샷이 2025년 10월과 2026년 3월 논문으로 먼저 공개했습니다. 미국 정부에서 AI 정책을 만든 딘 볼도 증류로는 성능을 설명할 수 없다고 평가했습니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
7월 22일 크라치오스 백악관 실장이 문샷AI가 Fable을 증류해 Kimi K3를 만들었다고 주장했고, 5시간 뒤 베센트 재무장관이 제재와 엔티티 리스트를 언급했습니다. K3 공개 전 Fable 5가 열려 있던 날은 18일 남짓이고, 근거 자료는 공개되지 않았습니다.

엔비디아가 허깅페이스를 129억 달러에 인수하기로 합의했다고 디인포메이션이 8월 26일(미국 시각) 보도했습니다. 연환산 매출 1억 5,000만 달러의 약 86배이고, 같은 날 엔비디아는 분기 데이터센터 매출 890억 달러를 발표했습니다.
7월 27일 문샷AI가 Kimi K3 가중치 파일 96개(1.56TB)와 기술 보고서, FlashKDA·MoonEP·AgentENV를 같은 날 MIT로 공개했습니다. 발표 때 주장이던 숫자가 파일에서 확인됐고, MoonEP 지원 목록에는 중국산 가속기 진우 PPU가 올라 있습니다.

7월 22일 크라치오스 백악관 실장이 문샷AI가 Fable을 증류해 Kimi K3를 만들었다고 주장했고, 5시간 뒤 베센트 재무장관이 제재와 엔티티 리스트를 언급했습니다. K3 공개 전 Fable 5가 열려 있던 날은 18일 남짓이고, 근거 자료는 공개되지 않았습니다.

엔비디아가 허깅페이스를 129억 달러에 인수하기로 합의했다고 디인포메이션이 8월 26일(미국 시각) 보도했습니다. 연환산 매출 1억 5,000만 달러의 약 86배이고, 같은 날 엔비디아는 분기 데이터센터 매출 890억 달러를 발표했습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
@arenaX 게시물 · 원문 보기
아레나는 이날 K3 소식을 두 번 올렸습니다. 첫 글은 한국 시각 17일 새벽 3시 33분, 문샷이 K3 예고 영상을 올린 지 8분 만에 나왔습니다. K3가 1,679점으로 프런트엔드 코드 부문 1위에 올라 Fable 5를 넘었고, 직전 모델 K2.6이 같은 부문 18위였으니 한 세대 만에 17계단을 올랐다는 내용입니다. 브랜드·마케팅과 데이터 분석, 소비자 제품, 시뮬레이션 등 일곱 분야 가운데 여섯에서 1위였고, 게임 분야만 Fable 5 다음 2위였습니다.
공개 전부터 이름을 가린 채 아레나 평가를 받아 온 덕에 순위가 발표와 거의 동시에 나왔습니다. 4시간 40분 뒤 올린 위 게시물은 76%가 무슨 숫자인지 풀었습니다. 같은 과제에서 다른 모델과 결과물을 맞대면 평균 76% 확률로 K3 쪽이 선택됐고, 이긴 횟수와 진 횟수가 같은 모델이 50%입니다.


독립 평가 기관 아티피셜 애널리시스(AA)는 문샷 발표 10분 뒤 K3의 지능 지수를 57점으로 매겼습니다. Fable 5(60점)와 GPT-5.6 Sol(59점) 다음 3위이고, Claude Opus 4.8(56점)이나 GPT-5.5(55점)와 비슷한 수준입니다. 직전 모델 K2.6이 44점이었으니 한 세대에 13점이 올랐습니다.

문샷도 1위를 주장하지 않았습니다. 기술 블로그 첫머리에 종합 성능은 아직 Fable 5와 GPT-5.6 Sol에 못 미친다고 적었고, 한계 항목에는 사용 경험에서도 두 모델과 뚜렷한 차이가 있다고 썼습니다. 자체 비교표에서 터미널 작업을 재는 Terminal-Bench 2.1은 88.3으로 GPT-5.6 Sol의 88.8 바로 아래였고, 실제 저장소를 고치는 DeepSWE는 67.5로 Sol(73.0)과 Fable 5(70.0)에 뒤졌습니다. 표 아래에는 Fable 5 결과에 폴백(안전장치가 걸려 다른 처리로 넘어간 경우)이, GPT-5.6 Sol 결과에 사이버 차단이 섞였을 수 있다는 주석도 붙어 있습니다.
1년 전만 해도 중국 모델은 미국을 6개월쯤 뒤에서 쫓는다는 말이 많았습니다. 포천은 K3 기사에서 앤트로픽의 다리오 아모데이 CEO를 비롯한 많은 사람이 중국 연구소가 미국 최고 모델에 근접하려면 6개월은 더 걸린다고 봤다고 전했습니다. 다음 날 나온 영국 AI보안연구소(AISI)의 측정에서도 사이버 공격 능력으로 잰 오픈웨이트와 폐쇄형의 거리는 2025년 대부분 6~10개월이었다가 4~7개월로 줄었고, 이 측정에는 K3가 들어가지 않았습니다. AA 지수로 K3와 1위의 차이는 3점입니다.
K3를 만든 문샷AI는 2023년 베이징에서 창업한 회사입니다. 중국어 회사 이름 月之暗面은 핑크 플로이드의 앨범 「더 다크 사이드 오브 더 문」에서 따왔고, 양즈린 CEO는 구글 브레인과 메타 FAIR를 거친 연구자입니다. 2025년 7월 낸 Kimi K2가 중국 모델로는 처음 글로벌 오픈소스 순위 1위에 올랐고, 문샷은 지난 12개월 가운데 9개월 동안 자사 모델이 오픈 모델 크기 기록을 지켰다고 밝혔습니다.
발표 전날 밤 문샷 사무실 사진도 돌았습니다. 책상 두 개에 여섯 명이 모여 KPI 없이 월드컵 중계를 보며 블로그를 준비했고, 아르헨티나가 잉글랜드를 이긴 순간 창밖으로 베이징의 해가 뜨는 모습을 찍었다는 이야기가 함께 퍼졌습니다. 문샷의 기업가치는 200억~300억 달러로 알려져 있어, 1조 달러에 가까운 앤트로픽과 견주면 30분의 1에서 50분의 1 사이입니다.
사진 속 여섯 명 뒤에는 큰 투자자와 인프라가 있습니다. 투자자 명단에 알리바바와 텐센트가 있고, K3 API는 문샷이 공개해 온 추론 시스템 Mooncake 위에서 돌아갑니다. 문샷은 이 구조 덕분에 코딩 작업에서 캐시 적중률이 90%를 넘는다고 밝혔습니다.
중국 모델이 빨리 따라오는 이유로 미국에서 가장 자주 나온 설명은 증류입니다. 증류는 앞선 모델에 질문을 대량으로 던져 받은 답으로 자기 모델을 가르치는 방법이라, 원본을 넘어서기 어렵습니다. 6월에는 앤트로픽이 상원에 보낸 서한에서 알리바바가 가짜 계정 2만 5,000여 개로 Claude와 2,880만 번 대화하며 에이전트 능력을 뽑아 갔다고 주장했는데, 서한에는 계정 목록이나 외부 조사 보고서가 붙어 있지 않았습니다.
K3는 증류 대상으로 거론될 만한 Opus 4.8과 GPT-5.5보다 AA 지수가 높았습니다. 뼈대가 되는 구조도 문샷이 먼저 논문으로 냈습니다. 긴 문맥을 맡는 Kimi Delta Attention(KDA)은 2025년 10월 Kimi Linear 논문에서, 모델 깊이 방향의 정보 흐름을 고친 Attention Residuals는 2026년 3월 논문에서 공개됐고, KDA를 빠르게 돌리는 커널 FlashKDA도 4월에 코드로 풀렸습니다.
미국 정책 쪽에서도 비슷한 평가가 나왔습니다. 트럼프 행정부 백악관에서 AI 행동계획 작성에 참여했던 딘 볼은 한국 시각 18일 0시 5분 K3를 써 본 소감을 여섯 항목으로 올렸습니다.
@deanwballX 게시물 · 원문 보기
첫 항목에서 볼은 K3가 매우 좋은 모델이고 증류 같은 것으로는 성능을 설명할 수 없다고 봤습니다. 에이전트 코딩에서는 올해 1분기 최고 공개 모델과 거의 같은 수준이라고 했습니다. 다만 짧게 써 본 바로는 토큰을 많이 먹어 실제로 싸게 돌아가는지는 분명하지 않다고 덧붙였는데, AA 측정에서 K3가 지수 전체를 푸는 데 쓴 출력 토큰은 약 1억 3,200만 개로 K2.6보다 21% 적었습니다.
두 번째 항목은 중국이 왜 이 수준의 모델을 공개하게 두는지에 대한 추정입니다. 볼은 이유의 75%를 AGI가 곧 온다고 보지 않는 중국 지도부의 전략적 맹점에서, 나머지 25% 정도를 고객에게 추론을 제공할 연산이 모자란 사정과 공격적인 수출 전략에서 찾았습니다. 연산 부족을 두고는 중국의 오픈웨이트 전략이 미국 수출통제가 의도하지 않게 낳은 부산물이라고 적었습니다.
문샷 블로그에서 벤치마크 표보다 길게 쓴 부분은 K3가 스스로 해낸 긴 작업들입니다. 커널 최적화 시험에서는 모델마다 같은 샌드박스에서 최대 24시간 동안 AttnRes, KDA, 헤드 차원 512짜리 MLA 커널까지 과제 네 개를 엔비디아 호퍼 GPU와 다른 회사의 범용 GPU에서 고치게 했습니다. 문샷은 K3가 Fable 5와 비슷한 성적을 냈고 Opus 4.8과 GPT-5.6 Sol, GPT-5.5는 크게 앞섰다고 밝혔습니다. 개발 막바지에는 초기 K3가 팀의 커널 최적화 작업 대부분을 맡았다고 적었습니다.
K3는 GPU 프로그래밍 도구도 처음부터 만들었습니다. MiniTriton이라는 작은 컴파일러를 짜서 지원하는 루프라인 벤치마크에서 Triton·torch.compile과 같거나 더 나은 성능을 냈고, 이 컴파일러로 nanoGPT 학습을 끝까지 돌려 기준과 거의 같은 손실 곡선을 얻었습니다. 48시간 동안 사람 개입 없이 오픈소스 설계 도구만으로 자기 구조를 쓰는 소형 모델용 칩도 설계했습니다. 4제곱밀리미터 면적에 표준 셀 146만 개를 넣었고, 시뮬레이션에서 100MHz로 초당 8,700토큰 넘게 디코딩했습니다.
칩은 시뮬레이션 결과이고 실제로 만든 반도체는 아닙니다. 과제도 문샷이 골랐습니다. 공개 직후 한 커널 엔지니어는 K3가 자기 커널에서 빠진 곱셈 한 줄을 추적해 특정 환경에서 게이트 값이 0.5에 갇히는 버그를 잡고, GPU가 한가한 시간을 노려 11분마다 도는 예약 작업까지 스스로 짰다는 실행 기록을 올렸습니다.
K3의 API 가격은 100만 토큰당 입력 3달러, 출력 15달러이고, 캐시에서 읽는 입력은 0.3달러입니다. 직전 모델 K2.6의 출력 가격이 4달러였으니 3.75배로 올렸습니다. 앤트로픽의 Claude Sonnet 5가 9월부터 받겠다고 예고한 정상가와 같고, 8월 31일까지 적용되는 Sonnet 5 도입가보다는 비쌉니다. 100만 토큰당 가격을 모으면 다음과 같습니다.
| 모델 | 입력 | 출력 |
|---|---|---|
| Kimi K3 | 3달러 | 15달러 |
| Claude Sonnet 5 (8월 31일까지 도입가) | 2달러 | 10달러 |
| Claude Sonnet 5 (9월부터 예고된 정상가) | 3달러 | 15달러 |
| GPT-5.6 Sol | 5달러 | 30달러 |
| Claude Fable 5 | 10달러 | 50달러 |
청구서에 찍히는 돈은 단가에 사용량을 곱한 값입니다. AA가 지수 과제 하나를 푸는 데 든 비용을 재 보니 K3는 0.94달러로 GPT-5.6 Sol(1.04달러)과 비슷했고 Opus 4.8(1.80달러)의 절반쯤이었습니다. 이미 가중치가 풀린 중국 모델 GLM-5.2는 0.32달러, 딥시크 V4 Pro는 0.04달러였습니다. 문샷 말대로 캐시 적중률이 90%라면 입력 100만 토큰의 평균 단가는 0.57달러로, 표시 가격의 5분의 1 아래로 내려갑니다.
문샷이 블로그에 올린 자체 코딩 벤치마크 그래프도 같은 방향을 가리킵니다. Kimi Code Bench V2에서 K3는 최대 추론 설정으로 과제당 4달러 안팎을 쓰고 72%대 점수를 냈고, Fable 5는 10달러를 조금 넘게 쓰고 77%대를 냈습니다.
K2.6은 출력 4달러짜리 가성비 모델이었고, K3는 과제당 비용이 GPT-5.6 Sol과 비슷한 모델로 나왔습니다. 7월 27일 가중치가 풀리면 다른 클라우드와 추론 업체도 K3를 자기 서버에 올려 따로 가격을 매길 수 있습니다.
미국 기업들은 K3 이전부터 중국 오픈 모델을 업무에 넣고 있었습니다. 배달 앱 도어대시의 공동창업자 앤디 팡은 7월 6일 사내 코딩 벤치마크를 근거로 AI 코드 리뷰어에 오픈웨이트 모델을 넣었다고 밝혔습니다. 가장 어려운 일은 Fable 5에 맡기고 그 아래 일은 Kimi K2.6에 넘겼더니 품질은 오르고 비용은 줄었다는 내용입니다.
@andyfangX 게시물 · 원문 보기
팡이 인용한 도어대시 AI 팀 게시물은 조합을 구체적으로 적었습니다. 사내 벤치마크 DashBench에서 Kimi K2.6과 Fable 5를 묶은 조합이 기존에 쓰던 Sonnet 4.6과 Opus 4.8 조합보다 훨씬 좋은 결과를 더 싸게 냈다는 것입니다. 코딩 도구 Cursor의 Composer 모델도 Kimi K2.5를 바탕으로 만들어졌고, 모델 중개 서비스 오픈라우터(OpenRouter) 집계로는 올해 1월 오픈 모델 추론 토큰의 72.7%가 중국계 모델에서 나왔습니다.
도어대시가 Fable 5에 남겨 둔 일은 가장 어려운 코드 리뷰였습니다. 9일 뒤 가중치가 풀릴 K3는 프런트엔드 코딩 대결에서 그 Fable 5를 이긴 모델로 나왔습니다.
공개 직후 사용량이 몰리는 시간대에는 K3 응답이 크게 늦어지고 가동률이 99%에서 52%까지 떨어졌다는 관측이 나왔습니다. 문샷은 블로그에서 K3를 가속기 64개 이상을 묶은 슈퍼노드에 올리라고 권했습니다. 2.8조 개 파라미터를 여러 칩에 나눠 올리면 칩끼리 주고받는 데이터가 많아져, 고대역 통신으로 묶인 칩이 많을수록 추론이 빨라지기 때문입니다.
KDA는 앞부분이 같은 요청의 계산을 재사용하는 기존 프리픽스 캐시 방식에도 새 과제를 안겼습니다. 문샷은 이를 풀어낸 코드를 오픈소스 추론 엔진 vLLM에 기여해 모델과 함께 내겠다고 밝혔습니다. 미국 수출통제 아래서 문샷이 쓸 수 있는 최신 칩은 한정돼 있고, 딘 볼이 두 번째 항목에서 짚은 연산 부족이 바로 이 대목입니다.
가중치를 풀면 추론을 세계의 클라우드가 나눠 맡고, 양자화(숫자 정밀도를 낮춰 모델을 줄이는 일)와 속도 최적화도 외부 팀이 대신합니다. K3보다 며칠 앞서 미국 스타트업 씽킹머신즈가 975B 모델 Inkling을 오픈웨이트로 풀었을 때도, 외부 팀들이 하루 만에 1.9TB짜리 모델을 270GB까지 줄였습니다.
발표 시점도 겹쳤습니다. K3가 나온 다음 날인 17일 상하이에서 세계인공지능대회(WAIC)가 막을 올렸고, 대회는 20일까지 이어집니다. 올해 대회는 오픈소스 산업 생태계를 전면에 걸었고, 세계 최초로 공개되는 제품만 300개가 넘습니다. 하루 전인 16일에는 29개국이 상하이에서 세계AI협력기구(WAICO) 설립 협정에 서명했습니다.
@ChinaMissionGvaX 게시물 · 원문 보기
17일 개막식 기조연설은 시진핑 국가주석이 처음으로 직접 맡았습니다. 그는 AI가 디지털 세계에서 물리 세계로 옮겨 가는 지금을 좀처럼 오지 않는 역사적 기회라고 부르며 오픈소스와 개방, 협력, 공유를 장려하자고 했고, 개발도상국에 앞으로 5년간 AI 연수·세미나 기회 5,000건을 주겠다고 발표했습니다. 연설의 흐름은 중국이 오픈소스를 외교 수단으로 쓰는 방식에 정리했습니다.
저는 중국이 오픈소스를 국가 전략으로 쓰고 있다고 봅니다. 성능을 파일로 넓게 깔아 개발자와 표준을 먼저 잡고, 그렇게 모인 사용량으로 자국 클라우드와 칩 수요를 키우는 순서입니다.
K3가 나온 다음 날인 17일 금요일에는 시장이 먼저 움직였습니다. 포천에 따르면 TSMC는 전날 분기 영업이익이 77% 늘었다고 발표하고도 7% 내렸고, 오픈AI의 대리 지표로 여겨지는 소프트뱅크는 9.0% 떨어졌습니다. K3와 경쟁하는 모델을 낸 중국 지푸(Z.ai)는 홍콩 증시에서 30% 가까이 급락했습니다. 포천은 이 기사에 시장이 두 번째 딥시크 충격을 겪었을지 모른다는 제목을 달았습니다.
첫 번째 충격은 2025년 1월 27일이었습니다. 딥시크 R1이 싼 비용으로 미국 최고 모델에 근접했다는 사실이 퍼지자 엔비디아 주가가 하루에 17% 떨어져 시가총액 5,890억 달러가 사라졌습니다. 이번에는 포천 집계 시점에 엔비디아가 1.2%, 나스닥100이 1.0% 내리는 데 그쳤고, 크게 흔들린 곳은 반도체 공급망과 오픈AI 관련주, 중국 경쟁사였습니다.
정책 쪽 반응은 둘로 나뉘었습니다. 트럼프 행정부의 AI 정책을 이끈 데이비드 색스는 중국 모델이 처음 아레나 1위를 가져간 상황을 두고, 미국이 데이터센터를 막고 규제를 쌓고 프런티어 모델에 사전 승인을 요구하며 스스로 지는 길로 가고 있다고 적었습니다. 반대편에서는 중국 모델을 아예 막자는 목소리가 나왔고, 딘 볼은 다섯 번째 항목에서 행정부가 금지 대신 연방기관의 구속력 없는 지침으로 중국 오픈 모델 사용에 규제 위험을 만드는 방법을 택할 것으로 내다봤습니다.
닫힌 모델은 서버를 끄면 멈춥니다. 6월 9일 출시된 Fable 5와 Mythos 5는 3일 만인 12일 미국 수출통제로 전 세계 접근이 끊겼다가 7월 1일에야 다시 열렸습니다. 두 모델이 멈췄던 19일이 지나고 15일 뒤 나온 K3는 27일 파일로 풀리고 나면 문샷이 서버를 꺼도 세계 곳곳에서 돌아갑니다.
한국에서도 K3는 지금 kimi.com과 Kimi API로 바로 쓸 수 있고, 코딩 도구 Kimi Code에서도 고를 수 있습니다. API 가격은 입력 100만 토큰에 약 4,200원, 출력에 약 2만 1,000원입니다.
변화가 큰 쪽은 7월 27일 이후입니다. 데이터를 밖으로 내보내기 어려운 금융·공공 업무에서는 사내 서버에 내려받아 돌리는 모델이 선택지인데, 그 선택지에 AA 지수 3위 모델이 더해집니다. 다만 2.8조 파라미터를 제대로 돌리려면 문샷 권장대로 가속기 64개 이상이 필요해, 국내 기업 대부분은 직접 올리는 대신 클라우드가 올린 K3를 빌려 쓰는 방식이 될 가능성이 큽니다.
라이선스는 아직 공개되지 않았습니다. 수정된 MIT 라이선스가 유력하다는 보도가 있지만 확정 전이고, 상업적으로 쓸 수 있는 범위는 27일 나올 조건에서 정해집니다. 국내 파운데이션 모델이 지금까지 견주던 상대는 해외 폐쇄 API의 가격이었고, 27일부터는 누구나 받을 수 있는 3위급 가중치가 그 상대에 더해집니다.
문샷은 가중치를 7월 27일까지 공개하고, 구조와 학습, 평가를 담은 기술 보고서도 함께 내겠다고 밝혔습니다. 가중치가 풀리면 외부 기관이 같은 조건에서 K3를 다시 잴 수 있고, 아레나 1위와 AA 3위가 문샷 API 밖에서도 같은 성적으로 나오는지 드러납니다.
중국 쪽 다음 모델도 이어집니다. 딥시크는 4월에 1.6조 파라미터 V4 Pro를 이미 풀었고, 미니맥스가 2.7조 파라미터 오픈소스 모델을 3분기에 낸다는 보도도 나왔습니다. 미국 쪽에서 볼 숫자는 다음 세대 모델이 AA 지수에서 K3와의 3점 차이를 얼마나 다시 벌리느냐입니다.
읽어 주셔서 고맙습니다.
초이 드림