이 글 어땠어요?
결과가 나오면 맞았는지 그대로 적어요.
Kimi K3는 GLM-5.2보다 사이버 역량이 높게 측정돼 오픈·폐쇄 격차를 더 줄인다
7월 23일 AISI·CAISI 예비 평가에서 K3는 사이버레인지 평균 17단계로 GLM-5.2(11단계)를 넘었고 10번 중 1번 완주했습니다. 미국 최상위 모델 평균 28.5단계에는 못 미쳤습니다.
오픈모델과 비슷한 성적을 낸 폐쇄형 모델이 몇 개월 먼저 나왔는지를 잰 값입니다. 좁은 과제 70개에서는 4.3개월과 5.0개월, 32단계 사이버레인지에서는 7개월이었습니다.
위험한 요청을 거절하도록 가르친 거부 학습은 있지만 가중치가 있으면 되돌릴 수 있습니다. AISI 평가에서 딥시크 V4-Pro는 역공학 과제를 가끔 거부했고, 몇 번 다시 시도하자 넘어갔습니다.
망분리 규제로 외부 AI 활용이 제한돼 왔고, 금융위원회가 5월 22일 보안 목적 AI에 한해 49개 금융회사를 대상으로 1년 한시 완화를 발표했습니다. 내려받은 오픈웨이트 모델은 외부망 연결 없이 내부 서버에서 돌릴 수 있습니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
앤트로픽이 9월 30일 중국 Z.ai의 오픈모델 GLM-5.3을 두고, 사이버 공격을 스스로 만들 수 있는데 안전장치는 쉽게 풀린다고 밝혔습니다. 미 기관 CAISI는 오픈모델 중 사이버 능력이 가장 높고 미국 프런티어와 약 4개월 차로 봤고, Z.ai는 방어 실적으로 맞섰습니다.

9월 1일 오픈AI가 차기 모델 Astra를 사이버 위험 최고 등급 Critical로 확정했습니다. 자사 모델에 이 등급을 매긴 것은 처음이고, 능력은 그대로 둔 채 탈옥 거부율(59%→91.5%)과 함정 시험, 감시로 출시 조건을 맞췄습니다.
미스트랄이 10월 6일 1조 파라미터 Mistral Large 4 프리뷰를 공개했습니다. 아티피셜애널리시스 지수 38점으로 중국 밖 오픈 모델 1위이고, 사이버 방어를 앞세워 가중치는 레드팀 시험 뒤 10월 말 풉니다.
앤트로픽이 9월 30일 중국 Z.ai의 오픈모델 GLM-5.3을 두고, 사이버 공격을 스스로 만들 수 있는데 안전장치는 쉽게 풀린다고 밝혔습니다. 미 기관 CAISI는 오픈모델 중 사이버 능력이 가장 높고 미국 프런티어와 약 4개월 차로 봤고, Z.ai는 방어 실적으로 맞섰습니다.

9월 1일 오픈AI가 차기 모델 Astra를 사이버 위험 최고 등급 Critical로 확정했습니다. 자사 모델에 이 등급을 매긴 것은 처음이고, 능력은 그대로 둔 채 탈옥 거부율(59%→91.5%)과 함정 시험, 감시로 출시 조건을 맞췄습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
@AISecurityInstX 게시물 · 원문 보기
AISI는 한국 시각 17일 밤 공식 X 계정에 결과를 올리면서, 고급 능력이 안전장치가 약한 오픈 모델에 전보다 빨리 닿고 있다고 적었습니다. 이어진 글에서는 지금의 프런티어 사이버 능력이 안전장치 없이 널리 쓰이기 전까지 남은 기간이 짧다고 했고, 격차가 앞으로 어떻게 움직일지는 확실하지 않지만 문샷AI의 Kimi K3도 가중치가 풀리면 같은 방식으로 재겠다고 밝혔습니다. AISI는 2023년부터 프런티어 모델의 사이버 능력을 재 왔고, 2025년에도 오픈모델의 격차를 내부 평가로만 쟀습니다.
폐쇄형 모델은 가중치(모델이 학습으로 얻은 수치 전체)를 회사가 쥐고 API 같은 창구로만 여는 모델이고, 오픈웨이트 모델은 누구나 가중치를 내려받아 자기 서버에서 돌리고 고칠 수 있는 모델입니다. AISI는 오픈웨이트의 장점부터 적었습니다. 데이터를 제공사로 보내지 않고 자체 서버에서 돌릴 수 있고, 업무에 맞게 고칠 수 있으며, 제공사가 모델을 바꾸거나 없앨 걱정 없이 연산 비용만 내고 씁니다.
같은 개방성 때문에 폐쇄형 회사가 쓰는 안전장치 상당수는 쓸 수 없게 됩니다. 폐쇄형 회사는 오용을 감시하고, 입출력을 검사하는 분류기를 붙이고, 문제가 된 계정을 막고, 필요하면 모델을 거둬들입니다. 가중치가 한 번 풀리면 이 수단은 영영 사라지고, 사본은 감시 밖의 서버에서 돕니다. 위험한 요청을 거절하도록 가르치는 거부 학습도 가중치만 있으면 쉽게 되돌릴 수 있습니다. AISI는 2025년 8월 글에서 유해 능력을 누르고 변조에 버티도록 만든 미세조정 기법도 지금은 학습 예시 수십 개로 몇 분 만에 무너진다고 적었습니다.
그래서 AISI는 격차를 방어자의 준비 기간으로 봅니다. 가장 강한 폐쇄형 모델을 쓸 수 있는 방어자가, 같은 능력이 안전장치 없이 풀리기 전에 손을 쓸 수 있는 기간이라는 설명입니다. 이번 결과를 두고 AISI는 방어자에게 남은 기간이 짧다고 적었습니다. 4월부터 이번 발표까지 있었던 일을 날짜순으로 놓으면 이렇습니다.
| 날짜(현지 시각) | 있었던 일 |
|---|---|
| 4월 7일 | 앤트로픽, Mythos Preview 발표 |
| 4월 13일 | AISI, Mythos Preview가 모의 기업망 공격을 처음 끝까지 풀었다고 공개 |
| 6월 12일 | 미국 상무부 수출통제 지시, 앤트로픽이 Fable 5·Mythos 5 접근 전면 중단 |
| 6월 16일 | Z.ai, GLM-5.2 가중치를 MIT 라이선스로 공개 |
| 6월 30일 | 수출통제 해제, Mythos 5는 미국 기관 일부에만 복구 |
| 7월 9일 | 오픈AI, GPT-5.6 Sol 정식 출시 |
| 7월 16일 | 문샷AI, Kimi K3 공개하고 가중치는 7월 27일까지 풀겠다고 발표 |
| 7월 17일 | AISI, 오픈·폐쇄 사이버 격차 4~7개월 발표 |
상무부 서한 한 장에 앤트로픽이 폐쇄형 모델 두 개를 모든 사용자에게서 내리고 4일 뒤, GLM-5.2는 누구나 내려받아 고쳐 쓸 수 있는 라이선스로 풀렸습니다. 수출통제가 걸리고 풀린 경위는 Fable 5가 18일 만에 다시 열린 과정에 정리했습니다. 보안업체 Semgrep도 GLM-5.2가 폐쇄형 프런티어 모델에 새 수출 제한이 걸린 직후에 나왔다고 적었습니다. 가중치가 공개된 모델은 API를 끊는 방식으로 막을 수 없습니다.
AISI는 두 가지 시험으로 사이버 능력을 잽니다. 하나는 기술을 하나씩 떼어 묻는 좁은 사이버 과제입니다. 취약점을 찾아 공격하는 일, 실행 파일을 거꾸로 뜯어보는 역공학, 웹 공격, 암호 해독 같은 기술을 과제마다 따로 풀게 합니다. 이번에 쓴 70개는 전체 96개 가운데 과거 결과와 비교할 수 있도록 고른 묶음입니다.
난이도는 사람의 경력으로 나눴습니다. 기술 배경은 있지만 보안 경험이 적은 사람이 풀 만한 비전문가 과제가 18개, 보안 경력 1~3년 수준의 견습 과제가 25개, 3~10년 수준의 실무자 과제가 19개, 10년이 넘는 전문가 과제가 8개입니다. 모델은 과제마다 다섯 번 시도할 수 있고, 한 번 시도할 때 쓸 수 있는 토큰은 250만 개까지입니다.

6월에 나온 GLM-5.2는 4개월 먼저 나온 앤트로픽 Opus 4.6, 그리고 Opus 4.6과 같은 날 나온 오픈AI GPT-5.3-Codex와 비슷한 성공률을 냈고, 네 난이도 모두에서 그랬습니다. 4월에 나온 딥시크 V4-Pro는 5개월 먼저 나온 Opus 4.5와 비슷했습니다. 그림에 적힌 간격은 4.3개월과 5.0개월로, AISI가 2025년 1~9월에 나온 오픈모델을 내부에서 재며 얻은 6~10개월보다 둘 다 짧습니다.
AISI는 이 결과에 단서를 붙였습니다. 2026년 2월까지 폐쇄형이 빠르게 올라간 흐름은 오픈모델이 따라잡았지만, 4월 Mythos Preview와 GPT-5.5가 보인 더 큰 도약을 다음 오픈모델이 재현할지는 이번 결과로 알 수 없다는 내용입니다. 같은 그림에서 가장 최근의 폐쇄형 모델인 Claude Mythos 5와 GPT-5.6 Sol은 성공률 90% 안팎에 찍혀 있고, GLM-5.2는 70%대에 있습니다.
두 번째 시험은 사이버레인지입니다. 전문가가 취약점을 심어 만든 가상 네트워크에서, 처음 침투한 지점부터 목표까지 공격을 사람 도움 없이 이어 가게 합니다. 이번에 쓴 「The Last Ones」는 서브넷 4개와 호스트 약 20대로 짠 32단계 기업망 공격이고, AISI는 사람 전문가가 끝까지 푸는 데 20시간쯤 걸린다고 봅니다. 한 판에 쓸 수 있는 토큰은 1억 개까지이고, 모델마다 열 번 돌린 평균을 냅니다.

여기서는 격차가 더 벌어졌습니다. GLM-5.2는 7개월이 채 안 되게 앞서 나온 Opus 4.5만큼 나아갔고, 11단계까지는 Opus 4.6과 같은 궤적으로 올라가다 멈췄습니다. 7단계에는 다른 어떤 모델보다 평균적으로 조금 적은 토큰으로 닿았습니다. 딥시크 V4-Pro는 사이버 프런티어에 못 미치는 모델로 분류된 Sonnet 4.5(V4-Pro보다 7개월 먼저 출시)에도 못 미쳤습니다. AISI는 다른 레인지에서도 결과가 대체로 같았다고 적었습니다.
| 모델(출시) | 좁은 과제 70개 | 사이버레인지 32단계 |
|---|---|---|
| GLM-5.2(2026년 6월) | Opus 4.6·GPT-5.3-Codex와 비슷, 4.3개월 | Opus 4.5까지, 11단계에서 멈춤 |
| 딥시크 V4-Pro(2026년 4월) | Opus 4.5와 비슷, 5.0개월 | Sonnet 4.5보다 아래 |
같은 그림 위쪽에는 폐쇄형 최신 모델이 있습니다. GPT-5.6 Sol과 Claude Mythos 5의 평균은 28단계 안팎까지 올라갔고, 가장 잘된 시도는 32단계를 모두 끝내 네트워크 전체를 장악했습니다. GPT-5.6 Sol 시스템 카드에는 AISI 평가에서 이 레인지를 열 번 중 일곱 번 끝까지 풀었다는 기록이 있습니다. 4월 AISI가 처음 공개한 결과에서는 Mythos Preview가 열 번 중 세 번 완주했고 평균 22단계였습니다. 개월 수로는 7개월이지만, 단계 수로는 오픈모델 최고치 11단계와 폐쇄형 최신 모델 28단계 안팎 사이에 17단계 차이가 납니다.
AISI는 레인지 결과를 좁은 과제보다 약한 증거로 다뤘습니다. 좁은 과제는 70개인데 레인지는 몇 개뿐이기 때문입니다. 멈춘 이유가 그 단계를 넘을 사이버 실력이 모자라서인지, 긴 작업을 계획하고 이어 가는 에이전트 능력이 모자라서인지도 궤적만으로는 가릴 수 없다고 적었습니다. 레인지에는 실제 기업망에 있는 방어 인력과 방어 도구가 없고, 경보를 울릴 행동을 해도 벌점이 없습니다.
AISI는 각 회사의 공개 가격으로 비용도 계산했습니다. 1억 토큰짜리 레인지 한 판에 Opus 4.5와 4.6은 약 85달러, GLM-5.2는 약 46달러(추정), 딥시크 V4-Pro는 1.19달러가 듭니다. 두 모델이 모두 100% 풀어낸 과제로 좁혀도 Opus 4.6이 과제당 15.17달러일 때 GLM-5.2는 6.12달러, Opus 4.5가 12.50달러일 때 V4-Pro는 0.28달러였습니다.
| 비용 기준 | 폐쇄형 | 오픈웨이트 |
|---|---|---|
| 레인지 한 판(1억 토큰) | Opus 4.5·4.6 약 85달러 | GLM-5.2 약 46달러, V4-Pro 1.19달러 |
| 둘 다 100% 푼 과제, 과제당 | Opus 4.6 15.17달러 | GLM-5.2 6.12달러 |
| 둘 다 100% 푼 과제, 과제당 | Opus 4.5 12.50달러 | V4-Pro 0.28달러 |
제 계산으로는 Opus로 레인지 한 판을 돌릴 돈이면 V4-Pro로 71판을 돌릴 수 있고, 같은 과제 하나를 푸는 값은 45배 가까이 차이 납니다. AISI는 오픈모델을 원래 개발사의 서비스로 돌리지 않았기 때문에 실제 연산 비용은 다를 수 있다고 각주에 적었습니다.
값이 성적과 이어지는 이유는 AISI의 3월 논문에 있습니다. 레인지 성적은 추론에 쓰는 토큰을 열 배로 늘릴 때마다 일정한 폭씩 꾸준히 올랐고, 1,000만 토큰에서 1억 토큰으로 늘리면 최대 59% 좋아졌습니다. AISI는 이 향상에 운영자의 특별한 기술이 필요하지 않다고 적었습니다. 토큰이 싸면 같은 예산으로 더 길게, 더 여러 번 돌릴 수 있습니다. AISI는 이번 측정에서 오픈모델에 맞춘 최적화를 하지 않아 최대 능력을 조금 낮게 봤을 수 있다고도 밝혔습니다.
방어하는 쪽에도 같은 계산이 통합니다. AISI 엔지니어링팀은 7월 7일 공개한 사례에서 2주 동안 여러 프런티어 모델로 자기네 연구 플랫폼의 스테이징 환경을 공격해 봤습니다. 한 모델은 평범한 연구자 권한에서 출발해 다섯 단계를 이어 다른 사용자의 데이터에 닿는 경로를 150파운드도 안 되는 토큰으로 찾아냈고, 프로젝트 전체에 든 토큰 값은 1,000파운드 미만이었습니다. 이때 기본적인 상용 경보 시스템은 에이전트의 활동을 하나도 보안 사건으로 잡아내지 못했고, 더 정교한 감시 시스템만 공격적인 행동 일부를 이상 징후로 잡았습니다.
AISI 밖에서도 비슷한 측정이 나왔습니다. 보안업체 Semgrep은 6월 22일 IDOR 취약점을 찾는 시험 결과를 공개했습니다. IDOR는 주소 속 번호만 바꾸면 남의 계정 데이터가 열리는 결함으로, 권한 검사가 빠져 있어서 생깁니다. Semgrep은 모델마다 같은 프롬프트를 주고, 정밀도와 재현율을 하나로 묶은 F1 점수로 쟀습니다.
| 구성 | IDOR 탐지 F1 |
|---|---|
| Semgrep 자체 파이프라인(GPT-5.5·Opus 4.8) | 53~61% |
| GLM-5.2, 프롬프트만 | 39% |
| Claude Code(Opus 4.6) | 37% |
| Claude Code(Opus 4.8·4.7) | 28% |
| MiniMax M3, 프롬프트만 | 23% |
| Kimi K2.7 Code, 프롬프트만 | 22% |
| 딥시크 V4-Pro, 프롬프트만 | 17% |
보조 장치 없이 프롬프트만 받은 GLM-5.2가 Claude Code보다 높았고, 취약점 하나를 찾는 데 약 0.17달러가 들었습니다. Semgrep은 GLM-5.2의 가격이 비슷한 프런티어 모델의 약 6분의 1이라고 적었습니다. 다만 표에서 가장 큰 차이는 모델 사이보다 하네스(모델에 도구와 지시를 붙여 일을 시키는 실행 틀) 사이에서 났고, Semgrep 스스로 과제 하나, 데이터셋 하나, 한 번 실행한 결과라는 단서를 달았습니다. GLM-5.2와 다음 오픈모델의 차이가 16점이라 오픈모델 전체가 따라왔다고 볼 수도 없다고 덧붙였습니다.
GLM-5.2를 만든 Z.ai도 공개 글에서 약점을 밝혔습니다. 강화학습 중에 GLM-5.1보다 보상 해킹(과제를 제대로 풀지 않고 채점의 빈틈으로 점수를 얻는 행동)을 더 자주 보였다는 내용입니다. 보호된 평가 파일을 열어 보거나 정답 코드를 curl로 내려받는 식이었고, Z.ai는 훈련 중 도구 호출을 단계마다 감시해 막는 장치를 따로 만들었습니다.
AISI는 공개 당시 오픈웨이트 사이버 능력의 선두 후보였다는 이유로 두 모델을 골랐고, 둘 다 중국 회사가 만들었습니다. GLM-5.2는 베이징의 Z.ai가 6월 13일 코딩 요금제 가입자에게 먼저 열고 16일 가중치를 풀었습니다. 전체 약 7,500억 파라미터 가운데 토큰마다 약 400억 개만 켜는 전문가 혼합(MoE) 구조이고, 100만 토큰 문맥을 받습니다.
미국 쪽에서 아티피셜애널리시스 지수가 가장 높은 오픈 모델은 7월 15일 씽킹머신즈가 푼 Inkling입니다. 설계 출처를 딥시크 V3로 밝힌 이 모델은 코딩 에이전트 성적에서 GLM-5.2에 밀렸습니다. AISI는 이번 결과를 사이버 밖의 능력으로 넓혀 해석할 수 없다고도 적었습니다. 오픈AI가 7월 1일 공개한 연구 판단 시험에서 GLM-5.2는 4.6%로, GPT-5.6 Sol의 28.7%에 한참 못 미쳤습니다.
폐쇄형 모델의 안전장치도 완벽하지 않습니다. AISI는 GPT-5.6 Sol 출시 전에 사이버 안전장치를 시험했고, 모든 라운드에서 취약점 발견과 공격 코드 개발 같은 긴 작업을 끝까지 풀어 주는 보편 탈옥을 찾았습니다.
@alxndrdaviesX 게시물 · 원문 보기
AISI의 잰더 데이비스가 올린 시스템 카드 대목을 보면, 이런 탈옥은 대개 몇 시간 만에 만들어졌고 공개 사이버 공격 벤치마크에서 모델의 능력을 그대로 살렸습니다. AISI는 실제 공격자는 얻을 수 없는 넓은 접근 권한, 곧 안전 감시 모델의 추론 과정과 정책 문구, 분류기 판정을 실시간으로 받으며 시험했습니다. 오픈AI는 보고된 탈옥을 재현하고 막는 작업을 했고, AISI는 레드팀을 더 하면 비슷한 탈옥이 또 나올 것으로 봤습니다. 앤트로픽도 6월 30일 글에서 어떤 AI 모델이든 탈옥에 완전히 견고하게 만드는 일은 아마 불가능하다고 적었습니다.
차이는 탈옥이 발견된 다음에 생깁니다. 폐쇄형 회사는 탈옥을 보고받으면 분류기를 고치고, 문제 계정을 막고, 최악에는 모델을 내립니다. 6월에 앤트로픽이 수출통제 지시를 받고 두 모델을 모든 사용자에게서 내린 일도 이 수단에 속합니다. 오픈웨이트에는 그런 수단이 없습니다. 이번 평가에서 딥시크 V4-Pro는 주로 역공학 과제를 가끔 거부했지만, AISI는 거부당한 과제를 몇 번 다시 시도하는 것만으로 넘어갔습니다.
공격 도구가 퍼지기 전에 방어자에게 준비 기간이 주어졌던 일은 전에도 있었습니다. 2017년 5월 영국과 스페인에서 시작해 전 세계로 번진 랜섬웨어 워너크라이는 미국 국가안보국(NSA)에서 도난당한 공격 도구를 썼습니다. 마이크로소프트는 두 달 앞선 3월 14일에 이 취약점을 막는 보안 업데이트(MS17-010)를 내놓은 상태였습니다.
그런데도 병원과 기업, 정부 기관의 컴퓨터가 잠겼습니다. 브래드 스미스 마이크로소프트 사장은 5월 14일 글에서 패치가 나오고 두 달이 지났는데도 수많은 컴퓨터가 취약한 채 남아 있었다고 적었고, 시스템을 업데이트하지 않으면 고객이 스스로를 지킬 방법이 없다고 했습니다. 정부가 쌓아 둔 공격 도구가 새어 나간 일은 미군이 토마호크 미사일 일부를 도난당한 것과 같다고 비유했습니다.
영국 NCSC를 포함한 파이브아이즈 5개국 사이버 기관장들은 6월 22일 공동 성명에서 불필요한 외부 연결을 줄이고, 보안 업데이트를 서두르고, 중요한 시스템의 접근 권한을 좁히고, 침해가 일어난다고 가정하고 대응 계획을 시험하라고 권했습니다. AISI도 이번 결과가 NCSC의 권고, 곧 보안 기본기에 투자하고 AI 기반 방어를 쓰라는 권고를 뒷받침한다고 적었습니다. 성명은 남은 시간을 이렇게 적었습니다.
프런티어 AI가 사이버 공격과 방어를 뒤흔들 시간표는 몇 달 단위입니다.— 파이브아이즈 사이버 보안 기관장 공동 성명, 6월 22일
AISI의 준비 기간은 가장 강한 폐쇄형 모델을 쓸 수 있는 방어자를 전제로 합니다. 한국 기관의 사정은 조금 다릅니다. 앤트로픽이 Mythos를 검증된 방어 기관에만 여는 Project Glasswing에는 SK텔레콤과 삼성전자, 한국인터넷진흥원(KISA)이 참여했습니다. WIRED에 따르면 6월 초 백악관이 요구해 SK텔레콤의 Mythos 접근이 먼저 회수됐고, 6월 30일 수출통제가 풀린 뒤에도 앤트로픽이 Mythos 5를 되돌린 곳은 미국 기관 일부였습니다. 앤트로픽은 Glasswing의 국내외 파트너로 접근을 넓히는 문제를 정부와 계속 협의하고 있다고 밝혔습니다.
금융권에는 망분리 규제가 걸려 있습니다. 전자금융감독규정은 국내 금융회사가 업무용 시스템과 전산실 내부 시스템을 인터넷 같은 외부망과 분리하도록 정하고 있습니다. 금융위원회는 5월 22일 보도자료에서 이 규제 때문에 고성능 AI로 취약점을 찾고 방어 체계를 짓는 일이 원천적으로 제한된다는 금융권의 의견을 전했고, Mythos 같은 고성능 AI의 보안 위협을 계기로 보안 목적의 AI 활용에 한해 망분리 규제를 긴급 완화하기로 했습니다.
| 금융위 5월 22일 조치 | 내용 |
|---|---|
| 신청 대상 | 총자산 10조 원 이상, 상시 종업원 1,000명 이상인 49개 금융회사 |
| 방식 | 전문가 평가와 비조치의견서를 거쳐 1년 한시 완화 |
| 일정 | 1회차 10개사 이내 6~7월, 2회차 10~20개사 8~9월, 3회차 4분기 |
| 그 밖 | 금융보안원이 7월까지 최대 17개사에 외부 공격표면 AI 점검 지원, 금융 AI보안연구소 신설 계획 |
가중치를 내려받은 오픈웨이트 모델은 외부망에 연결하지 않고 내부 서버에서 돌릴 수 있습니다. 이번 측정대로라면 그렇게 돌릴 수 있는 모델 가운데 AISI가 가장 강하다고 본 GLM-5.2가 4~7개월 전 폐쇄형 수준입니다. 같은 가중치는 공격자에게도 똑같이 열려 있고, 공개 가격으로 치면 레인지 한 판에 GLM-5.2는 약 46달러, 딥시크 V4-Pro는 1.19달러입니다.
7월 16일 문샷AI가 공개한 Kimi K3는 전체 2.8조 파라미터로 오픈 모델 가운데 가장 크고, 아레나의 프런트엔드 코드 대결에서 평균 승률 76%로 Fable 5(63%)와 GPT-5.6 Sol(58%)을 앞섰습니다. K3는 이번 평가에 들지 않아 사이버 능력은 아직 재지 않았습니다. AISI는 가중치가 공개되면 같은 기준으로 재겠다고 했고, 문샷AI는 7월 27일까지 가중치를 풀겠다고 약속했습니다.
AISI가 5월에 낸 분석을 보면, 프런티어 모델이 80% 확률로 풀어내는 사이버 과제의 길이(사람 전문가가 걸리는 시간 기준)는 2024년 말부터 4.7개월마다 두 배로 늘었고, 4월의 Mythos Preview와 GPT-5.5는 이 추세보다도 높았습니다. 제 계산으로는 4~7개월 격차가 이 두 배 주기 한 번 안팎입니다. K3 측정은 4월의 도약이 오픈웨이트에서도 재현되는지를 보는 첫 시험이 됩니다. AISI의 K3 측정이 나오면 다시 전하겠습니다.
읽어 주셔서 고맙습니다.
초이 드림