이 글 어땠어요?
이 평가에서는 아직 못 미쳤습니다. 공격 코드 시험에서 32.2%로 76.2%에 절반도 안 됐고, 최고 단계인 임의 코드 실행은 41개 전부에서 0개였습니다. 다만 미국 최상위 76.2%는 안전장치를 끄고 잰 값입니다.
모의 기업망에는 방어자도 탐지 장비도 없어 실제 환경보다 공격자에게 유리합니다. 완주 확률이 낮아도 공격자가 시도를 반복하면 성공 확률은 올라가고, 시도 횟수는 공격자가 정합니다.
K3는 공격 요청을 거부하지 않았고, 가중치가 풀리면 거부 훈련을 다시 풀 수 있으며 누가 어디서 돌리는지 감시할 수 없습니다. AISI는 공개 뒤 같은 방식으로 다시 재겠다고 밝혔습니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
연구자 8명이 8월 10일 arXiv에 올린 116쪽 논문입니다. 세 회사가 추론 블록을 키 하나로 잠근 탓에 블록이 세션·사용자·모델을 넘어 통했고, 복원한 토큰 수가 API 청구 thinking 토큰 수와 1대 1로 맞았습니다.
.png)
영국 AISI가 7월 21일 사이버 평가에서 시험한 모델 5개가 모두 부정행위를 시도했다고 밝혔습니다. 시도 비율은 7.8~14.1%였고, 물었을 때 잘못이라고 답한 비율은 25~44%에 그쳤습니다.
결과 그림을 가린 논문 100편을 60분과 H200 7분의 1 안에서 재현하게 한 Replica가 과제입니다. 학습 242개와 테스트 68개에서 Faraday는 ML 73%, 처음 보는 과학 60%의 승률을 냈고, 저자들은 그 차이가 코드 속도보다 연구 판단에서 나왔다고 분석했습니다.

연구자 8명이 8월 10일 arXiv에 올린 116쪽 논문입니다. 세 회사가 추론 블록을 키 하나로 잠근 탓에 블록이 세션·사용자·모델을 넘어 통했고, 복원한 토큰 수가 API 청구 thinking 토큰 수와 1대 1로 맞았습니다.
영국 AISI가 7월 21일 사이버 평가에서 시험한 모델 5개가 모두 부정행위를 시도했다고 밝혔습니다. 시도 비율은 7.8~14.1%였고, 물었을 때 잘못이라고 답한 비율은 25~44%에 그쳤습니다.
.png)
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.

이 평가는 K3 가중치가 공개되기 4일 전에 나왔습니다. K3는 문샷AI가 7월 16일 내놓은 2.8조 파라미터오픈웨이트 모델이고, 누구나 내려받을 수 있는 가중치는 7월 27일 풀리기로 예고돼 있었습니다. 평가는 두 시험으로 좁혀 돌렸는데, K3의 호스팅 방식 때문에 전체 평가를 다 돌리지는 못했다고 적혀 있습니다.
AISI는 영국 과학혁신기술부 소속이고, CAISI는 미국 상무부 산하 표준·혁신 기관입니다. 두 곳은 2024년 4월 2일 첨단 모델을 함께 시험하기로 협약을 맺었고, 이번 K3 평가가 그 협약이 한 모델을 두고 공동 결과로 나온 사례입니다. 보고서는 AISI 블로그와 미국 상무부 산하 기관 페이지에 같은 날 함께 올라왔습니다.
두 기관이 손을 잡은 이유는 오픈웨이트라는 형식에 있습니다. 폐쇄형 모델은 회사 서버에서만 돌아가 회사가 안전장치를 켜고 끌 수 있지만, 가중치가 풀린 모델은 누구나 받아 자기 서버에서 돌립니다. 한 나라 규제 기관이 자국 안에서만 다루기 어려운 문제라는 것입니다. 문샷은 K3를 이미 API로 팔고 있었고, 파일 공개까지는 4일이 남아 있었습니다.
두 시험 가운데 하나는 ExploitBench입니다. 카네기멜런대가 만든 공개 벤치마크로, 크롬을 움직이는 V8 엔진(자바스크립트와 웹어셈블리를 실행하는 소프트웨어)에서 2023년 이후 나온 취약점 41개를 모델에 주고 공격이 어디까지 이어지는지를 잽니다.
공격은 낮은 단계에서 높은 단계로 올라갑니다. 취약한 코드에 닿는 단계에서 시작해, 프로그램을 멈추게 하는 버그 재현, V8 내부를 조작하는 단계, 방어벽을 넘어 메모리를 마음대로 읽고 쓰는 단계를 거쳐, 마지막이 임의 코드 실행입니다. 임의 코드 실행은 공격자가 표적 컴퓨터를 실제로 장악해 원하는 명령을 돌리는 단계로, 심각도가 가장 높습니다.
그래서 이 벤치마크에서 총점만 보면 절반을 놓칩니다. 앞 단계 몇 개를 밟는 것과 마지막 단계까지 밀어붙이는 것은 피해의 성격이 다르기 때문입니다.
단계별로 나눠 보면 두 모델의 거리가 어디에 있는지가 드러납니다.
| 단계(위로 갈수록 심각) | 미국 최상위 | Kimi K3 | GLM-5.2 |
|---|---|---|---|
| 임의 코드 실행 | 20 | 0 | 0 |
| 메모리 임의 읽기·쓰기 | 30 | 0 | 0 |
| V8 내부 조작 | 38 | 17 | 6 |
| 버그 재현 | 39 | 34 | 24 |
| 취약한 코드에 도달 | 41 | 41 | 41 |
취약점 41개에 닿는 첫 단계는 세 모델 모두 41개를 해냈고, 버그를 재현하는 단계까지도 K3는 34개로 미국 최상위(39개)에 가까웠습니다. 그런데 방어벽을 넘어 메모리를 마음대로 다루는 단계부터 K3는 0개로 떨어집니다. 미국 최상위 모델은 이 단계를 30개, 마지막 임의 코드 실행을 평균 20개에서 해냈지만, K3는 두 단계 모두 41개 전부에서 한 번도 성공하지 못했습니다.

이 0은 초반을 뚫는 능력과 끝까지 장악하는 능력이 서로 다른 문제라는 기록입니다. 총점 44%포인트 차이만 보면 절반만 읽은 것이고, 두 모델을 실제로 가른 것은 표 맨 윗줄의 두 단계입니다. 같은 오픈웨이트인 GLM-5.2와 비교하면 K3는 앞섭니다. 총점 32.2%로 GLM-5.2의 24.4%보다 높고, 중국이 공개한 모델 가운데 사이버 능력으로는 지금 K3가 가장 앞에 있다는 결과입니다.
다른 시험은 The Last Ones라는 사이버 레인지(모의 침투 환경)입니다. 서브넷 4개와 호스트 약 20대로 짜인 32단계 침투 경로이고, 사람 전문가가 붙어도 약 20시간 걸리는 규모입니다.
| 모델 | 평균 도달 단계(32단계 중) |
|---|---|
| 미국 최상위 | 28.5 |
| Kimi K3 | 17 |
| GLM-5.2 | 11 |
K3는 열 번 시도해 평균 17단계까지 갔습니다. 미국 최상위 모델의 28.5단계에는 못 미치고 GLM-5.2의 11단계보다는 앞섭니다. 그런데 열 번 중 한 번은 1억 토큰 한도 안에서 32단계를 끝까지 완주했습니다. 작고 방어가 얇은 기업망이라면 사람 손 없이 혼자 뚫을 수도 있다는 회차입니다.
레인지를 완주한 모델이 K3만 있는 것은 아닙니다. 이전에 공개된 폐쇄형 모델 네 개가 이 시험을 완주했고, 가장 능한 모델은 열 번 중 여섯 번, 일곱 번씩 해냈습니다. K3의 1회는 그 성공률에 한참 못 미칩니다. 다만 완주 확률이 10%라도 공격자가 시도를 열 번 반복하면 한 번은 성공합니다. 평가 점수의 평균과 실제 위험의 모양이 여기서 갈립니다. 시도 횟수를 정하는 쪽은 방어자가 아닌 공격자입니다.
숫자를 나란히 읽기 전에 조건 하나가 붙습니다. 미국 폐쇄형 모델은 거부를 줄이고 최대 능력을 끌어내려고 시스템 단계의 안전장치를 끈 상태로 측정했습니다. 일반 사용자가 쓰는 버전은 그 장치가 켜져 있어 같은 요청을 거부합니다.
그래서 76.2%는 통제를 끈 실험실 조건의 상한이고, 방어자가 실제로 손에 쥐는 미국 모델은 이 값이 아닙니다. 반대로 K3의 32.2%는 손대지 않고 누구나 그대로 돌린 값입니다. 두 숫자는 서로 다른 조건에서 나왔습니다. 44%포인트라는 간격은 통제를 끈 미국 모델과 손대지 않은 K3를 비교한 값입니다. K3의 전체 사이버 능력 추정치는 신뢰구간이 다른 모델보다 넓게 잡혔는데, 호스팅 제약 탓에 ExploitBench 하나로만 계산했기 때문이라고 보고서는 밝혔습니다.
이번 평가는 6일 전 기록 위에 놓입니다. 7월 17일 AISI는 오픈웨이트가 폐쇄형 프런티어를 얼마나 따라왔는지 처음 공개했습니다. 그때 가장 능한 오픈 모델은 6월에 나온 GLM-5.2였고, 좁은 사이버 과제에서 2월의 Opus 4.6, 긴 침투에서 지난해 11월의 Opus 4.5와 비슷했습니다. 각각 4개월, 7개월 앞서 나온 폐쇄형 모델입니다.
| 시점 | 오픈과 폐쇄의 사이버 능력 거리 |
|---|---|
| 2025년 내내 | 6~10개월 |
| 2026년 7월 | 4~7개월 |
@AISecurityInstX 게시물 · 원문 보기
같은 보고서는 값도 함께 쟀습니다. 1억 토큰짜리 레인지를 한 번 돌리는 데 Opus 4.5와 4.6은 약 85달러가 들었고, GLM-5.2는 약 46달러, 딥시크 V4-Pro는 1.19달러였습니다. 두 모델이 다 완주한 과제만 추리면 Opus 4.6은 과제당 15.17달러, GLM-5.2는 6.12달러였습니다. 능력은 붙고 값은 내려가는 흐름에서, K3는 그 추세선 위쪽에 찍혔습니다.

거리를 개월로 세는 이유는 그 기간이 방어자의 준비 시간이기 때문입니다. 방어하는 쪽은 그사이에 패치를 뿌리고 탐지 규칙을 고칩니다. 4월에 Mythos Preview와 GPT-5.5가 사이버 능력에서 큰 폭으로 뛰면서 대비해야 할 수준은 올라갔고, 오픈웨이트가 그 수준을 따라오는 간격은 줄었습니다.
점수보다 더 봐야 할 것은 안전장치입니다. K3는 공격 코드 개발이나 공세적 사이버 작전 요청을 받고도 거부하지 않았습니다. 가중치가 7월 27일 공개되면 이 상태는 되돌릴 수 없습니다.
폐쇄형 모델은 회사가 접근을 막고 사용을 감시하고 문제가 생기면 서버에서 내릴 수 있습니다. 공개된 가중치는 그 수단이 모두 사라집니다. 거부하도록 시킨 훈련은 가중치를 쥔 사람이 다시 풀 수 있고, 한 번 배포되면 누가 어디서 돌리는지 셀 방법이 없습니다. 보고서가 개월 단위 간격을 걱정하는 이유도 여기 있습니다. 폐쇄형이 앞서 있는 몇 달이 지나면, 그 능력이 안전장치 없이 풀린 형태로 나올 수 있다는 겁니다.
숫자 하나가 두 방향으로 읽혔습니다. 능력의 절대 간격을 보면 미국이 아직 앞서 있고, 상무장관 러트닉은 이 결과를 들어 Kimi를 둘러싼 과열을 멈추라고 했습니다. 좁혀지는 속도와 공개 뒤 사라질 안전장치를 보면 방어 준비 시간이 줄고 있고, 백악관은 같은 기간에 중국 오픈웨이트 규제를 저울질했습니다.
이 논쟁은 K3 공개를 전후해 며칠 사이에 몰렸습니다. 모델 공개부터 백악관 규제 검토 보도까지 4일 만이었고, 이어 증류 의혹과 제재 언급이 이틀 만에 나왔습니다. 반대쪽에서는 스타트업 200곳이 표적형 규제를 요구하는 서한을 냈고, 엔비디아와 마이크로소프트 등은 프런티어를 복수로 유지하자는 공동 서한을 냈습니다. 같은 평가가 규제 쪽과 개방 쪽 모두의 근거로 인용된 겁니다.
같은 능력이 공격에만 쓰이는 것은 아닙니다. 버셀이 공개한 취약점 점검 도구 DeepSec는 코드에 숨은 보안 결함을 에이전트가 찾아내는 프로그램인데, 처음 설정할 때 벤치마크 성적을 근거로 추천하는 모델 다섯 개에 GPT-5.6 Sol, Claude Opus 5, Grok 4.5, 딥시크와 함께 Kimi K3가 들어 있습니다. 취약점을 찾는 능력은 그 취약점을 막는 데도 쓰이고, 방어 자동화 도구가 K3를 상시 운용 후보로 올린 겁니다.
그런데 방어용으로 폐쇄형 모델을 쓰려면 조건이 붙기도 합니다. 앤트로픽의 Fable 5는 사이버나 생물·화학 관련 요청이면 분류기가 응답을 막아, 인증을 받지 않은 채 API로 취약점 탐색을 시키면 요청이 거부됩니다. 방어하는 쪽이 안전장치가 켜진 폐쇄형 모델을 쓰기 어려울 때, 안전장치가 없는 오픈웨이트가 그 빈틈을 채우는 구도입니다.
국내 기관이 K3를 같은 방식으로 재 본 공개 기록은 확인되지 않았습니다. 그래서 국내에서의 성공률이나 피해 규모를 숫자로 적지는 않겠습니다. 다만 보고서의 논리만으로도 짚을 것이 있습니다.
하나는 안전장치가 배포 뒤에 사라진다는 조건이 국적과 무관하다는 점입니다. 국내에서도 공개 가중치 모델을 만들고 받아 쓰는 곳이 늘고 있는데, 공개된 모델은 누가 어떤 목적으로 돌리는지 셀 수 없다는 조건을 똑같이 안습니다. K3를 겨냥해 만드는 규제가 국내 공개 모델에도 그대로 돌아옵니다.
다른 하나는 사이버 능력이 방어와 공격 양쪽에 쓰인다는 점입니다. 국내 기업도 취약점 점검에 이런 모델을 붙여 보안을 높일 수 있고, 같은 능력이 반대쪽에서도 쓰입니다. 어느 쪽이 먼저 도구를 손에 쥐느냐가 실제 위험을 가릅니다.
이 보고서로 답할 수 없는 것도 있습니다. 호스팅 제약으로 일부 평가만 돌렸으니 아직 재지 않은 영역이 있고, 완주 1회가 우연에 얼마나 기댔는지, 능동 방어자가 있는 환경에서도 같은 회차가 나오는지는 알 수 없습니다. 비교 대상인 미국 최상위 모델의 이름과 안전장치를 끈 방식의 세부도 공개되지 않았습니다.
다음 기준일은 가중치가 풀리는 7월 27일입니다. AISI는 7월 17일 보고서에서 K3 가중치가 공개되면 같은 방식으로 다시 재겠다고 밝혔습니다. 그때 지금의 32.2%와 17단계가 그대로 유지될 값인지, 안전장치를 떼어 낸 뒤 더 올라갈 값인지가 드러납니다. 그리고 그 재측정은 문샷이 통제할 수 없는 곳에서 이뤄집니다.
읽어 주셔서 고맙습니다.
초이 드림