이 글 어땠어요?
발표 당일 기준 가장 높은 설정은 xhigh입니다. 메타가 비교표에 올린 max는 안전성 시험을 마친 뒤 열겠다고 했고, Artificial Analysis는 파트너 대상 제한 프리뷰로 분류했습니다.
100만 토큰당 입력 1.25달러, 캐시된 입력 0.15달러, 출력 4.25달러로 1.2와 같습니다. 학습 데이터 제공에 동의하는 기여자 요금제는 입력 0.10달러, 출력 0.20달러입니다.
1.3의 가중치 계획은 나오지 않았습니다. 메타는 8월 10일 1.2 가중치를 곧 공개하겠다고 했고, 이번 발표에서는 최종 안전성 미세조정을 마친 뒤 공개한다는 조건을 붙였습니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
미스트랄이 10월 6일 1조 파라미터 Mistral Large 4 프리뷰를 공개했습니다. 아티피셜애널리시스 지수 38점으로 중국 밖 오픈 모델 1위이고, 사이버 방어를 앞세워 가중치는 레드팀 시험 뒤 10월 말 풉니다.

리플렉션 AI가 10월 5일(미국 시각) 첫 모델 Beam을 공개했습니다. GLM-5.2급 추론 점수를 3~4배 적은 연산으로 냈다고 밝혔지만, 자사 비교표에서도 GLM-5.3과 DeepSeek V4.1-Flash가 더 높습니다.
딥시크가 8월 13일 V4-Pro 정식판을 앱과 API에 올렸습니다. DeepSWE는 프리뷰 12.8에서 62.7로 올랐지만, 5.6배 작은 플래시 정식판과의 종합 지수 차이는 1.2점이었습니다. 출력 요금은 8월 16일부터 1.98~3.96달러로 오릅니다.

미스트랄이 10월 6일 1조 파라미터 Mistral Large 4 프리뷰를 공개했습니다. 아티피셜애널리시스 지수 38점으로 중국 밖 오픈 모델 1위이고, 사이버 방어를 앞세워 가중치는 레드팀 시험 뒤 10월 말 풉니다.
리플렉션 AI가 10월 5일(미국 시각) 첫 모델 Beam을 공개했습니다. GLM-5.2급 추론 점수를 3~4배 적은 연산으로 냈다고 밝혔지만, 자사 비교표에서도 GLM-5.3과 DeepSeek V4.1-Flash가 더 높습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
@finkdX 게시물 · 원문 보기
마크 저커버그 CEO는 한국 시각 3일 새벽 4시 26분 X에 1.3을 소개하며 거의 계량할 필요가 없을 만큼 싼 프런티어 성능이라고 적었습니다. 코딩과 에이전트 작업에서 지금까지 가장 큰 도약이라며 Muse Code와 API에서 써 보라고 했고, 글 끝에는 다음 순서로 수박 이모지 하나와 Muse Spark 오픈웨이트 공개를 붙였습니다. 수박은 메타가 차세대 대형 모델을 부르는 내부 코드명 Watermelon입니다. 알렉산더 왕 최고 AI 책임자는 더 크고 강한 Muse 모델이 바로 뒤에 온다고 썼고, 1.3은 같은 날 OpenRouter에도 올라왔습니다.
저커버그가 올린 비교표에는 평가 11개가 있습니다. 1.3이 가장 높거나 같은 항목은 5개로, 긴 문맥 두 개와 코딩 세 개입니다. 앤트로픽의 Claude Opus 5는 실무 과제와 컴퓨터 조작을 포함한 4개에서, 오픈AI의 GPT-5.6 Sol은 웹 조사와 지시 이행 2개에서 앞섰고 터미널 코딩은 1.3과 같은 점수였습니다.
| 평가 | 1.3 (max) | 1.2 (xhigh) | GPT-5.6 Sol (max) | Opus 5 (max) |
|---|---|---|---|---|
| GDPval-AA v2 (지식 노동, Elo) | 1754 | 1615 | 1710 | 1824 |
| JobBench (전문 도구 사용) | 64.9 | 61.6 | 45.4 | 65.7 |
| OSWorld 2.0 (컴퓨터 조작) | 66.9 | 47.6 | 62.7 | 68.3 |
| DeepSearchQA (웹 조사) | 89.4 | 85.9 | 93.0 | 90.4 |
| Agentic IF Index (지시 이행, 메타 내부) | 57.8 | 46.2 | 60.5 | 59.1 |
| AutomationBench (업무 자동화) | 49.4 | 38.2 | 46.7 | 50.3 |
| MRCR 25만~50만 토큰 (긴 문맥) | 98.5 | 66.3 | 91.5 | - |
| MRCR 50만~100만 토큰 (긴 문맥) | 98.1 | 55.5 | 73.8 | - |
| DeepSWE v1.1 (장기 코딩) | 75.4 | 55.0 | 73.0 | 74.0 |
| SWE-Atlas Codebase QnA (코드 이해) | 59.4 | 46.2 | 53.5 | 52.7 |
| Terminal-Bench 2.1 (터미널 코딩) | 88.8 | 82.9 | 88.8 | 86.7 |
가장 많이 오른 것은 긴 문맥입니다. MRCR은 수십만 토큰짜리 대화 속에 비슷한 문장 8개를 흩어 두고 그중 정해진 하나를 정확히 찾아 옮기게 하는 시험인데, 50만~100만 토큰 구간에서 1.2의 55.5%가 98.1%로 올랐습니다. DeepSWE는 평가 회사 Datacurve가 만든 저장소 91곳, 언어 5개에 걸친 긴 개발 과제 113개로, 사람이 직접 쓴 테스트를 모두 통과해야 점수를 줍니다. 1.3은 1.2보다 20.4%포인트 높은 75.4%로 Opus 5(74.0%)와 Sol(73.0%)을 앞질렀습니다. 화면을 보고 컴퓨터를 다루는 OSWorld 2.0은 19.3%포인트 올라 Opus 5와 1.4%포인트 차이가 됐습니다.
발표 4분 뒤 X에는 DeepSWE 1위를 짚으며 무슨 일이냐고 묻는 게시물이 올라왔습니다. 2025년 4월 Llama 4가 기대에 못 미쳤던 회사가 17개월 만에 오픈AI와 앤트로픽의 최상위 모델보다 높은 코딩 점수를 적은 겁니다.
@kimmonismusX 게시물 · 원문 보기
비교표의 1.3 열은 max 설정으로, 1.2 열은 한 단계 낮은 xhigh로 쟀습니다. 메타 공식 계정은 1.3을 Muse Code와 Meta Model API에 내놓으면서 max 추론은 안전성 시험을 마친 뒤 곧 열겠다고 적었습니다. 발표 당일 개발자가 고를 수 있는 가장 높은 설정은 xhigh였고, Artificial Analysis는 max를 메타 파트너에게만 주는 제한 프리뷰로 분류했습니다.
@AIatMetaX 게시물 · 원문 보기
측정 출처도 열마다 다릅니다. 메타 평가 방법 문서를 보면 1.3과 Opus 5, Sol은 max로, 1.2는 xhigh로 쟀고, 모델마다 메타의 자체 측정과 공식 리더보드, 개발사 발표 가운데 가장 높은 값을 적었습니다. DeepSWE에서 메타가 직접 돌린 것은 1.3 하나입니다. 1.3 max는 가벼운 오픈소스 하네스인 mini-swe-agent로 돌렸고, 나머지 세 모델의 점수는 Datacurve 공식 리더보드에서 가져왔습니다.
같은 시험의 점수가 누가 어떤 틀로 돌리느냐에 따라 얼마나 움직이는지는 메타의 8월 도표와 겹쳐 보면 드러납니다. 8월 5일 1.2 발표 때 메타는 각 회사의 코딩 에이전트 제품으로 잰 DeepSWE 점수를 냈습니다.
| 모델 | 8월 1.2 발표 도표 | 9월 1.3 발표 표 |
|---|---|---|
| Muse Spark 1.2 | 59.3% (Muse Code) | 55.0% (Datacurve 리더보드) |
| Claude Opus 5 (max) | 65.0% (Claude Code) | 74.0% (Datacurve 리더보드) |
같은 1.2가 4%포인트 넘게 내려가고, 같은 Opus 5가 9%포인트 올랐습니다. 모델을 감싸 도구와 지시를 붙이는 실행 틀(하네스)과 측정 주체가 바뀐 결과입니다. 8월에 Muse Code 점수표를 두고 같은 모델에 두 점수가 붙은 경위는 하네스 채점을 따진 글에 적었습니다. 이번 표의 DeepSWE에서 1.3과 Opus 5, Sol을 가르는 1.4~2.4%포인트는 이 차이보다 작습니다.
외부 측정은 발표 한 시간 뒤에 나왔습니다. Artificial Analysis는 추론·지식·코딩·에이전트 평가 9개를 묶은 지능 지수에서 1.3 xhigh에 61점을 줬습니다. 7월 1.1의 53점, 8월 1.2의 57점에서 두 달 사이 8점이 올랐고, GPT-5.6 Sol 최고 설정과 SpaceXAI의 Grok 4.6, Opus 5의 high 설정과 같은 점수입니다. 그 위에는 Claude Fable 5.1(66점), Opus 5 최고 설정(63점), Fable 5(62점)만 있고, 제한 공개 중인 1.3 max는 62점입니다.
@ArtificialAnlysX 게시물 · 원문 보기
오른 점수는 에이전트 평가에 몰렸습니다. 은행 상담 업무를 여러 번 주고받으며 처리하는 τ³-Banking이 35%에서 47%로 올랐고, max는 52%로 전체 모델 가운데 1위였습니다. 터미널 작업은 80%에서 85%, 지식 노동 GDPval은 1615점에서 1709점이 됐습니다. 물리 연구 문제 CritPt도 18%에서 26%로 올랐습니다.
떨어진 항목도 둘 있습니다. 긴 문서 여러 개를 읽고 추론하는 AA-LCR이 83%에서 79%로 내려갔고, 지식 정확도는 3점 떨어졌습니다. 모를 때 답을 보류하는 비율이 늘어난 탓이고, 같은 이유로 틀린 답을 지어내는 비율은 줄었다고 Artificial Analysis는 설명했습니다.
토큰 단가는 7월 1.1 때 정한 값 그대로입니다. 학습에 데이터를 내주는 데 동의하는 기여자(Contributor) 요금제는 입력이 12.5분의 1, 출력이 21분의 1로 내려갑니다.
| 100만 토큰당 | 표준 요금 | 기여자 요금(학습 동의) |
|---|---|---|
| 입력 | 1.25달러 | 0.10달러 |
| 캐시된 입력 | 0.15달러 | - |
| 출력 | 4.25달러 | 0.20달러 |
같은 날 기준 Opus 5는 입력 5달러에 출력 25달러, Sol은 4달러에 20달러를 받습니다. Artificial Analysis가 지수 과제 하나를 푸는 데 든 돈을 재어 보니 1.3 xhigh는 0.55달러였고, 같은 61점대의 Grok 4.6은 0.94달러, Sol 최고 설정은 0.95달러, Opus 5 high는 1.23달러였습니다. 59점 이상에서 이보다 싼 모델은 없고, 가장 가까운 것이 0.58달러의 제미나이 3.8 Flash입니다. Opus 5 최고 설정은 2점 높은 63점에 2.34달러를 썼습니다.

다만 1.2의 0.40달러보다는 38% 비싸졌습니다. 단가는 같은데 에이전트 평가에서 과제 하나에 넣는 입력 토큰이 57% 늘었기 때문이고, 출력 토큰은 8%만 늘었습니다. max는 xhigh보다 GDPval에서 추론을 62%, τ³-Banking에서 28% 더 하는데, 메타가 가격을 밝히지 않아 비용 비교에서 빠졌습니다.
저커버그가 쓴 '계량할 필요도 없을 만큼 싸다'는 말에는 오래된 쓰임이 있습니다. 1954년 9월 루이스 스트로스 미국 원자력위원회 위원장은 과학기자협회 연설에서 다음 세대는 계량할 필요도 없을 만큼 싼 전기를 쓰게 될 것이라고 했고, 원자력 전기는 끝내 계량기를 떼지 못했습니다. 1.3의 토큰 단가는 두 달째 같고, 과제 하나에 드는 돈은 모델이 일을 더 많이 하면서 늘었습니다.
메타가 밝힌 효율 수치는 방향이 반대입니다. 메타 엔지니어들이 1.2와 나란히 써 본 비교에서 1.3은 필요 없는 턴을 덜 쓰고 말이 짧아져 도구 호출이 약 20%, 토큰이 약 25% 줄었습니다. 왕은 긴 작업에서 요구 사항을 끝까지 붙잡는 점을 함께 꼽았습니다. Artificial Analysis의 에이전트 평가에서는 과제당 입력 토큰이 57% 늘었으니, 두 숫자는 서로 다른 과제와 조건에서 나온 값입니다.
행동도 손봤습니다. 메타는 1.3이 지시가 모호하면 되묻고, 막히면 사용자에게 도움을 청하고, 결과가 큰 행동 앞에서는 먼저 확인받도록 훈련했다고 밝혔습니다. 자기가 할 수 있는 일과 모르는 것을 알아 막힌 작업의 결과를 지어내지 않게 했고, 한 하네스에 묶이지 않도록 여러 에이전트 실행 틀에서 두루 훈련했다는 설명도 있습니다. 후학습을 맡은 연구자 슈차오 비는 게으름과 지시 불이행, 얼버무리기, 보상만 쫓는 행동을 잡으려고 채점에 훨씬 많은 연산을 썼다고 밝혔습니다. 강화학습에서 모델이 채점기의 허점을 파고드는 문제를 채점 쪽 계산량을 늘려 누른 겁니다.
코딩 에이전트로 쓸 때의 측정도 같은 날 나왔습니다. Artificial Analysis의 코딩 에이전트 지수에서 Muse Code에 붙인 1.3 xhigh는 64점으로 1.2보다 2점 올랐고, Codex에 붙인 Sol 최고 설정(65점)보다 1점 낮았습니다. 과제당 비용은 1.72달러로, Claude Code에 붙인 Opus 5(8.17달러)의 5분의 1 정도입니다. 1.3 max는 Claude Code의 Opus 5와 같은 68점을 받고도 순위는 2위로 올랐고, 과제당 토큰은 약 1,400만 개로 Opus 5(약 2,200만 개)보다 3분의 1가량 적었습니다.
구글도 같은 9월 2일 제미나이 3.8 Flash를 냈습니다. 3.6 Flash 이후 6주 사이 세 번째 Flash이고, 메타는 7월 9일 1.1부터 8주 사이 세 번째 Spark입니다. 3.8 Flash의 모델 카드는 구조와 학습 데이터 항목을 3.7 Flash로 돌렸고, 1.3은 메타 연구자들이 내부 코드명 Avocado로 불러 온 기존 모델을 다시 후학습한 결과라고 밝혔습니다. 두 회사 모두 사전학습을 새로 하지 않고 후학습만으로 한 달 안팎마다 모델을 내고 있습니다. 같은 날 나온 제미나이 3.8 Flash와 1.3의 조건은 이렇습니다.
| 항목 | Muse Spark 1.3 (xhigh) | 제미나이 3.8 Flash (high) |
|---|---|---|
| AA 지능 지수 | 61점 | 59점 |
| AA 과제당 비용 | 0.55달러 | 0.58달러 |
| DeepSWE v1.1 | 75.4% (max, 메타 측정) | 73.7% (구글 발표) |
| 100만 토큰당 입력·출력 | 1.25·4.25달러 | 0.75·3.75달러(12월 31일까지), 이후 1.50·7.50달러 |
| 먼저 내놓은 곳 | Muse Code, Meta Model API | Gemini API, 제미나이 앱 유료 구독 |
토큰 단가는 구글이 싸지만 연말까지 붙은 도입 가격이고, 과제당 비용은 두 모델이 3센트 차이입니다. 구글은 3.8 Flash를 제미나이 앱에 바로 넣었고, 메타는 개발자 API와 코딩 에이전트에 먼저 내놓았습니다. 왕은 Artificial Analysis의 결과를 인용하며 한마디를 보탰습니다.
@alexandr_wangX 게시물 · 원문 보기
오픈웨이트 약속은 이번 발표에도 붙었습니다. 저커버그와 왕, 메타 공식 계정은 모두 Muse Spark 오픈웨이트 공개가 곧 나온다고 적었고, 블로그 마지막 문단은 더 큰 모델과 함께 최종 안전성 미세조정을 마친 뒤 Muse Spark 1.2의 가중치를 공개하겠다고 밝혔습니다. 이번에 나온 1.3보다 한 세대 앞선 모델입니다.
이 약속이 처음 나온 날은 8월 10일입니다. 메타는 그날 300억 파라미터 모델 Muse Glimmer의 가중치를 Apache 2.0으로 풀면서 1.2 가중치도 곧 공개하겠다고 했고, 3주 넘게 지난 9월 2일 가중치 대신 1.3이 먼저 나왔습니다.
Artificial Analysis 표에서 1.3 xhigh 바로 아래 60점에는 문샷AI가 7월 가중치를 푼 Kimi K3가 있고, 1.2와 같은 57점에는 Z.ai가 8월 26일 MIT 라이선스로 푼 GLM-5.3-Flash가 있습니다. 메타가 가중치를 공개한 Glimmer는 35점입니다. 1.2 가중치가 나오면 미국 회사가 57점짜리 모델을 오픈웨이트로 내놓게 되고, 라이선스가 Glimmer처럼 Apache 2.0인지에 따라 기업이 가져다 쓸 수 있는 범위가 정해집니다.
이 속도의 배경은 왕이 7월 말 와이 컴비네이터 대담에서 설명했습니다. Llama 4가 필요한 수준에 못 미친다고 판단한 뒤 연구소를 처음부터 다시 세웠고, 9개월 만에 첫 Muse Spark를 냈다는 겁니다. 그 대담에서 예고한 자체 하네스와 오픈소스 모델은 8월 Muse Code와 Glimmer로 나왔습니다. 7월 초 사내 타운홀에서 저커버그가 에이전트 진전이 기대만큼 빠르지 않다고 인정한 지 두 달 만에 나온 1.3입니다.
| 날짜(미국 시각) | 발표 |
|---|---|
| 4월 8일 | Muse Spark 공개 |
| 7월 9일 | Muse Spark 1.1, Meta Model API 공개 프리뷰 |
| 8월 5일 | Muse Code 베타, Muse Spark 1.2 |
| 8월 10일 | Muse Glimmer 가중치 공개, 1.2 가중치 공개 예고 |
| 8월 31일 | Muse Code 정식 출시, 월 구독 요금제 |
| 9월 2일 | Muse Spark 1.3 (max 설정은 안전성 시험 뒤 공개) |
더 큰 모델은 수박 이모지로 예고된 Watermelon입니다. 보도로는 Muse Spark보다 10배 많은 연산을 들여 10월 출시를 목표로 훈련하고 있습니다. 그 연산은 메타가 올해 1,300억~1,450억 달러로 잡은 설비투자에서 나옵니다. 1.3 max의 62점은 Artificial Analysis 순위에서 앤트로픽의 Fable과 Opus 다음이고, X에서는 Claude와 GPT 사이에 처음 끼어든 모델이라는 평이 나왔습니다.
1.3은 Meta Model API와 Muse Code, OpenRouter로 나왔고 단가는 1.2와 같습니다. 1.2로 에이전트를 돌리던 팀이라면 모델 이름만 바꿔도 되지만, 과제당 비용은 입력 토큰이 늘어난 만큼 오를 수 있습니다. 한국어 성적은 발표에 없습니다.
가장 싼 기여자 요금제는 프롬프트와 답을 메타의 다음 모델 학습에 쓰도록 허락하는 조건입니다. 고객 정보나 사내 코드가 섞인 작업을 이 요금제로 보내면 해외 회사의 학습 데이터로 넘어가는 일이라, 국내 기업에는 값보다 계약과 개인정보 처리 조건이 먼저 걸립니다.
메타는 max 설정을 안전성 시험을 마친 뒤 열겠다고만 했고 날짜와 가격은 밝히지 않았습니다. max가 열리고 1.2 가중치의 날짜와 라이선스가 나오면 다시 전하겠습니다.
읽어 주셔서 고맙습니다.
초이 드림