이 글 어땠어요?
메타가 낸 4비트판은 두 가지입니다. 24GB VRAM용은 평균 1.0%, 32GB용은 0.2%의 성능 저하가 있습니다. 원래 정밀도 그대로는 55GB가 넘는 메모리가 필요해 목표 장비를 64GB로 잡았습니다.
Apache 2.0이라 쓸 수 있습니다. Llama 4 라이선스에 있던 월간 사용자 7억 명 초과 시 별도 허가, 파생 모델 이름 앞에 'Llama'를 붙이는 조항이 없습니다. 메타는 18세 미만의 사용은 상정하지 않았습니다.
저커버그와 알렉산더 왕 모두 '곧'이라고만 밝혔습니다. 8월 10일 기준 공개 날짜와 라이선스, 지금 API로 쓰는 1.2와 같은 모델인지는 나오지 않았습니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
씽킹머신즈랩이 7월 30일 Inkling의 4분의 1 크기인 Inkling-Small(276B, 활성 12B)을 공개했습니다. HLE 31.6%로 선생의 29.7%를 넘었지만 사실 질문 시험 SimpleQA Verified는 43.9%에서 20.6%로 내려갔습니다.

메타가 7월 9일 Muse Spark 1.1을 공개하며 유료 Meta Model API를 열었습니다. 출력 100만 토큰당 4.25달러로 Claude Opus 4.8의 약 6분의 1, GPT-5.5의 약 7분의 1입니다. 에이전트 점수는 앞섰고 코딩 점수는 뒤졌습니다.
알리바바가 8월 3일 Qwen3.8-Max를 공개하고 다음 주 가중치를 풀겠다고 밝혔습니다. 사람이 고르는 아레나 프런트엔드 코드 순위에서 1,668점으로 4위에 올랐지만, 자체 비교표에는 그보다 위에 있는 Opus 5와 Kimi K3가 빠져 있습니다.

씽킹머신즈랩이 7월 30일 Inkling의 4분의 1 크기인 Inkling-Small(276B, 활성 12B)을 공개했습니다. HLE 31.6%로 선생의 29.7%를 넘었지만 사실 질문 시험 SimpleQA Verified는 43.9%에서 20.6%로 내려갔습니다.

메타가 7월 9일 Muse Spark 1.1을 공개하며 유료 Meta Model API를 열었습니다. 출력 100만 토큰당 4.25달러로 Claude Opus 4.8의 약 6분의 1, GPT-5.5의 약 7분의 1입니다. 에이전트 점수는 앞섰고 코딩 점수는 뒤졌습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
@AIatMetaX 게시물 · 원문 보기
발표는 메타의 AI 공식 계정과 연구 블로그에 함께 올라왔습니다. 메타는 Glimmer를 늘 켜 두고 쓰는 로컬 에이전트용 모델로 소개했습니다. 맥이나 그래픽카드 한 장짜리 PC에서 돌아가게 만들었고, 쓰임새로는 로컬 에이전트와 함수 호출(모델이 정해진 형식으로 외부 도구를 부르는 기능), 로컬 코딩, 다른 모델의 답을 채점하는 심판 역할을 꼽았습니다. 텍스트와 이미지를 함께 받아 텍스트로 답하고, 한 번에 13만 1,072토큰까지 읽습니다.
마크 저커버그 CEO는 한국 시각 오후 7시 1분 X에 초지능을 모두가 쓸 수 있어야 한다는 장문의 글을 알렸고, 2분 뒤 Glimmer 소식을 올렸습니다. 로컬에서 돌아가는 30B 밀집형 모델의 가중치를 오늘 열고, 최신 기반 모델인 Muse Spark 1.2의 가중치도 곧 공개하겠다는 내용입니다. 메타는 오픈소스를 강하게 지지한다는 말도 덧붙였습니다.
@finkdX 게시물 · 원문 보기
메타는 8월 5일(미국 시각) 터미널 코딩 에이전트 Muse Code 베타와 새 모델 Muse Spark 1.2를 내놓았습니다. 둘 다 메타의 유료 개발자 서비스인 Meta Model API로만 쓸 수 있었고, 입력 요금은 100만 토큰당 1.25달러였습니다. 메타가 이 API로 요금을 받기 시작한 것은 7월 Spark 1.1부터이고, Muse Code 점수표를 어떻게 읽을지는 하네스 채점을 따진 글에 적었습니다.
5일 뒤 같은 회사가 30B 모델을 누구나 내려받게 했습니다. 알렉산더 왕 최고 AI 책임자는 이날 두 모델을 한 문장에 묶었습니다.
서로 아주 다른 두 모델이 모두 사람들의 손으로 갑니다. 앞으로 더 나옵니다.— 알렉산더 왕, 메타 최고 AI 책임자
@alexandr_wangX 게시물 · 원문 보기
왕이 말한 두 모델은 Glimmer와 Spark 1.2의 한 버전입니다. 저커버그는 1.2를 최신 기반 모델이라고 불렀고, 왕은 여기에 '한 버전'이라는 단서를 달았습니다. 어떤 버전을 어떤 라이선스로 여는지, 지금 API로 쓰는 1.2와 성능이 같은지는 이날 나오지 않았습니다.
왕은 7월 말 공개된 와이 컴비네이터 대담에서 Spark 1.1 다음으로 에이전트 개발 도구와 더 큰 모델, 오픈소스 라인업을 함께 준비하고 있다고 말했습니다. 도구는 8월 5일 Muse Code로, 오픈소스는 8월 10일 Glimmer로 나왔고, 더 큰 모델은 아직 나오지 않았습니다.
메타는 Llama로 누구나 자기 장비에 대형 언어 모델을 올려 돌리는 흐름을 만든 회사입니다. 그런데 2025년 4월 5일 나온 Llama 4가 성능 논란에 휩싸였고, 최상위 모델 Behemoth는 끝내 공개되지 않았습니다. 그해 12월에는 차세대 모델 Avocado가 폐쇄형으로 나올 가능성이 높다는 보도가 나왔고, 메타의 기초 연구 조직 FAIR를 세운 얀 르쿤도 회사를 떠났습니다. 올해 3월에는 Avocado가 추론과 코딩이 부족하다는 내부 평가를 받고 출시가 밀렸습니다.
4월 메타 슈퍼인텔리전스 랩(MSL)의 첫 모델 Muse Spark는 가중치 없이 나왔습니다. Glimmer는 MSL이 만든 모델 가운데 가중치가 공개된 첫 모델입니다. 저커버그는 같은 날 올린 6,500여 단어 글에 MSL이 본격적으로 돌아가기 시작했으니 일부 오픈소스 모델 공개를 곧 재개하겠다고 적었고, Glimmer가 그 약속의 첫 결과물입니다.
라이선스도 달라졌습니다. Llama 4는 메타가 따로 만든 커뮤니티 라이선스로 나왔습니다. 출시일 기준 월간 사용자가 7억 명을 넘는 서비스는 메타에 별도 허가를 받아야 했고, Llama로 만든 제품에는 'Built with Llama'를 표시하고, Llama로 학습시킨 모델 이름 앞에는 'Llama'를 붙여야 했습니다. Glimmer의 Apache 2.0에는 이런 조항이 없고, 비교 상대인 구글 Gemma 4 31B와 알리바바 Qwen 3.6 27B도 같은 Apache 2.0입니다.
| 모델 | 만든 곳 | 라이선스 |
|---|---|---|
| Llama 4 (2025년 4월) | 메타 | Llama 4 커뮤니티 라이선스, 월간 사용자 7억 명 초과 시 별도 허가 |
| Gemma 4 31B | 구글 | Apache 2.0 |
| Qwen 3.6 27B | 알리바바 | Apache 2.0 |
| Muse Glimmer 30B (2026년 8월) | 메타 | Apache 2.0 |
메타가 가중치를 닫아 둔 동안 미국 밖 연구소들은 반대로 움직였습니다. Glimmer 공개 직전 2주만 봐도 중국 연구소 세 곳이 가중치를 풀었거나 풀겠다고 발표했습니다.
| 날짜 | 회사 | 내용 |
|---|---|---|
| 7월 27일(미국 시각) | 문샷AI | Kimi K3 가중치 1.56TB와 기술 보고서, 커널·통신 라이브러리(MIT) 공개 |
| 7월 31일 | 딥시크 | V4-Flash 정식판(0731)을 MIT 라이선스로 공개 |
| 8월 3일 | 알리바바 | Qwen3.8-Max 출시, Max급 모델로는 처음으로 가중치 공개 예고 |
| 8월 10일 | 메타 | Muse Glimmer 30B, Apache 2.0 |
문샷이 모델과 함께 그 모델을 돌리는 도구까지 한꺼번에 푼 과정은 Kimi K3 공개를 정리한 글에, 알리바바가 Max급 가중치를 풀기로 한 배경은 Qwen3.8-Max 글에 적었습니다. 알리바바는 그때까지 Max급 모델을 자사 서비스와 API로만 냈고, 가중치는 한 등급 아래 모델에만 풀었습니다. Glimmer의 비교 상대인 Qwen 3.6 27B가 그렇게 나온 모델입니다.
메타 발표 2분 뒤, 허깅페이스의 벤 버틴쇼는 '메타가 돌아왔다'는 문장으로 시작하는 글을 올렸습니다. 허깅페이스가 첫날부터 Glimmer를 지원한다는 소식과 함께, Glimmer에게 도구를 쥐여 주고 자기 자신을 양자화하게 한 시연 영상을 붙였습니다.
@ben_burtenshawX 게시물 · 원문 보기
Glimmer는 처음부터 혼자 배우지 않았습니다. 메타의 폐쇄형 플래그십 Muse Spark가 낸 출력을 교재로 삼아 사전학습했고, 방식은 로짓 증류입니다. 언어 모델은 다음 단어를 고를 때 후보 단어마다 확률을 매깁니다. 로짓 증류는 교사 모델이 매긴 이 확률 분포 전체를 학생이 따라 하게 하는 방식입니다.
정답 단어 하나만 가르치면 교사가 두 번째로 그럴듯하다고 본 단어나, 거의 가능성이 없다고 본 단어에 대한 판단은 전해지지 않습니다. 분포를 통째로 옮기면 그런 판단까지 넘어가서, 같은 데이터로 처음부터 학습할 때보다 적은 계산으로 교사의 습관을 옮길 수 있습니다. 중간 학습에는 더 긴 맥락과 에이전트 작업 데이터, 추론 과정이 자세히 담긴 기록을 넣었습니다. 후속 학습은 지도 미세조정에 온폴리시 증류(학생이 스스로 만든 답을 교사가 채점해 고쳐 주는 방식)와 강화학습을 섞었습니다.
이 방식에서는 학생이 닿을 수 있는 성능을 교사가 정합니다. 7월 Spark 1.1은 도구 호출 평가 MCP Atlas에서 88.1점을 받았고, Glimmer는 공개 문항 기준 75.5점입니다. 두 점수를 같은 조건에서 쟀는지는 나와 있지 않지만, 숫자로는 교사 점수의 86% 수준입니다. 교사인 Muse Spark의 가중치는 이번에도 공개되지 않았습니다.
증류는 지금 미국 정치권이 다투는 기술이기도 합니다. 7월 백악관 과학기술정책실장은 문샷AI가 앤트로픽의 모델 Fable을 대규모로 증류했다고 공개 비판했고, 하루 뒤 재무장관이 제재 가능성을 꺼냈습니다. 증류를 입증할 자료는 공개되지 않았고, 그 과정은 증류 비판과 제재 언급이 이어진 이틀에 적었습니다.
저커버그는 Glimmer 소식 직전에 알린 글에서 증류를 해로운 것으로 몰아가려는 시도가 있지만, 관찰할 수 있는 것에서는 무엇이든 배울 수 있다는 원칙을 지켜야 한다고 썼습니다. 미국 연구소들이 학습 데이터에 관한 추가 제한을 지키느라 외국 연구소보다 불리하고, 외국 오픈소스 모델의 사용을 막는 것은 효과적인 해법이 못 된다고도 적었습니다. Glimmer 모델 카드의 첫 문단에는 이 모델을 Muse Spark에서 증류했다는 문장이 들어 있습니다.

증류로 잃는 것도 있습니다. 씽킹머신즈가 7월 30일 공개한 Inkling-Small은 교사보다 HLE 점수가 높았는데도, 사실 기억을 재는 SimpleQA는 43.9%에서 20.6%로 떨어졌습니다. 이 사례는 Inkling-Small 글에 정리했습니다. Glimmer의 공식 비교표 24개 항목에는 SimpleQA 같은 사실성 평가가 들어 있지 않습니다.
메타가 비교 상대로 고른 모델은 비슷한 크기의 오픈웨이트 모델 두 개입니다. 구글 Gemma 4 31B와 알리바바 Qwen 3.6 27B이고, 세 모델 모두 추론을 켠 설정에서 쟀습니다. 안전 항목 둘을 뺀 22개 가운데 Glimmer가 1위인 항목은 12개, Qwen은 8개, Gemma는 2개입니다.
| 평가 | 재는 것 | Glimmer | Gemma 4 31B | Qwen 3.6 27B |
|---|---|---|---|---|
| MCP Atlas | 도구 서버 20여 개로 질문 해결 | 75.5 | 54.2 | 62.5 |
| DeepSearch QA | 웹 검색 조사 | 74.6 | 61.7 | 71.1 |
| τ³-Banking | 은행 상담 여러 차례 대화 | 23.5 | 15.1 | 16.7 |
| SWE-Bench Pro | 실제 저장소 코딩 | 51.2 | 36.9 | 50.2 |
| AA-LCR | 긴 문서 여러 개로 추론 | 80.0 | 68.3 | 73.3 |
| OSWorld-Verified | 화면을 보고 컴퓨터 조작 | 65.9 | 58.5 | 75.6 |
| TerminalBench 2.1 | 터미널 작업 | 51.7 | 43.4 | 60.7 |
| GDPval-AA v2 | 44개 직업의 실무 결과물 | 953 | 811 | 1,141 |
| SWE-Bench Verified | 코딩 | 76.0 | 66.6 | 77.2 |
| GPQA Diamond | 대학원 수준 과학 | 83.5 | 85.7 | 84.2 |
차이가 가장 큰 곳은 도구 호출입니다. MCP Atlas는 깃허브와 노션 같은 MCP(모델이 외부 도구에 붙는 표준 규격) 도구 서버 20여 개를 써서 질문 500개에 답하는 평가이고, Glimmer는 Qwen보다 13점, Gemma보다 21점 높았습니다. 웹을 뒤지는 조사, 은행 상담처럼 여러 번 주고받는 업무, 실제 저장소의 버그를 고치는 SWE-Bench Pro에서도 앞섰습니다.
화면을 보고 마우스와 키보드로 컴퓨터를 다루는 OSWorld-Verified에서는 Qwen보다 9.7점 낮았습니다. 우분투 데스크톱을 스크린샷만 보고 조작하는 과제 361개입니다. 터미널 작업과 44개 직업의 실무 결과물을 만드는 GDPval, 화면 속 버튼 위치를 찾는 ScreenSpot Pro, 문서 해석에서도 Qwen이 앞섰습니다. 대학원 수준 과학 문제(GPQA)와 전문가도 풀기 어렵게 만든 문제 모음 HLE에서는 세 모델 가운데 점수가 가장 낮았습니다.
앞선 항목은 메타가 중간 학습에 몰아 넣었다고 밝힌 에이전트 데이터와 긴 맥락 쪽에 모여 있습니다. 표로만 보면 사내 시스템을 API나 MCP로 붙여 일을 맡기는 팀에는 Glimmer가, 사람이 쓰던 화면을 그대로 조작하게 하려는 팀에는 Qwen 3.6이 앞선 모델입니다.
숫자에는 조건이 붙어 있습니다. 메타는 방법론 문서에서 다른 두 모델의 점수로 각 회사가 발표한 값과 메타가 직접 돌린 값 가운데 더 높은 쪽을 적었다고 밝혔습니다. 에이전트 평가 상당수는 세 모델 모두 메타가 직접 돌렸고, 메타는 자기 평가 환경이 다른 회사 모델에 맞춰져 있지 않아 그 모델들의 최고 성능이 나오지 않았을 수 있다고 적었습니다. OSWorld에서는 Glimmer와 Qwen이 앤트로픽의 컴퓨터 조작 규격을, Gemma는 구글 제미나이의 규격을 썼습니다.
공식 표의 안전 항목에는 개인정보 평가가 하나 들어 있습니다. CIMemories는 사용자 한 명마다 재무와 건강, 인간관계 같은 속성 100여 개를 담은 가상 프로필을 만들고, 의사에게 연락하는 일처럼 일상적인 상황 2,500개에서 모델이 어떤 정보를 꺼내는지 봅니다. 같은 속성도 어떤 일에는 꼭 필요하고 어떤 일에는 드러내면 안 되기 때문에 점수가 둘입니다. 드러내면 안 되는 정보를 드러낸 비율이 위반율이고, 필요한 정보를 제대로 넘긴 비율이 커버리지입니다.
| 모델 | 위반율(낮을수록 좋음) | 커버리지(높을수록 좋음) |
|---|---|---|
| Gemma 4 31B | 12.1% | 53.0% |
| Muse Glimmer | 26.4% | 64.8% |
| Qwen 3.6 27B | 53.4% | 66.9% |
Glimmer의 위반율은 Gemma의 약 2.2배이고 Qwen의 절반 수준입니다. 세 모델을 커버리지 순서로 세우면 위반율도 같은 순서로 올라갑니다. 필요한 정보를 많이 꺼내는 모델일수록 꺼내지 말아야 할 정보도 함께 흘렸습니다.
프롬프트 인젝션(외부 문서나 웹페이지에 숨긴 지시로 에이전트를 조종하는 공격)을 재는 Siren AgentDojo도 비슷하게 나왔습니다. 은행, 여행 예약, 업무 관리, 온라인 상점 네 환경의 정상 과제 97개에 악성 과제 35개를 섞은 949개 상황에서, 앤트로픽의 Claude Opus 4.6이 공격자로 나서 최대 6번까지 공격을 다듬습니다. 공격 성공률은 Gemma 25.6%, Glimmer 28.4%, Qwen 40.3%였고, 공격을 받으면서도 사용자가 시킨 원래 일을 끝낸 비율은 Glimmer가 94.2%로 가장 높았습니다.
로컬 모델은 원문을 회사 서버로 보내지 않습니다. 저커버그도 같은 날 글에서 메타조차 내용을 보거나 넘겨줄 수 없는 개인 에이전트용 완전 비공개 모드를 만들겠다고 했습니다. 다만 CIMemories가 재는 것은 데이터가 저장되는 곳과 무관하게 에이전트가 남에게 무엇을 말하느냐입니다. 모델이 기기 안에서 돌아도, 사용자를 대신해 병원이나 거래처에 메일을 쓸 때 끼워 넣지 말아야 할 정보를 끼워 넣는 비율은 그대로 남습니다.
메타는 모델 카드에서 개인정보를 네 가지 위험 축 가운데 하나로 두고, 정보의 민감도를 알아보고 필요한 만큼만 쓰며 로컬에서 먼저 처리하는 원칙을 합성 학습 데이터로 가중치에 넣었다고 적었습니다. 동시에 Glimmer 하나만 단독으로 서비스하지 말고 추가 안전장치를 갖춘 AI 시스템의 일부로 쓰라고 권했고, 되돌릴 수 없는 행동 앞에는 사람의 확인을 넣으라고 했습니다.
파라미터 하나를 16비트(2바이트)로 저장하는 원래 정밀도 그대로라면 296억 개에 60GB 가까운 메모리가 듭니다. 메타는 55GB가 넘는다고 적었고 목표 장비를 VRAM 64GB로 잡았습니다. 메타 설명대로 어떤 소비자용 그래픽카드도 이만한 메모리를 갖고 있지 않습니다.
그래서 가중치를 약 4비트로 압축했습니다. 파라미터 하나에 0.5바이트 안팎을 쓰면 언어 모델 부분이 20GB 아래로 줄어듭니다. 모델을 돌릴 때는 대화 내용을 담아 두는 KV 캐시와 이미지를 읽는 비전 인코더, 뒤에 설명할 초안 모델이 함께 메모리에 올라가는데, 메타는 이 셋까지 합쳐 24GB나 32GB 안에 들어가도록 맞췄습니다.
압축에 따른 성능 저하는 32GB용이 0.2%, 24GB용이 1.0%입니다. 널리 쓰는 벤치마크 15개의 정확도를 평균한 값이고, 어떤 15개를 골랐는지는 공개되지 않았습니다. 평균 1% 저하가 작업마다 고르게 1%라는 보장도 없습니다.
속도는 추측 디코딩으로 끌어올렸습니다. 언어 모델은 보통 토큰을 하나씩 차례로 만듭니다. Glimmer에 딸린 DFlash 초안 모델은 토큰 16개 묶음을 한 번에 먼저 제안하고, 본 모델은 이를 한꺼번에 검증해 맞는 토큰은 받아들이고 틀린 곳부터 다시 만듭니다. 검증이 새로 만드는 것보다 싸기 때문에 결과물은 그대로 두고 속도만 올라갑니다.
RTX 5090에서는 초당 74.9토큰이 233.4토큰으로 3.1배 빨라졌습니다. 1,000토큰짜리 답을 받는 데 13초 걸리던 것이 4초로 줄어드는 속도입니다. 맥북 M5 Max는 26.6토큰에서 50.2토큰으로 1.8배, M4 Max는 23.7토큰에서 37.8토큰으로 1.5배 빨라져서, 같은 답에 M4 Max는 42초 걸리던 것이 26초가 됩니다. 그래픽카드는 llama.cpp로, 맥은 ExecuTorch로 쟀고 한 번에 요청 하나를 처리하는 조건입니다.
로컬 실행 도구들은 발표와 거의 동시에 움직였습니다. LM Studio의 허깅페이스 저장소는 메타 공식 계정이 발표 글을 올리기 7시간 반 전에, Unsloth 저장소는 1시간 전에 만들어졌습니다. Unsloth는 메타, 허깅페이스와 함께 llama.cpp용 실행 코드를 만들었다고 밝혔습니다. 메타 블로그는 Ollama와 llama.cpp, MLX, ExecuTorch용 최적화가 며칠 안에 나온다고 적었습니다.
LM Studio는 메타 발표 34분 뒤 앱에서 바로 받을 수 있다고 알리며, 자신들이 시험한 같은 체급 모델 가운데 가장 강하다고 적었습니다. Unsloth는 18GB 메모리면 돌아간다고 했고, 그날 밤 2비트판이 14GB 메모리에서 도구를 100번 넘게 부르며 저장소 하나의 버그를 5분 동안 쉬지 않고 추적하는 영상을 올렸습니다. 증거를 모으고, 버그를 재현하고, 고치고, 테스트하고, 풀리퀘스트 설명까지 쓴 작업입니다.
@UnslothAIX 게시물 · 원문 보기
첫날 나온 나머지 시연은 아래 표에 모았습니다. 사례 이름을 누르면 원본 게시물로 이동합니다.
| 사례 | 내용 | 올린 곳 |
|---|---|---|
| 로컬 네트워크의 스마트홈 대시보드 | Home Assistant를 찾아 기기 API를 읽고 대시보드를 만든 뒤 로컬 서버에 배포 | @AIatMeta |
| 자기 자신을 배포하기 | 허깅페이스 추론 엔드포인트에 자신을 올리고 추론 효율을 조정 | @jackwrae |
| LM Studio 지원 | 노트북 앱에서 내려받아 바로 실행 | @lmstudio |
| Unsloth GGUF 공개 | 18GB 메모리에서 실행, Unsloth로 추가 학습 지원 | @UnslothAI |
허깅페이스의 Glimmer 저장소는 이용 신청 없이 바로 내려받을 수 있습니다. Apache 2.0이라 회사 규모와 관계없이 상업 서비스에 넣을 수 있고, Llama 때처럼 월간 사용자 수를 따지거나 모델 이름 앞에 메타 모델명을 붙일 필요도 없습니다. 24GB 그래픽카드에는 1% 저하 판을, VRAM이 32GB인 RTX 5090에는 0.2% 저하 판을 올릴 수 있습니다.
한국어 성적은 따로 나와 있지 않습니다. 메타는 100개가 넘는 언어로 학습했다고만 밝혔고, 모델 카드에는 학습 데이터에 든 모든 언어를 평가하지는 않았으며 잘 지원하는 언어 밖에서는 성능이 떨어질 수 있다고 적혀 있습니다. 모델이 아는 정보는 2026년 1월 4일까지이고, 메타는 18세 미만이 내려받거나 쓰는 것을 상정하지 않았습니다.
개인정보나 영업비밀 때문에 외부 API로 보내지 못하던 문서를 사내 장비 한 대에서 에이전트에게 맡길 수 있는 크기입니다. 이때 로컬 실행은 데이터가 밖으로 나가느냐는 물음에 답하고, 위반율 26.4%와 공격 성공률 28.4%는 에이전트가 그 데이터로 무엇을 하느냐는 물음에 답합니다. 두 숫자는 발표 당일 공식 표에 함께 실려 있습니다.
저커버그는 글에서 수십억 명이 쓸 무료 버전을 내놓고, 연산을 더 쓰려는 사람에게는 수요에 따라 값이 움직이는 경매 방식을 두겠다고 했습니다. 같은 글에서 모델을 공개하는 안전 기준은 메타의 독립 이사회가 승인하고, 모델마다 그 기준을 지켰는지 이사회가 검토하게 하겠다고 밝혔습니다.
| 구분 | 모델 | 조건 |
|---|---|---|
| 무료 가중치 | Muse Glimmer 30B | Apache 2.0 |
| 유료 API | Muse Spark 1.2 | 입력 100만 토큰당 1.25달러, 맥락 100만 토큰 |
| 예고 | 개인 초지능 서비스 | 기본은 무료, 더 쓰는 연산은 경매 방식 가격 |
Spark 1.2 가중치에 대해 나온 말은 '곧'뿐입니다. 공개 날짜와 라이선스, 지금 API로 쓰는 1.2와 같은 모델인지가 정해지지 않았습니다. 모델 카드에 따르면 Glimmer는 Muse Spark보다 성능이 낮아 메타 내부 기준인 고급 AI 확장 프레임워크의 '프런티어 AI'에 해당하지 않았고, 왕은 Glimmer가 이 프레임워크로 평가받아 가중치 공개 승인을 받았다고 적었습니다. Spark 1.2는 Glimmer를 가르친 바로 그 Muse Spark 계열입니다.
30B 파생 모델을 푸는 일과 교사 모델을 푸는 일은 경쟁 상대가 다릅니다. Glimmer는 같은 체급의 Gemma, Qwen과 겨루고, Spark 1.2 가중치는 100만 토큰 맥락을 다루는 유료 API들과 겨루게 됩니다. Spark 1.2가 어떤 조건으로 나오는지 확인되면 다시 전하겠습니다.
읽어 주셔서 고맙습니다.
초이 드림