이 글 어땠어요?
결과가 나오면 맞았는지 그대로 적어요.
해자가 모델에서 제품 스택으로 옮겨간다
하네스와 평가, 강화학습 환경, 컨텍스트가 쌓이는 곳이 실제 자산이라는 주장입니다.
커머디티 시장에서 이기는 쪽은 생산 원가가 가장 낮은 곳이다
데이터와 모델, 하네스를 하나의 순환으로 묶어 성능을 계단식으로 끌어올리는 마이크로소프트의 학습 방식입니다. GitHub Copilot 하네스에서 후학습한 모델을 엑셀 강화학습 환경에서 다시 학습시킨 것이 첫 사례입니다.
GitHub Copilot에 들어간 MAI-Code-1-Flash는 토큰마다 실제로 계산에 쓰는 활성 파라미터가 50억 개입니다. 엑셀용 MAI는 최신 가속기 없이 H100과 A100급 GPU에서도 돌아갑니다.
완전히 빠지지는 않았습니다. 마이크로소프트 제품에서는 오픈AI와 앤트로픽 모델이 MAI와 함께 오케스트레이션에 섞여 돌고, MAI가 대등하거나 앞서는 작업부터 트래픽을 옮기고 있습니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
오픈AI가 7월 30일 GPT-5.6 Luna 가격을 100만 토큰당 입력 0.2달러, 출력 1.2달러로 80% 내렸습니다. B200 8장 노드를 1년 빌리는 약 60만 달러면 Luna 출력 토큰 약 5,022억 개를 삽니다.

GPT-5.6 Sol이 다시 쓴 커널로 종단 서빙 비용이 20% 줄고, 스스로 개선한 초안 모델로 토큰 생성 효율이 15% 넘게 올랐습니다. 하네스는 도구 출력을 기본 1만 토큰에서 자르고 기록을 뒤에만 덧붙여, 일반 입력의 10분의 1 가격인 캐시를 지킵니다.
마이크로소프트가 9월 25일 사람이 자는 동안에도 일하는 Copilot Autopilot을 발표했습니다. 머지 코드의 약 80%를 Claude가 쓰는 앤트로픽은 모든 승인을 근거와 함께 기록하고, 경보 대응 에이전트에게는 배포를 뺀 권한 3개만 줬습니다.

오픈AI가 7월 30일 GPT-5.6 Luna 가격을 100만 토큰당 입력 0.2달러, 출력 1.2달러로 80% 내렸습니다. B200 8장 노드를 1년 빌리는 약 60만 달러면 Luna 출력 토큰 약 5,022억 개를 삽니다.

GPT-5.6 Sol이 다시 쓴 커널로 종단 서빙 비용이 20% 줄고, 스스로 개선한 초안 모델로 토큰 생성 효율이 15% 넘게 올랐습니다. 하네스는 도구 출력을 기본 1만 토큰에서 자르고 기록을 뒤에만 덧붙여, 일반 입력의 10분의 1 가격인 캐시를 지킵니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
나델라의 출발점은 원가입니다. 예전 소프트웨어는 한 번 만들면 복제 비용이 거의 0이었습니다. AI는 요청 한 건마다 연산 비용이 붙고, 그는 이것을 소프트웨어에 처음 생긴 실질적인 한계비용이라고 불렀습니다. 그러니 프런티어 수준의 능력을 모든 사용자에게 퍼뜨리려면, 과제마다 맞는 모델을 골라 비용 대비 성과를 맞춰야 한다는 것이 글의 논지입니다.
이 전제를 건너뛰면 뒤의 결론이 모두 이상해 보입니다. 복제 비용이 0이던 시절에는 사용자가 늘수록 마진이 좋아졌습니다. 요청마다 값이 붙으면 이 관계가 거꾸로 돕니다. 많이 쓰는 고객일수록 원가가 커지고, 기능을 좋게 만들수록 원가가 올라갑니다. 제목의 확산은 프런티어 능력을 제품 곳곳에 퍼뜨리는 일이고, 통제는 그 원가를 마이크로소프트가 직접 쥐는 일입니다.
첫 번째 증거는 GitHub Copilot입니다. 마이크로소프트는 6월 2일 코딩 모델 MAI-Code-1-Flash를 공개했습니다. 토큰 하나를 만들 때 실제로 계산에 쓰는 활성 파라미터가 50억 개인 경량 모델이고, 마이크로소프트는 Claude Haiku와 비슷한 수준을 더 싸게 낸다고 소개했습니다. 다른 연구소 모델의 출력을 증류하지 않고 처음부터 학습했다는 설명도 붙였습니다.
6월부터 수백만 명의 개발자가 Copilot에서 이 모델을 썼고, 7월 23일 공개한 결과는 이렇습니다.
| 비교 항목 | MAI-Code-1-Flash의 결과 |
|---|---|
| VS Code 코드 수락률 | GPT-5.4 Mini, Claude Haiku 4.5보다 약 10% 높음 |
| 며칠에 걸친 재방문 | GPT-5.4 Mini보다 6%, Claude Haiku 4.5보다 11% 높음 |
| 토큰 사용량(중앙값) | 두 모델보다 10% 적음 |
수락률은 개발자가 모델이 제안한 코드를 받아들인 비율입니다. 수락률은 높고 토큰은 적었다는 조합을 저는 크게 봅니다. 보통은 한쪽을 내주고 다른 쪽을 얻는데, 둘이 함께 좋아졌다면 모델이 그 편집기에서 사람들이 무엇을 받아들이는지 익혔다는 이야기입니다. 범용 모델은 어떤 코드가 필요할지 모르는 상태에서 답하고, 제품 안에서 길러진 모델은 그 제품의 작업 방식을 알고 답합니다.
마이크로소프트는 이 방식을 힐클라이밍 기계라고 부릅니다. 6월 빌드에서 처음 소개한 구조로, 데이터와 모델, 하네스를 하나의 순환으로 묶어 성능을 계단식으로 끌어올립니다. 하네스는 모델에 도구와 지시를 붙여 실제 작업을 시키는 실행 틀입니다.
엑셀은 코딩에서 기른 능력이 다른 영역으로 옮겨 가는지 확인하는 시험대였습니다. 마이크로소프트는 Copilot 하네스 안에서 후학습한 MAI-Code-1-Flash를 출발점으로 삼아, 엑셀 강화학습 환경에서 스프레드시트 도구와 업무 흐름을 다시 가르쳤습니다.

모델은 프롬프트와 스프레드시트를 받아 행동을 정하고, 엑셀의 자바스크립트 도구인 OfficeJS로 실행해 시트를 고치고, 결과를 검토합니다. 끝난 결과는 채점기가 평가하고, 그 점수로 모델의 가중치가 갱신됩니다. 실제 사용자가 원하는 작업을 끝내면서 배우는 구조입니다.

공개된 그래프에서 코딩 단계의 체크포인트는 VS Code 기준 SWE-Bench Verified 통과율 72%까지 올라가고, 그 체크포인트에서 이어진 엑셀 단계는 엑셀 기본 벤치 통과율을 81%에서 86%로 끌어올립니다. 실제 사용 트래픽에서 받은 피드백으로는 엑셀에서 가장 자주 쓰는 작업에서 GPT-5.6과 대등하다는 것이 마이크로소프트의 판단입니다.
코딩에서 기른 능력이 스프레드시트로 넘어갔다는 점도 흥미롭습니다. 두 작업은 결과를 기계가 채점할 수 있다는 공통점이 있습니다. 코드는 돌거나 안 돌고, 수식은 맞거나 틀립니다. 채점할 수 있는 작업에서 먼저 능력이 자라고, 그 능력이 성격이 비슷한 작업으로 옮겨 가는 순서입니다.
나델라가 통제의 조건으로 못 박은 문장입니다. 이 조건을 지키려고 마이크로소프트는 하네스와 메모리, 맥락, 스킬을 전부 모델 바깥에 둡니다. 모델은 언제든 바꿀 수 있는 부품이 되고, 성능은 제품 쪽에 쌓입니다.
실제로 마이크로소프트 제품 안에서는 오픈AI와 앤트로픽 모델이 MAI와 함께 오케스트레이션에 섞여 돕니다. 오케스트레이션은 요청마다 어느 모델에 보낼지 정하는 배분 체계이고, 마이크로소프트는 MAI가 대등하거나 앞서는 작업부터 트래픽을 자사 모델로 넘기기 시작했습니다. 7월 초 블룸버그 보도로는 주당 수만 건의 엑셀과 아웃룩 요청이 이미 MAI로 넘어갔습니다.
이 조건을 설계로 옮기면 세 가지가 따라옵니다. 평가 세트를 제품이 소유합니다. 모델 회사가 주는 벤치마크 대신 우리 사용자가 실제로 받아들인 결과로 채점표를 만들어야 모델을 바꿀 때 비교할 수 있습니다. 맥락과 메모리를 모델 바깥에 둡니다. 대화 이력과 사용자 설정이 특정 모델의 기능 안에 들어가면 그 모델을 빼는 순간 기능도 같이 빠집니다. 도구 호출 규약도 제품이 정의합니다. 모델마다 다른 규약에 맞추면 교체할 때마다 비용이 새로 생깁니다.
같은 생각은 6주 전 나델라의 블로그 글에 먼저 나왔습니다. 6월 14일 올린 「생태계 없는 프런티어는 안정적이지 않다」에서 그는 모든 회사가 인적 자본과 함께 토큰 자본, 곧 회사가 직접 쌓고 소유하는 AI 역량을 길러야 한다고 적었습니다. 범용 모델을 바꿔 끼워도 학습 시스템에 쌓인 회사 베테랑의 전문성을 잃지 않는 것이 다가올 시대의 통제와 주권을 가르는 시험이라는 문장도 그 글에 있습니다.
업무 하나, 심지어 일자리 하나는 떠넘길 수 있어도 배움은 결코 떠넘길 수 없습니다.— 사티아 나델라, 6월 14일 블로그
그는 자체 평가 세트와 자체 강화학습 환경, 회사 기억을 조회할 수 있게 만든 지식 기반을 이 학습 순환의 부품으로 꼽았고, 이 순환을 힐클라이밍 기계라고 불렀습니다. 5주 뒤 엑셀과 Copilot에서 공개된 구조가 이 설명을 그대로 따릅니다.
같은 글에서 그는 소수의 모델이 모든 산업의 가치를 가져가는 세상은 정치경제가 받아들이지 않을 것이라고 경고했습니다. 세계화 초기에 외주화로 산업이 통째로 비었을 때 국내총생산 숫자는 괜찮아 보였지만 일자리를 잃은 충격은 컸다는 비유를 들며, 프런티어 모델만이 아닌 프런티어 생태계를 만들자고 했습니다. 플랫폼 위에서 만들어지는 가치가 플랫폼이 가져가는 가치보다 커야 한다는, 윈도와 애저를 팔아 온 회사다운 논리입니다.
엑셀용 MAI는 최신 가속기가 없어도 엔비디아 H100과 A100급 GPU에서 돌아갑니다. 마이크로소프트는 모델 비용 절감과 별도로 이 점이 배포 원가를 크게 낮춘다고 적었습니다. 성능은 대등하고 돌리는 값은 싼 조합입니다. 프런티어 연구소가 최고 성능을 두고 다투는 동안, 마이크로소프트는 같은 능력을 더 싸게 반복 생산하는 쪽을 택했습니다.
구형 가속기에서 돈다는 조건은 국내에서 더 크게 다가옵니다. 최신 가속기는 물량과 납기가 모두 빡빡해서 국내 기업은 순서를 기다려 받는 경우가 많습니다. 이미 들여놓은 장비에서 도는 모델을 만들 수 있으면 최신 장비를 급하게 살 이유가 줄고, 공급사와 가격과 납기를 두고 협상할 여지도 생깁니다.
이번 결과에는 앞선 발표가 있습니다. 6월 2일 무스타파 술레이만이 자체 개발한 MAI 모델 7종을 한꺼번에 공개했습니다. 추론 모델 MAI-Thinking-1은 블라인드 비교에서 Claude Sonnet 4.6보다 선호됐고, 모든 모델을 다른 연구소의 출력을 증류하지 않고 깨끗한 라이선스 데이터로 처음부터 학습했다고 밝혔습니다. 자체 칩 Maia 200과 함께 설계해 1.4배의 효율을 얻었고, 메이요 클리닉과 의료 모델도 함께 발표했습니다.
증류하지 않았다는 설명은 7월 들어 정치적인 의미까지 띠게 됐습니다. 미국에서 증류가 제재 사유로 거론되기 시작했기 때문입니다. 백악관 과학기술정책실장이 문샷AI의 증류를 공개 비판했고, 하루 뒤 재무장관이 제재와 거래 제한 명단을 언급했습니다. 그 과정은 증류 제재 논의를 다룬 글에 있습니다.
뒤에는 계약이 있습니다. 2025년 10월 마이크로소프트와 오픈AI가 관계를 재편하면서, 마이크로소프트는 독자적으로 AGI를 추구할 권리와 2032년까지의 기술 라이선스를 확보했습니다. 술레이만은 약 6개월 전 오픈AI 계약에서 풀려나 초지능을 추구할 수 있게 됐다고 말합니다.
나델라는 한때 한 파트너의 모델에 회사의 미래를 통째로 맡기는 이른바 제2의 IBM 시나리오를 걱정했다고 전해집니다. 2주 전 그는 기업들이 자기 학습 루프를 되찾아야 한다는 글도 썼는데, 그 내용은 역방향 정보 역설을 다룬 글에 정리했습니다. 엑셀과 Copilot의 사례는 그 처방을 마이크로소프트 자신에게 먼저 적용한 결과로 볼 수 있습니다.
국내에서 AI 기능을 붙인 SaaS의 다수는 모델 회사의 API를 받아 다시 파는 구조입니다. 이 구조에서는 마진을 앞단의 모델 회사가 정합니다. 모델 회사가 값을 올리면 원가가 오르고, 모델을 단종하면 기능이 사라집니다.
마이크로소프트의 방법을 옮기는 데 자체 모델부터 만들 필요는 없습니다. 제품 안에서 사용자가 무엇을 받아들이고 버리는지 기록하는 일, 그 기록으로 자기만의 평가 세트를 만드는 일, 모델을 바꿀 수 있게 하네스와 맥락을 바깥에 두는 일은 모델 학습 예산 없이 할 수 있습니다. 그다음이 오픈웨이트 모델을 자기 평가 위에서 미세조정하는 일이고, 전 영역에서 이길 필요 없이 가장 많이 쓰는 작업 몇 개에서만 대등하면 그 트래픽부터 옮기면 됩니다. 마이크로소프트가 밟은 순서도 이랬습니다.
자체 모델은 자본이 있는 회사의 이야기라는 반론은 모델을 처음부터 학습하는 경우라면 맞습니다. 다만 이번 사례에서 성능을 만든 것은 모델 규모보다 학습 환경이었습니다. 활성 파라미터 50억 개짜리 모델이 제품 안에서 길러졌고, 그런 제품 사용 기록은 국내 서비스도 이미 갖고 있습니다.
나델라가 깔아 둔 전제는 제품끼리 차이가 거의 없는 시장에서는 생산 원가가 가장 낮은 곳이 이긴다는 것입니다. 이 전제가 맞으면 프런티어 연구소는 최고 모델을 만들고도 마이크로소프트 오케스트레이션에 모델을 대는 부품 공급자가 될 수 있고, 가격은 오케스트레이션을 쥔 쪽이 정하게 됩니다.
반대 경우도 있습니다. 최고 모델과 나머지의 성능 차이가 다시 크게 벌어지면, 모델을 부품으로 다루던 쪽이 그 모델 없이는 제품을 못 만드는 상황으로 돌아갑니다. 지금의 구도는 자주 쓰는 작업에서는 프런티어 능력이 이미 포화됐다는 가정 위에 서 있습니다.
확인되지 않은 것도 있습니다. MAI가 대등하다는 판단은 마이크로소프트의 자체 평가와 사용자 피드백에 기댄 것이고, 바깥에서 같은 결과가 나오는지는 아직 확인되지 않았습니다. 마이크로소프트는 같은 방식을 Copilot Chat과 아웃룩, 파워포인트로 넓히는 중이라고 밝혔고, 그 속도가 다음에 볼 숫자입니다. 발표 원문은 마이크로소프트 AI의 힐클라이밍 글에 있습니다.
읽어 주셔서 고맙습니다.
초이 드림