이 글 어땠어요?
결과가 나오면 맞았는지 그대로 적어요.
코드 반출이 막힌 조직부터 클라우드 토큰 과금 대신 로컬 장비에서 오픈웨이트 코딩 모델을 돌리는 곳이 늘어난다
Laguna S 2.1의 NVFP4 체크포인트는 약 71GB로 128GB DGX Spark 한 대에서 초당 13~24토큰으로 돕니다. 칸트는 고객들이 첫날부터 가중치를 받아 인터넷과 끊긴 환경에 설치해 써 왔다고 말했습니다.
Poolside 모델 카드 기준으로 추측 디코딩 없이 초당 13~14토큰이 대역폭 한계이고, DFlash 보조 모델을 붙이면 글쓰기 15토큰, 코드 22~24토큰입니다. 올라마 4비트 파일로는 초당 약 12.6토큰이 나왔습니다.
OpenMDW-1.1은 지역이나 이용자 수 제한 없이 사용과 수정, 배포를 허락합니다. 배포할 때 라이선스 사본과 출처 표시를 남겨야 하고, 모델이 특허나 저작권을 침해한다며 소송을 걸면 권리가 끝납니다.
Laguna 점수는 Poolside 자체 하네스로 과제마다 3~4번 풀어 평균 낸 값이고, 경쟁 모델은 공개된 점수 가운데 가장 높은 값을 가져왔습니다. 대신 Poolside는 최종 평가의 시도 기록 전부를 공개해 누구나 다시 볼 수 있게 했습니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
씽킹머신즈랩이 7월 30일 Inkling의 4분의 1 크기인 Inkling-Small(276B, 활성 12B)을 공개했습니다. HLE 31.6%로 선생의 29.7%를 넘었지만 사실 질문 시험 SimpleQA Verified는 43.9%에서 20.6%로 내려갔습니다.

마이크로소프트가 10월 7일(미국 시각) 윈도 행사에서 에이전트 격리 장치 MXC를 정식 출시하고 메타 Muse의 윈도 앱을 예고했습니다. PC에서 돌린 코딩 작업은 토큰 160만 개를 쓰고도 크레딧이 들지 않았고, Surface Laptop Ultra는 10월 16일 나옵니다.
리플렉션 AI가 10월 5일(미국 시각) 첫 모델 Beam을 공개했습니다. GLM-5.2급 추론 점수를 3~4배 적은 연산으로 냈다고 밝혔지만, 자사 비교표에서도 GLM-5.3과 DeepSeek V4.1-Flash가 더 높습니다.

씽킹머신즈랩이 7월 30일 Inkling의 4분의 1 크기인 Inkling-Small(276B, 활성 12B)을 공개했습니다. HLE 31.6%로 선생의 29.7%를 넘었지만 사실 질문 시험 SimpleQA Verified는 43.9%에서 20.6%로 내려갔습니다.

마이크로소프트가 10월 7일(미국 시각) 윈도 행사에서 에이전트 격리 장치 MXC를 정식 출시하고 메타 Muse의 윈도 앱을 예고했습니다. PC에서 돌린 코딩 작업은 토큰 160만 개를 쓰고도 크레딧이 들지 않았고, Surface Laptop Ultra는 10월 16일 나옵니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
@poolsideaiX 게시물 · 원문 보기
Poolside는 공식 계정에서 Laguna S 2.1을 지금까지 만든 모델 가운데 가장 뛰어난 모델이라고 소개하고, 여러 배 큰 모델과 겨룰 만하면서도 DGX Spark 한 대에서 돌아갈 만큼 작다고 적었습니다. 생각 모드를 켜고 끌 수 있고, 가중치는 16비트 원본과 FP8, INT4, 엔비디아의 4비트 형식 NVFP4로 한꺼번에 나왔습니다. 발표문에는 공개한 모든 점수의 평가 기록을 한 건도 빼지 않고 내놓는다는 문장도 붙어 있었습니다.
Poolside는 깃허브 최고기술책임자(CTO)를 지낸 제이슨 워너와 에이소 칸트가 공동 CEO를 맡은 회사입니다. 2024년 10월 5억 달러를 투자받아 학습용 GPU를 1만 장 규모로 늘렸고, 모델 개발 과정을 자동화한 사내 플랫폼을 「모델 공장(Model Factory)」이라고 부릅니다. 발표문 마지막 절의 제목도 「3개월에 모델 셋」이었습니다.
| 공개일 | 모델 | 전체 / 활성 파라미터 |
|---|---|---|
| 4월 28일 | Laguna M.1, Laguna XS.2 | 225B / 23B, 33B / 3B |
| 7월 2일 | Laguna XS 2.1 | 33B / 3B |
| 7월 21일 | Laguna S 2.1 | 118B / 8B |
Laguna S 2.1은 5월 22일 엔비디아 H200 GPU 4,096장으로 사전학습을 시작해 60일 만에 공개됐습니다. 사전학습 데이터는 7월 초 낸 XS 2.1과 똑같았고, 달라진 것은 모델 크기와 학습 코드 수정, 작은 방법 변경이었다고 Poolside는 밝혔습니다. 강화학습을 FP8 정밀도로 돌려 속도를 낸 것도 이 모델이 처음입니다.
XS 계열과 벌어진 차이 대부분은 후속학습에서 나왔습니다. 합성 데이터를 일부 섞은 지도학습 뒤에 강화학습을 붙였고, 학습 환경 40만 9,000개 가운데 터미널 작업이 8만 3,000개, 일반 소프트웨어 개발 작업이 16만 8,000개였습니다. 가장 큰 재료는 실제 커밋을 재현한 과제로, 저장소 약 1만 7,000곳에서 과제 약 3만 8,000개를 뽑았습니다.
Terminal-Bench 2.1은 에이전트를 터미널 하나로 환경에 연결해 두고 긴 작업을 끝까지 해내는지 재는 시험입니다. Poolside가 낸 비교표에서 Laguna S 2.1은 전체 파라미터가 2.5배인 텐센트 Hy3 바로 아래, 1.6조짜리 딥시크 V4-Pro-Max와 975B짜리 Inkling 위에 있습니다. 2.8조짜리 Kimi K3와 폐쇄형 Claude Fable 5는 88%대로 한참 앞섭니다.
| 모델 | 전체 / 활성 | Terminal-Bench 2.1 | SWE-Bench Pro |
|---|---|---|---|
| Kimi K3 | 2.8T / 50B | 88.3% | - |
| Claude Fable 5 | 비공개 | 88.0% | 80.3% |
| 텐센트 Hy3 | 295B / 21B | 71.7% | 57.9% |
| Laguna S 2.1 | 118B / 8B | 70.2% | 59.4% |
| 딥시크 V4-Pro-Max | 1.6T / 49B | 64.0% | 55.4% |
| Inkling | 975B / 41B | 63.8% | 54.3% |
| Nemotron 3 Ultra | 550B / 55B | 56.4% | - |
출처: Poolside 발표문(7월 21일). 경쟁 모델은 자체 발표치와 벤치마크 순위표, 아티피셜애널리시스 측정 가운데 가장 높은 값입니다.
표 아래에는 조건이 적혀 있습니다. Laguna의 점수는 Poolside의 자체 에이전트 하네스(모델에 도구와 지시를 붙여 일을 시키는 실행 틀) pool에서 생각 모드를 켜고 과제마다 네 번씩 풀어 평균 낸 값이고, 한 과제에 최대 500단계, Terminal-Bench 2.1에는 5시간까지 시간을 줬습니다. 하네스가 점수를 얼마나 움직이는지는 이달 초 서울 코덱스 밋업에서 나온 수치가 보여 줍니다. 같은 GPT-5.5가 코덱스 CLI에서는 Terminal-Bench 2.1 83.4%, 공용 하네스에서는 78.2%였습니다.
Poolside가 따로 절을 두고 설명한 시험은 DeepSWE입니다. 데이터 회사 Datacurve가 만든 이 시험은 저장소 91곳에서 뽑은 원본 과제 113개로 긴 개발 작업을 시키고, 과제가 길어 일부만 풀어서는 점수를 받기 어렵습니다. Terminal-Bench처럼 상위권이 70~90%대에 몰린 시험과 달리 점수가 넓게 퍼져, 프런티어 모델도 54~73%에 머물고 1조 파라미터가 넘는 일부 오픈 모델은 10% 아래로 떨어집니다.
| 모델 | 전체 / 활성 | DeepSWE v1.1 |
|---|---|---|
| GPT-5.6 Sol | 비공개 | 73.0% |
| Claude Fable 5 | 비공개 | 70.0% |
| Kimi K3 | 2.8T / 50B | 69.0% |
| GLM 5.2 | 753B / 40B | 44.0% |
| Laguna S 2.1 | 118B / 8B | 40.4% |
| 딥시크 V4-Pro-Max | 1.6T / 49B | 9.0% |
Laguna S 2.1은 전체 파라미터가 6배 넘는 GLM 5.2와 3.6%포인트 차이였고, 딥시크 V4-Pro-Max의 4.5배를 받았습니다. 이 표에도 조건이 있습니다. DeepSWE 공식 순위표는 mini-swe-agent라는 공용 하네스로 재는데, Laguna 점수는 Poolside 하네스에서 과제마다 세 번씩, 최대 6시간을 주고 잰 값입니다. Poolside는 여러 모델이 자기 하네스보다 mini-swe-agent에서 같거나 더 높은 점수를 낸다는 보고가 있어 이 차이가 자기들에게 특별히 유리하지 않다고 적었습니다.
Poolside는 발표한 모든 점수에 대해 최종 평가의 시도 기록 전부를 trajectories.poolside.ai에 올렸습니다. 모델이 과제마다 어떤 명령을 치고 무엇을 고쳤는지 누구나 내려받아 다시 볼 수 있습니다.
평가 과정의 실패도 적었습니다. Poolside의 평가는 따로 밝히지 않으면 인터넷에 연결된 채 돌아가는데, 사람이 표시한 사례로 보정한 AI 채점기로 과제를 풀지 않고 점수만 얻는 보상 해킹을 가려 왔습니다. 후속학습 초반에는 그 비율이 2% 아래였지만, 학습이 진행되자 SWE-bench 계열 과제에서 기록의 50% 넘게 보상 해킹으로 표시됐습니다. 직접 열어 보니 모델이 인터넷에서 과제의 원본 풀리퀘스트나 저장소를 찾아 수정 내용을 그대로 적용한 경우였습니다.
Poolside는 온라인에서 찾은 해답을 그대로 쓰지 말라는 짧은 문장을 지시에 덧붙였고, 보상 해킹 비율은 다시 2% 아래로 내려갔다고 밝혔습니다. ProgramBench와 MirrorCode 두 시험은 예외였다고 함께 적었습니다. 같은 날 영국 AI보안연구소도 사이버 평가에서 모델 5개가 모두 부정행위를 시도했다는 결과를 내놓았습니다.
발표문에서 가장 길게 쓴 대목은 점수 밖에 있습니다. 응용연구 공동책임자 왕펑밍은 이번 모델에서 달라진 것을 이렇게 요약했습니다.
이번 모델에서 우리가 고친 것은 더 많이 검증하고, 당연하게 여기지 않고, 일찍 승리를 선언하지 않고, 더 끈질기게 붙드는 행동입니다.— 왕펑밍, Poolside 응용연구 공동책임자
Poolside는 이 끈질김이 어디서 왔는지 학습 과정의 변화로 설명했습니다. 강화학습에서 과제마다 시간 제한을 크게 늘리고 한 차례에 쓰는 토큰과 과제당 차례 수도 이전 어느 모델보다 많이 줬고, 같은 과제를 여러 하네스에서 돌려 한 하네스에만 맞춰지지 않게 했습니다. 이전 Laguna 모델은 테스트가 일부만 통과해도 끝났다고 선언하거나 두 단계만 더 가면 될 방법을 버렸다고 발표문은 적었습니다.
작업 기록 세 건도 편집 없이 공개했습니다. 가장 긴 설명이 붙은 기록은 빈 폴더에서 HTML·CSS 렌더링 엔진을 만드는 일로, 사람 개입 없이 50분 동안 181단계를 거쳐 파서부터 레이아웃, 캔버스 렌더러까지 짰습니다. 화면을 볼 수 없는 모델이라 헤드리스 크로미움을 띄워 실제 브라우저 결과와 자기 결과를 숫자로 비교하며 검증했습니다.

Poolside 자체 하네스의 성능을 끌어올린 기록도 있습니다. 약 69만 토큰을 쓰는 자동 반복 작업에서 스무 번 시도했고, 아홉 번째 시도가 실행 시간을 5.19% 줄이고 메모리 할당을 71.1% 줄였습니다. 수학에서는 1975년 에르되시와 그레이엄 등이 낸 397번 문제의 해를 68분 만에 찾았습니다. 이 문제는 올해 1월 GPT-5.2 Pro가 먼저 풀었고, Poolside는 지식 마감이 2025년 11월인 모델이 기존 6개 지수 해법과 다른 8개 지수 해법을 찾아 독자적으로 다시 발견했다고 설명했습니다.
외부 시연도 공개 당일 올라왔습니다. Poolside가 발표문에서 로컬 실행 경로로 소개한 앱 atomic.chat은 스스로 플레이하는 아케이드 게임 세 개를 만들게 해 Laguna S 2.1을 GLM-5.2, Hy3와 비교했습니다. 출력 토큰은 Laguna 1만 300개, GLM-5.2 2만 6,400개, Hy3 1만 400개였고, 비교한 셋 가운데 128GB 맥북에서 돌아가는 모델은 Laguna뿐이었다고 적었습니다.
@atomic_chat_hqX 게시물 · 원문 보기
Laguna S 2.1의 생각 모드는 끄기와 최대 두 가지뿐입니다. 최대로 켜면 모델이 문제에 맞춰 생각할 양을 스스로 정하고, Poolside는 몇 시간 동안 수십만 토큰에 걸쳐 생각이 이어지는 경우도 봤다고 밝혔습니다.
| 시험 | 생각 끔 | 생각 켬 |
|---|---|---|
| Terminal-Bench 2.1 | 60.4% (평균 약 8만 토큰) | 70.2% (평균 약 12만 9,000토큰) |
| DeepSWE | 16.5% (평균 약 9만 9,000토큰) | 40.4% (평균 약 24만 9,000토큰) |
토큰 수는 과제 하나를 푸는 데 모델이 만든 평균 출력 토큰입니다(출처: Poolside).
DeepSWE 점수가 2.4배가 되는 동안 과제당 출력 토큰도 2.5배로 늘었습니다. 같은 날 구글은 제미나이 3.6 Flash가 DeepSWE 과제당 출력 토큰을 9만 7,000개로 줄였다고 밝혔습니다. 토큰당 가격이 싸도 과제 하나에 쓰는 토큰이 많으면 과제당 비용은 따로 계산됩니다.
Poolside가 밝힌 한계도 생각 모드와 관련이 있습니다. 특히 경시대회 수학에서 너무 오래 생각하는 경향이 있고, 끄기와 최대 사이의 중간 단계는 아직 없어 다음 버전의 첫 과제로 잡았다고 했습니다. 외부 하네스에서는 도구 정의를 읽지 않고 기억 속 사용법대로 처음 호출하는 경우가 있고, JSON 배열을 받는 도구 인자를 잘못 이스케이프하는 경우도 있다고 적었습니다.
DGX Spark는 엔비디아가 2025년 10월 내놓은 책상용 AI 컴퓨터로, CPU와 GPU가 128GB LPDDR5x 메모리를 함께 쓰고 메모리 대역폭은 초당 273GB입니다. 출시 당시 엔비디아 온라인 스토어 가격은 3,999달러였습니다. 서버 GPU보다 대역폭이 좁아서, 답을 한 토큰씩 만들 때마다 모델 가중치를 메모리에서 읽어 오는 속도가 곧 생성 속도를 정합니다.
그래서 이 장비에서는 토큰마다 읽는 양이 속도를 좌우합니다. LMSYS가 같은 장비에서 잰 결과를 보면 모든 가중치를 매번 읽는 밀집 모델 Llama 3.1 70B(FP8)는 초당 2.7토큰을 만들었습니다. Laguna S 2.1은 전체 118B 가운데 토큰마다 약 8.5B만 읽고, NVFP4 체크포인트는 약 71GB라 128GB 메모리에 올리고도 대화 기록을 담을 공간이 남습니다.
Poolside가 모델 카드에 적은 실측치는 이렇습니다. 올라마로 4비트 GGUF(약 75GB)를 돌리면 DGX Spark에서 초당 약 12.6토큰, 애플 실리콘 맥에서 17.6토큰이 나왔습니다. vLLM으로 NVFP4를 돌리면 추측 디코딩(작은 보조 모델이 다음 토큰 여러 개를 미리 짐작하고 큰 모델이 한꺼번에 검증하는 방식) 없이는 어느 엔진에서도 초당 13~14토큰으로 대역폭 한계에 걸렸고, DFlash 보조 모델을 붙이면 글쓰기에서 15토큰, 코드에서 22~24토큰까지 올라갔습니다.
공개 당일 직접 돌려 본 개발자들의 숫자도 올라왔습니다. 한 개발자는 DGX Spark 한 대에서 요청 하나일 때 초당 19토큰, 요청 8개를 동시에 넣으면 합계 초당 84토큰이 나왔다고 설치법과 함께 공개했고, vLLM 0.25보다 낮은 버전에서는 도구를 부를 때 알아볼 수 없는 출력이 나온다고 적었습니다. LMSYS는 이 장비에서 도는 큰 모델을 실서비스보다 시제품과 실험에 맞는 용도로 평가했습니다.
로컬 실행이 의미를 갖는 곳은 코드를 밖으로 내보낼 수 없는 조직입니다. 칸트는 공개 당일 X 라이브 방송 MTS 인터뷰에서 고객들이 첫날부터 가중치를 받아 자체 환경, 때로는 인터넷과 완전히 끊긴 환경에 설치해 써 왔다고 말했습니다. 저는 128GB 장비 한 대에서 실무에 쓸 만한 코딩 모델이 도는 조건이 갖춰진 만큼, 코드 반출이 막힌 국내 금융·공공 개발 조직부터 토큰 과금 대신 장비 구매를 계산에 넣는 곳이 늘어날 것으로 봅니다.
클라우드로 쓰는 값은 낮게 잡혔습니다. OpenRouter에는 컨텍스트 25만 6,000토큰짜리 무료 창구와 100만 토큰을 다 쓰는 유료 창구가 함께 열렸고, 유료 가격은 100만 토큰당 입력 0.10달러, 출력 0.20달러, 캐시 읽기 0.01달러입니다. 공개 당일 Nous Research는 2주 동안, OpenCode와 Kilo Code, Vercel은 한동안 무료로 열었습니다.
사용량은 예상을 넘었습니다. 칸트는 공개 당일 밤(미국 시각) X에 요청 한도 초과(429) 오류를 사과하며, 계획했던 최대치의 10배 부하가 몰렸다고 적었습니다.
라이선스 OpenMDW-1.1은 리눅스재단과 파이토치재단이 2025년 머신러닝 모델용으로 내놓은 허용형 라이선스입니다. 저작권과 특허, 데이터베이스, 영업비밀에 걸친 권리를 제한 없이 허락하고, 배포할 때 라이선스 사본과 출처 표시를 남기라는 조건과, 모델이 특허나 저작권을 침해한다며 소송을 걸면 권리가 끝난다는 조항을 둡니다. 모델이 만든 결과물에는 아무 제한을 걸지 않습니다.
지역이나 이용자 수를 따지는 조항이 없어서 국내 기업도 내려받아 고치고 제품에 넣을 수 있습니다. 모델 카드는 Poolside의 이용 정책에 맞게 쓰고, 비슷한 수준의 대책 없이 안전장치를 우회하지 말라고 권했습니다. 4월 XS.2는 Apache 2.0이었고, 후속학습 전 가중치(베이스 모델)는 이메일로 요청하면 받을 수 있습니다.
칸트는 공개에 맞춰 X에 긴 글을 올렸습니다. 모델 소개에 이어 그는 2030년이면 경제적으로 가치 있고 과학적으로 흥미롭고 개인적으로 의미 있는 모든 것이 서너 회사에서 빌려 쓰는 지능 위에 세워진다는 책을 5년 전에 읽었다면 디스토피아 SF라고 불렀을 것이라고 썼습니다.
@eisokantX 게시물 · 원문 보기
칸트는 같은 글에서 오픈 생태계는 자기 분야 1등으로는 이길 수 없고, 폐쇄형 모델과 같거나 더 좋아야 한다고 썼습니다. 워너는 누구나 프런티어에서 조금 떨어진 진짜 오픈 AI를 미국 회사에서 얻게 됐다고 적었고, 칸트는 MTS 인터뷰에서 파운데이션 모델 회사가 네다섯 곳에 그치지 않고 50~100곳이 되는 세상을 원한다고 말했습니다.
그 주 오픈웨이트 순위의 앞쪽은 중국 모델 차지였습니다. 7월 15일 아티피셜애널리시스 순위에서 오픈웨이트 상위 다섯 모델은 모두 중국 모델이었고, 다음 날 문샷AI는 2.8조 파라미터 Kimi K3를 공개하며 가중치를 7월 27일까지 풀겠다고 했습니다. 이달 초 텐센트는 한국을 빼던 조항을 지우고 Hy3를 Apache 2.0으로 바꿨습니다. 미국에서는 중국 오픈웨이트 모델 규제를 두고 딘 볼과 데이비드 색스가 맞섰고, 스탠퍼드 AI 인덱스 2026은 미국과 중국 최고 모델의 차이를 2.7%로 집계했습니다.
엔비디아도 이 모델에 이름을 올렸습니다. Poolside는 엔비디아가 서버용 TRT-LLM과 블랙웰용 NVFP4부터 DGX Spark 한 대까지 추론 최적화를 도왔다고 밝혔고, 엔비디아는 발표 몇 분 뒤 공식 계정에 축하 글을 올리며 자사 NeMo로 모델을 고쳐 쓰라고 안내했습니다. 사전학습도 엔비디아 H200 4,096장에서 돌았습니다.
Poolside는 더 큰 다음 Laguna가 발표 전주에 사전학습에 들어갔다고 밝혔습니다. 칸트는 MTS 인터뷰에서 다음 모델이 Laguna S의 몇 배 크기로 이 회사의 가장 큰 모델이 되고, 연산 활용률 99.2%로 학습 중이라고 말했습니다. 이번처럼 사전학습 시작부터 60일이 걸린다면 9월 중순이 되고, 모델이 커진 만큼 기간이 늘면 그 뒤가 됩니다.
Poolside는 다음 버전에 생각 강도의 중간 단계를 가장 먼저 넣겠다고 밝혔습니다. 새 Laguna가 나오면 공식 순위표의 점수와 평가 기록을 함께 전하겠습니다.
읽어 주셔서 고맙습니다.
초이 드림