이 글 어땠어요?
결과가 나오면 맞았는지 그대로 적어요.
오픈웨이트 자체 구축의 약점은 성능보다 장비 상각 기간에서 먼저 드러난다
3년 상각을 전제로 산 GPU의 토큰 단가가 상각 도중 API 가격 밑으로 밀리는지로 판정합니다.
값을 내리는 회사와 그 값을 업무 흐름에 얹는 회사가 같아야 인하가 매출로 돌아온다
오픈AI는 이번 인하를 Codex와 ChatGPT Work의 사용량 계산에도 반영했습니다.
100만 토큰당 Luna는 입력 1달러·출력 6달러에서 0.2달러·1.2달러로 80%, Terra는 2.5달러·15달러에서 2달러·12달러로 20% 내렸습니다. Sol은 5달러·30달러 그대로이고, 최대 2.5배 빠른 Fast 모드를 2배 값에 붙였습니다.
모델 크기에 따라 다릅니다. gpt-oss-120b는 80GB GPU 한 장, Solar Open 2는 H200 네 장이면 되지만 Kimi K3는 가속기 64장 이상이 권장됩니다. 7월 27일 코어위브 가격표로 B200 8장 노드는 시간당 68.80달러, 1년이면 약 60만 3,000달러이고, 인건비와 네트워크 비용은 따로 듭니다.
있습니다. 데이터를 사내망 밖으로 보내지 않고, 모델 버전을 스스로 정하고, 직접 추가 학습할 수 있습니다. 규정이나 보안이 이유라면 이번 인하와 상관없이 유효하고, 비용이 이유라면 Luna의 입력 0.2달러·출력 1.2달러와 다시 비교할 일입니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
엔비디아가 허깅페이스를 129억 달러에 인수하기로 합의했다고 디인포메이션이 8월 26일(미국 시각) 보도했습니다. 연환산 매출 1억 5,000만 달러의 약 86배이고, 같은 날 엔비디아는 분기 데이터센터 매출 890억 달러를 발표했습니다.

딥시크가 7월 31일 V4-Flash 정식판을 API와 MIT 가중치로 공개했습니다. 코딩 에이전트 평가 DeepSWE가 7.3에서 54.4로 올랐고, 요금은 100만 토큰당 출력 0.28달러 그대로입니다. 무엇을 더 학습시켰는지는 밝히지 않았습니다.
Epoch AI 측정으로 같은 성능을 내는 최저 API 가격은 해마다 중앙값 50배씩 떨어졌고, 게임용 GPU 한 장이 6~12개월 전 최전선 모델을 돌립니다. 오픈 웨이트는 2026년 들어 폐쇄형을 평균 4개월 차로 따라갑니다.

엔비디아가 허깅페이스를 129억 달러에 인수하기로 합의했다고 디인포메이션이 8월 26일(미국 시각) 보도했습니다. 연환산 매출 1억 5,000만 달러의 약 86배이고, 같은 날 엔비디아는 분기 데이터센터 매출 890억 달러를 발표했습니다.

딥시크가 7월 31일 V4-Flash 정식판을 API와 MIT 가중치로 공개했습니다. 코딩 에이전트 평가 DeepSWE가 7.3에서 54.4로 올랐고, 요금은 100만 토큰당 출력 0.28달러 그대로입니다. 무엇을 더 학습시켰는지는 밝히지 않았습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
@OpenAIX 게시물 · 원문 보기
오픈AI는 한국 시각 7월 31일 새벽 2시 17분 공식 계정에 비용 효율과 능력, 속도 세 방향에서 모델의 한계를 넓히겠다며 인하 소식을 올렸습니다. 발표문에 따르면 Luna와 Terra의 낮아진 가격은 Codex와 ChatGPT Work에서 사용량을 셀 때도 그대로 반영됩니다. 구독료와 사용 한도는 그대로 두고 두 모델이 차감하는 크레딧만 줄였고, 기존의 우선 처리 옵션은 Fast 모드로 대체했습니다.
인하 폭은 오픈AI 개발자 문서에 올라 있는 API 가격표의 보관본으로 확인할 수 있습니다. 인하 전후를 맞춰 보면 이렇습니다.
| 모델(100만 토큰당) | 인하 전 입력 | 인하 전 출력 | 인하 후 입력 | 인하 후 출력 |
|---|---|---|---|---|
| GPT-5.6 Luna | 1.00달러 | 6.00달러 | 0.20달러 | 1.20달러 |
| GPT-5.6 Terra | 2.50달러 | 15.00달러 | 2.00달러 | 12.00달러 |
| GPT-5.6 Sol | 5.00달러 | 30.00달러 | 5.00달러 | 30.00달러 |
인하 전은 7월 16일, 인하 후는 8월 1일 보관본의 표준 문맥 가격입니다. Luna와 Sol의 차이는 입력과 출력 모두 25배로 벌어졌고, Luna는 한 세대 전 소형 모델 GPT-5.4 mini(입력 0.75달러, 출력 4.5달러)보다도 싸졌습니다. 캐시에서 다시 읽는 Luna의 입력은 100만 토큰당 0.02달러입니다. 샘 올트먼 CEO는 10분 뒤 인하 내용을 다시 올리며, 모든 수준에서 가격 대비 지능이 가장 좋은 선택지를 내놓고 싶다고 덧붙였습니다.
@samaX 게시물 · 원문 보기
오픈AI는 발표문에서 Luna가 1년 전 프런티어급 모델과 비슷한 성능을 작업당 비용 약 6%, 속도 9배 가까이로 낸다고 적었습니다. 전문 업무를 재는 Agents' Last Exam에서는 Luna가 앤트로픽의 Fable 5를 앞서면서 작업당 추정 비용이 99% 가까이 낮다고도 밝혔는데, 둘 다 오픈AI가 직접 잰 값입니다. 발표문에 실린 고객사 발언 가운데 코드 생성 회사 Blitzy는 Luna가 GPT-5.4 mini보다 87% 싸게 같은 일을 하고 프롬프트 캐시 재사용률을 24%에서 90%로 올렸다고 했습니다.
오픈AI는 이번 인하를 하루 전 공개한 효율 개선의 결과로 설명했습니다. 사람이 이끄는 절차 안에서 GPT-5.6 Sol이 실제 서비스용 GPU 커널(모델 연산을 GPU에서 실행하는 코드)을 다시 쓰고 최적화해 모델 서빙의 전체 비용을 20% 줄였고, 토큰 생성 실험 수백 개를 설계하고 돌려 생성 효율을 15% 넘게 올렸다는 내용입니다. 그 과정은 GPT-5.6이 자기 GPU 코드를 고친 과정에 정리했습니다.
발표문은 이 개선이 계속 이어진다고 적었습니다. 모델이 좋아지고 스스로 일하는 폭이 넓어질수록 효율을 찾는 속도도 빨라진다는 설명입니다. GPT-5.6이 나온 7월 9일부터 인하까지는 3주였고, 그사이 새 모델이나 새 칩 없이 이미 배포된 모델이 고친 서빙 코드가 인하의 근거로 제시됐습니다.
7월 24일 공개된 「오픈웨이트와 미국의 AI 리더십」 서한은 스타트업과 기업, 대학이 모델을 처음부터 학습하거나 모든 작업에 프런티어 모델 값을 치르지 않고 첨단 모델 위에서 일할 수 있어야 한다고 적었습니다. 프런티어급 능력은 진짜 프런티어 문제에 남겨 두고, 나머지 일에는 효율적인 특화 모델을 쓰게 하는 것이 오픈웨이트의 역할이라는 논리입니다. 오픈AI도 7월 25일(한국 시각) 이 서한에 이름을 올렸고, 명단이 불어난 과정은 서명사가 이틀 만에 50곳으로 늘어난 과정에 정리했습니다.
6일 뒤 오픈AI 발표문의 첫 소제목은 「결과에 맞는 지능」이었습니다. 코딩 작업이라면 불확실한 부분을 풀고 계획을 세우는 일은 Sol에 맡기고, 정해진 변경을 구현하고 테스트를 쓰고 돌리는 일은 Luna에 맡기는 식으로 단계마다 모델을 고르라는 설명입니다. 대규모 문서 분석과 고객 응대 분류, 반복적인 구현을 넓게 돌려도 수지가 맞게 됐다는 문장도 있습니다. 서한과 발표문은 같은 분업을 그렸고, 프런티어 밖의 일을 서한은 오픈웨이트로, 오픈AI는 값을 내린 자사 모델로 채우겠다는 차이가 있습니다.
오픈웨이트 모델을 쓴다고 꼭 직접 돌리는 것은 아닙니다. 공개 모델 가운데 처음 매개변수 2조 8,000억 개에 닿은 Kimi K3를 만든 문샷AI는 자사 API를 100만 토큰당 입력 3달러, 출력 15달러에 팝니다. 인하된 Luna는 입력이 15분의 1, 출력이 12.5분의 1입니다.
두 모델의 체급은 같지 않습니다. Artificial Analysis 지능 지수에서 K3는 57점으로 Opus 4.8, GPT-5.5와 비슷했습니다. 오픈AI가 인하 발표와 함께 같은 지수로 그려 올린 그림을 보면 Luna는 51점 안팎을 작업당 5센트 남짓에 냈고, 비슷한 점수의 오픈웨이트 모델 GLM-5.2(Max 설정)는 작업당 20센트대였습니다.

비교 대상은 오픈AI가 골랐고, 세로축은 Artificial Analysis의 지능 지수입니다. 문샷은 코딩 작업에서 캐시 적중률이 90%를 넘는다고 밝혔는데, 캐시에서 읽는 K3 입력은 100만 토큰당 0.3달러라 실제 입력 단가는 표시 가격보다 낮아집니다. 7월 27일(미국 시각)에는 문샷이 첫날 파트너로 소개한 파이어웍스AI와 베이스텐, 투게더AI, 네비우스 등이 K3를 자사 서비스에 올렸습니다.
다리오 아모데이 앤트로픽 CEO는 7월 27일 올린 입장문에서 앤트로픽이 오픈웨이트 모델 금지를 주장한 적이 한 번도 없다고 밝혔습니다. 그리고 이렇게 적었습니다.
위험한 능력이 없는 오픈웨이트 모델은 공공재입니다. 그 모델을 돌리는 데 드는 연산 말고는 비용이 들지 않습니다.— 다리오 아모데이, 앤트로픽 CEO (7월 27일 입장문)
기업이 따져 볼 돈이 바로 그 연산입니다. 필요한 GPU는 모델 크기에 따라 크게 다릅니다. 오픈AI의 gpt-oss-120b(매개변수 1,170억 개)는 80GB GPU 한 장에 들어가고, 업스테이지는 Solar Open 2(2,500억 개)의 원본이 H200 네 장에서 돈다고 밝혔습니다. K3는 매개변수 2조 8,000억 개를 4비트 형식(MXFP4)으로 학습해 가중치만 단순 계산으로 1.4TB 안팎이고, 문샷은 가속기 64장 이상을 한 덩어리로 묶은 구성에서 돌리라고 권했습니다. GPU 한 장에 180GB가 달린 B200 여덟 장짜리 노드의 메모리가 1,440GB이니, K3는 가중치만으로 노드 하나를 거의 채웁니다.
클라우드에서 빌리는 값은 공개 가격표로 셀 수 있습니다. 7월 27일 보관된 코어위브 가격표와, 같은 돈으로 살 수 있는 인하된 Luna 출력 토큰을 함께 적었습니다.
| 구성(코어위브 북미, 7월 27일 가격표) | 시간당 임대료 | 1년 내내 빌리면 | 같은 돈의 Luna 출력 토큰 |
|---|---|---|---|
| H200 8장 노드 1대 | 50.44달러 | 약 44만 2,000달러 | 약 3,682억 개 |
| B200 8장 노드 1대 | 68.80달러 | 약 60만 3,000달러 | 약 5,022억 개 |
| B200 8장 노드 8대(64장) | 550.40달러 | 약 482만 달러 | 약 4조 179억 개 |
같은 날 람다의 B200 64장 클러스터 가격표는 GPU 한 장에 시간당 9.36달러로, 1년이면 약 525만 달러였습니다. 64장을 1년 빌리는 482만 달러면 문샷 API에서 K3 출력 토큰을 약 3,214억 개 삽니다.
한데 이 표는 같은 돈의 크기만 맞춘 것입니다. 임대료에는 운영 인력과 네트워크, 저장장치 비용이 빠져 있고, 노드 한 대가 1년 동안 실제로 몇 개의 토큰을 뽑아낼지는 모델 크기와 요청 패턴에 따라 다릅니다. API는 쓴 만큼만 내지만, 빌린 GPU는 요청이 없는 밤에도 시간당 요금이 나갑니다.
비용만으로는 설명되지 않는 이유가 남습니다. 서한은 오픈웨이트가 기업이 공급사 한 곳에 묶이지 않고, 자기 데이터를 직접 다루고, 모델을 자기 사업이 요구하는 곳 어디에든 배치하게 해 준다고 적었습니다. 가중치 파일을 받아 인터넷과 끊긴 사내망에 두면 데이터가 밖으로 나가지 않고, 모델 버전도 공급사 일정이 아닌 자기 일정에 맞춰 바꿉니다. gpt-oss-120b처럼 H100 노드 하나에서 추가 학습까지 할 수 있는 모델도 있습니다.
오픈AI가 4월 허깅페이스에 공개한 privacy-filter도 이 이유와 맞닿아 있습니다. 글에서 개인정보를 찾아 가리는 모델로, 전체 매개변수 15억 개 가운데 5,000만 개만 켜져 노트북이나 브라우저에서도 돌아가고 아파치 2.0 라이선스로 풀렸습니다. 민감한 정보는 사내에서 가린 뒤 나머지만 API로 보내는 구성이 가능해졌고, 보안을 이유로 오픈웨이트를 고르던 기업에게 API 쪽 선택지가 하나 더 생겼습니다.
국내에도 가중치를 공개한 대형 모델이 둘 있습니다. 업스테이지는 7월 22일 H200 네 장에서 도는 Solar Open 2를 공개했고, SK텔레콤은 7월 29일 매개변수 6,880억 개의 A.X K2를 상업적 이용을 막지 않는 아파치 2.0으로 풀었습니다. 위 표로 보면 H200 여덟 장짜리 노드를 1년 빌리는 돈은 인하된 Luna 출력 토큰 약 3,682억 개와 같습니다.
도입을 검토하는 기업이 먼저 가를 것은 오픈웨이트를 고르는 이유입니다. 데이터를 회사 밖으로 보낼 수 없는 금융이나 공공 업무라면 이번 인하와 상관없이 가중치를 받아 사내에서 돌리는 쪽이 남습니다. 비용이 이유였다면 비교 기준이 7월 30일부터 입력 0.2달러, 출력 1.2달러로 내려왔고, 사내 GPU가 그 값을 이기는 경우는 요청이 끊이지 않아 GPU가 쉬는 시간이 거의 없을 때입니다.
오픈AI는 발표문에서 모델이 기술팀의 효율 개선을 도우며 성능은 올리고 비용은 낮추는 과정이 이어진다고 적었습니다. GPU를 사서 3년에 걸쳐 감가상각하는 기업이라면, 그 3년 동안 API 가격이 몇 번 더 내려갈지가 손익 계산에 들어갑니다. 7월 16일 가격표에 있던 Luna 출력 가격 6달러는 2주 만에 1.2달러가 됐습니다.
읽어 주셔서 고맙습니다.
초이 드림