이 글 어땠어요?
결과가 나오면 맞았는지 그대로 적어요.
MiniMax가 H3 가중치를 며칠 안에 공개한다
MiniMax는 8월 3일(한국 시각) 허깅페이스에 H3 가중치를 공개했습니다. 풀린 것은 768p를 만드는 H3-Base(33B)이고, 지시문을 정리하는 H3-Context-IR과 2K 재생성은 API로 남았습니다. 라이선스 Q&A는 EU와 영국, 한국, 미국에서의 오픈웨이트 이용을 별도 승인 대상으로 두었습니다.
MiniMax는 7월 31일 블로그에서 적용되는 법과 규정의 범위 안에서 며칠 안에 공개하겠다고 밝혔고, 8월 2일에도 곧 나온다고 적었습니다. 가중치에는 MiniMax 커뮤니티 라이선스가 붙습니다.
8월 2일 현재 H3 라이선스 원문은 공개되지 않았습니다. 아티피셜애널리시스는 매출 2,000만 달러 미만 조직의 상업적 이용을 허락하고 눈에 띄는 출처 표기를 요구하는 라이선스라고 설명했고, 같은 이름의 M3 라이선스는 그보다 큰 매출이면 사전 서면 승인을 요구합니다.
MiniMax API에서 2K 영상은 초당 0.13달러, 1분에 7.80달러입니다. 출시 예정인 768p는 초당 0.09달러이고, 참고 이미지는 다섯 장까지 무료입니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
9월 18일 공개된 Qwen3.8-Omni-Flash는 입력을 종류와 상관없이 100만 토큰당 0.15달러로 받아, 이전 세대가 11달러를 받던 음성 입력이 0.15달러가 됐습니다. 시간당 가격은 회사 추정치이고 출력 비용은 따로 붙습니다.

딥시크가 9월 10일 552B MoE 모델 V4.1-Flash를 MIT 라이선스로 공개했습니다. 토큰당 KV 캐시는 V4-Flash의 약 4분의 1이고, 오프피크 요금은 캐시 적중 입력 0.003달러, 출력 0.6달러로 8월보다 내렸습니다.
알리바바 Qwen 팀이 9월 20일 생성부 7B의 이미지 생성·편집 모델 Qwen-Image-2.1 가중치를 공개했습니다. 자체 채점표 29개 모델 가운데 7위로 Nano Banana 2.0보다 0.46점 높았고, 상업 이용에는 별도 라이선스가 필요합니다.

9월 18일 공개된 Qwen3.8-Omni-Flash는 입력을 종류와 상관없이 100만 토큰당 0.15달러로 받아, 이전 세대가 11달러를 받던 음성 입력이 0.15달러가 됐습니다. 시간당 가격은 회사 추정치이고 출력 비용은 따로 붙습니다.

딥시크가 9월 10일 552B MoE 모델 V4.1-Flash를 MIT 라이선스로 공개했습니다. 토큰당 KV 캐시는 V4-Flash의 약 4분의 1이고, 오프피크 요금은 캐시 적중 입력 0.003달러, 출력 0.6달러로 8월보다 내렸습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
@MiniMax_AIX 게시물 · 원문 보기
발표 게시물은 H3를 네 가지 문구로 소개했습니다. 여러 참고 자료를 한 번에 넣는 옴니 레퍼런스, 상업용 수준의 생성 품질, 가격 대비 성능, 그리고 오픈웨이트입니다. MiniMax는 공식 블로그에서 광고와 브랜딩, 전자상거래, 제품 디자인, UI·UX, 게임 영상을 H3의 쓰임새로 꼽았고, 2K 기준 초당 가격이 주류 모델의 3분의 1이 안 된다고 적었습니다.
MiniMax의 영상 모델은 H3가 세 번째입니다. 블로그 설명으로는 하이루오 01이 시스템을 처음부터 세웠고, 하이루오 02는 구조의 효율과 데이터 품질, 규모를 끌어올렸습니다. 6월 공개한 언어 모델 MiniMax-M3는 7월 15일 아티피셜애널리시스 지능 지수에서 오픈웨이트 모델 가운데 GLM-5.2(51점) 다음인 44점을 받았습니다.
H3를 설계하며 MiniMax가 문제로 꼽은 것은 과제마다 모델이 따로 있던 구조입니다. 이미지는 글로 그리기와 편집, 인물 참고, 동작 참고, 화풍 참고가 각각 다른 전문 모델이었고, 음성과 효과음, 음악도 따로 연구됐으며, 영상은 글로 만들기와 이미지로 만들기, 첫 프레임과 끝 프레임 지정, 편집 등으로 잘게 나뉘어 있었습니다. H3는 이 과제를 한 모델에서 사전학습 단계부터 함께 배웁니다. 영상을 만들 때 소리를 함께 만들고, 여러 컷을 한 번에 구성하며, 음성과 효과음, 음악을 구분하지 않고 같이 다룹니다.
참고와 편집의 관계는 정해진 메뉴 대신 문장으로 지시합니다. 블로그에 실린 예시 지시문은 「영상 1의 히치콕식 카메라 움직임을 참고하고, 이미지 2의 인물이 노래하게 하되, 목소리는 오디오 3에 맞춰라」였습니다. 영상과 이미지, 음성 세 가지 참고 자료의 관계를 글로 설명하면 나머지는 모델이 풀어낸다는 설명입니다.

MiniMax는 H3를 받치는 기술로 네 가지를 들었습니다. 기술 보고서는 곧 내겠다고 했고, 블로그에는 요약만 실렸습니다.
| 기술 | 하는 일 | 공개된 숫자 |
|---|---|---|
| Contextual Omni Representation | 참고 자료와 결과 영상의 관계까지 글로 풀어 쓰는 캡션 | 원본 하나에 추론 약 10만 토큰, 캡션은 평균 약 4,000토큰 |
| H3-VAE | 영상을 압축해 모델이 다루는 표현으로 바꾸는 토크나이저 | 유효 시퀀스 길이 4배, 네이티브 2K의 바탕 |
| H3-Omni Transformer | 이해와 생성 연산을 나눠 돌리는 학습 구조 | 학습 처리량 약 30% 향상 |
| In-context Regeneration | 저해상도 결과를 기본 모델이 다시 생성해 2K로 올리는 방식 | 별도 초해상도 모듈 없음 |
가장 공을 들였다는 것은 캡션입니다. 참고 자료가 여럿 들어오면 결과 영상만 묘사해서는 부족하고, 자료와 결과의 관계, 자료끼리의 관계, 여러 컷에 걸친 소리와 화면의 관계까지 글로 적어야 합니다. MiniMax는 이를 위해 전용 모델과 이해 파이프라인을 따로 만들었고, 원본 대부분에 약 10만 토큰의 추론을 들여 평균 약 4,000토큰의 설명으로 줄였다고 밝혔습니다. H3가 지시를 잘 따르는 이유를 회사는 이 캡션에서 찾았습니다.
2K 영상을 만드는 방식도 다릅니다. 보통은 낮은 해상도로 만든 뒤 초해상도 모듈로 키우는데, H3는 기본 모델이 자기 저해상도 결과를 원래의 참고 자료와 함께 다시 생성합니다. 작은 글씨나 세부 묘사처럼 초해상도 모듈이 짐작만 하던 부분을 참고 자료에서 다시 가져올 수 있다는 설명입니다. 하이루오 02에서 쓰던 구조는 과제를 합치는 데 불필요하게 복잡하다며 내려놓았다고도 적었습니다.
아티피셜애널리시스는 이용자들이 두 모델의 결과를 이름을 가린 채 비교해 고르는 투표로 영상 모델 순위를 매깁니다. 7월 31일 오전 9시 48분(한국 시각) 구글의 Gemini Omni Flash가 영상 편집 순위 1위로 데뷔했다는 글이 올라왔고, 3시간 20분 뒤 같은 계정에 H3가 영상 편집 1위, 글로 영상 만들기 2위, 이미지로 영상 만들기 3위라는 글이 올라왔습니다. 아티피셜애널리시스는 그보다 앞선 글에서 Gemini Omni Flash가 자사 영상 순위표를 거의 휩쓸었다고 적었습니다.
@ArtificialAnlysX 게시물 · 원문 보기
H3가 영상 편집에서 순위에 오를 수 있었던 것은 영상을 입력으로 받기 때문입니다. 아티피셜애널리시스는 H3가 지시문으로 영상을 고치는 편집을 할 수 있는 몇 안 되는 모델이라고 적었습니다. 가중치가 공개되면 이전 오픈웨이트 1위였던 LTX-2.3보다 크게 앞서는 가장 강한 오픈웨이트 영상 모델이 된다는 평가도 붙였습니다. 같은 날 아티피셜애널리시스는 엔비디아가 7월 20일 공개한 Cosmos3-Super의 4단계 증류판을 이미지로 영상 만들기 부문 오픈웨이트 1위로 소개하기도 했습니다.
영상 생성은 언어 모델보다 가중치 공개가 늦은 분야였습니다. MiniMax는 블로그에서 폐쇄형 모델이 영상 생성을 오래 지배해 왔고, 언어 모델 분야보다 발전 속도가 느리고 생태계도 덜 열려 있었다고 적었습니다. 8월 1일 X에는 이렇게 썼습니다.
처음으로 오픈 영상 모델이 폐쇄형 프런티어와 같은 테이블에 앉았습니다.— MiniMax 공식 계정, 8월 1일
가격은 아티피셜애널리시스가 소리를 포함한 1분 분량으로 환산해 비교했고, 순위 평가도 2K 요금제로 진행했다고 밝혔습니다. 768p 요금제는 MiniMax 문서에 출시 예정으로 올라 있었습니다.
| 모델 | 해상도 | 1분당 가격 |
|---|---|---|
| Gemini Omni Flash (구글) | - | 6.00달러 |
| MiniMax H3 | 768p (출시 예정) | 5.40달러 |
| MiniMax H3 | 2K | 7.80달러 |
| HappyHorse-1.1 | - | 9.90달러 |
| Kling 3.0 | 1080p | 20.16달러 |
| Dreamina Seedance 2.0 | 1080p | 22.45달러 |
출처: 아티피셜애널리시스(7월 31일). H3는 초당 2K 0.13달러, 768p 0.09달러입니다.
2K로 만든 H3가 1080p인 Seedance 2.0과 Kling 3.0의 절반보다도 쌉니다. 참고 이미지는 다섯 장까지 무료이고 그 뒤로는 한 장에 0.04달러, 참고 음성은 무료입니다. 구글 Gemini Omni Flash만 H3 2K보다 1분에 1.80달러 쌉니다. MiniMax는 768p 요금이 주류 모델 720p 요금의 절반이 안 된다고 밝혔습니다. 블로그는 가격 대비 성능의 바탕으로 네 가지 기술을 모두 들었고, 그 가운데 H3-VAE는 높은 압축률로 유효 시퀀스 길이를 4배로 늘려 학습과 추론 비용을 크게 줄였다고 설명했습니다.
공개 전후로 X에는 H3로 만든 영상이 쏟아졌습니다. 공개 10시간 전 이 모델을 먼저 써 본 한 제작자는 프롬프트 하나로 하드 컷 24개가 이어지는 영상을 한 번에 만들었다며, 편집하지 않은 원본이라고 적었습니다.
@NEXUS_TO_NOVAX 게시물 · 원문 보기
| 사례 | 내용 | 올린 사람 |
|---|---|---|
| 게임 UI 영상, Seedance 2.0과 비교 | 같은 프롬프트와 참고 이미지 8장으로 비교, 8개 프레임의 작은 글씨와 배경음악까지 생성 | @ShamsAmin56 |
| 30초 예고편 | 약 6,900자짜리 프롬프트 2개로 15초씩 생성, 제목 글자 애니메이션까지 모델이 생성 | @aripratama293 |
| 참고 자료 7개와 음성을 넣은 인트로 | 긴 영상은 짧은 클립으로 나눠 만들라고 권함 | @altphotos_pl |
모두 만든 사람이 직접 올린 결과물이라 몇 번 만에 건진 영상인지는 나와 있지 않습니다. 긴 인트로를 한 번에 만들려던 제작자는 짧은 클립으로 나눠야 모델이 인물과 대상을 정확히 유지한다고 적었습니다. 결과를 다시 뽑을 때마다 초당 요금이 새로 붙으므로, 실제 비용은 표의 1분당 가격에 다시 뽑은 횟수를 곱한 값이 됩니다.
MiniMax는 블로그에서 적용되는 법과 규정의 범위 안에서 앞으로 며칠 안에 가중치를 공개할 계획이라고 적었습니다. 이유로는 오픈소스 커뮤니티 지원과 더 많은 AI 하드웨어와의 호환, 사용자가 자기만의 버전을 만들기 쉽게 하는 것을 들었고, 하드웨어 호환성은 설계 초기부터 고려했다고 밝혔습니다. 8월 1일 X에는 며칠 안에 누구나 H3 위에서 만들 수 있게 된다고 다시 적었고, 2일에도 가중치가 곧 나온다는 짧은 글을 올렸습니다.
아티피셜애널리시스에 따르면 가중치에는 MiniMax 커뮤니티 라이선스가 붙습니다. 아티피셜애널리시스는 이 라이선스가 매출 2,000만 달러 미만 조직의 상업적 이용을 허락하고, 눈에 띄는 출처 표기를 요구한다고 설명했습니다. 같은 이름의 라이선스를 단 6월 언어 모델 M3의 원문을 보면 비상업적 이용은 자유롭고, 상업적으로 쓰면 「Built with MiniMax M3」를 웹사이트나 제품 문서에 눈에 띄게 적은 뒤 MiniMax에 한 번 알려야 합니다. 연 매출이 2,000만 달러를 넘는 제품이나 서비스는 사전에 서면 승인을 받아야 하고, 군사 목적 이용은 금지 조항에 들어 있습니다.
H3 라이선스 원문은 8월 2일 현재 공개되지 않았습니다. 중국 회사의 영상 모델 라이선스에는 지역 조항이 붙은 전례가 있습니다. 텐센트가 2024년 12월 공개한 영상 모델 HunyuanVideo의 라이선스는 첫 문장에서 EU와 영국, 한국을 적용 지역에서 뺐습니다. 텐센트는 같은 조항을 달았던 언어 모델 Hy3를 7월 6일에야 Apache 2.0으로 바꿨습니다.
발표를 먼저 하고 가중치를 나중에 푸는 순서는 지난달 문샷AI도 밟았습니다. 문샷은 7월 16일 Kimi K3를 발표하며 7월 27일 공개를 약속했고, 약속한 날 가중치 파일 96개와 기술 보고서를 함께 풀었습니다. 그사이 vLLM 같은 오픈소스 추론 엔진이 새 모델을 붙일 시간을 벌었습니다.
가중치가 나오기 전에도 H3는 여러 경로로 쓸 수 있습니다. 하이루오 웹 앱과 MiniMax API 말고도 fal과 OpenRouter, Runway, Krea, Leonardo, Vercel AI Gateway가 공개 직후 H3를 붙였고, 노드 기반 편집 도구 ComfyUI는 API로 부르는 파트너 노드를 먼저 내놓으며 오픈웨이트를 직접 돌리는 지원은 곧 붙이겠다고 밝혔습니다.
모르는 것도 많습니다. 모델 크기와 로컬에서 돌리는 데 필요한 GPU 메모리는 가중치가 나와야 알 수 있고, 한국어 대사와 지시문을 얼마나 안정적으로 다루는지도 8월 2일까지 나온 자료에는 없습니다. 이미지와 영상, 음성을 한 모델에 넣는 흐름은 H3만의 것도 아닙니다. 7월 하순 Black Forest Labs가 이미지와 영상, 음성을 한 잠재 공간에서 처리하는 FLUX 3를 공개했고, 첫 영상 모델은 얼리 액세스로 내놓았습니다.
저는 H3 가중치가 약속대로 풀리고 라이선스에 지역 제한이 없다면, 광고와 커머스 영상을 만드는 국내 제작사가 클라우드 요금 대신 자체 GPU로 초안을 뽑는 계산을 해 볼 만한 조건이 처음 갖춰진다고 봅니다. MiniMax는 다음 H 시리즈에 언어 모델 M 시리즈의 이해 능력을 합치고 모델 규모를 키우겠다고 밝혔습니다. 가중치와 라이선스 원문이 나오면 다시 전하겠습니다.
읽어 주셔서 고맙습니다.
초이 드림