이 글 어땠어요?
결과가 나오면 맞았는지 그대로 적어요.
Hy4 정식판이 프리뷰의 과도한 추론 문제를 줄여 나온다
텐센트는 필요 이상으로 오래 추론하고 자기 결과를 지나치게 다시 확인하는 경향을 알려진 한계로 적었습니다.
외부 독립 측정에서 Hy4가 GLM 5.3·Kimi K3와 같은 구간에 든다
GDPval-AA v2 공식 점수는 Hy4 1,678점, Kimi K3 1,675점, GLM 5.3 1,763점이었습니다.
아파치 2.0이라 지역이나 매출 조건 없이 상업 이용과 수정, 재배포가 가능합니다. 같은 달 나온 Qwen3.8-Flash-Next는 모델 API나 코딩·사무용 AI 도구 사업에 쓰면 규모와 상관없이 알리바바와 별도 계약을 맺는 조건이 붙습니다.
대부분 텐센트가 직접 잰 값이고, 경쟁 모델도 텐센트가 Claude Code 실행 틀로 다시 잰 점수가 많습니다. 외부 공식 점수인 GDPval-AA v2에서는 1,678점으로 Kimi K3와 비슷했고 GLM 5.3보다 낮았습니다.
FP8 가중치만 770GB 안팎이라, 텐센트 안내대로 GPU 8장에 나누면 카드마다 96GB 넘게 올라갑니다. 80GB 카드 8장으로는 부족하고 141GB급 메모리 카드가 사실상 기본 조건입니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
딥시크가 2차 투자 라운드에서 최소 800억 위안(약 120억 달러)을 모읍니다. 처음 목표는 500억 위안이었고, CNBC는 1,000억 위안까지 늘리는 방안을 검토 중이라고 전했습니다. 상장 시점은 2027년 초로 보도됐습니다.

알리바바 Qwen 팀이 9월 20일 생성부 7B의 이미지 생성·편집 모델 Qwen-Image-2.1 가중치를 공개했습니다. 자체 채점표 29개 모델 가운데 7위로 Nano Banana 2.0보다 0.46점 높았고, 상업 이용에는 별도 라이선스가 필요합니다.
텐센트가 7월 6일 Hy3 정식판을 아파치 2.0으로 공개했습니다. 4월 프리뷰까지 쓰던 커뮤니티 라이선스는 첫 문장에서 EU와 영국, 한국을 적용 지역에서 뺐고, 월간 이용자 1억 명이 넘는 사업자의 사용도 막았습니다.
딥시크가 2차 투자 라운드에서 최소 800억 위안(약 120억 달러)을 모읍니다. 처음 목표는 500억 위안이었고, CNBC는 1,000억 위안까지 늘리는 방안을 검토 중이라고 전했습니다. 상장 시점은 2027년 초로 보도됐습니다.

알리바바 Qwen 팀이 9월 20일 생성부 7B의 이미지 생성·편집 모델 Qwen-Image-2.1 가중치를 공개했습니다. 자체 채점표 29개 모델 가운데 7위로 Nano Banana 2.0보다 0.46점 높았고, 상업 이용에는 별도 라이선스가 필요합니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
@TencentHunyuanX 게시물 · 원문 보기
7월 말부터 한 달 사이 중국 연구소들이 수천억에서 수조 파라미터급 모델의 가중치를 잇달아 풀었습니다.
| 공개 | 모델 | 전체 / 활성 파라미터 | 라이선스 |
|---|---|---|---|
| 7월 28일 | Kimi K3 | 2.8조 / 1,040억 | 매출 조건이 붙은 자체 라이선스 |
| 8월 12일 | Qwen3.8-Max 가중치 | 2.4조 / 950억 | 자체 라이선스, 연 매출 5,000만 달러 넘는 API·AI 도구 사업자는 별도 계약 |
| 8월 13일 | DeepSeek V4-Pro 정식판 | 1.6조 / 490억 | MIT |
| 8월 26일 | Qwen3.8-Flash-Next | 1,250억 / 60억 | Qwen 커뮤니티 라이선스, API·AI 도구 사업자는 규모와 무관하게 별도 계약 |
| 8월 28일 | Hy4 프리뷰 | 7,700억 / 490억 | 아파치 2.0 |
공개 간격이 며칠 단위로 좁아지는 동안 라이선스는 한쪽으로 모이지 않았습니다. 알리바바는 8월 들어 두 번에 걸쳐 모델 API 사업자와 코딩·사무용 AI 도구 사업자에게 별도 계약을 요구하는 조항을 붙였고, 그 과정은 같은 날 나온 Qwen과 GLM의 라이선스를 비교한 글에 정리했습니다. 텐센트는 반대로 7월 Hy3 정식판에서 한국과 EU, 영국을 빼던 지역 조항을 없앴고, Hy4도 같은 아파치 2.0으로 냈습니다.

국내 AI 스타트업에게 이 차이는 구체적입니다. 코딩 도우미나 사무 자동화 도구를 만드는 회사가 Qwen3.8-Flash-Next 위에 제품을 올리면 매출과 상관없이 알리바바와 별도 계약을 맺는 조건이 붙습니다. 같은 제품을 Hy4나 DeepSeek V4-Pro 위에 올리면 그런 조건이 없습니다. 성능과 가격이 비슷한 모델 사이에서는 이 조항 하나가 후보를 가릅니다.
| 항목 | Hy3 | Hy4 프리뷰 |
|---|---|---|
| 전체 파라미터 | 2,950억 | 7,700억 |
| 활성 파라미터 | 210억 | 490억 |
| 층 수 | 80개 | 78개 (첫 층만 일반 FFN, 나머지 77개 MoE) |
| 전문가 | 192개 중 8개 | 256개 중 8개 + 공유 전문가 1개 |
| 문맥 길이 | 256K 토큰 | 100만 토큰 |
| MTP 레이어 | 38억 | 100억 (활성 7억) |
Hy3와 견주면 전체 규모는 2.6배, 활성 파라미터는 2.3배, 문맥은 4배가 됐습니다. 텐센트는 모델 크기와 문맥 길이, 학습 데이터 세 방향을 함께 키웠고, 사후학습을 크게 늘린 효과가 겹쳐 오픈소스 최전선에 올랐다고 설명했습니다.
어텐션 설계는 다른 연구소의 공개 연구에서 가져왔습니다. 필요한 토큰만 골라 읽는 DeepSeek의 희소 어텐션(DSA)에 게이트를 붙였고, 그 선택 결과를 여러 층이 함께 쓰는 IndexCache를 넣었습니다. 텐센트가 IndexCache의 근거로 링크한 논문은 Z.ai가 GLM-5.2에 적용한 인덱스 공유 논문과 같은 논문입니다. 잔차 연결도 네 갈래 흐름으로 넓혔습니다. 설계 아이디어도 몇 달 안에 경쟁사 모델로 넘어가고, 그 속도가 공개 간격을 좁히는 한 원인입니다.
Hy3에서 Hy4로 넘어오며 오른 폭은 큽니다. 모두 텐센트가 같은 조건으로 잰 값입니다.
| 벤치마크 | Hy3 | Hy4 프리뷰 |
|---|---|---|
| DeepSWE | 28.0 | 64.3 |
| Terminal-Bench 2.1 | 70.8 | 85.4 |
| SWE-bench Pro | 57.9 | 65.7 |
| PostTrainBench | 14.5 | 35.6 |
| MathArena Apex 2025 | 38.7 | 74.2 |
경쟁 모델과의 비교는 읽는 법이 필요합니다. 텐센트는 부록 표 주석에 별표가 붙은 경쟁 모델 점수는 자기들이 직접 잰 값이라고 적었고, 여러 과제를 Claude Code 실행 틀에 넣어 돌렸다고 밝혔습니다. 공식 발표치와 텐센트 측정치를 함께 적은 항목을 보면 차이가 큽니다.
| Terminal-Bench 2.1 | 공식 발표 | 텐센트 측정 |
|---|---|---|
| DeepSeek V4-Pro | 87.9 | 80.3 |
| Kimi K3 | 88.3 | 85.7 |
| Qwen3.8-Max | 86.6 | 85.8 |
| GLM 5.3 | 88.2 | 88.3 |
| Claude Opus 5 | 86.7 | 85.4 |
Hy4의 85.4는 텐센트 측정치끼리 놓으면 DeepSeek V4-Pro보다 5점 남짓 높지만, DeepSeek가 스스로 발표한 87.9보다는 낮습니다. 같은 모델의 점수도 누가 어떤 실행 틀로 쟀느냐에 따라 몇 점씩 움직이고, 같은 달 메타의 코딩 성적표에서도 같은 모델이 측정 기관에 따라 82.9%와 80%로 갈린 일이 있었습니다. 텐센트도 주석에 Hy3의 일부 점수가 실행 틀과 채점 모델을 바꾸면서 예전 발표와 달라졌다고 적었습니다.
외부 기관이 같은 방식으로 잰 항목은 부록에 공식 점수로 따로 표시돼 있습니다. 실제 직업 과제의 결과물을 맞대 매기는 GDPval-AA v2에서 Hy4는 1,678점으로 Kimi K3(1,675점)와 비슷했고, GLM 5.3(1,763점)과 Qwen3.8-Max(1,717점)보다 낮았습니다. 연구 수준 물리 문제를 푸는 CritPt에서는 16.9점으로 표에 오른 경쟁 모델 가운데 가장 낮았습니다. 텐센트가 직접 잰 코딩 과제에서는 중국 상위권과 겨루지만, 외부 공식 점수에서는 그 무리의 가운데나 아래에 있습니다.
텐센트는 사람 평가도 냈습니다. 사내 전문가 163명이 엔지니어링 과제 203개의 결과물을 이름을 가린 채 비교했더니, Hy4는 4점 만점 평균 2.99점으로 GLM 5.3(2.92점)과 Kimi K3(2.94점)를 조금 앞섰습니다. GLM 5.3과의 맞대결에서는 이긴 비율이 46.8%, 진 비율이 40.4%였습니다. 텐센트 스스로 「조금 앞섰다」고 표현한 차이입니다.
텐센트는 Hy4를 자사 코딩 도구 CodeBuddy, 업무 도구 WorkBuddy와 함께 설계하고 있다고 밝혔습니다. 사전 접근권을 받은 개발자들은 발표 당일 WorkBuddy로 만든 결과물을 올리기 시작했습니다.
@ivanfioravantiX 게시물 · 원문 보기
모델 카드에는 알려진 한계를 적은 절이 따로 있습니다. 텐센트는 Hy4가 초기 버전이라 사전학습과 사후학습 모두 개선 여지가 크고, 복잡한 과제에서 필요 이상으로 오래 추론하거나 자기 결과를 지나치게 다시 확인하는 경향이 있다고 적었습니다. Hy3 프리뷰 때처럼 일찍 내놓고 무엇이 깨지는지 들으면서 고치겠다는 설명도 붙였습니다.
이 한계는 비용과 바로 이어집니다. Hy4는 기본 추론 설정이 가장 깊게 생각하는 high로 잡혀 있고, 짧은 답이 필요할 때는 추론을 끄는 옵션을 따로 넘기는 방식입니다. 토큰당 가격이 싸도 한 과제에 쓰는 출력 토큰이 길어지면 과제당 비용은 가격표보다 커집니다.
텐센트는 연구 관리자 역할을 시험한 시연도 발표 페이지에 소개했습니다. 작은 모델의 사후학습 방법을 찾는 과제에서 Hy4가 여러 Codex 세션에 서로 다른 실험을 맡기고, 결과가 들어올 때마다 방향을 바꾸며 여러 평가 목표를 함께 맞췄습니다. 같은 Codex가 혼자 탐색했을 때보다 8개 벤치마크 모두에서 높은 결과가 나왔다는 설명인데, 다른 과제에서도 같은 효과가 나는지는 발표 밖에서 재현된 적이 없습니다.
OpenRouter에는 8월 28일 Hy4 프리뷰가 올라왔습니다.
| 모델 | 입력 (100만 토큰) | 출력 (100만 토큰) |
|---|---|---|
| Hy4 프리뷰 | 0.834달러 (캐시 0.042달러) | 2.501달러 |
| GLM 5.3 | 0.84달러 | 2.64달러 |
| DeepSeek V4-Pro | 1.32달러 | 3.96달러 |
| Qwen3.8-Max | 2달러 | 6달러 |
| Kimi K3 | 3달러 | 15달러 |
출력 가격은 Qwen3.8-Max의 42%, Kimi K3의 6분의 1입니다. 가장 가까운 상대는 GLM 5.3으로, 출력 가격 차이가 5% 남짓이고 텐센트 사람 평가에서는 Hy4가, 외부 GDPval-AA에서는 GLM 5.3이 앞섰습니다. 캐시 입력은 일반 입력의 5% 수준이라, 같은 문서를 여러 번 읽히는 사내 규정 검토나 계약서 분석 같은 작업에서 청구액 차이가 커집니다.
490억만 켜진다고 490억짜리 장비로 돌아가지는 않습니다. 어느 전문가가 켜질지 미리 알 수 없어서 7,700억 전부가 메모리에 올라가 있습니다. 텐센트가 안내한 실행 설정은 FP8 가중치를 GPU 8장에 나눠 올리는 방식인데, FP8은 파라미터 하나가 1바이트라 가중치만 770GB 안팎입니다. 80GB 카드 8장을 합쳐도 640GB라 가중치가 다 들어가지 않습니다. 8장에 나누면 카드 한 장에 가중치만 96GB 넘게 올라가서, 141GB급 메모리를 단 카드가 사실상 기본 조건입니다. 문맥을 100만 토큰까지 쓰면 앞서 처리한 토큰의 계산 결과를 담는 캐시가 그 위에 더 얹힙니다.
Hy3 정식판은 FP8 기준 가중치가 295GB 안팎이었습니다. 한 세대 만에 사내 서빙에 필요한 메모리가 2.6배로 늘었고, 이 숫자는 벤치마크 표에 적히지 않습니다. 국내에서 이만한 장비를 모델 하나에 붙일 수 있는 조직은 대기업 연구조직과 일부 공공 사업 정도라, 대부분의 팀에게 Hy4는 API로 먼저 쓰게 되는 모델입니다.
그래도 아파치 2.0의 효과는 가중치를 받지 않는 회사에도 닿습니다. 가중치가 공개돼 있으면 여러 공급자가 같은 모델을 서빙할 수 있어서, 한 곳이 가격을 올리거나 서비스를 접어도 옮겨 갈 곳이 남습니다. 데이터를 밖으로 내보낼 수 없는 금융·의료 조직에는 장비만 갖추면 내부에 둘 수 있는 선택지가 됩니다. 공공 사업에서는 중국 공급자의 가중치라는 점 때문에 학습 데이터 출처와 안전 조치가 라이선스와 별도로 검토 항목에 오를 수 있습니다.
Hy4는 프리뷰입니다. Hy3는 4월 23일 프리뷰에서 7월 6일 정식판까지 74일이 걸렸고, 그사이 라이선스가 아파치 2.0으로 달라졌고 점수도 새로 발표됐습니다. 이번 수치도 대부분 텐센트가 직접 잰 값이라, 외부 기관의 독립 측정이 나오면 가격 대비 위치가 더 분명해집니다. 가중치는 허깅페이스의 Hy4 프리뷰 모델 카드에서, FP8판은 Hy4-preview-FP8에서 받을 수 있습니다.
읽어 주셔서 고맙습니다.
초이 드림