이 글 어땠어요?
결과가 나오면 맞았는지 그대로 적어요.
3.5 Pro 지연은 최상위 모델을 만드는 능력의 문제일 수 있다 (7월 21일 스레드)
구글은 코딩 순위 경쟁 대신 검색·안드로이드·워크스페이스에 싸고 빠른 모델을 넣는 쪽으로 승부한다 (7월 21일 스레드)
100만 토큰당 입력 1.50달러, 출력 7.50달러입니다. 3.5 Flash의 출력 단가 9달러보다 16.7% 내렸고, 같은 표의 GPT-5.6 Luna와 Grok 4.5는 출력 6달러입니다.
전작보다는 올랐지만 SWE-Bench Pro, DeepSWE, Terminal-bench 세 코딩 평가 모두 GPT-5.6 Luna, Grok 4.5, Claude Sonnet 5보다 낮습니다. 컴퓨터 조작, 차트 읽기, 긴 문맥 평가는 비교표에서 가장 높습니다.
피차이는 5월 19일 I/O에서 다음 달에 나온다고 했지만, 7월 21일 발표문은 파트너와 시험 중이며 준비되는 대로 풀겠다고만 적었습니다. 같은 글에서 Gemini 4 사전학습을 시작했다고 밝혔습니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
구글이 9월 2일 제미나이 3.8 Flash와 보안용 3.8 Flash Cyber를 공개했습니다. 6주 만의 세 번째 Flash이고, 모델 카드는 구조와 학습 데이터를 3.7 Flash와 같다고 적었습니다. 같은 날 메타 Muse Spark 1.3은 더 높은 지수를 더 싸게 냈습니다.

구글이 8월 27일 영상 생성·편집 모델 제미나이 Omni 1.1 Flash를 공개했습니다. 이어 붙이기, 첫·끝 프레임 지정, 360p 초안, 4K 업스케일, 참고 영상 입력이 붙었고, API 요금은 해상도별로 초당 0.03~0.30달러입니다.
유튜브가 9월 23일 Made on YouTube 2026에서 문장으로 지시하는 대화형 편집과 말로 만드는 맞춤 피드, 쇼츠 시즌 기능을 발표했습니다. 대화형 편집은 2027년 초 Shorts에, 맞춤 피드는 올가을 미국에 먼저 들어옵니다.

구글이 9월 2일 제미나이 3.8 Flash와 보안용 3.8 Flash Cyber를 공개했습니다. 6주 만의 세 번째 Flash이고, 모델 카드는 구조와 학습 데이터를 3.7 Flash와 같다고 적었습니다. 같은 날 메타 Muse Spark 1.3은 더 높은 지수를 더 싸게 냈습니다.

구글이 8월 27일 영상 생성·편집 모델 제미나이 Omni 1.1 Flash를 공개했습니다. 이어 붙이기, 첫·끝 프레임 지정, 360p 초안, 4K 업스케일, 참고 영상 입력이 붙었고, API 요금은 해상도별로 초당 0.03~0.30달러입니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
@GoogleDeepMindX 게시물 · 원문 보기
구글 딥마인드는 세 모델을 AI 에이전트를 더 빠르고 똑똑하고 싸게 돌리기 위한 모델이라고 소개했습니다. 3.6 Flash는 3.5 Flash보다 토큰을 덜 쓰면서 더 나은 결과를 내고, 3.5 Flash-Lite는 일상 작업을 빠르고 싸게 처리한다는 설명입니다. 발표문을 쓴 툴시 도시 제품관리 시니어 디렉터는 3.6 Flash를 코딩과 지식 노동, 멀티모달 성능을 끌어올린 「일꾼(workhorse)」 모델이라고 불렀습니다. 입력은 최대 100만 토큰, 출력은 한 번에 6만 4,000토큰까지 받습니다.
실제 서비스에 AI 에이전트를 붙이는 개발자와 고객에게는 더 높은 토큰 효율과 더 짧은 지연 시간, 더 믿을 만한 성능이 필요합니다.— 툴시 도시, 구글 제품관리 시니어 디렉터
3.6 Flash와 3.5 Flash-Lite는 발표 당일부터 AI Studio와 Android Studio의 Gemini API, 기업용 Gemini Enterprise Agent Platform, 제미나이 앱에서 쓸 수 있습니다. 3.6 Flash는 에이전트 개발 도구 Antigravity에도 들어갔고, 3.5 Flash-Lite는 구글 검색에 적용되기 시작했습니다. 3.5 Flash Cyber는 코드 보안 에이전트 CodeMender를 거쳐 정부와 신뢰할 수 있는 파트너에게만 시범으로 열 예정입니다.
| 모델 | 구글이 밝힌 쓰임새 | 100만 토큰당 입력·출력 | 공개 범위 |
|---|---|---|---|
| 제미나이 3.6 Flash | 코딩·지식 노동·멀티모달 주력 | 1.50달러·7.50달러 | API, 제미나이 앱, Antigravity, 기업용 |
| 제미나이 3.5 Flash-Lite | 짧은 지연·대량 처리 | 0.30달러·2.50달러 | API, 제미나이 앱, 기업용, 구글 검색 |
| 제미나이 3.5 Flash Cyber | 취약점 탐지·수정 | 공개 안 됨 | CodeMender 한정 시범 |
모델 카드의 비교표에는 3.6 Flash와 전작 3.5 Flash 옆에 오픈AI GPT-5.6 Luna, SpaceXAI Grok 4.5, 앤트로픽 Claude Sonnet 5가 나란히 올라 있습니다. 세 경쟁 모델은 모두 이달에 나왔습니다. 구글은 이 표에 자사 모델이 진 항목까지 그대로 적었습니다.
| 평가 | 3.6 Flash | 3.5 Flash | GPT-5.6 Luna | Grok 4.5 | Claude Sonnet 5 |
|---|---|---|---|---|---|
| 출력 단가 (100만 토큰) | 7.50달러 | 9.00달러 | 6.00달러 | 6.00달러 | 15.00달러 (한시 10.00달러) |
| SWE-Bench Pro (코딩 과제) | 58.7% | 55.1% | 62.7% | 64.7% | 63.2% |
| DeepSWE v1.1 (장기 코딩) | 49% | 37% | 67% | 54% | 54% |
| Terminal-bench 2.1 (터미널 코딩) | 78.0% | 76.2% | 84.7% | 83.3% | 80.4% |
| MLE-Bench (머신러닝 엔지니어링) | 63.9% | 49.7% | 47.6% | 43.2% | 66.9% |
| GDPVal-AA v2 (지식 노동, Elo) | 1421 | 1349 | 1584 | 1535 | 1607 |
| OSWorld-Verified (컴퓨터 조작) | 83.0% | 78.4% | 72.6% | 점수 없음 | 81.2% |
| CharXiv (차트 읽기, 도구 없이) | 85.2% | 84.2% | 82.7% | 81.6% | 77.0% |
| GDM-MRCR v2 128k (긴 문맥) | 91.8% | 77.3% | 74.8% | 81.4% | 71.6% |
| GDM-MRCR v2 100만 토큰 | 54.0% | 26.6% | 점수 없음 | 점수 없음 | 점수 없음 |
코딩 세 항목과 지식 노동 평가 GDPVal에서 3.6 Flash는 세 경쟁 모델보다 모두 낮았습니다. SWE-Bench Pro는 실제 소프트웨어 저장소의 버그를 고치거나 기능을 더하는 과제를 에이전트가 혼자 풀게 하는 평가인데, 3.6 Flash의 58.7%는 가장 높은 Grok 4.5(64.7%)보다 6.0%포인트 낮습니다. 머신러닝 실험 과제를 푸는 MLE-Bench에서는 63.9%로 Luna와 Grok 4.5를 앞섰지만 Sonnet 5(66.9%)에는 못 미쳤습니다. SWE-Bench Pro는 오픈AI가 7월 8일 공개 과제의 약 30%가 깨진 문제라는 감사 결과를 낸 평가이기도 합니다.
컴퓨터 조작 쪽은 순서가 반대입니다. 모델이 실제 컴퓨터 화면을 보고 클릭과 입력으로 과제를 끝내게 하는 OSWorld-Verified에서 3.6 Flash는 83.0%로 Claude Sonnet 5(81.2%)를 앞섰고, 차트를 읽고 추론하는 CharXiv에서도 85.2%로 가장 높았습니다.
6월 24일 3.5 Flash에서 미리보기로 열렸던 컴퓨터 사용 도구는 이번에 Gemini API와 Gemini Enterprise의 기본 도구로 들어갔습니다. 발표문에는 금융 리서치 AI 회사 Hebbia와 법률 AI 회사 Harvey가 문서 해석과 차트·데이터 분석, 보고서 초안 작성에 이 모델을 쓰고 있다는 사례가 실렸습니다.
격차가 가장 큰 항목은 긴 문맥입니다. GDM-MRCR은 긴 대화 속에 비슷한 요청과 답을 여러 개 섞어 두고 그중 특정 번째 것을 정확히 찾아내게 하는 구글의 평가입니다. 3.6 Flash는 128k 토큰 구간에서 91.8%로 2위 Grok 4.5(81.4%)보다 10.4%포인트 높았고, 100만 토큰 구간에서는 3.5 Flash의 26.6%를 54.0%로 두 배 넘게 올렸습니다. 이 구간에는 경쟁 모델의 점수가 없습니다.
구글 AI Studio의 제품 리드 아마르 레시는 발표 직후 3.6 Flash가 더 빠르고, 더 싸고, 코딩도 날카로워졌다고 소개했습니다. 전작과 견주면 그 설명대로 SWE-Bench Pro는 55.1%에서 58.7%로, 장기 코딩 평가 DeepSWE는 37%에서 49%로, MLE-Bench는 49.7%에서 63.9%로 올랐습니다.
@ammaarX 게시물 · 원문 보기
같은 점수를 경쟁사 옆에 놓으면 코딩 세 항목 모두 표에서 가장 낮습니다. 저도 발표 당일 스레드에 코딩하는 분들에게는 아쉬운 모델이라고 적었습니다. 비교표에는 오픈AI의 GPT-5.6 Sol이나 앤트로픽의 Claude Fable 5 같은 각 회사 최상위 모델도 들어 있지 않습니다.
3.6 Flash 모델 카드는 구조와 학습 데이터, 학습 하드웨어 항목마다 3.5 Flash를 기반으로 한다고 적고 3.5 Flash 모델 카드를 보라고 안내합니다. 두 달 만에 기반 모델을 새로 만들지 않고, 같은 모델을 다듬어 새 이름을 붙인 겁니다. Gemini API 변경 기록은 이번 판이 출력이 장황하다는 개발자 피드백을 반영했다고 적었습니다.
@JeffDeanX 게시물 · 원문 보기
제프 딘 구글 수석과학자는 3.6 Flash가 3.5 Flash보다 토큰을 훨씬 적게 쓴다며 두 모델을 나란히 돌린 영상을 올렸습니다. 발표문 수치로는 Artificial Analysis 지수 과제에서 과제당 평균 출력 토큰이 2만 8,000개에서 2만 3,000개로 17% 줄었고, DeepSWE에서는 27만 6,000개에서 9만 7,000개로 65% 줄었습니다. 여러 단계를 거치는 작업에서 추론 단계와 도구 호출 횟수도 줄었다고 적었습니다.
토큰이 줄고 단가가 내려가면 과제 하나에 드는 돈은 두 효과를 곱한 만큼 줄어듭니다. DeepSWE 과제 하나의 출력 비용을 단가로 계산하면 3.5 Flash는 27만 6,000개에 9달러를 곱한 약 2.48달러, 3.6 Flash는 9만 7,000개에 7.5달러를 곱한 약 0.73달러입니다. 입력 비용은 빠진 계산이지만, 출력만 보면 과제 하나의 값이 3분의 1 아래로 내려갔습니다.
독립 평가 기관 Artificial Analysis의 사전 측정에서도 과제 하나에 걸리는 시간이 2.7분에서 1.3분으로 절반이 됐습니다. 같은 측정에서 종합 지능 지수는 50점으로 3.5 Flash와 같았고, 같은 달 나온 GPT-5.6 Luna를 비롯한 최신 모델들이 이 지수에서 3.6 Flash보다 위에 있었습니다.
단가만 보면 3.6 Flash는 표에서 가장 싼 모델이 아닙니다. GPT-5.6 Luna는 100만 토큰당 입력 1달러, 출력 6달러이고, Grok 4.5는 입력 2달러, 출력 6달러입니다. 3.6 Flash의 출력 7.5달러는 두 모델보다 비싸고, 한시 할인가 10달러를 적용한 Claude Sonnet 5보다는 쌉니다.
구글이 내세운 강점은 토큰을 덜 쓴다는 점인데, 발표문의 토큰 비교는 전작 3.5 Flash하고만 했습니다. 같은 과제에서 Luna나 Grok 4.5가 토큰을 얼마나 쓰는지는 표에 없어서, 경쟁 모델과 과제당 비용을 맞대 보기는 어렵습니다. 전작보다 싸졌다는 것까지가 발표 자료로 확인되는 내용입니다.
함께 나온 3.5 Flash-Lite는 3.5 계열에서 가장 빠른 모델입니다. Artificial Analysis 기준 초당 350토큰을 출력하고, 값은 100만 토큰당 입력 0.30달러, 출력 2.50달러입니다. 구글은 문서 처리나 에이전트 검색처럼 처리량이 중요한 작업과, 큰 모델이 여러 작은 에이전트를 부리는 구성의 하위 에이전트로 쓰라고 안내했습니다.
@OfficialLoganKX 게시물 · 원문 보기
구글 AI Studio와 Gemini API를 이끄는 로건 킬패트릭은 3.5 Flash-Lite가 여러 경우 Gemini 3보다 똑똑하고, 곧 은퇴할 2.5 Flash와 같은 값에 더 똑똑하다고 적었습니다. 함께 올린 그래프를 보면 직전 라이트 모델 3.1 Flash-Lite보다 Terminal-bench 2.1은 31.0%에서 54.0%로, GDPVal-AA v2는 642점에서 1140점으로 올랐습니다. 한 세대 위 주력이던 3 Flash와 견줘도 SWE-Bench Pro(54.2% 대 49.6%)와 OSWorld-Verified(74.0% 대 65.1%)에서 앞섰습니다.
대신 라이트끼리 비교한 비용은 올랐습니다. Artificial Analysis는 3.5 Flash-Lite의 지능 지수가 전작 라이트보다 11점 올라 라이트 계열에서 가장 큰 폭으로 개선됐지만, 과제당 비용은 전작 라이트의 두 배가 됐다고 측정했습니다. 그래도 절대 금액은 3.6 Flash의 5분의 1 수준입니다.
3.5 Flash Cyber는 3.5 Flash를 바탕으로 보안 취약점을 찾고 고치는 데 맞춰 미세 조정한 모델입니다. 구글의 코드 보안 에이전트 CodeMender 안에서 이 모델 여러 개가 함께 일하고, 결과를 하나의 보고서로 합칩니다. 구글은 큰 모델보다 토큰당 값이 싸다고만 밝혔고 가격표는 내지 않았습니다.
구글이 공개한 취약점 평가 CyberGym 그래프에서 이 구성은 83.2%를 받았습니다. 한 과제에 모델을 최대 5번까지 부른 결과이고, 비교 대상은 각 회사의 에이전트에서 돌린 최상위 모델과 보안 특화 모델입니다.
| 구성 | CyberGym |
|---|---|
| 오픈AI GPT-5.5-Cyber (오픈AI 에이전트) | 85.6% |
| 앤트로픽 Mythos 5 (앤트로픽 에이전트) | 83.8% |
| 오픈AI GPT-5.6 Sol (오픈AI 에이전트) | 83.6% |
| 제미나이 3.5 Flash Cyber (CodeMender, 최대 5회 호출) | 83.2% |
| 앤트로픽 Mythos Preview (앤트로픽 에이전트) | 83.1% |
구글은 이 기술이 공격에도 쓰일 수 있어 접근을 제한한다고 밝혔습니다. 모델 카드에는 앞선 Gemini 3 계열 모델들이 사이버 분야 경보 기준에 닿아 3.6 Flash는 이 분야를 추가로 시험했고, 사이버 분야의 치명적 능력 수준(CCL)에는 닿지 않았다는 내용이 들어 있습니다. 화학·생물·방사능·핵과 사이버 공격 악용을 막는 안전장치도 강화했다고 적었습니다.
| 날짜 | 있었던 일 |
|---|---|
| 2월 19일 | 제미나이 3.1 Pro 출시 |
| 5월 19일 | I/O에서 3.5 Flash 출시, 피차이 「3.5 Pro는 다음 달」 |
| 6월 24일 | 3.5 Flash에 컴퓨터 사용 도구 미리보기 추가 |
| 7월 21일 | 3.6 Flash·3.5 Flash-Lite·3.5 Flash Cyber 공개, 「3.5 Pro는 파트너와 시험 중」 |
순다르 피차이 CEO는 5월 19일 I/O 기조연설에서 3.5 Pro를 사내에서 쓰고 있고 큰 개선을 보이고 있다며 다음 달에 나온다고 말했습니다. 6월에는 나오지 않았고, 이번 발표문은 3.5 Pro가 파트너와 시험 중이며 준비되는 대로 넓게 풀겠다고 적었습니다. 같은 글에서 구글은 Gemini 4를 위해 지금까지 가장 야심 찬 사전학습을 시작했다고 밝혔습니다.
구글의 가장 최근 Pro 모델은 지금도 2월 19일 나온 3.1 Pro입니다. 이번 비교표에 3.1 Pro가 함께 실렸는데, 3.6 Flash는 코딩과 컴퓨터 조작, 긴 문맥까지 표에 오른 모든 항목에서 3.1 Pro보다 높았습니다. 저는 발표 당일 스레드에 Flash를 앞세운 배치가 계산된 선택일 수도 있지만, 3.5 Pro가 일정을 넘긴 것은 최상위 모델을 만드는 능력의 문제일 가능성도 있다고 적었습니다.
제미나이 앱 사용자는 발표 당일부터 3.6 Flash를 쓸 수 있습니다. 구글이 5월 I/O에서 밝힌 제미나이 앱 월간 사용자는 9억 명을 넘었고, 검색 AI 모드 월간 사용자는 10억 명을 넘었습니다. 3.6 Flash는 제미나이 앱으로, 3.5 Flash-Lite는 검색으로 같은 날 일반 사용자에게도 닿았습니다. 제가 밖에서 만나는 사무 현장에서도 문서와 이미지를 다루는 일에는 제미나이를 쓰는 곳이 가장 많고, 워크스페이스에 붙어 있어 따로 도입할 것이 없다는 이유를 자주 듣습니다.
API로 서비스를 만드는 개발사에는 챙길 변경이 두 가지 있습니다. 같은 날 Gemini API 변경 기록에는 temperature, top_p, top_k 같은 샘플링 매개변수를 폐기한다는 공지가 함께 올라왔고, 로건 킬패트릭은 2.5 Flash가 은퇴를 앞두고 있다고 적었습니다. 킬패트릭이 2.5 Flash와 같은 값의 대안으로 내세운 모델이 3.5 Flash-Lite입니다.
한국어로 쓸 때 참고할 숫자도 모델 카드에 있습니다. 여러 언어로 안전 정책 위반을 재는 자동 평가에서 3.6 Flash는 3.5 Flash보다 5.45%포인트 나아졌고, 지식 기준일은 2026년 3월이지만 일부 분야는 2025년 1월에 머물러 있습니다. 5월에 다음 달이라던 3.5 Pro는 7월 21일 현재 파트너 시험 단계이고, 나오는 대로 다시 전하겠습니다.
읽어 주셔서 고맙습니다.
초이 드림