이 글 어땠어요?
100만 토큰당 도입가로 입력 2달러, 출력 10달러이고 캐시 입력은 95% 할인한 0.10달러입니다. 도입 기간이 끝나면 입력 4달러, 출력 20달러로 오릅니다.
독립 평가기관 AA 지능 지수에서 아르곤은 53점으로 GPT-6 Astra와 같고 GPT-6.1 Sol보다 1점 높지만, Opus 5.5(58점)와 Sonnet 5.5(56점)보다는 낮습니다. 환각률은 15%로 가장 낮았습니다.
아직 쓸 수 없습니다. 지금은 Fairwind 프로그램의 사이버 방어 기관에만 열려 있고, 뒤에 유료 API 고객과 구글 AI 울트라 구독자부터 넓힙니다. 제미나이 API와 구글 AI 울트라는 한국을 지원해, 그 배포가 시작되면 한국에서도 열립니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
구글이 9월 30일(미국) 제미나이 채팅에 스킬을 넣고 Gems를 개인 계정은 11월, 워크스페이스는 2027년 3월·6월에 없앱니다. Gems는 스킬로 자동 전환되지만 Opal 미니 앱은 11월 17일 이전 없이 멈춥니다.

구글이 8월 13일 제미나이 3.7 Flash를 공개했습니다. 3.6 Flash 이후 3주 만이고 모델 카드는 구조와 학습 데이터가 3.6 Flash와 같다고 적었습니다. 입력 0.75달러·출력 3.75달러는 연말까지의 도입 가격이고 내년부터 두 배가 됩니다.
구글이 개인 계정 제미나이 앱의 모델 접근을 요금제별로 다시 나눕니다. 10월 9일부터 무료는 Flash-Lite만, AI Plus는 Flash까지 쓰고 Pro 모델은 AI Pro와 Ultra에 남습니다. 1월 AI Plus를 내놓을 때 구글이 앞세운 혜택이 3 Pro였습니다.

구글이 9월 30일(미국) 제미나이 채팅에 스킬을 넣고 Gems를 개인 계정은 11월, 워크스페이스는 2027년 3월·6월에 없앱니다. Gems는 스킬로 자동 전환되지만 Opal 미니 앱은 11월 17일 이전 없이 멈춥니다.
구글이 8월 13일 제미나이 3.7 Flash를 공개했습니다. 3.6 Flash 이후 3주 만이고 모델 카드는 구조와 학습 데이터가 3.6 Flash와 같다고 적었습니다. 입력 0.75달러·출력 3.75달러는 연말까지의 도입 가격이고 내년부터 두 배가 됩니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
@GoogleDeepMindX 게시물 · 원문 보기
구글 딥마인드 공식 계정이 한국 시각 10월 1일 새벽 5시 3분에 올린 공개 글입니다. 복잡하고 오래 걸리는 작업을 위한 새 프런티어 모델이고, Fairwind 프로그램을 거쳐 믿을 수 있는 사이버 방어자들에게 먼저 연다는 내용입니다. 비슷한 시각 순다르 피차이 CEO와 로건 킬패트릭도 같은 소식을 올렸고, 피차이는 구글 안에서 코딩부터 양자컴퓨팅까지 여러 팀이 이미 아르곤을 쓰고 있다고 적었습니다.
@sundarpichaiX 게시물 · 원문 보기
구글은 5월 제미나이 3.5 Flash를 시작으로 7월 3.6, 8월 3.7, 9월 3.8 Flash까지 Flash만 잇달아 냈습니다. 그동안 큰 모델은 2월에 낸 제미나이 3.1 Pro 프리뷰가 마지막이었고, 그사이 오픈AI는 GPT-6 Astra를, 앤트로픽은 Opus 5.5와 Fable 5.1을 내놓으며 최상위 모델 경쟁을 끌어갔습니다. 아르곤은 이 공백을 메우는 모델이고, 이름의 세대 숫자도 3에서 4로 올랐습니다.
독립 평가기관 아티피셜애널리시스(AA)는 아르곤을 두고 구글이 지능에서 상위 세 연구소 안으로 돌아왔다고 적었습니다. AA 지능 지수(평가 10개를 묶은 종합 점수)에서 아르곤은 가장 높은 설정으로 53점을 받아 GPT-6 Astra(53점)와 같았고, 하루 전 나온 GPT-6.1 Sol(52점)보다 1점 높았습니다. 구글의 지난 비(非)Flash 모델인 3.1 Pro 프리뷰(30점)보다 23점 올랐고, 3.8 Flash(41점)보다 12점 높습니다.
@ArtificialAnlysX 게시물 · 원문 보기
같은 지수에서 더 높은 모델도 있습니다. 앤트로픽 Opus 5.5는 58점, Sonnet 5.5는 56점으로 아르곤보다 위에 있습니다. 구글이 되찾은 것은 선두까지는 아니고 선두권 진입입니다. AA도 Astra와 동점이고 상위 세 연구소로 돌아왔다는 정도로 아르곤을 평가했습니다.
아르곤에서 가장 눈에 띄는 숫자는 환각률입니다. AA의 지식 평가 AA-Omniscience에서 아르곤의 환각률(모른다고 답해야 할 질문에 틀린 답을 지어낸 비율)은 15%로, 지능 지수 45점을 넘는 모델 가운데 가장 낮았습니다. 같은 평가에서 GPT-6 Astra는 51%, GPT-6.1 Sol은 54%, Opus 5.5는 59%였습니다. 아르곤은 틀린 답을 지어내는 대신 모른다고 답하는 쪽에 가깝고, AA는 이 낮은 환각률을 아르곤 점수 상승의 큰 이유로 꼽았습니다.
대신 정답률 자체는 높지 않습니다. AA-Omniscience 정답률은 50%로 3.1 Pro 프리뷰보다 5점 낮고 GPT-6 Astra(63%)보다 13점 아래였습니다. 아는 것은 덜 맞히지만 모르는 것을 덜 지어내서, 둘을 합친 종합 점수는 42로 Astra(43), GPT-6.1 Sol(42)과 비슷했습니다.
에이전트작업에서는 그동안 약했던 제미나이가 올라섰습니다. 업무 자동화를 재는 AutomationBench-AA에서 아르곤은 77.5%로 1위였고, Sonnet 5.5(71.3%)보다 6점 높았습니다. 터미널에서 여러 단계짜리 실무를 끝내는 Terminal-Bench 4.0에서는 57%로, Sonnet 5.5(64%)와 Opus 5.5(60%), GPT-6 Astra(59%) 다음이었습니다.
아르곤은 혼자 나온 모델이 아닙니다. 9월 하순 한 주 남짓 사이 앤트로픽 Opus 5.5(9월 23일)와 Sonnet 5.5(9월 29일), 오픈AI GPT-6.1 Sol(9월 30일)이 잇달아 나왔고, 아르곤이 그 끝에 붙었습니다. AA가 각 모델을 가장 높은 설정으로 잰 값을 모으면 이렇습니다.
| 모델(최고 설정) | 공개(한국 시각) | 입력·출력(100만 토큰) | AA 지능 지수 | 환각률 | 과제당 비용 |
|---|---|---|---|---|---|
| Claude Opus 5.5 | 9월 23일 | 4달러·20달러 | 58 | 59% | 5.98달러 |
| Claude Sonnet 5.5 | 9월 29일 | 2달러·10달러 | 56 | 47% | 7.60달러 |
| 제미나이 4 아르곤 | 10월 1일 | 2달러·10달러(도입가) | 53 | 15% | 1.99달러 |
| GPT-6 Astra | 9월 3일 | 10달러·50달러 | 53 | 51% | 3.26달러 |
| GPT-6.1 Sol | 9월 30일 | 2달러·10달러 | 52 | 54% | 0.72달러 |
과제당 비용은 AA가 지능 지수 과제 하나를 푸는 데 든 평균 비용입니다. 아르곤은 도입가로 1.99달러가 들어 GPT-6 Astra(3.26달러)의 약 60%였고, 같은 53점을 더 싸게 냈습니다. 다만 과제당 토큰을 적게 써서 싼 것은 아닙니다. 아르곤은 과제 하나에 평균 6만 2,000토큰을 썼고 GPT-6 Astra는 2만 7,000토큰을 썼으니, 토큰을 더 쓰고도 단가가 낮아 값이 내려간 쪽입니다. 가장 싼 모델은 GPT-6.1 Sol로, 과제 하나에 0.72달러가 들어 아르곤의 3분의 1 수준이었습니다. 같은 주에 나온 Opus 5.5와 GPT-6 Sol의 일 한 건 비용은 작업 한 건의 값을 다시 잰 글에서 다뤘습니다.
| 100만 토큰당 | 도입가(지금) | 정상가(할인 종료 후) |
|---|---|---|
| 입력 | 2달러 | 4달러 |
| 출력 | 10달러 | 20달러 |
| 캐시 입력 | 0.10달러 | 0.20달러 |
로건 킬패트릭 구글 AI 스튜디오 책임자는 공개 글에서 아르곤이 도입가로 입력 2달러, 출력 10달러에 나온다고 적었습니다. 구글 블로그 각주를 보면 이 값은 할인가이고, 도입 기간이 끝나면 입력 4달러, 출력 20달러가 됩니다. 캐시에 저장해 둔 입력을 다시 보낼 때의 할인은 입력가의 95%로, 3.8 Flash의 90%보다 커졌습니다.
@OfficialLoganKX 게시물 · 원문 보기
캐시 할인이 커진 것은 에이전트 작업과 맞물립니다. 에이전트는 한 단계를 밟을 때마다 지시문과 읽어 둔 코드를 다시 모델에 보내기 때문에, 긴 작업일수록 이 재전송분이 청구서에서 차지하는 비중이 커집니다. 95% 할인이면 같은 내용을 다시 보낼 때 드는 값이 표준 입력가의 20분의 1입니다.

구글도 자체 평가표를 함께 냈습니다. 표에서 제미나이 점수는 구글이 직접 계산했고, 경쟁 모델 점수는 각 회사가 발표한 값이나 공개 순위표에서 가져왔다고 평가 방법론 문서에 적혀 있습니다. 누가 어떤 틀로 쟀느냐에 따라 숫자가 달라지므로, 아래 표는 구글이 고른 평가에서 구글이 정리한 값입니다.
| 평가 | 제미나이 4 아르곤 | GPT-6 Astra | Claude Opus 5.5 | 재는 것 |
|---|---|---|---|---|
| DeepSWE v1.1 | 77.9% | 74.1% | 74.2% | 실제 저장소의 긴 소프트웨어 과제 |
| AutomationBench | 51.3% | 41.4% | 42.5% | 업무 흐름 자동 수행 |
| Harvey Legal Agent | 19.6% | 5.4% | 3.8% | 법률 조사와 문서 작성 |
| Terminal-Bench 4.0 | 57.4% | 58.2% | 66.4% | 터미널에서 여러 단계 실무 |
| Terminal-Bench Science 0.1 | 57.6% | 68.1% | 63.3% | 데이터 분석·시뮬레이션 등 연구 작업 |
| GraphWalks 256k~1M | 84.2% | 71.8% | 66.8% | 긴 문맥에서 관계 추적 |
| LVBench | 91.7% | 87.5% | 83.7% | 긴 영상 이해 |
구글 표에서 아르곤이 가장 높은 항목은 실제 저장소의 코딩 과제 DeepSWE(77.9%)와 업무 자동화, 법률·금융 업무, 긴 문맥, 긴 영상이었습니다. 반대로 터미널 실무를 재는 Terminal-Bench 4.0(57.4%)과 과학 연구 작업 Terminal-Bench Science(57.6%)에서는 Opus 5.5나 Astra가 앞섰습니다. 긴 작업을 버티도록 출력 한도도 늘렸습니다. 아르곤이 한 번에 내놓을 수 있는 토큰은 100만 개로, 이전의 6만 4,000개에서 크게 늘었습니다.
사람이 두 답을 견줘 더 나은 쪽을 고르는 아레나에서도 아르곤이 올라섰습니다. 아레나 운영사는 아르곤이 텍스트 아레나에서 1,525점으로 1위, 웹 개발 코드 아레나에서 1,679점으로 8위에 올랐다고 밝혔습니다. 텍스트 아레나에서는 2위 Claude Opus 4.6(1,505점)보다 20점 높았고, 웹 개발 부문 순위는 3.8 Flash의 29위에서 8위로 올랐습니다.
@arenaX 게시물 · 원문 보기
구글은 아르곤을 자사 엔지니어들이 먼저 쓰고 있다며 세 가지 사례를 들었습니다. 양자컴퓨팅 연구에서는 중요한 응용의 병목이 되는 서브루틴의 연산 자원을 줄이는 과제에서, 아르곤이 몇 분 만에 공개된 기준치를 40% 넘겼습니다. 데이터센터에서는 아르곤 에이전트들이 전체 사용 기록을 분석해 메모리 최적화를 적용했고, 배포가 끝나면 300TiB가 넘는 메모리가 풀리며 전체로는 500TiB에서 1PiB까지 아낄 것으로 봤습니다. 영상 디코더 libgav1에서는 아르곤 에이전트가 러스트 코드 3만 2,000줄을 다시 짜, 같은 영상 결과를 내면서 2.7배 빠른 디코더를 만들었습니다. 구글은 이런 대규모 재작성은 운영에 올리기 전에 자동·수동 검수와 시험을 거친다고 덧붙였습니다.
아르곤에서 가장 다른 점은 쓸 수 있는 사람이 정해진 순서입니다. 구글은 아르곤을 Fairwind 프로그램에 든 사이버 방어 기관에 먼저 열었습니다. 개발자와 기업, 일반 사용자는 그다음입니다. Fairwind는 구글이 정부와 국가 사이버 당국, 의료·통신·에너지·금융 같은 주요 기반시설 운영사, 널리 쓰이는 소프트웨어 플랫폼에 먼저 고성능 모델을 주는 프로그램으로, 전 세계 650곳이 넘는 파트너가 들어와 있습니다. 구글은 이들에게 아르곤을 사이버 안전장치 없이 열어 방어 능력을 끝까지 쓸 수 있게 한다고 밝혔습니다.
구글이 든 이유는 방어자에게 먼저 시간을 벌어 주겠다는 것입니다. 구글은 프런티어 모델이 취약점을 빠르게 찾아 고치도록 도울 수 있지만, 같은 능력이 잘못된 손에 들어가면 똑같이 강한 위협이 된다고 적었습니다. 그래서 방어자에게 먼저 쥐여 줘, 새 위협이 오기 전에 중요한 시스템을 지킬 시간을 준다는 설명입니다.

능력 자체는 숫자로도 나왔습니다. 취약점을 고치는 능력을 재는 CWE-bench v1에서 아르곤은 68%로 공동 1위였고, 소스 코드를 훑어 취약점을 찾는 구글 내부 평가에서는 20개 언어에 걸쳐 85.8%를 기록해 보안 특화 모델 3.8 Flash Cyber(71.0%)를 앞섰습니다. 바깥에서 숨겨 넣은 지시로 모델의 행동을 가로채려는 간접 프롬프트 주입을 막는 Gray Swan 평가에서는 15번 시도 기준 공격 성공률 0.7%로 가장 낮았다고 구글은 밝혔습니다.
이 배포 순서는 앤트로픽이 사이버 모델 Mythos를 다루는 방식과 닮았습니다. 앤트로픽은 가장 강한 사이버 모델을 검증된 방어 기관에만 여는 Project Glasswing을 운영하고 있고, 구글 Fairwind도 접근을 방어 목적으로 좁히고 다중 인증과 배경 조사를 겁니다. 두 회사 모두 사이버 능력을 열되 받는 쪽을 가려 받습니다.
오픈AI는 같은 문제에 다른 길을 골랐습니다. 오픈AI는 9월 초 GPT-6 Astra를 사이버 최고 위험 등급으로 스스로 매기고도 출시하면서, 능력은 그대로 두고 거부율을 91.5%까지 올리고 감시와 사용자 심사를 붙였습니다. 프런티어 사이버 능력을 누구에게 어떻게 열지를 두고, 구글과 앤트로픽은 방어자 우선으로, 오픈AI는 거부와 심사 강화로 답했습니다. 세 방식 모두 가중치를 회사가 쥐고 창구를 골라 연다는 점은 같습니다.
아르곤은 지금 누구나 쓸 수 있는 모델이 아닙니다. 구글은 미국 정부의 출시 전 모델 접근 자율 절차에 참여하면서 안전장치를 단계적으로 보강하고 있고, 개발자와 기업, 일반 사용자에게는 그 뒤에 넓힌다고 밝혔습니다. 넓힐 때는 유료 API 고객과 구글 AI 울트라 구독자부터 시작합니다.
구글이 보강한다고 든 안전장치는 네 갈래입니다. 사이버와 생화학 공격에 악용되는 것을 막는 거부 장치, 간접 프롬프트 주입 방어, 모델이 사용자 의도를 넘어서는지 추론 과정을 지켜보는 감시, 고위험 시험을 격리된 환경에서 돌리는 장치입니다. 구글은 이 장치들을 사내외 레드팀이 수동·자동 공격으로 시험했다고 적었습니다.
한국 개발자와 사용자가 지금 당장 아르곤을 쓸 길은 없습니다. Fairwind 파트너가 아니면 접근할 수 없고, 공개 일정은 나오지 않았습니다. 넓어지는 순서가 유료 API 고객과 구글 AI 울트라 구독자부터인데, 제미나이 API와 구글 AI 울트라는 모두 한국을 지원하는 서비스입니다. 그 배포가 시작되면 한국의 유료 API 이용자와 AI 울트라 구독자도 아르곤을 쓸 수 있고, 다만 그 시점은 아직 구글이 밝히지 않았습니다.
한국의 보안팀에는 Fairwind 쪽도 열려 있습니다. 구글은 정부와 국가 사이버 당국, 의료·통신·에너지·금융 같은 기반시설 운영사, 널리 쓰이는 소프트웨어 플랫폼을 우선 받고 신청을 수시로 검토한다고 밝혔습니다. 윤리적 운영 이력을 확인하는 심사를 거치면 한국 기관도 신청 대상에 들어갑니다.
API로 제미나이를 붙여 쓰는 국내 팀에는 가격과 캐시 할인이 바로 걸리는 항목입니다. 도입가 2달러·10달러는 같은 값의 GPT-6.1 Sol, Sonnet 5.5와 겹치고, 캐시 할인 95%는 지시문과 문서를 반복해 보내는 에이전트의 청구서를 줄입니다. 다만 도입가가 끝나면 단가가 두 배가 되므로, 그때의 과제당 비용은 지금 계산과 달라집니다. 할인 종료 시점은 구글이 아직 밝히지 않았습니다. 정상가와 할인 종료 날짜가 나오면 다시 전하겠습니다.
읽어 주셔서 고맙습니다.
초이 드림