이 글 어땠어요?
결과가 나오면 맞았는지 그대로 적어요.
2036년 최전선 슈퍼컴퓨터는 공장에서 만든 몇 MW짜리 랙에 물과 전력, 광섬유만 꽂는 형태가 된다
우주 데이터센터에는 근본적으로 가로막는 문제가 없다
FLOPS는 칩이 이론상 낼 수 있는 연산량이고, 굿풋은 고장과 체크포인트 재시작, 소프트웨어 버그로 잃은 시간을 뺀 실제 작업량입니다. 바흐다트는 가속기 10만 개 규모면 하루에도 여러 번 고장이 난다며 굿풋으로 성과를 잰다고 했습니다.
2년쯤 전 추론이 칩 수명 동안 시장의 30~60%가 될 것으로 보고 학습용과 추론용으로 특화했습니다. 다만 수요가 어느 쪽으로 쏠릴지 몰라 두 칩 모두 상대의 일을 할 수 있게 만들었습니다.
바흐다트는 전력망 연결을 기본으로 하고 새로 필요한 송전선과 변전 설비 비용을 구글이 낸다고 했습니다. 모자란 전력은 기다리거나 태양광과 배터리로 메우고, 전력망을 거치지 않는 자체 발전은 드물다고 했습니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.

진행자인 세쿼이아 파트너 소냐 황은 구글 한 회사가 올해 설비투자에 2,000억 달러 넘게 쓸 것으로 보인다며 대화를 열었습니다. 알파벳은 7월 2분기 실적에서 올해 설비투자 전망을 1,800억~1,900억 달러에서 1,950억~2,050억 달러로 올렸고, 2분기에만 1년 전의 두 배인 449억 달러를 썼습니다. 순다르 피차이 CEO는 같은 발표에서 구글의 모델 API가 분당 약 220억 토큰을 처리한다며 아직 공급이 모자란다고 말했습니다.
바흐다트는 2025년 12월 피차이에게 직접 보고하도록 새로 만든 AI 인프라 수석 기술책임자로 승진했습니다. 테크크런치는 그 인사를 AI 인프라 경쟁에 대한 구글의 답이라고 썼습니다. 그전에는 머신러닝·시스템·클라우드 AI 부사장으로 2025년 4월 7세대 TPU Ironwood를 무대에서 발표했고, 올해 4월 22일에는 8세대 TPU를 소개하는 구글 블로그 글을 직접 썼습니다.
바흐다트가 FLOPS를 믿지 않는 이유는 학습이든 서빙이든 에이전트 작업이든 많은 작업이 동기식이라서입니다. 칩 수천, 수만 개가 마이크로초나 밀리초 단위로 맞춰 움직이다 하나가 멈추면 전체가 멈추고, 어느 칩이 멈췄는지 찾고 이전 체크포인트(계산 중간 상태를 저장해 둔 지점)를 불러와 다시 시작하는 동안 하는 일은 모두 답을 내는 데 보탬이 되지 않습니다. 종이에 문제를 풀다 실수해 1단계로 돌아가도 일은 일이지만, 문제를 다 푸는 데 걸린 시간이 늘어나는 것과 같다는 설명입니다.
그 규모라면 하루에도 여러 번, 구성에 따라서는 한 시간에도 여러 번 무언가가 고장 날 겁니다.— 아민 바흐다트, 구글 AI·인프라 수석 기술책임자 (Training Data)
가장 흔한 고장 원인을 묻자 그는 그런 것이 있었다면 벌써 고쳤을 거라고 답했습니다. 칩 하나가 여러 칩렛과 HBM(고대역폭 메모리), 광 부품을 묶은 패키지라 고장 날 곳이 많고, 하드웨어가 완벽해도 컴파일러나 런타임, 모델, 운영체제 버그 하나가 전체 성능을 깎는다는 겁니다. 굿풋은 구글이 만든 말인데 업계에서도 쓰기 시작했다고 했습니다.
흔한 고장 원인이 있었다면 벌써 알아내서 고쳤을 겁니다. 끊임없이 새로 발견하는 긴 꼬리입니다.— 아민 바흐다트, 구글 AI·인프라 수석 기술책임자 (Training Data)
이 지표는 제품 사양에도 들어갔습니다. 구글은 TPU 8t가 97%가 넘는 굿풋을 목표로 한다고 밝히면서, 수만 개 칩의 상태를 실시간으로 보는 원격 측정, 작업을 멈추지 않고 고장 난 칩 간 연결(ICI)을 돌아가는 기능, 사람 손 없이 하드웨어 구성을 바꾸는 광회로 스위칭을 근거로 들었습니다. 같은 글은 프런티어 학습 규모에서는 1%포인트가 며칠치 학습 시간과 맞먹을 수 있다고 적었습니다.
황은 바흐다트가 사내에 6개월마다 서빙 용량을 두 배로 늘려야 한다고 말했다는 이야기를 꺼냈습니다. 2025년 11월 CNBC가 사내 전체 회의 발표 자료에서 「이제 6개월마다 두 배가 돼야 한다. 다음 1,000배는 4~5년 안에」라는 문구를 보도한 일입니다. 구글은 당시 그만한 규모의 설비 증설을 말한 것은 아니었다고 해명했고, CNBC는 수요를 용량 증설과 효율 개선 양쪽으로 맞춘다는 취지가 더 정확히 드러나도록 기사를 고쳤습니다. 바흐다트는 이번 방송에서 그 말을 직접 풀어 설명했습니다.
6개월마다 두 배로 늘려야 하는 것은 그 하드웨어로 토큰을 만들어 내는 능력입니다. 그중 소프트웨어에서 나오는 부분이 하드웨어에서 나오는 부분만큼이거나 그보다 많을 겁니다.— 아민 바흐다트, 구글 AI·인프라 수석 기술책임자 (Training Data)
그는 모델과 런타임의 최적화 수십, 수백 개가 쌓여 이 속도를 만들고, 와트당 지능으로 따지면 이득의 대부분이 모델 쪽에서 왔다고 했습니다. 하드웨어는 해마다 두 배 넘게 좋아지는 곱셈 인자이고, 그 위의 모든 소프트웨어가 이 배수를 믿고 움직인다는 설명입니다.
숫자로 풀면 이렇습니다. 6개월마다 두 배는 1년에 4배이고, 5년이면 2의 10제곱인 1,024배라서 「4~5년에 1,000배」와 맞아떨어집니다. 하드웨어가 해마다 2배를 맡으면 나머지 2배는 해마다 소프트웨어와 모델이 채우는 구조입니다. 피차이가 밝힌 모델 API 처리량은 한 분기 전 분당 160억 토큰에서 220억 토큰으로 37.5% 늘었는데, 6개월마다 두 배인 속도를 분기로 나누면 약 41%입니다. API 토큰은 구글 서빙의 일부라서 두 숫자를 그대로 겹칠 수는 없지만, 증가 속도는 비슷한 범위에 있습니다.
TPU는 2013년 구글 안에서도 성공을 장담하지 못한 역발상이었습니다. 무어의 법칙이 18~24개월마다 성능을 두 배로 올려 주던 때라 단일 워크로드용 칩을 따로 만들지 않는 것이 상식이었습니다. 황이 이를 「칩의 쓴 교훈」이라고 부르자 바흐다트는 특화는 이기지 못한다는 교훈이라고 받았습니다. 첫 TPU는 번역과 음성 인식 추론용이었고, 두 번째 칩부터 학습을 맡았으며, 그 무렵 트랜스포머가 나오면서 프로그램의 방향이 완전히 달라졌다고 했습니다.
8세대를 둘로 나눈 결정은 2년쯤 전에 내렸습니다. 2026년에 추론과 학습을 모두 잘하는 칩 하나를 낼지, 각각에 더 특화한 칩 둘을 낼지 따졌고, 추론이 칩 수명 동안 시장의 30~60%가 될 것으로 보이자 특화가 맞는 계산이 됐다고 했습니다. 추론이 2~5%라면 두 배 빠른 전용 칩도 맞지 않았을 수 있다는 설명입니다. 다만 6년인 하드웨어 수명 동안 수요가 어느 쪽으로 쏠릴지 몰라, 8i와 8t 모두 상대의 일을 할 수 있게 만들었다고 했습니다.
하드웨어는 특정 워크로드에 맞출수록 덜 유연해지는 대신 더 빠르고 전력 효율이 높아집니다.— 아민 바흐다트, 구글 AI·인프라 수석 기술책임자 (Training Data)


구글 발표에 따르면 8i는 칩 하나에 HBM 288GB와 온칩 SRAM 384MB(Ironwood의 3배)를 붙여 추론 모델의 KV 캐시(앞서 계산한 문맥을 저장해 두는 메모리)를 칩 안에 담고, 같은 비용으로 고객을 두 배 가까이 받는다고 했습니다. 아예 트랜스포머를 칩에 새기면 어떠냐는 질문에 바흐다트는 행렬·벡터 곱셈과 소프트맥스는 이미 하드웨어에 들어 있고, 그다음은 특정 모델의 레이어 수와 행렬 모양까지 새기는 단계라며 그쪽을 고민하는 회사들도 있다고 했습니다. AMD가 인수한 모델 하나를 칩에 새기는 Taalas가 그런 예입니다.
구글은 생산 중인 칩부터 제조사에서 돌아와 검증 중인 칩, 테이프아웃(설계를 확정해 제조사에 넘기는 단계)을 앞둔 칩, 설계 단계와 구상 단계의 칩까지 대여섯 단계의 칩을 동시에 다룹니다. 하드웨어는 2~5년 앞서 계획하고, 9세대와 10세대도 구상이나 실행 단계에 있다고 했습니다. 딥마인드가 모델 쪽에서 큰 개선을 찾으면 두 팀이 며칠에서 2주까지 한 방에 모여, 필요하면 테이프아웃을 1~2주 미루고 진행 중인 칩 구조를 바꾼다는 설명입니다. 테이프아웃 직전의 칩이라면 0.5~1% 개선 정도로는 연구자들이 아예 찾아오지 않는다고 했습니다.
그가 놀랍다고 한 것은 TPU의 중간 수준 구조가 1세대 이후 거의 바뀌지 않았다는 사실입니다. 커다란 행렬 곱셈 장치, 벡터 연산과 흩어 모으기(scatter-gather)를 맡는 SparseCore, 칩 간 연결망으로 다른 칩의 메모리를 바로 읽고 쓰는 기능 등 다섯, 여섯 가지 기본 요소가 여러 세대의 모델을 받쳐 왔다고 했습니다.
우리는 Gemini로 미래의 Gemini를 위한 하드웨어도 설계하고 있습니다.— 아민 바흐다트, 구글 AI·인프라 수석 기술책임자 (Training Data)
공개된 사례도 있습니다. 딥마인드는 2025년 5월 Gemini 기반 코딩 에이전트 AlphaEvolve가 행렬 곱셈용 연산 회로의 불필요한 비트를 덜어낸 설계를 제안했고, 그 제안이 다음 TPU에 들어갔다고 밝혔습니다. 같은 에이전트가 찾은 작업 배치 규칙은 구글 데이터센터 전체 연산 자원의 평균 0.7%를 되찾았습니다. 바흐다트는 하드웨어 엔지니어들이 이제 소프트웨어 엔지니어만큼 AI를 쓰고, 설계 착수부터 테이프아웃까지와 칩을 처음 켜서 검증하는 기간이 짧아지고 있다고 했습니다.
공동 설계의 반대편도 짚었습니다. 어느 하드웨어에서든 돌도록 추상화하면 새 용량이 생기는 즉시 옮겨 갈 수 있지만, 하드웨어와 소프트웨어, 네트워크의 단계마다 10~20%, 많게는 2배의 성능을 버리게 됩니다. 그래서 구글은 JAX를 좋아하면서도 파이토치 모델을 고치지 않고 TPU에서 돌리는 TorchTPU를 함께 낸다며, 인터넷 프로토콜(IP)이 이긴 이유를 개방형 표준에서 찾았습니다. 그 TPU를 쓰는 바깥 고객에는 경쟁사 앤트로픽도 있고, 앤트로픽은 4월 구글·브로드컴과 2027년부터 쓸 차세대 TPU 계약을 맺었습니다.
황은 올해 초부터 장기 에이전트가 늘었다며 데이터센터에 무엇이 필요해지느냐고 물었습니다. 바흐다트가 든 첫 변화는 사람이 사라진 것입니다. 사람은 답을 읽고 생각한 뒤 다음 질문을 하느라 몇 초를 쓰지만, 에이전트는 답을 받자마자 다음 요청을 보내 간격이 밀리초로 줄어든다는 겁니다. 두 번째로 그 사이의 판단과 정리는 CPU에서 일어납니다. 다음 요청을 만들려고 다른 CPU의 D램이나 SSD, 하드디스크에서 맥락을 모아 오는 조율이 붙으면서, 가속기와 함께 CPU와 네트워크, 스토리지 수요도 치솟는다고 했습니다.
8세대 TPU에도 그 흔적이 있습니다. 구글은 8i 서버 한 대에 들어가는 CPU 호스트를 두 배로 늘리고 자체 Arm 칩 Axion으로 바꿨다고 밝혔습니다. 바흐다트는 CPU 랙을 TPU 랙 옆에 두면 건물을 TPU 밀도에 맞춰 특화할 수 없고, 건물을 따로 지으면 건물 사이 네트워크 비용과 수백 마이크로초의 지연이 붙는다며 설계의 저울질이 바뀌고 있다고 했습니다. 10월 4일 공개된 Lenny's Podcast에서는 오픈AI의 티보 소티오가 인터넷에서 일어나는 행동의 대부분을 에이전트가 하게 된다고 내다봤습니다.
구글은 15~16년 전 광섬유 한 가닥에 여러 신호를 싣는 파장 분할 다중화를 데이터센터에 들이면서 광회로 스위칭(OCS)도 함께 도입했습니다. 전기 스위치가 패킷마다 주소를 읽어 내보내는 것과 달리, 광회로 스위치는 미세 전기기계 장치(MEMS)로 움직이는 거울의 각도를 바꿔 들어온 빛을 다른 출구로 보냅니다. 처음에는 서로 자주 통신하는 랙 묶음 사이에 지름길을 내고, 광섬유를 옮기지 않고 네트워크를 늘리거나 줄이려고 썼다고 했습니다.
TPU에서는 쓰임이 하나 더 생겼습니다. TPU 랙 하나가 고장 나면 늘 대기 중인 예비 랙으로 빛의 방향을 바꿔, 사람이 광섬유를 다시 꽂지 않고 몇 밀리초 만에 갈아 끼웁니다. 구글이 2023년 공개한 TPU v4 논문은 광회로 스위치와 광 부품이 시스템 비용의 5%, 전력의 3%에 못 미친다고 적었습니다.

가장 큰 제약을 묻자 바흐다트는 모든 것이 제약이고 계속 바뀐다면서도 하나를 골랐습니다.
근본적으로 하나를 꼽으라면 전력이 가장 근본적인 제약입니다. 다른 것은 푸는 방법을 알고, 시간을 들여 푸는 문제로 보입니다.— 아민 바흐다트, 구글 AI·인프라 수석 기술책임자 (Training Data)
그가 밝힌 구글의 기본값은 전력망 연결입니다. 기가와트급이면 전력회사에 여러 해 앞서 알리고 함께 계획하며, 구글 때문에 새로 짓거나 늘리는 송전선과 변전 설비 비용은 다른 소비자의 요금이 오르지 않게 구글이 낸다고 했습니다. 2028년에 1GW가 필요한데 전력회사가 그해 700MW만 댈 수 있으면, 1년을 기다리거나 남는 300MW를 태양광과 배터리 같은 자체 발전으로 메우고, 전력망이 다 연결된 뒤에는 가장 더운 2주처럼 수요가 몰릴 때 그 발전분을 전력망에 돌려줄 수 있다는 예도 들었습니다.
그가 든 이유는 통계적 다중화, 곧 큰 집단에 기댈수록 변동이 줄어드는 확률 계산이었습니다. 1GW를 99.99% 넘는 신뢰도로 혼자 확보하려면 이중화 때문에 2GW를 지어야 하지만, 큰 전력망에 기대면 서로 남는 전력을 주고받아 모두가 이득을 본다는 겁니다. 계량기 뒤(전력망을 거치지 않는 자체 발전)로 가는 일은 드물고, 그때도 1년쯤 뒤 전력망에 연결한다는 전제로 한다고 했습니다. 구글은 3월 백악관의 요금 납부자 보호 서약에 서명하며 데이터센터가 쓰는 전력과 성장으로 생기는 새 인프라 비용을 100% 내겠다고 밝혔고, 같은 글에 가능한 곳에서는 새 발전소 옆에 데이터센터 부하를 짓는 인터섹트 파워와의 협력도 적었습니다. 방송 공개 당일에는 컨스텔레이션과 원자로 11기 출력 증강 890MW를 포함한 약 3.6GW 계약을 발표했습니다.
칩의 쓸모 있는 수명을 묻자 바흐다트는 예전 발언을 다시 꺼냈습니다.
7년, 8년 된 우리 TPU가 아직도 100% 가동된다고 말했습니다.— 아민 바흐다트, 구글 AI·인프라 수석 기술책임자 (Training Data)
그 말이 그렇게 널리 퍼질 줄 몰랐다는 그는 감가상각 기간이 약 6년이라, 상각이 끝나고 새 세대의 전력 효율이 충분히 높으면 바꾼다고 했습니다. 교체할 때는 칩 9,600개에 랙 140~152개쯤인 포드를 통째로 빼고 TPU 12세대나 14세대 포드를 넣는데, 새 포드의 크기가 빈 공간과 맞지 않아 개조가 필요하다는 겁니다. 서빙 클러스터가 학습 클러스터보다 MW당 반드시 싸지도 않다고 했습니다. 서빙은 스토리지와 연산, 가속기를 섞어 세계 곳곳에 나눠 두어야 해서 한곳에 몰아 특화하기 어렵다는 설명입니다.
구글이 우주 데이터센터 연구 계획 Suncatcher를 문샷이라고 부르는 이유도 전력입니다. 바흐다트는 우주에서는 대기 감쇠가 없어 태양광이 약 1.4배이고, 태양동기궤도에서는 햇빛을 받는 시간이 98~100%로 지상의 28~35%보다 3~4배 길어 배터리를 거의 뺄 수 있다고 했습니다. 두 배수를 곱하면 4~6배쯤이고, 구글 리서치는 2025년 11월 알맞은 궤도에서 태양광 패널의 생산성이 최대 8배라고 적었습니다. 첫 시험 위성은 10월 2일 궤도에 올라 교신에 성공했습니다.
우주에서는 냉각이 쉬울 거라고 단순하게 생각할 수 있지만, 실제로는 더 어렵습니다.— 아민 바흐다트, 구글 AI·인프라 수석 기술책임자 (Training Data)
수리도 어렵고 위성 사이는 광섬유 대신 레이저로 이어야 하지만, 그는 근본적으로 가로막는 문제는 없다고 했습니다. 10년 뒤 가장 앞선 슈퍼컴퓨터로는 공장에서 통째로 만든 랙 하나가 몇 MW를 쓰고, 설치할 때는 물과 전력, 가는 광섬유 다발 셋만 꽂는 모습을 그렸습니다.
한국 메모리 업계와 닿는 숫자도 있습니다. TPU 8i는 칩 하나에 HBM 288GB, 8t 포드 하나에 HBM 2PB가 들어가지만 구글은 어느 회사의 HBM인지 밝히지 않았습니다. 8세대 TPU는 올해 안에 정식 출시될 예정이며, 굿풋 97%는 구글이 내건 목표치로 실제 값은 공개되지 않았습니다. 컨스텔레이션 계약의 첫 출력 증강은 2028년이고, 구글은 Suncatcher 위성에서 몇 주 동안 궤도 데이터를 모으겠다고 했습니다. TPU 8의 실제 굿풋과 첫 궤도 결과가 나오면 이어서 전하겠습니다.
읽어 주셔서 고맙습니다.
초이 드림