이 글 어땠어요?
결과가 나오면 맞았는지 그대로 적어요.
세상은 소수 연구소의 범용 모델 대신 회사마다 하나씩, 수백만 개의 특화 모델로 나뉜다
2027년 소비자용 서비스에서 생성 AI의 쓰임새가 크게 열린다
미국 안에서 폐쇄형과 오픈 모델의 성능 격차가 줄어든다
린 차오는 하루 40조 토큰이 자기들이 아는 한 오픈AI와 제미나이 API보다 많다고 했지만, 각 회사가 토큰을 어떻게 세는지는 모른다는 단서를 달았습니다. 파이어웍스 공동창업자는 세미애널리시스 추정을 인용해 앤트로픽 처리량의 20% 수준이라고 적었습니다.
린 차오는 오픈 모델이 토큰 가격으로 10배쯤 싸지만 답이 1.5~2배 길어 같은 작업의 비용은 5~6배 싸다고 봤습니다. 그가 소개한 검루프는 사내 에이전트를 Opus 4.8에서 GLM-5.2로 바꿔 비용을 약 5분의 1로 줄였습니다.
그는 지정학 논쟁과 오픈이냐 폐쇄냐의 논쟁을 떼어 봐야 한다며 업계 전체가 더 많은 오픈 지능을 장려할 때라고 했고, 미국 회사들이 최고의 모델을 공개하지 말아야 할 이유를 찾지 못했다고 말했습니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
을 돌리고 고쳐 주는 파이어웍스(Fireworks)의 린 차오(Lin Qiao) CEO가 8월 3일(한국 시각) 공개된 Gradient Dissent에서, 파이어웍스가 하루 40조 토큰 넘게 처리해 오픈AI와 구글 제미나이의 API보다 많다고 말했습니다. 그 트래픽의 95%는 고객이 자기 데이터로 고친 맞춤 모델에서 나오고, 그는 세상이 몇몇 프런티어 연구소의 모델 대신 회사마다 자기 모델을 갖는 쪽으로 간다고 봤습니다. 7월 22일 백악관이 중국 오픈 모델의 증류를 문제 삼고 이틀 뒤 미국 기업들이 오픈웨이트 지지 서한을 낸 논쟁 속에서, 에피소드는 미국 회사가 중국 모델을 써도 되느냐는 물음으로 시작합니다.
@FireworksAI_HQX 게시물 · 원문 보기
40조라는 숫자는 파이어웍스가 7월 15일 블로그와 다음 날 X에 낸 투자 발표에 먼저 나왔습니다. 아트레이디스 매니지먼트와 인덱스 벤처스, TCV가 주도하고 엔비디아 등이 참여한 시리즈 D로 15억 500만 달러를 받았고, 기업가치는 175억 달러로 매겨졌습니다. 발표문은 연 환산 매출이 10억 달러를 넘었고, 하루 40조 토큰 이상을 서빙하며 그 95% 넘게가 고객의 자체 데이터로 특화한 모델에서 나온다고 적었습니다. 린 차오는 7월 21일(미국 시각) X에 3년 반, 직원 200명으로 연 환산 매출 10억 달러를 만들었다고 적었습니다. 매출을 직원 수로 나누면 1인당 500만 달러입니다.
린 차오는 링크드인을 거쳐 메타에서 파이토치 개발에 참여했습니다. 대담에서 그는 2015년 무렵 창업을 마음먹었지만 회사를 꾸리는 법을 배우려고 메타로 옮겼고, 거기서 누구 코드든 버그를 보면 고치는 극단적인 주인의식을 배웠다고 했습니다. 5년 전 메타가 겪은 AI 인프라 문제를 산업 전체가 똑같이 겪으며 파이토치 팀에 학습과 서빙 플랫폼을 만들어 달라는 요청이 몰리자, 자신을 뺀 공동창업자 6명과 파이어웍스를 세웠다는 설명입니다.
파이어웍스가 밝혀 온 하루 처리량을 날짜순으로 놓으면 이렇습니다. 5월 말부터 7월 중순까지 회사와 공동창업자가 공개한 숫자만 모았습니다.
| 시점(미국 시각) | 하루 처리 토큰 | 출처 |
|---|---|---|
| 5월 28일 | 30조 | 파이어웍스 X |
| 7월 8일 | 30조 이상(월 1,000조) | 드미트로 줄가코프 공동창업자 X |
| 7월 15일 | 40조 이상, 95% 이상이 맞춤 모델 | 시리즈 D 발표 |
린 차오는 대담에서 이 처리량이 자기들이 아는 한 오픈AI와 제미나이의 API보다 많다고 했습니다. 여기서 처리량은 모델에 넣는 입력 토큰과 모델이 내는 출력 토큰을 합친 값입니다. 진행자인 웨이츠앤드바이어시스(W&B) 창업자 루카스 비월드가 정말 오픈AI API보다 많으냐고 되묻자, 그는 각 회사가 이 숫자를 어떻게 세는지는 모르지만 숫자로만 보면 자기들이 더 많다고 답했습니다. 한데 비교 대상을 앤트로픽으로 바꾸면 그림이 달라집니다. 줄가코프는 7월 8일, 세미애널리시스가 앤트로픽의 6월 처리량을 월 5,000조 토큰으로 내다봤다는 게시물을 인용하며 파이어웍스는 월 1,000조 토큰으로 그 20% 수준이라고 적었습니다.
매출로 나눠 보면 이 사업의 단가가 보입니다. 연 환산 매출 10억 달러를 하루로 나누면 약 274만 달러이고, 이를 하루 40조 토큰으로 다시 나누면 100만 토큰당 7센트쯤입니다. 매출에는 학습과 전용 배포 요금도 들어 있으니 토큰에서 버는 돈은 이보다도 적습니다. 파이어웍스가 7월 27일(미국 시각) 올린 Kimi K3의 표시 가격은 100만 토큰당 입력 3달러, 출력 15달러, 캐시된 입력 0.3달러이고, 평균 단가 7센트는 이 가운데 가장 싼 캐시 입력 가격의 4분의 1에도 못 미칩니다.
린 차오의 세계관은 지능이 데이터에서 나온다는 가정에서 출발합니다. 프런티어 연구소가 처음부터 모델을 학습할 때 쓰는 데이터는 공개 인터넷과 라벨링 데이터인데, 세상 데이터의 대부분은 애플리케이션과 기업 안에 갇혀 있고 그것이 그 회사의 수익원이라 누구에게도 넘기면 안 된다는 겁니다. 그래서 그 데이터로 회사마다 자기 모델을 만들고, 제품과 기반 모델이 바뀌는 속도에 맞춰 특화 작업도 매주, 빠르면 몇 시간마다 이어진다고 했습니다.
세상은 양강 체제가 되지 않을 겁니다. 애플리케이션마다, 쓰임새마다 하나씩, 수백만 개의 특화 모델이 있는 세상이 될 겁니다.— 린 차오, 파이어웍스 CEO (Gradient Dissent)
오픈AI도 파인튜닝 API를 낸 적이 있는데 왜 크게 쓰이지 않았느냐는 물음에는 수지 구조로 답했습니다. 처음부터 학습하는 데 막대한 돈이 드니, 연구소로서는 모델 몇 개를 API로 묶어 최대한 빨리 넓게 파는 편이 가장 효율적이고, 수백만 개의 모델을 받쳐 주는 일은 전혀 다른 사업이라는 겁니다. 그는 파인튜닝 서비스에도 시장은 있다며, 연구소가 집중하는 방향과 맞지 않을 뿐이라고 했습니다.
고객이 파이어웍스를 쓰는 방식은 회사마다 다릅니다. 커서(Cursor)는 자체 코딩 모델 Composer를 파이어웍스의 학습 스택에서 강화학습으로 만들며 모든 설정값을 직접 쥐고, 파이어웍스는 커서의 학습기와 연결해 롤아웃 추론을 맡습니다. 의사용 딥리서치를 만드는 독시미티(Doximity)는 의학 용어를 모델에 익히려고 지도 미세조정(SFT)과 선호 학습, 강화학습을 섞어 씁니다. 린 차오는 지도 미세조정을 교과서를 외우는 일에, 강화학습을 여러 방식으로 시도해 보고 보상에 따라 방향을 고치는 일에 빗댔습니다. 그는 강화학습의 보상을 설계하는 데 의사에게 어떤 검색 결과가 좋은지 같은 판단이 필요해서, 모델을 다루는 제품 담당자라는 새로운 유형의 사람이 생기고 있다고 했습니다.
젠슨 황의 한마디도 옮겼습니다. GTC 기조연설 뒤 함께 영상을 찍을 때 황이 특화된 범용 회사는 없다고 지나가듯 말했는데, 곱씹어 보니 모든 회사가 저마다의 문제를 저마다의 방식으로 푸는 이상 그 판단과 취향은 범용 모델에 담기지 않는다는 뜻이었다고 했습니다.
두 번째 근거로 그는 돈 문제를 꺼냈습니다. SaaS 시절에는 제품이 시장에 맞기만 하면 오래가는 사업이 됐지만, 생성 AI 시대에는 지능을 돌리는 비용이 비싸 두 가지가 따로 논다고 했습니다.
고객이 사랑하고 돈도 내고 싶어 하는 제품을 가진 스타트업이 많은데, 그들은 사업을 키우지 못합니다. 파산을 향해 확장하고 있기 때문이고, 이제는 그게 보통입니다.— 린 차오, 파이어웍스 CEO (Gradient Dissent)
이미 고객이 많은 큰 회사일수록 사정이 나쁘다고 그는 봤습니다. AI 기능을 모든 고객에게 켜는 비용이 막대해 투자 대비 효과를 월가에 설명해야 하고, 사내 코딩 에이전트 비용도 부담입니다. 올해 초까지 토큰을 최대한 쓰던 분위기가 이제 가치를 따지는 쪽으로 옮겨 가고 있다는 것이 그의 관찰입니다. 그가 든 계산은 이렇습니다. 오픈 모델은 표시 가격으로 10배쯤 싸지만 답이 1.5~2배 길어서, 같은 일을 끝내는 데 드는 비용은 5~6배 싸다는 겁니다. 그는 7월 9일 X에서 자동화 도구 회사 검루프(Gumloop)가 사내 에이전트의 모델을 Opus 4.8에서 GLM-5.2로 바꿔 비용을 약 5분의 1로 줄였다고 소개하기도 했습니다.
파이어웍스도 폐쇄형 모델을 함께 씁니다. 재무팀이 예측과 장부 관리에 오픈 모델과 폐쇄형 모델을 섞어 쓴다고 했고, 개발 초기에는 가장 비싼 모델 하나로 가능성부터 확인하고 규모를 키울 때 비용을 줄이라고 조언했습니다.
대담이 공개되기 전 2주 동안 워싱턴은 중국 오픈 모델로 시끄러웠습니다. 7월 22일 마이클 크라치오스 백악관 과학기술정책실장이 문샷AI가 앤트로픽의 Fable을 증류해 Kimi K3를 만들었다는 정보가 있다고 올렸고, 5시간 뒤 스콧 베센트 재무장관은 산업 규모의 은밀한 증류가 지식재산 도용으로 넘어가면 제재와 엔티티 리스트 지정을 검토하겠다고 썼습니다. 백악관과 재무부가 잇달아 꺼낸 경고가 나온 지 이틀 뒤 오픈웨이트를 지지하는 공개서한이 나왔고, 파이어웍스는 서한 명단에 7월 25일 이름을 올렸습니다.
린 차오는 지정학 논쟁과 오픈이냐 폐쇄냐의 논쟁을 떼어 봐야 한다고 했습니다. 데이터 분야가 빨리 발전한 것도 오픈소스 프로젝트가 많았던 덕분이라며, 지능이 두 회사나 소수의 손에 있는 것은 말이 안 된다고 했습니다. 비월드가 오픈AI와 앤트로픽도 모델을 공개해야 하느냐고 묻자 그는 오픈AI가 작년에 오픈 모델을 낸 것이 공동체에 큰 순간이었다며 계속하기를 바란다고 했고, 미국 오픈 모델의 수준을 끌어올리려는 마이크로소프트, 엔비디아의 Nemotron과 함께 일하고 있으며 씽킹 머신스가 막 모델을 냈고 리플렉션도 곧 내놓기를 바란다고 덧붙였습니다.
미국 회사들이 최고의 모델을 오픈소스로 내놓지 말아야 할 이유가 없다고 봅니다. 저는 그 이유를 찾지 못했습니다.— 린 차오, 파이어웍스 CEO (Gradient Dissent)
@lqiaoX 게시물 · 원문 보기
그는 6월 28일 X에 영국이 가장 먼저 산업화한 것은 자국 기업에 더 비싼 석탄을 쓰라고 강요해서가 아니었다며, 왜 미국 기업에 더 비싼 지능을 쓰라고 하느냐고 적었습니다. 다리오 아모데이 앤트로픽 CEO는 7월 27일 입장문에서 앤트로픽이 오픈웨이트 모델 금지를 주장한 적이 없고, 위험한 능력이 없는 오픈웨이트 모델은 공공재라고 밝혔습니다. 다만 넓은 접근이 공격자보다 방어자를 반드시 더 돕는다는 서한의 주장에는 동의하지 않는다며, 그 반대일 가능성도 적어도 그만큼 된다고 적었습니다.
린 차오는 보안을 공격과 방어의 균형으로 봤습니다. 공격자는 어떻게든 도구를 구하니, 오픈 모델이 방어하는 쪽에도 같은 도구를 쥐여 주고 더 많은 사람이 방어를 쌓게 한다는 겁니다. 그는 오픈AI의 평가용 에이전트가 허깅페이스를 뚫은 사건을 예로 들었습니다. 그의 이해로는 허깅페이스가 대응에 오픈AI 모델을 쓰려 했지만 모델이 사이버 공격일 수 있다며 돕지 않았고, 허깅페이스는 GLM-5.2를 써서 빠르게 문제를 막았다고 했습니다.
@lqiaoX 게시물 · 원문 보기
대담 공개 3일 전 그는 오픈 가중치가 방어자의 무기라며, 보안 회사 depthfirst가 GLM-5.2를 파이어웍스에서 강화학습으로 고쳐 만든 모델이 취약점 찾기에서 프런티어 모델 수준을 냈다고 X에 올렸습니다. 아모데이의 입장문이 나오고 3일 뒤였습니다.
파이어웍스가 내세우는 해자는 품질입니다. 린 차오는 학습과 추론 사이에 수치 계산 방식이 달라 정밀도가 새는 문제를 없애, 학습 쪽과 추론 쪽 결과가 비트 단위까지 같은 KL 발산 0을 이뤘다고 했습니다. 학습과 추론이 끊임없이 오가는 강화학습에서는 작은 오차도 불어나기 때문입니다. 여러 지역에 흩어진 GPU를 묶어 수만 개 규모의 학습 한 번을 돌리는 기술과, 고객마다 10만 가지 넘는 설정 조합 가운데 가장 맞는 것을 찾는 추론 엔진도 들었습니다.
비월드는 여기서 모순을 짚었습니다. 오픈AI에 모델을 공개하라고 하면서 파이어웍스의 학습·추론 엔진은 닫아 두지 않느냐는 겁니다. 린 차오는 두 엔진 모두 자체 기술이 맞다고 인정했습니다. 엔진은 vLLM과 SGLang이 나오기 전에 만들었고, 파이토치가 널리 퍼지는 데 7년이 걸렸던 경험상 이렇게 빨리 바뀌는 코드를 공개하면 기여자들이 혼란스러워한다는 이유였습니다. 대신 이미 앞서 있는 오픈소스 엔진을 돕겠다며, 딥시크 모델을 올릴 때 버그 때문에 출시를 3일 미루고 잠도 못 자며 고친 결과를 vLLM과 SGLang에 돌려줬다고 했습니다.
새 모델을 공개 당일 올리는 데도 공을 들여, 초기 미스트랄이 코드 없이 가중치만 올렸을 때는 이전 모델에서 코드를 거꾸로 짜 맞춰 미스트랄의 API보다 먼저 서비스를 열었다고 했습니다. 직원 200명 가운데 엔진을 만드는 사람은 10명 안팎입니다.
린 차오는 쓰임새가 작년의 코딩에서 올해 법률·금융·채용·영업 같은 업무 도구로 넓어졌고, 내년에는 검색과 추천처럼 소비자 쪽이 열릴 수 있다고 봤습니다. 미국 회사들이 좋은 오픈 모델을 만들기 시작한 만큼 미국 안에서 폐쇄형과 오픈 모델의 격차도 줄어들 것이라고 했습니다. 하루 40조 토큰이 계속 늘어나는지, 오픈AI와 앤트로픽이 오픈 모델을 더 내놓는지, 그리고 중국 오픈 모델에 대한 미국 정부의 제한 논의가 실제 규정으로 이어지는지가 그의 말을 맞춰 볼 수 있는 대목입니다.
읽어 주셔서 고맙습니다.
초이 드림