


리퀴드 AI가 한국 시각 10월 8일 새벽 2시께 결정 모델 d1-3B와 실험판 d1-omni-600M의 가중치를 허깅페이스에 공개했습니다.
결정 모델은 글을 생성하지 않고 한 번의 계산으로 선택지나 확률을 내놓는 모델로, d1-3B는 텍스트와 이미지를, d1-omni-600M은 텍스트와 함께 이미지나 음성을 받습니다.
d1-3B는 공개 데이터셋 7개 평균 82.9점으로 Decider 4B(81.1점)를 앞섰고, Decision Index 0.2.1에서는 48.57점으로 매개변수 100억 개 미만 결정 모델 가운데 가장 높았습니다.
Choi
엔비디아와 함께 잰 속도에서 d1-3B는 질문 하나에 젯슨 AGX 토르에서 16밀리초, RTX 4090에서 8밀리초가 걸렸습니다. 리퀴드 AI는 d1-omni-600M을 아직 개발 중인 연구용 공개판으로 소개했고, 음성 판단을 재는 공개 평가가 없어 이미지·음성 점수는 내지 않았습니다.
소식AI

오픈AI가 한국 시각 10월 7일 아침 7시 공개하지 않은 내부 모델이 쓴 수학·이론전산학 원고 722편을 깃허브 저장소에 올렸습니다.
모델에 약 4,000개 문제를 던져 나온 결과를 372개 묶음으로 정리했고, 결과 하나에 평균 ChatGPT Pro 사고 연산 3시간이 들었습니다.
상당수에 Lean(증명을 기계로 검증하는 언어) 형식 증명이 붙었지만 전부는 아니며, 오픈AI 대변인은 사이언티픽 아메리칸에 거의 모든 결과가 에이전트 하나에 프롬프트 하나로 나왔다고 말했습니다.
Choi
오픈AI가 9월 21일 꾸린 독립 수학 자문그룹은 결과마다 모델과 프롬프트, 연산 시간을 공개하라고 권고했지만 이번 공개에는 프롬프트가 없습니다. MIT의 앤드루 서덜랜드는 단일 에이전트가 한 번에 풀었다는 주장은 모델이 공개돼 재현되기 전까지 검증되지 않은 것이라고 말했습니다.
일론 머스크가 한국 시각 10월 7일 오후 3시 46분 X에 스페이스X가 앞으로 Grok Bot의 작업마다 가장 나은 백엔드 모델을 쓰고, 여기에 앤트로픽의 Claude Opus 5.5와 미드저니, 수노 같은 외부 API도 들어간다고 적었습니다.
Grok Bot은 xAI를 합친 스페이스X의 AI 사업부 SpaceXAI가 8월에 내놓은 에이전트 앱으로, 봇마다 자기 컴퓨터에서 여러 작업을 동시에 처리합니다.
어떤 작업을 어느 모델에 보낼지는 밝히지 않았습니다.
Choi
앤트로픽과 미드저니, 수노는 각각 글과 이미지, 음악 모델을 만듭니다. 머스크는 9월 말 공개된 CMG 인터뷰에서 Grok 4.7이 Opus 5.5만큼은 못 한다고 말했습니다. 이번 발표가 나온 주에 그는 SpaceXAI 이름을 SpaceXSI로 바꾼다고도 했습니다.
엔비디아가 투자한 미국 스타트업 리플렉션 AI가 한국 시각 10월 6일 새벽 첫 오픈웨이트 모델 Beam을 발표했습니다.
전체 매개변수 5,010억 개 가운데 토큰마다 230억 개만 쓰는 전문가 혼합(MoE) 모델로, 23조 8,000억 토큰으로 사전학습한 뒤 엔비디아 GB300 GPU 1만 500개로 4주 동안 강화학습을 돌려 1억 건 넘는 시도를 만들었습니다.
가중치와 기술 보고서, 모델 카드는 최종 레드팀 시험을 마친 뒤 이달 안에 공개합니다.
Choi
리플렉션은 Beam이 고급 추론 벤치마크에서 지푸(Z.ai)의 GLM-5.2와 비슷한 점수를 3~4배 적은 추론 연산으로 낸다고 밝혔고, 기업과 국가가 자기 데이터로 맞춤 AI를 짓는 'AI 팩토리' 구상을 신세계그룹과 한국에서 시험하고 있습니다. 액시오스는 10월 4일 리플렉션의 출시가 임박했다고 먼저 보도했습니다.
프랑스 미스트랄 AI가 한국 시각 10월 6일 밤 Mistral Large 4(ML4) 프리뷰를 공개하고 Mistral Studio에서 API로 열었습니다.
전체 매개변수 1조 개 가운데 490억 개를 쓰는 멀티모달 모델로, 유럽에 있는 미스트랄 자체 데이터센터에서 엔비디아 그레이스 블랙웰 GPU 3,800개로 처음부터 학습했습니다.
가중치는 이달 말 공개하며, 그때까지 사이버보안 기업과 검증된 협력사, 각국 당국과 실제 환경에서 레드팀 시험을 합니다.
Choi
미스트랄은 실제 오픈소스 취약점을 재현하고 고치는 시험에서 ML4가 82%로 전체 모델 중 가장 높았고, Claude Opus 5.5와 GPT-6 Astra는 작업을 거부해 0점에 가까웠다고 밝혔습니다. 보안 대회 문제 40개로 된 Cybench에서는 93%를 풀었습니다.
블룸버그 인텔리전스(BI)의 로버트 리 선임 애널리스트가 한국 시각 10월 5일 낸 보고서에서 중국 최상위 AI 모델과 미국 경쟁 모델의 벤치마크 점수 차이가 3%로 줄었다고 밝혔습니다.
이 격차는 5월 약 9%, 올해 초 15%였고, 9월 딥시크 V4.1 Flash가 나온 뒤 BI 집계에서 가장 작은 폭이 됐습니다.
리는 중국 모델의 성능 향상이 시장 점유율 확대로 이어질 것으로 내다봤습니다.
Choi
BI는 공개 벤치마크 점수로 격차를 계산했습니다. 액시오스는 10월 4일 가장 강력한 오픈웨이트 모델이 거의 모두 중국에서 나오고, 여러 모델을 함께 서비스하는 플랫폼에서는 이들의 합산 점유율이 한때 과반을 넘었다고 보도했습니다.


매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.