채점이 끝난 21건 기준 98%예요. 일부는 0.5로 셌어요.
다음 세대 모델의 최고 실행은 다섯 과제의 기준선을 모두 넘는다(Andon Labs의 7월 24일 전망)
9월 10일 Andon Labs는 9월 3일 나온 오픈AI의 GPT-6 Astra가 다섯 과제 각각에서 적어도 한 번 사람 기준선을 넘은 첫 모델이라고 밝혔습니다. 그보다 앞선 8월 3일에는 모델이 채점 환경을 엿보는 부정행위가 늘고 있다며, 걸린 실행을 버리고 다시 돌린 기록을 따로 공개했습니다.
오픈AI가 통화에서 말한 나비에-스토크스 증명을 공개한다
9월 9일(한국 시각) 오픈AI가 GPT-6 Astra보다 훨씬 뛰어난 차세대 내부 모델로 에이전트 약 1만 개가 88시간 만에 만든 나비에-스토크스 해법이라며 공개했습니다. 부벡은 같은 날 알푀게를 저자에서 빼라고 요구한 적이 없다고 반박했고, 오픈AI 대변인은 9월 10일 뉴욕타임스에 버크마스터의 지난 두 달 Codex 프롬프트가 학습을 포함해 어떤 방식으로도 시스템에 영향을 줄 수 없었다고 밝혔습니다.
게시판 문법은 5일에 걸쳐 에이전트들이 스스로 만들었다
받는 쪽을 지정한 메시지가 2만 4,778건 쌓였다
사칭 사고 34분 뒤 공개키 서명 메시지가 처음 등장했고 429건이 오갔다
전체 작업 지시의 약 10%가 한 에이전트에게서 나왔다
Replica는 논문 100편에서 만든 학습 242개, 테스트 68개로 구성됩니다.
Faraday는 분포 내 ML 과제 73%, 미학습 과학 과제 60%의 승률을 기록했습니다.
상상 과제 20개 중 19개에서 Faraday가 선호됐습니다.
해당 판정 모델은 상상 과제에 대해 검증되지 않았습니다.
앤트로픽이 탐지 API를 자격을 갖춘 기관부터 제한적으로 연다
9월 1일 갱신된 설명에 따르면 탐지 API는 비공개 프리뷰로, EU 법이 정한 규제·수사 기관과 언론, 팩트체커, 독립 연구자, 교육기관, EU 시민단체, 준수 의무가 있는 기업에 먼저 열렸습니다.
GLM-5.3이 Artificial Analysis 종합 지수에서 58~60점 안팎에 들어온다
8월 26일 Artificial Analysis가 GLM-5.3-Flash 평가 글에서 GLM-5.3(최대 추론)을 60점으로 적었습니다.
암호화된 추론 블록이 세션·사용자·모델 사이에서 호환됩니다.
복원한 추론의 토큰 수가 API 청구 thinking 토큰 수와 대부분 1대 1로 일치했습니다.
공개 저장소 블록 31만 5,320개에서 개인식별정보 367건, 자격증명 182건이 나왔습니다.
앤트로픽이 워터마크 탐지를 누구나 쓰게 열지 않고 자격을 갖춘 기관부터 연다
9월 기준 지원 문서는 워터마크 탐지를 비공개 프리뷰로 두고, EU 법이 정한 규제·수사 기관과 언론, 팩트체커, 연구자, 교육기관, 준수 의무가 있는 기업에 먼저 열었습니다.
MiniMax가 H3 가중치를 며칠 안에 공개한다
MiniMax는 8월 3일(한국 시각) 허깅페이스에 H3 가중치를 공개했습니다. 풀린 것은 768p를 만드는 H3-Base(33B)이고, 지시문을 정리하는 H3-Context-IR과 2K 재생성은 API로 남았습니다. 라이선스 Q&A는 EU와 영국, 한국, 미국에서의 오픈웨이트 이용을 별도 승인 대상으로 두었습니다.
딥시크가 가장 강한 모델도 가중치를 공개한다
8월 13일 V4-Pro 정식판을 내면서 같은 날 밤 가중치를 MIT 라이선스로 허깅페이스에 올렸습니다.
실리콘 방패가 사라지는 시점이 곧 위험의 시점이다
애리조나 2나노 양산은 2029~2030년이라 2027년 준비태세보다 늦고, 가동 중인 팹은 침공으로 확보되지 않습니다.
Kimi K3는 GLM-5.2보다 사이버 역량이 높게 측정돼 오픈·폐쇄 격차를 더 줄인다
7월 23일 AISI·CAISI 예비 평가에서 K3는 사이버레인지 평균 17단계로 GLM-5.2(11단계)를 넘었고 10번 중 1번 완주했습니다. 미국 최상위 모델 평균 28.5단계에는 못 미쳤습니다.
개발 공고의 반등이 22~25세 개발 직군 고용 회복으로 곧바로 이어지지 않는다
스탠퍼드 연구진이 8월 12일 낸 개정판에서 AI 노출 직군 22~25세 고용 격차는 2025년 7월 자료 기준 15%에서 2026년 6월 자료 기준 19%로 벌어졌고, 연구진은 주된 경로를 채용 감소로 봤습니다.
수도권에서는 데이터센터가 전력 공급 승인을 받기 어렵다
7월 14일 뉴시스 보도(CBRE코리아 보고서 인용)에 따르면 2026년 3월 누적 수도권 전력계통영향평가 1차 기술검토 신청 522건 가운데 최종 공급 승인은 10건(건수 기준 1.9%)이었습니다.
LLM이 쏟아내는 버그 보고로 험난한 18개월(어쩌면 12개월)을 지나면, 퍼저 때처럼 버그가 잦아들고 커널 코드는 더 나아진다
그렉 크로아하트만이 9월 22일 Kernel Recipes 2026 발표에서 내놓은 전망입니다. 그는 3월부터 18개월이라고 말해 왔다고 했습니다.
2036년 최전선 슈퍼컴퓨터는 공장에서 만든 몇 MW짜리 랙에 물과 전력, 광섬유만 꽂는 형태가 된다
우주 데이터센터에는 근본적으로 가로막는 문제가 없다
사람이 컴퓨터로 하는 모든 일에서 모든 인간과 같거나 더 나은 모델이 2년 안팎(2028년 전후)에 나온다
숄토 더글러스가 2026년 8월 녹화, 10월 2일 공개된 American Optimist 대담에서 내놓은 전망입니다.
앞으로 2년 안에 사이버 보안은 공격보다 방어가 유리한 쪽으로 돌아선다
같은 대담에서 더글러스가 내놓은 전망입니다.
2028년 가정에 빨래와 간단한 청소를 하는 휴머노이드 로봇이 수만 대 들어간다
같은 대담의 2028년 예측입니다.
인터넷에서 일어나는 행동의 대부분을 에이전트가 하게 된다
루프와 그래프로 에이전트 흐름을 짜는 방식은 지나가는 단계다
2027년 AI가 정말 쓸 만해지고, 2028년에는 버튼 하나로 회사 인력 전체를 복제할 수 있다
에마드 모스타크가 8월 28일 공개된 피터 매코맥 쇼에서 내놓은 전망입니다.
2027년 테슬라 옵티머스급 휴머노이드가 시간당 1.5달러로 미국 트럭을 몰 수 있다
같은 대담에서 내놓은 전망입니다.
개인 에이전트는 한동안 어수선한 시기를 거친 뒤 사람들이 받아들일 쓰임새만 남는다 (하드포크 패널의 전망)
모두가 개인 비서를 쓰게 되면 비서끼리 겨루는 군비 경쟁이 된다 (하드포크 패널의 우려)
2028년 전에 어떤 행동이든 모델 안에서 그 원인을 인과적으로 찾아낼 수 있게 된다 (에릭 호의 전망)
내부 활성값 감시가 외부 감시를 곧 확실히 앞선다 (에릭 호의 전망)
모든 훈련 실행에 보상 해킹 감시가 붙어 지금 같은 보상 해킹 비율은 과거의 일이 된다 (굿파이어의 전망)
가장 똑똑한 프런티어 모델이 검증 토큰을 덜 써서 쉬운 일에서도 작은 모델보다 싸진다 (타리크 시히파르)
모델이 좋아지면 CLAUDE.md가 사라진다 (타리크 시히파르)
Claude Code는 클라우드 두뇌, 로컬·원격 손, 아티팩트 화면으로 나뉜다 (타리크 시히파르)
5~10년 뒤 지식노동자와 개발자는 지금보다 많아진다 (마이크 캐넌브룩스)
MCP와 CLI로 아틀라시안을 쓰는 고객은 화면 사용과 유료 좌석도 함께 늘린다 (마이크 캐넌브룩스)
챗봇은 업무의 최종 인터페이스가 되지 않는다 (마이크 캐넌브룩스)
AI 모델이 발전할수록 로봇의 작업 능력도 함께 좋아질 수 있다
HomeBody는 VLM을 바꿔 끼울 수 있게 설계됐지만, 다른 모델로 같은 과제를 돌린 결과는 아직 없습니다.
5년 뒤 자동화 트래픽이 사람 트래픽의 1,000배가 된다 (매슈 프린스)
올해 파크 레코드의 AI 라이선스 수입이 디지털 광고 수입을 넘는다 (매슈 프린스)
기술 업계 밖에서도 AI를 이유로 한 감원이 잇따른다 (매슈 프린스)
한 회사가 AGI를 만들어도 며칠 안에 경쟁사들이 따라온다 (매슈 프린스)
토큰 경제가 5년 안에 약 5조 달러, 10년 안에 10조 달러 규모가 된다 (안즈니 미다)
추론에 웃돈을 붙여 되파는 회사들이 정해진 작업 단위 과금으로 옮겨 가고, 사용자가 자기 추론을 가져오는 방식이 늘어난다 (알렉스 아탈라)
앞으로 10년 동안 사람이 저지르던 토큰 사기를 AI 에이전트가 저지르게 된다 (안즈니 미다)
RNA 앱타머 사고 사슬 설계가 습식 실험에서도 확인된다 (응우옌)
서열과 성능 점수가 짝으로 쌓인 다른 생물학 과제에도 같은 틀을 적용할 수 있다 (응우옌)
다음 세대 Omnii는 단백질, RNA, 후성유전체 등 여러 양식을 함께 다룬다 (응우옌)
5년 안에 총요소생산성 증가율 3%를 넘긴다 (TypeSafe 선언문)
모델 하나를 전제로 만든 코딩 에이전트와 여러 모델을 쓰는 코딩 에이전트의 경쟁 구도가 달라진다 (알메이다)
jev-1.13.0을 장기 지원 대상으로 묶는 방안을 검토한다 (알메이다)
성과를 낸 내부 모델이 8월 유출글의 'Bel'과 같은 모델인지는 확인되지 않았습니다.
판단 전용 모델에서 오래 남는 것은 특정 모델보다 선택지를 주고 확률을 돌려받는 호출 방식이다
9월 21일 기준 근거는 6일 사이 나온 Jev식 공개 모델 4개와 Claude Code 라우터, Vercel AI Gateway 연결입니다.
전쟁부가 이번 사고에 쓰인 챗봇의 종류를 공개한다
9월 18일 보도 시점에 CNN은 상용 제품인지 정부용 도구인지 확인하지 못했고, 전쟁부는 논평 요청에 답하지 않았습니다.
미군이 AI가 만든 정보를 검증하는 단일 기준을 내놓는다
보도 시점에는 부서마다 다른 도구와 안전 기준을 쓰고 있었고, AI가 만든 정보를 검증하는 단일 기준이 없었습니다.
AI 안전 논쟁도 곧 진영에 따라 갈리게 된다 (케빈 루스의 전망)
의회가 AI 안전 법안을 통과시켜도 대통령 거부권이 나올 가능성이 높다 (케이시 뉴턴의 전망)
머지않아 어느 나라의 몇 사람이 자체 에이전트 무리를 꾸려 세상에 풀 수 있게 된다 (케이시 뉴턴의 전망)
지연이 아주 중요한 작업 20~30%를 확산 언어 모델이 가져간다 (에르몬)
Inception이 몇 달 안에 가장 큰 다음 확산 언어 모델을 공개한다
추론 경쟁에서 더 병렬적인 확산 방식이 자기회귀 방식을 이긴다 (에르몬)
다음 세대 모델은 아주 긴 에이전트 작업을 매우 정확하게 해낸다 (무스타파 술레이만)
2년 안에 안전장치 없는 오픈소스 모델이 개인 컴퓨터에서 허깅페이스 사고 수준의 행동을 할 수 있다 (무스타파 술레이만)
AI가 AI 연구를 맡으면서 발전 속도가 지금의 약 3배로 빨라진다
프런티어 모델이 3개월짜리 과제를 해내게 되어 출시 전 평가가 모델의 전체 작업 길이를 따라가지 못한다
올해 말까지 포천 1000대 기업의 절반이 AIUC-1 컨소시엄에 대표를 둔다 (크비스트)
AIUC가 몇 주 안에 프런티어 AI 재난 위험 보험계리 모델을 오픈소스로 공개한다
AI 감사·보험이 에이전트에서 프런티어 모델, 로봇으로 넓어진다 (크비스트)
기업 AI는 여러 모델을 함께 쓰는 방식으로 가고, KV 캐시 재사용 같은 모델 간 상호운용 표준이 생긴다 (사티아 나델라)
AI 데이터센터 칩 공급이 엔비디아 외에 자체 칩과 AMD 등으로 다양해진다 (사티아 나델라)
5년 뒤 기업 AI 토큰의 90%가 사용자가 시작하지 않은 작업에 쓰인다
모델 회사의 토큰 보조는 상장 뒤 오래가지 못한다
한두 연구소가 AI 가치의 95%를 가져가는 구도는 오지 않는다
코딩 밖 지식노동의 AI 확산은 실리콘밸리 예상보다 훨씬 오래 걸린다
중국은 2030년까지 첨단 노광 장비를 자체 개발한다 (젠슨 황)
프런티어 연구소들이 연구에서 엔지니어링 조직으로 옮겨 가며 사고를 통제할 수 있게 된다 (젠슨 황)
수천 명이 몇 년 걸리는 AI 연구를 AI가 몇 주로 줄인다
로봇이 실험을 대신 돌리는 데 필요한 조건이 3~5년 안에 갖춰진다
오픈AI가 직원급 접근권을 가진 독립 평가자를 들인다
9월 12일 올트먼이 X에서 같은 조치를 하겠다고 밝혔습니다.
앤트로픽의 상주 외부 검토 팀이 편집 없는 첫 공개 보고서를 낸다
에세이는 가까운 시일 안에 검토 팀을 들이겠다고만 적었습니다.
배선을 섞은 대조군보다 원래 배선이 뚜렷하게 나은 과제가 커넥톰 시뮬레이션에서 나온다
개인 데모에서 시작한 회로 차단 실험이 실물 초파리 측정과 비교된다
1년쯤 뒤 한 달짜리 사무직을 맡길 원격 근무자 AI가 쓸 만한 형태로 나온다 (오닐·슐먼)
2년 안에 AI 연구자의 생산성이 10배가 된다 (슐먼)
3~4년 안에 컴퓨터로 하는 모든 일에서 최고 전문가를 앞서는 AI가 나온다 (슐먼)
재귀적 자기개선이 지속 학습보다 먼저 온다 (오닐)
모델 구조로 KV 캐시를 줄이는 방식이 퍼지면 AI 사용량과 메모리 수요는 같은 비율로 늘지 않는다
소비자가 컴퓨터 사용 에이전트에 익숙해지면서 기업용 소프트웨어도 에이전트가 쓰기 쉽게 다시 만들어진다
쇼핑몰은 사람 대신 에이전트를 끌어들이도록 다시 설계된다
Muse Confidential VM은 올해 안에 나올 예정입니다.
자동화형 대화 비율이 45%에서 90% 쪽으로 오르고 22~25세 고노출 직업 진입률이 계속 낮아지면, AI가 노동소득 비중 하락을 가속한다는 근거가 강해진다
두 값이 함께 움직여야 AI의 기여가 오래된 요인과 갈립니다.
봇이 사람보다 먼저 연락하는 능동형 에이전트가 AI의 다음 변화가 된다
일과 개인 생활을 한 제품이 함께 맡는 형태가 가장 좋은 제품 형태가 된다
머지않아 사용자가 봇의 원격 컴퓨터를 직접 들여다볼 일이 사라진다
같은 방법이 나비에-스토크스로 이어지고 외력도 없앨 수 있다
두 사람의 하이포디시페이티브 나비에-스토크스 폭발 논문이 Lean 검증을 마치고 공개된다
AI 전반의 진보가 갈수록 감시에 대한 확신에 가로막힐 것이다
파초키가 9월 6일 에세이에 적은 전망입니다.
공통 안전 기준이 세워질 때까지 연구소들의 자발적 감속이 널리 퍼질 것이다
파초키가 기대와 바람으로 적은 전망입니다.
다음 1년 동안 형식화의 속도는 증명을 옮기는 일보다 필요한 정의를 만드는 일이 정한다
버저드의 Annals Challenge(8월 13일 공개) 결과로 판정합니다.
AI 칩과 메모리의 공급 제약은 적어도 3~5년 이어진다
5년 넘게 지나면 단순한 칩은 아이디어에서 GDS2 파일까지 AI로 설계한다
에이전트 확산으로 데이터센터의 GW당 CPU 수요가 지금의 4배를 넘는다
AI 장악 가능성은 반반쯤이다 (벅 슐레게리스의 추정)
1~5년 안에 AI 회사들이 AI로 지금 속도 기준 5년치 발전을 1년에 해낼 수 있다 (벅 슐레게리스의 전망)
AI가 AI 연구 대부분을 맡을 즈음에는 사고 사슬 감시가 통하지 않을 가능성이 꽤 높다 (벅 슐레게리스의 전망)
LearnVector가 내년 초 일대일 학습 제품을 보여 준다
응이 8월 28일 공개된 대담에서 내년 초에 보여 줄 것이 많을 거라고 했습니다.
Muse Spark 1.2 가중치는 최종 안전성 미세조정을 마친 뒤 공개될 예정입니다.
3.9는 건너뛰고 다음 이름은 Gemini 4가 될 것이다 (9월 2일 스레드)
스트리밍 음성 인식 1위 기록 3.1%는 몇 달 안에 다른 모델로 넘어갈 수 있다
11월 미국 중간선거에서 양당이 AI 규제를 전면 공약으로 세우고 신입 채용 감소가 고용 지표로 확인되면, 신봉건제 프레임은 학술 논쟁에 머물지 않고 실제 정책이 될 가능성이 더 높습니다.
프런티어 에이전트가 6개월 안에 AI 회사 안에서 들키지 않는 무단 배포를 세울 능력을 갖출 가능성이 높다
에이제이아 코트라의 8월 28일 블로그 개인 전망입니다.
보안이 크게 나아지지 않으면 6개월 안에 프런티어 에이전트가 AI 회사 안에 감시를 피한 불법 배포를 세울 수 있게 된다
계속 곁에 남아 사람과 함께 일하는 AI 동료가 채팅과 에이전트에 이은 AI 제품의 세 번째 시대가 된다
Hy4 정식판이 프리뷰의 과도한 추론 문제를 줄여 나온다
텐센트는 필요 이상으로 오래 추론하고 자기 결과를 지나치게 다시 확인하는 경향을 알려진 한계로 적었습니다.
외부 독립 측정에서 Hy4가 GLM 5.3·Kimi K3와 같은 구간에 든다
GDPval-AA v2 공식 점수는 Hy4 1,678점, Kimi K3 1,675점, GLM 5.3 1,763점이었습니다.
다른 AI 공급사들도 군 계약에서 일부 사용 제한을 지켜 낸다
법원은 비판을 이유로 한 제재를 위법으로 봤지만, 전쟁부가 공급사를 고를 자유는 그대로 인정했습니다.
프런티어 연구소의 실질 AI 노동력이 해마다 10배로 늘어 이 10년이 끝나기 전 한 회사의 AI 노동력이 세계 인구를 넘는다
오픈AI와 앤트로픽이 내년 세계 신규 AI 연산의 40~50%를 가져간다
경쟁당국은 비엔비디아 추론 서비스의 동등한 대우와 기업 데이터 분리, 모델·데이터 이동권을 심사할 가능성이 있다
오픈AI와 앤트로픽이 2027년 세계 신규 AI 연산의 40~50%를 가져간다
2028년 말 오픈AI와 앤트로픽이 세계에서 쓸 수 있는 AI 연산의 대부분을 쥔다
2027년 말 선두 연구소의 메가와트당 연 매출이 7,000만~8,000만 달러에 이른다
2024~2029년 AI 설비투자 약 11조 달러 가운데 5조 달러 이상을 빚으로 조달한다
에이전트 곁을 지키는 지금의 작업 방식은 자동화로 줄어들고, 사람은 하루 한 번 결정만 내리게 된다
에이전트 덕분에 리눅스가 데스크톱에서 이긴다
지금의 초고속 추론 속도가 1~2년 안에 기본값이거나 그에 가까운 수준이 된다
티보 소티오가 8월 24일 공개된 인터뷰에서 내놓은 전망입니다.
지금의 코덱스가 2~3개월 뒤 원시적으로 보일 만큼 에이전트 쓰는 방식이 달라진다
소티오가 8월 3일 X에 쓴 전망입니다.
보통 기업이 상위 10% 기업의 AI 사용을 따라붙으면 지금의 데이터센터 공사는 초기 물량으로 남는다
8월 기준 근거는 오픈AI Signals의 토큰 출력 증가(상위 10% 17.1배, 보통 기업 2.1배, 격차 8.3배)입니다.
다음 전환의 신호는 모델 발표보다 토큰 사용량 곡선과 결제 장부에서 먼저 나온다
8월 19일 Stripe 투자자 서한과 Menlo Ventures의 토큰 곡선을 근거로 한 전망입니다.
5~10년 안에 1조 파라미터 규모의 계속 배우는 모델을 20와트로 돌릴 수 있다
가중치별 스텝 크기와 연속 역전파를 합친 새 세대 지속 딥러닝이 몇 년 안에 나온다
다른 프런티어 연구소도 훈련 감속과 전면 감시 같은 조치를 따라온다
8월 18일 기준으로는 오픈AI의 단독 조치였습니다.
클라우드 회사들은 앞으로 서버 임대보다 에이전트 실행 환경을 두고 더 치열하게 겨룰 것입니다.
Stripe는 OpenRouter를 모델 중립 브랜드로 두고, 뒤에서는 모델 호출과 예산 관리를 Metronome 과금, Radar 사기 방지, 세금, 에이전트 결제, 스테이블코인 정산과 묶을 것이다
8월 19일 Stripe와 OpenRouter가 인수 합의를 공식 발표했고, OpenRouter는 이름과 제품, 로드맵을 그대로 두고 모든 모델을 같은 조건에 두겠다고 밝혔습니다. 거래 종결 전입니다.
누구나 무엇이든 만들 수 있게 되면 디자인이 제품을 평가하는 가장 중요한 기준의 하나가 된다
챗GPT가 즉답과 대화, 작업 위임을 스스로 고르는 하나의 입력창으로 간다
자동화 코더가 2027년 11월 무렵 도래한다
코코타일로의 8월 16일 최종 중앙값입니다. 같은 팀의 리플랜드는 2030년 1월, 브렌던은 2029년 1월을 적었습니다.
코딩 업리프트에서 1을 뺀 값이 5개월마다 두 배가 되는 추세가 이어진다
8월 업데이트에서 코코타일로가 쓴 중앙 가정입니다. 리플랜드는 6.5개월, 브렌던은 5.5개월을 넣었습니다.
중간값 기업의 AI 지출이 상위 기업을 따라오지 못하면 설비를 먼저 지은 네오클라우드의 부담이 커진다
8월 기준 근거는 Ramp 자료의 직원 1인당 월 AI 지출(상위 1% 약 7,500달러, 중간값 약 12달러)과 코어위브의 2분기 설비투자 64억 2,200만 달러입니다.
배포 전 시험 제도가 도입되면 앤트로픽의 다음 프런티어 모델 출시도 그 시험 기간만큼 늦춰진다
아모데이는 자신이 지지한 시험 절차가 프런티어 기업을 먼저 늦춘다고 설명했습니다. 8월 16일 현재 제도는 도입 전입니다.
SpaceX의 AI 매출이 2026년 9월 나머지 사업 매출 전체를 넘는다
머스크가 8월 11일(미국 시각) 공개된 사내 발표에서 한 예측으로, 3분기 실적에서 확인할 수 있습니다.
SpaceX가 2027년 말까지 AI 컴퓨트 10GW를 확보한다
머스크는 지금까지 지은 규모의 약 10배라고 했습니다.
4~5년 안에 AI가 SpaceX 가치의 99%를 차지한다
상장 전 모닝스타는 적정가치 7,800억 달러 가운데 AI 사업을 1,700억 달러로 잡았습니다.
이 결과를 자율적 과학 발견의 증명으로 보기는 이릅니다.
반복 작업은 사내 27B가 맡고 어려운 설계와 최종 검토만 상위 API나 사람이 맡는 구성이 퍼진다
다른 주요 모델 개발사도 각자의 텍스트 워터마크를 넣는다
앤트로픽은 약 190개 서명 조직 가운데 다른 주요 개발사도 같은 EU 실천규약에 서명했다고 밝혔습니다.
프런티어 연구소의 사내 최상위 모델과 공개 제품 사이의 간격은 앞으로 더 벌어진다
8월 15일 스레드의 전망입니다.
구글은 3.5 Pro를 건너뛰고 바로 Gemini 4로 갈 것이다 (8월 13일 스레드)
앤트로픽 CEO 배우자의 역할을 판단할 근거는 가을 상장 신고서(S-1)의 관련자 거래 항목에서 처음 공개된다
8월 14일 스레드의 전망입니다. S-1 제출로 판정합니다.
다음 세대의 성능은 파라미터 수보다 실행 환경과 채점 설비를 얼마나 키우느냐에서 먼저 갈릴 가능성이 크다
최상위 점수대가 오픈AI·앤트로픽·xAI 3자 구도로 굳어지며 가격 경쟁과 출시 주기가 빨라진다
8월 12일 스레드의 전망입니다. xAI가 다음 판에서도 독립 지수 최상위 점수대를 지키는지로 채점합니다.
Kimi-K3가 Opus를 증류했다는 관찰은 정황이며 확정되지 않았습니다.
저자들이 정황 관찰로 제시했고 통제 조건에서는 재현되지 않았습니다.
AI 연구개발이 2030년 말~2031년 초(중앙값)에 완전히 자동화된다
2026년 말 앤트로픽의 AI 연구 인력 속도가 AI 덕분에 약 2.5배가 된다
AI 연구가 완전히 자동화된 뒤 1년 안에 지금 속도로 4~5년 걸릴 발전이 나온다
50년 동안 해석학으로 밀던 문제를 선형대수로 갈아탄 것이 이 결과의 실제 내용이다
레빈슨 이후 이 기록을 올린 논문은 전부 몰리파이어라는 같은 도구를 썼습니다.
AI 자기개선은 자동 채점이 되는 소프트웨어에서 먼저 빨라지고, 실험·칩·전력망 단계는 그 속도를 따라가지 못한다
일자리 충격은 모델 출시일보다 기업이 일을 다시 나누는 시점에 커진다
연구자 이탈은 단기 실적에서 구글의 손실로 잡히지 않고, 떠난 사람들의 회사가 구글 클라우드 고객으로 돌아온다
피차이는 Discovery Loop에 창업 투자자이자 클라우드 파트너로 참여한다고 밝혔고, 2분기 실적 발표에서 이니퍼블 인텔리전스를 AI 인프라 고객으로 불렀습니다.
제미나이 4 일정이 3.5 Pro처럼 밀리면 구글 연구자 이탈이 더 이어진다
AI 평가 환경에 실시간 감시와 더 강한 샌드박스가 기본으로 붙는다
이미지 모델 경쟁의 중심이 한 장을 잘 뽑는 생성에서 고친 뒤 나머지를 지키는 정밀 편집으로 옮겨 간다
8월 8일 스레드의 판단입니다. 다음 판들이 편집 순위와 편집 도구를 앞세우는지로 채점합니다.
가중치까지 칩에 새기는 방식은 같은 모델을 1년 넘게 쓰는 대규모 반복 트래픽에서만 GPU보다 경제성이 난다
Taalas의 100만 토큰당 0.75센트 계산은 고객이 같은 모델을 1년 이상 쓴다는 전제 위에 있습니다.
Prime Agent와 Opus 5 조합이 ARC Prize의 비공개 세트 검증에서도 사람 기준선 근처 점수를 낸다
8월 5일 발표의 95.5%는 공개된 25개 환경에서 나온 자체 보고입니다.
모델과 하네스를 함께 학습시키는 방식이 새 능력을 여는 주된 길이 된다
Prime Intellect는 아직 어떤 모델도 Prime Agent에 맞춰 학습되지 않았다고 밝혔습니다.
사내 에이전트 카탈로그가 150개 안팎을 넘기면 스킬을 늘리는 일보다 무엇을 올리지 않을지 고르는 일이 품질을 정한다
LangChain 사례 글에 따르면 Stripe 팀은 스킬이 150개를 넘기면 시스템 프롬프트와 합쳐졌을 때 최신 모델의 품질이 떨어지는 것을 관측했습니다.
Pax Machina에 편집진과 자문단이 몸담은 회사에 불리한 제도 설계가 실린다
편집진과 자문단에 구글 딥마인드, 오픈AI, 앤트로픽 사람이 함께 있습니다.
Pax Machina에서 다듬어진 제도 설계가 해외 규제 논의를 거쳐 국내 AI 제도 논의에 등장한다
편집진과 자문단 여럿이 백악관과 영국 정부의 AI 정책에 관여해 왔습니다.
세상은 소수 연구소의 범용 모델 대신 회사마다 하나씩, 수백만 개의 특화 모델로 나뉜다
2027년 소비자용 서비스에서 생성 AI의 쓰임새가 크게 열린다
미국 안에서 폐쇄형과 오픈 모델의 성능 격차가 줄어든다
앞으로 공개될 전사에서 모델이 상대를 실제 사람으로 인식한 시점이 밝혀지면 이번 사건의 해석이 달라진다
과거 평가 재점검에서 비슷한 경계 이탈 행동이 추가로 발견된다
코덱스는 여러 클라우드 컴퓨터에 작업 상태를 보존하고 사람은 지휘·승인하는 구조로 옮겨 간다
8월 4일 소티오의 예고와 6월 11일 Ona 인수 합의를 근거로 한 전망입니다.
Qwen3.8-Max는 아티피셜애널리시스 지능 지수에서 50점대 초중반에 든다
프런티어 경쟁의 중심이 더 큰 모델에서 더 큰 학습 공장으로 옮겨 간다
오픈AI의 첫 AI 연구 인턴이 9월에 나온다
야쿠프 파초키가 밝힌 일정입니다. 2027년 자동 AI 연구자 예측을 가늠할 첫 재료입니다.
이 사업의 성패는 순위표보다 공공 조달과 기업 도입에서 정해진다
GPU를 지원해 모델이 나오는 단계까지는 정책이 만들 수 있지만, 그 모델을 실제 업무에 쓰게 만드는 것은 구매와 검증 제도입니다.
한국이 로봇 판에서 쥔 협상 재료는 공정 데이터와 작업자의 손에 남은 노하우다 (7월 30일 스레드)
오픈웨이트 자체 구축의 약점은 성능보다 장비 상각 기간에서 먼저 드러난다
3년 상각을 전제로 산 GPU의 토큰 단가가 상각 도중 API 가격 밑으로 밀리는지로 판정합니다.
값을 내리는 회사와 그 값을 업무 흐름에 얹는 회사가 같아야 인하가 매출로 돌아온다
오픈AI는 이번 인하를 Codex와 ChatGPT Work의 사용량 계산에도 반영했습니다.
200B~300B급 오픈웨이트는 사실 지식을 검색과 도구에 맡기고 추론과 코딩을 싸게 처리하는 용도로 쓰인다
7월 기준 근거는 Inkling-Small의 도구 사용 HLE 47.8%, 출력 100만 토큰당 1.20달러, SimpleQA Verified 20.6%입니다.
이번 하락에서 무너진 것은 산업보다 그 산업의 미래에 매기던 값과 거기 얹힌 배수다
메모리 계약가격은 주가가 무너지는 구간에도 계속 올랐고 낸드 계약가격은 상반기에만 100% 넘게 뛰었습니다.
2027년 AGI 주장은 이번 일로 반박되지 않았다
반박된 것은 그 주장에 배수를 얹고 매일 가격이 찍히는 시장에서 버티는 방식입니다.
다음 세대 시스템 카드에 평가 환경의 격리 조건을 적는 항목이 새로 생긴다
지금 시스템 카드에는 능력 점수와 안전 평가는 있어도 그 평가를 돌린 환경이 어떻게 격리됐는지를 적는 항목이 없습니다.
트랜스포머는 지속 학습을 할 수 없어 다른 구조로 대체된다
AI 연구소의 실험 속도가 하루 1개에서 10개, 200개로 늘어난다
이 발표에서 오래 남을 쪽은 선호율보다 공개된 데이터와 수집 코드다
마을 좌표를 미리 계산하고 세 가지 조건으로 거른 청크 17만 8,271개를 포함한 데이터셋과 수집 코드, 모델 가중치가 모두 공개됐습니다.
경쟁은 같은 GPU에서 토큰을 얼마나 더 뽑는지에서 갈린다
새 아이디어를 가져오는 일은 에이전트가 대신하기 어렵고, 사용자 피드백에 뿌리내린 아이디어를 내는 일은 사람에게 남는다
나머지를 다 갖춰도 SK의 AI 수직계열화는 전력 계통 연결에서 갈린다
2027년 가동 목표인 최대 2GW AI 팩토리 첫 단계에 실제로 전기가 들어오는지가 판정 기준입니다.
값을 받는 대상이 모델 파일에서 커널·통신 라이브러리·라우터·라이선스로 옮겨간다
회사 단위 협상이 이어지면 HBM 공급 우위는 데이터센터·GPU 순번·전력망 같은 조건으로 이어지지 못하고 분기 실적으로만 남는다
2025년 10월 GPU 26만 장처럼 정부가 협상 창구를 맡은 방식이 상설 구조로 이어지는지가 판정 기준입니다.
일의 재편은 직함보다 업무 단위에서 먼저 나타난다
Kimi Vendor Verifier식 서빙 업체 채점이 다음 Kimi 모델 공개에도 그대로 쓰인다
앤트로픽이 몇 주에서 몇 달 안에 모델 안전장치 묶음을 개선해 제한된 모델의 사용자 경험과 접근 격차를 줄인다
발표 금액과 올해 실적, 몇 년 뒤 한국에 남는 것은 서로 다른 숫자로 나온다
서밋 발표에 딸린 돈 가운데 이사회 의결이 끝난 것은 SK하이퍼 출자 7,500억 원입니다.
이번 협약 물량이 실적으로 잡히는 시점은 빨라야 2027년 말, 현실적으로는 2028년이다
엔비디아에게 오픈웨이트는 기업·국가 단위 자체 구축 수요의 전제조건이다
엔비디아가 새로 나눠 보고하는 ACIE(AI 클라우드·산업·기업) 매출이 하이퍼스케일보다 빠르게 느는지로 판정합니다.
서한 명단은 7월 26일 이후에도 늘어나고, 명단 밖 대형 기업의 합류가 다음 변수가 된다
발행 뒤 확인: 마이크로소프트 페이지는 7월 30일 기준 230곳 넘게, 8월 3일 기준 270곳 넘게 서명했다고 적었습니다. 아마존·인텔·그록은 7월 30일 이전, 삼바노바는 8월 3일 이전에 합류했고, 앤트로픽·애플·퀄컴·브로드컴·세레브라스는 8월 5일 보관본에도 없습니다.
성능이 뒤져도 국가가 수요를 만들면 값을 부를 수 있다
창신메모리의 서버 D램 매출 비중은 2024년 8.4%에서 2025년 26.5%로 올랐고, 7월에는 64GB DDR5 서버 모듈을 삼성보다 비싸게 불렀습니다.
다음 세대 모델의 쇼케이스에 코끼리의 사실적 움직임과 풍동의 유체 계산이 성공 사례로 올라오면 실제 진전으로 볼 수 있다
CLAUDE.md와 스킬 같은 규칙 파일은 모델 세대가 바뀔 때마다 다시 줄이고 재는 대상이 된다
AMD가 그린 2030년 AI 가속기 시장 1조 4,000억 달러는 비싼 추론이 계속 비싸게 팔린다는 전제에 기댄다
같은 수준의 모델이 싸지고 책상 위 장비에서도 돌수록 기가와트 단위로 사 둔 가속기의 활용 기간이 짧아질 수 있다는 판단입니다.
12개월 안에 도구 20~40개를 채운 시스템 프롬프트가 사라진다
지식 노동에 쓰는 모델 크기의 정점은 1조~10조 파라미터 사이에 있다
강화학습이 사전학습의 더 이른 단계로 옮겨 간다
해자가 모델에서 제품 스택으로 옮겨간다
하네스와 평가, 강화학습 환경, 컨텍스트가 쌓이는 곳이 실제 자산이라는 주장입니다.
커머디티 시장에서 이기는 쪽은 생산 원가가 가장 낮은 곳이다
딥시크가 미국 프런티어와의 격차를 6개월, 나아가 3개월로 좁힌다
량원펑이 5월 20일 투자자 회의에서 밝힌 목표로, 당시 격차를 6~18개월로 봤습니다.
딥시크의 올해 기업 대상 매출이 10억 달러에 닿아 현금흐름이 흑자로 돈다
량원펑이 회의에서 조건부로 내놓은 전망입니다.
미국 정부는 중국 오픈웨이트 모델 사용을 전면 금지하는 대신 증류와 칩 같은 좁은 수단으로 대응한다
7월 24일 엔비디아와 마이크로소프트 등이 오픈웨이트 공동 서한을 냈고, 7월 27일 다리오 아모데이는 앤트로픽이 오픈웨이트 모델 금지를 주장한 적이 없다고 밝혔습니다.
증류 의혹은 중국 오픈웨이트 모델의 채택을 늦추는 규제 명분으로 쓰인다
증거 공개 없이 조달·호스팅 규정이 먼저 나오는지로 판정합니다.
제동은 모델 금지 대신 조달 규정, 호스팅 책임, 엔티티 리스트처럼 미국 기업의 채택 경로를 겨눈다
상무부 지정, 연방 조달 규정, 호스팅 책임 행정명령 가운데 무엇이 실제로 나오는지로 판정합니다.
독파모 2차 평가 기준이 현장 활용성으로 바뀌면서 사내 서버와 오피스 업무를 겨냥한 업스테이지 노선이 유리해진다
8월 2차 평가 결과가 판정 기준입니다.
의회가 2027 회계연도 국립과학재단 예산을 요청안보다 크게 늘린다
에너지부가 행정명령 시한 안에 한 과제 이상에서 플랫폼의 초기 운영 능력을 시연한다
8월 7일 에너지부는 제네시스 오픈 모델 이니셔티브 공모를 시작했습니다.
278개 선정 과제가 재현 가능한 논문과 공개 데이터로 결과를 낸다
에이전트 사용자가 앱 사용자의 90분의 1 수준에 머무는 동안 설비투자를 정당화할 매출은 뒤로 밀린다
7월 21일 기준 Codex와 ChatGPT Work 주간 사용자는 1,000만 명, ChatGPT 앱 주간 사용자는 9억 명입니다.
늘어난 추론 수요가 HBM 대신 값싼 메모리와 로컬 하드웨어로 흩어진다
엔비디아 Rubin CPX는 GDDR7 128GB를 쓰고, 추론 캐시를 낸드로 내리는 방식도 쓰이기 시작했습니다.
에이전트 사용자가 반도체 수요를 몇 배로 늘릴 만큼 빠르게 늘지는 않는다
7월 21일 기준 Codex와 ChatGPT Work 주간 사용자는 1,000만 명으로 ChatGPT 주간 사용자의 1% 남짓입니다.
에이전트 쪽에도 지브리 모먼트가 한 번 나와야 확산이 시작된다
기업 AI 성과가 확인되기 전까지 빅테크 설비투자는 언제든 늦춰질 수 있다
확산 언어 모델이 다양해질수록 UnMaskFork 같은 다중 모델 협업의 성능 이득이 커진다
중국 AI의 속도를 당분간 정하는 변수는 인재보다 연산이다
문샷AI는 Kimi K3 공개 48시간 만에 연산 한계로 신규 구독을 멈췄고, 딥시크 저자 356명 가운데 53.5%는 중국 밖 경력이 없었습니다.
3.5 Pro 지연은 최상위 모델을 만드는 능력의 문제일 수 있다 (7월 21일 스레드)
구글은 코딩 순위 경쟁 대신 검색·안드로이드·워크스페이스에 싸고 빠른 모델을 넣는 쪽으로 승부한다 (7월 21일 스레드)
강화학습 규모가 커질수록 모델의 보상 추구 성향도 커진다
연구진의 전망입니다. 안전 훈련을 마친 출시 모델에서 같은 측정을 한 결과는 아직 공개되지 않았습니다.
코드 반출이 막힌 조직부터 클라우드 토큰 과금 대신 로컬 장비에서 오픈웨이트 코딩 모델을 돌리는 곳이 늘어난다
Laguna S 2.1의 NVFP4 체크포인트는 약 71GB로 128GB DGX Spark 한 대에서 초당 13~24토큰으로 돕니다. 칸트는 고객들이 첫날부터 가중치를 받아 인터넷과 끊긴 환경에 설치해 써 왔다고 말했습니다.
사내 지식베이스는 처음 만드는 일보다 자료를 최신으로 유지하는 일에 더 많은 품이 든다
세레브라스는 40GB가 넘는 저장소를 커밋마다 갱신하는 방식을 공개했지만 유지 비용과 인원은 밝히지 않았습니다.
직접 짜는 하네스의 우위는 12개월 안에 상당 부분 모델로 흡수된다
킬패트릭이 6월 11일 공개된 대담에서 내놓은 전망으로, 2027년 6월 무렵 확인할 수 있습니다.
모델마다 여러 하네스에 얼마나 잘 적응하는지 재는 측정이 업계 표준으로 쓰인다
안목이 영원히 사람의 영역으로 남지는 않는다
디자인에도 잘잘못을 가르는 채점 루프가 생기면 경계가 다시 움직입니다. 암브로시노도 완전 자율에 대해 never도 always도 말하지 않았습니다.
틀린 판단도 그대로 적는 뉴스레터를 보내드려요.