채점이 끝난 21건 기준 98%예요. 일부는 0.5로 셌어요.
다음 세대 모델의 최고 실행은 다섯 과제의 기준선을 모두 넘는다(Andon Labs의 7월 24일 전망)
9월 10일 Andon Labs는 9월 3일 나온 오픈AI의 GPT-6 Astra가 다섯 과제 각각에서 적어도 한 번 사람 기준선을 넘은 첫 모델이라고 밝혔습니다. 그보다 앞선 8월 3일에는 모델이 채점 환경을 엿보는 부정행위가 늘고 있다며, 걸린 실행을 버리고 다시 돌린 기록을 따로 공개했습니다.
오픈AI가 통화에서 말한 나비에-스토크스 증명을 공개한다
9월 9일(한국 시각) 오픈AI가 GPT-6 Astra보다 훨씬 뛰어난 차세대 내부 모델로 에이전트 약 1만 개가 88시간 만에 만든 나비에-스토크스 해법이라며 공개했습니다. 부벡은 같은 날 알푀게를 저자에서 빼라고 요구한 적이 없다고 반박했고, 오픈AI 대변인은 9월 10일 뉴욕타임스에 버크마스터의 지난 두 달 Codex 프롬프트가 학습을 포함해 어떤 방식으로도 시스템에 영향을 줄 수 없었다고 밝혔습니다.
게시판 문법은 5일에 걸쳐 에이전트들이 스스로 만들었다
받는 쪽을 지정한 메시지가 2만 4,778건 쌓였다
사칭 사고 34분 뒤 공개키 서명 메시지가 처음 등장했고 429건이 오갔다
전체 작업 지시의 약 10%가 한 에이전트에게서 나왔다
Replica는 논문 100편에서 만든 학습 242개, 테스트 68개로 구성됩니다.
Faraday는 분포 내 ML 과제 73%, 미학습 과학 과제 60%의 승률을 기록했습니다.
상상 과제 20개 중 19개에서 Faraday가 선호됐습니다.
해당 판정 모델은 상상 과제에 대해 검증되지 않았습니다.
앤트로픽이 탐지 API를 자격을 갖춘 기관부터 제한적으로 연다
9월 1일 갱신된 설명에 따르면 탐지 API는 비공개 프리뷰로, EU 법이 정한 규제·수사 기관과 언론, 팩트체커, 독립 연구자, 교육기관, EU 시민단체, 준수 의무가 있는 기업에 먼저 열렸습니다.
GLM-5.3이 Artificial Analysis 종합 지수에서 58~60점 안팎에 들어온다
8월 26일 Artificial Analysis가 GLM-5.3-Flash 평가 글에서 GLM-5.3(최대 추론)을 60점으로 적었습니다.
암호화된 추론 블록이 세션·사용자·모델 사이에서 호환됩니다.
복원한 추론의 토큰 수가 API 청구 thinking 토큰 수와 대부분 1대 1로 일치했습니다.
공개 저장소 블록 31만 5,320개에서 개인식별정보 367건, 자격증명 182건이 나왔습니다.
앤트로픽이 워터마크 탐지를 누구나 쓰게 열지 않고 자격을 갖춘 기관부터 연다
9월 기준 지원 문서는 워터마크 탐지를 비공개 프리뷰로 두고, EU 법이 정한 규제·수사 기관과 언론, 팩트체커, 연구자, 교육기관, 준수 의무가 있는 기업에 먼저 열었습니다.
MiniMax가 H3 가중치를 며칠 안에 공개한다
MiniMax는 8월 3일(한국 시각) 허깅페이스에 H3 가중치를 공개했습니다. 풀린 것은 768p를 만드는 H3-Base(33B)이고, 지시문을 정리하는 H3-Context-IR과 2K 재생성은 API로 남았습니다. 라이선스 Q&A는 EU와 영국, 한국, 미국에서의 오픈웨이트 이용을 별도 승인 대상으로 두었습니다.
딥시크가 가장 강한 모델도 가중치를 공개한다
8월 13일 V4-Pro 정식판을 내면서 같은 날 밤 가중치를 MIT 라이선스로 허깅페이스에 올렸습니다.
실리콘 방패가 사라지는 시점이 곧 위험의 시점이다
애리조나 2나노 양산은 2029~2030년이라 2027년 준비태세보다 늦고, 가동 중인 팹은 침공으로 확보되지 않습니다.
Kimi K3는 GLM-5.2보다 사이버 역량이 높게 측정돼 오픈·폐쇄 격차를 더 줄인다
7월 23일 AISI·CAISI 예비 평가에서 K3는 사이버레인지 평균 17단계로 GLM-5.2(11단계)를 넘었고 10번 중 1번 완주했습니다. 미국 최상위 모델 평균 28.5단계에는 못 미쳤습니다.
개발 공고의 반등이 22~25세 개발 직군 고용 회복으로 곧바로 이어지지 않는다
스탠퍼드 연구진이 8월 12일 낸 개정판에서 AI 노출 직군 22~25세 고용 격차는 2025년 7월 자료 기준 15%에서 2026년 6월 자료 기준 19%로 벌어졌고, 연구진은 주된 경로를 채용 감소로 봤습니다.
수도권에서는 데이터센터가 전력 공급 승인을 받기 어렵다
7월 14일 뉴시스 보도(CBRE코리아 보고서 인용)에 따르면 2026년 3월 누적 수도권 전력계통영향평가 1차 기술검토 신청 522건 가운데 최종 공급 승인은 10건(건수 기준 1.9%)이었습니다.
LLM이 쏟아내는 버그 보고로 험난한 18개월(어쩌면 12개월)을 지나면, 퍼저 때처럼 버그가 잦아들고 커널 코드는 더 나아진다
그렉 크로아하트만이 9월 22일 Kernel Recipes 2026 발표에서 내놓은 전망입니다. 그는 3월부터 18개월이라고 말해 왔다고 했습니다.
2036년 최전선 슈퍼컴퓨터는 공장에서 만든 몇 MW짜리 랙에 물과 전력, 광섬유만 꽂는 형태가 된다
우주 데이터센터에는 근본적으로 가로막는 문제가 없다
사람이 컴퓨터로 하는 모든 일에서 모든 인간과 같거나 더 나은 모델이 2년 안팎(2028년 전후)에 나온다
숄토 더글러스가 2026년 8월 녹화, 10월 2일 공개된 American Optimist 대담에서 내놓은 전망입니다.
앞으로 2년 안에 사이버 보안은 공격보다 방어가 유리한 쪽으로 돌아선다
같은 대담에서 더글러스가 내놓은 전망입니다.
2028년 가정에 빨래와 간단한 청소를 하는 휴머노이드 로봇이 수만 대 들어간다
같은 대담의 2028년 예측입니다.
인터넷에서 일어나는 행동의 대부분을 에이전트가 하게 된다
루프와 그래프로 에이전트 흐름을 짜는 방식은 지나가는 단계다
2027년 AI가 정말 쓸 만해지고, 2028년에는 버튼 하나로 회사 인력 전체를 복제할 수 있다
에마드 모스타크가 8월 28일 공개된 피터 매코맥 쇼에서 내놓은 전망입니다.
2027년 테슬라 옵티머스급 휴머노이드가 시간당 1.5달러로 미국 트럭을 몰 수 있다
같은 대담에서 내놓은 전망입니다.
개인 에이전트는 한동안 어수선한 시기를 거친 뒤 사람들이 받아들일 쓰임새만 남는다 (하드포크 패널의 전망)
모두가 개인 비서를 쓰게 되면 비서끼리 겨루는 군비 경쟁이 된다 (하드포크 패널의 우려)
2028년 전에 어떤 행동이든 모델 안에서 그 원인을 인과적으로 찾아낼 수 있게 된다 (에릭 호의 전망)
내부 활성값 감시가 외부 감시를 곧 확실히 앞선다 (에릭 호의 전망)
모든 훈련 실행에 보상 해킹 감시가 붙어 지금 같은 보상 해킹 비율은 과거의 일이 된다 (굿파이어의 전망)
가장 똑똑한 프런티어 모델이 검증 토큰을 덜 써서 쉬운 일에서도 작은 모델보다 싸진다 (타리크 시히파르)
모델이 좋아지면 CLAUDE.md가 사라진다 (타리크 시히파르)
Claude Code는 클라우드 두뇌, 로컬·원격 손, 아티팩트 화면으로 나뉜다 (타리크 시히파르)
5~10년 뒤 지식노동자와 개발자는 지금보다 많아진다 (마이크 캐넌브룩스)
MCP와 CLI로 아틀라시안을 쓰는 고객은 화면 사용과 유료 좌석도 함께 늘린다 (마이크 캐넌브룩스)
챗봇은 업무의 최종 인터페이스가 되지 않는다 (마이크 캐넌브룩스)
AI 모델이 발전할수록 로봇의 작업 능력도 함께 좋아질 수 있다
HomeBody는 VLM을 바꿔 끼울 수 있게 설계됐지만, 다른 모델로 같은 과제를 돌린 결과는 아직 없습니다.
5년 뒤 자동화 트래픽이 사람 트래픽의 1,000배가 된다 (매슈 프린스)
올해 파크 레코드의 AI 라이선스 수입이 디지털 광고 수입을 넘는다 (매슈 프린스)
기술 업계 밖에서도 AI를 이유로 한 감원이 잇따른다 (매슈 프린스)
한 회사가 AGI를 만들어도 며칠 안에 경쟁사들이 따라온다 (매슈 프린스)
토큰 경제가 5년 안에 약 5조 달러, 10년 안에 10조 달러 규모가 된다 (안즈니 미다)
추론에 웃돈을 붙여 되파는 회사들이 정해진 작업 단위 과금으로 옮겨 가고, 사용자가 자기 추론을 가져오는 방식이 늘어난다 (알렉스 아탈라)
앞으로 10년 동안 사람이 저지르던 토큰 사기를 AI 에이전트가 저지르게 된다 (안즈니 미다)
RNA 앱타머 사고 사슬 설계가 습식 실험에서도 확인된다 (응우옌)
서열과 성능 점수가 짝으로 쌓인 다른 생물학 과제에도 같은 틀을 적용할 수 있다 (응우옌)
다음 세대 Omnii는 단백질, RNA, 후성유전체 등 여러 양식을 함께 다룬다 (응우옌)
5년 안에 총요소생산성 증가율 3%를 넘긴다 (TypeSafe 선언문)
모델 하나를 전제로 만든 코딩 에이전트와 여러 모델을 쓰는 코딩 에이전트의 경쟁 구도가 달라진다 (알메이다)
jev-1.13.0을 장기 지원 대상으로 묶는 방안을 검토한다 (알메이다)
성과를 낸 내부 모델이 8월 유출글의 'Bel'과 같은 모델인지는 확인되지 않았습니다.
판단 전용 모델에서 오래 남는 것은 특정 모델보다 선택지를 주고 확률을 돌려받는 호출 방식이다
9월 21일 기준 근거는 6일 사이 나온 Jev식 공개 모델 4개와 Claude Code 라우터, Vercel AI Gateway 연결입니다.
전쟁부가 이번 사고에 쓰인 챗봇의 종류를 공개한다
9월 18일 보도 시점에 CNN은 상용 제품인지 정부용 도구인지 확인하지 못했고, 전쟁부는 논평 요청에 답하지 않았습니다.
미군이 AI가 만든 정보를 검증하는 단일 기준을 내놓는다
보도 시점에는 부서마다 다른 도구와 안전 기준을 쓰고 있었고, AI가 만든 정보를 검증하는 단일 기준이 없었습니다.
AI 안전 논쟁도 곧 진영에 따라 갈리게 된다 (케빈 루스의 전망)
의회가 AI 안전 법안을 통과시켜도 대통령 거부권이 나올 가능성이 높다 (케이시 뉴턴의 전망)
머지않아 어느 나라의 몇 사람이 자체 에이전트 무리를 꾸려 세상에 풀 수 있게 된다 (케이시 뉴턴의 전망)
지연이 아주 중요한 작업 20~30%를 확산 언어 모델이 가져간다 (에르몬)
Inception이 몇 달 안에 가장 큰 다음 확산 언어 모델을 공개한다
추론 경쟁에서 더 병렬적인 확산 방식이 자기회귀 방식을 이긴다 (에르몬)
다음 세대 모델은 아주 긴 에이전트 작업을 매우 정확하게 해낸다 (무스타파 술레이만)
2년 안에 안전장치 없는 오픈소스 모델이 개인 컴퓨터에서 허깅페이스 사고 수준의 행동을 할 수 있다 (무스타파 술레이만)
AI가 AI 연구를 맡으면서 발전 속도가 지금의 약 3배로 빨라진다
프런티어 모델이 3개월짜리 과제를 해내게 되어 출시 전 평가가 모델의 전체 작업 길이를 따라가지 못한다
올해 말까지 포천 1000대 기업의 절반이 AIUC-1 컨소시엄에 대표를 둔다 (크비스트)
AIUC가 몇 주 안에 프런티어 AI 재난 위험 보험계리 모델을 오픈소스로 공개한다
AI 감사·보험이 에이전트에서 프런티어 모델, 로봇으로 넓어진다 (크비스트)
기업 AI는 여러 모델을 함께 쓰는 방식으로 가고, KV 캐시 재사용 같은 모델 간 상호운용 표준이 생긴다 (사티아 나델라)
AI 데이터센터 칩 공급이 엔비디아 외에 자체 칩과 AMD 등으로 다양해진다 (사티아 나델라)
5년 뒤 기업 AI 토큰의 90%가 사용자가 시작하지 않은 작업에 쓰인다
모델 회사의 토큰 보조는 상장 뒤 오래가지 못한다
한두 연구소가 AI 가치의 95%를 가져가는 구도는 오지 않는다
코딩 밖 지식노동의 AI 확산은 실리콘밸리 예상보다 훨씬 오래 걸린다
중국은 2030년까지 첨단 노광 장비를 자체 개발한다 (젠슨 황)
프런티어 연구소들이 연구에서 엔지니어링 조직으로 옮겨 가며 사고를 통제할 수 있게 된다 (젠슨 황)
수천 명이 몇 년 걸리는 AI 연구를 AI가 몇 주로 줄인다
로봇이 실험을 대신 돌리는 데 필요한 조건이 3~5년 안에 갖춰진다
오픈AI가 직원급 접근권을 가진 독립 평가자를 들인다
9월 12일 올트먼이 X에서 같은 조치를 하겠다고 밝혔습니다.
앤트로픽의 상주 외부 검토 팀이 편집 없는 첫 공개 보고서를 낸다
에세이는 가까운 시일 안에 검토 팀을 들이겠다고만 적었습니다.
배선을 섞은 대조군보다 원래 배선이 뚜렷하게 나은 과제가 커넥톰 시뮬레이션에서 나온다
개인 데모에서 시작한 회로 차단 실험이 실물 초파리 측정과 비교된다
1년쯤 뒤 한 달짜리 사무직을 맡길 원격 근무자 AI가 쓸 만한 형태로 나온다 (오닐·슐먼)
2년 안에 AI 연구자의 생산성이 10배가 된다 (슐먼)
3~4년 안에 컴퓨터로 하는 모든 일에서 최고 전문가를 앞서는 AI가 나온다 (슐먼)
재귀적 자기개선이 지속 학습보다 먼저 온다 (오닐)
모델 구조로 KV 캐시를 줄이는 방식이 퍼지면 AI 사용량과 메모리 수요는 같은 비율로 늘지 않는다
소비자가 컴퓨터 사용 에이전트에 익숙해지면서 기업용 소프트웨어도 에이전트가 쓰기 쉽게 다시 만들어진다
쇼핑몰은 사람 대신 에이전트를 끌어들이도록 다시 설계된다
Muse Confidential VM은 올해 안에 나올 예정입니다.
자동화형 대화 비율이 45%에서 90% 쪽으로 오르고 22~25세 고노출 직업 진입률이 계속 낮아지면, AI가 노동소득 비중 하락을 가속한다는 근거가 강해진다
두 값이 함께 움직여야 AI의 기여가 오래된 요인과 갈립니다.
봇이 사람보다 먼저 연락하는 능동형 에이전트가 AI의 다음 변화가 된다
일과 개인 생활을 한 제품이 함께 맡는 형태가 가장 좋은 제품 형태가 된다
머지않아 사용자가 봇의 원격 컴퓨터를 직접 들여다볼 일이 사라진다
같은 방법이 나비에-스토크스로 이어지고 외력도 없앨 수 있다
두 사람의 하이포디시페이티브 나비에-스토크스 폭발 논문이 Lean 검증을 마치고 공개된다
AI 전반의 진보가 갈수록 감시에 대한 확신에 가로막힐 것이다
파초키가 9월 6일 에세이에 적은 전망입니다.
공통 안전 기준이 세워질 때까지 연구소들의 자발적 감속이 널리 퍼질 것이다
파초키가 기대와 바람으로 적은 전망입니다.
다음 1년 동안 형식화의 속도는 증명을 옮기는 일보다 필요한 정의를 만드는 일이 정한다
버저드의 Annals Challenge(8월 13일 공개) 결과로 판정합니다.
AI 칩과 메모리의 공급 제약은 적어도 3~5년 이어진다
5년 넘게 지나면 단순한 칩은 아이디어에서 GDS2 파일까지 AI로 설계한다
에이전트 확산으로 데이터센터의 GW당 CPU 수요가 지금의 4배를 넘는다
AI 장악 가능성은 반반쯤이다 (벅 슐레게리스의 추정)
1~5년 안에 AI 회사들이 AI로 지금 속도 기준 5년치 발전을 1년에 해낼 수 있다 (벅 슐레게리스의 전망)
AI가 AI 연구 대부분을 맡을 즈음에는 사고 사슬 감시가 통하지 않을 가능성이 꽤 높다 (벅 슐레게리스의 전망)
LearnVector가 내년 초 일대일 학습 제품을 보여 준다
응이 8월 28일 공개된 대담에서 내년 초에 보여 줄 것이 많을 거라고 했습니다.
Muse Spark 1.2 가중치는 최종 안전성 미세조정을 마친 뒤 공개될 예정입니다.
3.9는 건너뛰고 다음 이름은 Gemini 4가 될 것이다 (9월 2일 스레드)
스트리밍 음성 인식 1위 기록 3.1%는 몇 달 안에 다른 모델로 넘어갈 수 있다
11월 미국 중간선거에서 양당이 AI 규제를 전면 공약으로 세우고 신입 채용 감소가 고용 지표로 확인되면, 신봉건제 프레임은 학술 논쟁에 머물지 않고 실제 정책이 될 가능성이 더 높습니다.
프런티어 에이전트가 6개월 안에 AI 회사 안에서 들키지 않는 무단 배포를 세울 능력을 갖출 가능성이 높다
에이제이아 코트라의 8월 28일 블로그 개인 전망입니다.
보안이 크게 나아지지 않으면 6개월 안에 프런티어 에이전트가 AI 회사 안에 감시를 피한 불법 배포를 세울 수 있게 된다
계속 곁에 남아 사람과 함께 일하는 AI 동료가 채팅과 에이전트에 이은 AI 제품의 세 번째 시대가 된다
Hy4 정식판이 프리뷰의 과도한 추론 문제를 줄여 나온다
텐센트는 필요 이상으로 오래 추론하고 자기 결과를 지나치게 다시 확인하는 경향을 알려진 한계로 적었습니다.
외부 독립 측정에서 Hy4가 GLM 5.3·Kimi K3와 같은 구간에 든다
GDPval-AA v2 공식 점수는 Hy4 1,678점, Kimi K3 1,675점, GLM 5.3 1,763점이었습니다.
다른 AI 공급사들도 군 계약에서 일부 사용 제한을 지켜 낸다
법원은 비판을 이유로 한 제재를 위법으로 봤지만, 전쟁부가 공급사를 고를 자유는 그대로 인정했습니다.
프런티어 연구소의 실질 AI 노동력이 해마다 10배로 늘어 이 10년이 끝나기 전 한 회사의 AI 노동력이 세계 인구를 넘는다
오픈AI와 앤트로픽이 내년 세계 신규 AI 연산의 40~50%를 가져간다
경쟁당국은 비엔비디아 추론 서비스의 동등한 대우와 기업 데이터 분리, 모델·데이터 이동권을 심사할 가능성이 있다
오픈AI와 앤트로픽이 2027년 세계 신규 AI 연산의 40~50%를 가져간다
2028년 말 오픈AI와 앤트로픽이 세계에서 쓸 수 있는 AI 연산의 대부분을 쥔다
2027년 말 선두 연구소의 메가와트당 연 매출이 7,000만~8,000만 달러에 이른다
2024~2029년 AI 설비투자 약 11조 달러 가운데 5조 달러 이상을 빚으로 조달한다
에이전트 곁을 지키는 지금의 작업 방식은 자동화로 줄어들고, 사람은 하루 한 번 결정만 내리게 된다
에이전트 덕분에 리눅스가 데스크톱에서 이긴다
지금의 초고속 추론 속도가 1~2년 안에 기본값이거나 그에 가까운 수준이 된다
티보 소티오가 8월 24일 공개된 인터뷰에서 내놓은 전망입니다.
지금의 코덱스가 2~3개월 뒤 원시적으로 보일 만큼 에이전트 쓰는 방식이 달라진다
소티오가 8월 3일 X에 쓴 전망입니다.
보통 기업이 상위 10% 기업의 AI 사용을 따라붙으면 지금의 데이터센터 공사는 초기 물량으로 남는다
8월 기준 근거는 오픈AI Signals의 토큰 출력 증가(상위 10% 17.1배, 보통 기업 2.1배, 격차 8.3배)입니다.
다음 전환의 신호는 모델 발표보다 토큰 사용량 곡선과 결제 장부에서 먼저 나온다
8월 19일 Stripe 투자자 서한과 Menlo Ventures의 토큰 곡선을 근거로 한 전망입니다.
5~10년 안에 1조 파라미터 규모의 계속 배우는 모델을 20와트로 돌릴 수 있다
가중치별 스텝 크기와 연속 역전파를 합친 새 세대 지속 딥러닝이 몇 년 안에 나온다
다른 프런티어 연구소도 훈련 감속과 전면 감시 같은 조치를 따라온다
8월 18일 기준으로는 오픈AI의 단독 조치였습니다.
클라우드 회사들은 앞으로 서버 임대보다 에이전트 실행 환경을 두고 더 치열하게 겨룰 것입니다.
Stripe는 OpenRouter를 모델 중립 브랜드로 두고, 뒤에서는 모델 호출과 예산 관리를 Metronome 과금, Radar 사기 방지, 세금, 에이전트 결제, 스테이블코인 정산과 묶을 것이다
8월 19일 Stripe와 OpenRouter가 인수 합의를 공식 발표했고, OpenRouter는 이름과 제품, 로드맵을 그대로 두고 모든 모델을 같은 조건에 두겠다고 밝혔습니다. 거래 종결 전입니다.
누구나 무엇이든 만들 수 있게 되면 디자인이 제품을 평가하는 가장 중요한 기준의 하나가 된다
챗GPT가 즉답과 대화, 작업 위임을 스스로 고르는 하나의 입력창으로 간다
자동화 코더가 2027년 11월 무렵 도래한다
코코타일로의 8월 16일 최종 중앙값입니다. 같은 팀의 리플랜드는 2030년 1월, 브렌던은 2029년 1월을 적었습니다.
코딩 업리프트에서 1을 뺀 값이 5개월마다 두 배가 되는 추세가 이어진다
8월 업데이트에서 코코타일로가 쓴 중앙 가정입니다. 리플랜드는 6.5개월, 브렌던은 5.5개월을 넣었습니다.
중간값 기업의 AI 지출이 상위 기업을 따라오지 못하면 설비를 먼저 지은 네오클라우드의 부담이 커진다
8월 기준 근거는 Ramp 자료의 직원 1인당 월 AI 지출(상위 1% 약 7,500달러, 중간값 약 12달러)과 코어위브의 2분기 설비투자 64억 2,200만 달러입니다.
배포 전 시험 제도가 도입되면 앤트로픽의 다음 프런티어 모델 출시도 그 시험 기간만큼 늦춰진다
아모데이는 자신이 지지한 시험 절차가 프런티어 기업을 먼저 늦춘다고 설명했습니다. 8월 16일 현재 제도는 도입 전입니다.
SpaceX의 AI 매출이 2026년 9월 나머지 사업 매출 전체를 넘는다
머스크가 8월 11일(미국 시각) 공개된 사내 발표에서 한 예측으로, 3분기 실적에서 확인할 수 있습니다.
SpaceX가 2027년 말까지 AI 컴퓨트 10GW를 확보한다
머스크는 지금까지 지은 규모의 약 10배라고 했습니다.
4~5년 안에 AI가 SpaceX 가치의 99%를 차지한다
상장 전 모닝스타는 적정가치 7,800억 달러 가운데 AI 사업을 1,700억 달러로 잡았습니다.
이 결과를 자율적 과학 발견의 증명으로 보기는 이릅니다.
반복 작업은 사내 27B가 맡고 어려운 설계와 최종 검토만 상위 API나 사람이 맡는 구성이 퍼진다
다른 주요 모델 개발사도 각자의 텍스트 워터마크를 넣는다
앤트로픽은 약 190개 서명 조직 가운데 다른 주요 개발사도 같은 EU 실천규약에 서명했다고 밝혔습니다.
프런티어 연구소의 사내 최상위 모델과 공개 제품 사이의 간격은 앞으로 더 벌어진다
8월 15일 스레드의 전망입니다.
구글은 3.5 Pro를 건너뛰고 바로 Gemini 4로 갈 것이다 (8월 13일 스레드)
앤트로픽 CEO 배우자의 역할을 판단할 근거는 가을 상장 신고서(S-1)의 관련자 거래 항목에서 처음 공개된다
8월 14일 스레드의 전망입니다. S-1 제출로 판정합니다.
다음 세대의 성능은 파라미터 수보다 실행 환경과 채점 설비를 얼마나 키우느냐에서 먼저 갈릴 가능성이 크다
최상위 점수대가 오픈AI·앤트로픽·xAI 3자 구도로 굳어지며 가격 경쟁과 출시 주기가 빨라진다
8월 12일 스레드의 전망입니다. xAI가 다음 판에서도 독립 지수 최상위 점수대를 지키는지로 채점합니다.
Kimi-K3가 Opus를 증류했다는 관찰은 정황이며 확정되지 않았습니다.
저자들이 정황 관찰로 제시했고 통제 조건에서는 재현되지 않았습니다.
AI 연구개발이 2030년 말~2031년 초(중앙값)에 완전히 자동화된다
2026년 말 앤트로픽의 AI 연구 인력 속도가 AI 덕분에 약 2.5배가 된다
AI 연구가 완전히 자동화된 뒤 1년 안에 지금 속도로 4~5년 걸릴 발전이 나온다
50년 동안 해석학으로 밀던 문제를 선형대수로 갈아탄 것이 이 결과의 실제 내용이다
레빈슨 이후 이 기록을 올린 논문은 전부 몰리파이어라는 같은 도구를 썼습니다.
AI 자기개선은 자동 채점이 되는 소프트웨어에서 먼저 빨라지고, 실험·칩·전력망 단계는 그 속도를 따라가지 못한다
일자리 충격은 모델 출시일보다 기업이 일을 다시 나누는 시점에 커진다
연구자 이탈은 단기 실적에서 구글의 손실로 잡히지 않고, 떠난 사람들의 회사가 구글 클라우드 고객으로 돌아온다
피차이는 Discovery Loop에 창업 투자자이자 클라우드 파트너로 참여한다고 밝혔고, 2분기 실적 발표에서 이니퍼블 인텔리전스를 AI 인프라 고객으로 불렀습니다.
제미나이 4 일정이 3.5 Pro처럼 밀리면 구글 연구자 이탈이 더 이어진다
AI 평가 환경에 실시간 감시와 더 강한 샌드박스가 기본으로 붙는다
이미지 모델 경쟁의 중심이 한 장을 잘 뽑는 생성에서 고친 뒤 나머지를 지키는 정밀 편집으로 옮겨 간다
8월 8일 스레드의 판단입니다. 다음 판들이 편집 순위와 편집 도구를 앞세우는지로 채점합니다.
가중치까지 칩에 새기는 방식은 같은 모델을 1년 넘게 쓰는 대규모 반복 트래픽에서만 GPU보다 경제성이 난다
Taalas의 100만 토큰당 0.75센트 계산은 고객이 같은 모델을 1년 이상 쓴다는 전제 위에 있습니다.
Prime Agent와 Opus 5 조합이 ARC Prize의 비공개 세트 검증에서도 사람 기준선 근처 점수를 낸다
8월 5일 발표의 95.5%는 공개된 25개 환경에서 나온 자체 보고입니다.
모델과 하네스를 함께 학습시키는 방식이 새 능력을 여는 주된 길이 된다
Prime Intellect는 아직 어떤 모델도 Prime Agent에 맞춰 학습되지 않았다고 밝혔습니다.
사내 에이전트 카탈로그가 150개 안팎을 넘기면 스킬을 늘리는 일보다 무엇을 올리지 않을지 고르는 일이 품질을 정한다
LangChain 사례 글에 따르면 Stripe 팀은 스킬이 150개를 넘기면 시스템 프롬프트와 합쳐졌을 때 최신 모델의 품질이 떨어지는 것을 관측했습니다.
Pax Machina에 편집진과 자문단이 몸담은 회사에 불리한 제도 설계가 실린다
편집진과 자문단에 구글 딥마인드, 오픈AI, 앤트로픽 사람이 함께 있습니다.
Pax Machina에서 다듬어진 제도 설계가 해외 규제 논의를 거쳐 국내 AI 제도 논의에 등장한다
편집진과 자문단 여럿이 백악관과 영국 정부의 AI 정책에 관여해 왔습니다.
세상은 소수 연구소의 범용 모델 대신 회사마다 하나씩, 수백만 개의 특화 모델로 나뉜다
2027년 소비자용 서비스에서 생성 AI의 쓰임새가 크게 열린다
미국 안에서 폐쇄형과 오픈 모델의 성능 격차가 줄어든다
앞으로 공개될 전사에서 모델이 상대를 실제 사람으로 인식한 시점이 밝혀지면 이번 사건의 해석이 달라진다
과거 평가 재점검에서 비슷한 경계 이탈 행동이 추가로 발견된다
코덱스는 여러 클라우드 컴퓨터에 작업 상태를 보존하고 사람은 지휘·승인하는 구조로 옮겨 간다
8월 4일 소티오의 예고와 6월 11일 Ona 인수 합의를 근거로 한 전망입니다.
Qwen3.8-Max는 아티피셜애널리시스 지능 지수에서 50점대 초중반에 든다
프런티어 경쟁의 중심이 더 큰 모델에서 더 큰 학습 공장으로 옮겨 간다
오픈AI의 첫 AI 연구 인턴이 9월에 나온다
야쿠프 파초키가 밝힌 일정입니다. 2027년 자동 AI 연구자 예측을 가늠할 첫 재료입니다.
이 사업의 성패는 순위표보다 공공 조달과 기업 도입에서 정해진다
GPU를 지원해 모델이 나오는 단계까지는 정책이 만들 수 있지만, 그 모델을 실제 업무에 쓰게 만드는 것은 구매와 검증 제도입니다.
한국이 로봇 판에서 쥔 협상 재료는 공정 데이터와 작업자의 손에 남은 노하우다 (7월 30일 스레드)
오픈웨이트 자체 구축의 약점은 성능보다 장비 상각 기간에서 먼저 드러난다
3년 상각을 전제로 산 GPU의 토큰 단가가 상각 도중 API 가격 밑으로 밀리는지로 판정합니다.
값을 내리는 회사와 그 값을 업무 흐름에 얹는 회사가 같아야 인하가 매출로 돌아온다
오픈AI는 이번 인하를 Codex와 ChatGPT Work의 사용량 계산에도 반영했습니다.
200B~300B급 오픈웨이트는 사실 지식을 검색과 도구에 맡기고 추론과 코딩을 싸게 처리하는 용도로 쓰인다
7월 기준 근거는 Inkling-Small의 도구 사용 HLE 47.8%, 출력 100만 토큰당 1.20달러, SimpleQA Verified 20.6%입니다.
이번 하락에서 무너진 것은 산업보다 그 산업의 미래에 매기던 값과 거기 얹힌 배수다
메모리 계약가격은 주가가 무너지는 구간에도 계속 올랐고 낸드 계약가격은 상반기에만 100% 넘게 뛰었습니다.
2027년 AGI 주장은 이번 일로 반박되지 않았다
반박된 것은 그 주장에 배수를 얹고 매일 가격이 찍히는 시장에서 버티는 방식입니다.
다음 세대 시스템 카드에 평가 환경의 격리 조건을 적는 항목이 새로 생긴다
지금 시스템 카드에는 능력 점수와 안전 평가는 있어도 그 평가를 돌린 환경이 어떻게 격리됐는지를 적는 항목이 없습니다.
트랜스포머는 지속 학습을 할 수 없어 다른 구조로 대체된다
AI 연구소의 실험 속도가 하루 1개에서 10개, 200개로 늘어난다
이 발표에서 오래 남을 쪽은 선호율보다 공개된 데이터와 수집 코드다
마을 좌표를 미리 계산하고 세 가지 조건으로 거른 청크 17만 8,271개를 포함한 데이터셋과 수집 코드, 모델 가중치가 모두 공개됐습니다.
경쟁은 같은 GPU에서 토큰을 얼마나 더 뽑는지에서 갈린다
새 아이디어를 가져오는 일은 에이전트가 대신하기 어렵고, 사용자 피드백에 뿌리내린 아이디어를 내는 일은 사람에게 남는다
나머지를 다 갖춰도 SK의 AI 수직계열화는 전력 계통 연결에서 갈린다
2027년 가동 목표인 최대 2GW AI 팩토리 첫 단계에 실제로 전기가 들어오는지가 판정 기준입니다.
값을 받는 대상이 모델 파일에서 커널·통신 라이브러리·라우터·라이선스로 옮겨간다
회사 단위 협상이 이어지면 HBM 공급 우위는 데이터센터·GPU 순번·전력망 같은 조건으로 이어지지 못하고 분기 실적으로만 남는다
2025년 10월 GPU 26만 장처럼 정부가 협상 창구를 맡은 방식이 상설 구조로 이어지는지가 판정 기준입니다.
일의 재편은 직함보다 업무 단위에서 먼저 나타난다
Kimi Vendor Verifier식 서빙 업체 채점이 다음 Kimi 모델 공개에도 그대로 쓰인다
앤트로픽이 몇 주에서 몇 달 안에 모델 안전장치 묶음을 개선해 제한된 모델의 사용자 경험과 접근 격차를 줄인다
발표 금액과 올해 실적, 몇 년 뒤 한국에 남는 것은 서로 다른 숫자로 나온다
서밋 발표에 딸린 돈 가운데 이사회 의결이 끝난 것은 SK하이퍼 출자 7,500억 원입니다.
이번 협약 물량이 실적으로 잡히는 시점은 빨라야 2027년 말, 현실적으로는 2028년이다
엔비디아에게 오픈웨이트는 기업·국가 단위 자체 구축 수요의 전제조건이다
엔비디아가 새로 나눠 보고하는 ACIE(AI 클라우드·산업·기업) 매출이 하이퍼스케일보다 빠르게 느는지로 판정합니다.
서한 명단은 7월 26일 이후에도 늘어나고, 명단 밖 대형 기업의 합류가 다음 변수가 된다
발행 뒤 확인: 마이크로소프트 페이지는 7월 30일 기준 230곳 넘게, 8월 3일 기준 270곳 넘게 서명했다고 적었습니다. 아마존·인텔·그록은 7월 30일 이전, 삼바노바는 8월 3일 이전에 합류했고, 앤트로픽·애플·퀄컴·브로드컴·세레브라스는 8월 5일 보관본에도 없습니다.
성능이 뒤져도 국가가 수요를 만들면 값을 부를 수 있다
창신메모리의 서버 D램 매출 비중은 2024년 8.4%에서 2025년 26.5%로 올랐고, 7월에는 64GB DDR5 서버 모듈을 삼성보다 비싸게 불렀습니다.
다음 세대 모델의 쇼케이스에 코끼리의 사실적 움직임과 풍동의 유체 계산이 성공 사례로 올라오면 실제 진전으로 볼 수 있다
CLAUDE.md와 스킬 같은 규칙 파일은 모델 세대가 바뀔 때마다 다시 줄이고 재는 대상이 된다
AMD가 그린 2030년 AI 가속기 시장 1조 4,000억 달러는 비싼 추론이 계속 비싸게 팔린다는 전제에 기댄다
같은 수준의 모델이 싸지고 책상 위 장비에서도 돌수록 기가와트 단위로 사 둔 가속기의 활용 기간이 짧아질 수 있다는 판단입니다.
12개월 안에 도구 20~40개를 채운 시스템 프롬프트가 사라진다
지식 노동에 쓰는 모델 크기의 정점은 1조~10조 파라미터 사이에 있다
강화학습이 사전학습의 더 이른 단계로 옮겨 간다
해자가 모델에서 제품 스택으로 옮겨간다
하네스와 평가, 강화학습 환경, 컨텍스트가 쌓이는 곳이 실제 자산이라는 주장입니다.
커머디티 시장에서 이기는 쪽은 생산 원가가 가장 낮은 곳이다
딥시크가 미국 프런티어와의 격차를 6개월, 나아가 3개월로 좁힌다
량원펑이 5월 20일 투자자 회의에서 밝힌 목표로, 당시 격차를 6~18개월로 봤습니다.
딥시크의 올해 기업 대상 매출이 10억 달러에 닿아 현금흐름이 흑자로 돈다
량원펑이 회의에서 조건부로 내놓은 전망입니다.
미국 정부는 중국 오픈웨이트 모델 사용을 전면 금지하는 대신 증류와 칩 같은 좁은 수단으로 대응한다
7월 24일 엔비디아와 마이크로소프트 등이 오픈웨이트 공동 서한을 냈고, 7월 27일 다리오 아모데이는 앤트로픽이 오픈웨이트 모델 금지를 주장한 적이 없다고 밝혔습니다.
증류 의혹은 중국 오픈웨이트 모델의 채택을 늦추는 규제 명분으로 쓰인다
증거 공개 없이 조달·호스팅 규정이 먼저 나오는지로 판정합니다.
제동은 모델 금지 대신 조달 규정, 호스팅 책임, 엔티티 리스트처럼 미국 기업의 채택 경로를 겨눈다
상무부 지정, 연방 조달 규정, 호스팅 책임 행정명령 가운데 무엇이 실제로 나오는지로 판정합니다.
독파모 2차 평가 기준이 현장 활용성으로 바뀌면서 사내 서버와 오피스 업무를 겨냥한 업스테이지 노선이 유리해진다
8월 2차 평가 결과가 판정 기준입니다.
의회가 2027 회계연도 국립과학재단 예산을 요청안보다 크게 늘린다
에너지부가 행정명령 시한 안에 한 과제 이상에서 플랫폼의 초기 운영 능력을 시연한다
8월 7일 에너지부는 제네시스 오픈 모델 이니셔티브 공모를 시작했습니다.
278개 선정 과제가 재현 가능한 논문과 공개 데이터로 결과를 낸다
에이전트 사용자가 앱 사용자의 90분의 1 수준에 머무는 동안 설비투자를 정당화할 매출은 뒤로 밀린다
7월 21일 기준 Codex와 ChatGPT Work 주간 사용자는 1,000만 명, ChatGPT 앱 주간 사용자는 9억 명입니다.
늘어난 추론 수요가 HBM 대신 값싼 메모리와 로컬 하드웨어로 흩어진다
엔비디아 Rubin CPX는 GDDR7 128GB를 쓰고, 추론 캐시를 낸드로 내리는 방식도 쓰이기 시작했습니다.
에이전트 사용자가 반도체 수요를 몇 배로 늘릴 만큼 빠르게 늘지는 않는다
7월 21일 기준 Codex와 ChatGPT Work 주간 사용자는 1,000만 명으로 ChatGPT 주간 사용자의 1% 남짓입니다.
에이전트 쪽에도 지브리 모먼트가 한 번 나와야 확산이 시작된다
기업 AI 성과가 확인되기 전까지 빅테크 설비투자는 언제든 늦춰질 수 있다
확산 언어 모델이 다양해질수록 UnMaskFork 같은 다중 모델 협업의 성능 이득이 커진다
중국 AI의 속도를 당분간 정하는 변수는 인재보다 연산이다
문샷AI는 Kimi K3 공개 48시간 만에 연산 한계로 신규 구독을 멈췄고, 딥시크 저자 356명 가운데 53.5%는 중국 밖 경력이 없었습니다.
3.5 Pro 지연은 최상위 모델을 만드는 능력의 문제일 수 있다 (7월 21일 스레드)
구글은 코딩 순위 경쟁 대신 검색·안드로이드·워크스페이스에 싸고 빠른 모델을 넣는 쪽으로 승부한다 (7월 21일 스레드)
강화학습 규모가 커질수록 모델의 보상 추구 성향도 커진다
연구진의 전망입니다. 안전 훈련을 마친 출시 모델에서 같은 측정을 한 결과는 아직 공개되지 않았습니다.
코드 반출이 막힌 조직부터 클라우드 토큰 과금 대신 로컬 장비에서 오픈웨이트 코딩 모델을 돌리는 곳이 늘어난다
Laguna S 2.1의 NVFP4 체크포인트는 약 71GB로 128GB DGX Spark 한 대에서 초당 13~24토큰으로 돕니다. 칸트는 고객들이 첫날부터 가중치를 받아 인터넷과 끊긴 환경에 설치해 써 왔다고 말했습니다.
사내 지식베이스는 처음 만드는 일보다 자료를 최신으로 유지하는 일에 더 많은 품이 든다
세레브라스는 40GB가 넘는 저장소를 커밋마다 갱신하는 방식을 공개했지만 유지 비용과 인원은 밝히지 않았습니다.
직접 짜는 하네스의 우위는 12개월 안에 상당 부분 모델로 흡수된다
킬패트릭이 6월 11일 공개된 대담에서 내놓은 전망으로, 2027년 6월 무렵 확인할 수 있습니다.
모델마다 여러 하네스에 얼마나 잘 적응하는지 재는 측정이 업계 표준으로 쓰인다
안목이 영원히 사람의 영역으로 남지는 않는다
디자인에도 잘잘못을 가르는 채점 루프가 생기면 경계가 다시 움직입니다. 암브로시노도 완전 자율에 대해 never도 always도 말하지 않았습니다.
오픈 웨이트와 폐쇄형의 평균 간격이 다시 3개월 안쪽으로 좁아진다
자체 채점 기준을 가진 조직이 가운데 구간 모델로 비용을 먼저 낮춘다
폐쇄형 최상위 모델과 오픈웨이트 모델의 격차가 몇 주 단위로 좁혀지다가 사라지는 시점이 온다
7월 16일 기준 아티피셜 애널리시스 지수 차이는 3점(Fable 5 60점, K3 57점)이고, AISI가 잰 사이버 역량 격차는 4~7개월이었습니다.
미국이 중국 오픈 모델을 차단하는 방식으로는 확산을 막기 어렵다
K3 가중치는 7월 27일 공개 예정이고, 한 번 풀린 가중치는 회수할 수 없습니다.
양수만 쓰는 구조는 뇌를 흉내 낸 칩과 잘 맞아 전력을 크게 아낄 수 있다
저자들은 아날로그·광·시냅스 소자 기반 뉴로모픽 기판에 맞을 수 있다고 적었지만 칩 위 측정은 논문에 없고, 음의 기여를 처리하는 회로는 여전히 필요하다고 밝혔습니다.
시장의 소프트웨어 매도는 지금 실적보다 몇 년 뒤 벌이의 지속성에 거는 베팅이고, 다음 몇 분기 실적이 그 베팅의 맞고 틀림을 가린다
a16z 자료에서 매출 증가율과 30거래일 수익률의 상관계수는 -0.08이었습니다. 2분기 이후 실적과 IGV 사분위 격차로 판정합니다.
오픈AI의 연산이 2030년 30GW에 이른다
앞으로 오픈AI 연산의 80% 이상이 추론에 쓰인다
AI가 다음 세대 AI를 학습시키고 돌릴 시스템과 칩을 직접 설계하는 시기가 멀지 않았다
에이전트 제품의 체감 속도와 원가는 모델 요금표 못지않게 실행 환경에서 갈린다
7월 기준 근거는 앤트로픽의 첫 토큰 시간 약 60% 단축과 SPACE의 생성 지연 3~5배 단축입니다.
넓고 깊은 리서치는 더 큰 모델보다 검색을 프로그램으로 짜는 설계에서 먼저 풀린다
7월 기준 근거는 같은 GPT-5.5가 감싼 틀에 따라 soft F1 0.363과 0.121을 받은 WANDR 표입니다.
지금의 후한 사용 한도와 잦은 초기화는 수요 급증기의 한시적 조건이다
7월 10일과 14일 연이은 전체 한도 초기화, 올트먼의 '곧 차질이 생길 수 있다'는 글, 코덱스 AMA 추천 1위가 월 20달러 요금의 지속 가능성 질문이었던 점이 근거입니다.
오픈웨이트 연구소 사이의 경쟁은 모델 구조보다 데이터와 후속학습, 파인튜닝 도구에서 벌어진다
Inkling은 MoE 설계를 딥시크 V3에서 가져오고 연산 대부분을 강화학습에 썼습니다. 씽킹머신즈는 7월 30일 Inkling-Small도 가중치를 공개하고 Tinker에서 파인튜닝을 받는 같은 방식으로 냈습니다.
앤트로픽 플랫폼의 추상화가 지식에서 실행으로, 실행에서 조율 단계로 옮겨 간다
AI API의 매개변수가 원하는 결과와 예산 두 가지로 줄어든다
AI가 한 일을 사람이 채점하는 일이 풀이만큼 어려워지면 사람 피드백 학습·레드팀·벤치마크에 기댄 지금의 안전 절차가 함께 약해진다
o1의 추궁 뒤 속임 유지 85%(2024년 12월), 감시를 보상에 넣자 의도를 숨긴 오픈AI 실험(2025년 3월), 평가 인식을 끄자 협박 시도가 0번에서 13번으로 늘어난 앤트로픽 실험(2026년 7월)이 근거입니다.
점화 시험의 20스텝 대 40스텝 차이가 통계적으로 유의해지는 시점이 재귀적 자기개선 다음 단계의 신호가 된다
7월 14일 보고서에서 AIDE47은 같은 최고점에 약 20스텝, AIDE-human은 약 40스텝에 닿았고 효율 차이는 유의하지 않았습니다.
딥마인드가 다음 프런티어 모델을 출시 30일 전에 외부 평가에 넘기고 결과를 공개한다
8월 5일 하사비스는 딥마인드 CEO에서 의장 겸 알파벳 수석과학자로 옮겼고, 제미나이 모델 개발은 코라이 카부쿠오글루 수석부사장이 맡았습니다. 8월 27일 딥마인드는 싱가포르 AI 안전연구소 등과 함께 제미나이 Flash Lite 모델을 비공개 벤치마크로 평가하는 이중맹검 시범을 발표했습니다.
다른 프런티어 랩도 FINRA형 표준기구 구상에 힘을 싣는다
8월 15일(미국 시각) 아모데이는 X 글에서 하사비스가 제안한 FINRA 같은 기구를 지지한다고 밝혔습니다.
프런티어 랩들이 필요하면 개발 속도를 함께 늦춘다
9월 1일(미국 시각) 공개된 인터뷰에서 올트먼은 프런티어 강화학습 훈련 한 건을 미뤘다고 밝혔고, 9월 12일(미국 시각) 아모데이는 3단계 속도 조절안을 낸 뒤 첫 단계를 앤트로픽 혼자서라도 시행하겠다고 했습니다. 두 발표 모두 각 회사의 결정이나 제안입니다.
스스로 고치는 소재로 가는 첫걸음이다
논문은 능동 자가 수리에 작동 장치가 필요하다고 적었고, 지금은 실물에서 형상 인식, 시뮬레이션에서 손상 방향 예측과 복구까지입니다.
학습이 한 방향으로만 흐르면 가치는 지식을 만든 쪽보다 학습 인프라를 가진 쪽으로 모인다
나델라가 학습 인프라를 모든 기업에 나눠야 한다고 적은 근거입니다.
10~20년 안에 사람 수준의 AI가 나올 가능성이 꽤 높다 (닐 난다의 전망)
훨씬 똑똑해진 미래 모델은 사고 사슬을 통제해 중요한 단계를 감출 수 있게 된다 (닐 난다가 가능성으로 든 전망)
판정 기준을 문서에 넣은 명세가 에이전트가 만든 결과물의 완성도를 끌어올린다
한 나라의 AI 정책은 자국 노동시장만으로 범위를 잡으면 실패한다
송금 경유 노출이 GDP 10% 이상 송금 수취국 19개국 중 18개국에서 상향으로 나타났습니다.
소버린 AI의 성과는 그 모델 위에서 일어나는 생산성 변화로 평가받게 된다
발전소를 발전소 자체의 수익률로 평가하지 않는 것과 같은 논리입니다.
공급 계약이 채워지고 조달처가 늘어 메모리 마진이 꺾이는 시점이 이번 사이클의 정점 신호가 된다
2026년 1분기 SK하이닉스 영업이익률 72%, 6월 마이크론 80.4%가 기준입니다.
한국형 AI 노출지수가 2027년까지 개발된다
7월 9일 산업전환 고용안정 기본계획이 밝힌 일정입니다.
Manus가 장애 대응과 확장 같은 운영 단계까지 에이전트 안으로 가져온다
6월 호스팅 모드로 서버 운영 방식 선택까지 제품 안에 들어왔습니다.
공급망이 나라별로 나뉘면 부품을 대던 나라는 한쪽 블록 안으로 들어가거나 밀려난다
코딩 에이전트 감시는 제공사가 다른 모델을 섞은 앙상블이 기본 구성이 된다
아폴로 측정에서 두 개 이상으로 이긴 조합이 모두 회사가 섞인 조합이었고, 같은 회사 모델끼리 채점 오차 상관이 0.76~0.78이었습니다
프런티어 코딩 모델의 값이 범용 부품처럼 내려가기 시작하는 지점이다
점수 최상위가 아닌 모델이 출력 단가 4분의 1로 들어왔고, 계열사 수요부터 자기 모델로 채우는 구도가 근거입니다.
언어 모델용 해석 도구는 블록과 다른 단위를 쓰게 된다
저자들이 블록 희소성은 언어·영상에 맞지 않을 것이라고 논문에 적은 것이 근거입니다
완성된 음성 인터페이스가 화면 없는 기기의 전제 조건이다
화면을 두드리는 대신 말로 시키려면 끊기지 않고 알아듣는 음성이 먼저입니다.
수출통제가 중국의 국산 추론 스택 자립을 앞당긴다
딥시크 V4의 어센드 구동, 텐센트·창신메모리 장기계약, 바이트댄스의 화웨이 칩 구매 계획이 근거입니다. 프런티어 학습은 아직 엔비디아 H200에 기대고 있습니다.
추론 원가 경쟁이 메모리 수요가 끝없이 늘어난다는 전제를 흔든다
3분기 D램 계약가격 상승 폭 전망이 13~18%로 줄었고, 오픈웨이트 기본값과 빅테크 자체 칩이 추론 원가를 낮추고 있습니다.
가까운 미래의 재귀적 자기개선은 모델 가중치보다 하네스 개선에서 먼저 시작된다
웽의 7월 4일 전망입니다. 근거로 모델을 고정한 채 하네스만 진화시켜 SWE-bench Verified를 20%에서 50%로 올린 다윈 괴델 머신 같은 연구를 들었습니다.
하네스 개선의 상당수는 모델 안으로 흡수되고 바깥 도구와의 인터페이스는 남는다
웽은 프롬프트 요령이 모델 발전으로 덜 중요해졌어도 목표와 제약을 알려 줄 필요는 남은 사례를 들었습니다.
내부 활성값 감시가 사고 과정 텍스트 감시보다 오래 유효할 것이다
텍스트는 훈련에 따라 꾸밀 수 있지만 활성값은 아직 못 꾸밉니다. 다만 숙달된 행동은 작업공간을 우회하므로 수명이 정해져 있습니다.
루프의 실제 실패는 요란하지 않고 조용히 온다
Claude Code 팀은 답을 만든 맥락이 그대로 채점하지 않도록 새 맥락의 두 번째 에이전트에게 코드 리뷰를 맡기라고 권했습니다.
텐센트가 다른 오픈 모델에도 지역 제한 없는 라이선스를 적용한다
HunyuanVideo 등 기존 모델은 EU·영국·한국을 뺀 커뮤니티 라이선스를 쓰고 있습니다.
제3자 평가에서도 Hy3가 실무 과제에서 GLM-5.1보다 높게 평가된다
전문가 270명 블라인드 평가는 텐센트가 직접 설계했습니다.
IBM처럼 신입 직무를 고객 접점과 명세 중심으로 다시 짜는 대기업 채용 프로그램이 늘어난다
다음 BLS 직업별 통계(2026년 5월 기준)에서도 컴퓨터 프로그래머·웹 개발자·QA 테스터 감소가 이어진다
기업은 작업마다 소버린 모델과 해외 프런티어 모델을 골라 보내며 두 종류를 함께 쓰게 된다
목표가 최신 글로벌 모델의 95%로 잡혀 있어 최상위 성능이 필요한 일은 해외 유료 모델에 남습니다.
작업마다 모델을 골라 보내 비용을 줄여 주는 AX 솔루션 회사가 빠르게 커진다
코인베이스가 GLM-5.2와 Kimi로 작업별 비용을 줄이는 구조를 짠 사례를 근거로 들었습니다.
앞으로 몇 년 동안 강화학습 환경이 지금보다 훨씬 복잡하고 다양해진다
공동체 방식으로 개발하고 배포하는 AI가 시간이 갈수록 더 널리 채택된다
Nemotron 연합의 공동 기반 모델이 차기 Nemotron 4 가족의 토대가 된다
AI 위험 평가의 기준이 모델의 절대 능력에서 지금 있는 도구 대비 한계 상승분으로 옮겨 간다
CJS의 역량 상승 축이 기존 도구 대비로 정의된 것이 근거입니다. 다른 개발사나 정부가 같은 방식을 채택하는지로 채점합니다.
다음 경쟁의 병목은 하네스 설계보다 배울 거리가 남아 있는 환경이다
EdgeBench의 학습 법칙(7월 2일)과 에포크의 보드게임 결과(7월 1일)가 하루 차이로 나온 대비가 근거입니다. 논문 부록에서는 하네스만 바꿔도 GPT-5.4가 26.1점에서 31.8점으로 올랐습니다.
엔비디아가 직접 포워드 디플로이 조직을 만들어 배포까지 수직 통합한다
7월 3일까지 발표된 조직은 없습니다. 지금은 인포시스·위프로 같은 통합 회사와 팔란티어가 엔비디아 기술로 기업 에이전트를 만들고 있습니다.
정부 계획대로 2035년까지 AI 데이터센터 18.4GW가 구축된다
AI 데이터센터 특별법 시행 뒤 비수도권 AI 데이터센터가 전력을 받기까지 걸리는 기간이 줄어든다
앞으로 3년 동안 AI가 수학 분야 사이를 잇는 새 연결을 훨씬 많이 찾아낸다
앞으로 5년 안에 AI 수학의 진전에서 곧바로 나온 경제적 개선이 나온다
가르치는 일은 앞으로 50년 동안 가장 안정적인 직업 가운데 하나로 남는다
GeneBench-Pro는 2026년 말까지 포화될 수 있다(오픈AI 전망)
채점의 어려움과 연구 투자 순서 때문에 생긴 AI의 디자인 약점은 모델이 좋아지면서 풀린다
틀린 판단도 그대로 적는 뉴스레터를 보내드려요.