채점이 끝난 21건 기준 98%예요. 일부는 0.5로 셌어요.
다음 세대 모델의 최고 실행은 다섯 과제의 기준선을 모두 넘는다(Andon Labs의 7월 24일 전망)
9월 10일 Andon Labs는 9월 3일 나온 오픈AI의 GPT-6 Astra가 다섯 과제 각각에서 적어도 한 번 사람 기준선을 넘은 첫 모델이라고 밝혔습니다. 그보다 앞선 8월 3일에는 모델이 채점 환경을 엿보는 부정행위가 늘고 있다며, 걸린 실행을 버리고 다시 돌린 기록을 따로 공개했습니다.
오픈AI가 통화에서 말한 나비에-스토크스 증명을 공개한다
9월 9일(한국 시각) 오픈AI가 GPT-6 Astra보다 훨씬 뛰어난 차세대 내부 모델로 에이전트 약 1만 개가 88시간 만에 만든 나비에-스토크스 해법이라며 공개했습니다. 부벡은 같은 날 알푀게를 저자에서 빼라고 요구한 적이 없다고 반박했고, 오픈AI 대변인은 9월 10일 뉴욕타임스에 버크마스터의 지난 두 달 Codex 프롬프트가 학습을 포함해 어떤 방식으로도 시스템에 영향을 줄 수 없었다고 밝혔습니다.
게시판 문법은 5일에 걸쳐 에이전트들이 스스로 만들었다
받는 쪽을 지정한 메시지가 2만 4,778건 쌓였다
사칭 사고 34분 뒤 공개키 서명 메시지가 처음 등장했고 429건이 오갔다
전체 작업 지시의 약 10%가 한 에이전트에게서 나왔다
Replica는 논문 100편에서 만든 학습 242개, 테스트 68개로 구성됩니다.
Faraday는 분포 내 ML 과제 73%, 미학습 과학 과제 60%의 승률을 기록했습니다.
상상 과제 20개 중 19개에서 Faraday가 선호됐습니다.
해당 판정 모델은 상상 과제에 대해 검증되지 않았습니다.
앤트로픽이 탐지 API를 자격을 갖춘 기관부터 제한적으로 연다
9월 1일 갱신된 설명에 따르면 탐지 API는 비공개 프리뷰로, EU 법이 정한 규제·수사 기관과 언론, 팩트체커, 독립 연구자, 교육기관, EU 시민단체, 준수 의무가 있는 기업에 먼저 열렸습니다.
GLM-5.3이 Artificial Analysis 종합 지수에서 58~60점 안팎에 들어온다
8월 26일 Artificial Analysis가 GLM-5.3-Flash 평가 글에서 GLM-5.3(최대 추론)을 60점으로 적었습니다.
암호화된 추론 블록이 세션·사용자·모델 사이에서 호환됩니다.
복원한 추론의 토큰 수가 API 청구 thinking 토큰 수와 대부분 1대 1로 일치했습니다.
공개 저장소 블록 31만 5,320개에서 개인식별정보 367건, 자격증명 182건이 나왔습니다.
앤트로픽이 워터마크 탐지를 누구나 쓰게 열지 않고 자격을 갖춘 기관부터 연다
9월 기준 지원 문서는 워터마크 탐지를 비공개 프리뷰로 두고, EU 법이 정한 규제·수사 기관과 언론, 팩트체커, 연구자, 교육기관, 준수 의무가 있는 기업에 먼저 열었습니다.
MiniMax가 H3 가중치를 며칠 안에 공개한다
MiniMax는 8월 3일(한국 시각) 허깅페이스에 H3 가중치를 공개했습니다. 풀린 것은 768p를 만드는 H3-Base(33B)이고, 지시문을 정리하는 H3-Context-IR과 2K 재생성은 API로 남았습니다. 라이선스 Q&A는 EU와 영국, 한국, 미국에서의 오픈웨이트 이용을 별도 승인 대상으로 두었습니다.
딥시크가 가장 강한 모델도 가중치를 공개한다
8월 13일 V4-Pro 정식판을 내면서 같은 날 밤 가중치를 MIT 라이선스로 허깅페이스에 올렸습니다.
실리콘 방패가 사라지는 시점이 곧 위험의 시점이다
애리조나 2나노 양산은 2029~2030년이라 2027년 준비태세보다 늦고, 가동 중인 팹은 침공으로 확보되지 않습니다.
Kimi K3는 GLM-5.2보다 사이버 역량이 높게 측정돼 오픈·폐쇄 격차를 더 줄인다
7월 23일 AISI·CAISI 예비 평가에서 K3는 사이버레인지 평균 17단계로 GLM-5.2(11단계)를 넘었고 10번 중 1번 완주했습니다. 미국 최상위 모델 평균 28.5단계에는 못 미쳤습니다.
개발 공고의 반등이 22~25세 개발 직군 고용 회복으로 곧바로 이어지지 않는다
스탠퍼드 연구진이 8월 12일 낸 개정판에서 AI 노출 직군 22~25세 고용 격차는 2025년 7월 자료 기준 15%에서 2026년 6월 자료 기준 19%로 벌어졌고, 연구진은 주된 경로를 채용 감소로 봤습니다.
수도권에서는 데이터센터가 전력 공급 승인을 받기 어렵다
7월 14일 뉴시스 보도(CBRE코리아 보고서 인용)에 따르면 2026년 3월 누적 수도권 전력계통영향평가 1차 기술검토 신청 522건 가운데 최종 공급 승인은 10건(건수 기준 1.9%)이었습니다.
LLM이 쏟아내는 버그 보고로 험난한 18개월(어쩌면 12개월)을 지나면, 퍼저 때처럼 버그가 잦아들고 커널 코드는 더 나아진다
그렉 크로아하트만이 9월 22일 Kernel Recipes 2026 발표에서 내놓은 전망입니다. 그는 3월부터 18개월이라고 말해 왔다고 했습니다.
2036년 최전선 슈퍼컴퓨터는 공장에서 만든 몇 MW짜리 랙에 물과 전력, 광섬유만 꽂는 형태가 된다
우주 데이터센터에는 근본적으로 가로막는 문제가 없다
사람이 컴퓨터로 하는 모든 일에서 모든 인간과 같거나 더 나은 모델이 2년 안팎(2028년 전후)에 나온다
숄토 더글러스가 2026년 8월 녹화, 10월 2일 공개된 American Optimist 대담에서 내놓은 전망입니다.
앞으로 2년 안에 사이버 보안은 공격보다 방어가 유리한 쪽으로 돌아선다
같은 대담에서 더글러스가 내놓은 전망입니다.
2028년 가정에 빨래와 간단한 청소를 하는 휴머노이드 로봇이 수만 대 들어간다
같은 대담의 2028년 예측입니다.
인터넷에서 일어나는 행동의 대부분을 에이전트가 하게 된다
루프와 그래프로 에이전트 흐름을 짜는 방식은 지나가는 단계다
2027년 AI가 정말 쓸 만해지고, 2028년에는 버튼 하나로 회사 인력 전체를 복제할 수 있다
에마드 모스타크가 8월 28일 공개된 피터 매코맥 쇼에서 내놓은 전망입니다.
2027년 테슬라 옵티머스급 휴머노이드가 시간당 1.5달러로 미국 트럭을 몰 수 있다
같은 대담에서 내놓은 전망입니다.
개인 에이전트는 한동안 어수선한 시기를 거친 뒤 사람들이 받아들일 쓰임새만 남는다 (하드포크 패널의 전망)
모두가 개인 비서를 쓰게 되면 비서끼리 겨루는 군비 경쟁이 된다 (하드포크 패널의 우려)
2028년 전에 어떤 행동이든 모델 안에서 그 원인을 인과적으로 찾아낼 수 있게 된다 (에릭 호의 전망)
내부 활성값 감시가 외부 감시를 곧 확실히 앞선다 (에릭 호의 전망)
모든 훈련 실행에 보상 해킹 감시가 붙어 지금 같은 보상 해킹 비율은 과거의 일이 된다 (굿파이어의 전망)
가장 똑똑한 프런티어 모델이 검증 토큰을 덜 써서 쉬운 일에서도 작은 모델보다 싸진다 (타리크 시히파르)
모델이 좋아지면 CLAUDE.md가 사라진다 (타리크 시히파르)
Claude Code는 클라우드 두뇌, 로컬·원격 손, 아티팩트 화면으로 나뉜다 (타리크 시히파르)
5~10년 뒤 지식노동자와 개발자는 지금보다 많아진다 (마이크 캐넌브룩스)
MCP와 CLI로 아틀라시안을 쓰는 고객은 화면 사용과 유료 좌석도 함께 늘린다 (마이크 캐넌브룩스)
챗봇은 업무의 최종 인터페이스가 되지 않는다 (마이크 캐넌브룩스)
AI 모델이 발전할수록 로봇의 작업 능력도 함께 좋아질 수 있다
HomeBody는 VLM을 바꿔 끼울 수 있게 설계됐지만, 다른 모델로 같은 과제를 돌린 결과는 아직 없습니다.
5년 뒤 자동화 트래픽이 사람 트래픽의 1,000배가 된다 (매슈 프린스)
올해 파크 레코드의 AI 라이선스 수입이 디지털 광고 수입을 넘는다 (매슈 프린스)
기술 업계 밖에서도 AI를 이유로 한 감원이 잇따른다 (매슈 프린스)
한 회사가 AGI를 만들어도 며칠 안에 경쟁사들이 따라온다 (매슈 프린스)
토큰 경제가 5년 안에 약 5조 달러, 10년 안에 10조 달러 규모가 된다 (안즈니 미다)
추론에 웃돈을 붙여 되파는 회사들이 정해진 작업 단위 과금으로 옮겨 가고, 사용자가 자기 추론을 가져오는 방식이 늘어난다 (알렉스 아탈라)
앞으로 10년 동안 사람이 저지르던 토큰 사기를 AI 에이전트가 저지르게 된다 (안즈니 미다)
RNA 앱타머 사고 사슬 설계가 습식 실험에서도 확인된다 (응우옌)
서열과 성능 점수가 짝으로 쌓인 다른 생물학 과제에도 같은 틀을 적용할 수 있다 (응우옌)
다음 세대 Omnii는 단백질, RNA, 후성유전체 등 여러 양식을 함께 다룬다 (응우옌)
5년 안에 총요소생산성 증가율 3%를 넘긴다 (TypeSafe 선언문)
모델 하나를 전제로 만든 코딩 에이전트와 여러 모델을 쓰는 코딩 에이전트의 경쟁 구도가 달라진다 (알메이다)
jev-1.13.0을 장기 지원 대상으로 묶는 방안을 검토한다 (알메이다)
성과를 낸 내부 모델이 8월 유출글의 'Bel'과 같은 모델인지는 확인되지 않았습니다.
판단 전용 모델에서 오래 남는 것은 특정 모델보다 선택지를 주고 확률을 돌려받는 호출 방식이다
9월 21일 기준 근거는 6일 사이 나온 Jev식 공개 모델 4개와 Claude Code 라우터, Vercel AI Gateway 연결입니다.
전쟁부가 이번 사고에 쓰인 챗봇의 종류를 공개한다
9월 18일 보도 시점에 CNN은 상용 제품인지 정부용 도구인지 확인하지 못했고, 전쟁부는 논평 요청에 답하지 않았습니다.
미군이 AI가 만든 정보를 검증하는 단일 기준을 내놓는다
보도 시점에는 부서마다 다른 도구와 안전 기준을 쓰고 있었고, AI가 만든 정보를 검증하는 단일 기준이 없었습니다.
AI 안전 논쟁도 곧 진영에 따라 갈리게 된다 (케빈 루스의 전망)
의회가 AI 안전 법안을 통과시켜도 대통령 거부권이 나올 가능성이 높다 (케이시 뉴턴의 전망)
머지않아 어느 나라의 몇 사람이 자체 에이전트 무리를 꾸려 세상에 풀 수 있게 된다 (케이시 뉴턴의 전망)
지연이 아주 중요한 작업 20~30%를 확산 언어 모델이 가져간다 (에르몬)
Inception이 몇 달 안에 가장 큰 다음 확산 언어 모델을 공개한다
추론 경쟁에서 더 병렬적인 확산 방식이 자기회귀 방식을 이긴다 (에르몬)
다음 세대 모델은 아주 긴 에이전트 작업을 매우 정확하게 해낸다 (무스타파 술레이만)
2년 안에 안전장치 없는 오픈소스 모델이 개인 컴퓨터에서 허깅페이스 사고 수준의 행동을 할 수 있다 (무스타파 술레이만)
AI가 AI 연구를 맡으면서 발전 속도가 지금의 약 3배로 빨라진다
프런티어 모델이 3개월짜리 과제를 해내게 되어 출시 전 평가가 모델의 전체 작업 길이를 따라가지 못한다
올해 말까지 포천 1000대 기업의 절반이 AIUC-1 컨소시엄에 대표를 둔다 (크비스트)
AIUC가 몇 주 안에 프런티어 AI 재난 위험 보험계리 모델을 오픈소스로 공개한다
AI 감사·보험이 에이전트에서 프런티어 모델, 로봇으로 넓어진다 (크비스트)
기업 AI는 여러 모델을 함께 쓰는 방식으로 가고, KV 캐시 재사용 같은 모델 간 상호운용 표준이 생긴다 (사티아 나델라)
AI 데이터센터 칩 공급이 엔비디아 외에 자체 칩과 AMD 등으로 다양해진다 (사티아 나델라)
5년 뒤 기업 AI 토큰의 90%가 사용자가 시작하지 않은 작업에 쓰인다
모델 회사의 토큰 보조는 상장 뒤 오래가지 못한다
한두 연구소가 AI 가치의 95%를 가져가는 구도는 오지 않는다
코딩 밖 지식노동의 AI 확산은 실리콘밸리 예상보다 훨씬 오래 걸린다
중국은 2030년까지 첨단 노광 장비를 자체 개발한다 (젠슨 황)
프런티어 연구소들이 연구에서 엔지니어링 조직으로 옮겨 가며 사고를 통제할 수 있게 된다 (젠슨 황)
수천 명이 몇 년 걸리는 AI 연구를 AI가 몇 주로 줄인다
로봇이 실험을 대신 돌리는 데 필요한 조건이 3~5년 안에 갖춰진다
오픈AI가 직원급 접근권을 가진 독립 평가자를 들인다
9월 12일 올트먼이 X에서 같은 조치를 하겠다고 밝혔습니다.
앤트로픽의 상주 외부 검토 팀이 편집 없는 첫 공개 보고서를 낸다
에세이는 가까운 시일 안에 검토 팀을 들이겠다고만 적었습니다.
배선을 섞은 대조군보다 원래 배선이 뚜렷하게 나은 과제가 커넥톰 시뮬레이션에서 나온다
개인 데모에서 시작한 회로 차단 실험이 실물 초파리 측정과 비교된다
1년쯤 뒤 한 달짜리 사무직을 맡길 원격 근무자 AI가 쓸 만한 형태로 나온다 (오닐·슐먼)
2년 안에 AI 연구자의 생산성이 10배가 된다 (슐먼)
3~4년 안에 컴퓨터로 하는 모든 일에서 최고 전문가를 앞서는 AI가 나온다 (슐먼)
재귀적 자기개선이 지속 학습보다 먼저 온다 (오닐)
모델 구조로 KV 캐시를 줄이는 방식이 퍼지면 AI 사용량과 메모리 수요는 같은 비율로 늘지 않는다
소비자가 컴퓨터 사용 에이전트에 익숙해지면서 기업용 소프트웨어도 에이전트가 쓰기 쉽게 다시 만들어진다
쇼핑몰은 사람 대신 에이전트를 끌어들이도록 다시 설계된다
Muse Confidential VM은 올해 안에 나올 예정입니다.
자동화형 대화 비율이 45%에서 90% 쪽으로 오르고 22~25세 고노출 직업 진입률이 계속 낮아지면, AI가 노동소득 비중 하락을 가속한다는 근거가 강해진다
두 값이 함께 움직여야 AI의 기여가 오래된 요인과 갈립니다.
봇이 사람보다 먼저 연락하는 능동형 에이전트가 AI의 다음 변화가 된다
일과 개인 생활을 한 제품이 함께 맡는 형태가 가장 좋은 제품 형태가 된다
머지않아 사용자가 봇의 원격 컴퓨터를 직접 들여다볼 일이 사라진다
같은 방법이 나비에-스토크스로 이어지고 외력도 없앨 수 있다
틀린 판단도 그대로 적는 뉴스레터를 보내드려요.