Impossible Research의 하네스 schema가 Opus 4.8과 Fable 5 조합으로 ARC-AGI-3 공개 세트에서 98.98%를 기록했고, 공식 리더보드 최고는 13.33%입니다. 엔비디아는 로봇이 참고하는 맥락을 약 5분(8,000스텝)으로 늘린 RoboTTT와 실시간 모션 생성 모델 ARDY를 공개했고, Sunday Robotics의 ACT-2는 옷 개기 785회에서 99.1% 성공률을 냈습니다.
AI 인사이트
보는 사람의 권한이 그대로 적용되는 설계 덕분에 사내 대시보드로 쓸 여지가 생깁니다. 공개 공유에서 빠진 이유이기도 합니다.
AI 인사이트
커널 수준 최적화를 기본값으로 넣는 업데이트가 오픈 모델의 실사용 비용을 낮춥니다.
AI 인사이트
모델 안의 작은 모델을 즉석에서 학습시켜 경험을 고정 크기 가중치에 압축하니 맥락이 길어져도 계산량이 늘지 않습니다. 언어모델에서 본 컨텍스트 스케일링이 로봇 제어에서도 나타났습니다.
AI 인사이트
프레임을 이어 붙이는 자기회귀 구조라 생성 도중에 프롬프트를 바꿔도 즉시 다시 계획합니다. 같은 모델이 유니트리 G1용으로도 나와 화면 속 캐릭터와 실제 휴머노이드가 한 모션 모델을 씁니다.
AI 인사이트
3D 그래픽·VFX 작업자는 블렌더 애드온과 후디니 연동으로 받은 날 바로 쓸 수 있습니다. 생김새와 표정을 따로 조절하는 구조라 사진 한 장 복원에서 리깅까지 이어집니다.
AI 인사이트
행동 정보가 없는 인터넷 영상을 강화학습 데이터처럼 써서 작업마다 따로 학습시키지 않았습니다. Pantograph는 게임에 이어 컴퓨터 사용과 실제 환경 데이터까지 학습하면 로봇 AI 성능도 높일 수 있다고 봅니다.
AI 인사이트
버핏이 내건 기준은 장기간 자본 대비 높은 수익과 실제 현금 창출입니다. AI 기업에 들어가는 막대한 투자금도 이 기준으로 회수 여부를 따지게 됩니다.
AI 인사이트
"AI가 생산성을 바꾸고 높인다는 얘기"가 팀 인원수로 드러난 사례입니다. PM·디자이너·데이터 과학자 역할을 제품 스태프 한 명이 맡습니다.
AI 인사이트
같은 Opus 4.8·Fable 5 조합이 Claude Code에서는 42.83%, schema에서는 98.98%를 냈습니다. 점수 차이가 모델 밖 하네스 설계에서 나왔습니다.
AI 인사이트
처음 보는 가정집 31곳에서 옷 개기 785회를 반복해 낸 수치라 실험실 성적과 성격이 다릅니다. 새 동작은 미세 조정 예시 한 번으로 익힙니다.
AI가 AI를 채점할 때 생기는 문제는 〈정답을 알면서 틀린 라벨을 단 AI 심판, 앤트로픽이 찾은 오작동 넷〉에 정리했습니다. 앤트로픽은 프런티어 모델 14종을 가상 업무 환경에 넣어 오작동 네 가지를 찾았고, 시나리오 대화 기록을 모두 공개했습니다.