
다음 화면과 물리 반응을 직접 예측해 가상 환경을 생성하는 모델입니다. 게임 플레이를 실시간으로 만들어 내거나 로봇 학습용 환경을 대신 제공하는 용도로 쓰입니다.
용어 자세히 보기

WorldCrafter는 3D 공간을 따로 만들지 않고, 카메라 위치에 맞춰 기억 속 정보를 꺼내 영상을 생성합니다.
그래서 다른 곳을 보다가 돌아와도 앞서 본 공간과 물체가 비교적 일관되게 유지됩니다.
이미지 한 장이나 글만으로 몇 분 동안 공간을 둘러볼 수 있고, 기본 모델과 빠른 생성용 증류 모델의 가중치가 코드와 함께 공개됐습니다.
Choi
텐센트 ARC 랩과 베이징대 연구진은 논문에서, 깊이 정보로 시점을 맞추는 대신 요청한 시점에 맞춰 과거 관측을 정해진 수의 토큰으로 압축해 생성기에 넘긴다고 설명했습니다.
소식13분AI
소식AI
게임 엔진 없이 AI가 실시간으로 세계를 그리고, 그 안에서 사람과 AI 에이전트 20명이 동시에 상호작용합니다.
공개 버전에서는 사람 4명이 AI 에이전트 16개와 함께 전투할 수 있고, 참여자의 행동에 따라 월드 모델이 환경 변화를 실시간으로 생성합니다.
오디세이는 AI 학습과 안전성 시험, 로봇, 자율주행, 사이버보안, 게임에 이런 시뮬레이션을 쓸 수 있다고 봅니다.
Choi
참여자 20명이 같은 세계를 공유하는 구조라 한 사람의 행동이 나머지 19명의 화면에도 같은 순서로 나타나고, 참여자가 늘수록 이 동기화 계산이 커집니다.
JING은 사용자의 행동과 참고 이미지, 이전 상황을 바탕으로 다음 화면을 실시간으로 만듭니다.
카메라를 움직여 공간을 돌아다니고 물체를 건드리거나 등장인물과 대화할 수 있으며, 이때 영상과 오디오를 함께 생성합니다.
XGEN Labs는 앞서 JING과 세계 상태를 관리하는 DAO를 묶은 Generative World Simulation 구조를 발표했고, 이번에 그중 JING을 허깅페이스에 올렸습니다.
Choi
XGEN Labs는 앞선 발표에서 JING이 WBench Full 부문 1위, Navi 부문 2위를 기록했다고 밝혔고, 이번 공개로 외부 개발자가 같은 모델을 직접 돌려 볼 수 있게 됐습니다.
Robbyant가 LingBot-World 2.0 Small을 오픈소스로 공개했습니다.
1.3B 크기의 모델 하나로 일반 소비자용 GPU에서 실시간으로 세계를 생성할 수 있습니다.
캐릭터 이동이나 카메라 조작은 물론 전투, 마법, 총격, 날씨 변화 같은 입력에도 바로 반응하며, 몇 초짜리 영상으로 끝나지 않고 화면을 계속 이어서 생성합니다.
전체 환경에서는 720p·60fps까지 지원하며 14B Causal Pretrain과 Bidirectional 모델도 함께 공개됐습니다.
월드 모델이 거대한 서버에서 돌아가는 연구용 기술을 넘어, 개인 PC에서 게임이나 시뮬레이션을 직접 만드는 단계까지 내려오고 있습니다.
Choi
1.3B 모델이 소비자용 GPU에서 실시간으로 돌아가면, 서버 없이 개인 PC에서 게임이나 시뮬레이션 제작에 월드 모델을 써 볼 수 있습니다.
SolarWM 연구팀이 데이터 수집·정제·라벨링부터 학습·추론 코드, 사전학습 모델까지 전체 개발 과정을 오픈소스로 공개했습니다.
데이터만 143만 개 영상 클립, 약 25TB 규모입니다.
SolarWM-5B는 5초짜리 영상만으로 학습했지만 실시간 상호작용 영상을 생성하며, 이를 수분에서 수시간까지 이어갈 수 있다고 합니다.
5B·14B에 더해 LTX-2.5와 Minimax-H3까지 하나의 코드베이스에서 지원합니다.
세계 모델을 연구할 때 가장 시간이 많이 드는 데이터 준비와 학습 환경 구축을 그대로 활용할 수 있어, 개인 연구자도 새로운 월드 모델을 실험하기 훨씬 쉬워질 것 같습니다.
월드 모델을 처음부터 직접 만들어 보고 싶다면 확인해 볼 만합니다.
Choi
143만 개 클립, 25TB 규모의 데이터 수집·정제·라벨링 과정을 그대로 받아 쓸 수 있어, 월드 모델 연구에서 가장 오래 걸리던 준비 단계를 건너뛸 수 있습니다. 다만 25TB를 내려받아 학습할 장비는 따로 필요합니다.
사용자가 환경, 캐릭터, 분위기, 물리 규칙을 설정하면 720p·24fps 영상과 48kHz 오디오로 세계를 실시간 생성합니다.
생성된 세계 안에서 “캐릭터를 의자에 앉혀줘”처럼 텍스트로 행동을 지시하거나 카메라를 움직이면, 그 입력을 반영해 다음 화면이 이어서 생성됩니다.
Runway는 게임에 더해 가상 캐릭터, 로봇 훈련, Embodied AI 시뮬레이션에도 쓸 수 있다고 설명합니다.
Choi
텍스트 지시와 카메라 입력에 실시간으로 반응하는 영상 세계라, 로봇과 Embodied AI가 연습할 가상 환경을 따로 만들지 않고 생성할 수 있습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.