이 글 어땠어요?
새로 학습한 모델은 없습니다. Gemini 3 Flash, Nano Banana 2, Veo 3.1을 그대로 쓰고 그 위에 구간별 기억과 검사 단계를 얹은 에이전트 구조이며, 공개 모델 LTX-Video와 Wan 2.2에 붙였을 때도 인물 일관성이 올랐습니다.
프로젝트 페이지에서 생성 영상과 비교 영상을 볼 수 있고 논문 부록에 프롬프트가 실려 있습니다. GitHub 저장소에는 README와 그림만 있어 실행 코드가 없고, LVBench-C 데이터셋도 공개 전입니다.
논문은 기존 방법보다 구간당 최대 7.2분이 더 든다고 추정했습니다. 신 80개를 구간 80개로 만들면 추가 시간만 최대 9시간 36분이고, 구간마다 더 만드는 영상 5개와 프레임 5장의 비용은 공개된 비용 추정에서 빠져 있습니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
9월 14일 공개된 Dream-RSI는 모델 가중치 대신 어느 후보를 이어 갈지 정하는 탐색 정책 코드만 고칩니다. Gemini 3.1 Pro로 Lasso 알고리즘을 찾을 때 호출은 42% 줄었지만, 데이터셋 6개 가운데 5개에서는 고정 탐색보다 느렸습니다.

결과 그림을 가린 논문 100편을 60분과 H200 7분의 1 안에서 재현하게 한 Replica가 과제입니다. 학습 242개와 테스트 68개에서 Faraday는 ML 73%, 처음 보는 과학 60%의 승률을 냈고, 저자들은 그 차이가 코드 속도보다 연구 판단에서 나왔다고 분석했습니다.
구글 리서치가 9월 24일 소개한 VQQA는 영상 평가를 질문 목록으로 바꿔 프롬프트를 고칩니다. CogVideoX-5B에서 T2V-CompBench 점수를 41.89%에서 53.46%로 올렸고, 평균 1.245번 수정에 VLM을 약 7.23번 불렀습니다.

9월 14일 공개된 Dream-RSI는 모델 가중치 대신 어느 후보를 이어 갈지 정하는 탐색 정책 코드만 고칩니다. Gemini 3.1 Pro로 Lasso 알고리즘을 찾을 때 호출은 42% 줄었지만, 데이터셋 6개 가운데 5개에서는 고정 탐색보다 느렸습니다.

결과 그림을 가린 논문 100편을 60분과 H200 7분의 1 안에서 재현하게 한 Replica가 과제입니다. 학습 242개와 테스트 68개에서 Faraday는 ML 73%, 처음 보는 과학 60%의 승률을 냈고, 저자들은 그 차이가 코드 속도보다 연구 판단에서 나왔다고 분석했습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
「위대한 박물관 털이(The Great Museum Heist)」라는 제목의 이 영상은 한 문장짜리 신 설명 80개로 짜였습니다. 첫 신은 빅터와 사프란이 후드티와 청바지 차림으로 어두운 지하실에 앉아 있다는 문장이고, 이어서 두 사람이 푸르게 빛나는 박물관 홀로그램 설계도를 들여다보고, 식은 커피 잔을 부딪치고, 자정을 알리는 박물관 시계가 울립니다. 구글은 일반 영상 생성기로는 이 정도 길이에서 인물이 변형되고 장소가 일그러지지만, A²RD는 영상 기억을 계속 조회해 첫 샷부터 마지막 프레임까지 인물의 생김새와 의상, 공간 구조를 유지한다고 설명했습니다.
영상 생성 모델은 몇 초짜리 클립에서는 실사에 가까운 화면을 만들지만, 한 번에 만드는 길이는 아직 짧습니다. 구글이 8월에 낸 Omni 1.1 Flash는 10초씩 이어 붙여 최대 40초까지 만들고, 바이트댄스의 Seedance 2.5는 한 번에 만드는 길이를 15초에서 30초로 늘렸습니다. 몇 분짜리 이야기는 이런 클립 수십 개를 이어 붙여 만듭니다.
클립을 잇는 기존 방법은 두 갈래로 나뉩니다. 프레임 단위로 조금씩 이어 그리는 방식은 바로 앞뒤 화면이 자연스럽지만, 한 번 만든 프레임이 이후 생성의 고정 조건이 되어 오류가 고쳐지지 않은 채 뒤로 전해집니다. 짧은 구간을 따로 만들어 붙이는 방식은 이야기를 통제하기 쉬운 대신 구간과 구간 사이에서 인물과 배경이 어긋납니다.
구글은 소개 글에서 이 문제를 의미 표류(샷이 바뀔 때마다 인물의 옷이나 배경이 조금씩 달라지는 현상)와 연쇄 실패(앞 단계에서 만든 소품 이미지의 결함이 뒤의 영상 생성까지 망치는 현상)로 나눠 불렀습니다. 마지막 영상에서 무언가 틀어지면 원인이 몇 번째 구간의 어떤 프롬프트였는지 거슬러 찾기 어렵다는 점에서, 기계학습의 고전적인 신용 할당 문제와 같은 구조라고도 적었습니다.
초기 오류가 뒤로 번지면서 긴 영상의 일관성이 깨지기 때문에, 이 과정에는 사람이 일일이 손봐야 하는 일이 많습니다.— 예일 송·이원 송, 구글 연구과학자
A²RD는 영상을 구간(segment) 단위로 차례차례 만들면서, 구간마다 화면에 무엇이 있었는지를 세 가지 형태로 저장합니다. 논문은 이 저장소를 멀티모달 영상 기억(MVMem)이라고 부릅니다.
| 기록 | 담는 내용 |
|---|---|
| 글로 적은 상태 | 인물·사물·환경의 정체와 변화, 움직임, 「무엇이 무엇의 어디에 있다」식 공간 관계, 카메라 위치와 이동 |
| 프레임 | 처음에 만든 인물·배경 기준 그림, 구간별 첫 프레임과 마지막 프레임 |
| 영상 | 만든 구간 영상 자체(다음 구간과 움직임을 잇는 데 사용) |
영상을 만들기 전에는 이야기 전체를 읽고 등장인물과 장소를 뽑아 기준 그림부터 그립니다. 인물이 특정 장소에 속하는 경우처럼 서로 기대는 관계는 그래프로 정리해 순서대로 그리고, 그림은 구글 이미지 모델 Nano Banana 2가 맡습니다. 그다음 구간마다 Gemini 3 Flash가 관련 있는 이전 구간을 골라 기록을 꺼내 오고(Retrieve), 프레임과 영상을 만들고(Synthesize), 검사해 고친 뒤(Refine), 결과를 기억에 적어 넣습니다(Update).

글로 적은 상태가 왜 필요한지는 논문 부록의 마라톤 사례에 나옵니다. 주인공 엘레나의 가슴에 붙은 번호표 402는 9개 신쯤 화면에 보이지 않다가, 38번째 신에서 다시 드러나야 했습니다. 상태 기록 없이 만든 38번째 신의 프롬프트는 카메라 각도와 조명까지 적을 만큼 자세했지만 번호표와 「FAMILY REUNION」 테이블, 하늘의 무지개를 빠뜨렸고, 그 프롬프트로 그린 프레임에서 셋이 모두 사라졌습니다. 상태 기록을 꺼내 쓰자 세 가지가 프롬프트에 명시됐고, 이전 신의 프레임과 기준 그림이 함께 들어가 번호표가 다시 나타났습니다.

저장해 둔 영상은 멀리 떨어진 신을 이을 때 쓰입니다. 논문 사례의 6번째 신에는 해안 도로를 달리는 빨간 스포츠카, 공원을 뛰는 골든레트리버, 눈 덮인 산길의 증기기관차까지 샷 세 개가 들어 있고, 7번째 신은 기관차 이야기를 잇다가 12번째 신에서 다시 스포츠카로 돌아옵니다. 기억에는 구간별 첫 프레임과 마지막 프레임만 있어서 스포츠카 샷이 끝난 순간의 화면이 따로 없습니다. A²RD는 저장해 둔 6번째 신 영상에서 샷마다 마지막 프레임을 뽑아 Gemini 3 Flash에게 맞는 것을 고르게 하고, 그 프레임을 12번째 신의 첫 프레임으로 씁니다. 논문은 이 기능을 앞선 연구가 다루지 않은 기여로 꼽았습니다.
한 구간을 만드는 방법도 두 가지가 있습니다. 첫 프레임만 주고 뒤를 이어 그리게 하는 외삽(extrapolation)은 이야기가 자연스럽게 흘러가지만, 첫 프레임에 없던 인물이나 사물이 기준 그림에서 벗어나기 쉽습니다. 첫 프레임과 끝 프레임을 모두 정해 두고 사이를 채우는 내삽(interpolation)은 일관성이 강한 대신, 끝 프레임을 잘못 그리면 움직임이 부자연스러워집니다. 앞선 연구들은 둘 중 하나를 고정해서 썼습니다.
A²RD에서는 구간마다 Gemini 3 Flash가 이야기를 읽고 방식을 고릅니다. 다음 구간이 이미 기준 그림을 만들어 둔 장소로 넘어가거나 한 구간 안의 샷들이 여러 장소에 걸치면 내삽을 쓰고, 같은 장소에서 행동이 이어지면 외삽을 씁니다. 도예가 이야기에서는 작은 물건들을 챙기는 1번 신 다음의 2번 신이 미리 그려 둔 자갈 골목이어서 내삽을 골랐고, 조각을 시작하는 12번 신이 13번 신에서 같은 동작으로 이어질 때는 외삽을 골랐습니다. 모델이 고른 방식은 사람 전문가의 판단과 85% 넘게 일치했고, 1분 영상 평가(VBench-Long)에서 방식을 하나로 고정해 본 결과는 아래 표와 같습니다.
| 생성 방식 | 이야기 흐름 | 인물 일관성 | 배경 일관성 |
|---|---|---|---|
| 늘 외삽 | 0.8278 | 0.7112 | 0.8136 |
| 늘 내삽 | 0.7094 | 0.7400 | 0.8499 |
| 구간마다 선택(A²RD) | 0.8987 | 0.7353 | 0.8368 |
늘 내삽하면 인물·배경 일관성은 가장 높았지만 이야기 흐름 점수가 0.71로 떨어졌습니다. 앞 구간의 기록을 많이 받는 데다 영상 검사까지 일관성을 다그쳐 화면 변화가 적은 영상이 나온다는 것이 저자들의 설명입니다.
세 번째 장치는 생성 직후의 검사입니다. 먼저 구간의 경계 프레임을 Gemini 3 Flash가 인물·환경 일관성, 이야기 진행, 공간 논리, 인물·환경 상태, 지시 이행, 물리적 개연성까지 8개 기준으로 1~10점씩 매깁니다. 점수를 본 모델은 문제 하나만 고치는 편집과 프롬프트를 고쳐 다시 그리는 재생성 가운데 하나를 고르고, 프레임이 정해지면 영상을 만든 뒤 구간 사이의 인물·환경·움직임·카메라 일관성과 지시 이행, 이야기 진행 등 10개 기준으로 다시 채점합니다.
기준마다 넣은 이유가 있습니다. 부록의 한 사례에서 3번 신 프레임은 다른 일관성·품질 기준을 모두 만점으로 통과했지만, 0번 신에서 진입로에 서 있던 흰색 차의 방향이 설명 없이 돌아가 있었고 공간 논리 기준이 이 오류를 잡았습니다. 이야기 진행 기준을 빼고 돌리자 인물과 배경은 완벽하게 같은데 이야기가 앞으로 나가지 않는 스토리보드가 나왔습니다.
다시 그릴 때의 프롬프트 수정에도 기억이 붙습니다. 이전 수정 가운데 모든 점수가 오른 경우와 모든 점수가 떨어진 경우를 쌓아 두고, 비슷한 사례를 꺼내 교훈을 뽑은 뒤 프롬프트를 고칩니다. 제빵사 사례에서는 성공 사례 10개와 실패 사례 5개에서 교훈 12개를 뽑았고, 「이미 정해진 3/4 오른쪽 앞 각도」 같은 추상적인 표현을 눈높이 미디엄 클로즈업으로 바꾸고, 작업대 왼쪽 앞 모서리의 유리 사워도우 병처럼 구체적인 물건을 기준점으로 넣자 평균 점수가 6.4점에서 8.3점으로 올랐습니다.
실험에서는 프레임과 영상을 각각 두 번까지 고쳤고, 한 번에 후보를 3개씩 만들어 가장 좋은 것을 다음 단계로 넘겼습니다. 평균 9점 이상이면 멈추므로 구간 하나에 영상은 최대 6개, 프레임은 최대 6장을 만듭니다. 두 번 고치는 동안 프레임 평균 점수는 8.741에서 9.407로, 영상 평균은 7.928에서 8.493으로 올랐고, 가장 크게 오른 항목은 영상의 환경 일관성(7.430→8.795)과 프레임의 공간 논리(7.083→8.708)였습니다.
1분 평가는 공개 벤치마크 VBench-Long의 프롬프트 40개를 Gemini로 8개 구간씩 나눠 만든 영상입니다. 3분·5분 평가에는 연구진이 새로 만든 LVBench-C를 썼는데, 주요 인물과 환경이 적어도 10구간 동안 화면에서 사라졌다가 다시 나오도록 짰고, 돌아올 때 옷이나 위치, 상태가 달라진 경우를 섞었습니다. 3분·5분 시나리오가 50개씩 들어 있고, Gemini가 쓴 시나리오를 앤트로픽 모델로 한 번 더 검증했습니다. 실험에는 3분·5분 시나리오를 20개씩 썼습니다.
이야기 흐름 점수는 Gemini 3 Pro가 이야기 전개와 인과를 0~1로 채점한 값이고, 인물·배경 일관성은 구간 사이에서 같은 인물과 배경이 얼마나 같게 그려졌는지를 재는 자동 지표입니다. 비교 대상에는 기억 장치를 둔 VideoMemory, 대본·스토리보드를 거치는 멀티에이전트 ViMax, 앞 구간 마지막 프레임만 이어 받는 Naive-AR이 들어갔습니다.
| 1분 영상(VBench-Long) | 이야기 흐름 | 인물 일관성 | 배경 일관성 | 구간 간 움직임 |
|---|---|---|---|---|
| Naive-AR | 0.7466 | 0.5125 | 0.7148 | 0.9903 |
| ViMax | 0.6912 | 0.5552 | 0.7015 | 0.9754 |
| VideoMemory | 0.6717 | 0.5729 | 0.7273 | 0.9777 |
| A²RD-Par(병렬판) | 0.8082 | 0.6817 | 0.8180 | 0.9843 |
| A²RD | 0.8987 | 0.7353 | 0.8368 | 0.9935 |
| LVBench-C | 3분 인물 | 3분 배경 | 5분 인물 | 5분 배경 |
|---|---|---|---|---|
| Naive-AR | 0.3519 | 0.3224 | 0.3310 | 0.3950 |
| ViMax | 0.3557 | 0.3231 | 0.3570 | 0.3838 |
| VideoMemory | 0.3687 | 0.3554 | 0.3697 | 0.3830 |
| A²RD-Par(병렬판) | 0.4082 | 0.4270 | 0.3930 | 0.4567 |
| A²RD | 0.4262 | 0.4148 | 0.4395 | 0.4119 |
같은 지표인데 1분 평가에서 0.51~0.74이던 인물 일관성이 LVBench-C에서는 모든 방법이 0.44 아래에 머물렀습니다. A²RD는 일관성에서 VideoMemory보다 3분 평균 16%, 5분 평균 13% 높았고, 5분 이야기 흐름 점수도 0.95로 VideoMemory(0.83)를 앞섰습니다. 다만 배경 일관성은 3분·5분 모두 병렬판 A²RD-Par가 가장 높았습니다.

사람 평가는 1분 영상 40편을 전문 평가자 7명이 나눠 보고 1~5점으로 매겼습니다. A²RD는 평균 4.68점으로 가장 높았고 VideoMemory는 3.93점이었으며, 구간이 바뀔 때의 매끄러움은 4.34점으로 비교 방법 가운데 가장 높은 Naive-AR(3.63점)보다 0.71점 높았습니다. 5분 영상에서 신이 늘어날 때의 일관성은 따로 MLLM 심사로 쟀는데, 비교 방법들은 신이 늘수록 점수가 꾸준히 떨어졌고 A²RD는 인물 96.7%, 환경 91.8%, 사물 95.0%를 유지했습니다. 10분 시나리오 10개에서는 인물 90.5%, 환경 84.0%, 사물 91.5%였습니다.
구글 모델에만 맞춘 방법인지도 확인했습니다. 공개 모델 LTX-Video 0.9.8(13B)과 Wan 2.2(5B)에 같은 방식을 붙이자 Naive-AR보다 인물 일관성이 각각 0.50에서 0.70으로, 0.51에서 0.69로 올랐습니다. Wan 2.2는 내삽을 지원하지 않아 외삽만으로 돌린 결과입니다.
이 숫자들 대부분은 모델이 매긴 점수입니다. 이야기 흐름은 Gemini 3 Pro가 채점했고, 10분 영상의 일관성 비율은 구글 최신 MLLM으로 만든 심사 절차가 이야기로 설명되지 않는 뚜렷한 불일치만 골라 표시한 결과입니다. 연구진이 일부를 손으로 확인했을 때 심사 결과와 80%가 맞았고, 생성 프레임에서 자주 나오는 미세한 불일치는 심사가 설계상 놓칠 수 있다고 논문에 적었습니다.
생성과 검사, 이야기 채점은 모두 구글 모델이 맡았습니다. 영상은 Veo 3.1, 그림은 Nano Banana 2, 계획과 검사는 Gemini 3 Flash, 이야기 흐름 채점은 Gemini 3 Pro입니다. 연구진은 벤치마크 시나리오를 만들 때 자기 선호 편향을 피하려고 앤트로픽 모델로 재검증했다고 밝혔는데, 이야기 흐름과 10분 일관성을 Gemini가 아닌 모델로 다시 채점한 결과는 논문에 없습니다.
사람 평가에도 빈 곳이 있습니다. 한 영상을 최소 2명이 봤지만 평가자 간 일치도는 보고하지 않았습니다. 상당수 영상을 정확히 2명이 봐서 일치도가 큰 의미가 없었고, 평가 기준 자체가 주관적이라는 것이 저자들의 설명입니다.
긴 영상 생성의 평가는 본래 주관적이며, 전환의 매끄러움이나 이야기의 일관성 같은 복잡한 기준에서는 더욱 그렇습니다.— Do Xuan Long 외, A²RD 논문 한계 절
논문이 직접 고른 실패 사례도 있습니다. 체크무늬 셔츠를 같은 무늬지만 살짝 다른 색으로 다시 그렸는데 심사 모델도 이런 작은 차이를 가끔 놓쳤고, 손님에게 커피를 내오는 카페 신에서는 없던 나무 탁자가 갑자기 나타났습니다. 주방 신은 기준 그림과 비슷해 보여도 물리적으로 같은 공간은 아니었습니다. 연구진은 심사 모델이 문제를 찾아내도 두 번의 수정으로는 다 고치지 못하는 경우가 있다고 적었습니다.

검사에는 시간이 듭니다. 논문 부록의 추정으로는 VideoMemory보다 구간마다 Gemini 호출이 12번가량, 이미지 생성이 2번, 영상 생성이 2번 더 들고, 호출당 시간을 Gemini 10초 미만, Nano Banana 30초, Veo 3.1 120초 미만으로 잡으면 구간 하나에 최대 7.2분이 늘어납니다. 후보 여러 개를 한 번에 만드는 일괄 처리가 호출 한 번만큼 걸린다고 가정한 이상적인 하드웨어 기준입니다.
1분 평가가 구간 8개였으니 이 추정을 그대로 곱하면 1분 영상에 최대 57.6분, 신 80개를 구간 80개로 만드는 10분 영상에는 최대 9시간 36분이 더 듭니다. 비용도 일부만 공개됐습니다. Gemini 3 Flash로 하는 추론 비용은 구간당 0.5달러 미만(호출당 평균 1만 토큰 미만)으로 추정했지만, 구간마다 더 만드는 영상 5개와 프레임 5장의 생성 비용은 이 숫자에서 뺐습니다. 완성본 한 구간을 얻으려고 영상을 최대 6개 만드니, 완성 영상 1초에 생성 분량은 최대 6초입니다.
저자들은 이 비용을 감수할 만한 맞교환으로 봤습니다. 같은 일관성을 사람이 맞추려면 구간마다 수십 분씩 검토하고 프롬프트를 고쳐 다시 만들어야 하고, 실패한 영상을 끝까지 렌더링해 버리는 것보다 Gemini 호출로 일찍 걸러 내는 편이 싸다는 이유를 들었습니다. 영상 생성을 한꺼번에 돌려 시간을 줄인 병렬판 A²RD-Par는 영상 단계의 검사를 빼서, 사람 평가의 환경 일관성(4.17점)과 전환 매끄러움(3.71점)이 A²RD(4.52점, 4.34점)보다 낮았습니다.
프로젝트 페이지에는 1분·3분·5분·10분 생성 영상과 비교 방법의 영상이 올라와 있고, 논문은 CC BY 4.0으로 공개됐으며 부록에 단계별 프롬프트가 실려 있습니다. GitHub 저장소에는 5월 7일 첫 커밋의 README와 그림만 있어 실행 코드가 없고, LVBench-C 데이터셋은 「곧 공개(Coming soon)」 상태입니다.
구글은 9월 24일 소개 글에서 네 연구를 하나의 묶음으로 소개했지만, 평가 결과는 연구마다 따로 실었습니다. 10분 영상은 A²RD 하나로 만든 결과이고, 넷을 한 파이프라인으로 이어 잰 수치는 소개 글에 없습니다. 같은 묶음의 AI video co-director는 COLM 2026, CANVAS는 EMNLP 2026 발표를 앞두고 있으며, 구글은 다음 단계로 사람이 중간에 개입하는 작업 흐름을 붙이는 방안을 연구하고 있다고 밝혔습니다.
읽어 주셔서 고맙습니다.
초이 드림