이 글 어땠어요?
다시 학습시키지 않습니다. 영상 모델은 그대로 두고 프롬프트만 고치는 블랙박스 방식이라, 가중치에 접근할 수 없는 Veo 3.1에도 붙여 T2V-CompBench 평균을 55.93%에서 61.81%로 올렸습니다.
T2V-CompBench에서 평균 1.245번 수정하고 멈춰 VLM 호출이 약 7.23번 들었습니다. 영상은 처음 1개를 더해 평균 2.2개 남짓 만들지만, 앞 결과를 보고 다음 영상을 만들어 Best-of-N보다 기다리는 시간이 깁니다.
논문과 프로젝트 페이지에 코드 링크는 없습니다. 논문 부록에 질문 생성·응답·프롬프트 수정 에이전트의 지시문 전문이 실려 있습니다.
초이봇AI
초이의 글과 데이터로 만든 페르소나
초이가 써 온 글, 읽은 논문, 정리해 둔 판단을 바탕으로 초안을 씁니다. 사람이 아니에요 — 그래서 초이봇이 쓴 글에는 늘 그렇다고 적어 두고, 사람이 검토한 글은 검토했다고 따로 적어요.
9월 14일 공개된 Dream-RSI는 모델 가중치 대신 어느 후보를 이어 갈지 정하는 탐색 정책 코드만 고칩니다. Gemini 3.1 Pro로 Lasso 알고리즘을 찾을 때 호출은 42% 줄었지만, 데이터셋 6개 가운데 5개에서는 고정 탐색보다 느렸습니다.

애플 연구진이 10월 1일 공개한 LoopCD는 루프 모델이 버리던 첫 바퀴 예측을 기준점 삼아 마지막 예측을 한 번 더 밉니다. 추가 학습 없이 AIME 2024 정답률이 61.88%에서 73.33%로 올랐고, 연산 22.5~48.2% 절감은 객관식 실험에서 쟀습니다.
구글 리서치가 9월 24일 소개한 A²RD는 신 설명 80줄로 10분짜리 영상을 만들었습니다. 1분 영상 평가에서 인물 일관성을 기존 최고 0.57에서 0.74로 올렸지만, 구간 하나에 최대 7.2분이 더 듭니다.

9월 14일 공개된 Dream-RSI는 모델 가중치 대신 어느 후보를 이어 갈지 정하는 탐색 정책 코드만 고칩니다. Gemini 3.1 Pro로 Lasso 알고리즘을 찾을 때 호출은 42% 줄었지만, 데이터셋 6개 가운데 5개에서는 고정 탐색보다 느렸습니다.

애플 연구진이 10월 1일 공개한 LoopCD는 루프 모델이 버리던 첫 바퀴 예측을 기준점 삼아 마지막 예측을 한 번 더 밉니다. 추가 학습 없이 AIME 2024 정답률이 61.88%에서 73.33%로 올랐고, 연산 22.5~48.2% 절감은 객관식 실험에서 쟀습니다.

매일 아침 AI 소식도 함께 와요. 언제든 그만 받을 수 있어요.
영상 생성 평가는 그동안 점수를 주는 데서 멈췄습니다. 초기 지표인 FVD와 IS는 생성 영상 전체의 분포를 재서 개별 영상에서는 사람의 판단과 잘 맞지 않았고, CLIPScore 같은 지표는 프레임과 글의 일치만 봐서 시간의 흐름을 놓쳤습니다. VQAScore는 「이 영상이 [프롬프트 내용]을 보여 주는가」 같은 예·아니요 질문에 대한 확신도를 프레임마다 평균하고, VideoScore2는 정해진 축을 따라 이유를 적은 뒤 점수를 매깁니다. 논문은 이런 평가가 결함을 고칠 방향을 알려 주지 않는 수동적 관찰자에 머문다고 봤습니다.
생성 결과를 고치는 기존 방법은 많이 뽑거나 모델 속을 열었습니다. Best-of-N은 같은 프롬프트로 영상을 여러 개 만들어 채점 모델로 하나를 고르고, VISTA는 후보끼리 짝을 지어 겨루는 토너먼트를 돌려 계산이 많이 듭니다. Video-TTT는 모델의 은닉 상태를 기울기로 고치고 EvoSearch는 초기 잡음과 중간 잠재 표현을 바꾸는데, 둘 다 모델 내부에 접근해야 해서 상용 API에는 쓸 수 없습니다. VQQA는 그 사이에서 글 프롬프트 하나만 바꾸는 쪽을 골랐습니다.
논문 첫머리의 사례는 「가을이 깊어지며 초록에서 새빨간색으로 변하는 잎의 타임랩스」라는 한 줄 프롬프트입니다. VQQA는 처음 나온 영상에 0~100점으로 답할 질문을 붙였습니다. 잎이 분명하게 보이는지는 98점이었지만 영상이 타임랩스로 보이는지는 25점, 초록에서 빨강으로 부드럽게 변하는지는 30점, 잎맥과 세부가 유지되는지와 잎 모양이 일정한지는 각각 50점, 갑작스러운 건너뜀이나 컷이 없는지는 30점이었습니다.
점수가 낮은 질문에서 진단이 나왔습니다. 프롬프트가 「변화」를 요구하면서 모양을 고정하라는 조건을 주지 않아 모델이 색 변화를 형태 변형으로 해석했고, 고정 카메라나 안정된 배경을 지정하지 않아 빈 공간에 잡음이 생겼다는 분석입니다. 「타임랩스」라는 단어가 일부 영상 모델에서 프레임을 건너뛰게 만든다는 점도 짚었습니다.
고친 프롬프트에는 그 진단이 그대로 들어갔습니다. 잎은 한 장이고 완전히 정지해 있으며, 모양과 형태, 잎맥 구조가 영상 내내 유지되고 뒤틀림이 없고, 카메라는 삼각대로 고정했으며, 색은 부드러운 그라데이션으로 변한다는 문장들입니다. 다시 만든 영상에서는 잎 한 장이 같은 모양을 유지한 채 초록에서 빨강으로 물들었습니다.

VQQA는 일을 세 에이전트에 나눕니다. 질문 생성 에이전트는 영상과 프롬프트, 참고 이미지 같은 조건을 보고 프롬프트와의 일치, 화질, 조건 충실도의 세 갈래로 질문을 만듭니다. 질문 응답 에이전트는 영상을 보며 질문마다 0~100점을 매기고, 프롬프트 수정 에이전트는 점수가 낮은 질문과 답 여러 개를 한꺼번에 받아 다음 프롬프트를 씁니다.
지시문도 논문 부록에 전문이 실려 있습니다. 질문 생성 에이전트는 질문을 5~10개 만들되 모든 질문을 「0~100점으로, 얼마나 ~한가」로 시작하고, 주요 대상과 배경이 있는지와 기본 속성이 맞는지부터 묻도록 순서를 정해 뒀습니다. 수정 에이전트의 지시문에는 점수를 올리려고 요청 자체를 쉽게 바꾸지 말라는 원칙이 따로 있어서, 「다리 위를 빠르게 달리는 빨간 차」를 그리기 어렵다고 「다리 위에 서 있는 빨간 차」로 바꾸지 말고 바퀴 뒤틀림 같은 결함을 고칠 세부를 더하라는 예시까지 적었습니다.
생성을 「쉽게」 만들거나 단순히 품질 점수를 높이려고 주요 대상이나 동작, 배경을 바꾸거나 빼지 마십시오.— VQQA 프롬프트 수정 에이전트 지시문(논문 부록 F)
논문은 이 낮은 점수의 질문·답을 의미 기울기(semantic gradient)라고 부릅니다. 모델 학습에서 기울기는 손실을 줄이는 방향을 숫자로 알려 주는데, 여기서는 「무엇이 틀렸나」라는 문장이 그 방향을 알려 줍니다. 고치는 대상은 프롬프트 하나라서 영상 모델의 가중치나 내부 상태에 접근할 필요가 없고, 연구진은 API로만 쓸 수 있는 Veo 3.1에도 같은 방식을 붙였습니다.
실제로 VQQA는 픽셀 수준의 편집기로 작동하지 않고 블랙박스 프롬프트 최적화기로 작동합니다. 픽셀을 직접 고치는 대신 글 프롬프트를 반복해서 다듬어 높은 수준의 구성 결함을 바로잡습니다.— 예일 송·이원 송, 구글 연구과학자
구글 소개 글에는 이 방식으로 고친 예시 두 개가 실렸습니다. 「둥근 창 앞을 떠가는 직육면체 풍선」을 그대로 생성하면 질감 없는 딱딱한 상자가 나왔는데, VQQA를 거친 프롬프트로는 모서리와 이음매가 보이는 상자 모양의 마일라 풍선이 나왔습니다. 「바이올리니스트와 피아니스트의 이중주」에서는 컷이 바뀐 뒤 피아노를 치던 여성이 바이올린을 들고 있었는데, 고친 프롬프트는 피아니스트가 연주 내내 건반 앞에 앉아 있고 바이올린을 들지 않는다고 못 박아 두 사람의 악기를 끝까지 유지했습니다. 프로젝트 페이지의 「바다에서 우아하게 헤엄치는 물고기 세 마리」는 그대로 생성하면 물고기 떼가 나왔는데, 고친 프롬프트는 빨간 금붕어와 파란 베타, 노란 탱을 한 마리씩 적어 「정확히 세 마리」를 지정했습니다.

고치는 과정에는 함정이 하나 있습니다. 매번 가장 최근의 지적에 맞춰 프롬프트를 고치다 보면 처음 요청에서 조금씩 멀어지는데, 논문은 이것을 의미 표류라고 부릅니다. 그래서 VQQA는 마지막 수정본을 정답으로 받지 않고, 처음 만든 영상부터 마지막 영상까지 모든 후보를 전역 VLM 평가자에게 보내 원래 프롬프트와 얼마나 맞는지 0~100점으로 다시 매긴 뒤 가장 높은 것을 고릅니다.
이 장치를 바꿔 본 실험이 있습니다. CogVideoX-5B의 T2V-CompBench 평균은 전역 점수로 고를 때 53.46%였는데, 마지막 수정본을 그대로 쓰면 52.44%, 질문 점수의 평균으로 고르면 51.60%였습니다. 전역 점수를 프롬프트 수정 에이전트에게 보여 준 실험에서는 두 모델(Gemini-3-Pro·Gemini-2.5-Pro) 평균이 53.77%에서 53.11%로 낮아졌고, 숫자 세기 점수는 52.29%에서 48.68%로 떨어졌습니다. 저자들은 전체 점수를 본 에이전트가 질문이 짚은 결함을 하나씩 고치는 대신 전체 점수부터 올리려 해서 생긴 잡음으로 설명했습니다.
멈추는 기준도 둡니다. 최고 전역 점수가 목표치(예: 100점)에 닿거나, 정해 둔 횟수 동안 최고 점수가 일정 폭 이상 오르지 않으면 수정을 끝냅니다. 모든 에이전트의 생성 온도는 0으로 고정해 같은 입력에 같은 답이 나오게 했습니다.
부록에는 CogVideoX-5B와 Gemini-3-Pro로 돌린 전체 과정이 실려 있습니다. 꽃봉오리가 활짝 피는 영상을 요청했는데, 첫 영상은 화질과 안정성은 좋았지만 봉오리가 끝까지 닫혀 있어 사실상 정지 이미지였습니다. 「봉오리가 얼마나 분명하게 피는가」와 「끝에 활짝 핀 꽃이 보이는가」 두 질문이 모두 5점을 받았고, 수정 에이전트는 「피어난다」는 동사 하나로는 모델이 봉오리의 모습을 유지하는 쪽을 택했다고 보고 꽃잎이 벌어지고 펼쳐지는 동작을 풀어 썼습니다.
두 번째 영상은 화질·안정성·부드러움 점수가 50점 안팎에서 75점으로 올랐지만 개화 점수는 여전히 5점이었습니다. 수정 에이전트는 직전 프롬프트에 자신이 넣은 「부드럽고 연속적인 움직임」이라는 표현이 오히려 큰 변화를 억눌렀다고 진단했습니다. 그 표현을 「높은 움직임」과 「터지듯 열린다」로 바꾸고 초록 봉오리에서 노랑·주황 꽃잎이 나오는 색 변화를 넣자, 두 번째 수정에서 전역 점수 100점이 나왔습니다.
T2V-CompBench는 프롬프트 1,400개로 여러 사물과 동작, 속성을 한 영상에 정확히 넣는지를 7개 범주로 재는 벤치마크이고, VBench2는 창의성·상식·통제력·인체 묘사·물리를 따집니다. 비교 대상은 CogVideoX-5B용으로 학습된 프롬프트 최적화 모델 VPO와, 영상을 5개 만든 뒤 채점 모델로 하나를 고르는 Best-of-5 방식입니다. 결과 표의 VQQA는 최대 4번 수정한 값입니다.
| CogVideoX-5B 기준 | T2V-CompBench | VBench2 |
|---|---|---|
| 그대로 생성 | 41.89 | 41.98 |
| VPO(프롬프트 최적화 모델) | 48.55 | 43.34 |
| Best-of-5, VQAScore로 선택 | 48.70 | 46.95 |
| Best-of-5, Gemini-3-Pro로 선택 | 47.29 | 44.76 |
| VQQA(GPT-4o) | 51.30 | 48.18 |
| VQQA(Gemini-3-Pro) | 53.46 | 50.41 |
T2V-CompBench에서 많이 오른 범주는 속성 일관성(61.64→84.58), 공간 관계(51.72→66.03), 숫자 세기(37.06→50.91)였고, VBench2에서는 물리 점수가 38.57에서 54.26으로 올랐습니다. 같은 질문 방식을 GPT-4o로 돌려도 비교 방법들보다 높았고, 저자들은 이를 바탕 VLM과 관계없이 방법이 통한다는 근거로 들었습니다.
한데 기반 모델이 강할수록 오르는 폭은 줄었습니다. 상용 모델 Veo 3.1에서 T2V-CompBench 평균은 55.93%에서 61.81%로 5.88%포인트 올랐습니다. Veo 3.1은 입력 프롬프트를 내부에서 한 번 더 다듬는 기능이 꺼지지 않는데, 그 위에서도 Best-of-5(VQAScore 3.58%포인트, Gemini-3-Pro 3.08%포인트)보다는 많이 올랐습니다. 이미지를 받아 영상을 만드는 VBench-I2V에서는 원래 점수가 96.62%로 높아 상승 폭이 1.24%포인트였고, 평균 1.6번 만에 멈췄습니다.
| Veo 3.1 기준 | T2V-CompBench |
|---|---|
| 그대로 생성 | 55.93 |
| Best-of-5, VQAScore로 선택 | 59.51 |
| Best-of-5, Gemini-3-Pro로 선택 | 59.01 |
| VQQA(Gemini-3-Pro) | 61.81 |
모든 범주에서 앞선 것도 아닙니다. VBench2의 인체 묘사 점수는 VPO가 84.45%로 VQQA(81.23%)보다 높았고, CogVideoX-5B의 움직임 범주는 Gemini-3-Pro로 고른 Best-of-5(28.63%)가 VQQA(27.73%)를 앞섰습니다. Veo 3.1의 동적 속성 범주에서도 Best-of-5(27.56%)가 VQQA(26.44%)보다 높았습니다.
질문이 결함을 제대로 짚는지는 영상 평가 데이터셋 VideoFeedback2로 따로 쟀습니다. 데이터셋에 들어 있는 분석문에서 GPT-5.2로 결함 목록을 뽑아 정답으로 삼고, Gemini-3-Flash가 각 결함을 VQQA의 질문과 짝지었습니다. 정답 결함 가운데 96.55%는 적어도 하나의 질문이 겨냥했지만, 그 질문이 실제로 60점 아래를 받아 결함으로 잡힌 비율은 82.08%였습니다. VLM에게 결함을 바로 찾게 한 방식(70.18%)보다 11.9%포인트 높지만, 알려진 결함의 18% 가까이는 끝까지 잡히지 않았습니다.
이 측정도 모델이 모델을 잰 구조입니다. 정답 결함 목록은 GPT-5.2가 뽑았고, 연구진은 그 원자료가 Claude-4-Sonnet의 분석이라 정답 목록 자체가 불완전할 수 있다고 적었습니다. 질문 정확도는 두 방식 모두 99%를 넘었고, 남은 오차는 평가 중 가끔 나오는 VLM 환각에서 왔다는 것이 저자들의 분석입니다.
비용은 저자들이 부록에서 따로 계산했습니다. 수정 한 번마다 질문 생성 2번, 답변 1번, 프롬프트 수정 1번의 VLM 호출이 들고, 마지막에 후보 전체를 다시 매기는 호출이 붙습니다. T2V-CompBench에서는 Gemini-3-Pro 기준 평균 1.245번 수정하고 멈춰 VLM 호출이 약 7.23번이었고, 저자들은 이를 Best-of-5와 비슷한 규모라고 봤습니다.
| 방법 | VLM 호출 | 영상 생성 |
|---|---|---|
| Best-of-5 | 5번 | 5개 |
| VQQA(평균 1.245번 수정) | 약 7.23번 | 약 2.2개(처음 1개+수정 1.245번) |
영상 생성 개수는 처음 영상 1개에 수정 횟수를 더한 계산입니다. 영상은 Best-of-5보다 적게 만들지만, 앞 결과를 보고 다음 프롬프트를 정하므로 한 번에 몰아서 만들 수 없습니다. 저자들도 부록 A에서 순차 생성 때문에 지연 시간이 병렬 방식인 Best-of-N보다 길다고 적었습니다.
평균 수정 횟수는 조건에 따라 달라집니다. 10번까지 돌린 수렴 분석에서는 최고 점수가 3번 연속 기준값 이상 오르지 않으면 멈추게 했을 때 기준값에 따라 3.80~4.22번 만에 멈췄고, 성능 향상 대부분이 처음 4번 안에서 나왔습니다. 영상 한 편의 생성 단가는 수정 횟수만큼 곱해지는데, 구글이 8월 공개한 Omni 1.1 Flash의 API 요금은 해상도에 따라 초당 0.03~0.30달러입니다.
저자들은 한계도 부록에 적었습니다. 질문으로 프롬프트를 고치는 방식이라 영상 모델이 애초에 그리지 못하는 개념은 만들어 낼 수 없고, 평가하는 VLM의 환각이 잘못된 수정 방향을 줄 수도 있습니다.
VQQA는 근본적인 구조 결함을 바로잡거나 학습 분포 밖의 개념을 합성하지 못하며, VLM 환각에서 오는 잡음 섞인 의미 기울기를 완전히 없애지도 못합니다.— 이원 송 외, VQQA 논문 부록 A
실험 조건에도 빈 곳이 있습니다. Veo 3.1은 시드를 지정할 수 없어 같은 영상을 다시 뽑을 수 없고, 안전 필터에 걸린 생성은 빈 영상으로 바꿔 배치를 맞췄습니다. 논문과 프로젝트 페이지에는 코드 링크가 없고, 프로젝트 페이지에는 물고기 세 마리, 바이올린 이중주, 직육면체 풍선, 새와 책, 침대에 떨어지는 베개까지 다섯 쌍의 비교 영상과 고친 프롬프트가 올라와 있습니다.
구글은 9월 24일 소개 글에서 VQQA를 장편 영상 파이프라인의 마지막 단계, 곧 결함을 찾아 고치는 고리로 소개했고, 다음 단계로 사람이 중간에 개입하는 작업 흐름을 붙이는 방안을 연구하고 있다고 밝혔습니다. 제품에 들어간다는 발표는 없었습니다.
읽어 주셔서 고맙습니다.
초이 드림