Загружаем каталог…
Загружаем каталог…
velog
(출처: arXiv:2609.38721, Figure 2) 논문 제목 : UniEvo-VL: An On-policy Self-Distillation Training Recipe for Multimodal Model Self-improvement 저자 : Fang Wu, Da Xing, Yanjie Huang, Junxi Wang, Ji Wang, Hejia Geng, Guancheng Wan, Bowen Zuo, Xiaomin Li, Shixiang Tang, Xinyu Xiang, Zehong Wang, Shiyi Du, Peng Xia, Shuangjia Zheng, Yining Hong, Li Erran Li, Jure Leskovec, Yejin Choi (총 19인) 소속 : Stanford University, Johns Hopkins University, University of Toronto, University of Oxford, UC Riverside, MatrAIx, University of Notre Dame, Carnegie Mellon University, UNC–Chapel Hill, Independent Researcher 공개일 : 2026년 9월 30일 (v1) arXiv : https://arxiv.org/abs/2609.38721 코드/모델 : 공개된 저장소·프로젝트 페이지·HuggingFace 아티팩트 없음 (본문 및 Reproducibility Statement 확인) 분류 : cs.AI (primary), cs.CV / 라이선스 CC BY 4.0 🔖 TL;DR (한눈에) 이미지를 생성 하면서 동시에 그 이미지를 이해·평가 할 수 있는 통합 멀티모달 모델(unified multimodal model)의 특성을 이용해, 외부 교사 모델 없이 스스로 만든 비평(critique)을 학습 신호로 바꾸는 자가진화 프레임워크다. 핵심 트릭은 특권 정보(privileged information)의 비대칭 이다. 동일한 모델의 EMA 복사본인 교사는 "비평이 반영된 수정 프롬프트"를 보고, 학생은 원래 프롬프트만 본다. 두 쪽의 디노이징 전이 분포를 학생이 실제로 지나간 샘플링 경로 위에서 맞춘다(on-policy). 수정된 이미지를 정답으로 쓰지 않고, 스칼라 보상도 쓰지 않는다. "어떤 수정이 필요한가"를 "디노이징 스텝을 어떻게 바꿔야 하는가"로 번역 하는 것이 이 논문의 기여다. Qwen-Image-2512 위에서 GenEval 네이티브 점수가 0.747 → 0.808 (자가비평), 외부 비평가 GPT-5.6-Luna를 쓰면 0.882 까지 올라간다. GenEval2 Soft-TIFA는 Luna 기준 32.97 → 35.53 . 다만 개선은 균일하지 않다 . 자가비평만으로는 GenEval2 네이티브 점수가 오히려 32.86 → 32.37로 하락 하고, 텍스트 렌더링(OCR)도 검증 단계를 빼면 0.771 → 0.761로 퇴행 한다. 쉬운 프롬프트에서는 1 4점(0 100 정규화 기준) 손실이 관찰된다. 한 줄 요약 : 통합 멀티모달 모델의 자기 비평을 교사만 볼 수 있는 특권 조건으로 삼아 on-policy 자기증류로 흘려보내면, 추론 시 별도 반성 없이도 생성 능력 자체가 올라간다 — 단, 그 효과의 크기는 비평가의 실력과 과제 종류에 크게 좌우된다. 📄 초록(Abstract) 완역 최신 멀티모달 모델들은 생성과 이해를 하나의 통합 시스템 안으로 가져오며, 이로써 모델이 스스로 피드백을 제공하고 또 그 피드백으로부터 배우는 것이 가능해진다. 이러한 통합된 능력에 착안해, 우리는 멀티모달 모델이 테스트 타임 연산 중에 이 건설적인 자기 교정 피드백으로부터 학습하도록 하는 자가진화 프레임워크 UniEvo-VL을 제안한다. 별도의, 흔히 더 큰 교사 모델에 의존하는 대신, 우리는 모델의 자기 비평을 특권 정보(privileged information)로 활용하여 하나의 멀티모달 모델이 서로 다른 맥락을 가진 교사와 학생 양쪽 역할을 모두 수행하도록 요구한다. 학생은 평범한 질문만 보는 반면, 교사는 특권적인 비평을 조건으로 받는다. 그 다음 학습은 학생 자신의 샘플링 경로 위에서 두 쪽의 디노이징 디퓨전 분포 간 상태별 발산(per-state divergence)을 최소화한다. 실험은 UniEvo-VL이 멀티모달 모델의 이미지 생성 능력을 향상시키면서도, 추가적인 반성(reflection) 정보에 대한 민감도를 유지함을 보여준다. 구체적으로, 우리는 오픈소스 Qwen-image-2512 위에 구축하여 GenEval에서 0.747에서 0.808로, GenEval2 Soft-TIFA에서 32.97에서 35.53으로의 유의미한 성능 향상을 관찰한다. 더 나아가, 더 강력한 외부 비평가(예: GPT5.6-Luna)를 사용한 시도는 강한 심판(judge) 능력을 갖춘 멀티모달 모델이 더 높은 자가진화 상한을 기대할 수 있음을 보여준다. 마지막으로 중요한 점은, 혼재된 텍스트 렌더링 결과가 우리의 자기 개선이 서로 다른 과제에 걸쳐 균일하지 않을 수 있음을 보여준다는 것이다. 우리의 연구는 외부 감독이나 지도 없이 멀티모달 모델을 사용할 때의 사용자 경험을 향상시키기 위한, 현재 뜨거운 재귀적 자기 개선(recursive self-improvement) 연구 흐름에 빛을 비추는 것을 목표로 한다. 요약 : 통합 멀티모달 모델은 자기 출력물을 스스로 평가할 수 있으므로, 그 평가를 외부 감독 없는 학습 신호로 재활용할 수 있다. UniEvo-VL은 비평을 "수정 프롬프트"로 합성해 교사에게만 보여주고, 원래 프롬프트만 보는 학생이 교사의 디노이징 전이를 따라가도록 증류한다. 이 증류는 학생이 실제로 밟는 경로 위에서 이뤄지므로, 정답 이미지도 보상 모델도 필요 없다. 결과적으로 구성적 생성(compositional generation)에서 분명한 향상을 얻지만, 텍스트 렌더링처럼 일부 과제에서는 설정에 따라 성능이 퇴행할 수 있다는 한계를 저자들이 직접 명시한다. 🧩 왜 이 문제가 중요한가 (배경) 이미지 생성 모델을 피드백으로 개선하려는 시도는 크게 세 갈래였다. 자기 출력 선별 후 SFT/선호 최적화 — 잘 나온 샘플을 골라 다시 학습시킨다. 자기 생성 상호작용을 캡셔닝·판단·반성 과제로 재구성 — 이해 능력을 끌어올려 간접적으로 생성을 돕는다. 명시적 반성을 조건으로 이미지를 재정제 — ReflectionFlow 계열. 추론 시점에 한 번 더 고쳐 그린다. 멀티모달 평가를 보상으로 집계해 테스트 타임 정책 최적화 — Meta-TTRL 계열. 문제는 이들 어느 쪽도 교정 조건(corrective conditioning)을 원래 프롬프트 기준의 생성 정책 자체에, 그 정책이 밟는 경로 위에서 직접 증류하지는 않는다 는 점이다. 논문이 드는 예시가 직관적이다. "빠진 물체를 되살려라"라는 비평은 무엇이 바뀌어야 하는지 는 알려주지만, 생성기가 중간 디노이징 예측을 어떻게 바꿔야 하는지 는 전혀 알려주지 않는다. 반성 기반 방법은 그래서 매번 추론 시 추가 연산을 요구하고, 모델 자체는 조금도 똑똑해지지 않는다. 여기에 "검증은 생성보다 쉽다(verification is easier than generation)"는 최근 관찰이 겹친다. 모델이 자기 그림의 컵이 세 개인지 두 개인지 판별 하는 일은, 처음부터 두 개를 정확히 그리는 일보다 쉽다. 그렇다면 그 쉬운 판별 능력을 어려운 생성 능력으로 환전할 수 있는가? 이 환전의 경로를 설계한 것이 UniEvo-VL이다. 실무적으로도 이 구도는 매력적이다. Qwen-Image-2512처럼 생성기 내부에 이미 Qwen2.5-VL 계열 조건 인코더를 품고 있는 모델이라면, 생성과 이해가 한 시스템 안에 있다는 전제가 공짜로 주어진다. 외부에 더 큰 교사를 두지 않아도 되므로, 서비스 중인 모델이 사용자 요청 스트림을 처리하면서 점진적으로 나아지는 시나리오를 그릴 수 있다. 🔬 방법론 (출처: arXiv:2609.38721, Figure 1) 1) 생성과 이해 사이의 자가진화 루프 멀티모달 모델 $M_\theta$는 두 가지 모드로 동작한다. $$I \sim M_\theta^{gen}(p, \varepsilon), \qquad (c, a) \sim M_\theta^{und}(p, I)$$ $p$: 프롬프트, $\varepsilon \sim \mathcal{N}(0, I)$: 노이즈 $c$: 생성 이미지 $I$와 프롬프트 $p$ 사이의 불일치 설명 $a \in {0, 1}$: 이진 수락 결정. $a=1$이면 정합 — 수정 불필요, $a=0$이면 결함 — $c$가 교정 피드백 역할 비어 있거나 파싱 불가능한 비평 응답은 무효 평가로 간주해 버린다 . 여기서 핵심은 교사와 학생이 가중치가 아니라 맥락(context)으로만 구분 된다는 점이다. 학생 $M_\theta$: 평범한 프롬프트 $p$만 본다 → 추론 시점 조건과 정확히 동일 교사 $M_{\bar\theta}$: $M_\theta$의 EMA 참조 복사본 이며, 특권 정보인 수정 제안에 접근할 수 있다 2) 교정 조건 합성과 경험 획득 $a=0$인 유효 평가를 받은 이미지에 대해, 이해 모드가 비평을 독립적으로 읽히는 수정 프롬프트 로 다시 쓴다. $$\tilde{p} \sim M_\theta^{und}(p, c)$$ 논문의 예시: $p$가 "빨간 컵 두 개"를 요구했는데 생성기가 세 개를 그렸다면, $\tilde p$는 색과 장면 맥락은 보존하면서 정확히 두 개 임을 강조하도록 쓰인다. 중요한 제약이 하나 붙는다 — 교사는 텍스트만 조건으로 받으므로, 수정 프롬프트는 "이전 이미지"를 지칭해서는 안 된다 . 비평은 합성 전에 의미(semantic) / 텍스트(text) / 시각 품질(visual quality) 세 축으로 분리되어 수집되고, 문제가 없는 초안에는 KEEP 이 반환된다. 수정 프롬프트 사후 검증 (post-revision verification) 모든 $\tilde p$를 쓰지 않고 걸러내는 선택적 단계다. 학생이 같은 시드 $\varepsilon$ 으로 $I' \sim M_\theta^{gen}(\tilde p, \varepsilon)$ 재생성 $I'$를 원래 프롬프트 $p$ 기준으로 2차 평가 2차 평가가 유효하고 $I'$를 수락 할 때만 $\tilde p$를 학습 샘플로 채택 $I'$는 오직 $\tilde p$의 채택 여부를 판정하는 데만 쓰이며, 결코 학습 타깃이 되지 않는다. 즉 "고쳐 그린 그림"을 베끼게 하는 것이 아니라, "이 수정 지시가 실제로 통하는 지시인가"만 확인하는 장치다. 3) On-policy 자기증류 — 전이 매칭 반복 $k$에서 삼중항 $(p, \tilde p, \varepsilon)$에 대해, 학생이 원래 프롬프트 $p$로 길이 $T$의 디노이징 경로 $\tau = {s_0, \dots, s_T}$를 굴린다. 그리고 각 상태 $s_j$에서 교사와 학생의 국소 예측을 맞춘다. $$\mathcal{L}(\theta) = \mathbb{E}\Big[, D\big(, M_\theta^{gen}(\mathrm{sg}[s_j], p),\ \mathrm{sg}\big[M_{\bar\theta}^{gen}(\mathrm{sg}[s_j], \tilde p)\big] ,\big) \Big]$$ 기대값은 $(p, \tilde p, \varepsilon) \sim \mathcal{A}_k$, $\tau \sim M_\theta^{gen}(p, \varepsilon)$, $s_j \sim \tau$에 대해 취한다. 읽어야 할 포인트는 세 가지다. $\mathrm{sg}[\cdot]$(stop-gradient)가 어디에 붙는가 : 샘플된 상태 $s_j$(양쪽 모두)와 교사 예측 전체 . 초안 생성·평가·프롬프트 합성·경로 수집이 전부 그래디언트 밖에 있고, 그래디언트는 학생 파라미터 $\theta$로만 흐른다. 교사는 "고정된 전분포 타깃"이다. on-policy가 뜻하는 것 : 감독이 지금 학생이 실제로 방문하는 상태 위에 놓인다. 교사가 그린 이미지는 학생이 거의 지나지 않는 경로에 있을 수 있으므로, 학생의 노이즈 상태에서 국소 지도를 주는 쪽이 유용하다는 논증이다. "비평이 제안하는 수정"과 "그 수정이 다음 전이를 어떻게 바꾸는가"의 분리 : 이것이 앞서 말한 환전 메커니즘이다. 실제로 구현된 손실 (flow 인스턴스) 논문은 $D$를 "KL 또는 JS 발산 같은 것"이라 서술하지만, 부록 A.1에서 구현체는 가중 L2임을 명시 한다. CFG($g=4$)를 적용한 속도장 $$v_\theta^{(g)}(z, \sigma, p) = v_\theta(z, \sigma, \emptyset) + g,[,v_\theta(z, \sigma, p) - v_\theta(z, \sigma, \emptyset),]$$ 로 다음 잠재를 $\mu_{\theta,j}(z,p) = z + \Delta\sigma_j \cdot v_\theta^{(g)}(z, \sigma_j, p)$라 쓰면, 전이별 손실은 $$\ell_j^{flow}(\theta) = \frac{1}{2d}\big|\mu_{\theta,j}(\mathrm{sg}[s_j], p) - \mathrm{sg}[\mu_{\bar\theta,j}(\mathrm{sg}[s_j], \tilde p)]\big| 2^2 = \frac{(\Delta\sigma_j)^2}{2d}\big|M_\theta^{gen}(\mathrm{sg}[s_j], p) - \mathrm{sg}[M {\bar\theta}^{gen}(\mathrm{sg}[s_j], \tilde p)]\big|_2^2$$ 공유 잠재 $z = s_j$가 소거되므로 두 식이 같아진다. 즉 $D_j(u,w) = (\Delta\sigma_j)^2|u-w|_2^2 / (2d)$ — 샘플러 간격의 제곱으로 가중된 속도 매칭 이다. 저자들도 이것이 "정확한 확률적 정책 KL이나 JS 발산은 아니다"라고 인정한다. 전체 목표는 선택된 전이 인덱스 $J$에 대한 평균이며, 보고된 20스텝·noisy fraction 0.3 레시피에서는 $J = {0, \dots, 5}$ — 노이즈가 가장 큰 6개 전이 만 쓴다. 교사는 $\bar\theta \leftarrow \beta\bar\theta + (1-\beta)\theta$, $\beta = 0.999$로 갱신된다. 4) 알고리즘 한 장 요약 획득 단계에서 프롬프트마다 초안을 그리고 비평한다. 비평이 유효하고 $a=0$이면 수정 프롬프트를 합성한다. 검증 플래그가 켜져 있으면 같은 시드로 재생성해 2차 평가를 통과한 것만 $\mathcal{A}_k$에 넣는다. 증류 단계에서는 각 삼중항에 대해 경로를 detach한 채 굴리고, 경로의 미니배치마다 전이 손실로 학생을 업데이트한 뒤 EMA 교사를 갱신한다. 배포 시점에는 수정 프롬프트도 반성도 없이 원래 프롬프트만으로 생성한다. 5) 실험 설정 항목 설정 기반 생성기 Qwen-Image-2512 (flow 기반, Qwen2.5-VL 조건 인코더 내장) 자가비평 백엔드 Qwen3-VL-8B-Thinking (비평) + Qwen3-VL-8B-Instruct (합성) 외부 비평가 (어블레이션) GPT-5.6-Luna (사후 검증 없는 설정에서만) 평가자 (학습 신호 아님) Gemini-2.5-Flash (temp 0, judge seed 42, JSON 스키마 강제) 학습 대상 이미지 생성 LoRA만 (rank 16 / alpha 16). 베이스 가중치·텍스트 인코더·VAE·피드백 모듈 전부 동결 샘플링 10242, 20 스텝, CFG 4.0, noisy timestep fraction 0.3 옵티마이저 (검증 레시피) AdamW, lr 3e-4, wd 1e-4, grad clip 1.0, local batch 1 / accum 2, EMA 0.999, seed 42 하드웨어 H200 GPU 4장 벤치마크 GenEval(553 프롬프트, 6 카테고리) / GenEval2(800 프롬프트, atomicity 3~10) / OCR 텍스트 렌더링(학습 약 20,000 · 테스트 1,018 프롬프트) GenEval·GenEval2·OCR은 각각 따로 학습 된다. 평가 점수는 어떤 형태로도 보상으로 되돌아가지 않는다. 📊 실험 결과 메인 결과 (Table 1) 괄호는 비평가를, "verification"은 수정 프롬프트 필터링을 뜻한다. Base는 동일 사전학습 모델의 서로 다른 랜덤 시드 평균이다. Method GenEval Native GenEval Atomic(%) GenEval HumanPref GenEval2 Native GenEval2 Atomic(%) GenEval2 HumanPref OCR Native OCR HumanPref Base 0.747 95.30 8.48 32.58 81.69 6.65 0.771 9.07 UniEvo-VL 0.808 96.90 8.79 32.37 82.24 6.91 0.761 9.06 UniEvo-VL (GPT5.6-Luna) 0.882 98.76 8.97 35.53 83.18 6.86 0.775 9.03 UniEvo-VL (verification) 0.818 97.41 8.71 35.07 82.75 7.11 0.790 9.10 읽는 법이 중요하다. 구성적 생성(GenEval)에서는 자가비평만으로도 0.747 → 0.808로 +0.061 이 오르고, 외부 비평가를 쓰면 0.882까지 간다. 그런데 GenEval2 네이티브 점수는 자가비평 설정에서 32.58 → 32.37로 오히려 내려간다. 사후 검증을 붙이면 35.07로 회복된다. OCR도 같은 패턴이다 — 검증 없는 자가비평은 0.771 → 0.761로 퇴행하고, 검증을 붙여야 0.790으로 최고가 된다. "비평을 거르는 단계"가 선택적 장식이 아니라 사실상 필수 라는 뜻이다. 학습된 개선 vs 추론 시 반성 (Table 2) 이 논문에서 가장 설계가 좋은 실험이다. "학습으로 모델에 내재화된 향상"과 "추론 시 반성 한 번이 주는 추가 이득"을 짝지어 분리한다. Dataset Metric Base 직접 Base + 반성 UniEvo-VL 직접 UniEvo-VL + 반성 GenEval Native 0.748 0.826 0.818 0.848 GenEval Atomic 95.41 98.26 97.41 98.56 GenEval HumanPref 8.47 8.92 8.71 8.87 GenEval2 Native 31.92 42.52 35.07 46.23 GenEval2 Atomic 81.47 84.45 82.75 86.12 GenEval2 HumanPref 6.53 7.09 7.11 7.65 OCR Native 0.769 0.783 0.790 0.803 OCR HumanPref 9.02 9.15 9.10 9.22 세 가지가 읽힌다. 학습된 직접 생성이 "반성한 베이스"에 어디까지 근접하는가 : GenEval에서는 0.818 vs 0.826으로 거의 붙었고, OCR에서는 0.790 vs 0.783으로 역전 했다. 반면 GenEval2에서는 35.07 vs 42.52로 여전히 크게 뒤진다. 즉 반성 한 번의 가치를 전부 흡수한 것은 아니다. 반성 민감도가 보존되는가 : 학습 후에도 모든 지표에서 반성이 추가 이득을 준다. GenEval에서는 반성 이득이 +0.078 → +0.030으로 줄어드는데 (효과가 겹쳤다는 뜻), GenEval2에서는 +10.60 → +11.17로 오히려 커지고 OCR은 +0.014 → +0.013으로 거의 그대로다. 학습+반성 조합이 세 벤치마크 모두에서 최고 네이티브 점수 를 낸다. 단 GenEval HumanPref만은 반성한 베이스(8.92)가 UniEvo-VL+반성(8.87)보다 미세하게 높다. 비평가 역량이 자가진화 상한을 정한다 (Table 3) Gemini 구성 충실도(0~10) 기준, GenEval 카테고리별: Critic / model Single Two Count Color Position Attr. Overall Base 9.93 9.68 7.86 9.71 6.85 9.75 8.96 Qwen-VL 9.90 9.88 9.29 9.66 8.79 9.94 9.57 GPT-5.6-Luna 9.98 9.92 9.58 9.91 9.88 9.94 9.87 이득이 공간 구성과 세기 에 집중된다. 자가비평만으로 position 6.85 → 8.79, co
То, что RADAR обнаружил и классифицировал для этой возможности. Это опубликованный источником текст, а не подтверждение, что предложение ещё действует.
[논문리뷰] UniEvo-VL: An On-policy Self-Distillation Training Recipe for Multimodal Model Self-improvement (멀티모달 자가진화). (출처: arXiv:2609.38721, Figure 2) 논문 제목 : UniEvo-VL: An On-policy Self-Distillation Training Recipe for Multimodal Model Self-improvement 저자 : Fang Wu, Da Xing, Yanjie Huang, Junxi Wang, Ji Wang, Hejia Geng, Guancheng Wan, Bowen Zuo, Xiaomin Li, Shixiang Tang, Xinyu Xiang, Zehong…
Открыть источник