9 분 소요

0. Introduction

Paper link

Project page

DanceOPD는 OPD를 language model distillation이 아니라 image generation field composition 문제로 옮긴 논문이다. 이 논문이 다루는 핵심 질문은 단순하다. T2I, local editing, global editing, realism reward, CFG 같은 서로 다른 generation capability를 하나의 flow-matching student 안에 어떻게 합칠 것인가다.

현대 image generation model은 한 가지 능력만 잘하면 부족하다. Text-to-image는 open-ended visual quality and prompt following을 요구한다. Local editing은 source image preservation and precise modification을 요구한다. Global editing은 style, color, layout 같은 넓은 distribution shift를 허용해야 한다. 이 능력들은 서로 자연스럽게 정렬되지 않는다. Editing을 세게 학습하면 T2I 성능이 떨어질 수 있고, local editing and global editing은 보존과 변형의 방향이 충돌할 수 있다.

DanceOPD는 이 문제를 “capability를 parameter space에서 섞는 문제”가 아니라 velocity field를 어떤 student state에서 query할 것인가로 본다. 각 frozen capability source를 shared flow state space 위의 velocity field로 두고, student가 자기 rollout에서 방문한 low-noise semantic-side state를 하나 뽑아 해당 capability field에게 supervision을 받는다. Sample마다 하나의 field만 hard-route하여 target-field ambiguity를 줄이고, dense trajectory supervision은 correlated signal을 과도하게 중복하므로 피한다.

한 줄 요약: DanceOPD는 flow-matching image generator에서 T2I, editing, realism, CFG 같은 capability source를 velocity field로 보고, sample-wise hard routing, student-visited low-noise state query, single-query velocity MSE를 사용해 multi-capability composition을 on-policy field distillation으로 푸는 framework다.

이 논문을 지금 볼 가치가 있는 이유는 다음과 같음.

  • OPD를 text token distribution이 아니라 generative velocity field matching으로 일반화한다.
  • Multi-capability image model 학습에서 capability conflict를 field ambiguity, state mismatch, trajectory correlation으로 분해한다.
  • Plain velocity MSE가 local field distillation objective로 충분하다는 practical recipe를 제시한다.
  • CFG and realism reward 같은 operator-defined field도 같은 formulation으로 흡수할 수 있음을 보인다.
  • Ablation이 design choice와 성능 변화를 꽤 직접적으로 연결한다.
  • Image generation model compression, editing integration, multi-teacher distillation에 재사용할 수 있는 관점을 준다.

이 글에서는 DanceOPD를 “새 image editing model”보다, flow-matching model에서 여러 capability field를 하나의 student에 안전하게 distill하려는 training recipe paper로 읽는다.

1. Problem Setting

1-1. Problem definition

Flow-matching image generation에서 model은 시간 $t$의 noisy state $x_t$와 condition $c$를 받아 velocity field를 예측한다.

\[v_{\theta}(x_t,t,c)\]

여러 capability source가 있으면 각각 다른 velocity field를 정의한다.

\[v_1, v_2, \ldots, v_K\]

예를 들어:

Field What it represents
T2I field Text prompt based image generation
Local edit field Preserve source image while applying local change
Global edit field Broad style or layout transformation
Realism field Reward or critic derived visual realism direction
CFG field Operator-defined guided velocity

목표는 하나의 student $v_{\theta}$가 이 capability들을 적절히 내재화하게 하는 것이다.

Naive solution은 capability data를 섞거나, 여러 teacher outputs를 평균하거나, parameter merging을 시도하는 것이다. 하지만 field level에서는 문제가 생긴다.

  1. 서로 다른 capability field가 같은 sample에서 다른 direction을 제시할 수 있다.
  2. Off-policy state에서 teacher field를 query하면 student가 실제 inference에서 방문하는 state와 다르다.
  3. 한 rollout의 여러 timestep에서 dense query를 하면 correlated gradient를 과도하게 쌓을 수 있다.

DanceOPD의 problem setting은 이 세 문제를 동시에 줄이는 것이다.

1-2. Why previous approaches are insufficient

1) Data mixing and joint training

Data mixing은 가장 단순하다. T2I, local edit, global edit data를 섞고 하나의 model을 학습한다. 하지만 capability-specific objective가 충돌하면 평균적인 compromise solution이 될 수 있다.

특히 local editing은 preservation을 요구하고, global editing은 transformation을 요구한다. 같은 parameter가 두 목표를 동시에 만족하려 하면 특정 capability가 약해질 수 있다.

2) Parameter merging and adapter composition

Fine-tuned model or adapter를 합치는 방법은 cheap한 composition을 제공한다. 그러나 field-level behavior를 보장하지 않는다. Parameter interpolation은 velocity field interpolation과 같지 않고, semantic state에 따라 어떤 capability가 active해야 하는지 명시하기 어렵다.

3) Inference-time composition

CFG or score composition처럼 inference에서 field를 조합하는 방식은 powerful하다. 하지만 composition이 deployed student 밖에 남는다. Serving cost가 늘고, student 자체가 해당 behavior를 internalize하지 못한다.

4) Off-policy distillation

Teacher trajectory or data state에서 supervision을 주면 student가 자기 rollout에서 방문하는 state와 distribution mismatch가 생긴다. Generation model은 작은 field error가 sampling trajectory 전체에 누적되므로, off-policy mismatch가 특히 중요하다.

DanceOPD는 student rollout state에서 teacher field를 query하는 on-policy direction을 택한다.

2. Core Idea

2-1. Main contribution

DanceOPD의 contribution은 네 가지다.

  1. Generative field distillation
    • Capability를 output image or parameter가 아니라 velocity field로 표현한다.
    • Distillation target은 field direction이다.
  2. Sample-wise hard routing
    • 한 sample은 하나의 capability field에만 배정된다.
    • 여러 field를 같은 sample에서 soft mixing하지 않아 semantic identity를 보존한다.
  3. On-policy low-noise query
    • Teacher field를 student rollout에서 나온 state에 query한다.
    • 특히 semantic information이 concentrated된 low-noise region을 사용한다.
  4. Single-query velocity MSE
    • 한 trajectory에서 많은 timestep을 query하지 않는다.
    • Correlated supervision accumulation을 줄인다.
    • Objective는 simple velocity MSE다.

2-2. Design intuition

DanceOPD의 design은 세 가지 failure diagnosis와 대응된다.

Failure Cause DanceOPD choice
Target-field ambiguity Multiple fields mixed in one sample Hard-routed sample-wise field matching
State-distribution mismatch Teacher/data/off-policy state supervision Query on student rollout state
Trajectory-query correlation Dense queries from same rollout are correlated One low-noise query per sample

이 논문의 직관은 “capability를 평균하지 말고, capability가 의미를 갖는 field identity를 보존하라”다. T2I field, local edit field, global edit field는 같은 state space 위에 있지만 같은 semantic goal을 표현하지 않는다. 따라서 한 sample에서 field direction을 섞으면 어느 capability를 학습하는지 모호해질 수 있다.

3. Architecture / Method

3-1. Overview

Item Description
Goal Multi-capability image generation model distillation
Base formulation Flow matching velocity field
Source model Frozen capability field
Student query state Stop-gradient state from current student rollout
Routing One sample to one field
Query count One semantic-side low-noise query per sample
Loss Plain velocity MSE
Extra field type CFG와 realism field도 흡수 가능
Main settings T2I-editing, local-global editing, realism absorption, CFG absorption

3-2. Module breakdown

1) Capability field

각 source는 velocity field를 정의한다.

\[u_k(x_t,t,c)\]

Student field는 다음과 같다.

\[v_{\theta}(x_t,t,c)\]

Target field $k$로 routed된 sample에 대해 local regression objective는 다음과 같다.

\[\mathcal{L}_{\mathrm{MSE}} = \left\| v_{\theta}(x_t,t,c) - u_k(x_t,t,c) \right\|_2^2\]

논문은 local Gaussian transition 관점에서 KL-style field matching이 weighted MSE로 줄어든다고 설명한다. 실제로는 plain velocity MSE가 잘 작동한다.

2) Hard field routing

Sample은 정확히 하나의 capability field에 route된다.

\[r_i \in \{1,\ldots,K\}\]

Loss는 다음과 같다.

\[\mathcal{L} = \mathbb{E}_{i} \left[ \left\| v_{\theta}(x_i,t_i,c_i) - u_{r_i}(x_i,t_i,c_i) \right\|_2^2 \right]\]

Hard routing은 서로 다른 capability semantics에 해당하는 teacher direction을 평균하는 것을 피한다.

3) Student-induced on-policy state

DanceOPD는 teacher field를 data state나 teacher trajectory에서 query하지 않고, 현재 student rollout에서 나온 state를 사용한다. 이 state에는 stop-gradient를 적용한다. 즉, rollout path를 differentiable하게 통과시키는 것이 아니라 query point로만 취급한다.

개념적으로는 다음과 같다.

\[x_t^{\mathrm{sg}} = \mathrm{stopgrad} \left( \mathrm{Rollout}(v_{\theta}) \right)\]

그 다음 다음 field를 query한다.

\[u_k(x_t^{\mathrm{sg}},t,c)\]

Student는 자신이 실제로 방문하는 state에서 학습한다.

4) Semantic-side low-noise query

논문은 sample마다 semantic side의 low-noise query state 하나를 선택한다. Capability-specific information이 그 영역에 가장 집중되어 있다는 주장이다. Ablation에서도 low-noise query가 median query와 high-noise query보다 좋게 나온다.

이 선택은 중요하다. Early high-noise state는 capability 간 semantic difference를 충분히 드러내지 못할 수 있고, 같은 trajectory에서 dense query를 하면 correlated signal을 과도하게 세게 세는 문제가 생긴다.

5) Guidance field absorption

Classifier-free guidance는 guided velocity field로 쓸 수 있다. Unconditional field와 conditional field가 있으면 guided field를 operator-defined direction으로 표현할 수 있다. DanceOPD는 이것도 하나의 source field처럼 취급해 student에 distill한다.

이 지점이 유용한 이유는 CFG가 보통 inference-time overhead이기 때문이다. Student가 CFG behavior를 흡수하면 deployment가 더 싸거나 단순해질 수 있다.

4. Training / Data / Recipe

4-1. Data and settings

논문은 네 가지 composition/absorption case를 평가한다.

Setting Goal
T2I와 editing composition T2I anchor를 보존하면서 editing을 추가
Local과 global edit composition 두 editing capability type을 결합
Realism-field absorption Base generation을 보존하면서 realism 개선
CFG absorption Guided field를 student에 distill

정확한 dataset과 model은 재현 전에 implementation section에서 다시 확인해야 한다. 핵심 recipe는 새 dataset contribution이 아니라 field-level distillation이다.

4-2. Training objective

Primary training objective는 routed, student-induced low-noise state에서의 velocity MSE다.

Training recipe는 다음처럼 요약할 수 있다.

  1. Data와 capability assignment를 sample한다.
  2. Current student를 rollout한다.
  3. Semantic-side low-noise query state 하나를 선택한다.
  4. 해당 state에서 routed frozen capability field를 query한다.
  5. Velocity MSE로 student를 학습한다.
  6. Capability source 전반에 걸쳐 반복한다.

4-3. Engineering notes

  1. Do not average fields blindly
    • Soft all-teacher mixing은 ambiguous target을 만들 수 있다.
  2. Query where the student actually goes
    • Off-policy state supervision은 rollout error를 고치지 못할 수 있다.
  3. Avoid dense same-trajectory overcounting
    • Query state가 많다고 항상 좋은 것은 아니다.
  4. Low-noise query is a real hyperparameter
    • Capability semantics가 어디에 집중되는지 정하는 지점이다.
  5. CFG can be treated as a field
    • Inference-time guidance를 training-time distillation으로 바꿀 수 있다.
  6. Use anchor capability metrics
    • Target capability만 좋아지고 base T2I가 collapse하면 의미가 없다.

5. Evaluation

5-1. Main reported results

Introduction은 몇 가지 key improvement를 보고한다.

Setting Reported result
T2I와 editing GEditBench +8.1% over best reproduced OPD baseline
T2I와 editing GEditBench +8.5% over edit source
Local과 global edit +16.1% over best competing composition baseline
Local과 global edit +7.9% over local edit source
Realism absorption Realism reward +9.9% over off-policy distillation
Realism absorption Closes 85.3% of student-to-teacher reward gap
CFG absorption Best measured composition +7.6% over train-only absorption
CFG absorption +1.4% over eval-only CFG

논문은 relevant setting에서 T2I anchor quality가 보존되거나 개선된다고도 적는다. Multi-capability composition은 target editing만 개선하고 base generation을 망가뜨리기 쉬우므로 이 점이 중요하다.

5-2. Ablation

Introduction에 보고된 key ablation result는 다음과 같다.

Design choice Result
Hard routing vs soft all-teacher mixing MSE에서 +15.2%, KL에서 +10.6%
Low-noise query vs median query +23.7%
Low-noise query vs high-noise query +19.5%
Dense same-step accumulation drops by 22.8%
SDE-style decorrelation rescue +18.4% but still 8.6% below single-query default
Plain velocity MSE vs weighted variants +2.8% to +4.5%

이 ablation들이 논문의 가장 강한 부분이다. Field ambiguity, state mismatch, trajectory correlation이라는 세 design diagnosis를 직접 뒷받침한다.

5-3. What really matters in the experiments

1) Anchor preservation

Multi-capability training은 new capability를 강화하면서 anchor를 망가뜨리지 않을 때만 유용하다. 논문은 T2I를 보존해야 할 anchor capability로 명시적으로 둔다.

2) Hard routing is not just efficiency

Hard routing은 field identity를 보존한다. 이는 compute decision만이 아니라 semantic decision이다.

3) On-policy state matters

Student는 자신이 방문하는 state에서 학습해야 한다. Error가 trajectory 전체에 누적되는 generative sampling에서는 특히 중요하다.

4) More supervision can be worse

Dense trajectory query는 더 많은 data처럼 보이지만, correlated state는 gradient를 bias할 수 있다. Diffusion/flow distillation에서 유용한 경고다.

6. Limitations

  1. Flow-matching setting에 기반한다
    • Main formulation은 flow-matching velocity field를 대상으로 한다.
    • 다른 generative family로 확장하려면 주의가 필요하다.
  2. Hard routing에는 capability assignment가 필요하다
    • Sample을 field에 route해야 한다.
    • 나쁜 routing은 composition을 해칠 수 있다.
  3. Field source quality가 중요하다
    • Frozen capability field가 supervision을 정의한다.
    • 약하거나 biased된 teacher field는 그대로 distill된다.
  4. Low-noise query는 task-dependent하다
    • Best query time은 capability와 model에 따라 달라질 수 있다.
  5. Metric은 task-specific하다
    • GEditBench, GenEval, realism reward, CFG-related metric은 서로 다른 facet을 포착한다.
    • Aggregate composition quality는 요약하기 어렵다.
  6. Arbitrary capability set에 대한 보장은 없다
    • T2I/editing/realism/CFG는 중요하지만 exhaustive하지 않다.
  7. Diversity loss 가능성이 있다
    • Guidance나 realism field를 흡수하면 sample diversity가 바뀔 수 있다.
    • 별도 분석이 필요하다.
  8. Implementation detail이 중요하다
    • Student rollout, stop-gradient, query time, field source, routing이 모두 outcome에 영향을 준다.
  9. Project release를 확인해야 한다
    • Code와 checkpoint status는 reproducibility에 영향을 줄 수 있다.
  10. Human preference evaluation이 여전히 중요하다
    • Image editing quality는 몇 개 automated metric만으로 완전히 포착되지 않는다.

7. My Take

7-1. Why this matters for my work

DanceOPD의 가장 중요한 포인트는 OPD를 “teacher output을 따라하는 distillation”에서 student-visited generative field를 맞추는 문제로 바꾼 데 있다.

Image generation에서 capability는 text answer처럼 하나의 sequence가 아니다. Sampling state 위의 vector field다. Student가 teacher와 다른 state를 방문한다면 off-policy distillation은 training query point에서는 좋아 보여도 generation 중 실패할 수 있다.

이 framing은 multi-capability generative system에 직접 유용하다.

7-2. Reuse potential

Image editing model training

Local edit, global edit, base T2I를 결합할 때 DanceOPD는 모든 loss를 uniform하게 섞기보다 각 capability field identity를 유지하고 sample을 route하라고 제안한다.

Guidance distillation

CFG나 realism guidance는 field로 흡수할 수 있다. Quality가 유지된다면 inference-time guidance overhead를 줄일 수 있다.

Multi-teacher distillation

여러 teacher behavior를 가진 generative model이라면 hard-routed on-policy field matching은 테스트해볼 만한 recipe다.

Video generation

Video generation에도 같은 문제가 있다. T2V, image-to-video, editing, camera motion, subject preservation은 field conflict와 trajectory correlation이 더 클 수 있다.

7-3. Production considerations

  • Anchor generation metric을 target edit metric과 별도로 추적한다.
  • Visual quality에는 human preference evaluation을 유지한다.
  • Realism이나 CFG absorption 이후 diversity를 검증한다.
  • Capability field별 routing distribution을 audit한다.
  • Base model이나 sampler를 바꾸면 low-noise query time을 다시 확인한다.
  • Dense trajectory supervision이 항상 좋다고 가정하지 않는다.

7-4. Follow-up papers

  • Flow Matching for Generative Modeling
  • Rectified Flow
  • On-Policy Distillation
  • Score Distillation Sampling
  • Classifier-Free Guidance
  • Diffusion model merging과 adapter composition papers
  • Image editing benchmarks such as GEditBench
  • GenEval

8. Summary

  • DanceOPD는 image-generation capability를 velocity field로 해석한다.
  • Sample마다 하나의 routed capability field를 student-visited state에서 distill한다.
  • Sample마다 semantic-side low-noise query 하나를 사용해 trajectory correlation을 피한다.
  • Plain velocity MSE가 핵심 practical objective다.
  • 가장 강한 insight는 multi-capability composition에는 field identity, on-policy state, anti-correlation design이 필요하다는 점이다.

댓글남기기