DanceOPD: On-Policy Generative Field Distillation Review
0. Introduction
DanceOPD는 OPD를 language model distillation이 아니라 image generation field composition 문제로 옮긴 논문이다. 이 논문이 다루는 핵심 질문은 단순하다. T2I, local editing, global editing, realism reward, CFG 같은 서로 다른 generation capability를 하나의 flow-matching student 안에 어떻게 합칠 것인가다.
현대 image generation model은 한 가지 능력만 잘하면 부족하다. Text-to-image는 open-ended visual quality and prompt following을 요구한다. Local editing은 source image preservation and precise modification을 요구한다. Global editing은 style, color, layout 같은 넓은 distribution shift를 허용해야 한다. 이 능력들은 서로 자연스럽게 정렬되지 않는다. Editing을 세게 학습하면 T2I 성능이 떨어질 수 있고, local editing and global editing은 보존과 변형의 방향이 충돌할 수 있다.
DanceOPD는 이 문제를 “capability를 parameter space에서 섞는 문제”가 아니라 velocity field를 어떤 student state에서 query할 것인가로 본다. 각 frozen capability source를 shared flow state space 위의 velocity field로 두고, student가 자기 rollout에서 방문한 low-noise semantic-side state를 하나 뽑아 해당 capability field에게 supervision을 받는다. Sample마다 하나의 field만 hard-route하여 target-field ambiguity를 줄이고, dense trajectory supervision은 correlated signal을 과도하게 중복하므로 피한다.
한 줄 요약: DanceOPD는 flow-matching image generator에서 T2I, editing, realism, CFG 같은 capability source를 velocity field로 보고, sample-wise hard routing, student-visited low-noise state query, single-query velocity MSE를 사용해 multi-capability composition을 on-policy field distillation으로 푸는 framework다.
이 논문을 지금 볼 가치가 있는 이유는 다음과 같음.
- OPD를 text token distribution이 아니라 generative velocity field matching으로 일반화한다.
- Multi-capability image model 학습에서 capability conflict를 field ambiguity, state mismatch, trajectory correlation으로 분해한다.
- Plain velocity MSE가 local field distillation objective로 충분하다는 practical recipe를 제시한다.
- CFG and realism reward 같은 operator-defined field도 같은 formulation으로 흡수할 수 있음을 보인다.
- Ablation이 design choice와 성능 변화를 꽤 직접적으로 연결한다.
- Image generation model compression, editing integration, multi-teacher distillation에 재사용할 수 있는 관점을 준다.
이 글에서는 DanceOPD를 “새 image editing model”보다, flow-matching model에서 여러 capability field를 하나의 student에 안전하게 distill하려는 training recipe paper로 읽는다.
1. Problem Setting
1-1. Problem definition
Flow-matching image generation에서 model은 시간 $t$의 noisy state $x_t$와 condition $c$를 받아 velocity field를 예측한다.
\[v_{\theta}(x_t,t,c)\]여러 capability source가 있으면 각각 다른 velocity field를 정의한다.
\[v_1, v_2, \ldots, v_K\]예를 들어:
| Field | What it represents |
|---|---|
| T2I field | Text prompt based image generation |
| Local edit field | Preserve source image while applying local change |
| Global edit field | Broad style or layout transformation |
| Realism field | Reward or critic derived visual realism direction |
| CFG field | Operator-defined guided velocity |
목표는 하나의 student $v_{\theta}$가 이 capability들을 적절히 내재화하게 하는 것이다.
Naive solution은 capability data를 섞거나, 여러 teacher outputs를 평균하거나, parameter merging을 시도하는 것이다. 하지만 field level에서는 문제가 생긴다.
- 서로 다른 capability field가 같은 sample에서 다른 direction을 제시할 수 있다.
- Off-policy state에서 teacher field를 query하면 student가 실제 inference에서 방문하는 state와 다르다.
- 한 rollout의 여러 timestep에서 dense query를 하면 correlated gradient를 과도하게 쌓을 수 있다.
DanceOPD의 problem setting은 이 세 문제를 동시에 줄이는 것이다.
1-2. Why previous approaches are insufficient
1) Data mixing and joint training
Data mixing은 가장 단순하다. T2I, local edit, global edit data를 섞고 하나의 model을 학습한다. 하지만 capability-specific objective가 충돌하면 평균적인 compromise solution이 될 수 있다.
특히 local editing은 preservation을 요구하고, global editing은 transformation을 요구한다. 같은 parameter가 두 목표를 동시에 만족하려 하면 특정 capability가 약해질 수 있다.
2) Parameter merging and adapter composition
Fine-tuned model or adapter를 합치는 방법은 cheap한 composition을 제공한다. 그러나 field-level behavior를 보장하지 않는다. Parameter interpolation은 velocity field interpolation과 같지 않고, semantic state에 따라 어떤 capability가 active해야 하는지 명시하기 어렵다.
3) Inference-time composition
CFG or score composition처럼 inference에서 field를 조합하는 방식은 powerful하다. 하지만 composition이 deployed student 밖에 남는다. Serving cost가 늘고, student 자체가 해당 behavior를 internalize하지 못한다.
4) Off-policy distillation
Teacher trajectory or data state에서 supervision을 주면 student가 자기 rollout에서 방문하는 state와 distribution mismatch가 생긴다. Generation model은 작은 field error가 sampling trajectory 전체에 누적되므로, off-policy mismatch가 특히 중요하다.
DanceOPD는 student rollout state에서 teacher field를 query하는 on-policy direction을 택한다.
2. Core Idea
2-1. Main contribution
DanceOPD의 contribution은 네 가지다.
- Generative field distillation
- Capability를 output image or parameter가 아니라 velocity field로 표현한다.
- Distillation target은 field direction이다.
- Sample-wise hard routing
- 한 sample은 하나의 capability field에만 배정된다.
- 여러 field를 같은 sample에서 soft mixing하지 않아 semantic identity를 보존한다.
- On-policy low-noise query
- Teacher field를 student rollout에서 나온 state에 query한다.
- 특히 semantic information이 concentrated된 low-noise region을 사용한다.
- Single-query velocity MSE
- 한 trajectory에서 많은 timestep을 query하지 않는다.
- Correlated supervision accumulation을 줄인다.
- Objective는 simple velocity MSE다.
2-2. Design intuition
DanceOPD의 design은 세 가지 failure diagnosis와 대응된다.
| Failure | Cause | DanceOPD choice |
|---|---|---|
| Target-field ambiguity | Multiple fields mixed in one sample | Hard-routed sample-wise field matching |
| State-distribution mismatch | Teacher/data/off-policy state supervision | Query on student rollout state |
| Trajectory-query correlation | Dense queries from same rollout are correlated | One low-noise query per sample |
이 논문의 직관은 “capability를 평균하지 말고, capability가 의미를 갖는 field identity를 보존하라”다. T2I field, local edit field, global edit field는 같은 state space 위에 있지만 같은 semantic goal을 표현하지 않는다. 따라서 한 sample에서 field direction을 섞으면 어느 capability를 학습하는지 모호해질 수 있다.
3. Architecture / Method
3-1. Overview
| Item | Description |
|---|---|
| Goal | Multi-capability image generation model distillation |
| Base formulation | Flow matching velocity field |
| Source model | Frozen capability field |
| Student query state | Stop-gradient state from current student rollout |
| Routing | One sample to one field |
| Query count | One semantic-side low-noise query per sample |
| Loss | Plain velocity MSE |
| Extra field type | CFG와 realism field도 흡수 가능 |
| Main settings | T2I-editing, local-global editing, realism absorption, CFG absorption |
3-2. Module breakdown
1) Capability field
각 source는 velocity field를 정의한다.
\[u_k(x_t,t,c)\]Student field는 다음과 같다.
\[v_{\theta}(x_t,t,c)\]Target field $k$로 routed된 sample에 대해 local regression objective는 다음과 같다.
\[\mathcal{L}_{\mathrm{MSE}} = \left\| v_{\theta}(x_t,t,c) - u_k(x_t,t,c) \right\|_2^2\]논문은 local Gaussian transition 관점에서 KL-style field matching이 weighted MSE로 줄어든다고 설명한다. 실제로는 plain velocity MSE가 잘 작동한다.
2) Hard field routing
Sample은 정확히 하나의 capability field에 route된다.
\[r_i \in \{1,\ldots,K\}\]Loss는 다음과 같다.
\[\mathcal{L} = \mathbb{E}_{i} \left[ \left\| v_{\theta}(x_i,t_i,c_i) - u_{r_i}(x_i,t_i,c_i) \right\|_2^2 \right]\]Hard routing은 서로 다른 capability semantics에 해당하는 teacher direction을 평균하는 것을 피한다.
3) Student-induced on-policy state
DanceOPD는 teacher field를 data state나 teacher trajectory에서 query하지 않고, 현재 student rollout에서 나온 state를 사용한다. 이 state에는 stop-gradient를 적용한다. 즉, rollout path를 differentiable하게 통과시키는 것이 아니라 query point로만 취급한다.
개념적으로는 다음과 같다.
\[x_t^{\mathrm{sg}} = \mathrm{stopgrad} \left( \mathrm{Rollout}(v_{\theta}) \right)\]그 다음 다음 field를 query한다.
\[u_k(x_t^{\mathrm{sg}},t,c)\]Student는 자신이 실제로 방문하는 state에서 학습한다.
4) Semantic-side low-noise query
논문은 sample마다 semantic side의 low-noise query state 하나를 선택한다. Capability-specific information이 그 영역에 가장 집중되어 있다는 주장이다. Ablation에서도 low-noise query가 median query와 high-noise query보다 좋게 나온다.
이 선택은 중요하다. Early high-noise state는 capability 간 semantic difference를 충분히 드러내지 못할 수 있고, 같은 trajectory에서 dense query를 하면 correlated signal을 과도하게 세게 세는 문제가 생긴다.
5) Guidance field absorption
Classifier-free guidance는 guided velocity field로 쓸 수 있다. Unconditional field와 conditional field가 있으면 guided field를 operator-defined direction으로 표현할 수 있다. DanceOPD는 이것도 하나의 source field처럼 취급해 student에 distill한다.
이 지점이 유용한 이유는 CFG가 보통 inference-time overhead이기 때문이다. Student가 CFG behavior를 흡수하면 deployment가 더 싸거나 단순해질 수 있다.
4. Training / Data / Recipe
4-1. Data and settings
논문은 네 가지 composition/absorption case를 평가한다.
| Setting | Goal |
|---|---|
| T2I와 editing composition | T2I anchor를 보존하면서 editing을 추가 |
| Local과 global edit composition | 두 editing capability type을 결합 |
| Realism-field absorption | Base generation을 보존하면서 realism 개선 |
| CFG absorption | Guided field를 student에 distill |
정확한 dataset과 model은 재현 전에 implementation section에서 다시 확인해야 한다. 핵심 recipe는 새 dataset contribution이 아니라 field-level distillation이다.
4-2. Training objective
Primary training objective는 routed, student-induced low-noise state에서의 velocity MSE다.
Training recipe는 다음처럼 요약할 수 있다.
- Data와 capability assignment를 sample한다.
- Current student를 rollout한다.
- Semantic-side low-noise query state 하나를 선택한다.
- 해당 state에서 routed frozen capability field를 query한다.
- Velocity MSE로 student를 학습한다.
- Capability source 전반에 걸쳐 반복한다.
4-3. Engineering notes
- Do not average fields blindly
- Soft all-teacher mixing은 ambiguous target을 만들 수 있다.
- Query where the student actually goes
- Off-policy state supervision은 rollout error를 고치지 못할 수 있다.
- Avoid dense same-trajectory overcounting
- Query state가 많다고 항상 좋은 것은 아니다.
- Low-noise query is a real hyperparameter
- Capability semantics가 어디에 집중되는지 정하는 지점이다.
- CFG can be treated as a field
- Inference-time guidance를 training-time distillation으로 바꿀 수 있다.
- Use anchor capability metrics
- Target capability만 좋아지고 base T2I가 collapse하면 의미가 없다.
5. Evaluation
5-1. Main reported results
Introduction은 몇 가지 key improvement를 보고한다.
| Setting | Reported result |
|---|---|
| T2I와 editing | GEditBench +8.1% over best reproduced OPD baseline |
| T2I와 editing | GEditBench +8.5% over edit source |
| Local과 global edit | +16.1% over best competing composition baseline |
| Local과 global edit | +7.9% over local edit source |
| Realism absorption | Realism reward +9.9% over off-policy distillation |
| Realism absorption | Closes 85.3% of student-to-teacher reward gap |
| CFG absorption | Best measured composition +7.6% over train-only absorption |
| CFG absorption | +1.4% over eval-only CFG |
논문은 relevant setting에서 T2I anchor quality가 보존되거나 개선된다고도 적는다. Multi-capability composition은 target editing만 개선하고 base generation을 망가뜨리기 쉬우므로 이 점이 중요하다.
5-2. Ablation
Introduction에 보고된 key ablation result는 다음과 같다.
| Design choice | Result |
|---|---|
| Hard routing vs soft all-teacher mixing | MSE에서 +15.2%, KL에서 +10.6% |
| Low-noise query vs median query | +23.7% |
| Low-noise query vs high-noise query | +19.5% |
| Dense same-step accumulation | drops by 22.8% |
| SDE-style decorrelation rescue | +18.4% but still 8.6% below single-query default |
| Plain velocity MSE vs weighted variants | +2.8% to +4.5% |
이 ablation들이 논문의 가장 강한 부분이다. Field ambiguity, state mismatch, trajectory correlation이라는 세 design diagnosis를 직접 뒷받침한다.
5-3. What really matters in the experiments
1) Anchor preservation
Multi-capability training은 new capability를 강화하면서 anchor를 망가뜨리지 않을 때만 유용하다. 논문은 T2I를 보존해야 할 anchor capability로 명시적으로 둔다.
2) Hard routing is not just efficiency
Hard routing은 field identity를 보존한다. 이는 compute decision만이 아니라 semantic decision이다.
3) On-policy state matters
Student는 자신이 방문하는 state에서 학습해야 한다. Error가 trajectory 전체에 누적되는 generative sampling에서는 특히 중요하다.
4) More supervision can be worse
Dense trajectory query는 더 많은 data처럼 보이지만, correlated state는 gradient를 bias할 수 있다. Diffusion/flow distillation에서 유용한 경고다.
6. Limitations
- Flow-matching setting에 기반한다
- Main formulation은 flow-matching velocity field를 대상으로 한다.
- 다른 generative family로 확장하려면 주의가 필요하다.
- Hard routing에는 capability assignment가 필요하다
- Sample을 field에 route해야 한다.
- 나쁜 routing은 composition을 해칠 수 있다.
- Field source quality가 중요하다
- Frozen capability field가 supervision을 정의한다.
- 약하거나 biased된 teacher field는 그대로 distill된다.
- Low-noise query는 task-dependent하다
- Best query time은 capability와 model에 따라 달라질 수 있다.
- Metric은 task-specific하다
- GEditBench, GenEval, realism reward, CFG-related metric은 서로 다른 facet을 포착한다.
- Aggregate composition quality는 요약하기 어렵다.
- Arbitrary capability set에 대한 보장은 없다
- T2I/editing/realism/CFG는 중요하지만 exhaustive하지 않다.
- Diversity loss 가능성이 있다
- Guidance나 realism field를 흡수하면 sample diversity가 바뀔 수 있다.
- 별도 분석이 필요하다.
- Implementation detail이 중요하다
- Student rollout, stop-gradient, query time, field source, routing이 모두 outcome에 영향을 준다.
- Project release를 확인해야 한다
- Code와 checkpoint status는 reproducibility에 영향을 줄 수 있다.
- Human preference evaluation이 여전히 중요하다
- Image editing quality는 몇 개 automated metric만으로 완전히 포착되지 않는다.
7. My Take
7-1. Why this matters for my work
DanceOPD의 가장 중요한 포인트는 OPD를 “teacher output을 따라하는 distillation”에서 student-visited generative field를 맞추는 문제로 바꾼 데 있다.
Image generation에서 capability는 text answer처럼 하나의 sequence가 아니다. Sampling state 위의 vector field다. Student가 teacher와 다른 state를 방문한다면 off-policy distillation은 training query point에서는 좋아 보여도 generation 중 실패할 수 있다.
이 framing은 multi-capability generative system에 직접 유용하다.
7-2. Reuse potential
Image editing model training
Local edit, global edit, base T2I를 결합할 때 DanceOPD는 모든 loss를 uniform하게 섞기보다 각 capability field identity를 유지하고 sample을 route하라고 제안한다.
Guidance distillation
CFG나 realism guidance는 field로 흡수할 수 있다. Quality가 유지된다면 inference-time guidance overhead를 줄일 수 있다.
Multi-teacher distillation
여러 teacher behavior를 가진 generative model이라면 hard-routed on-policy field matching은 테스트해볼 만한 recipe다.
Video generation
Video generation에도 같은 문제가 있다. T2V, image-to-video, editing, camera motion, subject preservation은 field conflict와 trajectory correlation이 더 클 수 있다.
7-3. Production considerations
- Anchor generation metric을 target edit metric과 별도로 추적한다.
- Visual quality에는 human preference evaluation을 유지한다.
- Realism이나 CFG absorption 이후 diversity를 검증한다.
- Capability field별 routing distribution을 audit한다.
- Base model이나 sampler를 바꾸면 low-noise query time을 다시 확인한다.
- Dense trajectory supervision이 항상 좋다고 가정하지 않는다.
7-4. Follow-up papers
- Flow Matching for Generative Modeling
- Rectified Flow
- On-Policy Distillation
- Score Distillation Sampling
- Classifier-Free Guidance
- Diffusion model merging과 adapter composition papers
- Image editing benchmarks such as GEditBench
- GenEval
8. Summary
- DanceOPD는 image-generation capability를 velocity field로 해석한다.
- Sample마다 하나의 routed capability field를 student-visited state에서 distill한다.
- Sample마다 semantic-side low-noise query 하나를 사용해 trajectory correlation을 피한다.
- Plain velocity MSE가 핵심 practical objective다.
- 가장 강한 insight는 multi-capability composition에는 field identity, on-policy state, anti-correlation design이 필요하다는 점이다.
댓글남기기