9 분 소요

0. Introduction

Paper link

On-policy distillation, 이하 OPD는 student가 실제로 방문한 state에서 teacher의 token distribution을 받는다는 점 때문에 reasoning post-training에서 자주 등장한다. Offline teacher trajectory를 그대로 모방하는 것보다 student policy의 현재 failure state를 직접 다룰 수 있고, scalar reward보다 훨씬 조밀한 supervision을 제공할 수 있기 때문이다.

하지만 이 논문은 OPD의 가장 기본적인 전제를 다시 묻는다.

Teacher와 student의 log-probability 차이는 모두 transferable capability gap인가?

Teacher distribution도 고정된 진실은 아니다. 의미를 거의 바꾸지 않는 evaluative instruction, 표현 방식, privileged context가 추가되면 teacher의 token likelihood가 움직일 수 있다. 이 변화는 student가 반드시 따라야 할 지식 차이가 아니라 teacher 자체의 self-deviation일 수 있다. 그런데 standard OPD는 이 둘을 구분하지 않고 전체 discrepancy를 학습 신호로 사용한다.

한 줄 요약: Cal-OPD는 teacher-student discrepancy 안에 teacher self-deviation이 섞여 있다고 보고, positive and negative intervention으로 teacher의 허용 가능한 likelihood region을 추정한 뒤 그 범위를 넘어선 discrepancy만 distill하는 calibration framework다.

이 논문을 지금 볼 가치가 있는 이유는 다음과 같음.

  • OPD의 실패를 student trajectory quality만이 아니라 teacher signal reliability 문제로 확장한다.
  • Privileged information이 teacher를 강하게 만드는 동시에 teacher-side shift도 키울 수 있음을 보여준다.
  • Token importance를 별도 predictor로 추정하지 않고 teacher 자체의 counterfactual response를 calibration에 사용한다.
  • Strong student에서는 standard OPD가 성능을 낮출 수 있지만 Cal-OPD는 이를 완화한다.
  • 더 많은 teacher computation을 쓰면서도 shorter rollout 덕분에 전체 training time이 줄어드는 흥미로운 system-level 결과를 제시한다.

1. Problem Setting

1-1. OPD가 사용하는 discrepancy

Input $x$와 student가 생성한 trajectory $y=(y_1,\dots,y_T)$가 있다고 하자. Token $t$에서 teacher와 student가 실제 sampled token $y_t$에 부여한 log-likelihood를 각각 아래처럼 둔다.

\[\ell_t^T = \log \pi_T(y_t \mid x,y_{<t}), \qquad \ell_t^S = \log \pi_S(y_t \mid x,y_{<t})\]

Standard OPD는 이 차이를 teacher가 student보다 해당 token을 얼마나 더 선호하는지 나타내는 dense signal로 사용한다.

\[A_t^{\mathrm{OPD}} = \ell_t^T - \ell_t^S\]

직관은 명확하다. Teacher가 student보다 어떤 token을 훨씬 높게 평가한다면 student는 그 방향으로 이동해야 한다. 문제는 teacher likelihood 자체도 context와 instruction에 민감하다는 점이다.

1-2. Teacher self-deviation

논문은 teacher가 본질적으로 같은 state를 보더라도 task-agnostic intervention에 따라 likelihood를 바꾸는 현상을 teacher self-deviation, 이하 TSD로 정의한다.

예를 들어 다음과 같은 변화가 있을 수 있다.

  • 같은 response prefix에 positive evaluative feedback을 붙인다.
  • 같은 prefix에 negative evaluative feedback을 붙인다.
  • Teacher만 solution-level privileged information을 본다.
  • Answer semantics를 직접 바꾸지 않는 표현 지시를 추가한다.

이때 생기는 teacher likelihood shift가 모두 transferable knowledge는 아니다. 일부는 teacher가 prompt framing에 반응한 결과일 뿐이다.

논문은 standard discrepancy를 아래처럼 해석한다.

\[A_t^{\mathrm{OPD}} = A_t^{\mathrm{Cal}} + A_t^{\mathrm{TSD}}\]

여기서 $A_t^{\mathrm{Cal}}$은 student가 실제로 배워야 할 calibrated discrepancy이고, $A_t^{\mathrm{TSD}}$는 teacher 자체의 허용 가능한 흔들림이다.

1-3. 왜 privileged teacher가 자동으로 더 좋은가

Privileged information은 teacher에게 정답 rationale, hint, evaluation signal을 제공해 더 강한 distribution을 만들 수 있다. 그러나 teacher가 더 강해졌다는 사실과 그 distribution shift가 deployable student에게 transferable하다는 사실은 다르다.

Teacher만 보는 information이 클수록 아래 두 효과가 동시에 커질 수 있다.

  1. 실제 capability advantage
  2. Information asymmetry에 따른 teacher-side shift

두 효과를 분리하지 않으면 student는 useful reasoning보다 teacher prompt condition을 따라가는 데 capacity를 쓸 수 있다. Cal-OPD는 privileged signal을 직접 distill target으로 쓰기보다, teacher가 어느 정도까지 흔들릴 수 있는지 측정하는 probe로 사용한다.

2. Core Idea

2-1. Teacher likelihood를 point가 아니라 region으로 본다

Cal-OPD의 핵심은 teacher likelihood를 단일 정답 값으로 취급하지 않는 것이다. Positive and negative intervention으로 token별 upper and lower deviation을 추정하고, teacher의 plausible likelihood region을 만든다.

Base teacher likelihood를 $\ell_t^T$라고 하고, intervention에서 관찰한 upward and downward deviation 추정치를 각각 $\hat d_t^{\uparrow}$, $\hat d_t^{\downarrow}$라고 하자. Calibration scale을 $\lambda$로 두면 teacher region은 다음과 같다.

\[\hat{\mathcal R}_t^T = [\ell_t^T - \lambda \hat d_t^{\downarrow}, \ell_t^T + \lambda \hat d_t^{\uparrow}] = [L_t^T,U_t^T]\]

Student likelihood가 이 region 안에 있으면 teacher와 student의 차이는 TSD 범위 안에 있다고 본다. 따라서 그 token의 advantage를 0으로 만든다.

2-2. Region 바깥의 discrepancy만 남긴다

Calibrated advantage는 다음처럼 쓸 수 있다.

\[A_t^{\mathrm{Cal}} = [L_t^T-\ell_t^S]_+ - [\ell_t^S-U_t^T]_+\]

여기서 $[z]_+=\max(z,0)$이다.

세 경우로 나누면 더 직관적이다.

Student likelihood 위치 Cal-OPD signal 해석
$\ell_t^S < L_t^T$ Positive Student가 teacher region보다 token을 과소평가함
$L_t^T \le \ell_t^S \le U_t^T$ Zero 차이가 teacher self-deviation 범위 안에 있음
$\ell_t^S > U_t^T$ Negative Student가 teacher region보다 token을 과대평가함

Standard OPD가 point-to-point matching이라면 Cal-OPD는 interval-aware matching이다. Teacher와 정확히 같은 likelihood를 요구하지 않고, teacher behavior가 안정적으로 구분되는 범위만 학습한다.

2-3. Intervention은 supervision이 아니라 측정 장치다

이 논문의 중요한 설계는 intervention output을 student target으로 직접 사용하지 않는다는 점이다.

  • Positive feedback teacher를 새 teacher로 삼지 않는다.
  • Negative feedback distribution을 반대 reward처럼 쓰지 않는다.
  • Privileged solution을 그대로 student input에 넣지 않는다.

Intervention은 teacher likelihood의 sensitivity를 측정하는 장치다. 최종 update는 base teacher와 student discrepancy를 사용하되, 그 discrepancy 중 intervention으로 설명 가능한 부분을 제거한다.

이 분리는 꽤 중요하다. Calibration probe가 잘못 설계되어도 그것이 곧바로 target distribution이 되지는 않는다. 대신 region width가 과도하게 넓거나 좁아지는 형태로 영향을 주기 때문에 failure mode를 더 명시적으로 관찰할 수 있다.

3. Architecture / Method

3-1. Overview

Item Description
Goal Teacher-student discrepancy에서 TSD 성분 제거
Student state Student가 직접 생성한 on-policy trajectory
Teacher query Base condition plus positive and negative intervention
Calibration object Token별 teacher likelihood interval
Update rule Interval 바깥 discrepancy만 advantage로 사용
Extra model 별도 critic이나 token-importance predictor 없음

전체 pipeline은 다음 순서로 볼 수 있다.

  1. Student가 response trajectory를 생성한다.
  2. Base teacher가 같은 prefix에서 sampled token likelihood를 계산한다.
  3. Positive and negative intervention을 준 teacher query로 upward and downward deviation을 추정한다.
  4. Token별 teacher region $[L_t^T,U_t^T]$를 만든다.
  5. Student likelihood가 region 안이면 signal을 제거한다.
  6. Region 바깥의 residual discrepancy만 policy update에 사용한다.

3-2. TSD가 큰 token은 무엇인가

논문의 분석에서 TSD는 token 종류에 따라 균일하지 않다.

  • maybe, however 같은 discourse and surface-form token은 상대적으로 TSD가 크다.
  • Number와 mathematical symbol처럼 solution content에 직접 연결된 token은 상대적으로 TSD가 작다.
  • Correctness polarity가 달라도 일부 token shift는 공통으로 나타난다.

이 결과는 Cal-OPD가 단순 confidence threshold와 다른 이유를 보여준다. Teacher가 낮은 confidence를 보이는 token만 제거하는 것이 아니라, 같은 teacher가 harmless intervention에 얼마나 민감한지를 본다.

3-3. Solution-level intervention의 함정

더 강한 intervention이 항상 더 좋은 calibration을 만드는 것은 아니다. Solution-level privileged information은 teacher distribution을 크게 바꿀 수 있지만, 그 변화 안에는 useful capability signal도 포함될 수 있다.

논문에서는 evaluative feedback 기반 intervention이 가장 좋은 결과를 보이고, solution-level calibration은 useful discrepancy까지 과도하게 제거하는 경향을 보인다. Calibration은 teacher를 최대한 흔드는 것이 아니라, non-transferable self-deviation을 선택적으로 측정해야 한다.

4. Training / Data / Recipe

4-1. Data and model pairs

Training data는 DAPO-17K 기반이며, 강한 Qwen3 model을 이용해 filtering한 math reasoning set을 사용한다. Main comparison은 두 scale pair로 구성된다.

Teacher Student Initial student average
Qwen3-4B-Thinking-2507 Qwen3-1.7B 49.2
Qwen3-30B-A3B-Thinking-2507 Qwen3-4B 66.6

Evaluation은 AMC23, AIME24, AIME25, AIME26, HMMT26, MATH500을 사용하고, 각 setting은 Avg@16으로 집계한다.

4-2. Optimization recipe

논문에 보고된 주요 설정은 다음과 같다.

  • Training framework: verl
  • Training steps: 100
  • Trajectories per step: 256
  • Learning rate: $1\times 10^{-6}$
  • Training maximum response length: 16,384
  • Evaluation maximum response length: 20,480
  • Calibration scale: $\lambda=5$
  • Hardware: 8 H20 GPUs, student와 teacher에 각각 4 GPUs

핵심은 Cal-OPD가 OPD objective 전체를 바꾸는 것이 아니라 advantage construction을 바꾼다는 점이다. 따라서 기존 OPD infrastructure 위에서 teacher query와 interval calibration을 추가하는 형태로 구현할 수 있다.

4-3. Retained discrepancy and trajectory length

Training이 진행될수록 Cal-OPD가 남기는 discrepancy 비율은 약 65%에서 52%로 감소한다. Zero advantage token 비율은 약 27%에서 34%로 증가한다.

이는 student가 teacher와 가까워질수록 작은 discrepancy의 더 많은 부분이 TSD region 안으로 들어간다는 뜻이다. Standard OPD는 이 작은 차이까지 계속 밀어붙일 수 있지만, Cal-OPD는 update를 자동으로 약화한다.

또한 standard OPD에서는 평균 response length가 약 9.8K에서 11.8K로 늘어난 반면, Cal-OPD는 약 9.3K 수준에서 종료된다. 추가 teacher query가 필요하지만 shorter trajectory 덕분에 전체 training은 약 1.26x 빠르게 보고된다.

5. Evaluation

5-1. Main results

핵심 결과는 다음과 같다.

Teacher to student Student Standard OPD Cal-OPD Gain over OPD
4B to 1.7B 49.2 50.8 53.1 +2.3
30B-A3B to 4B 66.6 65.9 69.0 +3.1

첫 번째 setting에서는 standard OPD도 student를 개선하지만 Cal-OPD가 더 높다. 더 중요한 것은 두 번째 setting이다. Initial 4B student가 이미 강한 경우 standard OPD는 66.6에서 65.9로 떨어진다. 반면 Cal-OPD는 69.0으로 올라간다.

이 결과는 OPD의 teacher quality만으로 성능을 설명하기 어렵다는 점을 보여준다. Teacher가 강해도 discrepancy를 모두 따라가면 student가 가진 좋은 policy를 손상할 수 있다.

5-2. Baseline comparison에서 볼 점

비교군에는 standard OPD뿐 아니라 ExOPD, EOPD, Uni-OPD, Privileged-OPD가 포함된다. Cal-OPD는 두 scale setting의 평균에서 가장 높고, 12개 benchmark-model pair 중 7개에서 best를 기록한다.

특히 Privileged-OPD가 가장 약한 결과를 보인다는 점이 중요하다. Privileged context가 teacher prediction을 더 정확하게 만들 수 있어도, 그 distribution을 그대로 따라가는 것은 deployable student에게 좋은 objective가 아닐 수 있다.

5-3. Lambda ablation

$\lambda$는 teacher self-deviation region의 폭을 조절한다.

  • 너무 작으면 standard OPD와 비슷해져 TSD를 충분히 제거하지 못한다.
  • 적절한 값에서는 noisy discrepancy를 줄이면서 useful signal을 유지한다.
  • 너무 크면 region이 넓어져 useful capability gap까지 0으로 만든다.

논문에서는 $\lambda=5$가 가장 좋은 operating point다. 따라서 Cal-OPD는 hyperparameter-free method가 아니며, intervention type과 region scale을 함께 검증해야 한다.

5-4. 이 실험에서 진짜 의미 있는 지표

단순 benchmark average만 보면 Cal-OPD는 더 좋은 OPD variant로 읽힐 수 있다. 하지만 논문의 더 큰 기여는 다음 세 지표를 함께 연결한 데 있다.

  1. Accuracy
    • Calibration이 실제 task performance를 개선하는가.
  2. Retained discrepancy
    • Teacher signal 중 얼마를 useful update로 남기는가.
  3. Response length and wall-clock
    • Calibration이 optimization dynamics와 system cost를 어떻게 바꾸는가.

Teacher query 수가 늘었는데도 wall-clock이 줄었다는 결과는 token-level objective가 generation behavior를 바꾸고, 그 변화가 다시 RL infrastructure cost에 영향을 준다는 점을 보여준다.

6. Limitations

  1. Domain scope가 math reasoning에 집중됨

    TSD가 code, tool use, long-horizon agent, open-ended instruction following에서도 같은 형태로 나타나는지는 추가 검증이 필요하다.

  2. Model family가 Qwen3 중심임

    Teacher와 student가 다른 family일 때 intervention sensitivity와 likelihood calibration scale이 유지되는지 알기 어렵다.

  3. Intervention design 의존성

    Evaluative feedback은 잘 작동하지만 solution-level intervention은 over-filtering을 일으킨다. 어떤 intervention이 task-agnostic TSD만 측정하는지 사전에 보장하기 어렵다.

  4. 추가 teacher computation

    이번 setting에서는 shorter rollout로 비용을 상쇄했지만, output length가 짧거나 teacher serving이 비싼 환경에서는 전체 cost가 증가할 수 있다.

  5. Region estimation은 approximation임

    소수 positive and negative intervention으로 teacher distribution의 모든 self-deviation을 포괄할 수는 없다. Calibration interval이 teacher uncertainty의 완전한 confidence set은 아니다.

  6. Token-local calibration의 한계

    Discourse token 하나의 likelihood shift가 harmless해 보여도 sequence-level planning에서는 중요한 역할을 할 수 있다. Token-level zeroing이 long-range credit assignment와 어떻게 상호작용하는지는 더 분석할 필요가 있다.

7. My Take

7-1. OPD를 teacher reliability 문제로 다시 본다

이 논문의 가장 좋은 포인트는 teacher-student gap을 그대로 truth gap으로 취급하지 않는다는 것이다. 최근 OPD 연구는 student가 어떤 state를 방문하는지, 어떤 divergence를 쓰는지, privileged context를 어떻게 넣는지에 집중해왔다. Cal-OPD는 한 단계 앞에서 teacher signal 자체가 같은 state에서 얼마나 안정적인지를 묻는다.

이 관점은 OPD뿐 아니라 LLM-as-judge reward, process reward model, verifier distillation에도 재사용할 수 있다. Judge가 harmless prompt variation에 따라 score를 크게 바꾼다면, model과 judge의 gap 전체를 optimization target으로 삼아서는 안 된다.

7-2. Confidence calibration과 다른 점

Cal-OPD는 teacher entropy가 높은 token을 제거하는 방식이 아니다. Teacher가 확신하는 token도 prompt framing에 민감할 수 있고, 확신이 낮은 token도 intervention에 안정적일 수 있다.

따라서 중요한 것은 absolute confidence가 아니라 counterfactual stability다.

\[\text{reliability} \neq \text{high confidence}\] \[\text{reliability} \approx \text{stability under irrelevant intervention}\]

이 기준은 model calibration에서 꽤 실용적인 설계 원칙이다.

7-3. 실제 pipeline에서의 재사용 방법

실무적으로는 다음과 같은 형태로 확장할 수 있다.

  • Teacher query를 여러 prompt paraphrase로 실행해 token-level stability region을 만든다.
  • Privileged and non-privileged teacher pair의 공통 deviation을 제거한다.
  • High-cost teacher에는 일부 token이나 trajectory만 intervention query를 수행한다.
  • Sequence-level calibration과 token-level calibration을 함께 사용한다.
  • Calibration region을 adaptive하게 줄여 student가 수렴할수록 teacher query 수를 줄인다.

특히 strong student를 더 강한 teacher로 distill하는 setting에서는 useful gap보다 teacher idiosyncrasy가 상대적으로 커질 수 있다. 이때 Cal-OPD 같은 dead-zone objective가 catastrophic imitation을 줄이는 안전장치가 될 수 있다.

7-4. Follow-up papers

  • DOPD: Dual On-policy Distillation
  • Weak-to-Strong Generalization via Direct On-Policy Distillation
  • Trust Region On-Policy Distillation
  • RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning

이 논문들을 함께 보면 OPD의 최근 흐름을 capability source, state reliability, policy shift, retirement timing이라는 서로 다른 축으로 정리할 수 있다.

8. Summary

  • Standard OPD는 teacher-student likelihood gap 전체를 transferable signal로 사용한다.
  • Cal-OPD는 그 gap 안에 teacher self-deviation이 섞여 있다고 본다.
  • Positive and negative intervention으로 token별 teacher likelihood region을 추정한다.
  • Student가 region 안에 있으면 update를 제거하고, 바깥 residual만 distill한다.
  • Math reasoning에서 standard OPD보다 높은 accuracy와 짧은 trajectory를 동시에 보고한다.

댓글남기기