7 분 소요

0. Introduction

Paper link

Code link

한 줄 요약: 이 논문은 human communication에서 알려진 Uniform Information Density 가설을 LLM reasoning trace에 적용해, 좋은 reasoning이 step-level information flow에서 어떤 패턴을 보이는지 분석한다. 결론은 흥미롭게도, 좋은 LLM reasoning은 local transition은 smooth하지만 trajectory 전체는 global non-uniformity를 갖는다는 것이다.

이 논문을 지금 볼 가치가 있는 이유는 다음과 같음.

  • Reasoning trace quality를 final answer accuracy나 self-confidence가 아니라 information density pattern으로 본다.
  • Step-level entropy와 surprisal 기반 signal이 reasoning failure를 예측하는 데 쓸 수 있는지 분석한다.
  • Human communication의 UID와 LLM reasoning의 objective가 다를 수 있음을 보여준다.
  • Best-of-N selection, verifier, reasoning trace filtering에 사용할 수 있는 internal signal을 제공한다.

이 논문은 “생각이 고르게 이어지면 좋은가”라는 단순한 질문에서 출발한다. 하지만 결론은 단순하지 않다. 사람의 커뮤니케이션에서는 전체적으로 information density를 균일하게 유지하는 것이 좋은 설명일 수 있다. 반면 LLM reasoning에서는 가까운 step 사이의 변화는 부드럽지만, 전체 trajectory는 중요한 구간과 덜 중요한 구간이 구조적으로 나뉘는 편이 더 좋은 결과와 연결된다.

1. Problem Setting

1-1. Problem definition

LLM reasoning 연구에서 자주 보는 평가는 final answer accuracy다. 하지만 reasoning model이 여러 trace를 생성할 수 있을 때, 어떤 trace가 더 믿을 만한지 고르는 것은 여전히 어렵다.

기존에는 다음 signal을 많이 쓴다.

  • self-certainty
  • final answer confidence
  • token entropy
  • majority voting
  • answer consistency
  • verifier score

하지만 이런 signal은 reasoning trace 내부의 흐름을 충분히 보지 못한다. 모델이 중간에 갑자기 큰 information jump를 만들거나, 같은 내용을 반복하거나, 중요한 전환을 abrupt하게 처리하는 경우 final answer만 봐서는 알기 어렵다.

이 논문은 Uniform Information Density, 줄여서 UID를 LLM reasoning trace에 다시 적용한다. 핵심 질문은 다음이다.

  • 좋은 reasoning trace는 step별 information density가 균일한가.
  • Local uniformity와 global uniformity는 같은 방향으로 작동하는가.
  • Entropy-based density signal이 reasoning quality predictor로 쓸 수 있는가.

1-2. Why previous approaches are insufficient

Self-confidence나 low entropy 같은 signal은 final answer 근처의 확신을 보여줄 수 있다. 하지만 reasoning trace가 어떻게 진행되었는지는 충분히 설명하지 못한다.

예를 들어 어떤 trace는 초반에 문제를 잘 분해하고, 중간에 핵심 insight를 만들고, 마지막에 계산을 정리한다. 이 경우 trajectory 전체는 균일하지 않을 수 있다. 중요한 insight 구간은 정보 밀도가 다르고, routine calculation 구간은 정보 밀도가 낮을 수 있다.

반대로 step마다 거의 같은 수준의 entropy를 유지하는 trace가 항상 좋은 것은 아닐 수 있다. 문제 해결은 communication과 다르게, listener에게 일정한 정보량을 전달하는 것이 아니라 solution search를 수행하는 과정이다.

이 논문은 그래서 human communication의 UID를 그대로 가져오지 않고, LLM reasoning에서 local uniformity와 global uniformity를 분리해 본다.

2. Core Idea

2-1. Main contribution

논문의 기여는 세 가지로 정리할 수 있다.

  1. UID 가설을 LLM reasoning trace에 적용한다.
  2. Entropy-based stepwise information density를 정의하고, local uniformity와 global uniformity를 나눠 측정한다.
  3. 좋은 reasoning은 local uniformity와 global non-uniformity를 함께 보인다는 실험 결과를 제시한다.

논문이 제시하는 핵심 구분은 다음과 같다.

Concept Meaning
Local uniformity 인접한 reasoning step 사이의 information density 변화가 smooth한가
Global uniformity 전체 trajectory에서 information density가 고르게 유지되는가
Global non-uniformity 전체 trajectory 안에 구조적 variation이 존재하는가

좋은 LLM reasoning은 인접 step 사이에서는 급격한 spike를 피하지만, 전체적으로는 모든 step이 같은 밀도를 갖지 않는다. 즉 “부드러운 local transition”과 “구조적인 global variation”이 함께 나타난다.

2-2. Design intuition

이 결과는 처음에는 UID와 반대로 보일 수 있다. Human communication에서는 listener의 processing load를 줄이기 위해 전체 utterance의 information density를 비교적 균일하게 유지하는 것이 좋다고 본다.

하지만 LLM reasoning은 communication이 아니라 problem solving이다. Reasoning trace의 목표는 listener에게 일정한 속도로 정보를 전달하는 것이 아니라, search, decomposition, insight, verification을 수행하는 것이다. 따라서 전체 trajectory가 완전히 균일하면 오히려 중요한 전환점이 부족할 수 있다.

이 논문의 intuition을 간단히 쓰면 다음과 같다.

\[quality = local_smoothness + global_structure\]

Local smoothness는 중간 step이 갑자기 튀지 않도록 한다. Global structure는 trace 전체가 문제 해결 과정의 phase를 갖도록 한다. 이 둘을 같이 보는 것이 UID를 LLM reasoning에 적용할 때의 핵심이다.

3. Architecture / Method

3-1. Overview

Item Description
Goal reasoning trace의 information density pattern으로 quality 예측
Main signal entropy 기반 stepwise density
Key metrics local uniformity, global uniformity, global non-uniformity 지표
Target LLM reasoning traces
Usage trace selection, failure prediction, evaluation 보조 signal
Main finding high-quality trace는 local uniformity와 global non-uniformity를 함께 보임

3-2. Module breakdown

1) Step segmentation

먼저 reasoning trace를 step 단위로 나눈다. CoT trace를 하나의 긴 문자열로 보지 않고, step sequence로 보는 것이 출발점이다. 어떤 segmentation rule을 쓰는지는 결과에 영향을 줄 수 있으므로, 실제 재현에서는 이 부분을 꼭 확인해야 한다.

2) Information density estimation

각 step에 대해 entropy-based density를 계산한다. 직관적으로는 해당 step이 얼마나 예측 가능한지, 혹은 얼마나 정보량이 큰지를 보는 것이다. 높은 density spike는 모델이 갑작스러운 전환을 만들거나, 이전 context에서 덜 자연스러운 내용을 내는 상황과 연결될 수 있다.

3) Local and global uniformity

Local uniformity는 인접 step 사이의 변화가 부드러운지를 본다. 좋은 reasoning trace는 step 사이 transition이 갑자기 끊기지 않는다.

Global uniformity는 trace 전체에서 정보 밀도가 얼마나 일정한지를 본다. 논문의 결과에서는 완전한 global uniformity보다 global non-uniformity가 더 좋은 reasoning과 연결된다.

4) Trace selection

이 signal은 여러 reasoning sample 중 더 좋은 trace를 고르는 데 쓸 수 있다. 예를 들어 Best-of-N setting에서 final answer confidence만 보지 않고, UID-inspired metric으로 trace quality를 scoring할 수 있다.

4. Training / Data / Recipe

4-1. Data

논문은 여러 reasoning benchmark에서 실험한다. Abstract에서는 seven reasoning benchmarks를 언급하고, main table에는 AIME2025, BRUMO2025, HMMT2025, MinervaMath가 포함된다. 모델로는 DS-R1-Distill-Qwen-7B, DS-R1-Distill-Llama-8B, Qwen3-8B 등이 사용된다.

4-2. Training strategy

이 논문은 새로운 model training recipe를 제안하기보다, reasoning trace를 평가하고 선택하는 metric을 제안한다. 따라서 핵심 pipeline은 다음과 같다.

  1. 모델에서 여러 reasoning trace를 sampling한다.
  2. 각 trace를 step 단위로 나눈다.
  3. stepwise information density를 계산한다.
  4. local uniformity와 global uniformity 관련 score를 만든다.
  5. score에 따라 trace를 선택하거나 failure risk를 판단한다.
  6. final accuracy와 기존 internal signal 대비 성능을 비교한다.

이 방식은 weight update 없이도 사용할 수 있다. 다만 log probability, entropy, step segmentation이 필요하므로 closed API 환경에서는 제한이 있을 수 있다.

4-3. Engineering notes

실제로 적용하려면 다음을 고려해야 한다.

  • Reasoning trace를 볼 수 있어야 한다.
  • Step segmentation이 안정적이어야 한다.
  • Token log probability나 entropy 접근이 가능해야 한다.
  • 모델별 entropy scale 차이를 normalization해야 한다.
  • Long trace에서는 local score와 global score의 weighting이 중요하다.
  • Majority voting이나 verifier와 complement하게 쓸 수 있는지 봐야 한다.

특히 production setting에서는 CoT를 사용자에게 노출하지 않는 경우가 많다. 이 경우 internal trace를 평가 signal로만 쓰고, final answer에는 노출하지 않는 설계가 필요하다.

5. Evaluation

5-1. Main results

논문은 UID-inspired metric이 self-certainty, high confidence, low entropy 같은 baseline signal보다 reasoning quality prediction에 유용할 수 있음을 보인다.

Main table에서 local uniformity와 global non-uniformity는 여러 math benchmark와 model setting에서 좋은 성능을 보인다. 예를 들어 Qwen3-8B setting에서 AIME2025 mean accuracy는 0.67인데, local uniformity selection은 0.69, global non-uniformity selection은 0.70으로 나타난다. DS-R1-Distill-Qwen-7B에서도 AIME2025에서 local uniformity는 0.53, global non-uniformity는 0.52로 mean accuracy 0.40보다 높다.

Sample size scaling에서도 흥미로운 결과가 나온다. Sample by 10 setting에서 locally uniform traces는 0.72 accuracy까지 올라가고, globally uniform traces는 0.63으로 떨어진다. 논문은 이를 local uniformity와 global non-uniformity의 조합이 작은 sampling budget에서도 효과적이라는 takeaway로 정리한다.

5-2. What really matters in the experiments

이 논문에서 가장 중요한 결과는 “UID가 맞다” 혹은 “UID가 틀리다”가 아니다. 더 정확히는 UID를 LLM reasoning에 적용하려면 scale을 나누어야 한다는 점이다.

  • Local level에서는 uniformity가 좋다.
  • Global level에서는 uniformity보다 structured non-uniformity가 좋다.
  • Correct reasoning trace는 sharp information density spike를 피하는 경향이 있다.
  • Incorrect trace는 irregular burst를 보일 수 있다.

이 관점은 verifier 설계에 유용하다. Verifier가 final answer만 보지 않고 reasoning path의 information flow를 함께 보면, 잘못된 trace를 더 빨리 걸러낼 수 있다.

6. Limitations

  1. Trace access dependency
    • 이 방법은 reasoning trace와 token-level signal 접근이 필요하다. API-only 환경에서는 제한이 클 수 있다.
  2. Step segmentation sensitivity
    • Reasoning step을 어떻게 나누는지에 따라 local uniformity와 global uniformity 값이 달라질 수 있다.
  3. Faithfulness 문제
    • 좋은 UID pattern을 가진 trace가 반드시 faithful reasoning이라는 뜻은 아니다. Trace는 여전히 post-hoc rationalization일 수 있다.
  4. Benchmark domain
    • 수학 reasoning benchmark 중심 결과가 다른 domain reasoning, coding, agent task에도 그대로 적용될지는 추가 실험이 필요하다.
  5. Optimization target risk
    • UID score를 직접 최적화하면 모델이 좋은 reasoning보다 좋은-looking trace pattern을 학습할 위험이 있다.

7. My Take

7-1. Why this matters for my work

이 논문은 reasoning evaluation에서 꽤 실용적인 signal을 준다. LLM reasoning을 평가할 때 final answer만 보는 것은 점점 부족해지고 있다. 특히 여러 trace를 sampling한 뒤 하나를 골라야 하는 상황에서는, 어떤 trace가 더 믿을 만한지 판단하는 internal criterion이 필요하다.

UID signal은 verifier를 대체하기보다, verifier 앞단의 cheap filter로 쓰기 좋다. 즉 여러 candidate reasoning 중 information flow가 너무 불안정한 trace를 먼저 제거하고, 남은 trace에 expensive judge나 symbolic verifier를 붙이는 방식이다.

7-2. Reuse potential

이 아이디어는 다음 작업에 활용할 수 있다.

  • Best-of-N reasoning trace selection에 활용
  • self-consistency voting 전 candidate filtering
  • math reasoning verifier의 auxiliary feature
  • long CoT compression에서 중요한 phase 찾기
  • agent trajectory에서 abrupt transition이나 hallucinated jump 탐지
  • reasoning model post-training의 diagnostic metric

특히 agent trajectory에서도 비슷한 관점이 가능하다. 좋은 agent는 step마다 tool call과 observation을 부드럽게 연결하지만, 전체 trajectory에는 search, evidence gathering, decision, verification phase가 있어야 한다. 이것도 local smoothness와 global structure의 조합으로 볼 수 있다.

7-3. Follow-up papers

  • Self-consistency와 Best-of-N reasoning 논문
  • Self-certainty 기반 trace selection 논문
  • CoT faithfulness evaluation 논문
  • Entropy-based CoT compression 논문
  • Verifier와 process reward model 논문

8. Summary

  • 이 논문은 UID 가설을 LLM reasoning trace에 다시 적용한다.
  • 좋은 reasoning은 local uniformity와 global non-uniformity를 함께 보인다.
  • Entropy-based stepwise density는 reasoning quality selection signal로 쓸 수 있다.
  • Human communication의 UID와 LLM reasoning objective는 다르기 때문에 같은 결론을 기대하면 안 된다.
  • 실무적으로는 Best-of-N selection, verifier feature, reasoning diagnostic에 재사용 가능성이 있다.

댓글남기기