6 분 소요

0. Introduction

Paper link

PDF link

Code link

LLM logical reasoning에서 흔히 쓰는 방법은 formal logic으로 변환하거나, structured intermediate representation을 만든 뒤 reasoning하게 하는 것이다. 하지만 이런 방식은 자연어의 context nuance를 잃기 쉽고, 여러 sentence를 지나며 현재 무엇이 true인지 계속 업데이트하기 어렵다.

SituW는 이 문제를 cognitive psychology의 situation model theory로 접근한다. 사람은 문장을 순서대로 읽으면서 단순 token sequence가 아니라 현재 상황의 mental model을 만든다. 누가 등장하는지, 어디에서 일어나는지, 시간은 언제인지, 어떤 원인과 의도가 있는지를 계속 갱신한다. 논문은 이 아이디어를 LLM reasoning에 넣어 Situation Working Memory를 만든다.

한 줄 요약: SituW는 logical reasoning을 raw text나 static logical form 위에서만 수행하지 않고, time, space, causality, intention, protagonist로 구성된 situation memory를 동적으로 만들고 이를 inference에 주입해 global consistency를 높이는 방법이다.

이 논문을 지금 볼 가치가 있는 이유는 다음과 같다.

  • LLM reasoning에서 context state를 explicit memory로 관리하는 설계를 보여준다.
  • Formal logic 변환의 rigidity와 raw CoT의 불안정성 사이에 있는 중간 표현을 제안한다.
  • Prompt-based setting과 supervised setting을 모두 다룬다.
  • Logical reasoning benchmark에서 uncertainty 감소와 accuracy 개선을 함께 보고한다.

1. Problem Setting

1-1. Problem definition

논문이 겨냥하는 문제는 multi-step logical reasoning에서 LLM이 coherent global state를 유지하지 못한다는 점이다.

자연어 논리 문제는 단순히 각 sentence를 독립적으로 해석하면 풀리지 않는다. 앞 문장에서 등장한 인물, 장소, 사건, 의도, 원인이 뒤 문장의 의미를 바꾼다. 그런데 LLM은 surface cue에 의존하거나, formal logic 변환 과정에서 중요한 contextual nuance를 잃을 수 있다.

예를 들어 어떤 사람이 elevator를 타고 fifth floor로 갔고, 이후 professor를 만나러 갔다면, 독자는 professor office가 fifth floor에 있을 가능성을 자연스럽게 추론한다. 이런 정보는 명시적 triple이나 first-order logic만으로 깔끔하게 보존되기 어렵다.

1-2. Why previous approaches are insufficient

기존 방식의 한계는 크게 세 가지다.

  1. Formal logic conversion의 brittleness
    • 자연어를 formal logic으로 바꾸는 과정에서 nuance가 빠질 수 있다.
    • Symbolic solver는 입력 logical form이 정확해야 잘 동작한다.
  2. Raw CoT의 state drift
    • CoT는 reasoning trace를 만들지만, 현재 상황 상태를 구조적으로 저장하지 않는다.
    • 긴 premise를 지나면 앞에서 정해진 condition이나 protagonist relation을 잊을 수 있다.
  3. Static representation의 한계
    • 한 번 만든 logical form이 상황 변화나 implicit consequence를 충분히 반영하지 못할 수 있다.

SituW는 이런 문제를 dynamic working memory로 본다. Text를 sentence-by-sentence로 처리하며 situation state를 업데이트하고, 그 state를 final reasoning에 사용한다.

2. Core Idea

2-1. Main contribution

SituW의 핵심은 situation memory를 명시적으로 만들고 reasoning prompt 또는 supervised data에 주입하는 것이다.

Situation memory는 다섯 dimension으로 구성된다.

Component Role
Time 사건의 시간 정보
Space 사건의 장소 정보
Protagonist 관련 인물이나 entity
Causality 무엇이 무엇을 유발했는지
Intention actor의 목적이나 의도

논문은 이를 objective indexing과 subjective indexing으로 나눈다.

  • Objective indexing: time, space, protagonist처럼 sentence에서 비교적 직접 추출 가능한 요소
  • Subjective indexing: causality, intention처럼 해석과 추론이 필요한 요소

2-2. Design intuition

사람의 comprehension은 단순히 문장을 저장하는 것이 아니라 상황을 업데이트하는 과정에 가깝다. SituW는 이 점을 LLM에 명시적으로 준다.

개념적으로 memory는 다음처럼 쓸 수 있다.

\[M = {t, s, p, c, i}\]

여기서 $t$는 time, $s$는 space, $p$는 protagonist, $c$는 causality, $i$는 intention이다. Raw context를 그대로 쓰는 대신, context에서 이 요소를 추출하고, final reasoning 시점에 enriched context로 제공한다.

이 방식의 장점은 해석 가능성이다. Model이 어떤 time, location, protagonist, cause, intention을 사용했는지 사람이 볼 수 있다. 틀렸을 때도 memory extraction이 문제인지, final reasoning이 문제인지 분리할 수 있다.

3. Architecture / Method

3-1. Overview

Item Description
Goal Logical reasoning에서 coherent situation state 유지
Method Situation Working Memory
Memory components Time, space, protagonist, causality, intention
Construction mode Prompt-based and supervised
Reasoning mode Enriched context plus iterative reasoning
Main comparison Standard LLM, CoT, SymbCoT, Logic-LM

3-2. Module breakdown

1) Situation memory construction

SituW는 input context를 sentence 단위로 처리한다. 각 sentence에서 새롭게 등장한 situation element를 추출하고, 기존 memory state를 업데이트한다.

Prompt-based pipeline에서는 LLM이 다음 요소를 직접 추출한다.

  • Time: 언제 일어나는가
  • Space: 어디서 일어나는가
  • Protagonist: 누가 관련되는가
  • Causality: 무엇이 원인인가
  • Intention: 어떤 목적이 있는가

Supervised pipeline에서는 GPT teacher가 sentence-level memory trace를 만들고, final prediction이 ground truth와 맞는 trace만 pseudo-labeled dataset으로 유지한다. 그 다음 open-source LLM을 fine-tuning해 situation memory를 생성하게 한다.

2) Situation reasoning

Memory가 만들어지면 각 component를 natural language statement로 verbalize해 원래 context에 붙인다. 이렇게 enriched context가 만들어지고, 모델은 Plan, Action, Update, Process 형태로 reasoning한다.

이 구조는 formal logic solver와 다르다. Symbolic representation으로 완전히 변환하지 않고, situation cue를 natural language로 보존한다. 그래서 strict formalism보다 유연하지만, raw CoT보다 state를 더 명시적으로 관리한다.

3) Objective and subjective indexing

Objective indexing은 time, space, protagonist처럼 relatively observable한 정보를 다룬다. Subjective indexing은 causality와 intention처럼 해석이 필요한 정보를 다룬다.

논문에서 중요한 결과 중 하나는 objective information만으로는 충분하지 않다는 점이다. Causality와 intention을 함께 넣을 때 큰 성능 향상이 나오며, 둘은 단순히 독립적으로 더해지는 feature가 아니라 서로 보완적으로 작동한다.

4. Training / Data / Recipe

4-1. Data

평가는 prompt-based setting과 supervised setting 모두에서 수행된다.

사용된 logic-oriented dataset은 다음과 같다.

  • PrOntoQA
  • ProofWriter
  • FOLIO
  • LogiQA 2.0 NLI

논문은 closed-source model로 GPT-3.5-turbo와 GPT-4o-mini를 사용하고, supervised setting에서는 Llama-3.1-Instruct, Llama-3.3-Instruct, Mistral-Instruct, Qwen2.5-Instruct 등을 다룬다.

4-2. Training strategy

Prompt-based setting에서는 별도 training 없이 LLM prompt로 situation memory를 구성하고 reasoning한다.

Supervised setting에서는 다음 절차를 사용한다.

  1. Context를 sentence sequence로 분리한다.
  2. GPT teacher가 sentence별 situation-model snippet을 생성한다.
  3. Memory trace와 final answer를 만든다.
  4. Final prediction이 ground truth와 맞는 trace만 pseudo-label로 유지한다.
  5. Open-source LLM을 fine-tune해 situation memory 기반 reasoning을 학습한다.

4-3. Engineering notes

실무적으로 중요한 포인트는 다음과 같다.

  1. Memory extraction과 answer generation을 분리한다
    • 틀렸을 때 어느 단계가 문제인지 debugging하기 쉽다.
  2. Objective와 subjective memory를 모두 본다
    • 장소와 인물만으로는 충분하지 않고, 원인과 의도가 reasoning을 바꾼다.
  3. JSON-style memory output은 검증 가능하다
    • Structured memory를 만들면 human review나 automatic consistency check를 붙이기 쉽다.
  4. Prompt-based와 supervised를 모두 고려할 수 있다
    • 작은 scale에서는 prompt로 시작하고, 반복 task에서는 supervised construction으로 amortize할 수 있다.

5. Evaluation

5-1. Main results

Prompt-based setting에서 SituW는 GPT-3.5-turbo와 GPT-4o-mini 모두에서 Standard, CoT, SymbCoT, Logic-LM baseline보다 높은 평균 accuracy를 보고한다.

Table 2 기준으로 GPT-3.5-turbo에서는 SituW 평균 63.43, GPT-4o-mini에서는 SituW 평균 71.79를 보인다. Supervised setting에서도 FOLIO 기준 vanilla fine-tuning보다 SituW fine-tuning이 여러 backbone에서 큰 absolute gain을 보인다.

LogiQA에서도 standard prompting과 CoT prompting 모두에서 SituW를 붙였을 때 accuracy가 개선된다. 논문은 uncertainty prediction이 줄어드는 qualitative result도 제시한다.

5-2. What really matters in the experiments

이 논문에서 중요한 실험 해석은 세 가지다.

  1. Accuracy보다 state consistency가 핵심이다
    • SituW는 단순히 더 긴 prompt가 아니라, 현재 상황의 global state를 유지하는 장치다.
  2. Objective plus subjective가 함께 필요하다
    • Ablation에서 objective만 쓰는 것보다 causality와 intention을 함께 쓸 때 성능이 크게 오른다.
  3. Prompt-based and supervised both matter
    • Prompt-based는 바로 적용 가능하다.
    • Supervised는 반복적인 logic domain에서 memory construction을 모델에 내재화할 수 있다.

6. Limitations

  1. Memory extraction 오류 가능성
    • Situation memory가 틀리면 final reasoning도 틀릴 수 있다.
  2. Cost overhead
    • Sentence-by-sentence memory construction은 token cost와 latency를 늘린다.
  3. Cognitive model의 단순화
    • Situation model theory를 다섯 dimension으로 단순화한 것이 모든 reasoning task에 충분하다고 보기는 어렵다.
  4. Dataset scope
    • Logic-oriented benchmark에서의 개선이 open-ended agent reasoning이나 document QA로 바로 이어진다고 단정할 수 없다.
  5. Evaluation leakage 주의
    • Supervised pseudo-label 생성과 filtering 과정에서 dataset split과 teacher behavior를 세밀하게 확인해야 한다.

7. My Take

7-1. Why this matters for my work

이 논문은 LLM memory를 retrieval memory가 아니라 working memory로 보는 점이 흥미롭다. 많은 RAG나 long-context workflow는 evidence를 많이 넣는 데 집중한다. 하지만 reasoning이 필요한 경우에는 evidence를 넣는 것만큼 현재 situation state가 무엇인가를 유지하는 것이 중요하다.

Document AI에서도 비슷한 문제가 있다. 계약서, 규정, 실험 protocol, troubleshooting log를 읽을 때 time, actor, condition, intention, causality를 계속 업데이트해야 한다. SituW는 이런 구조를 prompt나 fine-tuning data로 만들 수 있는 하나의 template를 제공한다.

7-2. Reuse potential

재사용 가능한 포인트는 다음과 같다.

  1. Situation memory schema
    • Time, space, protagonist, causality, intention을 structured memory field로 둔다.
  2. Sentence-level incremental update
    • 긴 문서를 한 번에 요약하지 않고, sentence 또는 paragraph 단위로 memory를 업데이트한다.
  3. Memory-grounded reasoning prompt
    • Final answer를 만들기 전에 extracted memory를 먼저 제시한다.
  4. Ablation-friendly memory design
    • 어떤 memory component가 성능에 기여하는지 따로 평가할 수 있다.
  5. Uncertainty reduction tracking
    • Accuracy뿐 아니라 uncertain label이 줄어드는지도 본다.

7-3. Follow-up papers

  • Situation Model Theory 관련 cognitive psychology 논문
  • Logic-LM
  • SymbCoT
  • ProofWriter
  • PrOntoQA

8. Summary

  • SituW는 logical reasoning에서 LLM이 현재 상황 state를 유지하지 못하는 문제를 다룬다.
  • 핵심은 time, space, protagonist, causality, intention으로 구성된 situation working memory다.
  • Prompt-based construction과 supervised construction을 모두 제안한다.
  • Formal logic보다 유연하고 raw CoT보다 state tracking이 명시적이다.
  • 이 논문은 reasoning system에서 retrieval memory와 별개로 working memory 설계가 필요하다는 점을 보여준다.

댓글남기기