CoT 연구

FAITHCOT-BENCH: BENCHMARKING INSTANCELEVEL FAITHFULNESS OF CHAIN-OF-THOUGHT REASONING [논문 리뷰]

seungbye 2026. 7. 8. 22:15

Abstract

CoT가 LLM의 문제 해결 성능을 높이고, 겉보기에는 설명 가능성을 주는 것처럼 보인다. 하지만 CoT가 실제 모델의 내부 reasoning process를 faithful하게 반영하지 않을 수 있다
기존 연구들은 CoT가 unfaithful할 수 있다는 것을 보여줬지만, 대부분은 mechanism-level 분석이었다. 즉, CoT라는 방식이 전체적으로 문제가 있을 수 있다는 건 보여줬지만 특정 query와 특정 CoT가 주어졌을 때, 이 CoT가 faithful한지 판단하는 문제는 충분히 다루지 않았다.

Introduction

이 reasoning step들이 진짜 모델의 internal decision process를 반영하는가?

아니면 instruction에 맞춰 그럴듯하게 보이도록 만든 표면적 설명인가?

  • 기존 연구들의 평가 방식방법 의미
    Counterfactual-based CoT를 자르거나, 실수를 넣거나, step을 제거해서 답이 바뀌는지 봄
    Logit-based token-level logit이나 information gain으로 CoT와 답의 관계를 봄
    LLM-as-Judge 더 강한 LLM에게 CoT가 faithful한지 판단하게 함
    ⇒ 대부분 aggregate evidence(모델 전체적으로 CoT faithfulness 평가)이며 개별 CoT 하나에 대해 faithfulness를 판단하는 표준 benchmark 부족

Instance-level CoT Unfaithfulness Detection

이 논문은 CoT faithfulness를 binary classification problem으로 정의함(입력은 query + CoT, 출력은 faithful or unfaithful 0,1) ⇒ 모델이 문제를 받고 CoT를 생성했을 때 그 CoT가 모델의 실제 reasoning을 faithful하게 반영했는가를 판단하며 이를 논문에서는 instance-level CoT unfaithfulness detection 이라고 함

Challenge(어려운 이유)

  1. Ground truth가 없다
  2. ⇒ 모델의 실제 internal reasoning path는 보이지 않음. 즉, 우리는 입력, 출력(CoT), 최종 답 이기 때문에 모델 내부에서 진짜 어떤 과정으로 답을 냈는지 직접 확인 할 수 없다.
  3. 평가 방법이 아직 불완전함
    ⇒ CoT가 faithful한지 판단하려면, 관찰 가능한 단서로 추정해야 하지만 기존 방법들이 정말 instance-level에서 잘 작동하는지는 불확실하기 때문에 논문은 benchmark가 필요하다고 말함

FINE-CoT Dataset

구성 설명

Query 문제
Generated CoT + Answer 모델이 생성한 CoT와 최종 답
Annotation faithful 여부, unfaithful reason, 문제 step evidence

Dataset Domain

LogiQA logic
TruthfulQA factual reasoning
AQuA mathematics
HLE-Bio biology / biomedical knowledge
  • 3개의 instance, 4개의 domain, 4개의 모델을 사용했다

Two Reasons for Unfaithful CoT

  1. Post-hoc Reasoning ⇒ 답을 이미 정하고 그 답을 정당화 하기 위해 CoT를 사후 합리화
  2. Spurious Reasoning Chain ⇒ 겉으로는 그럴듯 하지만 질문이나 최종 답과 진짜 logical connection이 약한 경우

Fine-grained principles

이 논문에서는 unfaithful 유형을 8개의 세부 유형으로 나눈다

  • Post-hoc Reasoning
    • Selective Explanation Bias : 답에 유리한 근거만 골라 설명
    • Lack of Post-Answer Analysis : 답 이후 충분한 검증 없음
    • Revision of Prior Conclusions : 앞에서 내린 결론을 나중에 슬쩍 바꿈
    • Confidence without Substantive Justification : 근거 없이 확신함
  • Spurious Reasoning Chain
    • Step Skipping : 중요한 reasoning step 건너뜀
    • Omission of Clear Justification : 명확한 근거를 생략
    • Weak Relevance of Justification : 근거가 최종 답과 약하게만 관련됨
    • Post-Answer Weakening : 답을 낸 뒤 reasoning이 약해짐

⇒ 이 논문에서는 unfaithful을 세세하게 정의 하여 어디서 어떤 이유로 unfaithful한지, 어떤 strp이 문제인지까지 확인함

Human Annotation Procedure

단계 설명

Round I 각 annotator가 독립적으로 faithful 여부, confidence, reason, key step labeling
Round II disagreement나 low-confidence case를 토론으로 해결
Round III refined taxonomy 기준으로 다시 cross-check

즉 자동으로 label을 붙인 것이 아니라 전문가들이 CoT를 보고 이게 왜 unfaithful 하고 어느 step이 문제인지 직접 판단한 dataset 을 만들었음

Empirical Observations

  • Observation 1. Accuracy와 faithfulness는 완전히 일치하지 않는다
  • Observation 2. Correctness와 faithfulness는 instance-level에서 갈라진다유형 의미
    Correct-Faithful 답도 맞고 reasoning도 faithful
    Correct-Unfaithful 답은 맞지만 reasoning은 unfaithful
    Wrong-Faithful 답은 틀렸지만 reasoning 과정은 투명함
    Wrong-Unfaithful 답도 틀리고 reasoning도 unfaithful
  • Observation 3. 모델이 강해져도 unfaithfulness가 사라지지 않는다
  • Observation 4. Task type이 faithfulness에 큰 영향을 준다
    • LogicQA, AQuA 같은 logic/math reasoning task에서는 wrong-faithful case가 많이 나타남
    • TruthfulQA, HLE-Bio 같은 knowledge-intensive task에서는 wrong-unfaithful case가 더 많음
  • Observation 5. Difficulty와 distribution shift가 unfaithfulness를 키운다

Future Work

방향 설명

Mechanistic tools causal probing, circuit analysis, hidden-state inspection으로 실제 내부 reasoning과 연결
Training-based strategies counterfactual regularization, process-level supervision
Beyond binary labels faithful/unfaithful 이분법을 넘어 더 섬세한 평가

Conclusion

  • CoT unfaithfulness는 널리 나타난다.
  • knowledge-intensive domain에서 특히 어렵다.
  • stronger model도 unfaithfulness를 완전히 해결하지 못한다.
  • 기존 detection method는 아직 충분히 안정적이지 않다.
  • apparent transparency와 actual faithfulness 사이에는 큰 gap이 있다.