Abstract
CoT가 LLM의 문제 해결 성능을 높이고, 겉보기에는 설명 가능성을 주는 것처럼 보인다. 하지만 CoT가 실제 모델의 내부 reasoning process를 faithful하게 반영하지 않을 수 있다
기존 연구들은 CoT가 unfaithful할 수 있다는 것을 보여줬지만, 대부분은 mechanism-level 분석이었다. 즉, CoT라는 방식이 전체적으로 문제가 있을 수 있다는 건 보여줬지만 특정 query와 특정 CoT가 주어졌을 때, 이 CoT가 faithful한지 판단하는 문제는 충분히 다루지 않았다.
Introduction
이 reasoning step들이 진짜 모델의 internal decision process를 반영하는가?
아니면 instruction에 맞춰 그럴듯하게 보이도록 만든 표면적 설명인가?
- 기존 연구들의 평가 방식방법 의미
⇒ 대부분 aggregate evidence(모델 전체적으로 CoT faithfulness 평가)이며 개별 CoT 하나에 대해 faithfulness를 판단하는 표준 benchmark 부족Counterfactual-based CoT를 자르거나, 실수를 넣거나, step을 제거해서 답이 바뀌는지 봄 Logit-based token-level logit이나 information gain으로 CoT와 답의 관계를 봄 LLM-as-Judge 더 강한 LLM에게 CoT가 faithful한지 판단하게 함
Instance-level CoT Unfaithfulness Detection
이 논문은 CoT faithfulness를 binary classification problem으로 정의함(입력은 query + CoT, 출력은 faithful or unfaithful 0,1) ⇒ 모델이 문제를 받고 CoT를 생성했을 때 그 CoT가 모델의 실제 reasoning을 faithful하게 반영했는가를 판단하며 이를 논문에서는 instance-level CoT unfaithfulness detection 이라고 함
Challenge(어려운 이유)
- Ground truth가 없다
- ⇒ 모델의 실제 internal reasoning path는 보이지 않음. 즉, 우리는 입력, 출력(CoT), 최종 답 이기 때문에 모델 내부에서 진짜 어떤 과정으로 답을 냈는지 직접 확인 할 수 없다.
- 평가 방법이 아직 불완전함
⇒ CoT가 faithful한지 판단하려면, 관찰 가능한 단서로 추정해야 하지만 기존 방법들이 정말 instance-level에서 잘 작동하는지는 불확실하기 때문에 논문은 benchmark가 필요하다고 말함
FINE-CoT Dataset
구성 설명
| Query | 문제 |
| Generated CoT + Answer | 모델이 생성한 CoT와 최종 답 |
| Annotation | faithful 여부, unfaithful reason, 문제 step evidence |
Dataset Domain
| LogiQA | logic |
| TruthfulQA | factual reasoning |
| AQuA | mathematics |
| HLE-Bio | biology / biomedical knowledge |
- 3개의 instance, 4개의 domain, 4개의 모델을 사용했다
Two Reasons for Unfaithful CoT
- Post-hoc Reasoning ⇒ 답을 이미 정하고 그 답을 정당화 하기 위해 CoT를 사후 합리화
- Spurious Reasoning Chain ⇒ 겉으로는 그럴듯 하지만 질문이나 최종 답과 진짜 logical connection이 약한 경우
Fine-grained principles
이 논문에서는 unfaithful 유형을 8개의 세부 유형으로 나눈다
- Post-hoc Reasoning
- Selective Explanation Bias : 답에 유리한 근거만 골라 설명
- Lack of Post-Answer Analysis : 답 이후 충분한 검증 없음
- Revision of Prior Conclusions : 앞에서 내린 결론을 나중에 슬쩍 바꿈
- Confidence without Substantive Justification : 근거 없이 확신함
- Spurious Reasoning Chain
- Step Skipping : 중요한 reasoning step 건너뜀
- Omission of Clear Justification : 명확한 근거를 생략
- Weak Relevance of Justification : 근거가 최종 답과 약하게만 관련됨
- Post-Answer Weakening : 답을 낸 뒤 reasoning이 약해짐
⇒ 이 논문에서는 unfaithful을 세세하게 정의 하여 어디서 어떤 이유로 unfaithful한지, 어떤 strp이 문제인지까지 확인함
Human Annotation Procedure
단계 설명
| Round I | 각 annotator가 독립적으로 faithful 여부, confidence, reason, key step labeling |
| Round II | disagreement나 low-confidence case를 토론으로 해결 |
| Round III | refined taxonomy 기준으로 다시 cross-check |
즉 자동으로 label을 붙인 것이 아니라 전문가들이 CoT를 보고 이게 왜 unfaithful 하고 어느 step이 문제인지 직접 판단한 dataset 을 만들었음
Empirical Observations
- Observation 1. Accuracy와 faithfulness는 완전히 일치하지 않는다
- Observation 2. Correctness와 faithfulness는 instance-level에서 갈라진다유형 의미
Correct-Faithful 답도 맞고 reasoning도 faithful Correct-Unfaithful 답은 맞지만 reasoning은 unfaithful Wrong-Faithful 답은 틀렸지만 reasoning 과정은 투명함 Wrong-Unfaithful 답도 틀리고 reasoning도 unfaithful - Observation 3. 모델이 강해져도 unfaithfulness가 사라지지 않는다
- Observation 4. Task type이 faithfulness에 큰 영향을 준다
- LogicQA, AQuA 같은 logic/math reasoning task에서는 wrong-faithful case가 많이 나타남
- TruthfulQA, HLE-Bio 같은 knowledge-intensive task에서는 wrong-unfaithful case가 더 많음
- Observation 5. Difficulty와 distribution shift가 unfaithfulness를 키운다
Future Work
방향 설명
| Mechanistic tools | causal probing, circuit analysis, hidden-state inspection으로 실제 내부 reasoning과 연결 |
| Training-based strategies | counterfactual regularization, process-level supervision |
| Beyond binary labels | faithful/unfaithful 이분법을 넘어 더 섬세한 평가 |
Conclusion
- CoT unfaithfulness는 널리 나타난다.
- knowledge-intensive domain에서 특히 어렵다.
- stronger model도 unfaithfulness를 완전히 해결하지 못한다.
- 기존 detection method는 아직 충분히 안정적이지 않다.
- apparent transparency와 actual faithfulness 사이에는 큰 gap이 있다.