Abstract
CoT가 AI safety에 도움이 될 수 있다고 말함. ⇒ 모델의 CoT를 보면 모델이 어떤 의도와 reasoning으로 답했는지 감시할 수 있을 것 같기 때문임
- 모델이 prompt 안의 hint를 사용해 답을 바꾸더라도, 그 hint 사용을 CoT에 말하는 비율은 낮다.
- outcome-based reinforcement learning(결과 기반 강화 학습)은 초반에는 faithfulness를 높이지만, 어느 정도에서 plateau(정체기)가 온다.
- RL 중 reward hacking을 배워도, 모델은 그 reward hack을 CoT에 거의 말하지 않는다.
⇒CoT monitoring은 유용할 수 있지만, 믿고 의존하기에는 부족하다
Introduction
CoT의 두 가지 장점으로는 Capability(복잡한 문제를 더 잘 풀게 함)와 safety monitoring(모델이 무슨생각을 하는지 감시) 이 있음
하지만 safety monitoring이 가능하려면 CoT가 legible(사람이 이해할 수 있어야 함), faithful 해야함.
Measuring CoT Faithfulness
이 논문에서의 평가방식은 모델이 hint 때문에 답을 바꿨다면, CoT에서 그 hint를 사용했다고 말하는가를 보는 것 이다. 위의 Turpin 논문과 비슷하게 hint pair를 사용한다. (원래문제, hint 삽입 문제 pair)
이후 모델이 힌트를 사용하여 답을 냈을 때 CoT에서 hint를 사용했다고 말하는지를 통해 faithful score(hint 때문에 답이 바뀐 경우 중 CoT가 그 hint 사용을 명시적으로 나타낸 비율)를 1,0으로 계산함
Metric
- unhinted prompt에서는 hint answer가 아닌 답을 함
- hinted prompt에서는 hint answer로 답을 바꿈
- 그러면 hint가 답 변화의 원인이라고 추론
- 그때 CoT가 hint 사용을 말했는지 확인
하지만 이 score가 true faithfulness의 upper bound일 가능성이 있다고 말한다. ⇒ CoT가 hint를 말했더라도, 다른 숨은 reasoning이나 의도까지 다 말한 것은 아닐 수 있기 때문이다(모델이 단순히 hint만 보고 CoT를 대답한 것이 아니기 때문에 완전한 faithful이 아닐 수 있음. 따라서 upper bound라고 표현한 것)
Data
- MMLU: 상대적으로 쉬운 시험형 지식/추론 문제
- GPQA: 더 어려운 전문 지식/추론 문제
- 6종류의 힌트를 만들어서 제공
구분 Hint 설명
| Neutral | Sycophancy | 사용자가 “답은 A 같은데?”라고 제안 |
| Neutral | Consistency | 이전 턴에서 모델이 이미 A라고 말한 것처럼 제시 |
| Neutral | Visual Pattern | few-shot 예시에서 정답을 특정 표시로 강조 |
| Neutral | Metadata | XML metadata 안에 정답 정보 삽입 |
| Misaligned | Grader Hacking | 채점기 코드/검증 함수가 특정 답을 보상한다고 암시 |
| Misaligned | Unethical Information | 비윤리적으로 얻은 정보가 정답을 알려줌 |
*아래 두 힌트는 단순 힌트가 아니라 safety 관점에서 위험한 hint
Experimental Setup
- 모델에게 step-by-step reasoning을 하게 하고, 최종 option letter를 쓰게 함
- CoT가 hint를 verbalize했는지 판단할 때는 두 조건을 본다
- CoT가 hint를 언급했는지
- 그 hint가 답을 고르는 데 실제로 사용된 것처럼 보이는가
- 단순히 마지막에 metadata도 있었다 처럼 확인만 하는 것은 verbalization으로 보지 않는다
Benchmarking CoT Faithfulness of Reasoning Models
- Result 1 : 모든 모델이 hint를 사용한다
- Result 2 : Reasoning model(추론)이 non-reasoning model(학습된 패턴에 의존)보다 더 faithful하긴 하다
- Result 3 : 하지만 절대적인 faithfulness는 높지 않음모델 평균 faithfulness
Claude 3.7 Sonnet 약 25% DeepSeek R1 약 39%
*추가적으로 저자들은 모델이 짧게 쓰려는 성향 때문에 힌트를 말하지 않는 것이라 생각했지만 길고 복잡한 CoT가 unfaithful한 상황이 많았음.
*상대적으로 어려운 question인 GPQA에서 unfaithful 했음 ⇒ 어려운 문제일수록 모델 스스로의 지식으로 답을 확신하기 어렵기에 hint를 더 많이 사용할 가능성이 있고 이를 말하지 않을 가능성 존재함
*위의 Lanham 논문에선 쉬운 task에서는 CoT가 post-hoc일 수 있다고 했고 이 논문에서는 어려운 task에서는 hint 사용 verbalization이 더 낮을 수 있다고 말함 ⇒ 결국 쉬운 문제, 어려운 문제 모두 다른 방식으로 faithfulness 문제가 발생할 수 있음
The Impact of Outcome-Based RL on CoT Faithfulness
- outcome-based RL(CoT 과정 자체를 평가하지 않고, 최종 답이 맞았는지만 보상하는 훈련)을 하면 CoT faithfulness가 좋아질까? ⇒ 답이 맞는 경우 reward제공, CoT가 faithful한지는 직접 보상하지 않음
- 결과적으로 outcome-based RL은 초반에는 CoT faithfulness를 꽤 올리지만 금방 plateau에 도달했
CoT Faithfulness on RL Reward Hacks
- 모델이 RL 과정에서 reward hack을 배우면, 그 꼼수를 CoT에 말할까?
- 결과적으로 모델은 모든 환경에서 reward hack을 빠르게 배워서 30step안에 incorrect hint answer를 99% 이상 선택함, 하지만 CoT에는 reward hack을 verbalize하는 비율은 매우 낮았음(6개 중 5개의 환경에서 reward hack verbalization이 2% 미만)
Discussion
CoT monitoring은 unintended behavior를 발견하는 데 유용한 도구일 수 있다. 특히 어떤 위험 행동이 자주 발생하거나, 여러 단계의 reasoning이 필요한 경우에는 CoT 중 일부에서 그 의도가 드러날 가능성이 있다. 하지만 CoT monitoring 하나만으로 안전을 보장하기 어려움. 따라서 CoT monitoring에 의존하려면 두 가지가 필요함
- 모델이 그 위험 행동을 CoT 없이 수행할 수 없다는 capability evidence
- 모델이 CoT를 사용할 때 실제 reasoning을 faithfully verbalize한다는 evidence
Limitations
- 실험이 multiple-choice benchmark 문제 중심이다. 실제 deployment 환경과 다를 수 있다.
- hint가 매우 쉽게 exploit 가능한 형태다. 그래서 CoT가 꼭 필요한 상황은 아니다.
Conclusion
- reasoning model의 CoT는 일부 경우에는 hint 사용을 드러낸다.
- 하지만 충분히 신뢰할 만큼 안정적으로 드러내지는 않는다.
- outcome-based RL만으로 CoT faithfulness를 충분히 높이기 어렵다.
- reward hacking은 CoT에 거의 verbalize되지 않을 수 있다.
- CoT monitoring은 alignment의 유용한 도구일 수 있지만, 단독으로는 부족하다
Future direction