연구 주제
연구 주제
CoT는 언제 faithful reasoning에서 사후 설명으로 변하는가? ⇒ Post-hoc rationalization의 전환 조건 분석
문제 의식
CoT는 모델이 답을 내기 전에 중간 reasoning 과정을 생성하게 하여, 문제 해결 성능을 높이고 설명 가능성을 제공하는 방식으로 사용되어 왔다.
하지만 CoT가 답보다 먼저 생성된다고 해서, 반드시 모델이 그 CoT를 실제로 사용해서 답을 냈다고 볼 수는 없다.어떤 경우에는 CoT가 final answer를 만드는 데 실제로 중요한 역할을 하는 load-bearing reasoning일 수 있고 반대로 어떤 경우에는 모델이 이미 답을 알고 있거나 쉽게 예측한 뒤, 그 답에 맞는 설명을 나중에 생성하는 post-hoc rationalization일 수 있다.
그래서 단순히 CoT가 faithful 한가에 중점을 두는 것이 아니라 CoT는 어떤 조건에서 실제 reasoning으로 작동하고, 어떤 조건에서 사후 설명으로 변하는가가 중요하다고 생각한다.
기존 연구 배경
- CoT는 모든 task에서 동일하게 효과적인 것이 아니라, 주로 math, logic, symbolic reasoning task에서 성능 향상이 크다. 그러나 CoT가 accuracy를 높인다는 사실이 곧 CoT가 faithful하다는 뜻은 아니다
- 모델은 biasing feature나 hint에 영향을 받아 답을 바꾸면서도, CoT에서는 그 영향을 말하지 않을 수 있다. 즉, CoT는 그럴듯해 보이지만 실제 답의 원인을 숨길 수 있다
- CoT를 자르거나, 오류를 넣었을 때 모델의 답이 바뀌는 정도는 task와 model에 따라 크게 달라진다. 특히 쉬운 문제나 모델이 이미 잘 풀 수 있는 문제에서는 CoT가 실제 답 생성에 덜 필요할 가능성이 있다
- fine-tuning이나 domain adaptation 이후 CoT faithfulness가 변할 수 있다는 결과도 있지만, 아직 왜 faithfulness가 깨지는지를 설명하는 연구는 부족하다.
기존 연구들의 부족한 부분
- 기존 연구들은 CoT가 unfaithful할 수 있음을 다양한 방식으로 보여주었다. 그러나 대부분은 CoT가 faithful하지 않을 수 있다는 사실을 확인하는 데 초점이 있었고 어떤 조건에서 CoT가 faithful reasoning으로 작동하고, 어떤 조건에서 post-hoc explanation으로 변하는가에 대한 부분은 부족하다고 생각합니다
- biasing feature, hint, metadata, reward hack 등을 넣고 모델이 이를 CoT에 말하는지 확인하는 연구들이 존재했지만 이는 모델이 숨은 단서를 사용하는데에 초점이 맞춰져 있었다. 외부 힌트나 bias가 없더라도 모델이 어떤 조건에서 CoT를 실제 reasoning이 아니라 사후 설명으로 사용하는지에 대한 연구는 부족하다고 생각합니다
- CoT를 자르거나 오류를 넣어 final answer가 바뀌는지 확인했던 기존의 연구는 CoT가 실제로 답에 영향을 주는지 보는 중요한 기반이 된다. 하지만 모델이 어느 수준의 task difficulty 에서 CoT를 실제로 사용하다가, 어느 지점부터 CoT 없이도 답을 내고 CoT를 사후 설명으로 만들기 시작하는가를 볼 필요가 있다고 생각합니다.
- 기존 fine-tuning 연구는 fine-tuning 이후 CoT faithfulness가 감소할 수 있음을 보여주지만 이 감소가 왜 발생했는지는 더 분리해서 볼 필요가 있다고 생각합니다.
- 모델이 task에 너무 익숙해져서 CoT 없이도 답을 내기 때문
- fine-tuning 과정에서 특정 문제 패턴을 학습했기 때문
- CoT 형식만 학습하고 실제 reasoning은 강화되지 않았기 때문
- task가 너무 어려워져서 reasoning chain이 무너졌기 때문
기존 연구와의 차별점
기존 연구가 주로 CoT faithfulness의 존재 여부나 평가 방법에 집중했다면, 제가 하고픈 연구는 faithfulness가 유지되는 구간과 깨지는 구간을 설명하는 현상 연구를 목표로 하고 있습니다.
1주차 계획
기존 연구들의 특정 domain, fine tuning 상황에서의 faithfulness 측정, 연구 과정 재현 및 이해