전체 글 14

FRIT: Using Causal Importance to Improve Chain-of-Thought Faithfulness [논문 리뷰]

AbstractCoT는 복잡한 문제에서 LLM의 성능을 높이지만, 모델이 출력한 reasoning step이 실제로 final answer에 영향을 주지 않는 경우가 존재한다.기존 연구는 “CoT가 faithful 한가?” 에 집중했지만 “모델 자체를 더 faithful하게 만들려면 어떻게 학습해야 하는가?” 에 대한 scalable한 방법은 상대적으로 부족했다.FRIT 제안논문은 **Faithful Reasoning via Intervention Training (FRIT)**을 제안한다.모델이 생성한 CoT의 reasoning step에 intervention해당 step이 final answer에 실제 영향을 주는지 측정이를 이용해 faithful / unfaithful CoT pair 생성DPO를..

CoT 연구 2026.08.14

TO COT OR NOT TO COT? CHAIN-OF-THOUGHT HELPS MAINLY ON MATH AND SYMBOLIC REASONING(ARC) [논문재현]

ARC-Challenge 데이터 셋 로드from eval_datasets.types.arc import ARCDatasetarc_dataset = ARCDataset( path_or_url="allenai/ai2_arc", subset="ARC-Challenge", split="validation", use_llama_3_1_prompts=False,)print( "ARC-Challenge 데이터 개수:", len(arc_dataset),)공식 ARC Dataset은 문제와 선택지를 읽어 다음을 생성한다.zs_cotless_messages: Direct Answer 프롬프트zs_cot_messages: CoT 프롬프트answerKey: 정답 선택지 문자answer: 정답 ..

CoT 연구 2026.07.09

TO COT OR NOT TO COT? CHAIN-OF-THOUGHT HELPS MAINLY ON MATH AND SYMBOLIC REASONING(GSM8K) [논문 재현]

mkdir -p ~/researchcd ~/researchgit clone https://github.com/Zayne-sprague/To-CoT-or-not-to-CoT.gitcd To-CoT-or-not-to-CoT원본 저장소는 Hugging Face 모델을 보통 vLLM 서버로 띄운 뒤 endpoint로 호출하도록 구성돼 있는데, 학교 Gpu 서버 환경에는 vLLM이 없어서 먼저 transformer로 로컬 모델 실행을 확인하고, 그다음 원본 코드에 연결하기로 했고 14개의 모델을 전부 실행하기엔 어려워서 논문에서 사용한 Qwen 2 대신 Qwen 2.5 7B를 대신 사용했음.Qwen 2.5 7B 불러오기import torchfrom transformers import AutoTokenizer, A..

CoT 연구 2026.07.09

FAITHCOT-BENCH: BENCHMARKING INSTANCELEVEL FAITHFULNESS OF CHAIN-OF-THOUGHT REASONING [논문 리뷰]

AbstractCoT가 LLM의 문제 해결 성능을 높이고, 겉보기에는 설명 가능성을 주는 것처럼 보인다. 하지만 CoT가 실제 모델의 내부 reasoning process를 faithful하게 반영하지 않을 수 있다기존 연구들은 CoT가 unfaithful할 수 있다는 것을 보여줬지만, 대부분은 mechanism-level 분석이었다. 즉, CoT라는 방식이 전체적으로 문제가 있을 수 있다는 건 보여줬지만 특정 query와 특정 CoT가 주어졌을 때, 이 CoT가 faithful한지 판단하는 문제는 충분히 다루지 않았다.Introduction이 reasoning step들이 진짜 모델의 internal decision process를 반영하는가?아니면 instruction에 맞춰 그럴듯하게 보이도록 만든..

CoT 연구 2026.07.08

On the Impact of Fine-Tuning on Chain-of-Thought Reasoning[논문 리뷰]

AbstractLLM은 원래 general intelligence를 가진 모델이지만, 특정 task에서는 fine-tuning을 하면 성능이 더 좋아질 수 있다. 하지만 기존 연구들은 fine-tuning이 이런 문제를 만들 수 있다고 본다.문제 의미catastrophic forgettingfine-tuning한 task는 잘하지만 기존 능력은 잊음privacy riskfine-tuning data가 더 쉽게 추출될 위험safety risk기존 safety mechanism이 약해질 위험이 논문에서는 이런 문제점들에서 한 걸음 더 나아가서 fine tuning이 CoT reasoning과 CoT faithfulness에는 어떤 영향을 끼치는지 분석함. ⇒ 결과적으로 fine tuning 이후에 네 개의 ..

CoT 연구 2026.07.08

Reasoning Models Don’t Always Say What They Think [논문 리뷰]

AbstractCoT가 AI safety에 도움이 될 수 있다고 말함. ⇒ 모델의 CoT를 보면 모델이 어떤 의도와 reasoning으로 답했는지 감시할 수 있을 것 같기 때문임모델이 prompt 안의 hint를 사용해 답을 바꾸더라도, 그 hint 사용을 CoT에 말하는 비율은 낮다.outcome-based reinforcement learning(결과 기반 강화 학습)은 초반에는 faithfulness를 높이지만, 어느 정도에서 plateau(정체기)가 온다.RL 중 reward hacking을 배워도, 모델은 그 reward hack을 CoT에 거의 말하지 않는다.⇒CoT monitoring은 유용할 수 있지만, 믿고 의존하기에는 부족하다IntroductionCoT의 두 가지 장점으로는 Capabi..

CoT 연구 2026.07.08

Measuring Faithfulness in Chain-of-Thought Reasoning

AbstractLLM은 CoT를 생성하면 성능이 좋아질 때가 많지만 그 CoT가 모델의 실제 reasoning process를 faithfully 설명하는지는 불확실함 ⇒ CoT faithfulness 측정하기 위해 여러 intervention(간섭) 수행⇒ 이 intervention들에 대해서 답이 같으면 실제로 모델은 CoT를 사용하지 않았을 수도 있다실험 의미Early AnsweringCoT를 중간에 자르고 답하게 함Adding MistakesCoT 중간에 실수를 넣음ParaphrasingCoT를 다른 말로 바꿔 씀Filler TokensCoT를 의미 없는 … 토큰으로 대체IntroductionLLM이 어떤 답을 냈을 때, 특히 의료, 법률, 안전 같은 high-stakes setting(위험 부담..

CoT 연구 2026.07.08

Language Models Don’t Always Say What They Think:Unfaithful Explanations in Chain-of-Thought Prompting [논문 리뷰]

AbstractLLM은 CoT를 사용하면 여러 task에서 좋은 성능을 낼 수 있다. 그래서 사람들은 모델이 출력한 CoT를 모델이 실제로 문제를 푼 과정이라고 믿고 싶어 한다. 하지만 이 논문에서는 CoT가 실제 이유를 충실하게 반영하지 않을 수 있다고 주장한다. 특히 입력에 biasing feature를 넣었을 때, 모델의 답이 그 bias에 영향을 받으면서도 CoT에서는 그 영향을 거의 언급하지 않는다는 것을 보여준다. (힌트 떄문에 답을 고른 후 문제 조건을 논리적으로 따져봐서 그 답을 골랐다고 주장)ex) few shot prompting에서 정답이 항상 A가 되도록 answer choice를 조작해도 CoT에선 A가 반복적으로 정답이었다는 사실을 말하지 않는다⇒ CoT explanation은 ..

CoT 연구 2026.07.07

CoT 연구 1주차

연구 주제연구 주제CoT는 언제 faithful reasoning에서 사후 설명으로 변하는가? ⇒ Post-hoc rationalization의 전환 조건 분석문제 의식CoT는 모델이 답을 내기 전에 중간 reasoning 과정을 생성하게 하여, 문제 해결 성능을 높이고 설명 가능성을 제공하는 방식으로 사용되어 왔다.하지만 CoT가 답보다 먼저 생성된다고 해서, 반드시 모델이 그 CoT를 실제로 사용해서 답을 냈다고 볼 수는 없다.어떤 경우에는 CoT가 final answer를 만드는 데 실제로 중요한 역할을 하는 load-bearing reasoning일 수 있고 반대로 어떤 경우에는 모델이 이미 답을 알고 있거나 쉽게 예측한 뒤, 그 답에 맞는 설명을 나중에 생성하는 post-hoc rationali..

CoT 연구 2026.06.29

Reasoning Models Don’t Always Say What They Think (논문리뷰)

Abstract첫째, CoT를 사용한 100편 이상의 논문을 meta-analysis(기존 연구 결과 통합, 분석)둘째, 20개 dataset, 14개 model을 직접 평가결과 : CoT는 주로 math 또는 logic이 포함된 task에서 성능 향상이 크고, 다른 task에서는 효과가 작다. ⇒ 항상 좋은 것 아님.IntroductionCoT는 LLM에게 “think step by step” 처럼 말해서 reasoning을 유도하는 prompting technique이다. GPT나 Llama 같은 모델들도 reasoning problem에서 CoT를 기본적으로 사용하거나, CoT 능력을 post-training 과정에서 많이 학습한다. (CoT는 model 자체의 문제가 아니라 reasoning의 종..

CoT 연구 2026.06.29