Abstract
LLM은 원래 general intelligence를 가진 모델이지만, 특정 task에서는 fine-tuning을 하면 성능이 더 좋아질 수 있다. 하지만 기존 연구들은 fine-tuning이 이런 문제를 만들 수 있다고 본다.
문제 의미
| catastrophic forgetting | fine-tuning한 task는 잘하지만 기존 능력은 잊음 |
| privacy risk | fine-tuning data가 더 쉽게 추출될 위험 |
| safety risk | 기존 safety mechanism이 약해질 위험 |
이 논문에서는 이런 문제점들에서 한 걸음 더 나아가서 fine tuning이 CoT reasoning과 CoT faithfulness에는 어떤 영향을 끼치는지 분석함. ⇒ 결과적으로 fine tuning 이후에 네 개의 dataset에서 평균적으로 CoT faithfulness가 감소했다(fine tuning으로 학습한 답 패턴을 정당화 하는 설명)
Introduction
LLM은 금융, 의료, 교육, 콘텐츠 생성 등 다양한 분야에 쓰인다. 하지만 pre-trained model은 의료나 법률처럼 specialized knowledge가 필요한 domain에서는 부족할 수 있다. 그래서 pre-trained LLM을 특정 domain dataset으로 fine-tuning한다. 하지만 fine-tuning은 위에서 언급했던 문제들을 일으킬 수 있음
*이 논문에서는 fine-tuning이 reasoning 능력에는 어떤 영향을 주는지 충분히 연구되지 않았다고 설명
Our Work
- fine-tuning이 CoT reasoning accuracy에 어떤 영향을 주는가?
- fine-tuning이 CoT faithfulness에 어떤 영향을 주는가?
- fine-tuning이 IID(AI가 학습한 데이터와 테스트 데이터가 동일한 분포 즉, AI에게 익숙한 문제 유형) /OOD(새로운 형태의 데이터) reasoning performance에 어떤 영향을 주는가?
- QLoRA rank가 fine-tuning 후 CoT 능력 저하에 영향을 주는가?
*QLoRA는 모델 전체를 fine-tuning 하는 것이 아닌 LoRA에 4bit Quantization을 적용
Methods
- fine-tuning을 어떻게 했는지
- supervised fine-tuning을 사용하고, LLaMA 모델에는 QLoRA를 적용
- 대부분 dataset에서는 reasoning step 없이 question-answer pair만으로 fine-tuning
- CoT accuracy와 faithfulness를 어떻게 측정하는지
- Accuracy of Chain-of-Thought Reasoning
- 모델에게 CoT prompt를 줌
- step-by-step reasoning을 생성하게 함
- 최종 답을 내게 함
- fine-tuned model과 pre-trained model의 accuracy 비교
- Faithfulness of Chain-of-Thought Reasoning
- Early Termination ⇒ CoT를 중간에 끊고 답하게 함
- Paraphrasing ⇒ CoT 일부를 다른 말로 바꿈
- Filler Substitution ⇒ CoT 뒤쪽을 … 같은 filler로 바꿈(필요 없는 token)
- Accuracy of Chain-of-Thought Reasoning
Experimental Setup
- DatasetsDataset Domain 설명
GSM8K Math reasoning 초중등 수준 수학 word problem CosmosQA Commonsense reasoning 상식 기반 reading comprehension MedQA Medical USMLE 기반 의학 QA MedMCQA Medical AIIMS/NEET 기반 의학 QA - 여기서 fine-tuning dataset과 test dataset이 같은 category면 IID, 다르면 OOD(위 아래 두개씩 IID라고 볼 수 있음)
- ModelsModel 특징
Llama-3-8B-Instruct 작은 open-source model GPT-3.5-turbo-0125 중간급 closed model GPT-4 강한 reasoning model - LLaMA에는 QLoRA를 사용하고, GPT 계열은 OpenAI API로 fine-tuning
Results
- RQ1. Fine-tuning이 CoT reasoning accuracy에 어떤 영향을 주는가?
- fine-tuning 후 CoT accuracy가 전반적으로 떨어지는 경우가 많으며 특히 GSM8K 같은 math reasoning dataset에서 세 모델 모두 fine-tuned model이 pre-trained model보다 낮은 CoT accuracy를 보였다고 설명해. ⇒ fine tuning은 특정 task Acc를 올릴 수 있지만 CoT reasoning은 오히려 망가질 수 있음, 특히 작은 모델은 fine-tuning으로 parameter가 많이 흔들리고, general reasoning 능력이 더 쉽게 손상될 수 있음
- RQ2. Fine-tuning이 CoT faithfulness에 어떤 영향을 주는가?
- Early Termination : 이 논문에서는 CoT를 25%, 50%, 75% 지점에서 끊고, full CoT와 같은 답이 나오는 비율을 봤는데 Gpt 계열에서는 fine tuning을 해도 faithfulness 변화가 크지 않았지만 LLaMA에선 Early Termination으로 CoT Pred Match가 증가하는 경향이 있었음
- Filler Substitution : Filler Substitution에서도 Early Termination과 비슷하게, CoT Pred Match가 높으면 의미 있는 reasoning을 filler로 바꿔도 답이 유지된다 → CoT content가 실제 답에 덜 중요할 수 있다 → faithfulness가 낮을 가능성
- Paraphrasing : Paraphrasing에서는 CoT Pred Match가 높으면 좋은 쪽으로 해석된다. 왜냐하면 표현만 바꿨는데 답이 유지된다는 건 특정 토큰이나 phrasing 때문이 아니라, reasoning의 논리적 내용이 유지되었기 때문일 수 있기 때문이다.
- RQ3. Fine-tuning이 IID/OOD general performance에 어떤 영향을 주는가?
- Figure 2a는 CoT 없이 바로 답을 내는 zero-shot accuracy를 보여주는데 이때 GPT 모델은 fine-tuning 후 여러 dataset에서 accuracy가 개선되는 경우가 많았다. 하지만 LLaMA-3-8B-Instruct는 MedQA나 CosmosQA로 fine-tuning했을 때 GSM8K 같은 math reasoning dataset에서 성능이 크게 떨어졌어.
- QLoRA rank가 영향을 주는가?
- LLaMA-3-8B-Instruct에 대해 QLoRA rank를 8, 16, 32로 바꿔서 실험했는데 결과적으로 rank를 바꿔도 핵심 경향은 유지됐다.
Conclusion
- Fine-tuning은 작은 LLM의 complex reasoning performance를 감소시킬 수 있다.
- 특히 math-based task에서 CoT reasoning performance가 크게 떨어질 수 있다.
- Fine-tuning은 CoT reasoning faithfulness도 손상시킬 수 있다.
Limitations
- Faithfulness metric 자체가 아직 초기 단계이기 때문에 metric 발전에 따른 결과 해석을 다시 할 필요 존재
- 새로운 CoT prompting 방법은 다루지 않음. 기본적인 CoT prompting 중심으로 실험으로만 진행
- fine-tuning이 실제로 모델 내부 activation이나 attention head를 어떻게 바꾸는지는 깊게 분석하지 않았음
- dataset/model 범위 제한(더 다양한 reasoning/non-reasoning task와 더 많은 open-source model로 확장할 필요 존재)