상위: AI & ML
Direct Preference Optimization RLHF의 복잡한 과정을 단순화하여, 인간의 선호도 데이터를 직접 사용하여 LLM을 최적화하는 Fine-tuning 방법.
작동 방식
- 데이터셋:
(프롬프트, 선호하는 응답, 선호하지 않는 응답)쌍으로 구성된 데이터셋을 구축. - 학습: 모델이 선호하는 응답의 확률을 높이고, 선호하지 않는 응답의 확률을 낮추도록 직접적으로 학습.
- 목적: 인간의 선호도에 더 잘 부합하는, 더 안전하고 유용한 응답을 생성.
장점
- 단순성: RLHF에 필요한 보상 모델(Reward Model) 학습이나 강화 학습(Reinforcement Learning) 과정이 필요 없어 구현이 훨씬 간단.
- 안정성: 학습 과정이 더 안정적이고 수렴이 빠름.
- 성능: RLHF와 유사하거나 더 나은 성능을 달성하는 경우가 많음.
단점
- 데이터셋 구축: 고품질의 선호도 데이터셋을 구축하는 데 여전히 시간과 비용이 소요됨.
- 선호도 데이터의 편향: 데이터셋에 편향이 있을 경우 모델도 편향된 응답을 생성할 수 있음.