상위: AI & ML
LLM이 인간의 선호도에 더 잘 부합하는 응답을 생성하도록 학습시키는 방법론. LLM의 정렬(Alignment)에 핵심적인 역할을 함.
작동 방식
- 사전 학습된 LLM (Pre-trained LLM): 대규모 텍스트 데이터로 학습된 기본 모델.
- 지도 미세 조정 (Supervised Fine-tuning, SFT): 소량의 고품질 지시-응답 쌍 데이터로 모델을 미세 조정하여 기본적인 지시를 따르는 능력 향상.
- 보상 모델 (Reward Model, RM) 학습:
- 강화 학습 (Reinforcement Learning):
장점
- 인간 선호도 반영: 모델이 단순히 사실을 나열하는 것을 넘어, 인간이 선호하는 방식(유용성, 안전성, 정직성)으로 응답을 생성하도록 유도.
- 환각(Hallucination) 감소: 잘못된 정보를 생성하는 경향을 줄임.
- 유해한 콘텐츠 생성 방지: 안전하고 윤리적인 응답을 생성하도록 모델을 정렬.
단점
- 복잡성: 보상 모델 학습, 강화 학습 등 여러 단계가 필요하여 구현이 복잡하고 비용이 많이 듦.
- 데이터 수집 비용: 고품질의 인간 선호도 데이터(비교 데이터)를 수집하는 데 많은 시간과 노력이 필요.
- 확장성: 대규모 모델에 적용하기 위한 컴퓨팅 자원 요구량이 높음.