전체 그래프
Foundational Concepts

RLHF

ai-mlconcept

상위: AI & ML

LLM이 인간의 선호도에 더 잘 부합하는 응답을 생성하도록 학습시키는 방법론. LLM의 정렬(Alignment)에 핵심적인 역할을 함.

작동 방식

  1. 사전 학습된 LLM (Pre-trained LLM): 대규모 텍스트 데이터로 학습된 기본 모델.
  2. 지도 미세 조정 (Supervised Fine-tuning, SFT): 소량의 고품질 지시-응답 쌍 데이터로 모델을 미세 조정하여 기본적인 지시를 따르는 능력 향상.
  3. 보상 모델 (Reward Model, RM) 학습:
    • LLM이 생성한 여러 응답에 대해 인간 평가자가 선호도를 부여(랭킹).
    • 이 선호도 데이터를 사용하여 LLM의 응답을 평가하는 별도의 보상 모델을 학습.
  4. 강화 학습 (Reinforcement Learning):
    • 보상 모델을 사용하여 LLM의 응답에 점수를 부여.
    • 이 점수를 보상 신호로 삼아 LLM을 강화 학습(예: PPO 알고리즘)하여 인간의 선호도에 맞는 응답을 생성하도록 유도.

장점

  • 인간 선호도 반영: 모델이 단순히 사실을 나열하는 것을 넘어, 인간이 선호하는 방식(유용성, 안전성, 정직성)으로 응답을 생성하도록 유도.
  • 환각(Hallucination) 감소: 잘못된 정보를 생성하는 경향을 줄임.
  • 유해한 콘텐츠 생성 방지: 안전하고 윤리적인 응답을 생성하도록 모델을 정렬.

단점

  • 복잡성: 보상 모델 학습, 강화 학습 등 여러 단계가 필요하여 구현이 복잡하고 비용이 많이 듦.
  • 데이터 수집 비용: 고품질의 인간 선호도 데이터(비교 데이터)를 수집하는 데 많은 시간과 노력이 필요.
  • 확장성: 대규모 모델에 적용하기 위한 컴퓨팅 자원 요구량이 높음.