전체 그래프
Foundational Concepts

BART

ai-mlconcept

상위: AI & ML

Bidirectional Auto-Regressive Transformer Transformer 기반의 인코더-디코더 구조를 유지하는 LLM.

특징

  • 양방향 인코더: BERT와 유사하게 입력 텍스트의 양방향 문맥을 학습.
  • 자기회귀 디코더: GPT와 유사하게 이전 토큰을 기반으로 다음 토큰을 예측하며 텍스트를 생성.
  • 텍스트 손상 및 재구성: 사전 학습 시 입력 텍스트에 다양한 형태의 노이즈(손상)를 가하고, 디코더가 원본 텍스트를 재구성하도록 학습.

사전 학습 목표 (Pre-training Objectives)

  • 토큰 마스킹 (Token Masking): 입력 문장의 일부 토큰을 [MASK]로 가리고 예측.
  • 토큰 삭제 (Token Deletion): 입력 문장의 일부 토큰을 완전히 삭제 — 어느 위치가 비었는지까지 모델이 추론.
  • 텍스트 채우기 (Text Infilling): 포아송 분포(λ=3)로 뽑은 길이의 스팬(길이 0 포함)을 단일 [MASK]로 치환 — 논문에서 Sentence Permutation과의 조합이 최고 성능.
  • 문장 순서 뒤섞기 (Sentence Permutation): 문서를 문장 단위로 나눠 무작위 재배열.
  • 문서 회전 (Document Rotation): 문서 내 임의 토큰을 시작점으로 회전시켜 실제 시작 지점을 찾게 학습.

활용 분야

  • 텍스트 요약 (Summarization): 특히 추상적 요약(abstractive summarization)에 강점.
  • 기계 번역 (Machine Translation): 인코더-디코더 구조의 강점을 활용.
  • 텍스트 생성 (Text Generation): 자연스러운 문장 생성.
  • 질문 답변 (Question Answering): 문맥 이해 및 생성 능력 활용.

메모

  • Pre-training
    • 입력 문장에 노이즈 (Masking) → 몇개가 마스킹 되었는지 모름 (0 ~ N) cf. BERT
    • Decoder가 추론