전체 그래프
Foundational Concepts

BERT

ai-mlconcept

상위: AI & ML

Bidirectional Encoder Representations from Transformers TransformerEncoder 부분을 활용하여 양방향 문맥 이해에 중점을 둔 LLM.

특징

  • 양방향 문맥 이해: 문장의 앞뒤 모든 단어의 문맥을 동시에 고려하여 단어의 의미를 파악.
  • 인코더 전용: Transformer의 인코더 스택만을 사용하여 텍스트를 이해하고 표현하는 데 특화.
  • 사전 학습 (Pre-training) 및 Fine-tuning: 대규모 코퍼스로 사전 학습된 후, 특정 태스크에 맞춰 미세 조정.

아키텍처

  • Transformer의 인코더 블록을 여러 층으로 쌓아 올린 구조.
  • 각 층은 Self-Attention 메커니즘을 통해 입력 시퀀스 내의 모든 단어 간의 관계를 학습.

사전 학습 태스크 (Pre-training Tasks)

Masked Language Model (MLM)

입력 문장의 일부 단어(토큰)를 [MASK] 토큰으로 가린 후, 가려진 단어를 예측하도록 학습.

  • 작동 방식:
    • [MASK] 처리하고 원래 단어를 맞추게 하는 방식.
    • 이외에도 랜덤으로 바뀌었을 수도 있는 단어의 원래 단어를 맞추게 하는 방식 추가.
  • 목적: 단어의 양방향 문맥을 이해하는 능력 학습.

Next Sentence Prediction (NSP)

두 개의 문장이 주어졌을 때, 이 두 문장이 원본 문서에서 이어지는 문장인지 아닌지를 예측하도록 학습.

  • 목적: 문장 간의 관계를 이해하는 능력 학습.

활용 분야

  • 텍스트 분류 (Text Classification): 스팸 메일 분류, 감성 분석 등.
  • 개체명 인식 (Named Entity Recognition, NER): 주어진 텍스트로부터 사람, 장소, 조직 등 개체를 추출.
  • 질문 답변 (Question Answering, QA): 주어진 지문에서 질문에 대한 답변을 추출.
  • 임베딩 생성: 단어 또는 문장 임베딩을 생성하여 다른 NLP 태스크의 입력으로 활용.

메모

  • BERT는 생성 모델이 아님 (인코더 전용)