상위: AI & ML
Bidirectional Encoder Representations from Transformers Transformer의 Encoder 부분을 활용하여 양방향 문맥 이해에 중점을 둔 LLM.
특징
- 양방향 문맥 이해: 문장의 앞뒤 모든 단어의 문맥을 동시에 고려하여 단어의 의미를 파악.
- 인코더 전용: Transformer의 인코더 스택만을 사용하여 텍스트를 이해하고 표현하는 데 특화.
- 사전 학습 (Pre-training) 및 Fine-tuning: 대규모 코퍼스로 사전 학습된 후, 특정 태스크에 맞춰 미세 조정.
아키텍처
- Transformer의 인코더 블록을 여러 층으로 쌓아 올린 구조.
- 각 층은 Self-Attention 메커니즘을 통해 입력 시퀀스 내의 모든 단어 간의 관계를 학습.
사전 학습 태스크 (Pre-training Tasks)
Masked Language Model (MLM)
입력 문장의 일부 단어(토큰)를 [MASK] 토큰으로 가린 후, 가려진 단어를 예측하도록 학습.
- 작동 방식:
- [MASK] 처리하고 원래 단어를 맞추게 하는 방식.
- 이외에도 랜덤으로 바뀌었을 수도 있는 단어의 원래 단어를 맞추게 하는 방식 추가.
- 목적: 단어의 양방향 문맥을 이해하는 능력 학습.
Next Sentence Prediction (NSP)
두 개의 문장이 주어졌을 때, 이 두 문장이 원본 문서에서 이어지는 문장인지 아닌지를 예측하도록 학습.
- 목적: 문장 간의 관계를 이해하는 능력 학습.
활용 분야
- 텍스트 분류 (Text Classification): 스팸 메일 분류, 감성 분석 등.
- 개체명 인식 (Named Entity Recognition, NER): 주어진 텍스트로부터 사람, 장소, 조직 등 개체를 추출.
- 질문 답변 (Question Answering, QA): 주어진 지문에서 질문에 대한 답변을 추출.
- 임베딩 생성: 단어 또는 문장 임베딩을 생성하여 다른 NLP 태스크의 입력으로 활용.
메모
- BERT는 생성 모델이 아님 (인코더 전용)