상위: AI & ML
Generative Pre-trained Transformer Transformer의 Decoder 부분을 활용하여 텍스트 생성에 특화된 LLM.
특징
- 디코더 전용: Transformer의 디코더 스택만을 사용하여 텍스트를 생성하는 데 특화.
- 자기회귀 (Autoregressive): 이전 생성된 토큰들을 기반으로 다음 토큰을 순차적으로 예측하며 텍스트를 생성.
- 단방향 문맥 이해: 텍스트를 왼쪽에서 오른쪽으로만 처리하여 문맥을 이해.
- 사전 학습 (Pre-training) 및 Fine-tuning: 대규모 코퍼스로 사전 학습된 후, 특정 생성 태스크에 맞춰 미세 조정.
아키텍처
- Transformer의 디코더 블록을 여러 층으로 쌓아 올린 구조.
- 각 층은 Self-Attention 메커니즘을 통해 입력 시퀀스 내의 단어 간 관계를 학습하며, 이전 토큰에만 어텐션.
사전 학습 방식
- 대규모 텍스트 데이터셋에서 다음 단어를 예측하는 방식으로 학습.
- 이 과정에서 문법, 의미, 사실적 지식 등 언어의 복잡한 패턴을 습득.
활용 분야
- 텍스트 생성: 기사 작성, 스토리텔링, 시나리오 생성 등.
- 대화형 AI: 챗봇, 가상 비서 등.
- 코드 생성: 프로그래밍 코드 작성.
- 번역, 요약: 생성 태스크로 변환하여 수행.
주요 버전
- GPT-2: 대규모 텍스트 생성 능력으로 주목받음.
- GPT-3: 1,750억 개의 파라미터로 더욱 향상된 성능과 범용성.
- GPT-3.5 (ChatGPT): 대화에 특화된 버전으로 대중화에 기여.
- GPT-4: 멀티모달 입력(텍스트, 이미지) 처리 및 더욱 정교한 추론 능력.
메모
- 풀 수 있는 문제의 범위가 넓음 cf. BERT