전체 그래프
Foundational Concepts

GPT

ai-mlconcept

상위: AI & ML

Generative Pre-trained Transformer TransformerDecoder 부분을 활용하여 텍스트 생성에 특화된 LLM.

특징

  • 디코더 전용: Transformer의 디코더 스택만을 사용하여 텍스트를 생성하는 데 특화.
  • 자기회귀 (Autoregressive): 이전 생성된 토큰들을 기반으로 다음 토큰을 순차적으로 예측하며 텍스트를 생성.
  • 단방향 문맥 이해: 텍스트를 왼쪽에서 오른쪽으로만 처리하여 문맥을 이해.
  • 사전 학습 (Pre-training) 및 Fine-tuning: 대규모 코퍼스로 사전 학습된 후, 특정 생성 태스크에 맞춰 미세 조정.

아키텍처

  • Transformer의 디코더 블록을 여러 층으로 쌓아 올린 구조.
  • 각 층은 Self-Attention 메커니즘을 통해 입력 시퀀스 내의 단어 간 관계를 학습하며, 이전 토큰에만 어텐션.

사전 학습 방식

  • 대규모 텍스트 데이터셋에서 다음 단어를 예측하는 방식으로 학습.
  • 이 과정에서 문법, 의미, 사실적 지식 등 언어의 복잡한 패턴을 습득.

활용 분야

  • 텍스트 생성: 기사 작성, 스토리텔링, 시나리오 생성 등.
  • 대화형 AI: 챗봇, 가상 비서 등.
  • 코드 생성: 프로그래밍 코드 작성.
  • 번역, 요약: 생성 태스크로 변환하여 수행.

주요 버전

  • GPT-2: 대규모 텍스트 생성 능력으로 주목받음.
  • GPT-3: 1,750억 개의 파라미터로 더욱 향상된 성능과 범용성.
  • GPT-3.5 (ChatGPT): 대화에 특화된 버전으로 대중화에 기여.
  • GPT-4: 멀티모달 입력(텍스트, 이미지) 처리 및 더욱 정교한 추론 능력.

메모

  • 풀 수 있는 문제의 범위가 넓음 cf. BERT