전체 그래프
RAG

RAG Guardrails

ai-mlragguardrailssafety

상위: RAGOps

요약

프로덕션 RAG의 안전성은 입력–처리–출력 전 단계에 걸쳐 적용해야 한다. RAG는 지식 베이스 자체가 새로운 공격 표면이 되므로 일반 LLM 가드레일보다 검색 계층 방어가 추가된다.

3계층 방어 모델 (Three-Layer Defense)

  • 입력 가드레일 (Input Rails):
    • 프롬프트 인젝션 탐지·차단
    • 유해/부적절 콘텐츠 필터링
    • 쿼리 형식 유효성 검증, PII 탐지
  • 검색 가드레일 (Retrieval Rails):
    • Self-Check Facts: 검색된 문서에 답변이 실제 근거하는지 검증
    • 접근 권한 기반 문서 필터링 (Multi-tenancy)
  • 출력 가드레일 (Output Rails):
    • 환각 감지·차단
    • PII 마스킹, 유해 콘텐츠 필터링
    • 답변 형식 준수 검증

주요 도구

  • NVIDIA NeMo Guardrails: Colang DSL로 프로그래밍 가능한 안전 제어 (입력/출력/주제 제어/환각 탐지)
  • Guardrails AI: Pydantic 기반 출력 검증, 스키마 준수 강제
  • 자체 구현: LLM-as-Judge로 입출력 검증 파이프라인 구축

관련 노트