상위: RAGOps
요약
프로덕션 RAG의 안전성은 입력–처리–출력 전 단계에 걸쳐 적용해야 한다. RAG는 지식 베이스 자체가 새로운 공격 표면이 되므로 일반 LLM 가드레일보다 검색 계층 방어가 추가된다.
3계층 방어 모델 (Three-Layer Defense)
- 입력 가드레일 (Input Rails):
- 프롬프트 인젝션 탐지·차단
- 유해/부적절 콘텐츠 필터링
- 쿼리 형식 유효성 검증, PII 탐지
- 검색 가드레일 (Retrieval Rails):
- Self-Check Facts: 검색된 문서에 답변이 실제 근거하는지 검증
- 접근 권한 기반 문서 필터링 (Multi-tenancy)
- 출력 가드레일 (Output Rails):
- 환각 감지·차단
- PII 마스킹, 유해 콘텐츠 필터링
- 답변 형식 준수 검증
주요 도구
- NVIDIA NeMo Guardrails: Colang DSL로 프로그래밍 가능한 안전 제어 (입력/출력/주제 제어/환각 탐지)
- Guardrails AI: Pydantic 기반 출력 검증, 스키마 준수 강제
- 자체 구현: LLM-as-Judge로 입출력 검증 파이프라인 구축
관련 노트
- RAGOps — 운영 전반
- Agno Tools & Guardrails — 에이전트 프레임워크의 가드레일