상위: LLMOps
요약
새로운 기능을 테스트하기 위한 데이터가 부족할 때, 코드를 통해 인위적으로 테스트 데이터를 생성하는 방법. 특히 LLM 애플리케이션에서는 다른 LLM을 이용해 특정 기능을 검증하는 질문·답변 쌍을 대량 생성할 수 있어 테스트 커버리지를 빠르게 넓힐 수 있음.
주요 기법
- 입력 변형 생성: 같은 의도를 여러 표현으로 변형 (예: 환불 문의를 반말/존댓말/축약형으로) → 모델의 강건성(Robustness) 테스트
- 입력-출력 쌍 생성: 지식 베이스를 기반으로 LLM이 질문과 이상적 답변 쌍을 생성 → 전문가 검토 후 평가 데이터셋으로 활용
- 사용자 상호작용 시뮬레이션: LLM이 사용자와 에이전트 역할을 번갈아 맡아 다중 턴 대화를 생성 → 현실적인 대화 관리 능력 평가
주의점
- 생성 데이터의 품질은 프롬프트 엔지니어링에 크게 좌우됨
- 합성 데이터는 테스트의 폭을 넓히는 용도 — 신뢰도의 기준선은 전문가가 검증한 골든 데이터셋이 담당
- 생성 모델의 편향이 테스트셋에 그대로 전이될 수 있어 샘플 검수 필요