요약
기업의 재무 데이터, 고객 목록 등 표(Table) 형식의 정형 데이터를 RAG 시스템에서 활용
정형 데이터에 대한 자연어 질의응답이 가능해져, 데이터 분석가나 개발자가 아니어도 누구나 데이터에 접근하고 인사이트를 얻을 수 있음.
작동 방식
- CSV 파일의 각 행(row)을 하나의 '문서'로 취급
- 각 행의 내용을 텍스트로 변환하고 임베딩하여 Vector DB에 저장
- 예:
제품명: 노트북, 가격: 150만원, 재고: 30개라는 행을 하나의 텍스트 덩어리로 만들어 검색 대상에 포함
한계와 대안
- 집계 질문에 약함: "평균 가격은?" 같은 질문은 행 몇 개를 검색해서는 답할 수 없음 → 이런 경우 LLM이 SQL/Pandas 코드를 생성해 직접 계산하는 Text-to-SQL 방식이 적합
- 행이 많으면 유사 행이 대량 검색됨 → 컬럼 요약·메타데이터 필터와 병행
- 행 단위 검색은 "이 제품 재고 있어?" 같은 개별 조회형 질문에 적합