요약
"질문과 문서는 벡터 공간에서 가깝다"는 가정을 넘어, "질문과 그에 대한 이상적인 답변은 벡터 공간에서 가깝다"는 아이디어를 활용
질문은 짧고 추상적이지만 문서는 길고 구체적이라, 질문 벡터로 문서를 찾으면 어휘·형태 차이 때문에 놓치는 경우가 많음. HyDE는 이 간극을 "가상의 답변"으로 메움.
작동 방식
- 사용자의 질문 수신
- LLM으로 이 질문에 대한 가상의 완벽한 답변(문서)을 즉석 생성
- 실제 문서가 아닌 이 '가상 답변'을 벡터로 변환
- 이 벡터로 Vector DB에서 실제 문서들을 검색
장단점
- 장점: 복잡하고 추상적인 질문에서 검색의 방향성을 명확히 잡아 정확도를 크게 향상. 질문-문서 간 표현 차이(vocabulary mismatch)에 강함
- 단점: LLM 호출이 한 번 추가되어 지연시간·비용 증가. 가상 답변이 환각이면 검색도 엉뚱한 방향으로 갈 수 있음 — 모델이 전혀 모르는 최신·사내 지식 질문에는 오히려 불리
- 짧은 키워드성 질문에는 효과가 작고, 서술형·추론형 질문에서 이득이 큼