상위: Papers
원문 링크
- share_link: (미등록)
- doi: (미등록)
- arxiv: (미등록)
Triple Graph Construction
- 정의: [사용자 데이터, 신뢰할 수 있는 출처, 공식적인 정의]라는 3가지 요소를 한 묶음으로 연결하여 지식 그래프를 구성
- 예시: [환자의 '고혈당' 증상(데이터), 관련 의학 논문(출처), '당뇨병'의 의학사전 정의(정의)]를 하나의 정보 단위로 연결
- 효과: 생성된 답변의 근거를 명확히 추적할 수 있게 하여 추적성(Traceability)과 설명 가능성(Explainability)을 확보
U-Retrieval
- 정의: 비용이 많이 드는 기존의 그래프 커뮤니티 분석 대신, 의료 태그를 이용한 효율적인 U자형 검색 전략
- 하향식 (Top-down) 정밀 검색: 방대한 정보 속에서 질문과 가장 연관 깊은 특정 정보(메타-메드그래프)를 찾아내어 초기 답변을 생성
- 상향식 (Bottom-up) 답변 정제: 초기 답변을 기반으로, 더 넓은 맥락의 상위 태그 정보를 단계적으로 통합하며 답변의 완성도를 높임
- 효과: 검색의 효율성과 답변의 정확성 및 포괄성을 모두 달성
Method

1. 의료 그래프 구축 (Medical Graph Construction)
1.1. 의미 기반 문서 분할 (Semantic Document Chunking)
- 목표: 긴 의료 문서를 문맥이 끊기지 않도록 의미적으로 연관된 덩어리(Chunk)로 나눔
- 과정:
- 기본 분할: 줄 바꿈을 기준으로 문서를 단락(P_1,P_2,...)으로 분리
- 의미적 결합 (LLM as a judge): LLM이 현재 단락이 이전 덩어리와 주제적으로 일관성이 있는지 판단
- 덩어리 확정:
- 주제가 같고 LLM의 최대 토큰 제한을 넘지 않으면 기존 덩어리에 추가
- 주제가 다르거나 토큰 제한을 초과하면 새로운 덩어리를 시작
- 슬라이딩 윈도우: 판단의 정확도를 높이기 위해, 최근 5개 단락의 흐름을 함께 고려하여 주제 일관성을 평가
1.2. 개체 추출 (Entities Extraction)
- 목표: 의미 덩어리에서 그래프의 기본 재료가 될 핵심 의료 정보(개체)를 추출.
- 과정: LLM이 각 덩어리에서 중요한 개체를 찾아내어 다음과 같은 구조화된 정보로 만듬.
e = {na, ty, cx}na (name): 개체의 이름 (예: "제2형 당뇨병")ty (type): 개체의 유형. UMLS 표준에 따라 분류. (예: "질병 또는 증후군")cx (context): 문맥 정보. 해당 개체가 사용된 맥락을 요약한 문장.
1.3. 삼중 연결 (Triple Linking)
- 목표: 추출된 개체들을 신뢰할 수 있는 외부 지식과 계층적으로 연결
- 삼중 그래프 구조 (3-Tier Architecture):
- 1층 (사용자 RAG 그래프): 사용자 문서(환자 기록 등)에서 추출한 개체(E1).
- 2층 (RepoGraph - 문헌): 의학 논문, 교과서 등에서 추출한 개체(E2).
- 3층 (RepoGraph - 사전): UMLS와 같은 표준 의학 사전의 개체(E3).
- 연결 방식:
- 콘텐츠 임베딩으로 각 개체 정보를 벡터로 변환한 뒤, 코사인 유사도를 계산하여 관련도를 측정
- 참조 관계 (TheReferenceOf): 1층 개체 ↔ 2층 개체
- 정의 관계 (the definition of): 2층 개체 ↔ 3층 개체
1.4. 관계 연결 (Relationship Linking)
- 목표: 같은 덩어리 내의 개체들 사이에 어떤 관계가 있는지 정의하여 그래프를 완성
- 과정: LLM이 두 개체 사이의 관계를 설명하는 문구를 생성
- 판단 근거:
- 덩어리 내의 문맥 정보 (예: 환자 기록에 나온 '메트포르민'과 '제2형 당뇨병')
- 3단계에서 연결된 외부 문헌의 관련 내용 (예: 교과서의 '메트포르민' 설명)
- 결과물: 각 의미 덩어리는 하나의 메타-메드그래프(Meta-MedGraph)라는 작은 지식 그래프로 완성
2. 그래프 태깅 (Tag the Graphs)
- 목표: 수많은 메타-메드그래프를 효율적으로 검색할 수 있도록 계층적 태그 구조를 만듬
- 과정:
- 기초 태그 생성: LLM이 각 메타-메드그래프를 보고 "증상", "약물" 등 미리 정의된 카테고리에 맞춰 내용을 요약한 태그-요약(T_m)을 생성 (0층)
- 계층적 클러스터링: 태그-요약의 유사도를 기반으로 비슷한 그래프들을 그룹화. 이 그룹을 대표하는 더 추상적인 상위 레벨 태그-요약을 다시 생성. 이 과정을 반복하여 총 12개의 계층 구조를 만듬
3. U-검색 (U-Retrieval)
- 목표: 계층적 태그 구조를 활용하여 질문에 대한 답변을 생성하고 정제
- 과정:
- 하향식 검색: 사용자 질문 역시 태그로 변환한 뒤, 태그 계층 구조의 최상위부터 가장 유사한 태그를 따라 내려가 최종 목표 그래프를 찾고, 이를 바탕으로 초안 답변을 생성
- 상향식 정제: 내려왔던 경로를 다시 거슬러 올라가면서 각 상위 레벨의 요약 태그 정보를 활용하여 초안 답변을 점진적으로 수정하고 보강
- 최종 답변 생성: 4~6개 레이어를 거쳐 정제가 끝나면 최종 답변을 사용자에게 제공
TEST
llama3.3:70b

관련 노트
- 논문: KARE, LightRAG, ODKE+, Pathway
- 개념: Graph RAG, Knowledge Graph, RAGOps, Graph Database
- See also: ApeRAG, N-RAG Manual