상위: Papers
원문 링크
- share_link: (미등록)
- doi: (미등록)
- arxiv: (미등록)
KNOWLEDGE AWARE REASONING-ENHANCED FRAMEWORK
Community-Level Retrieval
- 개념: 지식 그래프 내에서 '당뇨병', '인슐린 저항성', '혈당'처럼 밀접하게 연관된 개념들을 하나의 '커뮤니티(그룹)'로 사전 구성
- 장점: 환자 정보가 입력되면 단편적인 키워드가 아닌, 가장 관련 있는 '지식 커뮤니티' 전체를 검색하여 훨씬 더 맥락에 맞고 풍부한 정보를 LLM에 제공
Methodology: 3-Step Framework

1. 의료 지식 그래프 구축 및 인덱싱 (KG Construction & Indexing)
실제 환자 데이터(EHR)에 기반한, 예측에 최적화된 고품질 지식 베이스 구축
1.1. 지식 추출 (Knowledge Extraction from 3 Sources)
- 생물 의학 KG (UMLS): EHR 데이터에서 자주 함께 등장하는 개념 쌍(e.g., 당뇨병-고혈압)을 찾아, 이들을 잇는 최단 경로만 추출. (임상적 관련성 높은 지식의 뼈대 구성)
- 의학 문헌 (PubMed): EHR의 진단/처방 기록을 키워드로 최신 논문을 검색하고, 관계 정보를 추출하여 KG에 추가. (최신 연구 결과 반영)
- LLM: EHR 데이터를 기반으로 LLM에 질문하여 데이터에 명시되지 않은 숨겨진 관계를 추론. (미묘한 연결고리 발견)
1.2. 의미론적 클러스터링 (Semantic Clustering)
- 목표: 여러 소스에서 온 동의어(e.g., '심근경색', '심장마비', 'MI')를 하나로 통일하여 지식의 중복을 제거하고 정제.
- 과정:
- 임베딩: 모든 개념/관계를 LLM으로 의미 벡터(좌표)로 변환.
- 최적 기준점 탐색: '실루엣 점수'를 이용, "클러스터 내 거리는 최소화, 클러스터 간 거리는 최대화"하는 최적의 임계값을 자동 계산
- $a(i)$ = 같은 클러스터 안 다른 점들과의 평균 거리
- $b(i)$ = 가장 가까운 다른 클러스터와의 평균 거리
- $s(i) = \frac{b(i) - a(i)}{\max(a(i), b(i))}$
- $s(i) \approx 1$ → 같은 그룹끼리 가깝고, 다른 그룹과 멀다
- $s(i) \approx 0$ → 경계선
- $s(i) < 0$ → 다른 그룹에 속하는 게 더 적합
- 클러스터링 및 대표자 선정: 기준점에 따라 유사 개념들을 그룹화하고, 각 그룹의 의미적 중심이 되는 대표 용어를 선정.
- 그래프 정제: 모든 동의어를 대표 용어로 매핑하여 깨끗하고 정제된 최종 KG(G)를 완성.
1.3. 계층적 커뮤니티 인덱싱 (Hierarchical Community Indexing)
- 목표: 정제된 KG를 검색하기 좋은 '계층적 폴더 구조'로 만들어 '스마트 인덱스'를 구축.
- 과정:
- 커뮤니티 탐지: 라이덴 알고리즘을 사용해 관련성 높은 개념들을 자동으로 그룹화(커뮤니티)하고, 이를 여러 수준의 계층 구조로 구성.
- Local moving of nodes
- 네트워크에 있는 각 노드가 다른 커뮤니티로 옮겨가면 품질(Modularity 같은 지표)이 좋아질지 확인
- 좋아지면 그 노드를 옮김
- 이 과정을 더 이상 개선이 안 될 때까지 반복
- Refinement of partitions
- Louvain에서는 여기서 끝나지만, Leiden은 추가로 커뮤니티 내부를 검사
- 어떤 커뮤니티가 사실은 서로 연결 안 된 조각일 수도 있음
- 강제로 분리해서 모든 커뮤니티가 “연결된(subgraph connected)” 상태가 되도록
- Aggregation of the network
- 커뮤니티들을 하나의 노드로 뭉쳐서 새로운 축소 그래프를 만듬
- ex. “커뮤니티 1” → 노드 X, “커뮤니티 2” → 노드 Y 로 묶음.
- 축소된 그래프에서 다시 1단계(Local moving)를 반복합니다.
- [이동 → 세분화 → 축소] 를 반복
- Local moving of nodes
- 커뮤니티 요약: LLM을 이용해 각 커뮤니티의 내용을 요약한 태그(Tag) 생성.
- 일반 요약: 커뮤니티의 전반적인 내용 요약.
- 주제별 요약: 특정 과제(e.g., 사망률 예측)와 관련된 핵심 내용 요약.
- 계층적 색인 완성: 모든 커뮤니티와 요약 정보를 계층적으로 정리하여 최종 '지식 인덱스'를 완성
- 커뮤니티 탐지: 라이덴 알고리즘을 사용해 관련성 높은 개념들을 자동으로 그룹화(커뮤니티)하고, 이를 여러 수준의 계층 구조로 구성.
2. 환자 맥락 구성 및 증강 (Patient Context Construction & Augmentation)
환자 개인을 위한 '맞춤형 정보 브리핑 자료' 생성.
2.1. 기본 맥락 구성 (Base Context)
- 과제 설명: 예측 목표 명시 (e.g., "30일 내 재입원율 예측")
- 환자 EHR 요약: 진단, 시술, 약물 등 의료 기록을 시간순으로 정리.
- 유사 환자 사례: 현재 환자와 가장 유사한 2명(결과가 같은 환자, 다른 환자)의 사례를 첨부하여 대조 학습(Contrastive Learning) 효과 유도.
2.2. 지식 증강 (Knowledge Augmentation with DGRA)
- 목표: 1단계에서 만든 지식 인덱스에서 현재 환자에게 가장 유용한 '지식 커뮤니티 요약'을 동적으로 선택하여 기본 맥락에 추가.
- 과정 (DGRA 알고리즘): 필요한 수(N개)의 요약이 모일 때까지 아래 과정을 반복.
- 모든 커뮤니티에 대해 종합 관련성 점수 계산.
- 연관성 (Node Hits): 환자 EHR과 직접/간접적으로 얼마나 관련 있는가?
- 다양성 (Decay): 이전에 선택된 정보와 얼마나 다른 새로운 정보를 제공하는가?
- 일관성 (Coherence): 환자의 전체적인 맥락과 내용이 얼마나 잘 맞는가?
- 최신성 (Recency): 환자의 최근 상태와 얼마나 관련이 깊은가?
- 주제 적합성 (Theme Relevance): 예측 과제의 주제와 얼마나 부합하는가?
- 점수가 가장 높은 커뮤니티의 요약을 선택하여 브리핑 자료에 추가.
- 선택된 커뮤니티는 후보에서 제외 후, 점수를 다시 계산하여 다음 최적의 커뮤니티를 선택.
- 모든 커뮤니티에 대해 종합 관련성 점수 계산.
3. 추론 강화 예측 (Reasoning-Enhanced Prediction)
'설명 능력'과 '예측 능력'을 동시에 갖춘 작고 효율적인 최종 모델을 훈련
3.1. 훈련 샘플 생성 (Training Sample Generation)
- LLM(고성능 모델)을 활용하여 고품질의 '설명 가능한(Explainable)' 훈련 데이터셋 구축.
- 과정: LLM에게
과제,증강된 환자 맥락(2단계 결과물),실제 정답을 모두 제공하고, 정답에 이르는 논리적 '추론 과정(Reasoning Chain)'을 생성하도록 함. 이 중 가장 신뢰도 높은 추론 과정을 최종 훈련 데이터로 채택.
Training Dataset
- Task description
- Augmented patient context
- Ground Truth
- Best reasoning chain
3.2. 멀티태스크 미세조정 및 예측 (Multitask Fine-Tuning & Prediction)
- LLM(작고 효율적인 모델)을 두 가지 과제로 동시에 훈련.
- 추론 훈련
[Reasoning]: 선생님 LLM이 만든 '모범 풀이 과정'을 따라 하도록 학습 → 설명 능력 확보. - 예측 훈련
[Label Prediction]: '실제 정답'을 맞히도록 학습 → 예측 정확도 확보.
- 추론 훈련
- 실전 활용: 훈련된 단일 모델에 지시문(
[Reasoning]또는[Label Prediction])을 달리하여, 필요에 따라 상세한 설명을 얻거나 빠른 예측 결과를 얻는 유연한 활용이 가능.
Test dataset
llama3.3:70b
관련 노트
- 논문: LightRAG, MedGraphRAG, ODKE+, Pathway
- 개념: Graph RAG, Knowledge Graph, RAGOps, Graph Database
- See also: ApeRAG, N-RAG Manual