전체 그래프
Papers

KARE

papersraggraphhealthcare

상위: Papers

원문 링크

  • share_link: (미등록)
  • doi: (미등록)
  • arxiv: (미등록)

KNOWLEDGE AWARE REASONING-ENHANCED FRAMEWORK

Community-Level Retrieval

  • 개념: 지식 그래프 내에서 '당뇨병', '인슐린 저항성', '혈당'처럼 밀접하게 연관된 개념들을 하나의 '커뮤니티(그룹)'로 사전 구성
  • 장점: 환자 정보가 입력되면 단편적인 키워드가 아닌, 가장 관련 있는 '지식 커뮤니티' 전체를 검색하여 훨씬 더 맥락에 맞고 풍부한 정보를 LLM에 제공

Methodology: 3-Step Framework

KARE

1. 의료 지식 그래프 구축 및 인덱싱 (KG Construction & Indexing)

실제 환자 데이터(EHR)에 기반한, 예측에 최적화된 고품질 지식 베이스 구축

1.1. 지식 추출 (Knowledge Extraction from 3 Sources)
  • 생물 의학 KG (UMLS): EHR 데이터에서 자주 함께 등장하는 개념 쌍(e.g., 당뇨병-고혈압)을 찾아, 이들을 잇는 최단 경로만 추출. (임상적 관련성 높은 지식의 뼈대 구성)
  • 의학 문헌 (PubMed): EHR의 진단/처방 기록을 키워드로 최신 논문을 검색하고, 관계 정보를 추출하여 KG에 추가. (최신 연구 결과 반영)
  • LLM: EHR 데이터를 기반으로 LLM에 질문하여 데이터에 명시되지 않은 숨겨진 관계를 추론. (미묘한 연결고리 발견)
1.2. 의미론적 클러스터링 (Semantic Clustering)
  • 목표: 여러 소스에서 온 동의어(e.g., '심근경색', '심장마비', 'MI')를 하나로 통일하여 지식의 중복을 제거하고 정제.
  • 과정:
    1. 임베딩: 모든 개념/관계를 LLM으로 의미 벡터(좌표)로 변환.
    2. 최적 기준점 탐색: '실루엣 점수'를 이용, "클러스터 내 거리는 최소화, 클러스터 간 거리는 최대화"하는 최적의 임계값을 자동 계산
      • $a(i)$ = 같은 클러스터 안 다른 점들과의 평균 거리
      • $b(i)$ = 가장 가까운 다른 클러스터와의 평균 거리
      • $s(i) = \frac{b(i) - a(i)}{\max(a(i), b(i))}$
        • $s(i) \approx 1$ → 같은 그룹끼리 가깝고, 다른 그룹과 멀다
        • $s(i) \approx 0$ → 경계선
        • $s(i) < 0$ → 다른 그룹에 속하는 게 더 적합
    3. 클러스터링 및 대표자 선정: 기준점에 따라 유사 개념들을 그룹화하고, 각 그룹의 의미적 중심이 되는 대표 용어를 선정.
    4. 그래프 정제: 모든 동의어를 대표 용어로 매핑하여 깨끗하고 정제된 최종 KG(G)를 완성.
1.3. 계층적 커뮤니티 인덱싱 (Hierarchical Community Indexing)
  • 목표: 정제된 KG를 검색하기 좋은 '계층적 폴더 구조'로 만들어 '스마트 인덱스'를 구축.
  • 과정:
    1. 커뮤니티 탐지: 라이덴 알고리즘을 사용해 관련성 높은 개념들을 자동으로 그룹화(커뮤니티)하고, 이를 여러 수준의 계층 구조로 구성.
      1. Local moving of nodes
        • 네트워크에 있는 각 노드가 다른 커뮤니티로 옮겨가면 품질(Modularity 같은 지표)이 좋아질지 확인
        • 좋아지면 그 노드를 옮김
        • 이 과정을 더 이상 개선이 안 될 때까지 반복
      2. Refinement of partitions
        • Louvain에서는 여기서 끝나지만, Leiden은 추가로 커뮤니티 내부를 검사
        • 어떤 커뮤니티가 사실은 서로 연결 안 된 조각일 수도 있음
        • 강제로 분리해서 모든 커뮤니티가 “연결된(subgraph connected)” 상태가 되도록
      3. Aggregation of the network
        • 커뮤니티들을 하나의 노드로 뭉쳐서 새로운 축소 그래프를 만듬
        • ex. “커뮤니티 1” → 노드 X, “커뮤니티 2” → 노드 Y 로 묶음.
        • 축소된 그래프에서 다시 1단계(Local moving)를 반복합니다.
      • [이동 → 세분화 → 축소] 를 반복
    2. 커뮤니티 요약: LLM을 이용해 각 커뮤니티의 내용을 요약한 태그(Tag) 생성.
      • 일반 요약: 커뮤니티의 전반적인 내용 요약.
      • 주제별 요약: 특정 과제(e.g., 사망률 예측)와 관련된 핵심 내용 요약.
    3. 계층적 색인 완성: 모든 커뮤니티와 요약 정보를 계층적으로 정리하여 최종 '지식 인덱스'를 완성

2. 환자 맥락 구성 및 증강 (Patient Context Construction & Augmentation)

환자 개인을 위한 '맞춤형 정보 브리핑 자료' 생성.

2.1. 기본 맥락 구성 (Base Context)
  • 과제 설명: 예측 목표 명시 (e.g., "30일 내 재입원율 예측")
  • 환자 EHR 요약: 진단, 시술, 약물 등 의료 기록을 시간순으로 정리.
  • 유사 환자 사례: 현재 환자와 가장 유사한 2명(결과가 같은 환자, 다른 환자)의 사례를 첨부하여 대조 학습(Contrastive Learning) 효과 유도.
2.2. 지식 증강 (Knowledge Augmentation with DGRA)
  • 목표: 1단계에서 만든 지식 인덱스에서 현재 환자에게 가장 유용한 '지식 커뮤니티 요약'을 동적으로 선택하여 기본 맥락에 추가.
  • 과정 (DGRA 알고리즘): 필요한 수(N개)의 요약이 모일 때까지 아래 과정을 반복.
    1. 모든 커뮤니티에 대해 종합 관련성 점수 계산.
      • 연관성 (Node Hits): 환자 EHR과 직접/간접적으로 얼마나 관련 있는가?
      • 다양성 (Decay): 이전에 선택된 정보와 얼마나 다른 새로운 정보를 제공하는가?
      • 일관성 (Coherence): 환자의 전체적인 맥락과 내용이 얼마나 잘 맞는가?
      • 최신성 (Recency): 환자의 최근 상태와 얼마나 관련이 깊은가?
      • 주제 적합성 (Theme Relevance): 예측 과제의 주제와 얼마나 부합하는가?
    2. 점수가 가장 높은 커뮤니티의 요약을 선택하여 브리핑 자료에 추가.
    3. 선택된 커뮤니티는 후보에서 제외 후, 점수를 다시 계산하여 다음 최적의 커뮤니티를 선택.

3. 추론 강화 예측 (Reasoning-Enhanced Prediction)

'설명 능력'과 '예측 능력'을 동시에 갖춘 작고 효율적인 최종 모델을 훈련

3.1. 훈련 샘플 생성 (Training Sample Generation)
  • LLM(고성능 모델)을 활용하여 고품질의 '설명 가능한(Explainable)' 훈련 데이터셋 구축.
  • 과정: LLM에게 과제, 증강된 환자 맥락(2단계 결과물), 실제 정답을 모두 제공하고, 정답에 이르는 논리적 '추론 과정(Reasoning Chain)'을 생성하도록 함. 이 중 가장 신뢰도 높은 추론 과정을 최종 훈련 데이터로 채택.

Training Dataset

  • Task description
  • Augmented patient context
  • Ground Truth
  • Best reasoning chain
3.2. 멀티태스크 미세조정 및 예측 (Multitask Fine-Tuning & Prediction)
  • LLM(작고 효율적인 모델)을 두 가지 과제로 동시에 훈련.
    1. 추론 훈련 [Reasoning]: 선생님 LLM이 만든 '모범 풀이 과정'을 따라 하도록 학습 → 설명 능력 확보.
    2. 예측 훈련 [Label Prediction]: '실제 정답'을 맞히도록 학습 → 예측 정확도 확보.
  • 실전 활용: 훈련된 단일 모델에 지시문([Reasoning] 또는 [Label Prediction])을 달리하여, 필요에 따라 상세한 설명을 얻거나 빠른 예측 결과를 얻는 유연한 활용이 가능.

Test dataset

llama3.3:70b

관련 노트