상위: Papers
원문 링크
- share_link: (미등록)
- doi: (미등록)
- arxiv: https://arxiv.org/abs/2509.04696
Ontology-Guided Open-Domain Knowledge Extraction with LLMs

1. Extraction Initiator
- 누락/오래된 사실 식별
- 업데이트 필요 엔티티 결정
- 구조화된 형식으로 출력
웹 페이지 업데이트/추가 감지
↓
관련 엔티티 식별
↓
사실 재평가 일정 등록
2. Evidence Retriever
- 선택된 주체와 URL에 대한 웹 문서 검색
- 다운스트림 추출을 위한 문서 코퍼스 제공
입력: ⟨주체, URL, 로케일⟩
↓
웹 크롤 인덱스에서 페이지 검색
↓
출력: 관련 문서 코퍼스
3. Knowledge Extractor
검색된 문서에서 사실 값 추출 및 출처 연결
3.1. Pattern-based Extractors
고정밀 반구조화 데이터(위키피디아 인포박스)에 최적화
- Predicate Mapper: 인포박스 키 → KG 술어 매핑
- 예:
Height→P2048(Wikidata)
- 예:
- Value Extractor: 정규표현식 기반 값 추출
- 다양한 형식 지원: "6 ft 0 in", "184 cm"
- 하이퍼링크된 엔티티 추출
- Value Aggregator: 다중 후보 통합
- 이상값/불일치 필터링
- 단일 신뢰값 선택
3.2. LLM-based Extractors
- 비구조화/반구조화 데이터 모두 처리 가능
- 엔티티 유형 간 일반화
- 개방형 도메인에 적응적
- 맞춤 구성 없이 모든 술어 지원
- Prompt Generator
- 엔티티 유형별 온톨로지 스니펫 동적 생성
- 포함 내용:
- 술어 이름 & 설명
- 필수 한정자(qualifiers)
- 허용 단위 목록
- Extraction
- LLM이 키-값 쌍 추출
- 복합 값 자동 분해
- 예: 출생 이벤트 → 날짜 + 위치
- Schema Mapping
- 추출값 ↔ 온톨로지 술어 정렬
- 의미론적 단서 활용
- Schema Translation
- 정규화/수집 가능한 구조화 형식으로 직렬화
3.3. 온톨로지 스니펫 생성 파이프라인 (Offline)

- Ranked Property Generation
- 각 엔티티 유형별로 중요한 술어 선별 및 순위화
- 프로세스:
- 온톨로지 분석
- 엔티티 타입별 술어 목록 추출
- 순위화 기준:
- 빈도: KG에서 얼마나 자주 사용되는가
- 의미론적 중요성: 해당 엔티티 타입에 얼마나 핵심적인가
- Predicate Enrichment
- 다중 소스 통합으로 술어 정보 완전화
- 입력 소스:
- 온톨로지 메타데이터
- Wikidata 온톨로지
- 실제 KG 사용 패턴
- 출력: Predicate 360 (술어의 360도 전방위 뷰)
- 온톨로지 메타데이터
- Wikidata 정보
- KG 실사용 패턴
- Normalization Config Generator
- 값 정규화가 필요한 술어 식별 및 규칙 생성
- 처리 대상:
- 수량 (Quantities): 단위 변환 필요
- 날짜/시간: 형식 통일 필요
- 화폐: 통화 단위 변환 필요
- 출력: 온톨로지 스니펫
4. Grounder
LLM 추출 결과의 사실 검증 필터링 모듈
- 추출된 트리플 → 자연어 주장(assertion) 변환
- 그라운더 LLM에게 검증 요청
- Yes/No 판정
5. Corroborator
추출된 사실의 정규화, 통합 및 신뢰도 평가 모듈
- 최종 신뢰 가능한 사실 선별
- 충돌 해결 및 일관성 확보
- 사실 정확성 극대화
5.1. Normalization
목적: 다양한 형식을 표준화된 형식으로 변환 도구: Duckling (2016) 예시:
| 입력 형식 | 표준화 출력 | 타입 |
|---|---|---|
| "6 ft" | 182.88 cm | 길이 |
| "5 feet 11 inches" | 180.34 cm | 길이 |
| "July 4, 1776" | 1776-07-04 | 날짜 |
| "2000년 1월 1일" | 2000-01-01 | 날짜 |
| "$100 million" | 100000000 USD | 화폐 |
추가 로직:
- 술어별 정규화 규칙 적용
- 폴백(fallback) 전략: 표준 도구 실패 시 대체 방법
5.2. Consolidation
목적: 중복 제거 및 충돌 해결 처리 방식:
같은 주체 & 술어의 여러 후보값 집계
↓
동등한 값 통합
↓
불일치 제거
↓
최종 후보 목록
예시:
주체: Taylor Swift
술어: height
후보값:
- 180 cm (패턴 추출기)
- 5'11" (LLM 추출기 1) → 180.34 cm로 정규화
- 180 cm (LLM 추출기 2)
통합 결과:
→ 180 cm (빈도: 3, 신뢰도: 높음)
5.3. Scoring & Ranking
평가 방식: 휴리스틱 + 모델 기반 조합 4가지 주요 평가 특징:
- 추출기 유형: 패턴 기반 vs. LLM 기반
- 신뢰도 점수: 추출기가 부여한 확신도 (0.0 ~ 1.0)
- 빈도: 여러 소스에서 동일 값 출현 횟수 (많을수록 신뢰 ↑)
- 답변의 풍부함: 한정자 등 추가 정보 포함 여부 (풍부할수록 신뢰 ↑)
1. 규칙 기반 (Rule-based)
- 적용 대상: 모호성 낮은 술어
- 방식: 사전 정의된 규칙으로 순위화
- 예시:
if 빈도 > 3 and 추출기 = 패턴:
점수 = 높음
2. AutoML 기반 (Model-based)
- 적용 대상: 복잡한 시나리오
- 도구: H2O (LeDell and Poirier, 2020)
- 방식:
- 가중치 함수 학습
- 특징 조합 최적화
- 자동 순위화
6. Data Export & KG Ingestion
검증된 사실을 지식 그래프에 통합하는 최종 단계
- 식별자가 있는 소스 -> 기존 KG 노드에 직접 연결
- 식별자가 없는 경우 -> ML 기반 엔티티 연결 모델을 사용하여 기존 엔티티와 매칭하거나 새 엔티티를 생성
- 이름 유사도
- 속성 일치
- 컨텍스트 유사성
Corroborator
↓
데이터 내보내기 (트리플 + 메타데이터)
↓
엔티티 연결
├─ 식별자 있음 → 직접 연결
└─ 식별자 없음 → ML 매칭 → 연결 or 생성
↓
KG 통합 완료
Result
-
인간 큐레이션을 통한 정밀도(Precision) 감사 (Human Curation Audit):
- 방법: 전담 "KG 품질팀"이 매주 무작위로 샘플링된 약 2,000개의 추출된 사실(Triples)을 직접 검토하여 정확성을 평가합니다.
- 핵심 지표: 정밀도(Precision). ODKE+는 프로덕션 환경 유지를 위해 95% 이상의 정밀도를 지속적으로 달성해야 하며, 실제로 이 기준을 충족하고 있다고 언급합니다 (결과 섹션에서 98.8% 달성 보고).
-
Side-by-Side (SBS) 평가를 통한 사용자 선호도 측정:
- 방법: 매주 실제 사용자의 지식 그래프(KG) 쿼리 샘플을 평가자(Annotator)에게 제시합니다. 평가자는 기존 시스템(Incumbent)의 답변과 ODKE+가 생성한 답변을 나란히 비교하고 어느 쪽이 더 나은지 평가합니다 (어떤 시스템의 답변인지 모르는 상태, 즉 블라인드 테스트).
- 핵심 지표: 사용자 선호도(User Preference). 평가자들이 약 3분의 2 경우에 ODKE+의 답변을 선호한다고 보고합니다. 이는 추출된 정보가 실제 사용자에게 더 유용하고 만족스럽다는 것을 의미합니다.
-
핵심 성능 지표 (KPIs) 측정:
- 커버리지(Coverage):
- 기존 파이프라인 대비 답변 가능한 사용자 쿼리가 10% 증가했음을 보여줍니다.
- 제3자 지식 그래프(예: Wikidata)와 비교했을 때 **48%의 정보 중복(Overlap)**을 달성했다고 보고합니다. (Table 2)
- 최신성(Freshness): ODKE+를 통해 추출된 새로운 사실이 기존 KG 워크플로우보다 평균적으로 약 50일 더 빨리 반영된다고 보고합니다.
- 처리량 및 안정성: 프로덕션 환경에서 하루 평균 15만~25만 개의 새로운 사실을 처리하며, 99.9% 이상의 성공률을 유지한다고 언급합니다.
- 커버리지(Coverage):
-
구성 요소 영향 분석 (Component Impact Analysis):
- Grounder(검증기) 효과: Grounder 모듈을 도입함으로써 LLM의 환각(Hallucination)으로 인한 잘못된 추출이 35% 감소했다고 분석합니다.
- Corroborator(통합기) 효과: Corroborator의 순위 결정(Ranking) 및 통합 과정을 거치면서, 초기 LLM 추출 결과의 정밀도가 91%에서 최종 98.8%까지 향상되었음을 보여줍니다.
관련 노트
- 논문: KARE, LightRAG, MedGraphRAG, Pathway
- 개념: Graph RAG, Knowledge Graph, RAGOps, Graph Database
- See also: ApeRAG, N-RAG Manual