전체 그래프
Papers

ODKE+

papersragontologyextraction

상위: Papers

원문 링크

Ontology-Guided Open-Domain Knowledge Extraction with LLMs

ODKE+ ODKE+

1. Extraction Initiator

  • 누락/오래된 사실 식별
  • 업데이트 필요 엔티티 결정
  • 구조화된 형식으로 출력
 페이지 업데이트/추가 감지
    
관련 엔티티 식별
    
사실 재평가 일정 등록

2. Evidence Retriever

  • 선택된 주체와 URL에 대한 웹 문서 검색
  • 다운스트림 추출을 위한 문서 코퍼스 제공
입력: ⟨주체, URL, 로케일⟩
    
 크롤 인덱스에서 페이지 검색
    
출력: 관련 문서 코퍼스

3. Knowledge Extractor

검색된 문서에서 사실 값 추출 및 출처 연결

3.1. Pattern-based Extractors

고정밀 반구조화 데이터(위키피디아 인포박스)에 최적화

  1. Predicate Mapper: 인포박스 키 → KG 술어 매핑
    • 예: HeightP2048 (Wikidata)
  2. Value Extractor: 정규표현식 기반 값 추출
    • 다양한 형식 지원: "6 ft 0 in", "184 cm"
    • 하이퍼링크된 엔티티 추출
  3. Value Aggregator: 다중 후보 통합
    • 이상값/불일치 필터링
    • 단일 신뢰값 선택
3.2. LLM-based Extractors
  • 비구조화/반구조화 데이터 모두 처리 가능
  • 엔티티 유형 간 일반화
  • 개방형 도메인에 적응적
  • 맞춤 구성 없이 모든 술어 지원
  1. Prompt Generator
  • 엔티티 유형별 온톨로지 스니펫 동적 생성
  • 포함 내용:
    • 술어 이름 & 설명
    • 필수 한정자(qualifiers)
    • 허용 단위 목록
  1. Extraction
    • LLM이 키-값 쌍 추출
    • 복합 값 자동 분해
      • 예: 출생 이벤트 → 날짜 + 위치
  2. Schema Mapping
    • 추출값 ↔ 온톨로지 술어 정렬
    • 의미론적 단서 활용
  3. Schema Translation
    • 정규화/수집 가능한 구조화 형식으로 직렬화
3.3. 온톨로지 스니펫 생성 파이프라인 (Offline)

ODKE+

  1. Ranked Property Generation
    • 각 엔티티 유형별로 중요한 술어 선별 및 순위화
    • 프로세스:
      • 온톨로지 분석
      • 엔티티 타입별 술어 목록 추출
      • 순위화 기준:
        • 빈도: KG에서 얼마나 자주 사용되는가
        • 의미론적 중요성: 해당 엔티티 타입에 얼마나 핵심적인가
  2. Predicate Enrichment
    • 다중 소스 통합으로 술어 정보 완전화
    • 입력 소스:
      1. 온톨로지 메타데이터
      2. Wikidata 온톨로지
      3. 실제 KG 사용 패턴
    • 출력: Predicate 360 (술어의 360도 전방위 뷰)
      • 온톨로지 메타데이터
      • Wikidata 정보
      • KG 실사용 패턴
  3. Normalization Config Generator
    • 값 정규화가 필요한 술어 식별 및 규칙 생성
    • 처리 대상:
      • 수량 (Quantities): 단위 변환 필요
      • 날짜/시간: 형식 통일 필요
      • 화폐: 통화 단위 변환 필요
    • 출력: 온톨로지 스니펫

4. Grounder

LLM 추출 결과의 사실 검증 필터링 모듈

  1. 추출된 트리플 → 자연어 주장(assertion) 변환
  2. 그라운더 LLM에게 검증 요청
  3. Yes/No 판정

5. Corroborator

추출된 사실의 정규화, 통합 및 신뢰도 평가 모듈

  • 최종 신뢰 가능한 사실 선별
  • 충돌 해결 및 일관성 확보
  • 사실 정확성 극대화
5.1. Normalization

목적: 다양한 형식을 표준화된 형식으로 변환 도구: Duckling (2016) 예시:

입력 형식표준화 출력타입
"6 ft"182.88 cm길이
"5 feet 11 inches"180.34 cm길이
"July 4, 1776"1776-07-04날짜
"2000년 1월 1일"2000-01-01날짜
"$100 million"100000000 USD화폐

추가 로직:

  • 술어별 정규화 규칙 적용
  • 폴백(fallback) 전략: 표준 도구 실패 시 대체 방법
5.2. Consolidation

목적: 중복 제거 및 충돌 해결 처리 방식:

같은 주체 & 술어의 여러 후보값 집계
    
동등한  통합
    
불일치 제거
    
최종 후보 목록

예시:

주체: Taylor Swift
술어: height

후보값:
- 180 cm (패턴 추출기)
- 5'11" (LLM 추출기 1) → 180.34 cm로 정규화
- 180 cm (LLM 추출기 2)

통합 결과:
→ 180 cm (빈도: 3, 신뢰도: 높음)
5.3. Scoring & Ranking

평가 방식: 휴리스틱 + 모델 기반 조합 4가지 주요 평가 특징:

  • 추출기 유형: 패턴 기반 vs. LLM 기반
  • 신뢰도 점수: 추출기가 부여한 확신도 (0.0 ~ 1.0)
  • 빈도: 여러 소스에서 동일 값 출현 횟수 (많을수록 신뢰 ↑)
  • 답변의 풍부함: 한정자 등 추가 정보 포함 여부 (풍부할수록 신뢰 ↑)

1. 규칙 기반 (Rule-based)

  • 적용 대상: 모호성 낮은 술어
  • 방식: 사전 정의된 규칙으로 순위화
  • 예시:
  if 빈도 > 3 and 추출기 = 패턴:
      점수 = 높음

2. AutoML 기반 (Model-based)

  • 적용 대상: 복잡한 시나리오
  • 도구: H2O (LeDell and Poirier, 2020)
  • 방식:
    • 가중치 함수 학습
    • 특징 조합 최적화
    • 자동 순위화

6. Data Export & KG Ingestion

검증된 사실을 지식 그래프에 통합하는 최종 단계

  • 식별자가 있는 소스 -> 기존 KG 노드에 직접 연결
  • 식별자가 없는 경우 -> ML 기반 엔티티 연결 모델을 사용하여 기존 엔티티와 매칭하거나 새 엔티티를 생성
    • 이름 유사도
    • 속성 일치
    • 컨텍스트 유사성
Corroborator
    
데이터 내보내기 (트리플 + 메타데이터)
    
엔티티 연결
├─ 식별자 있음  직접 연결
└─ 식별자 없음  ML 매칭  연결 or 생성
    
KG 통합 완료

Result

  1. 인간 큐레이션을 통한 정밀도(Precision) 감사 (Human Curation Audit):

    • 방법: 전담 "KG 품질팀"이 매주 무작위로 샘플링된 약 2,000개의 추출된 사실(Triples)을 직접 검토하여 정확성을 평가합니다.
    • 핵심 지표: 정밀도(Precision). ODKE+는 프로덕션 환경 유지를 위해 95% 이상의 정밀도를 지속적으로 달성해야 하며, 실제로 이 기준을 충족하고 있다고 언급합니다 (결과 섹션에서 98.8% 달성 보고).
  2. Side-by-Side (SBS) 평가를 통한 사용자 선호도 측정:

    • 방법: 매주 실제 사용자의 지식 그래프(KG) 쿼리 샘플을 평가자(Annotator)에게 제시합니다. 평가자는 기존 시스템(Incumbent)의 답변과 ODKE+가 생성한 답변을 나란히 비교하고 어느 쪽이 더 나은지 평가합니다 (어떤 시스템의 답변인지 모르는 상태, 즉 블라인드 테스트).
    • 핵심 지표: 사용자 선호도(User Preference). 평가자들이 약 3분의 2 경우에 ODKE+의 답변을 선호한다고 보고합니다. 이는 추출된 정보가 실제 사용자에게 더 유용하고 만족스럽다는 것을 의미합니다.
  3. 핵심 성능 지표 (KPIs) 측정:

    • 커버리지(Coverage):
      • 기존 파이프라인 대비 답변 가능한 사용자 쿼리가 10% 증가했음을 보여줍니다.
      • 제3자 지식 그래프(예: Wikidata)와 비교했을 때 **48%의 정보 중복(Overlap)**을 달성했다고 보고합니다. (Table 2)
    • 최신성(Freshness): ODKE+를 통해 추출된 새로운 사실이 기존 KG 워크플로우보다 평균적으로 약 50일 더 빨리 반영된다고 보고합니다.
    • 처리량 및 안정성: 프로덕션 환경에서 하루 평균 15만~25만 개의 새로운 사실을 처리하며, 99.9% 이상의 성공률을 유지한다고 언급합니다.
  4. 구성 요소 영향 분석 (Component Impact Analysis):

    • Grounder(검증기) 효과: Grounder 모듈을 도입함으로써 LLM의 환각(Hallucination)으로 인한 잘못된 추출이 35% 감소했다고 분석합니다.
    • Corroborator(통합기) 효과: Corroborator의 순위 결정(Ranking) 및 통합 과정을 거치면서, 초기 LLM 추출 결과의 정밀도가 91%에서 최종 98.8%까지 향상되었음을 보여줍니다.

관련 노트