Downloads · 30 days
0
sysy9292/kf-deberta-base-kg-extractor
kf-deberta-base-kg-extractor is a machine learning model from sysy9292. Use it for the machine learning task on the model card, and read the license before you ship it in a product. It is set up for pytorch. The card lists the license as mit.
한국어 뉴스 기사 한 편에서 사건, 발언·판단, 개체, 시간을 추출하고 Event-centered Article-local KG를 구성합니다. KF-DeBERTa 기반의 공유 문맥 표현과 다중 태스크 head를 사용해 사건의 참여자·시간, 발언 주체, 사건 간 인과 관계 등을 연결하고 PUBLIC JSON graph로 반환합니다.
Downloads · 30 days
0
Access
Public
Updated Oct 1, 2026
Repo size
225 MB
Likes
3
Public
Click a slice to open those files.
.pt61.5 MB · 97%
From the Hugging Face model README
한국어 뉴스 기사 한 편에서 사건, 발언·판단, 개체, 시간을 추출하고 Event-centered Article-local KG를 구성합니다. KF-DeBERTa 기반의 공유 문맥 표현과 다중 태스크 head를 사용해 사건의 참여자·시간, 발언 주체, 사건 간 인과 관계 등을 연결하고 PUBLIC JSON graph로 반환합니다.
Python 환경에서 pip install -r requirements.txt를 실행합니다. Backbone은 번들에 중복 포함되지 않습니다. kakaobank/kf-deberta-base의 manifest 고정 revision 363b171d71443b0874b0bf9cea053eb5b1650633을 로컬 Hugging Face snapshot으로 준비해야 합니다. Loader가 tokenizer와 backbone weight SHA를 확인합니다.
from runtime.v3_pretraining.project_release import load_project_release_worker
worker = load_project_release_worker(
".",
backbone_snapshot="/path/to/models--kakaobank--kf-deberta-base/snapshots/363b171d71443b0874b0bf9cea053eb5b1650633",
device="cpu", # Metal 사용 가능 시 "mps"
)
graph = worker.analyze_public(
article_id="example-001",
content="기사 원문 전체 텍스트",
title="기사 제목",
published_at="2026-09-27",
)
print(graph)
examples/inference.py는 기사 JSON 파일을 받아 같은 PUBLIC 경로를 실행합니다. D2/E1 및 pair policy를 호출자가 직접 주입할 필요가 없습니다.
| 입력 필드 | 필수 | 설명 |
|---|---|---|
article_id | O | 기사 식별자 |
content | O | 기사 원문 |
title | X | 기사 제목 |
article_version_id | X | 버전 ID; 미지정 시 runtime 생성 |
published_at | X | 발행 시각 또는 날짜 |
Root에는 schema_version, projection_version, article, status, persistence_ready, nodes, edges, diagnostics가 있습니다. 상세 필드와 값은 PUBLIC JSON schema와 출력 계약을 따릅니다.
| Node kind | 핵심 내용 |
|---|---|
ARTICLE | 기사 ID와 메타데이터 |
EVENT | 사건 canonical text 및 Primary 점수 |
STATEMENT | 발언·판단 canonical text와 유형(FORECAST, CLAIM, EVALUATION) |
ENTITY | canonical name과 유형(PERSON, ORGANIZATION, LOCATION, PRODUCT, GENERIC) |
TIME | 정규화된 YEAR, MONTH, DAY |
| Edge kind | 의미 |
|---|---|
COVERS, CONTAINS_STATEMENT, MENTIONS | 기사와 명제·개체 연결 |
ACTOR, TARGET, PLACE | 사건 참여 역할 |
ASSERTED_BY, OCCURRED_ON | 발언 주체·사건 시간 |
ABOUT, CAUSES | 명제 간 주제·인과 관계 |
Node·edge의 source evidence는 원문 [start, end) 문자 좌표와 exact text를 보존합니다. 모델 점수는 calibrated probability가 아닌 각 head의 decision score입니다. PUBLIC 출력은 Primary를 통과한 Event/Statement 중 최대 8개를 선택하며, 관계의 양쪽 끝이 출력에 살아남아야 그 관계도 출력합니다.
선택 checkpoint SHA, D2/E1 SHA, source policy·acceptance SHA, active routing config, PUBLIC schema 및 모든 파일 SHA는 release-manifest.json에 있습니다. python verify_bundle.py --check-imports로 파일과 독립 import를 검증할 수 있습니다. CPU와 MPS 외의 장치는 선택할 수 없습니다.