Downloads · 30 days
0
canolayoo78/custom_summarization_dataset
custom_summarization_dataset is a machine learning model from canolayoo78. Use it for the machine learning task on the model card, and read the license before you ship it in a product.
Custom Text Dataset 이 데이터셋은 CNN/Daily Mail 데이터셋을 기반으로 한 사용자 정의 텍스트 요약 데이터셋입니다.
Downloads · 30 days
0
Access
Public
Updated Sep 20, 2024
Repo size
348 KB
Likes
0
Public
Click a slice to open those files.
.arrow348 KB · 98%
From the Hugging Face model README
Custom Text Dataset 이 데이터셋은 CNN/Daily Mail 데이터셋을 기반으로 한 사용자 정의 텍스트 요약 데이터셋입니다.
이 데이터셋은 긴 뉴스 기사(문장)를 짧고 요약된 문장으로 변환하는 텍스트 요약 작업에 사용됩니다. sentence는 원본 텍스트이며, labels는 해당 텍스트의 요약입니다. 데이터셋은 훈련 데이터와 테스트 데이터로 나누어져 있습니다.
Train 데이터셋: 커스텀으로 생성된 단일 훈련 예시를 포함합니다. sentence: 원본 뉴스 기사의 긴 텍스트 labels: 요약된 문장 Test 데이터셋: CNN/Daily Mail 데이터셋에서 100개의 테스트 샘플을 포함합니다. sentence: 뉴스 기사 labels: 해당 기사에 대한 하이라이트 요약
훈련 및 테스트는 CNN/Daily Mail 데이터셋(버전 3.0.0)에서 가져왔습니다. 훈련 데이터는 사용자 정의 문장과 그 요약으로 구성되었으며, CNN/Daily Mail 데이터셋의 일반적인 구조를 따릅니다.
텍스트는 토크나이저를 통해 토큰화되어 모델이 처리할 수 있는 형태로 변환됩니다. 입력 길이는 512 토큰으로 제한되며, 초과되는 부분은 잘립니다. 라벨(요약문)은 필요한 경우 150 토큰 이내로 줄여서 출력됩니다.
이 데이터셋은 Hugging Face의 datasets 라이브러리로 쉽게 불러올 수 있습니다. 아래는 사용 예시 코드입니다:
from datasets import load_from_disk
# 데이터셋 불러오기
train_dataset = load_from_disk('./results/custom_dataset/train')
test_dataset = load_from_disk('./results/custom_dataset/test')
# 데이터셋 샘플 보기
print(train_dataset['train'][0])
print(test_dataset['test'][0])
이 데이터셋은 텍스트 요약 모델의 성능을 평가하는 데 사용됩니다. 평가는 ROUGE 지표(ROUGE-1, ROUGE-2, ROUGE-L)를 사용하여 요약문과 원문 간의 일치도를 측정합니다.
훈련 데이터는 매우 제한적입니다. 단일 예시로 구성되어 있으므로 대규모 학습에는 적합하지 않습니다. 테스트 데이터는 CNN/Daily Mail 데이터셋의 일부분만을 포함하므로 모델 성능을 충분히 평가하기에는 샘플 크기가 작을 수 있습니다. 윤리적 고려사항 데이터셋은 뉴스 기사를 기반으로 하므로, 본래 뉴스 기사에 포함된 편향이나 주관적 견해가 요약문에 반영될 수 있습니다. 요약이 사실적이지 않을 수 있으며, 중요 정보를 누락하거나 잘못된 정보를 포함할 수 있습니다. 사용자는 이 데이터셋을 실제 환경에 배포할 때 윤리적인 책임을 다해야 하며, 특히 중요한 정보가 포함된 요약 작업에서는 주의가 필요합니다.