Downloads · 30 days
216
42% of all-time downloads
TTA-DQA/HateDetection_MultiLabel_KcElectra_FineTuning
HateDetection_MultiLabel_KcElectra_FineTuning is a machine learning model from TTA-DQA. Use it for the machine learning task on the model card, and read the license before you ship it in a product. The card lists the license as mit.
이 모델은 한국어 문장 내 유해 표현의 유무 및 유해 표현의 유형(카테고리)를 분류하기 위해 학습된 모델입니다. mult-label classification을 수행하며, 유해표현이 포함되는지, 유해표현이라면 그 유형을 판단(분류) 합니다. AI-Task로는 text-classification에 해당합니다. 사용하는 데이터셋은 TTA-DQA/hatesentence입니다.
Downloads · 30 days
216
42% of all-time downloads
All-time downloads
512
Public
Parameters
128M
1.5 GB on disk
Likes
0
Public
Click a slice to open those files.
.pt1 GB · 67%
From the Hugging Face model README
이 모델은 한국어 문장 내 유해 표현의 유무 및 유해 표현의 유형(카테고리)를 분류하기 위해 학습된 모델입니다.
mult-label classification을 수행하며, 유해표현이 포함되는지, 유해표현이라면 그 유형을 판단(분류) 합니다.
AI-Task로는 text-classification에 해당합니다.
사용하는 데이터셋은 TTA-DQA/hate_sentence입니다.
"0": insult"1": abuse"2": obscenity"3": TVPC(Threats of violence/promotion of crime)"4": sexuality"5": age"6": race and region"7": disabled"8": religion"9": politics"10": job"11": no_hateTTA-DQA/hate_sentence)5e-60.0130162BertWordPieceTokenizer511MBpytorch ~= 1.8.0transformers ~= 4.0.0emoji ~= 0.6.0soynlp ~= 0.0.493from transformers import AutoTokenizer, AutoModelForSequenceClassification, pipeline
model_name = "TTA-DQA/HateDetection_MultiLabel_KcElectra_FineTuning"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForSequenceClassification.from_pretrained(model_name)
classifier = pipeline("text-classification", model=model, tokenizer=tokenizer)
sentences = ["오늘 점심 뭐 먹을까?", "이 나쁜 놈아."]
results = classifier(sentences)'
이 모델은 초거대AI 학습용 데이터 품질검증 사업(2024년도 초거대AI 학습용 품질검증)에 의해서 구축되었습니다.
본 모델은 각 클래스의 데이터를 편향되게 학습하지는 않았으나,
언어적·문화적 특성에 의해 레이블에 대한 이견이 있을 수 있습니다.
유해 표현은 언어, 문화, 적용 분야, 개인적 견해에 따라 주관적인 부분이 존재하여,
결과에 대한 편향 또는 논란이 발생할 수 있습니다.
❗ 본 모델의 결과는 절대적인 유해 표현 기준이 아님을 유의해 주세요.