Downloads · 30 days
14
25% of all-time downloads
Doji070/rubert-tiny2-toxic-multilabel
rubert-tiny2-toxic-multilabel is a text classification model from Doji070. Use it when you need a label for a piece of text. The card lists the license as mit.
Модель для мульти-лейбл классификации токсичных комментариев на русском языке. Основана на cointegrated/rubert-tiny2 с тремя головами для классов: - Ненормативная лексика (Profanity) - Угрозы (Threats) - Незаконные за…
Downloads · 30 days
14
25% of all-time downloads
All-time downloads
57
Public
Repo size
234 MB
Likes
1
Public
Click a slice to open those files.
.bin117 MB · 98%
From the Hugging Face model README
Модель для мульти-лейбл классификации токсичных комментариев на русском языке.
Основана на cointegrated/rubert-tiny2 с тремя головами для классов:
from transformers import AutoTokenizer, AutoModel
import torch
import json
# Загрузка модели
model = AutoModel.from_pretrained("Doji070/rubert-tiny2-toxic-multilabel")
tokenizer = AutoTokenizer.from_pretrained("Doji070/rubert-tiny2-toxic-multilabel")
# Загрузка порогов
with open("thresholds.json", "r") as f:
thresholds = json.load(f)
def predict(text):
inputs = tokenizer(text, return_tensors="pt", truncation=True, max_length=128)
with torch.no_grad():
outputs = model(**inputs)
probs = torch.sigmoid(outputs.logits).squeeze().numpy()
preds = {
'profanity': int(probs[0] >= thresholds['profanity']),
'threat': int(probs[1] >= thresholds['threat']),
'illegal': int(probs[2] >= thresholds['illegal'])
}
return preds, probs
# Пример
text = "Ты идиот! Я тебя убью!"
preds, probs = predict(text)
print(f"Текст: {text}")
print(f"Предсказания: {preds}")
Doji070
2026-07-18