Downloads · 30 days
52
57% of all-time downloads
Izbebe/ru-toxicity-classifier-rosberta
ru-toxicity-classifier-rosberta is a text classification model from Izbebe. Use it when you need a label for a piece of text.
Модель для детекции токсичных сообщений в переписке службы поддержки (учебный проект). Дообучена на базе ai-forever/ru-en-RoSBERTa: энкодер заморожен, обучалась только классификационная голова.
Downloads · 30 days
52
57% of all-time downloads
All-time downloads
92
Public
Parameters
405M
1.6 GB on disk
Likes
1
Public
Click a slice to open those files.
.safetensors1.6 GB · 99%
From the Hugging Face model README
Модель для детекции токсичных сообщений в переписке службы поддержки
(учебный проект). Дообучена на базе ai-forever/ru-en-RoSBERTa:
энкодер заморожен, обучалась только классификационная голова.
0 — нетоксичный текст1 — токсичный текст (грубость, оскорбления, сарказм, пассивная агрессия)| Метрика | Значение |
|---|---|
| Accuracy | 0.9610 |
| Precision | 0.9646 |
| Recall | 0.9571 |
| F1 | 0.9608 |
| ROC AUC | 0.9948 |
| MCC | 0.9220 |
import torch
from transformers import AutoTokenizer, AutoModelForSequenceClassification
tokenizer = AutoTokenizer.from_pretrained("Izbebe/ru-toxicity-classifier-rosberta")
model = AutoModelForSequenceClassification.from_pretrained("Izbebe/ru-toxicity-classifier-rosberta")
text = "Вы что, совсем тупой? Я же уже объяснял!"
inputs = tokenizer(text, return_tensors="pt", truncation=True, max_length=128)
with torch.no_grad():
probs = torch.softmax(model(**inputs).logits, dim=-1)
print(f"Вероятность токсичности: {probs[0, 1].item():.3f}")
Датасет: Izbebe/ru-toxicity-support-binary