Downloads · 30 days
5
26% of all-time downloads
Ahbdjbdsh/Dataset-from-HOMEWORK-2
Dataset-from-HOMEWORK-2 is a text classification model from Ahbdjbdsh. Use it when you need a label for a piece of text.
Это модель для бинарной классификации русскоязычных комментариев на предмет токсичности (1 — toxic, 0 — neutral). Модель построена на базе предобученной архитектуры ai-forever/ru-en-RoSBERTa и дообучена в рамках выпол…
Downloads · 30 days
5
26% of all-time downloads
All-time downloads
19
Public
Parameters
405M
1.6 GB on disk
Likes
0
Public
Click a slice to open those files.
.safetensors1.6 GB · 99%
From the Hugging Face model README
Это модель для бинарной классификации русскоязычных комментариев на предмет токсичности (1 — toxic, 0 — neutral).
Модель построена на базе предобученной архитектуры ai-forever/ru-en-RoSBERTa и дообучена в рамках выполнения Домашнего задания №2.
По результатам оценки модели (evaluate_model) на сбалансированном тестовом множестве были получены следующие показатели:
В ходе анализа ошибок и ручного инференса было установлено, что модель успешно детектирует маркеры скрытой и пассивной агрессии (повышая внутреннюю вероятность токсичности до 0.34 - 0.45). Однако стандартный жесткий порог argmax (0.5) может пропускать такие завуалированные фразы. Для деплоя в продакшен рекомендуется калибровать порог классификации под конкретную бизнес-задачу.
from transformers import AutoTokenizer, AutoModelForSequenceClassification
import torch
tokenizer = AutoTokenizer.from_pretrained("Ahbdjbdsh/Dataset-from-HOMEWORK-2")
model = AutoModelForSequenceClassification.from_pretrained("Ahbdjbdsh/Dataset-from-HOMEWORK-2")
text = "Вы что, совсем тупой? Я же уже объяснял!"
inputs = tokenizer(text, return_tensors="pt")
with torch.no_grad():
outputs = model(**inputs)
probs = torch.softmax(outputs.logits, dim=-1)
prediction = torch.argmax(outputs.logits, dim=1).item()
print(f"Класс: {prediction}, Вероятность токсичности: {probs[0][1].item():.4f}")