Downloads · 30 days
21
62% of all-time downloads
caeher/mbert-sv
mbert-sv is a text classification model from caeher. Use it when you need a label for a piece of text. It is set up for transformers. The card lists the license as apache-2.0.
Fine-tuning de bert-base-multilingual-cased para clasificación multiclase de toxicidad en redes sociales en español salvadoreño.
Downloads · 30 days
21
62% of all-time downloads
All-time downloads
34
Public
Parameters
178M
1.4 GB on disk
Likes
0
Public
Click a slice to open those files.
.safetensors711 MB · 100%
From the Hugging Face model README
Fine-tuning de bert-base-multilingual-cased para clasificación multiclase de toxicidad en redes sociales en español salvadoreño.
Checkpoint de auditoría: checkpoint-1072 (época 4, semilla 42).
| id | etiqueta |
|---|---|
| 0 | No Tóxico |
| 1 | Lenguaje Ofensivo |
| 2 | Discurso de Odio |
| 3 | Amenazas/Violencia |
| Campo | Valor |
|---|---|
max_length | 128 |
| Columna de texto | texto_modelo |
| Normalizador | normalize_for_model v1.1 |
Si el texto no está preprocesado, hay que aplicar el mismo normalizador del repositorio de la tesina.
| Métrica | Valor |
|---|---|
| F1-macro | 0.7777 |
| Accuracy | 0.7826 |
| Precision-macro | 0.7809 |
| Recall-macro | 0.7757 |
| QWK | 0.7362 |
F1 por clase: No Tóxico 0.814 · Lenguaje Ofensivo 0.795 · Discurso de Odio 0.746 · Amenazas/Violencia 0.756.
from transformers import AutoTokenizer, AutoModelForSequenceClassification
import torch
repo_id = "caeher/mbert-sv"
tokenizer = AutoTokenizer.from_pretrained(repo_id)
model = AutoModelForSequenceClassification.from_pretrained(repo_id)
text = "ejemplo de comentario"
inputs = tokenizer(text, return_tensors="pt", truncation=True, max_length=128)
with torch.no_grad():
logits = model(**inputs).logits
pred = int(logits.argmax(dim=-1))
print(model.config.id2label[pred])
model.safetensors, config.json, tokenizer.json, tokenizer_config.jsoninference_contract.json — contrato de preprocesamientotest_metrics.json / train_metrics.json — métricas del checkpointModelo de tesina, no un moderador autónomo. El corpus es de El Salvador; el desempeño puede caer en otros dialectos o en jerga adversarial. FPR sobre jerga no tóxica y cortes por plataforma están documentados en el informe del proyecto.