Downloads · 30 days
10
23% of all-time downloads
zurawski/bertweetbr_multilabel_classifier_toldbr
bertweetbr_multilabel_classifier_toldbr is a machine learning model from zurawski. Use it for the machine learning task on the model card, and read the license before you ship it in a product.
Este modelo é uma versão fine-tuned do BERTweetBR para detecção multilabel de diferentes tipos de linguagem tóxica em português brasileiro. O modelo foi treinado no corpus ToLD-Br e é capaz de identificar múltiplas ca…
Downloads · 30 days
10
23% of all-time downloads
All-time downloads
44
Public
Parameters
135M
540 MB on disk
Likes
0
Public
Click a slice to open those files.
.safetensors540 MB · 100%
From the Hugging Face model README
Este modelo é uma versão fine-tuned do BERTweetBR para detecção multilabel de diferentes tipos de linguagem tóxica em português brasileiro. O modelo foi treinado no corpus ToLD-Br e é capaz de identificar múltiplas categorias de toxicidade simultaneamente em um mesmo texto.
ToLD-Br: Dataset brasileiro de linguagem tóxica contendo 21,000 tweets em português brasileiro. Os tweets foram coletados e anotados manualmente para identificar diferentes formas de toxicidade. É o maior dataset público de linguagem tóxica em português brasileiro.
Avaliação no conjunto de teste (1,213 exemplos com pelo menos um rótulo):
| Categoria | Precision | Recall | F1-Score | Support |
|---|---|---|---|---|
| Homophobia | 0.48 | 0.59 | 0.53 | 34 |
| Obscene | 0.47 | 0.87 | 0.61 | 665 |
| Insult | 0.61 | 0.66 | 0.64 | 438 |
| Racism | 0.00 | 0.00 | 0.00 | 14 |
| Misogyny | 0.45 | 0.36 | 0.40 | 47 |
| Xenophobia | 0.20 | 0.07 | 0.10 | 15 |
Métricas Gerais: