Downloads · 30 days
0
BercyHub/CamemBERT_classification_discussions
CamemBERT_classification_discussions is a machine learning model from BercyHub. Use it for the machine learning task on the model card, and read the license before you ship it in a product. The card lists the license as mit.
- Developed by: Asma RACHIDI (BercyHub) - Model type: Classification de Texte (Basé sur Camembert) - Language(s) (NLP): Français FR - License: MIT - Finetuned from model: camembert-base
Downloads · 30 days
0
Access
Public
Updated Dec 18, 2023
Repo size
788 MB
Likes
0
Public
Click a slice to open those files.
.zip788 MB · 98%
From the Hugging Face model README
Les utilisateurs peuvent utiliser directement le modèle pour des tâches de classification de texte, telles que la catégorisation de discussions basée sur les titres et les messages.
Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
pip install -r requirements.txt
Le modèle a été entraîné sur un jeu de données annoté manuellement par Datactivist en 2021 sur un échantillon de discussions.
Le jeu de données annoté manuellement est disponible sur data.gouv.fr :
https://www.data.gouv.fr/fr/datasets/annotation-des-discussions-publiees-sur-data-gouv-fr/#/resources
(voir fichier : "discussions-annotations-public-.csv")
Le script effectue diverses étapes de prétraitement, notamment la gestion des valeurs manquantes, la combinaison du titre et du message, et le nettoyage des données textuelles.
Modèle 1 - Catégories :
Modèle 2 - Sous-catégories :
Le modèle a été évalué, premièrement sur un ensemble de données de test dérivé du jeu de données des discussions annotées par datactivist représentant 20% de l'ensemble de données total. Et deuxièmement sur un jeu de données du catalogue des discussions de data.gouv.fr (non-annoté): https://www.data.gouv.fr/fr/datasets/catalogue-des-donnees-de-data-gouv-fr/
Le modèle a obtenu des performances compétitives sur l'ensemble de test.
Modèle 1 - Catégories :
Modèle 2 - Sous-catégories :
Cependant, les données d'entraînement comportent un très grand déséquilibre entre les classes, ce qui abaisse les performances au niveau des classes sous-représentées. Ce désequilibre induit un certains biais entre les classes.
Le notebook .ipynb a pour but la création, l'entraînement et l'évaluation du modèle. Ce script comprend les étapes suivantes :
L'architecture du modèle est basée sur Camembert et est conçue pour la classification de texte. L'objectif principal est de catégoriser les discussions dans des classes prédéfinies. Le premier modèle classifie sur 6 catégories et le second modèle sur 26 sous-catégories. Et chaque catégorie comporte plusieurs sous-catégories d'appartenances mais le modèle ne prédit que des catégories et sous-catégories d'appartenances uniques.
Asma RACHIDI (BercyHub)