Downloads · 30 days
34
16% of all-time downloads
Finisha-F-scratch/Aricate-base
Aricate-base is a text generation model from Finisha-F-scratch. Use it when you need the model to write or continue text. The card lists the license as mit.
Downloads · 30 days
34
16% of all-time downloads
All-time downloads
207
Public
Parameters
6M
27.2 MB on disk
Likes
1
Public
Click a slice to open those files.
.safetensors24 MB · 87%
From the Hugging Face model README

Félicitations ! Vous êtes sur le point d'utiliser Aricate-Base, le socle de l'architecture Aricate V4. Ce modèle a été conçu pour fournir une base linguistique solide, prête à être ajustée (Fine-Tunée) sur votre tâche spécifique (Q/A, classification, résumé, etc.).
| Caractéristique | Valeur |
|---|---|
| Architecture | GRU + Attention Additive (Aricate V4) |
| But du Pré-entraînement | Prédiction du Mot Suivant |
| Usage Principal | Fine-Tuning (Ajustement) |
Aricate-Base résout l'instabilité de la génération souvent rencontrée par les modèles de petite taille :
Il est impératif de noter que, bien que le corpus d'entraînement initial ait inclus du français, la nature du split et du dataset (Wikitext-2) a conduit à une forte dominance des schémas et du vocabulaire anglais dans les poids du modèle pré-entraîné.
| Scénario | Conséquence pour Aricate-Base | Effort de Fine-Tuning |
|---|---|---|
| Modèle Final en Anglais | Idéal. Le modèle a déjà une excellente base anglaise. | Minimal. Concentration sur la tâche (Q/A, etc.). |
| Modèle Final en Français | Le modèle aura tendance à utiliser des structures syntaxiques anglaises et à produire des mots/concepts anglais s'il n'est pas certain (ex: 'antimony' vu dans les tests). | Élevé. Nécessite un Fine-Tuning sur une large et dense dataset en français. |
Si vous exigez un contrôle total sur le langage et souhaitez éliminer tout biais linguistique dès la base, nous recommandons de réaliser un Aricate from Scratch.
La puissance d'Aricate-Base réside dans sa capacité à apprendre rapidement de nouvelles tâches.
pip install torch huggingface-hub safetensors datasets
Vous aurez besoin des classes AricateModel et WordTokenizer (fournies par l'auteur) pour charger correctement le modèle.
voir l'exemple de code dans le readme du modèle Lam-2
Votre jeu de données doit être formaté pour la Prédiction du Mot Suivant, en incluant les tokens spéciaux (<sep>, <eos>).
Exemple pour une tâche Question/Réponse (Q/A) :
Chaque paire doit être transformée en une séquence unique :
$$Question\ W_1\ W_2\ ...\ <sep>\ Réponse\ A_1\ A_2\ ...\ <eos>$$
| Paramètre | Recommandation | Justification |
|---|---|---|
| Taux d'Apprentissage (LR) | $10^{-4}$ à $10^{-5}$ (Très faible) | Empêche l'écrasement des connaissances linguistiques pré-acquises. |
| Nombre d'Époques | 5 à 20 | Suffisant pour spécialiser le modèle sans sur-apprentissage (overfitting). |
| Batch Size | 32 à 128 | Dépendant du GPU. Plus petit pour économiser la VRAM. |
| Optimiseur | Adam ou AdamW | Fonctionne bien avec les architectures RNN modernes. |
Ce modèle est prêt à devenir l'outil spécialisé dont vous avez besoin. Bon Fine-Tuning ! 🚀
Aricate-base est a L'architecture Aricate se que le gpt2 original de transformers est a transformers
Fichier quantifier de Aricate-base : aricate_quantized.arica (présent juste à côté des poids de Aricate-base dans son dépôt)