Downloads · 30 days
25
37% of all-time downloads
sml-brrt/t2p-onnx
t2p-onnx is a translation model from sml-brrt. Use it when you need text moved from one language to another. The card lists the license as apache-2.0.
Version ONNX quantifiée en INT8 du modèle Propicto/t2p-t5-large-orfeo, optimisée pour l'inférence côté client avec Transformers.js et ONNX Runtime Web (WASM).
Downloads · 30 days
25
37% of all-time downloads
All-time downloads
68
Public
Repo size
250 MB
Likes
0
Public
Click a slice to open those files.
.onnx249 MB · 99%
From the Hugging Face model README
Version ONNX quantifiée en INT8 du modèle Propicto/t2p-t5-large-orfeo, optimisée pour l'inférence côté client avec Transformers.js et ONNX Runtime Web (WASM).
Ce modèle convertit du texte en français en séquences de pictogrammes ARASAAC, destiné à la Communication Augmentée et Alternative (CAA).
Ce repo contient les poids ONNX INT8 dérivés du modèle PyTorch original :
Pour les détails sur l'entraînement, les datasets et les métriques d'évaluation, consultez la fiche du modèle original.
import { AutoTokenizer, AutoModelForSeq2SeqLM } from "@huggingface/transformers";
const tokenizer = await AutoTokenizer.from_pretrained("sml-brrt/t2p-onnx");
const model = await AutoModelForSeq2SeqLM.from_pretrained("sml-brrt/t2p-onnx", {
device: "auto",
});
const inputs = tokenizer("Je mange une pomme");
const outputs = await model.generate({
inputs: inputs.input_ids,
attention_mask: inputs.attention_mask,
max_new_tokens: 40,
do_sample: true,
top_k: 30,
top_p: 0.95,
});
const pred = tokenizer.decode(outputs[0], { skip_special_tokens: true });
// → "me manger une pomme"
Le lexique associé (lexicon.json) permet de mapper les lemmes prédits aux identifiants de pictogrammes ARASAAC.
| Fichier | Description |
|---|---|
config.json | Configuration du modèle T5 |
tokenizer.json | Tokenizer SentencePiece |
tokenizer_config.json | Configuration du tokenizer |
special_tokens_map.json | Mapping des tokens spéciaux |
generation_config.json | Paramètres de génération |
spiece.model | Modèle SentencePiece binaire |
lexicon.json | Lexique lemme → ID pictogramme ARASAAC |
onnx/encoder_model.onnx | Encodeur ONNX INT8 (105 Mo) |
onnx/decoder_model_merged.onnx | Décodeur ONNX INT8 (133 Mo) |
Modèle développé par :
Financement :
Conversion ONNX et intégration Transformers.js : AEDE — PictoPhrase
Si vous utilisez ce modèle, veuillez citer le travail original :
@inproceedings{macaire_jeptaln2024,
title = {{Approches cascade et de bout-en-bout pour la traduction automatique de la parole en pictogrammes}},
author = {Macaire, C{\'e}cile and Dion, Chlo{\'e} and Schwab, Didier and Lecouteux, Benjamin and Esperan{\c c}a-Rodier, Emmanuelle},
url = {https://inria.hal.science/hal-04623007},
booktitle = {{35{\`e}mes Journ{\'e}es d'{\'E}tudes sur la Parole (JEP 2024) 31{\`e}me Conf{\'e}rence sur le Traitement Automatique des Langues Naturelles (TALN 2024) 26{\`e}me Rencontre des {\'E}tudiants Chercheurs en Informatique pour le Traitement Automatique des Langues (RECITAL 2024)}},
address = {Toulouse, France},
publisher = {{ATALA \& AFPC}},
volume = {1 : articles longs et prises de position},
pages = {22-35},
year = {2024}
}
Apache-2.0 (identique au modèle d'origine)