Downloads · 30 days
0
Dpn82/offvox-language-packs
offvox-language-packs is a machine learning model from Dpn82. Use it for the machine learning task on the model card, and read the license before you ship it in a product. The card lists the license as apache-2.0.
Modelos Whisper afinados para euskera, gallego y galés, convertidos a ONNX (cuantizado int8) para usarse con sherpa-onnx vía sherpaonnx.OfflineRecognizer.fromwhisper(...). Es el formato que consume OffVox, una app de…
Downloads · 30 days
0
Access
Public
Updated Sep 7, 2026
Repo size
5 GB
Likes
0
Public
Click a slice to open those files.
.onnx5 GB · 100%
From the Hugging Face model README
Modelos Whisper afinados para euskera, gallego y galés, convertidos a ONNX
(cuantizado int8) para usarse con sherpa-onnx
vía sherpa_onnx.OfflineRecognizer.from_whisper(...). Es el formato que
consume OffVox, una app de diario y reuniones por voz
100% local/offline.
Cada carpeta <idioma>/<tamaño>/ contiene 3 ficheros: encoder.int8.onnx,
decoder.int8.onnx, tokens.txt.
Todos los checkpoints originales están licenciados bajo Apache-2.0, y todos los datasets usados para el fine-tuning están licenciados bajo CC0 (dominio público) — sin restricciones de uso comercial en ningún eslabón de la cadena. Esta conversión (exportación a ONNX + cuantización int8) se publica también bajo Apache-2.0, manteniendo la atribución exigida por esa licencia.
HiTZ/whisper-{tiny,base,small}-eu,
HiTZ/whisper-{tiny,base,small}-gl), Apache-2.0, entrenados sobre
Mozilla Common Voice (CC0). Ver el
paper "Whisper-LM" (Xabier de Zuazo et al., HiTZ Zentroa/UPV-EHU,
arXiv:2503.23542).techiaith/whisper-tiny-ft-cy-en), Apache-2.0, entrenado sobre Common
Voice (CC0) y Banc Trawsgrifiadau Bangor
(CC0).Los tamaños medium (euskera/gallego) y large-v3 (galés) también se
convirtieron y se verificaron como correctos, pero no se han subido
aquí todavía — el nivel de tamaño ("tier") actual de OffVox solo llega
hasta small. Si en el futuro se añade un nivel superior, se subirán
también.
Pipeline: checkpoint HuggingFace → formato nativo OpenAI Whisper →
exportación ONNX vía el script export-onnx.py de sherpa-onnx (adaptado
para aceptar checkpoints locales) → cuantización dinámica int8. Verificado
end-to-end con audio real de datasets públicos (shunyalabs/galician-speech-dataset,
shunyalabs/welsh-speech-dataset, mikelalda/basque_speech_dataset) antes
de publicar, comparando la transcripción reconocida contra la referencia.