Downloads · 30 days
0
Iscte-Sintra/KeaASR-LLM-300M
KeaASR-LLM-300M is a automatic speech recognition model from Iscte-Sintra. Use it when you need speech turned into text. The card lists the license as cc-by-nc-4.0.
Fine-tuned version of omniASRCTC300M for Kabuverdianu (kea) — Cape Verdean Creole, a low-resource language spoken by ~1 million people.
Downloads · 30 days
0
Access
Public
Updated May 25, 2026
Repo size
6.5 GB
Likes
0
Public
Click a slice to open those files.
.pt6.5 GB · 100%
From the Hugging Face model README
Fine-tuned version of omniASR_CTC_300M for Kabuverdianu (kea) — Cape Verdean Creole, a low-resource language spoken by ~1 million people.
| Property | Value |
|---|---|
| Base model | omniASR_CTC_300M (Meta, ~300M parameters) |
| Language | Kabuverdianu (kea_Latn) |
| Task | Automatic Speech Recognition (CTC) |
| Framework | omnilingual-asr (fairseq2) |
| Dataset | shunyalabs/kabuverdianu-speech-dataset |
| Split | Samples |
|---|---|
| Train | 2715 |
| Validation | 366 |
| Test | 864 |
| Parameter | Value |
|---|---|
| Training steps | N/A |
| Learning rate | N/A |
| Mixed precision | N/A |
| Gradient accumulation | N/A batches |
| Encoder frozen for | N/A steps |
| Min audio length | N/A samples (2 s) |
| Max audio length | N/A samples (60 s) |
| Max elements per batch | N/A |
| Metric | Value |
|---|---|
| WER (validation) | N/A |
| Train CTC Loss | N/A |
| Validation CTC Loss | N/A |
checkpoint/sdp_00.pt ← model weights (fairseq2 sharded format)
model.yaml ← architecture definition
config.yaml ← full training configuration
metrics/train.jsonl ← per-step training metrics
metrics/valid.jsonl ← per-step validation metrics (WER)