Downloads · 30 days
14
4% of all-time downloads
MadLook/whisper-small-arabic-multidialect
whisper-small-arabic-multidialect is a automatic speech recognition model from MadLook. Use it when you need speech turned into text. It is set up for transformers. The card lists the license as apache-2.0.
Fine-tuned Whisper Small model for Arabic speech recognition across multiple dialects.
Downloads · 30 days
14
4% of all-time downloads
All-time downloads
322
Public
Parameters
242M
967 MB on disk
Likes
0
Public
Click a slice to open those files.
.safetensors967 MB · 99%
From the Hugging Face model README
Fine-tuned Whisper Small model for Arabic speech recognition across multiple dialects.
This is a fine-tuned version of OpenAI's Whisper Small model, trained on Arabic multi-dialect speech data for automatic speech recognition tasks.
This model can be used for automatic transcription of Arabic speech across multiple dialects. It processes audio files and outputs Arabic text transcriptions.
Can be integrated into:
Users should validate performance on their specific use case before deployment. Consider additional fine-tuning for specific dialects or domains.
from transformers import pipeline
transcriber = pipeline(
"automatic-speech-recognition",
model="MadLook/whisper-small-arabic-multidialect"
)
result = transcriber("arabic_audio.mp3")
print(result["text"])
Or with more control:
import torch
from transformers import WhisperForConditionalGeneration, WhisperProcessor
import librosa
# Load model and processor
model = WhisperForConditionalGeneration.from_pretrained("MadLook/whisper-small-arabic-multidialect")
processor = WhisperProcessor.from_pretrained("MadLook/whisper-small-arabic-multidialect")
# Load audio
audio, sr = librosa.load("arabic_audio.mp3", sr=16000)
# Process
input_features = processor(audio, sampling_rate=16000, return_tensors="pt").input_features
# Generate transcription
with torch.no_grad():
predicted_ids = model.generate(input_features)
# Decode
transcription = processor.batch_decode(predicted_ids, skip_special_tokens=True)[0]
print(transcription)
Trained on 40% subset of Arabic multi-dialect speech dataset:
Validation set: 2,628 samples from Arabic multi-dialect dataset
Validation Set Performance:
BibTeX:
@article{radford2022whisper,
title={Robust Speech Recognition via Large-Scale Weak Supervision},
author={Radford, Alec and Kim, Jong Wook and Xu, Tao and Brockman, Greg and McLeavey, Christine and Sutskever, Ilya},
journal={arXiv preprint arXiv:2212.04356},
year={2022}
}
Madlook