Downloads · 30 days
0
Dibachain/Diba-STT
Diba-STT is a automatic speech recognition model from Dibachain. Use it when you need speech turned into text. The card lists the license as apache-2.0.
Downloads · 30 days
0
Access
Public
Updated Sep 16, 2026
Repo size
5.2 GB
Likes
2
Public
Click a slice to open those files.
.carpa3.4 GB · 65%
From the Hugging Face model README
A Persian speech-to-text model by Dibachain — offline and real-time مدل تبدیل گفتار به متن فارسی، ساختهی دیباچین — آفلاین و بلادرنگ
🌐 dibachain.ir · 🤖 Agent · Live demo · Diba-Base · Diba-Embed · Diba-Vision
</div>Diba-STT transcribes spoken Persian into text. It runs fully offline — on a CPU, on a phone, or entirely in the browser — with no cloud and no GPU, and it works in real time as you speak. Part of the Diba model family from Dibachain.
Choose by the trade‑off between size and accuracy:
| Version | Size | Best for | Direct download |
|---|---|---|---|
| fa-small-0.42 | ~53 MB | real‑time, mobile, in‑browser (recommended default) | download |
| fa-0.42 | ~1.6 GB | highest accuracy, server / desktop | download |
| fa-small-0.5 | ~60 MB | small, desktop | download |
| fa-0.5 | ~1 GB | large vocabulary, server | download |
A browser‑ready package of the small model is at browser/diba-stt-fa-small.tar.gz for in‑page real‑time transcription.
Install the Diba-STT package:
pip install diba-stt
from diba_stt import DibaSTT
stt = DibaSTT("fa-small") # or "fa" for the large, more accurate model
print(stt.transcribe("audio.wav")) # 16 kHz mono WAV
Real time, from an audio stream:
stt = DibaSTT("fa-small")
for chunk in pcm_chunks: # 16-bit PCM bytes
print(stt.accept(chunk))
print(stt.final())
Models download automatically on first use. Available: fa-small (default), fa (most accurate), fa-small-0.5, fa-0.5.
The live demo Space transcribes your microphone in real time, entirely in your browser, using the packaged small model — sign in with your Hugging Face account to use it.
Accuracy depends on microphone quality, background noise, and accent; the small models trade some accuracy for speed and size. Audio must be 16 kHz mono for the Python API. Best on clear, conversational Persian.
دیبا-استیتی گفتار فارسی را به متن تبدیل میکند. کاملاً آفلاین اجرا میشود — روی CPU، روی گوشی، یا کاملاً داخل مرورگر — بدون ابر و بدون GPU، و بلادرنگ همزمان با صحبت شما کار میکند. بخشی از خانوادهی مدلهای دیبا ساختهی دیباچین.
بر اساس توازن حجم و دقت انتخاب کنید:
| نسخه | حجم | مناسبِ | دانلود مستقیم |
|---|---|---|---|
| fa-small-0.42 | حدود ۵۳ مگابایت | بلادرنگ، موبایل، مرورگر (پیشفرض پیشنهادی) | دانلود |
| fa-0.42 | حدود ۱٫۶ گیگابایت | بالاترین دقت، سرور / دسکتاپ | دانلود |
| fa-small-0.5 | حدود ۶۰ مگابایت | کوچک، دسکتاپ | دانلود |
| fa-0.5 | حدود ۱ گیگابایت | واژگان بزرگ، سرور | دانلود |
نسخهی آمادهی مرورگرِ مدل کوچک در browser/diba-stt-fa-small.tar.gz قرار دارد.
pip install diba-stt
from diba_stt import DibaSTT
stt = DibaSTT("fa-small") # یا "fa" برای مدل بزرگ و دقیقتر
print(stt.transcribe("audio.wav")) # فایل WAV، ۱۶ کیلوهرتز، تککاناله
مدلها بار اول خودکار دانلود میشوند. نامها: fa-small (پیشفرض)، fa (دقیقترین)، fa-small-0.5، fa-0.5. صدا باید ۱۶ کیلوهرتز و تککاناله باشد.
صفحهی نمایش زنده میکروفون شما را بلادرنگ و کاملاً داخل مرورگر رونویسی میکند؛ برای استفاده با حساب Hugging Face خود وارد شوید.
دقت به کیفیت میکروفون، نویز محیط و لهجه بستگی دارد؛ مدلهای کوچک بخشی از دقت را با سرعت و حجم عوض میکنند. برای API پایتون صدا باید ۱۶ کیلوهرتز تککاناله باشد. بهترین نتیجه روی گفتار فارسی واضح و محاورهای.
خانوادهی دیبا · The Diba family — Diba-Base · Diba-Embed · Diba-Vision · Diba-STT · Diba-Code · Diba-TTS · Diba-Image · Diba-ImageEdit
</div>