Downloads · 30 days
0
Dimitrius174/voice-tts
voice-tts is a machine learning model from Dimitrius174. Use it for the machine learning task on the model card, and read the license before you ship it in a product.
Zero-shot клон голоса диктора Владимира Еремина (рекламные ролики ЖК «Лайф Варшавская», «Ес-резиденс» от группы «Пионер»).
Downloads · 30 days
0
Access
Public
Updated Aug 2, 2026
Repo size
1.2 MB
Likes
0
Public
Click a slice to open those files.
.wav480 KB · 97%
From the Hugging Face model README
Zero-shot клон голоса диктора Владимира Еремина (рекламные ролики ЖК «Лайф Варшавская», «Ес-резиденс» от группы «Пионер»).
Работает на CPU и GPU, с полной нормализацией чисел, дат и процентов.
| Файл | Назначение |
|---|---|
ref_eremin.wav | Референс-аудио (10 сек чистого голоса, 24kHz) |
eremin_tts.py | Скрипт синтеза (нормализация + разбиение) |
pip install f5-tts num2words soundfile torch torchaudio
Русская модель скачается автоматически с Hugging Face:
Misha24-10/F5-TTS_RUSSIAN (~1.3GB, первый запуск).
# Простая озвучка
python eremin_tts.py "Добрый день! Это Владимир Еремин."
# С числами (нормализация автоматическая)
python eremin_tts.py "Квартира стоит 129 990 рублей, скидка 25%. Дата 15.03.2025."
# Настройки
python eremin_tts.py "Текст" --out result.wav --speed 1.2 --steps 64
| Ввод | Произносится |
|---|---|
129 990 | сто двадцать девять тысяч девятьсот девяносто |
25% | двадцать пять процентов |
2024 | две тысячи двадцать четыре |
15.03.2025 | пятнадцатое марта две тысячи двадцать пятого года |
3.12 | три точка двенадцать (версии) |
Разбиение на предложения по . ; ! ? и переносам строк — каждое
синтезируется отдельно и склеивается.
Голос — личные аудиоданные. Код — MIT.