Downloads · 30 days
4
6% of all-time downloads
0qwpifs/Diff_Ai05-SVC
Diff_Ai05-SVC is a machine learning model from 0qwpifs. Use it for the machine learning task on the model card, and read the license before you ship it in a product. It is set up for so-vits-svc.
Downloads · 30 days
4
6% of all-time downloads
All-time downloads
62
Public
Repo size
1.3 GB
Likes
2
Public
Click a slice to open those files.
.pth1.2 GB · 96%
From the Hugging Face model README
Что это?
Одна из самых продвинутых моделей для замены голоса в пении. Она берёт эталонный голос и перекрашивает его в ваш тембр, сохраняя интонации, дыхание и эмоции.
Почему Whisper PPG Large V2?
В основе лежит нейросеть OpenAI Whisper Large V2 — она обучена на 680 000 часов речи со всего мира (98 языков). Обычно Whisper расшифровывает аудио, но в SVC мы берём его внутреннее представление звука (PPG — phonetic posteriorgram). Оно очень детальное: 1280 измерений (против типичных 256–768).
Результат: голос звучит живо, не склеивается в «пластик» и не копирует чужих певцов — только ваш характер.
Для кого?
Для тех, кто ценит реализм и готов дать модели побольше вычислительных ресурсов. Идеально для песен с эмоциональными нюансами.
Что это?
Диффузионная модель — она работает как художник-реставратор: начинает с шума и постепенно «проявляет» чистый голос. Под капотом Fish Diffusion, специально заточенный под вокал.
Плюсы:
Что это?
Самый лёгкий и шустрый вариант. Комбинация DDSP (разлагает звук на синтезируемые компоненты) и Rectified Flow (новый умный способ учиться).
Плюсы:
Это информация только об этой конкретной модели голоса — чтобы не смешивать с общим описанием технологий.
Голос автора (Diff_Ai05 / Kedo) обучен на:
| Параметр | Значение |
|---|---|
| 🗣️ Модель | SO-VITS-SVC 4.1 (Whisper PPG Large V2) |
| 📊 Датасет | 1,259 сэмплов (очищены вручную — без шумов, пауз, посторонних звуков) |
| ⏱️ Объём сырого аудио | ≈ 2–3 часа |
| 🔁 Шагов обучения | 30,400 (полный цикл) |
| 🧠 Энкодер | Whisper PPG Large V2 (1280 dims) |
| 🎵 F0 Predictor | crepe (самый точный) |
| 📉 Финальный learning rate | 0.00001 — ювелирная подстройка, чтобы не переучить тембр |
| 🧩 Вокодер | NSF-HiFiGAN |
Результат: модель узнаваема, не сливается с датасетом, отлично передаёт манеру оригинала.
large-v2.pt) — для 4.1pytorch_model.bin) — для Diff-SVC и DDSP0.45 – 0.55crepek=50–100 соседейDiff_Ai05 (также известен как Kedo / 0qwpif / ii_Senya0)
Специалист по ИИ-голосам, 3D-аниматор и вокалист. 4 года исследований в SVC.
Создано с любовью к деталям и живому звуку.