Downloads · 30 days
30
26% of all-time downloads
ViktorR-BarreL/phonoscopic
phonoscopic is a automatic speech recognition model from ViktorR-BarreL. Use it when you need speech turned into text. It is set up for transformers. The card lists the license as mit.
Данная модель представляет собой дообученную версию wav2vec2 для фонемной транскрипции русской речи. Модель используется в приложении [ф]оноскоп.
Downloads · 30 days
30
26% of all-time downloads
All-time downloads
116
Public
Parameters
316M
1.3 GB on disk
Likes
0
Public
Click a slice to open those files.
.safetensors1.3 GB · 100%
From the Hugging Face model README
Данная модель представляет собой дообученную версию wav2vec2 для фонемной транскрипции русской речи. Модель используется в приложении [ф]оноскоп.
Модель обучена распознавать фонемы русского языка (включая гласные, согласные и их мягкие/твердые варианты). Ожидаемый формат входных данных — 16kHz WAV аудио.
from transformers import Wav2Vec2ForCTC, Wav2Vec2Processor
import torch
# Загрузка модели
model_name = "ViktorR-BarreL/phonoscopic"
processor = Wav2Vec2Processor.from_pretrained(model_name)
model = Wav2Vec2ForCTC.from_pretrained(model_name)
# Пример обработки аудио (y - массив numpy, sr=16000)
inputs = processor(y, sampling_rate=16000, return_tensors="pt")
with torch.no_grad():
logits = model(inputs.input_values).logits
predicted_ids = torch.argmax(logits, dim=-1)
# Декодирование
transcription = processor.decode(predicted_ids[0])
print(transcription)