Downloads · 30 days
4
31% of all-time downloads
nelmo-ux/mod-sencevoice
mod-sencevoice is a automatic speech recognition model from nelmo-ux. Use it when you need speech turned into text. It is set up for funasr. The card lists the license as other.
SenseVoiceSmall をチャンクマスク学習(SCAMA方式)でファインチューニングした日本語特化モデルです。ストリーミング(チャンク逐次)推論時の精度劣化を解消することを目的としています。
Downloads · 30 days
4
31% of all-time downloads
All-time downloads
13
Public
Repo size
2.8 GB
Likes
0
Public
Click a slice to open those files.
.pt936 MB · 100%
From the Hugging Face model README
SenseVoiceSmall をチャンクマスク学習(SCAMA方式)でファインチューニングした日本語特化モデルです。ストリーミング(チャンク逐次)推論時の精度劣化を解消することを目的としています。
ベースの SenseVoiceSmall は全区間双方向 attention で学習されているため、そのままチャンク推論すると精度が大きく劣化します。本モデルはダイナミックチャンクマスク(chunk_size を学習ステップごとに 8/12/16 からランダム選択)でファインチューニングを行い、このギャップをほぼ解消しました。
v3(現行): 814時間コーパス(58アーカイブ・56スタジオ)・H100×2(bf16)で学習。v2(300時間)から全指標で改善。
| モデル | チャンク推論 CER | フル注意 CER | ギャップ |
|---|---|---|---|
| SenseVoiceSmall(公開重み) | 0.4024 | 0.1781 | 0.2243 |
| v2(300h) | 0.1679 | 0.1584 | 0.0095 |
| v3(814h、現行) | 0.1623 | 0.1518 | 0.0106 |
eval/ に確定評価の生JSONを同梱feat/chunk-training ブランチ、docs/chunk_training.md)model.py はチャンク推論対応版(forward_chunk / init_chunk_cache を含む)ですfrom funasr import AutoModel
model = AutoModel(
model="nelmo-ux/mod-sencevoice",
trust_remote_code=True,
remote_code="model.py",
device="cpu", # または "cuda:0"
)
res = model.generate(input="audio.wav", language="ja", use_itn=True)
同梱 model.py の init_chunk_cache() / forward_chunk()、または SenseVoice-mod の streaming/ パッケージ(チャンクバックエンド)を使用してください。学習時ジオメトリ(window 12 / stride 10 / pad_right 2 / look_back 1)での評価値が上表です。
model.pt — ファインチューニング済み重み(v3 採用チェックポイント = round-2 epoch 3、weights のみ)config.yaml / configuration.json / am.mvn / chn_jpn_yue_eng_ko_spectok.bpe.model — funasr ロードに必要な一式(ベースモデル由来)model.py — チャンク推論対応のモデル実装(remote code)eval/ — v3 の全 val 確定評価JSON(ep2/ep3/ep4)。過去バージョンの評価はリポジトリの revision 履歴を参照model.py)は MIT License