Downloads · 30 days
9
17% of all-time downloads
AXERA-TECH/Hojo-TTS-Light
Hojo-TTS-Light is a text-to-speech model from AXERA-TECH. Use it when you need text read aloud. The card lists the license as apache-2.0.
Hojo-TTS-Light-40M 中文/英文 TTS(24kHz,15 音色)在爱芯 AX650/NPU3 上的预编译部署包。 全链路 NPU:LM(ax-llm s8)+ finelocal + decoder。
Downloads · 30 days
9
17% of all-time downloads
All-time downloads
54
Public
Repo size
244 MB
Likes
0
Public
Click a slice to open those files.
.axmodel127 MB · 65%
From the Hugging Face model README
Hojo-TTS-Light-40M 中文/英文 TTS(24kHz,15 音色)在爱芯 AX650/NPU3 上的预编译部署包。 全链路 NPU:LM(ax-llm s8)+ fine_local + decoder。
相对上一版的改进:
llm_build2),step0 logits 精度更高、长程生成更稳temperature=0.0 被运行时钳制为 1.0,实际退化为无种子 softmax 采样,
导致每次生成完全不同、偶发近乎静音;本版固定为 argmax 确定性生成,相同输入多次运行 token 序列完全一致models/:预编译模型
lm_s8/:LM 10 层 decode-only axmodel + post + embedding(Pulsar2 7.0 llm_build2,s8/bf16 hidden)fine_local.axmodel(INT8,cos 0.9997)decoder_sq.axmodel(SmoothQuant+U16,mag 0.998+ / phase 0.95-0.97)bin/:C++ 可执行(AX650/aarch64)
hojo_tts_cpp / tts_driver:LM 生成 + 全链路出 wav./bin/hojo_tts_cpp \
models/lm_s8 <embeds.bin> <num_tokens> 17659 128 \
models/fine_local.axmodel models/decoder_sq.axmodel \
models/lm_s8/embed_tokens.bin models/speaker_vecs.bin \
<voice_idx> models/id2code.bin out.wav
<embeds.bin> 为文本 prompt 的 BF16 embedding(50 token 示例见 models/README.md 说明),
输出 out.wav(24kHz)。音色索引 0-14(voice_ids 见 models/Hojo-TTS-Light-40M-voice.npz)。
中文示例(voice hojo_zh_f_01):
<audio controls src="https://huggingface.co/AXERA-TECH/Hojo-TTS-Light/resolve/main/audio/demo_zh.wav"> 你的浏览器不支持音频播放,可<a href="https://huggingface.co/AXERA-TECH/Hojo-TTS-Light/resolve/main/audio/demo_zh.wav">下载中文示例</a>。 </audio>英文示例(voice hojo_en_m_02):
<audio controls src="https://huggingface.co/AXERA-TECH/Hojo-TTS-Light/resolve/main/audio/demo_en.wav"> 你的浏览器不支持音频播放,可<a href="https://huggingface.co/AXERA-TECH/Hojo-TTS-Light/resolve/main/audio/demo_en.wav">下载英文示例</a>。 </audio>长示例(20 秒级,采样生成 temperature=0.8 / top_p=0.95 / repetition_penalty=1.1,与厂商推理一致):
中文长示例(voice hojo_zh_f_01):
<audio controls src="https://huggingface.co/AXERA-TECH/Hojo-TTS-Light/resolve/main/audio/demo_zh_long.wav"> 你的浏览器不支持音频播放,可<a href="https://huggingface.co/AXERA-TECH/Hojo-TTS-Light/resolve/main/audio/demo_zh_long.wav">下载中文长示例</a>。 </audio>英文长示例(voice hojo_en_m_02):
<audio controls src="https://huggingface.co/AXERA-TECH/Hojo-TTS-Light/resolve/main/audio/demo_en_long.wav"> 你的浏览器不支持音频播放,可<a href="https://huggingface.co/AXERA-TECH/Hojo-TTS-Light/resolve/main/audio/demo_en_long.wav">下载英文长示例</a>。 </audio>post_config.json 默认采样,避免长文本重复退化;greedy 可通过
enable_temperature=false 开启)模型转换(ONNX → HF safetensors → llm_build2)与 C++ SDK 构建源码见 GitHub:ml-inory/hojo-tts-light.axera