Downloads · 30 days
4
22% of all-time downloads
AXERA-TECH/GCRN
GCRN is a audio-to-audio model from AXERA-TECH. Use it for the audio-to-audio task on the model card, and read the license before you ship it in a product. The card lists the license as apache-2.0.
GCRN(Graph Convolutional Recurrent Network)单声道语音增强模型,输入 16 kHz 噪声语音, 输出同长增强语音。本包为 AX650 / NPU3 量化部署版:
Downloads · 30 days
4
22% of all-time downloads
All-time downloads
18
Public
Repo size
29.3 MB
Likes
0
Public
Click a slice to open those files.
.axmodel28.9 MB · 99%
From the Hugging Face model README
GCRN(Graph Convolutional Recurrent Network)单声道语音增强模型,输入 16 kHz 噪声语音, 输出同长增强语音。本包为 AX650 / NPU3 量化部署版:
bash setup.sh
bash run.sh
脚本会自动选择后端:板端(有 axengine)跑 NPU 模型,普通电脑自动用 ONNX 模型演示。
输出为 enhanced.wav,增强前后的对比音频可以自己听一下。
| 目录 | 用途 |
|---|---|
models/ | AXMODEL 模型 + model_meta.json |
python/ | Python SDK(axengine / onnxruntime 双后端) |
cpp/ | C++ SDK(AX Engine runtime,aarch64 交叉编译) |
model_convert/ | 导出、校准、Pulsar2 编译全套可复现脚本 |
reports/ | 导出/编译/仿真/板端验证报告 |
test_audio/ | 自带 9.77 秒测试音频 |
from gcrn_sdk import GCRNDenoiser
denoiser = GCRNDenoiser("models/model.axmodel")
report = denoiser.enhance_file("test_audio/mix.wav", "enhanced.wav")
print(report) # 含 RTF 等性能指标
Q: import 报错找不到 axengine?
A: 说明当前不在 AX 板端。代码会自动用 ONNX 模型演示;要在 NPU 上跑,需在 AX650 板端
安装匹配的 axengine wheel(见 setup.sh 输出提示)。
Q: 想自己重新编译 AXMODEL?
A: 进入 model_convert/ 按 README 操作,Pulsar2 会从 ONNX 重新量化编译。
原始编译使用 Docker 镜像 pulsar2:7.0-lite,配置为 NPU3 + U16 高精度模式。
Q: 输入音频有什么要求? A: 16 kHz、单声道、16-bit PCM WAV;更长音频会自动按 4 秒分块处理并拼接。