Configuration Parsing Warning:Invalid JSON for config file config.json
模型资源目录
models-for-asr-chain/ 集中保存 AX650 音频智能链路运行时使用的模型和配套资源。它位于驱动与业务编排层之间:driver/ 和 framework/ 提供模型加载、推理及调度代码,config/sdk-config.yaml 指定这里的模型路径,部署脚本再将生产所需资源同步到目标板。
使用时候作为github项目 asr-llm-tts-chain 的组件使用
完整链路中的模型使用顺序为:
麦克风音频
→ NS 降噪
→ VAD 语音检测
→ 可选的 CAMPPlus 说话人识别
→ ASR 语音转文字
→ LLM 文本生成或翻译
→ TTS 语音合成与播放
一级目录结构
models-for-asr-chain/
├── asr/ # 自动语音识别模型及词表、归一化等配套资源
├── campplus/ # 说话人特征提取与聚类模型
├── kws/ # 关键词唤醒模型预留目录
├── llm/ # 大语言模型、tokenizer、权重和推理配置
├── ns/ # 实时语音降噪与增强模型
├── tts/ # 文本转语音模型、音色和声码器资源
├── vad/ # 语音活动检测模型
└── vc/ # 语音转换模型预留目录
子目录说明
| 目录 | 作用 | 当前工程中的使用方式 |
|---|---|---|
asr/ |
保存语音识别模型及 tokenizer、词表、特征归一化文件。 | 当前使用 SenseVoice,将 VAD 输出的话段转换为文本,供转录、LLM 和 TTS 链路继续处理。 |
campplus/ |
保存说话人 embedding 模型。 | 可选功能,用于提取说话人特征、聚类和标注不同说话人。 |
kws/ |
为关键词唤醒模型保留统一位置。 | 当前只有占位文件,生产链路尚未启用 KWS。 |
llm/ |
保存大语言模型的分层 AXModel、embedding、tokenizer 和生成配置。 | 当前使用 Qwen3-1.7B,对 ASR 文本进行回答或中英翻译,并将流式文本交给 TTS 预处理。 |
ns/ |
保存语音降噪和增强模型。 | 当前使用 FastEnhance,在 48 kHz 实时采集链路中抑制噪声。 |
tts/ |
保存文本分词、语言模型、音色 embedding、声学模型和 decoder 等资源。 | 当前使用 Hojo TTS,将 Qwen 输出按标点分段合成为语音并送入播放队列。 |
vad/ |
保存语音活动检测模型。 | 当前使用 TEN-VAD 区分语音与静音,控制话段的开始、结束和累积。 |
vc/ |
为语音转换模型保留统一位置。 | 当前只有占位文件,生产链路尚未启用 VC。 |
配置与部署
模型路径由 config/sdk-config.yaml 配置。生产部署应使用 scripts/deploy-ax650.sh 的白名单增量同步,避免遗漏 tokenizer、配置文件或分层 AXModel,也避免将开发期中间文件复制到目标板。
这些文件大多面向 AX650 和指定的 AX Engine/VNPU 模式,不能仅按文件名替换为其他平台或其他编译参数生成的模型。模型升级后应重新执行完整编译、部署依赖检查,并验证对应推理链路。
- Downloads last month
- 2
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support