Configuration Parsing Warning:Invalid JSON for config file config.json

模型资源目录

models-for-asr-chain/ 集中保存 AX650 音频智能链路运行时使用的模型和配套资源。它位于驱动与业务编排层之间:driver/ 和 framework/ 提供模型加载、推理及调度代码,config/sdk-config.yaml 指定这里的模型路径,部署脚本再将生产所需资源同步到目标板。

使用时候作为github项目 asr-llm-tts-chain 的组件使用

完整链路中的模型使用顺序为:

麦克风音频
  → NS 降噪
  → VAD 语音检测
  → 可选的 CAMPPlus 说话人识别
  → ASR 语音转文字
  → LLM 文本生成或翻译
  → TTS 语音合成与播放

一级目录结构

models-for-asr-chain/
├── asr/          # 自动语音识别模型及词表、归一化等配套资源
├── campplus/     # 说话人特征提取与聚类模型
├── kws/          # 关键词唤醒模型预留目录
├── llm/          # 大语言模型、tokenizer、权重和推理配置
├── ns/           # 实时语音降噪与增强模型
├── tts/          # 文本转语音模型、音色和声码器资源
├── vad/          # 语音活动检测模型
└── vc/           # 语音转换模型预留目录

子目录说明

目录 作用 当前工程中的使用方式
asr/ 保存语音识别模型及 tokenizer、词表、特征归一化文件。 当前使用 SenseVoice,将 VAD 输出的话段转换为文本,供转录、LLM 和 TTS 链路继续处理。
campplus/ 保存说话人 embedding 模型。 可选功能,用于提取说话人特征、聚类和标注不同说话人。
kws/ 为关键词唤醒模型保留统一位置。 当前只有占位文件,生产链路尚未启用 KWS。
llm/ 保存大语言模型的分层 AXModel、embedding、tokenizer 和生成配置。 当前使用 Qwen3-1.7B,对 ASR 文本进行回答或中英翻译,并将流式文本交给 TTS 预处理。
ns/ 保存语音降噪和增强模型。 当前使用 FastEnhance,在 48 kHz 实时采集链路中抑制噪声。
tts/ 保存文本分词、语言模型、音色 embedding、声学模型和 decoder 等资源。 当前使用 Hojo TTS,将 Qwen 输出按标点分段合成为语音并送入播放队列。
vad/ 保存语音活动检测模型。 当前使用 TEN-VAD 区分语音与静音,控制话段的开始、结束和累积。
vc/ 为语音转换模型保留统一位置。 当前只有占位文件,生产链路尚未启用 VC。

配置与部署

模型路径由 config/sdk-config.yaml 配置。生产部署应使用 scripts/deploy-ax650.sh 的白名单增量同步,避免遗漏 tokenizer、配置文件或分层 AXModel,也避免将开发期中间文件复制到目标板。

这些文件大多面向 AX650 和指定的 AX Engine/VNPU 模式,不能仅按文件名替换为其他平台或其他编译参数生成的模型。模型升级后应重新执行完整编译、部署依赖检查,并验证对应推理链路。

Downloads last month
2
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support