语音与对话
选择并评测语音识别
用真实电话音频比较识别错误、文本修订与尾部延迟。
先做什么
识别模型要在相同业务音频、文本归一化和延迟定义下比较。先把电话号码、金额、人名与日期识别对,再看整体字错率。
理解这条链路
原始电话音频格式检查流式识别修订与最终稿实体评分延迟统计
把电话信道放进测试集
分别保留真实 8k 电话、宽带录音、噪声、方言、长停顿与中英混读。将 8k 重采样成 16k 只改变格式,不能补回电话信道已经丢失的高频。每条记录保留原始音频摘要、转码配置、人工参考稿和实体标注。
比较三个结果,不合成一个空泛分数
CER/WER 要写清数字展开、大小写和标点规则;业务实体另算精确匹配;延迟分别记录首个 partial、最终稳定文本及用户声学结束后的等待。对文本修订次数和最终稿变化保留原始事件,不把第一段看似正确的文本当最终结果。
按这个顺序操作
- 先抽取已获准使用的真实样本,按语种、信道和错误类型分层;没有真实样本时只做管线自检。
- 选一个本地候选和一个账户确实可用的 API 候选,固定模型版本与转码。
- 在相同音频上记录每个 partial/final 和接收时间,严格区分真实模型与 mock。
- 按通话或说话人做配对比较,查看关键实体错误与尾延迟后再选型。
配套本地工具
以下工具位于 AI 学习工作区。先阅读对应说明,确认所需数据与依赖;本轮未重新运行这些实验。
- asr-bench/README.md
- asr-bench/REAL_PHONE_BENCH_PROTOCOL.md
可直接复用的记录模板
sample_id,language,channel,reference,entities,model_id,mode,first_partial_ms,final_after_user_end_ms,cer,entity_exact,error example-001,zh,phone8k,请核对订单金额,金额,待填,real,待测,待测,待测,待测,
做到什么程度才算通过
- 同一归一化规则用于所有模型。
- 失败、空结果和超时保留在报告中。
- mock 与真实识别分别统计。
- 报告同时给出实体错误例子与时间分布。
当前证据的限制
本轮核对文档与本地工具入口,没有调用付费 ASR 或重新跑真实电话样本。
本轮确认的事实与来源
以下为公开资料支持的具体结论;操作流程和验收建议属于工程推导。仓库说明或厂商效果表述不等于独立实测。
[1] Qwen3-ASR · 官方仓库
Qwen3-ASR 官方 README 提供 0.6B 与 1.7B 模型,并说明流式推理当前使用 vLLM 后端;该流式路径不支持批推理或返回时间戳。
资料日期:页面未统一标注;以复核日期为准 · 复核:2026-09-08
阅读原始来源 ↗[2] faster-whisper · 官方仓库
faster-whisper 文档按设备、精度与 batch_size 分别给出测试数据,并说明通过 PyAV 解码音频。其离线速度表不能直接作为电话流式首包延迟。
资料日期:页面未统一标注;以复核日期为准 · 复核:2026-09-08
阅读原始来源 ↗这次更新了什么
合并开源选型与 ASR 实战;撤下跨测试集的精度排行,并补上 Qwen3-ASR 流式后端限制。
合并前的内容入口
以下旧地址仍可访问,并会带你来到本篇。完整重构前材料已留存本地备份。
- research-hub/asr-opensource-deploy.html
- practice-hub/asr-bench-practice.html