AIAI 学习 · 专题库

语音与对话

选择并评测语音识别

用真实电话音频比较识别错误、文本修订与尾部延迟。

资料复核:2026-09-082 份直接来源含操作步骤与记录模板
先做什么

识别模型要在相同业务音频、文本归一化和延迟定义下比较。先把电话号码、金额、人名与日期识别对,再看整体字错率。

理解这条链路

原始电话音频格式检查流式识别修订与最终稿实体评分延迟统计
参考流程:根据公开能力整理的操作顺序;分支、重试和回退以正文说明为准,不代表厂商内部实现。

把电话信道放进测试集

分别保留真实 8k 电话、宽带录音、噪声、方言、长停顿与中英混读。将 8k 重采样成 16k 只改变格式,不能补回电话信道已经丢失的高频。每条记录保留原始音频摘要、转码配置、人工参考稿和实体标注。

比较三个结果,不合成一个空泛分数

CER/WER 要写清数字展开、大小写和标点规则;业务实体另算精确匹配;延迟分别记录首个 partial、最终稳定文本及用户声学结束后的等待。对文本修订次数和最终稿变化保留原始事件,不把第一段看似正确的文本当最终结果。

按这个顺序操作

  1. 先抽取已获准使用的真实样本,按语种、信道和错误类型分层;没有真实样本时只做管线自检。
  2. 选一个本地候选和一个账户确实可用的 API 候选,固定模型版本与转码。
  3. 在相同音频上记录每个 partial/final 和接收时间,严格区分真实模型与 mock。
  4. 按通话或说话人做配对比较,查看关键实体错误与尾延迟后再选型。
配套本地工具

以下工具位于 AI 学习工作区。先阅读对应说明,确认所需数据与依赖;本轮未重新运行这些实验。

  • asr-bench/README.md
  • asr-bench/REAL_PHONE_BENCH_PROTOCOL.md

可直接复用的记录模板

sample_id,language,channel,reference,entities,model_id,mode,first_partial_ms,final_after_user_end_ms,cer,entity_exact,error
example-001,zh,phone8k,请核对订单金额,金额,待填,real,待测,待测,待测,待测,

做到什么程度才算通过

  • 同一归一化规则用于所有模型。
  • 失败、空结果和超时保留在报告中。
  • mock 与真实识别分别统计。
  • 报告同时给出实体错误例子与时间分布。
当前证据的限制

本轮核对文档与本地工具入口,没有调用付费 ASR 或重新跑真实电话样本。

本轮确认的事实与来源

以下为公开资料支持的具体结论;操作流程和验收建议属于工程推导。仓库说明或厂商效果表述不等于独立实测。

[1] Qwen3-ASR · 官方仓库

Qwen3-ASR 官方 README 提供 0.6B 与 1.7B 模型,并说明流式推理当前使用 vLLM 后端;该流式路径不支持批推理或返回时间戳。

资料日期:页面未统一标注;以复核日期为准 · 复核:2026-09-08

阅读原始来源 ↗
[2] faster-whisper · 官方仓库

faster-whisper 文档按设备、精度与 batch_size 分别给出测试数据,并说明通过 PyAV 解码音频。其离线速度表不能直接作为电话流式首包延迟。

资料日期:页面未统一标注;以复核日期为准 · 复核:2026-09-08

阅读原始来源 ↗

这次更新了什么

合并开源选型与 ASR 实战;撤下跨测试集的精度排行,并补上 Qwen3-ASR 流式后端限制。

合并前的内容入口

以下旧地址仍可访问,并会带你来到本篇。完整重构前材料已留存本地备份。

  • research-hub/asr-opensource-deploy.html
  • practice-hub/asr-bench-practice.html

接着解决下一个问题