AIAI 学习 · 专题库

知识与记忆

用失败案例推动数据迭代

从真实错误采样开始,隔离训练、开发与盲测数据。

资料复核:2026-09-082 份直接来源含操作步骤与记录模板
先做什么

数据迭代从一个可解释的失败开始。先确认失败来自知识、模型、流程还是线路,再决定补哪种数据;不要把所有失败都交给模型重训。

理解这条链路

线上失败样本证据归因审核标注去重与隔离单项改动盲测灰度反馈
参考流程:根据公开能力整理的操作顺序;分支、重试和回退以正文说明为准,不代表厂商内部实现。

防止同一个对话偷偷进入两边

相邻话轮、同一客户和相似模板高度相关。按通话、主体或来源文档分组切分,并做近重复检查;只随机切行,容易让训练集和盲测集共享答案。合成数据用于覆盖反例,不能替代真实业务分布。

每次迭代只验证一个假设

错误:金额口语表达识别失败。改动可以是热词、归一化或 ASR,先定位再选一项。用固定案例验证修复是否有效,再用盲测集确认未损伤其他场景。保留失败例子比只保存一个总分更有助于下一轮改进。

按这个顺序操作

  1. 从失败与成功通话都抽样,避免只看投诉样本而无法估计总体。
  2. 定义错误类型、来源许可、标注规范和复核方式。
  3. 按来源分组去重并冻结盲测集,合成数据单独标识。
  4. 发布单一改动,比较配对结果并归档仍未解决的问题。

可直接复用的记录模板

failure_id:
所属层:线路 / 音频 / 识别 / 知识 / 工具 / 话术
原始证据及来源许可:
改动假设:
train_group / dev_group / blind_test_group:
真实或合成:
修复案例 / 新增退化案例 / 发布结论:

做到什么程度才算通过

  • 同一来源不会跨训练与盲测泄漏。
  • 合成与真实数据分开报告。
  • 每个改动有对应假设。
  • 成功和失败均保留原始证据。
当前证据的限制

未采集新的用户通话或训练模型;迭代收益须由实际数据测得。

本轮确认的事实与来源

以下为公开资料支持的具体结论;操作流程和验收建议属于工程推导。仓库说明或厂商效果表述不等于独立实测。

[1] OpenAI · Prompt engineering

OpenAI 当前 Prompt 指南建议固定模型快照并建立评测,监测提示词迭代和模型升级后的行为变化。

资料日期:页面未统一标注;以复核日期为准 · 复核:2026-09-08

阅读原始来源 ↗
[2] W3C · PROV-O 数据溯源

PROV-O 可表达数据由哪些来源和处理活动派生;合成样本与真实来源应保留不同血缘。

资料日期:2013-04-30 · 复核:2026-09-08

阅读原始来源 ↗

这次更新了什么

删除从“飞轮”概念直接推导收益的叙述,改成错误归因、数据隔离与单项实验。

合并前的内容入口

以下旧地址仍可访问,并会带你来到本篇。完整重构前材料已留存本地备份。

  • research-hub/data-flywheel.html

接着解决下一个问题