知识与记忆
用失败案例推动数据迭代
从真实错误采样开始,隔离训练、开发与盲测数据。
先做什么
数据迭代从一个可解释的失败开始。先确认失败来自知识、模型、流程还是线路,再决定补哪种数据;不要把所有失败都交给模型重训。
理解这条链路
线上失败样本证据归因审核标注去重与隔离单项改动盲测灰度反馈
防止同一个对话偷偷进入两边
相邻话轮、同一客户和相似模板高度相关。按通话、主体或来源文档分组切分,并做近重复检查;只随机切行,容易让训练集和盲测集共享答案。合成数据用于覆盖反例,不能替代真实业务分布。
每次迭代只验证一个假设
错误:金额口语表达识别失败。改动可以是热词、归一化或 ASR,先定位再选一项。用固定案例验证修复是否有效,再用盲测集确认未损伤其他场景。保留失败例子比只保存一个总分更有助于下一轮改进。
按这个顺序操作
- 从失败与成功通话都抽样,避免只看投诉样本而无法估计总体。
- 定义错误类型、来源许可、标注规范和复核方式。
- 按来源分组去重并冻结盲测集,合成数据单独标识。
- 发布单一改动,比较配对结果并归档仍未解决的问题。
可直接复用的记录模板
failure_id: 所属层:线路 / 音频 / 识别 / 知识 / 工具 / 话术 原始证据及来源许可: 改动假设: train_group / dev_group / blind_test_group: 真实或合成: 修复案例 / 新增退化案例 / 发布结论:
做到什么程度才算通过
- 同一来源不会跨训练与盲测泄漏。
- 合成与真实数据分开报告。
- 每个改动有对应假设。
- 成功和失败均保留原始证据。
当前证据的限制
未采集新的用户通话或训练模型;迭代收益须由实际数据测得。
本轮确认的事实与来源
以下为公开资料支持的具体结论;操作流程和验收建议属于工程推导。仓库说明或厂商效果表述不等于独立实测。
[1] OpenAI · Prompt engineering
OpenAI 当前 Prompt 指南建议固定模型快照并建立评测,监测提示词迭代和模型升级后的行为变化。
资料日期:页面未统一标注;以复核日期为准 · 复核:2026-09-08
阅读原始来源 ↗[2] W3C · PROV-O 数据溯源
PROV-O 可表达数据由哪些来源和处理活动派生;合成样本与真实来源应保留不同血缘。
资料日期:2013-04-30 · 复核:2026-09-08
阅读原始来源 ↗这次更新了什么
删除从“飞轮”概念直接推导收益的叙述,改成错误归因、数据隔离与单项实验。
合并前的内容入口
以下旧地址仍可访问,并会带你来到本篇。完整重构前材料已留存本地备份。
- research-hub/data-flywheel.html