AIAI 学习 · 专题库

知识与记忆

从原始资料构建可引用知识库

打通文档、会话挖掘、检索与证据回答,留下可复核产物。

资料复核:2026-09-082 份直接来源含操作步骤与记录模板
先做什么

先让每个答案能回到一段有效的原始材料。知识挖掘、检索和回答是三种能力,必须分别验收;从聊天里抽出的说法不能自动变成业务政策。

理解这条链路

原始材料分块与版本候选知识抽取锚定审核检索带引用回答错误归档
参考流程:根据公开能力整理的操作顺序;分支、重试和回退以正文说明为准,不代表厂商内部实现。

先解决知识冲突,再追求召回

每条政策保存生效时间、地区、产品与来源优先级。同一问题出现两个不同答案时,先确认它们是否属于不同时间或服务范围;不要按文本相似度直接去掉其中一个。无法确认的冲突放到人工审核区,不能带着“多数人这么说”发布。

按错误所在层修复

查不到正确材料属于检索问题;材料已在上下文里却答错,才进入生成与 Prompt 调整;引用的材料本身错误则回到治理。分别维护检索命中、回答受证据支持与业务完成三个指标,避免一个综合分看不出该修哪里。

按这个顺序操作

  1. 挑一个明确业务域,整理当前有效文档和需要回答的问题。
  2. 切块时保存标题路径、原文位置、版本与访问权限;QA 对必须回链原句。
  3. 建立词面与语义检索基线,对专有名词、否定条款和时间限定做反例。
  4. 把未回答、错引用和内容冲突送回同一个错误台账,审核后再发布。
配套本地工具

以下工具位于 AI 学习工作区。先阅读对应说明,确认所需数据与依赖;本轮未重新运行这些实验。

  • knowledge-mining-lab/README.md
  • knowledge-mining-pipeline/README.md

可直接复用的记录模板

knowledge_id:
source_id / source_span / source_version:
适用产品、地区与生效时间:
问题表达 / 经审核答案:
引用原文:
权限范围 / 审核人 / 冲突条目:
检索未命中与回答不支持分别记录。

做到什么程度才算通过

  • 每个知识条目可回到原始材料。
  • 旧政策不会覆盖新政策。
  • 权限过滤在检索与输出侧均有设计。
  • 测试集包含应当拒答和证据冲突的情况。
当前证据的限制

本轮核对文档与本地入口;没有重新运行真实向量库、Embedding 或业务知识问答。

本轮确认的事实与来源

以下为公开资料支持的具体结论;操作流程和验收建议属于工程推导。仓库说明或厂商效果表述不等于独立实测。

[1] 阿里云百炼 · 知识库

百炼知识库文档将数据准备、索引、检索与应用接入分开,并提供 TopK、相似度和重排相关配置。配置项存在不代表调大参数必然提升业务质量。

资料日期:页面未统一标注;以复核日期为准 · 复核:2026-09-08

阅读原始来源 ↗
[2] W3C · PROV-O 数据溯源

W3C PROV-O 用 Entity、Activity、Agent 及派生关系描述数据来源;可用于设计知识条目到原始材料的追溯字段。

资料日期:2013-04-30 · 复核:2026-09-08

阅读原始来源 ↗

这次更新了什么

合并知识体系综述和知识挖掘教程;移除小样本 Hit@1 变化等同于生产收益的表达。

合并前的内容入口

以下旧地址仍可访问,并会带你来到本篇。完整重构前材料已留存本地备份。

  • research-hub/llm-knowledge-system.html
  • practice-hub/knowledge-mining-practice.html

接着解决下一个问题