03 · Knowledge Engineering
知识库资料准备:检索质量从上传之前开始
从资料盘点、版本治理、结构化解析到切块与验收,给出一套适用于 Mint 本地和云端知识库的准备方法。
更新于 2026 年 7 月
盘点
明确资料范围、所有者和使用目的
治理
去重、定版并补充必要元数据
解析
形成统一且通过质检的文档快照
切块
按语义和结构生成检索片段
验收
使用真实问题验证召回与引用
核心判断
知识库不是文件仓库。来源混乱、版本冲突和结构缺失的问题,不会因为加入向量检索而自动消失。
01 / Scope
先定义知识库要回答什么问题
“把所有资料都上传”通常会带来重复、冲突和噪声。更稳定的做法是先确定使用人、问题范围、资料负责人和更新周期。
用途边界
区分制度查询、产品支持、项目资料、科研文献和历史档案,不把完全不同的问答目标混在一起。
权限边界
确认哪些资料只能本机使用,哪些可以上传云端并跨设备共享。
责任边界
为资料指定维护人和更新时间,避免知识库长期返回已经失效的内容。
02 / Source governance
在上传前解决版本、重复和命名问题
同一制度的草稿、修订稿和正式稿同时进入知识库,会让检索系统给出互相矛盾的答案。文件治理比后期调整相似度阈值更重要。
建议保留唯一正式版本,并记录文档名称、版本、发布日期、适用范围、资料类型和负责人。重复文件可以通过内容哈希识别,不能只比较文件名。
需要保留历史版本时,应把版本和生效时间作为显式元数据,而不是依靠“最终版2”“最新修改”等文件名推断。
推荐命名
使用“主题—版本—发布日期”或企业已有的文档编号规则。文件名服务于人工管理,元数据服务于检索和权限。
03 / Document shape
让文档结构能够被稳定识别
清晰的标题层级、真实表格和连续段落,会直接改善切块和引用质量。依赖空格对齐、截图文字或装饰性文本框的内容更容易丢失结构。
标题与章节
使用真实标题样式和连续层级,避免只通过字号和加粗模拟章节结构。
表格
优先保留可编辑表格,并为关键表格补充标题、口径和单位,避免只有颜色或位置表达含义。
图片与扫描件
图片中的关键文字需要 OCR;图表应补充说明,帮助检索理解图像与正文的关系。
页眉页脚
重复页眉、页脚和水印应在解析阶段识别,避免它们污染每个检索片段。
04 / Retrieval units
切块单位应围绕语义,而不是固定字符数
Mint 会优先利用章节、段落、列表和表格边界形成检索片段,再根据模型上下文和内容长度调整大小。
过小的片段缺少上下文,过大的片段会稀释关键词并增加模型负担。对制度条款、技术步骤和表格记录,应采用不同的切块策略。
每个片段需要保留文档、章节、页码和版本引用。回答能够定位来源,才具备企业知识库所需的可核验性。
章节 405 / Acceptance
用真实问题验收,不用文件数量验收
知识库显示“已索引”只代表管线完成,不能证明它能回答业务问题。上线前应准备一组真实查询,验证召回内容、引用位置和错误边界。
可回答问题
检查答案是否找到正确版本、正确章节,并能回到原文。
不可回答问题
确认资料中没有依据时,系统不会使用相似但无关的内容强行回答。
更新问题
替换文件后验证旧版本是否退出检索,新版本是否保留完整引用。
Implementation Checklist
实施检查表
继续阅读 · 01