云南叠跃科技有限公司
返回原创指南

03 · Knowledge Engineering

知识库资料准备:检索质量从上传之前开始

从资料盘点、版本治理、结构化解析到切块与验收,给出一套适用于 Mint 本地和云端知识库的准备方法。

约 10 分钟
企业知识管理、项目资料归档与智能问答建设人员

更新于 2026 年 7 月

01

盘点

明确资料范围、所有者和使用目的

02

治理

去重、定版并补充必要元数据

03

解析

形成统一且通过质检的文档快照

04

切块

按语义和结构生成检索片段

05

验收

使用真实问题验证召回与引用

核心判断

知识库不是文件仓库。来源混乱、版本冲突和结构缺失的问题,不会因为加入向量检索而自动消失。

01 / Scope

先定义知识库要回答什么问题

“把所有资料都上传”通常会带来重复、冲突和噪声。更稳定的做法是先确定使用人、问题范围、资料负责人和更新周期。

01

用途边界

区分制度查询、产品支持、项目资料、科研文献和历史档案,不把完全不同的问答目标混在一起。

02

权限边界

确认哪些资料只能本机使用,哪些可以上传云端并跨设备共享。

03

责任边界

为资料指定维护人和更新时间,避免知识库长期返回已经失效的内容。

章节 1

02 / Source governance

在上传前解决版本、重复和命名问题

同一制度的草稿、修订稿和正式稿同时进入知识库,会让检索系统给出互相矛盾的答案。文件治理比后期调整相似度阈值更重要。

建议保留唯一正式版本,并记录文档名称、版本、发布日期、适用范围、资料类型和负责人。重复文件可以通过内容哈希识别,不能只比较文件名。

需要保留历史版本时,应把版本和生效时间作为显式元数据,而不是依靠“最终版2”“最新修改”等文件名推断。

推荐命名

使用“主题—版本—发布日期”或企业已有的文档编号规则。文件名服务于人工管理,元数据服务于检索和权限。

章节 2

03 / Document shape

让文档结构能够被稳定识别

清晰的标题层级、真实表格和连续段落,会直接改善切块和引用质量。依赖空格对齐、截图文字或装饰性文本框的内容更容易丢失结构。

01

标题与章节

使用真实标题样式和连续层级,避免只通过字号和加粗模拟章节结构。

02

表格

优先保留可编辑表格,并为关键表格补充标题、口径和单位,避免只有颜色或位置表达含义。

03

图片与扫描件

图片中的关键文字需要 OCR;图表应补充说明,帮助检索理解图像与正文的关系。

04

页眉页脚

重复页眉、页脚和水印应在解析阶段识别,避免它们污染每个检索片段。

章节 3

04 / Retrieval units

切块单位应围绕语义,而不是固定字符数

Mint 会优先利用章节、段落、列表和表格边界形成检索片段,再根据模型上下文和内容长度调整大小。

过小的片段缺少上下文,过大的片段会稀释关键词并增加模型负担。对制度条款、技术步骤和表格记录,应采用不同的切块策略。

每个片段需要保留文档、章节、页码和版本引用。回答能够定位来源,才具备企业知识库所需的可核验性。

章节 4

05 / Acceptance

用真实问题验收,不用文件数量验收

知识库显示“已索引”只代表管线完成,不能证明它能回答业务问题。上线前应准备一组真实查询,验证召回内容、引用位置和错误边界。

01

可回答问题

检查答案是否找到正确版本、正确章节,并能回到原文。

02

不可回答问题

确认资料中没有依据时,系统不会使用相似但无关的内容强行回答。

03

更新问题

替换文件后验证旧版本是否退出检索,新版本是否保留完整引用。

章节 5

Implementation Checklist

实施检查表

明确知识库的使用人、问题范围、数据边界和维护人
删除重复文件,并确认唯一正式版本
补齐版本、日期、类型、适用范围和来源元数据
抽查标题、表格、扫描页和关键数字的解析结果
使用真实问题同时验证正确召回、引用和拒答表现

继续阅读 · 01

复杂 PDF 处理:从文件识别到可追溯文本

让资料处理结果可验证、可恢复、可引用

指南中的处理原则来自 Mint 的实际文档、媒体与知识库工程,并持续通过真实资料验证。