知识管理
最后更新时间:2026年8月15日
知识管理用于管理企业内部知识,并结合大语言模型实现检索增强生成(RAG),让智能体基于企业私有知识回答问题, 从而减少大模型的幻觉,并给出可追溯的内容来源。
工作原理
知识库的整体流程分为「构建」与「使用」两个阶段:
知识库构建
- 创建知识库;
- 上传文档;
- 对文档进行切片与向量化。
知识库使用
- 将用户的问题进行向量化;
- 在知识库中进行向量检索;
- 将检索到的内容交给大模型进行回答。
创建知识库
进入「知识管理」页面,点击「新建知识库」,填写名称与描述后完成创建。创建后进入知识库详情,即可开始接入数据源。
接入数据源
平台支持接入多类型数据源,常见方式包括:
- 文档上传:直接上传 PDF、Word、TXT、Markdown 等格式文件。
- 结构化数据:接入数据库、表格等结构化数据。
- 网页或接口:通过配置来源地址抓取或同步内容。
数据质量建议
检索效果高度依赖源内容质量。建议优先整理结构清晰、版本明确的文档,避免重复、过期与相互冲突的内容混入同一知识库。
分块与向量化
文档接入后,平台会按一定策略将长文档切分为更小的片段(分块),并转换为向量表示(向量化)。 分块大小会影响检索精度:过小的分块可能丢失上下文,过大的分块则可能降低相关性。多数场景使用平台默认策略即可, 若发现检索命中率偏低,可尝试调整分块大小或重叠长度。
检索测试与调优
知识库通常提供「检索测试」入口,可输入问题查看命中的内容片段与相似度得分。调优时可关注以下参数:
| 参数 | 说明 |
|---|---|
| 召回数量(top-k) | 每次检索返回的内容片段数量,数量越大上下文越丰富,但可能引入噪声。 |
| 相似度阈值 | 低于该阈值的内容将不被采纳,可有效过滤无关片段。 |
| 分块大小 / 重叠长度 | 控制切分粒度,影响上下文完整性与检索相关性。 |
实践建议
先使用默认参数跑通,再针对「答非所问」或「遗漏关键信息」两类问题分别调参:前者可提高相似度阈值,后者可增大召回数量或分块大小。
知识更新与版本管理
业务内容会持续变化,建议建立轻量更新机制:
- 新增或修改文档后,及时重新同步或重新向量化。
- 对核心制度与正式资料保留版本记录,避免旧版本误用。
- 定期清理重复、过期内容,保持知识库干净。