# 帮道 AI 知识资产生产流水线 > 项目定位:面向企业行业知识场景的 AI 知识资产生产基础设施\ > 版本:v1.0 ## 1. 项目定位 帮道 AI 知识资产生产流水线,不是简单的知识库系统,而是一套将企业分散在文档、制度、案例、访谈、员工经验中的非结构化信息,转化为可理解、可检索、可信任、可持续演进 AI 知识资产的生产体系。 核心理念: > 企业 AI > 的竞争力不是模型能力,而是企业经验被数字化、结构化和持续优化的能力。 ------------------------------------------------------------------------ ## 2. 当前问题 传统 RAG 流程: 文件上传 ↓ 对象存储 ↓ 文本解析 ↓ 切片 ↓ Embedding ↓ 向量数据库 ↓ AI回答 存在问题: - 原始资料质量不可控; - PDF/OCR 噪声污染知识库; - 页眉页脚、水印影响检索; - 文档结构丢失; - 制度、案例、经验混杂; - 无法判断知识可信程度; - 错误知识难以追溯和撤回。 因此企业 AI 首先需要解决: > 如何把企业资料加工成为 AI 可以安全使用的知识资产。 ------------------------------------------------------------------------ ## 3. 总体架构 数据来源层 ↓ 原始资产层 ↓ 数据加工层 ↓ 知识结构层 ↓ 治理审核层 ↓ 发布消费层 ### 数据来源层 包括: - 文档 - 图片 - 音视频 - API数据 - 企业业务系统数据 ### 原始资产层 负责: - 原件保存 - Hash校验 - 来源记录 - 权限信息 - 数据血缘起点 原则: > 原始数据永不修改。 ------------------------------------------------------------------------ # 4. 数据加工层(核心建设重点) 数据加工层解决当前 RAG 准确率不足的核心问题。 流程: 原始文件 ↓ 解析 ↓ 去噪 ↓ 结构恢复 ↓ 知识分类 ↓ 智能切片 ↓ 向量化 ------------------------------------------------------------------------ ## 4.1 文档解析 支持: - PDF - Word - Excel - PPT - 图片OCR - 录音ASR - 视频分析 输出: - 文档结构 - 页面信息 - 内容定位 - 原始证据 ------------------------------------------------------------------------ ## 4.2 文档去噪 处理: - 页眉页脚 - 页码 - 水印 - 重复目录 - 空白字符 - OCR错误 - 编码异常 原则: > 清洗生成新版本,不覆盖原文。 ------------------------------------------------------------------------ ## 4.3 结构恢复 禁止简单固定字数切片。 根据知识类型: ### 制度 章节 ↓ 条款 ↓ 解释 ### SOP 场景 ↓ 前置条件 ↓ 步骤 ↓ 异常处理 ### 案例 背景 ↓ 问题 ↓ 处理过程 ↓ 结果 ↓ 经验 ------------------------------------------------------------------------ # 5. 知识资产模型 核心对象不是 Document,而是: > Knowledge Unit(知识单元) 类型: 类型 说明 ------------ ---------- POLICY 制度规范 SOP 业务流程 CASE 真实案例 FAQ 问答 EXPERIENCE 专家经验 TERM 行业术语 ASSESSMENT 评测数据 ------------------------------------------------------------------------ # 6. 知识生命周期 RAW ↓ PARSED ↓ NORMALIZED ↓ STRUCTURED ↓ REVIEW_PENDING ↓ APPROVED ↓ PUBLISHED ↓ DEPRECATED 原则: - 每次加工产生新版本; - 发布必须经过确认; - 撤回必须可追踪。 ------------------------------------------------------------------------ # 7. 数据可信体系 数据分类: 类型 用途 ----------- ------------ RAW 原始资料 CANDIDATE 加工候选 TRUSTED 可信知识 CASE 案例资产 SYNTHETIC AI生成内容 RUNTIME 运行数据 GOLDEN 评测数据 核心原则: AI生成 != 企业事实 用户反馈 != 标准经验 Embedding != 已发布知识 ------------------------------------------------------------------------ # 8. AI 使用边界 AI 可以: - 自动分类; - 信息抽取; - 标签生成; - 候选FAQ生成; - 相似检测; - 案例结构化。 AI 不可以: - 修改原始事实; - 自动发布知识; - 判断制度有效性; - 替代业务责任人。 原则: LLM = 加工助手 不是 知识管理员 ------------------------------------------------------------------------ # 9. 帮道业务场景示例 原始资料: 物业经理访谈录音。 ↓ AI加工: 生成案例: 场景: 业主拒缴物业费 背景: 业主认为服务不到位 处理: 1. 情绪沟通 2. 定位问题 3. 提供方案 结果: 恢复缴费 经验: 先解决情绪,再解决业务问题 ↓ 人工确认 ↓ 进入: - AI问答 - 物业经理陪练 - 培训系统 ------------------------------------------------------------------------ # 10. 实施路线 ## Phase 1:知识加工链路 目标: 提升现有知识库准确率。 建设: - 原始资产管理 - 文档解析 - 去噪 - 结构化切片 - 基础版本管理 ## Phase 2:知识治理 建设: - 审核流程 - 生命周期 - 血缘 - 撤回 - 权限 ## Phase 3:智能运营 建设: - 自动规则 - 黄金评测集 - 自动质量分析 - 持续优化 ------------------------------------------------------------------------ # 11. 核心指标 ## 数据指标 - 来源可追溯率 - 噪声发现率 - 结构恢复率 ## AI指标 - Recall@K - MRR - nDCG - 无答案误召回率 ## 业务指标 - 专家经验沉淀数量 - 人工查询减少比例 - 培训效率提升 ------------------------------------------------------------------------ # 12. 最终目标 帮道不是建设一个普通知识库。 而是建设: 企业经验数字化生产系统 将: 员工脑中的经验 历史文件中的知识 业务案例中的方法 转化为: AI可以理解 AI可以调用 AI可以训练 AI可以评估 的企业数字资产。 ------------------------------------------------------------------------ # 总结 未来企业 AI 的竞争: 不是单纯模型竞争。 而是: 企业独有数据 + 行业经验结构 + 持续优化机制 + 可信治理能力 帮道 AI 知识资产生产流水线,就是围绕这一核心能力建设。