437 lines
6.8 KiB
Markdown
437 lines
6.8 KiB
Markdown
# 帮道 AI 知识资产生产流水线
|
|
|
|
> 项目定位:面向企业行业知识场景的 AI 知识资产生产基础设施\
|
|
> 版本:v1.0
|
|
|
|
## 1. 项目定位
|
|
|
|
帮道 AI
|
|
知识资产生产流水线,不是简单的知识库系统,而是一套将企业分散在文档、制度、案例、访谈、员工经验中的非结构化信息,转化为可理解、可检索、可信任、可持续演进
|
|
AI 知识资产的生产体系。
|
|
|
|
核心理念:
|
|
|
|
> 企业 AI
|
|
> 的竞争力不是模型能力,而是企业经验被数字化、结构化和持续优化的能力。
|
|
|
|
------------------------------------------------------------------------
|
|
|
|
## 2. 当前问题
|
|
|
|
传统 RAG 流程:
|
|
|
|
文件上传
|
|
↓
|
|
对象存储
|
|
↓
|
|
文本解析
|
|
↓
|
|
切片
|
|
↓
|
|
Embedding
|
|
↓
|
|
向量数据库
|
|
↓
|
|
AI回答
|
|
|
|
存在问题:
|
|
|
|
- 原始资料质量不可控;
|
|
- PDF/OCR 噪声污染知识库;
|
|
- 页眉页脚、水印影响检索;
|
|
- 文档结构丢失;
|
|
- 制度、案例、经验混杂;
|
|
- 无法判断知识可信程度;
|
|
- 错误知识难以追溯和撤回。
|
|
|
|
因此企业 AI 首先需要解决:
|
|
|
|
> 如何把企业资料加工成为 AI 可以安全使用的知识资产。
|
|
|
|
------------------------------------------------------------------------
|
|
|
|
## 3. 总体架构
|
|
|
|
数据来源层
|
|
↓
|
|
原始资产层
|
|
↓
|
|
数据加工层
|
|
↓
|
|
知识结构层
|
|
↓
|
|
治理审核层
|
|
↓
|
|
发布消费层
|
|
|
|
### 数据来源层
|
|
|
|
包括:
|
|
|
|
- 文档
|
|
- 图片
|
|
- 音视频
|
|
- API数据
|
|
- 企业业务系统数据
|
|
|
|
### 原始资产层
|
|
|
|
负责:
|
|
|
|
- 原件保存
|
|
- Hash校验
|
|
- 来源记录
|
|
- 权限信息
|
|
- 数据血缘起点
|
|
|
|
原则:
|
|
|
|
> 原始数据永不修改。
|
|
|
|
------------------------------------------------------------------------
|
|
|
|
# 4. 数据加工层(核心建设重点)
|
|
|
|
数据加工层解决当前 RAG 准确率不足的核心问题。
|
|
|
|
流程:
|
|
|
|
原始文件
|
|
↓
|
|
解析
|
|
↓
|
|
去噪
|
|
↓
|
|
结构恢复
|
|
↓
|
|
知识分类
|
|
↓
|
|
智能切片
|
|
↓
|
|
向量化
|
|
|
|
------------------------------------------------------------------------
|
|
|
|
## 4.1 文档解析
|
|
|
|
支持:
|
|
|
|
- PDF
|
|
- Word
|
|
- Excel
|
|
- PPT
|
|
- 图片OCR
|
|
- 录音ASR
|
|
- 视频分析
|
|
|
|
输出:
|
|
|
|
- 文档结构
|
|
- 页面信息
|
|
- 内容定位
|
|
- 原始证据
|
|
|
|
------------------------------------------------------------------------
|
|
|
|
## 4.2 文档去噪
|
|
|
|
处理:
|
|
|
|
- 页眉页脚
|
|
- 页码
|
|
- 水印
|
|
- 重复目录
|
|
- 空白字符
|
|
- OCR错误
|
|
- 编码异常
|
|
|
|
原则:
|
|
|
|
> 清洗生成新版本,不覆盖原文。
|
|
|
|
------------------------------------------------------------------------
|
|
|
|
## 4.3 结构恢复
|
|
|
|
禁止简单固定字数切片。
|
|
|
|
根据知识类型:
|
|
|
|
### 制度
|
|
|
|
章节
|
|
↓
|
|
条款
|
|
↓
|
|
解释
|
|
|
|
### SOP
|
|
|
|
场景
|
|
↓
|
|
前置条件
|
|
↓
|
|
步骤
|
|
↓
|
|
异常处理
|
|
|
|
### 案例
|
|
|
|
背景
|
|
↓
|
|
问题
|
|
↓
|
|
处理过程
|
|
↓
|
|
结果
|
|
↓
|
|
经验
|
|
|
|
------------------------------------------------------------------------
|
|
|
|
# 5. 知识资产模型
|
|
|
|
核心对象不是 Document,而是:
|
|
|
|
> Knowledge Unit(知识单元)
|
|
|
|
类型:
|
|
|
|
类型 说明
|
|
------------ ----------
|
|
POLICY 制度规范
|
|
SOP 业务流程
|
|
CASE 真实案例
|
|
FAQ 问答
|
|
EXPERIENCE 专家经验
|
|
TERM 行业术语
|
|
ASSESSMENT 评测数据
|
|
|
|
------------------------------------------------------------------------
|
|
|
|
# 6. 知识生命周期
|
|
|
|
RAW
|
|
↓
|
|
PARSED
|
|
↓
|
|
NORMALIZED
|
|
↓
|
|
STRUCTURED
|
|
↓
|
|
REVIEW_PENDING
|
|
↓
|
|
APPROVED
|
|
↓
|
|
PUBLISHED
|
|
↓
|
|
DEPRECATED
|
|
|
|
原则:
|
|
|
|
- 每次加工产生新版本;
|
|
- 发布必须经过确认;
|
|
- 撤回必须可追踪。
|
|
|
|
------------------------------------------------------------------------
|
|
|
|
# 7. 数据可信体系
|
|
|
|
数据分类:
|
|
|
|
类型 用途
|
|
----------- ------------
|
|
RAW 原始资料
|
|
CANDIDATE 加工候选
|
|
TRUSTED 可信知识
|
|
CASE 案例资产
|
|
SYNTHETIC AI生成内容
|
|
RUNTIME 运行数据
|
|
GOLDEN 评测数据
|
|
|
|
核心原则:
|
|
|
|
AI生成 != 企业事实
|
|
|
|
用户反馈 != 标准经验
|
|
|
|
Embedding != 已发布知识
|
|
|
|
------------------------------------------------------------------------
|
|
|
|
# 8. AI 使用边界
|
|
|
|
AI 可以:
|
|
|
|
- 自动分类;
|
|
- 信息抽取;
|
|
- 标签生成;
|
|
- 候选FAQ生成;
|
|
- 相似检测;
|
|
- 案例结构化。
|
|
|
|
AI 不可以:
|
|
|
|
- 修改原始事实;
|
|
- 自动发布知识;
|
|
- 判断制度有效性;
|
|
- 替代业务责任人。
|
|
|
|
原则:
|
|
|
|
LLM = 加工助手
|
|
|
|
不是
|
|
|
|
知识管理员
|
|
|
|
------------------------------------------------------------------------
|
|
|
|
# 9. 帮道业务场景示例
|
|
|
|
原始资料:
|
|
|
|
物业经理访谈录音。
|
|
|
|
↓
|
|
|
|
AI加工:
|
|
|
|
生成案例:
|
|
|
|
场景:
|
|
业主拒缴物业费
|
|
|
|
背景:
|
|
业主认为服务不到位
|
|
|
|
处理:
|
|
1. 情绪沟通
|
|
2. 定位问题
|
|
3. 提供方案
|
|
|
|
结果:
|
|
恢复缴费
|
|
|
|
经验:
|
|
先解决情绪,再解决业务问题
|
|
|
|
↓
|
|
|
|
人工确认
|
|
|
|
↓
|
|
|
|
进入:
|
|
|
|
- AI问答
|
|
- 物业经理陪练
|
|
- 培训系统
|
|
|
|
------------------------------------------------------------------------
|
|
|
|
# 10. 实施路线
|
|
|
|
## Phase 1:知识加工链路
|
|
|
|
目标:
|
|
|
|
提升现有知识库准确率。
|
|
|
|
建设:
|
|
|
|
- 原始资产管理
|
|
- 文档解析
|
|
- 去噪
|
|
- 结构化切片
|
|
- 基础版本管理
|
|
|
|
## Phase 2:知识治理
|
|
|
|
建设:
|
|
|
|
- 审核流程
|
|
- 生命周期
|
|
- 血缘
|
|
- 撤回
|
|
- 权限
|
|
|
|
## Phase 3:智能运营
|
|
|
|
建设:
|
|
|
|
- 自动规则
|
|
- 黄金评测集
|
|
- 自动质量分析
|
|
- 持续优化
|
|
|
|
------------------------------------------------------------------------
|
|
|
|
# 11. 核心指标
|
|
|
|
## 数据指标
|
|
|
|
- 来源可追溯率
|
|
- 噪声发现率
|
|
- 结构恢复率
|
|
|
|
## AI指标
|
|
|
|
- Recall@K
|
|
- MRR
|
|
- nDCG
|
|
- 无答案误召回率
|
|
|
|
## 业务指标
|
|
|
|
- 专家经验沉淀数量
|
|
- 人工查询减少比例
|
|
- 培训效率提升
|
|
|
|
------------------------------------------------------------------------
|
|
|
|
# 12. 最终目标
|
|
|
|
帮道不是建设一个普通知识库。
|
|
|
|
而是建设:
|
|
|
|
企业经验数字化生产系统
|
|
|
|
将:
|
|
|
|
员工脑中的经验
|
|
|
|
历史文件中的知识
|
|
|
|
业务案例中的方法
|
|
|
|
转化为:
|
|
|
|
AI可以理解
|
|
AI可以调用
|
|
AI可以训练
|
|
AI可以评估
|
|
|
|
的企业数字资产。
|
|
|
|
------------------------------------------------------------------------
|
|
|
|
# 总结
|
|
|
|
未来企业 AI 的竞争:
|
|
|
|
不是单纯模型竞争。
|
|
|
|
而是:
|
|
|
|
企业独有数据
|
|
+
|
|
行业经验结构
|
|
+
|
|
持续优化机制
|
|
+
|
|
可信治理能力
|
|
|
|
帮道 AI 知识资产生产流水线,就是围绕这一核心能力建设。
|