Files
prop-ai-hr/docs/AI人力资源系统项目规划方案与AI接口说明.md

195 lines
11 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 物业 AI 人力资源系统项目规划方案与 AI 接口说明
> 会议版 | 2026-07-06
> 核心口径:这套系统真正对标的不是「知识库 + 练习工具」,而是 **数字师傅**。
## 1. 一句话定位
这是一套面向物业一线岗位的 **数字师傅系统**:用 AI 把优秀老师傅的 **言传、身教、判断** 三件事产品化、规模化。
物业一线知识很多不是写在文档里的,而是在老师傅带新人时完成传递:
- 催费上门该几个人去、带什么、第一句话怎么说。
- 业主情绪上来时先接什么话、什么时候承诺、什么时候升级。
- 巡逻、查卫生、接待、上门沟通这些动作怎么做才像样。
- 遇到投诉、求助、吵架、听不清、方言场景时怎么稳住局面。
本系统要做的不是把资料搬进库里,而是把这些经验变成可学习、可练习、可复盘、可分发的 AI 能力。
## 2. 产品主线:数字师傅 = 言传 + 身教 + 判断
| 老师傅能力 | AI 产品化形态 | 系统落点 |
|---|---|---|
| 言传:怎么说 | 话术、语音示范、多语气对话 | SOP 查询、话术推荐、ASR/TTS、三角色对练 |
| 身教:怎么做 | 图片、视频、动作示范、场景演示 | 培训图片、培训视频、案例视频、关键帧解析 |
| 判断:学什么 | 根据岗位、阶段、短板决定学习内容 | 员工画像、主管看板、个性化学习分发 |
一句话总结:**AI 生产内容,AI 匹配媒介,AI 决定给谁看,数据再回流画像。**
## 3. 三个认知跃迁
### 3.1 从「文字资料」到「知识类型 × 媒介匹配」
不同知识不能都用文档承载。媒介选错,员工学不会。
| 知识类型 | 最适合媒介 | 例子 |
|---|---|---|
| 规则数字类 | 信息图 / 卡片 | 投诉首响时限、催费节点、工单流转规则 |
| 话术类 | 语音示范 / 对话脚本 | 安抚话术、催费开场、拒绝不合理诉求 |
| 动作流程类 | 视频 | 上门催费、接待礼仪、巡检动作、现场沟通站位 |
| 判断策略类 | 案例 + 复盘 | 什么情况升级、什么话不能说、什么时候先稳情绪 |
所以后续培训视频不是锦上添花,而是隐性知识传递的主媒介之一。
### 3.2 从「SOP 库」到「经验资产库」
SOP 只解决标准问题,老师傅真正值钱的是案例、策略和火候。
| 知识层 | 作用 | 输出给员工的形式 |
|---|---|---|
| SOP | 告诉员工标准是什么 | 标准答案、步骤、红线 |
| 案例 | 告诉员工真实场景怎么发生 | 可参照案例、相似情境 |
| 话术 | 告诉员工此刻可以怎么说 | 直接可说的话 |
| 经验策略 | 告诉员工什么时候用哪招 | 注意事项、判断依据 |
因此「案例沉淀」不是辅助功能,而是隐性经验的采集入口:一线语音上报 → AI 整理 → 审核入库 → 反哺训练和检索。
### 3.3 从「回答问题」到「有情绪的语音对手戏」
员工真正需要练的不是选择题,而是现场应对。
目标体验是:
1. AI 扮演业主,有情绪、有身份、有诉求。
2. 员工用语音回应。
3. ASR 识别员工话术。
4. LLM 结合人设和对话记忆继续追问。
5. TTS 用不同语气播报。
6. 完成后从 SOP、沟通、情绪、营销意识等维度评分。
这就是“老师傅带你去现场练一遍”的数字化版本。
## 4. 三端怎么玩
| 端 | 使用对象 | 核心玩法 |
|---|---|---|
| 候选人端 H5 | 面试候选人 | AI 面试、答题、补充资料、查看审核状态 |
| 员工端 H5 | 一线员工/客服管家 | 今日任务、语音对练、查 SOP、学案例、看画像 |
| 主管端 H5 | 项目主管/带教人 | 看团队进度、看待复盘员工、点进单条话术、给复盘建议 |
## 5. 管理后台功能地图
| 模块 | 作用 |
|---|---|
| 首页驾驶舱 | 看演示指标、待办、风险 |
| AI 面试 | 管理候选人面试、查看评分、审核资料 |
| 三角色对练 | 管理训练场景、对练过程、评分结果 |
| 案例沉淀 | 上传语音/素材,AI 整理成案例 |
| SOP 知识库 | 上传制度/SOP,检索、引用、问答 |
| 资料处理 | 批量上传、异步解析、导入任务、处理状态 |
| 模型配置 | 配置大模型、向量模型、ASR、TTS、视觉模型 |
## 6. 当前已经打通的能力
| 能力 | 当前状态 |
|---|---|
| 三端 H5 | 候选人端、员工端、主管端已可点击演示 |
| 手机号登录 | 已接短信登录流程;演示可用固定验证码 |
| AI 面试 | 已复用后端面试 API,模型优先,失败 fallback |
| 员工三角色对练 | 已接 `/start`、`/turn`、`/finish`,完成后写训练记录 |
| 员工训练历史/画像 | 已从训练记录聚合展示 |
| 主管复盘 | 已能看待复盘列表、详情、导师改写、标记复盘 |
| 候选资料上传 | 文件进 OSS/MinIO,关系进候选资料表,HR 可审核 |
| SOP 知识库 | 支持文档上传、解析、切片、检索、引用 |
| 批量资料处理 | 支持异步队列、失败重试、导入任务 |
| Qdrant 向量库 | 作为向量索引层接入,不替代 MySQL/MinIO |
| 视频资料解析 | 已规划为异步处理,依赖 ffmpeg/ffprobe、ASR、Vision |
## 7. AI 接口和供应商口径
核心原则:**系统不绑定单一模型厂商**。后端统一走模型配置表,按能力分成 `chat / vector / rerank / asr / tts / vision` 六类。通用能力优先复用 OpenAI-compatible API;供应商契约不同的能力由后端按供应商和模型分流,客户端仍使用统一业务接口。
### 7.1 当前系统内置/预留的供应商
| 供应商 | 当前用途 | 备注 |
|---|---|---|
| OpenAI 兼容接口 | 通用兜底入口 | 可接企业自有网关或任何兼容服务 |
| DeepSeek | Chat 大模型候选 | 适合文本生成、问答、总结 |
| 智谱 AI | Chat / embedding / rerank 候选 | 代码内保留供应商入口 |
| 阿里云百炼 / 通义千问 | 生产短音频 ASR/TTS;Chat、实时语音候选 | 短音频 ASR 使用 `qwen3-asr-flash` 兼容模式,密钥只保存在受控配置 |
| Ollama | 本地模型候选 | 可用于内网/离线试验 |
| 硅基流动 SiliconFlow | 向量、重排及语音兼容供应商 | bge-m3、OpenAI audio 兼容 ASR、CosyVoice2 TTS、部分图像模型 |
### 7.2 各类 AI 能力怎么接
| AI 能力 | 接口类别 | 当前/推荐供应商 | 用在什么地方 |
|---|---|---|---|
| 大模型对话/总结 | `chat` | DeepSeek、通义千问、智谱、硅基流动、企业自有 OpenAI 兼容网关 | 面试出题、评分、案例整理、SOP 总结、资料归类 |
| 向量化 embedding | `vector` | 硅基流动 `BAAI/bge-m3`、智谱 `embedding-3` | SOP/案例/资料切片后做语义检索 |
| 重排序 rerank | `rerank` | bge-reranker 类模型,供应商可走硅基流动或智谱兼容接口 | 多条知识命中后按语义相关度排序 |
| 语音识别 ASR | `asr` | 生产使用阿里云百炼 `qwen3-asr-flash`;SiliconFlow OpenAI audio 接口保留兼容 | 员工语音训练、案例语音上传、视频音轨转写 |
| 语音合成 TTS | `tts` | 生产优先阿里云百炼 `qwen-audio-3.0-tts-flash`;SiliconFlow CosyVoice2 保留兼容 | AI 业主播报、SOP 朗读、模拟不同语气声 |
| 图片/视频画面理解 | `vision` | 多模态 Chat 模型;二期可评估火山 Doubao-embedding-vision | 图片 OCR、视频关键帧描述、以图搜图 |
| 向量数据库 | Qdrant | 自建 Qdrant 服务 | 只存向量索引和最小 payload,事实源仍是 MySQL/MinIO |
| 原始文件存储 | MinIO / sys_oss | 当前自建 MinIO | 存 SOP、候选资料、语音、图片、视频 |
| 短信 | 阿里云短信 | 复用 RuoYi sms4j 配置 | 手机号登录验证码 |
## 8. 视频和数字人接口规划
视频优先级需要上调。它不是“生成玩具”,而是老师傅身教经验的主要载体。
| 层级 | 方案 | 推荐接口/供应商 |
|---|---|---|
| 低成本先跑 | 图片 + TTS + 字幕 + ffmpeg 合成培训短视频 | 自建 ffmpeg 合成,TTS 用硅基流动或 MiniMax |
| 数字人口播 | 案例讲解、SOP 讲解、培训课件口播 | 腾讯智影、百度曦灵、硅基智能、MiniMax |
| 文生/图生视频 | 片头、场景氛围、动作示范补充 | 可灵 Kling、火山即梦 Seedance、MiniMax 海螺、通义万相 |
二期建议先接 **MiniMax 一家**做完整闭环:LLM、TTS、图像、视频一套 key 和鉴权,集成成本最低;如果视频效果不够,再单独替换可灵/即梦。
## 9. 资料与知识库怎么玩
1. HR 或运营人员上传 SOP、制度、案例、图片、视频。
2. 系统把原始文件存到 MinIO。
3. 后端解析文本、图片 OCR、视频抽音轨/关键帧。
4. 文本切片写入 MySQL。
5. 配置了向量模型时写 embedding,并同步到 Qdrant。
6. 员工或主管提问时,系统先查 MySQL Fulltext,再查 Qdrant,最后 rerank 排序。
7. 回答分层输出:SOP 给标准,案例给参照,话术给可直接说的话,经验策略给判断依据。
## 10. 后续规划
### P0:当前 MVP
- 三端 H5 能点。
- AI 面试能跑。
- 员工训练能跑。
- SOP 查询能跑。
- 候选资料能上传和审核。
- 主管能看复盘。
### P1:试点项目可用
- **生活顾问岗位做深**:投诉、报修、催费、停车、入伙、日常接待。
- **连贯语音对手戏**:多语气、多情绪、多方言的 AI 业主。
- **每日小训**:每天 5-10 分钟训练。
- **主管学习监控**:谁看了、谁练了、分数如何、短板是什么。
- **员工四维画像**:训练时长、贡献度、测评分、AI 等级。
- **经验资产库**:SOP、案例、话术、策略分层入库。
### P2:规模化和视频化
- **AI 老师傅**:按岗位、阶段、画像短板自动推荐学习内容。
- **培训图片/视频自动生成**:让隐性经验可以被看见、被模仿。
- **纯视觉检索**:找图片、找视频片段、找动作示范。
- **个性化学习分发引擎**:AI 分析该让谁看什么、练什么。
- **对接企业微信/钉钉/外部人事系统**。
## 11. 会议上建议怎么讲
可以按这 4 句话讲:
1. **这套系统不是知识库,也不是普通练习工具,而是物业行业的数字师傅。**
2. **它把老师傅的言传、身教、判断三件事产品化:话术用语音,动作用视频,判断用画像和分发。**
3. **候选人、员工、主管三端已经能跑,后台负责配置、审核、资料处理和模型管理。**
4. **近期先把生活顾问岗位做深,后面扩到保安、保洁、保绿、保修,并逐步上视频化培训和个性化学习分发。**