diff --git a/docs/BACKLOG.md b/docs/BACKLOG.md index 06e1429c..4d9da4dc 100644 --- a/docs/BACKLOG.md +++ b/docs/BACKLOG.md @@ -28,6 +28,9 @@ - 方言 → 粤语/川话预置音色,或语音克隆接口用 ~15s 真实录音复刻(方言 TTS 本来就在一期集成清单第 4 项) - 吵架 → `emotion: angry` + `speed: 1.2` - 求救听不清 → TTS 出 `emotion: sad/fearful` 底音 + ffmpeg 后期加噪/压音量/断续("信道劣化"无现成 API,后期处理最可控) +- **2026-07-04 反馈增补**(截图见 `feedback/2026070423/`,解读见其 ANALYSIS.md): + - **连贯语音对手戏**:对练从"回合制答题"升级为实时情景对话——ASR→LLM(情绪人设+对话记忆)→TTS 低延迟循环,"很凶的老太太吵架"是验收场景; + - **场景库分四保一服**:保安/保洁/保绿/保修/客服按岗位出场景,启用 `practice_scenario.position/project_type` 字段,内容不混岗。 ### B3. AI 一键生成场景培训图片(优先级 3) @@ -48,6 +51,7 @@ 2. **数字人口播**(案例讲解视频主力):腾讯智影 / 百度曦灵 / 硅基智能,按分钟计费,比文生视频便宜一个量级 3. **文生视频**(片头/场景氛围镜头):可灵 Kling / 火山即梦 Seedance / MiniMax 海螺 / 通义万相 - 选型倾向:二期先只接 **MiniMax 一家**打通(LLM + TTS + 文生图 + 视频一个 key 一套鉴权,对 2 人团队集成量最小,且同时覆盖 B2 语气声);视频质量不满意再单换可灵/即梦——全部封装在自有 provider 抽象后(参照 siliconflow embedding provider 先例)。 +- **2026-07-04 反馈:优先级上调**(解读见 `feedback/2026070423/ANALYSIS.md`)——视频不是"锦上添花的生成玩具",而是**表演型/动作类隐性知识的主传递媒介**(巡逻、查卫生、礼仪、上门催费:"几个人去、带什么、开口怎么说,经验上的东西没办法说,好的领导现场表演一遍,现在都可以用 AI 做出来")。切入点:催费上门等 1-2 条示范视频先行,验证价值再铺量。 ### B5. 员工四维画像:训练时长 / 贡献度 / 测评分 / AI 等级 @@ -79,6 +83,18 @@ - 前置:火山引擎开户 + G3/G6 供应商合规评估;图片/视频资料成规模、以图搜图成为真实高频需求。 - 已做的替代缓解(2026-07-04):视频关键帧 caption(vision prompt 带画面描述)+ rerank(bge-reranker-v2-m3)已上线,覆盖大部分检索需求;B7 只补最后一段纯视觉语义。 +### B8. 数字师傅:学习旅程模块化 + 个性化分发引擎(2026-07-04 反馈,方向级) + +来源:2026-07-04 用户反馈(截图与完整解读见 `feedback/2026070423/ANALYSIS.md`)。核心洞察:系统的对标物是"会带人的老师傅"——把言传(话术语音)、身教(动作视频)、判断(该学什么)用 AI 规模化。 + +三个子块,可独立排期: + +1. **员工端五段学习旅程模块化**:入职前面试考核 → 岗前培训 → **每日小训(5-10 分钟,独立模块)** → 棘手问题即时求助("发一个语音,给我两三个 SOP 或话术"——检索输出加话术层)→ 场景模拟。角色主页做成"职责地图"(板块化菜单,不是卡片流)。 +2. **主管端学习监控面板**:员工×活动(看了哪些视频/做了哪些互动)×时长×效果,衔接 B5 四维画像与视频观看时长统计(心跳+区间合并方案,见 2026-07-04 会话讨论)。 +3. **个性化分发引擎**(系统的大脑):岗位(四保一服)× 阶段(入职前/岗前/在岗)× 画像短板 → 决定"今天该看什么/练什么";内容多了以后分发比生产更难("用 AI 分析该让他们看到哪些东西")。闭环:AI 生产内容 → AI 匹配媒介 → AI 决定给谁看 → 数据回流画像。 + +配套知识模型扩容:知识类型维度(SOP=标准 / 案例=参照 / 话术=直接能说 / 经验策略=火候),检索按类型分层供给;案例沉淀链路是隐性知识的采集入口,战略地位上调。 + ## Future Enhancements ### Model Classification Version Governance diff --git a/docs/README.md b/docs/README.md index dc2f9db0..899582b6 100644 --- a/docs/README.md +++ b/docs/README.md @@ -13,7 +13,8 @@ | [AI人力资源系统一期MVP版作战清单.md](AI人力资源系统一期MVP版作战清单.md) | MVP 作战图、切割线、排期、验收承诺 | | [物业AI人力资源系统业务需求文档BRD.md](物业AI人力资源系统业务需求文档BRD.md) | 业务需求、范围边界、角色、风险与验收 | | [物业AI人力资源系统开发规格TechSpec.md](物业AI人力资源系统开发规格TechSpec.md) | 工程结构、数据模型、页面路由、API 和核心实现规格 | -| [BACKLOG.md](BACKLOG.md) | 需求池与延后事项(含 2026-07-03 甲方反馈 B1–B5:数据权限/人设语音/生成图片/生成视频/员工四维画像) | +| [BACKLOG.md](BACKLOG.md) | 需求池与延后事项(B1–B8:数据权限/人设语音/生成图片/生成视频/员工画像/视觉检索/数字师傅) | +| [feedback/](feedback/) | 用户反馈原始截图与解读(按日期归档,含 ANALYSIS.md) | | [CODEBASE_ORIGINS.md](CODEBASE_ORIGINS.md) | 代码库来源与上游仓库说明 | | [prototypes/ai-hr-dashboard.png](prototypes/ai-hr-dashboard.png) | 后台首页高保真目标图 | | [prototypes/ai-hr-p0-pages-composite.png](prototypes/ai-hr-p0-pages-composite.png) | P0 四个页面组合高保真原型图 | diff --git a/docs/feedback/2026070423/1.png b/docs/feedback/2026070423/1.png new file mode 100644 index 00000000..0d471105 Binary files /dev/null and b/docs/feedback/2026070423/1.png differ diff --git a/docs/feedback/2026070423/2.png b/docs/feedback/2026070423/2.png new file mode 100644 index 00000000..a9d6d7b6 Binary files /dev/null and b/docs/feedback/2026070423/2.png differ diff --git a/docs/feedback/2026070423/3.png b/docs/feedback/2026070423/3.png new file mode 100644 index 00000000..881953f8 Binary files /dev/null and b/docs/feedback/2026070423/3.png differ diff --git a/docs/feedback/2026070423/4.png b/docs/feedback/2026070423/4.png new file mode 100644 index 00000000..0d0eca4e Binary files /dev/null and b/docs/feedback/2026070423/4.png differ diff --git a/docs/feedback/2026070423/5.png b/docs/feedback/2026070423/5.png new file mode 100644 index 00000000..93844fa7 Binary files /dev/null and b/docs/feedback/2026070423/5.png differ diff --git a/docs/feedback/2026070423/6.png b/docs/feedback/2026070423/6.png new file mode 100644 index 00000000..e152b17b Binary files /dev/null and b/docs/feedback/2026070423/6.png differ diff --git a/docs/feedback/2026070423/7.png b/docs/feedback/2026070423/7.png new file mode 100644 index 00000000..c1b7cf32 Binary files /dev/null and b/docs/feedback/2026070423/7.png differ diff --git a/docs/feedback/2026070423/8.png b/docs/feedback/2026070423/8.png new file mode 100644 index 00000000..7329ff89 Binary files /dev/null and b/docs/feedback/2026070423/8.png differ diff --git a/docs/feedback/2026070423/9.png b/docs/feedback/2026070423/9.png new file mode 100644 index 00000000..ab04b58f Binary files /dev/null and b/docs/feedback/2026070423/9.png differ diff --git a/docs/feedback/2026070423/ANALYSIS.md b/docs/feedback/2026070423/ANALYSIS.md new file mode 100644 index 00000000..8dab230f --- /dev/null +++ b/docs/feedback/2026070423/ANALYSIS.md @@ -0,0 +1,119 @@ +# 2026-07-04 23:21 用户反馈解读(张立·微信语音转文字,截图 1-9) + +> 原始截图见本目录 1-9.png。反馈时用户使用的是线上 `peilian.njzhmj.top` **旧版**—— +> 2026-07-03/04 本地已完成的死按钮 toast、整页 tab 切换、情境化首页、结构化概要均未发布。 +> 采纳反馈前先发布新版,避免对旧版问题重复投入。 + +## 一、逐条解码:他说的 → 他真正要的 + +### 1. 喜报图示范(截图 1-2)——要"设计过的排版",不是"生成图片" + +用户拿南师附中录取喜报做示范:同样的信息,两段长文字"又多又长又臭",做成图后 +"条理清晰、布局有逻辑、一眼看清重点"。并自己点破实现方式:**"整理成 HTML 版本的, +是不是就不用花钱?"**(他对生图 API 成本敏感,自己在充值)。 + +→ 要的是**信息图式 HTML 卡片**:大标题、徽章式重点数字、分栏列表、色块分区。 +当前概要卡是"素文字列表",差的是视觉设计,不是数据结构。 + +### 2. 按需生成 + 小窗口(截图 3-4)——交互设计他已给全 + +原话拆解出三个明确决策: +- **总结入口是显式按钮**("旁边有个按钮,想看总结时再点一下"),不是默认自动; +- **呈现载体是弹出的小窗/卡片**(和"查到的原文"分开,有仪式感); +- **按需调用**("不用提前搞,提前搞成本高、风险大"),点了才花钱, + loading 有预期所以可接受("他会有一个预期的时间,不会太耗时")。 + +→ 轻概要可保留自动;**重排版总结卡改为按钮触发 + 小窗呈现**,还省 token。 + +### 3. "页面一定要切换"(截图 7)——弹出式反馈不算反馈 + +"按钮点完一定要跳转页面,要不然很怪。底下可能弹出来了,但我会很诧异为什么点了 +没反应,因为弹出的部分不明显。" + +→ 底部 toast 可见度不够;页内展开/底部追加模式都要改成**明确的页面切换**。 +整页 tab 已符合;「建设中」toast 需升级为整页或居中大提示。 + +### 4. 可点的要长得像可点的(截图 7) + +"每一行可以用不同的颜色,有差异性,好看也好找;同一个颜色看起来像介绍, +不像按钮不像超链接,要更像我能点的东西。" + +→ 入口行做视觉分化:每区不同强调色、按钮化(边框/箭头/底色)。 + +### 5. 角色主页 = 职责地图(截图 5) + +"不论什么身份进来,希望很明确看到我可以对哪几个方面进行安排/学习/操作, +界面分布不清晰"+"目前的感受是过于简单了,拿咱们方案再细化"。 + +→ **板块化、菜单化的角色主页**,每个角色的"我能干什么"直接摆出来,不是滚动卡片流。 + +### 6. 员工端五段旅程(截图 6)——他给出的产品主线 + +① 入职前:面试/考核(视频或语音文字) +② 岗前培训 +③ **每日小训(5-10 分钟)**——要独立成模块,当前归在"今天要学"粒度不够 +④ 碰到棘手问题:**"发一个语音,给我两三个 SOP 或话术"**——期待输出是拿来就能说的话术,不是知识片段 +⑤ 场景模拟 + +### 7. 主管端定位 = 学习监工(截图 5) + +"检查我管理的员工最近看了哪些视频、做了哪些互动学习、做了多长时间、反馈内容的 +有效性。"→ 主管端首页应是**员工学习活动监控面板**(人×活动×时长×效果)。 +与 BACKLOG B5(四维画像)、视频观看时长统计(心跳+区间合并方案)直接衔接。 + +### 8. 场景模拟分行业、分"四保一服"(截图 7) + +保安/保洁/保绿/保修/客服按岗位出对应场景,"内容要分得清,不要乱"。 +→ 对练场景库加**岗位维度**;TechSpec `practice_scenario` 本有 `position/project_type` +字段设计,应启用。 + +### 9. 多维训练 + 知识类型扩容(截图 8) + +"不光是 SOP,还有案例的应对、经验策略、方案步骤"——知识模型需要**类型维度**: +SOP(标准)/ 案例(参照)/ 话术(直接能说)/ 经验策略(火候)。检索输出按类型分层供给。 + +### 10. 连贯语音对手戏(截图 8) + +"模拟很凶的老头老太太过来吵架,说一堆话,你怎么回复?回复完他那边还要有一个回复, +最好是有连贯性的语音交互。"→ 对练不是"出题-作答-评分"的考试,是**实时情景对手戏**: +ASR→LLM(情绪人设+对话记忆)→TTS 低延迟循环 + 情绪化音色(BACKLOG B2)。 + +### 11. 动作类知识 = 视频教学(截图 8-9) + +巡逻、查卫生、收文档、礼仪、上门催费——"几个人去、带什么、开口怎么说,很多经验上 +的东西没办法说,好的领导可以给你现场表演一遍,**现在都可以用 AI 把它做出来**。" + +### 12. 内容分发要 AI 决策(截图 9) + +"是不是还得用 AI 再分析分析,到底应该让他们看到哪些东西。"——内容多了以后 +**分发比生产更难**,需要个性化学习路径引擎。 + +## 二、拔高:三个产品定位跃迁 + +**系统的真正对标物不是"知识库+练习工具",而是"老师傅"。** +物业知识传承的现实是师徒制;张立要的是把公司最稀缺的资源——会带人的老师傅—— +用 AI 克隆并规模化("数字师傅")。这正是 BRD"经验资产化中央厨房"的具象化。 + +| 跃迁 | 从 | 到 | 依据 | +|---|---|---|---| +| 媒介 | 文字为主的呈现 | **知识类型决定媒介**:规则数字→信息图;话术→语音示范;动作流程→视频表演 | 用户是几千一线员工,文字对系统最便宜、对他们最贵 | +| 知识模型 | SOP 库 | **经验资产库**:显性(SOP)+隐性(案例/话术/策略);案例沉淀链路是隐性知识采集入口 | 截图 8"不光是 SOP" | +| 对练形态 | 回合制答题 | **有情绪、有连贯性的语音对手戏** | 截图 8"吵架的老太太" | + +**收束点**:最后"用 AI 分析该让他们看什么"= 系统的大脑—— +AI 生产内容 → AI 匹配媒介 → AI 决定给谁看 → 数据回流画像,闭环。 + +## 三、行动清单(2026-07-05 起) + +| 优先级 | 事项 | 状态/去向 | +|---|---|---| +| P0 | 发布本地版本到 peilian.njzhmj.top,让用户基于新版反馈 | 待执行 | +| P0 | 检索总结卡:按钮触发 + 小窗 + 信息图式 HTML 排版 | 待执行 | +| P1 | 可点元素视觉分化;「建设中」toast 升级整页/居中提示 | 待执行 | +| P1 | 问 SOP 输出加"推荐话术 2-3 条"(digest prompt 加 scripts 字段) | 待执行 | +| P2 | 员工端五段旅程模块化、每日小训独立、主管学习监控面板 | BACKLOG B8 | +| P2 | 个性化学习分发引擎(岗位×阶段×画像短板→内容推荐) | BACKLOG B8 | +| P2 | 连贯语音对手戏 + 情绪人设 | BACKLOG B2 增补 | +| P2 | 场景库分四保一服岗位维度 | BACKLOG B2 增补 | +| P2 | 表演型知识视频(催费上门等 1-2 条示范先行) | BACKLOG B4 优先级上调 | +| P2 | 知识类型维度(SOP/案例/话术/策略)与分层检索供给 | BACKLOG B8 |