docs: add 2026-07-03 client feedback items B1-B4 to backlog

四项甲方反馈需求入池:层级数据权限+人资运营者角色、分岗位
面试官人设与多语气声、一键生成培训图片、一键生成培训视频
(含供应商选型倾向)。均不进一期Demo,按优先级排入后续迭代。
This commit is contained in:
2026-07-03 16:45:59 +08:00
parent f869d66c90
commit 2046707696
+49
View File
@@ -1,5 +1,54 @@
# Backlog
## 需求池:2026-07-03 甲方反馈四项
> 来源:甲方微信反馈(2026-07-03)。均不进 2026-07-05 一期 Demo(守 MVP 切割线),按下方优先级顺序排入 Demo 后迭代。
> 依据:`物业AI人力资源系统业务需求文档BRD.md`(D1 数据权限、4.3.4 案例视频、G6 成本闸门)、`物业AI人力资源系统开发规格TechSpec.md`(5 数据表、6.2 persona_json、/api/ai/tts 契约)。
### B1. 层级数据权限 + 人资运营者角色(优先级 1,成本最低)
需求:按所管人层级看到不同项目人数;人资部门作为"运营者"负责整理资料、出题、每日收集训练结果、考评。
- 组织快照映射进 `sys_dept`(本地只存 `ext_party_id`,BRD 4.6),数据权限以「项目」为范围主体(D1),用若依 `@DataPermission` 过滤,"不同项目人数"即权限过滤后的聚合报表。
- 新建 `hr_operator` 角色,菜单挂既有/规划中后台能力:
- 资料整理:SOP/案例管理(`AihrSopController` / `AihrCaseController`,已有)
- 出题:`practice_scenario` 场景/人设/rubric 管理(TechSpec 第 5 章)
- 考评:评分复核,基于评分缓存 `practice_score`
- **净新增工作量**:「每日训练结果」按日聚合报表一张页面(`practice_session` 聚合,TechSpec M10 驾驶舱子集);其余为角色/菜单/数据权限配置。
### B2. AI 面试官/客户人设:分岗位形象 + 多语气声(优先级 2,对练体验提升最大)
需求:AI 员工分岗位等级面试官形象;模拟多种语气声——老太说话慢、带方言、吵架、求救听不清。
- 复用三角色对练人设机制,**不新建架构**:面试官 = 另一组 `practice_scenario.persona_json`(TechSpec 6.2),按岗位等级(管家/主管/项目经理)建多条,新增字段:
- `avatar_url`:岗位形象头像,由 B3 文生图生成
- `voice_profile`:`{ voice_id, speed, emotion, pitch, dialect }`
- TTS 契约扩展:`POST /api/ai/tts` 的 `voice` 参数扩成 voice_profile。以 MiniMax speech-2.8-hd 为参照:
- 老太慢速 → 老年音色(如 `Chinese (Mandarin)_Gentle_Senior`)+ `speed: 0.7`
- 方言 → 粤语/川话预置音色,或语音克隆接口用 ~15s 真实录音复刻(方言 TTS 本来就在一期集成清单第 4 项)
- 吵架 → `emotion: angry` + `speed: 1.2`
- 求救听不清 → TTS 出 `emotion: sad/fearful` 底音 + ffmpeg 后期加噪/压音量/断续("信道劣化"无现成 API,后期处理最可控)
### B3. AI 一键生成场景培训图片(优先级 3)
需求:培训场景配图一键生成。
- 供应商:SiliconFlow 已接入(embedding 同 key 可用 Kolors/FLUX 文生图),或 MiniMax `POST /v1/image_generation`。
- 落地:`ruoyi-aihr` 新增 `AihrMediaService` + 异步生成任务表(生成慢,禁止同步等待);生成结果**必须下载转存自有 OSS**(MiniMax 返回 URL 仅 24h 有效)。
- 前端:场景/SOP 编辑页加"一键生成配图"按钮,SOP 要点自动拼 prompt。
- 受 G6 约束:图片调用计入月度成本上限。
### B4. AI 一键生成培训视频(优先级 4,二期)
需求:一键生成培训视频;选定视频接口供应商。
- 维持 BRD 既定决策:一期视频用**预渲染样片**(4.3.4),真接口二期;调用量受 G6 成本闸门约束。
- 形态分层,先便宜后昂贵:
1. **图文转视频**(首选落地):B3 图片 + TTS 配音 + 字幕,ffmpeg 合成,成本近零
2. **数字人口播**(案例讲解视频主力):腾讯智影 / 百度曦灵 / 硅基智能,按分钟计费,比文生视频便宜一个量级
3. **文生视频**(片头/场景氛围镜头):可灵 Kling / 火山即梦 Seedance / MiniMax 海螺 / 通义万相
- 选型倾向:二期先只接 **MiniMax 一家**打通(LLM + TTS + 文生图 + 视频一个 key 一套鉴权,对 2 人团队集成量最小,且同时覆盖 B2 语气声);视频质量不满意再单换可灵/即梦——全部封装在自有 provider 抽象后(参照 siliconflow embedding provider 先例)。
## Future Enhancements
### Model Classification Version Governance