diff --git a/docs/BACKLOG.md b/docs/BACKLOG.md index 04703375..bbcc05af 100644 --- a/docs/BACKLOG.md +++ b/docs/BACKLOG.md @@ -1,5 +1,54 @@ # Backlog +## 需求池:2026-07-03 甲方反馈四项 + +> 来源:甲方微信反馈(2026-07-03)。均不进 2026-07-05 一期 Demo(守 MVP 切割线),按下方优先级顺序排入 Demo 后迭代。 +> 依据:`物业AI人力资源系统业务需求文档BRD.md`(D1 数据权限、4.3.4 案例视频、G6 成本闸门)、`物业AI人力资源系统开发规格TechSpec.md`(5 数据表、6.2 persona_json、/api/ai/tts 契约)。 + +### B1. 层级数据权限 + 人资运营者角色(优先级 1,成本最低) + +需求:按所管人层级看到不同项目人数;人资部门作为"运营者"负责整理资料、出题、每日收集训练结果、考评。 + +- 组织快照映射进 `sys_dept`(本地只存 `ext_party_id`,BRD 4.6),数据权限以「项目」为范围主体(D1),用若依 `@DataPermission` 过滤,"不同项目人数"即权限过滤后的聚合报表。 +- 新建 `hr_operator` 角色,菜单挂既有/规划中后台能力: + - 资料整理:SOP/案例管理(`AihrSopController` / `AihrCaseController`,已有) + - 出题:`practice_scenario` 场景/人设/rubric 管理(TechSpec 第 5 章) + - 考评:评分复核,基于评分缓存 `practice_score` +- **净新增工作量**:「每日训练结果」按日聚合报表一张页面(`practice_session` 聚合,TechSpec M10 驾驶舱子集);其余为角色/菜单/数据权限配置。 + +### B2. AI 面试官/客户人设:分岗位形象 + 多语气声(优先级 2,对练体验提升最大) + +需求:AI 员工分岗位等级面试官形象;模拟多种语气声——老太说话慢、带方言、吵架、求救听不清。 + +- 复用三角色对练人设机制,**不新建架构**:面试官 = 另一组 `practice_scenario.persona_json`(TechSpec 6.2),按岗位等级(管家/主管/项目经理)建多条,新增字段: + - `avatar_url`:岗位形象头像,由 B3 文生图生成 + - `voice_profile`:`{ voice_id, speed, emotion, pitch, dialect }` +- TTS 契约扩展:`POST /api/ai/tts` 的 `voice` 参数扩成 voice_profile。以 MiniMax speech-2.8-hd 为参照: + - 老太慢速 → 老年音色(如 `Chinese (Mandarin)_Gentle_Senior`)+ `speed: 0.7` + - 方言 → 粤语/川话预置音色,或语音克隆接口用 ~15s 真实录音复刻(方言 TTS 本来就在一期集成清单第 4 项) + - 吵架 → `emotion: angry` + `speed: 1.2` + - 求救听不清 → TTS 出 `emotion: sad/fearful` 底音 + ffmpeg 后期加噪/压音量/断续("信道劣化"无现成 API,后期处理最可控) + +### B3. AI 一键生成场景培训图片(优先级 3) + +需求:培训场景配图一键生成。 + +- 供应商:SiliconFlow 已接入(embedding 同 key 可用 Kolors/FLUX 文生图),或 MiniMax `POST /v1/image_generation`。 +- 落地:`ruoyi-aihr` 新增 `AihrMediaService` + 异步生成任务表(生成慢,禁止同步等待);生成结果**必须下载转存自有 OSS**(MiniMax 返回 URL 仅 24h 有效)。 +- 前端:场景/SOP 编辑页加"一键生成配图"按钮,SOP 要点自动拼 prompt。 +- 受 G6 约束:图片调用计入月度成本上限。 + +### B4. AI 一键生成培训视频(优先级 4,二期) + +需求:一键生成培训视频;选定视频接口供应商。 + +- 维持 BRD 既定决策:一期视频用**预渲染样片**(4.3.4),真接口二期;调用量受 G6 成本闸门约束。 +- 形态分层,先便宜后昂贵: + 1. **图文转视频**(首选落地):B3 图片 + TTS 配音 + 字幕,ffmpeg 合成,成本近零 + 2. **数字人口播**(案例讲解视频主力):腾讯智影 / 百度曦灵 / 硅基智能,按分钟计费,比文生视频便宜一个量级 + 3. **文生视频**(片头/场景氛围镜头):可灵 Kling / 火山即梦 Seedance / MiniMax 海螺 / 通义万相 +- 选型倾向:二期先只接 **MiniMax 一家**打通(LLM + TTS + 文生图 + 视频一个 key 一套鉴权,对 2 人团队集成量最小,且同时覆盖 B2 语气声);视频质量不满意再单换可灵/即梦——全部封装在自有 provider 抽象后(参照 siliconflow embedding provider 先例)。 + ## Future Enhancements ### Model Classification Version Governance