四项甲方反馈需求入池:层级数据权限+人资运营者角色、分岗位 面试官人设与多语气声、一键生成培训图片、一键生成培训视频 (含供应商选型倾向)。均不进一期Demo,按优先级排入后续迭代。
4.4 KiB
4.4 KiB
Backlog
需求池:2026-07-03 甲方反馈四项
来源:甲方微信反馈(2026-07-03)。均不进 2026-07-05 一期 Demo(守 MVP 切割线),按下方优先级顺序排入 Demo 后迭代。 依据:
物业AI人力资源系统业务需求文档BRD.md(D1 数据权限、4.3.4 案例视频、G6 成本闸门)、物业AI人力资源系统开发规格TechSpec.md(5 数据表、6.2 persona_json、/api/ai/tts 契约)。
B1. 层级数据权限 + 人资运营者角色(优先级 1,成本最低)
需求:按所管人层级看到不同项目人数;人资部门作为"运营者"负责整理资料、出题、每日收集训练结果、考评。
- 组织快照映射进
sys_dept(本地只存ext_party_id,BRD 4.6),数据权限以「项目」为范围主体(D1),用若依@DataPermission过滤,"不同项目人数"即权限过滤后的聚合报表。 - 新建
hr_operator角色,菜单挂既有/规划中后台能力:- 资料整理:SOP/案例管理(
AihrSopController/AihrCaseController,已有) - 出题:
practice_scenario场景/人设/rubric 管理(TechSpec 第 5 章) - 考评:评分复核,基于评分缓存
practice_score
- 资料整理:SOP/案例管理(
- 净新增工作量:「每日训练结果」按日聚合报表一张页面(
practice_session聚合,TechSpec M10 驾驶舱子集);其余为角色/菜单/数据权限配置。
B2. AI 面试官/客户人设:分岗位形象 + 多语气声(优先级 2,对练体验提升最大)
需求:AI 员工分岗位等级面试官形象;模拟多种语气声——老太说话慢、带方言、吵架、求救听不清。
- 复用三角色对练人设机制,不新建架构:面试官 = 另一组
practice_scenario.persona_json(TechSpec 6.2),按岗位等级(管家/主管/项目经理)建多条,新增字段:avatar_url:岗位形象头像,由 B3 文生图生成voice_profile:{ voice_id, speed, emotion, pitch, dialect }
- TTS 契约扩展:
POST /api/ai/tts的voice参数扩成 voice_profile。以 MiniMax speech-2.8-hd 为参照:- 老太慢速 → 老年音色(如
Chinese (Mandarin)_Gentle_Senior)+speed: 0.7 - 方言 → 粤语/川话预置音色,或语音克隆接口用 ~15s 真实录音复刻(方言 TTS 本来就在一期集成清单第 4 项)
- 吵架 →
emotion: angry+speed: 1.2 - 求救听不清 → TTS 出
emotion: sad/fearful底音 + ffmpeg 后期加噪/压音量/断续("信道劣化"无现成 API,后期处理最可控)
- 老太慢速 → 老年音色(如
B3. AI 一键生成场景培训图片(优先级 3)
需求:培训场景配图一键生成。
- 供应商:SiliconFlow 已接入(embedding 同 key 可用 Kolors/FLUX 文生图),或 MiniMax
POST /v1/image_generation。 - 落地:
ruoyi-aihr新增AihrMediaService+ 异步生成任务表(生成慢,禁止同步等待);生成结果必须下载转存自有 OSS(MiniMax 返回 URL 仅 24h 有效)。 - 前端:场景/SOP 编辑页加"一键生成配图"按钮,SOP 要点自动拼 prompt。
- 受 G6 约束:图片调用计入月度成本上限。
B4. AI 一键生成培训视频(优先级 4,二期)
需求:一键生成培训视频;选定视频接口供应商。
- 维持 BRD 既定决策:一期视频用预渲染样片(4.3.4),真接口二期;调用量受 G6 成本闸门约束。
- 形态分层,先便宜后昂贵:
- 图文转视频(首选落地):B3 图片 + TTS 配音 + 字幕,ffmpeg 合成,成本近零
- 数字人口播(案例讲解视频主力):腾讯智影 / 百度曦灵 / 硅基智能,按分钟计费,比文生视频便宜一个量级
- 文生视频(片头/场景氛围镜头):可灵 Kling / 火山即梦 Seedance / MiniMax 海螺 / 通义万相
- 选型倾向:二期先只接 MiniMax 一家打通(LLM + TTS + 文生图 + 视频一个 key 一套鉴权,对 2 人团队集成量最小,且同时覆盖 B2 语气声);视频质量不满意再单换可灵/即梦——全部封装在自有 provider 抽象后(参照 siliconflow embedding provider 先例)。
Future Enhancements
Model Classification Version Governance
Current behavior:
- Same document fingerprint reuses existing category, summary, and tags.
- Model classification uses
temperature=0to reduce drift.
Add later when model upgrades need governance:
- Record provider, model name, prompt version, and analysis time.
- Preview batch reclassification after model changes.
- Show before/after category and tag diffs.
- Require admin confirmation before overwriting historical metadata.
- Keep an audit trail of prior classification versions.