feat(aihr): keyframe caption and rerank in retrieval pipeline
视频关键帧 vision prompt 从纯 OCR 扩展为「文字+一句画面描述」,纯视觉 信息(动作/场景演示)进入文本向量可检索;检索 RRF 融合后接 category=rerank 模型(bge-reranker-v2-m3)语义重排,未配置或失败保持 RRF 顺序(TechSpec 12.3 最后一环)。BACKLOG 记入 B7 视觉向量检索 (Doubao-embedding-vision,二期)。端到端验证:重传视频片段带画面描述; 检索「首次反馈时限」视频转写片段重排后命中第一。
This commit is contained in:
@@ -70,6 +70,15 @@
|
||||
|
||||
净新增工作量:① session 时长字段+聚合;② 审核通过→积分的贡献计分服务逻辑;③ profile 接口拼装四指标。其余为 M6 既有 P1 表和页面。
|
||||
|
||||
### B7. 视觉向量检索(Doubao-embedding-vision,二期)
|
||||
|
||||
需求(2026-07-04 技术评审结论):纯视觉语义检索——"找演示保安站姿的视频"、图片素材以图搜图等"没说出口、也没写在画面上"的内容,当前文本向量链路(转写/OCR/caption → bge-m3)覆盖不到。
|
||||
|
||||
- **选型已定**:火山引擎 `Doubao-embedding-vision`(Seed1.6-Embedding,文本/图片/视频 → 统一向量空间,中文原生,0.7 元/百万 token)。优于 CLIP 类双塔方案:免融合排序调参、托管 API 免运维。
|
||||
- 工程量(不只是换模型名):入库管线支持"视觉片段"(帧/图直接向量化)、Qdrant 图文混合存储、检索结果展示帧图/跳转视频时间点、引用约束适配(视觉命中服务"找资料"场景,不进 RAG 生成)。
|
||||
- 前置:火山引擎开户 + G3/G6 供应商合规评估;图片/视频资料成规模、以图搜图成为真实高频需求。
|
||||
- 已做的替代缓解(2026-07-04):视频关键帧 caption(vision prompt 带画面描述)+ rerank(bge-reranker-v2-m3)已上线,覆盖大部分检索需求;B7 只补最后一段纯视觉语义。
|
||||
|
||||
## Future Enhancements
|
||||
|
||||
### Model Classification Version Governance
|
||||
|
||||
Reference in New Issue
Block a user