视频关键帧 vision prompt 从纯 OCR 扩展为「文字+一句画面描述」,纯视觉 信息(动作/场景演示)进入文本向量可检索;检索 RRF 融合后接 category=rerank 模型(bge-reranker-v2-m3)语义重排,未配置或失败保持 RRF 顺序(TechSpec 12.3 最后一环)。BACKLOG 记入 B7 视觉向量检索 (Doubao-embedding-vision,二期)。端到端验证:重传视频片段带画面描述; 检索「首次反馈时限」视频转写片段重排后命中第一。