多模态RAG是指把图片、音频、视频等非文本数据和文本放在一起,通过检索增强生成的方式,让大模型能够引用这些素材来回答用户问题。它打破了单一文本语料的局限,使问答系统可以看懂图纸、听懂会议录音、理解监控片段。

什么是多模态RAG
检索增强生成(RAG)原本主要处理文档和网页文本,用户提问后,系统从知识库找出相关段落,交给大模型生成答案。多模态RAG在这一基础上,把图片、音频、视频也纳入知识范围。它的核心思想是:无论数据原本是什么形态,都先转换成模型可比较的向量表示,再按照语义相近程度做召回。
例如,用户问“上个月车间设备异响是什么问题”,系统不仅搜索维修文本,还会检索那段时间的设备录音,把声纹特征与故障样本比对,再结合文字记录给出判断。这种能力依赖统一的表征空间和跨模态对齐技术,否则图片和文字会处在互不相交的向量区间,检索就会失效。
图片、音频、视频的预处理与表征
图片的切分与编码
企业里的图片常是扫描合同、设计图纸或现场照片。直接整图向量化会丢失局部信息,通常先用目标检测或版面分析把图切成区块,如标题栏、表格、缺陷位置。每个区块送进视觉编码器得到向量,同时保留坐标和来源页码等元数据。
视觉编码器多选用CLIP类模型,它能把图像和文本映射到同一空间。这样用户用文字“红色阀门渗漏”也能搜到对应照片。实践中,对高清图纸还需做金字塔缩放,避免小字模糊导致编码偏差。
音频的转写与声学特征
音频不能只靠语音识别成文字,因为语调、背景噪声也承载信息。标准做法是并行提取两条特征:一条是ASR文本向量,另一条是声纹或频谱向量。会议录音先用说话人分离,再分别处理,便于后续按人检索。
例如客服录音质检,既搜“投诉”关键词文本,也比对情绪激动的声学模式。两部分向量在检索时做加权融合,比单用文本召回更准。注意音频切片不宜过长,通常十到三十秒一段,否则语义混杂。
视频的截帧与片段聚合
视频本质是图像序列加音轨。处理时按固定间隔抽帧,每帧当图片编码;音轨按音频方式处理。然后用时间窗口把相邻帧和对应声音聚成片段向量,代表某段时间发生了什么。
监控场景里,搜“叉车进库”就靠截帧里的物体检测加文字描述对齐。若只抽关键帧会漏掉动作过程,因此不少系统采用滑动窗口重叠抽取,虽增加存储,但召回完整度明显提升。
检索链路与向量库选型
多模态RAG的检索层要支持多种向量列并存,并能混合过滤。比如先按时间、设备编号做元数据过滤,再在剩余集合里算余弦相似度。单纯堆向量维度并不能解决跨模态问题,对齐训练才是关键。
常见开源库如Milvus、Weaviate都支持多向量字段和标量过滤。下表列出基础对比:
| 组件 | 多向量支持 | 元数据过滤 | 适用规模 |
|---|---|---|---|
| Milvus | 强 | 强 | 千万级以上 |
| Weaviate | 中 | 强 | 百万级 |
| Chroma | 弱 | 中 | 原型阶段 |
排序与生成阶段的注意点
召回的异构结果要统一排序。常用方法是给每类模态设权重,再用学习排序模型微调。图片区块可能命中但文字无关,此时权重过低会埋没答案。建议用少量业务数据做偏序标注,训练轻量排序器。
生成时,大模型需能引用非文本内容。可把图片链接、音频时间段作为上下文递给模型,并提示“依据提供的录音第120秒内容回答”。避免让模型凭空描述没检索到的视频,否则会产生幻觉。
落地误区与评测建议
不少项目一开始就把所有视频全量编码,成本飙升且效果平平。应先从高频问题对应的素材入手,建立小闭环。另一个误区是忽视权限,图片视频常含敏感信息,检索层必须带租户隔离。
评测不能只看文本答案准确率,要加模态命中率指标:用户问图,系统是否真召回了图。可用双盲测试,由业务人员判断回答是否用对了素材。持续收集bad case,反推预处理或对齐模型的短板。