视觉问答(VQA)中的计数问题长期困扰研究者和工程落地团队。当图像中存在多个同类物体且分布密集时,端到端的VQA模型容易把五个苹果报成三个,或者把两只狗数成四只。这类错误并非偶然,而是模型对“数量”这一抽象概念的表达方式存在结构性缺陷。目标检测技术通过显式地找出每个物体并给出位置,能够从数据层面补齐VQA所缺失的实例感知能力。

VQA计数错误的底层成因
大多数早期VQA模型使用卷积神经网络提取整图特征,再与问题词向量拼接后送入分类器。这种全局池化操作会把空间信息压缩成向量,使模型只能隐式地“感觉”物体多少,而无法逐一核对个体。当物体相互遮挡或背景杂乱时,特征响应重叠,模型便会少算。相反,若同类物体颜色纹理相近,模型又可能把连续区域当成多个目标,导致多算。
另一个常被忽视的原因是训练数据偏差。公开VQA数据集中,计数问题的答案分布极不均匀,数字“1”和“2”出现频率远高于“7”或“8”。模型在优化交叉熵损失时,会倾向于预测高频小数,形成系统性的计数偏移。即便使用注意力机制,若注意力仅落在物体类别上而未细化到实例,仍无法从根本上解决该问题。
从评估角度看,传统准确率指标掩盖了计数错误的严重性。一个把“3”答成“2”的模型与把“3”答成“cat”的模型在准确率上同等受罚,但前者在真实场景里更危险,因为用户难以察觉微小偏差。因此,引入目标检测来提供可验证的物体清单,成为修正计数错误最直接的技术路径。
目标检测辅助的融合架构
最典型的做法是采用两阶段检测器(如Faster R-CNN)先处理图像,得到若干候选框及其类别概率。每个框对应一个实例特征,这些特征代替原图的全局特征进入VQA下游。问题编码器仍可使用LSTM或Transformer,但在多模态融合时,模型能够针对“有多少”类问题,直接对检测框按类别聚合计数。
下面给出一个简化的 PyTorch 风格融合代码示例,展示如何根据检测框类别统计数量并传给问答头:
import torch
# 假设 detector 输出 boxes, labels, scores
# labels 是长度为 N 的张量,表示每个框的类别索引
def count_by_class(labels, question_class_id):
# 统计指定类别的出现次数
mask = (labels == question_class_id)
count = int(mask.sum().item())
return count
# 模拟检测输出
labels = torch.tensor([1, 1, 2, 1, 3])
# 假设问题问的是类别 1 的物体有几个
question_class_id = 1
num = count_by_class(labels, question_class_id)
print("预测数量:", num)
在实际系统中,检测框数量会作为显式特征参与答案生成。例如设计一个计数分支,用回归头预测数字,并与分类答案融合。相比纯VQA,这种架构把“找物体”和“答问题”解耦,检测器负责不重不漏,问答模块负责语言对齐,错误率可下降百分之二十以上。
需要注意的是,检测器自身也会漏检或误检。如果前端把两只重叠的猫漏掉一只,下游无论如何也数不对。因此常采用高分框保留与软计数策略:不强行离散化,而是用置信度加权和作为连续计数,再四舍五入,从而容忍轻微定位误差。
训练策略与误差修正实践
要让目标检测真正辅助VQA计数,训练阶段需做针对性设计。一种有效方式是联合损失:主任务仍为VQA分类损失,辅任务为检测框计数回归损失。两者共享骨干网络,使特征同时具备语义与实例分辨力。如下伪代码展示损失组合:
import torch.nn as nn vqa_loss = nn.CrossEntropyLoss() count_loss = nn.MSELoss() # pred_vqa: 问答logits, pred_count: 计数回归值 # ans, true_count: 标签 loss = vqa_loss(pred_vqa, ans) + 0.5 * count_loss(pred_count, true_count.float()) loss.backward()
数据增强也至关重要。对训练图做随机复制粘贴同类物体,可人工制造大数值样本,打破数据集中小数垄断。同时,在推理时对同一图做多尺度检测并投票,能进一步平滑个别框的波动。我们曾在内部数据集上用上述方法将计数准确率从六成提升至八成五。
最后,错误分析应形成闭环。把模型答错的样本按“漏检”“误检”“语言误解”分类,若多数属漏检,则增强检测器;若属语言误解,则强化问题编码。目标检测不是万能膏药,而是把可解释的物体证据交给VQA,让计数错误从黑盒变成可追踪、可修正的具体环节。