稀疏视图三维重建的核心挑战在于,有限观测无法唯一确定场景几何。假设只有三张不同角度的图像,同一个像素在不同视图中的对应关系只能提供少量深度约束,而深度值在很大范围内都可能满足重投影误差要求。这种解的不唯一性会直接导致重建表面出现孔洞、漂浮伪影或整体尺度漂移。要解决这一问题,需要从两个方向补充信息:一是利用场景本身的结构规律作为几何先验,二是借助数据驱动的单目深度估计提供稠密深度线索。
一、重建歧义从何而来
从多视图几何的角度看,三维点的深度是通过不同视图中对应像素的三角化来确定的。当视图数量足够多时,每个三维点会被多条射线反复约束,深度估计的不确定性会迅速下降。但在稀疏视图条件下,一个三维点往往只被两三条射线约束,甚至只有一条射线。此时如果沿着射线方向移动该点,并同时调整其法向量或材质属性,渲染出的图像仍可能与输入保持较低误差。这种欠定特性使得优化过程很容易陷入局部极小,产生错误的几何解释。
纹理缺失区域会使问题进一步恶化。在弱纹理或重复纹理表面上,像素匹配本身就不可靠,光度一致性误差对深度变化不敏感。传统多视图立体方法依赖稠密匹配窗口,但在只有三张图像且视角跨度较大时,窗口内像素的对应关系会严重退化。神经辐射场等方法虽然能从图像直接优化场景表示,但在稀疏输入下容易过拟合到训练视角,深度场出现高频噪声,新视角渲染时则暴露出几何错误。
此外,单目尺度歧义也是稀疏重建中不可忽视的因素。仅凭图像无法确定场景的绝对尺度,而多视图约束不足时,优化器可能在不同尺度之间漂移。例如同一组输入图像,既可以解释为一个近距离的小物体,也可以解释为一个远距离的大物体。这种尺度上的不确定性会直接影响深度监督信号的设计,要求辅助深度信息能够以尺度不变或相对深度的形式参与优化。
二、几何先验如何约束解空间
几何先验的本质是对场景结构做出合理假设,从而将原本无限大的解空间压缩到更符合真实世界的子集。常见的先验包括局部深度平滑、法向量一致性、平面结构、对称性以及曼哈顿世界假设。局部深度平滑假设相邻像素的深度值变化不会过于剧烈,除非存在明显的边缘或遮挡边界。法向量一致性则进一步约束表面朝向,避免出现大量高频起伏和漂浮几何。平面先验适用于室内墙面、地面等场景,可以通过拟合局部平面来剔除异常深度估计。
这些先验在优化过程中通常以正则项的形式出现。例如在神经辐射场训练中,可以在渲染深度图上计算相邻像素深度差,并将其作为损失函数的一部分。为了保留物体边缘,可以采用边缘感知的各向异性平滑,即根据图像梯度调整平滑强度:在图像边缘处减小约束,在平坦区域增强约束。法向量先验则可以从深度图推导表面法向量,再惩罚相邻像素法向量的突变。这种约束能有效抑制稀疏视图下常见的漂浮物伪影,因为漂浮物通常表现为不连续、无支撑的几何碎片。
几何先验的另一个重要价值在于为优化器提供全局结构感。当训练视图非常稀疏时,单纯依赖光度损失容易让深度场在无观测区域自由发散。加入几何先验后,即使某个区域没有足够的视图约束,也会被邻近区域的结构信息所引导,形成连续且合理的表面。需要注意的是,几何先验并非越强越好,过强的平滑约束会导致细节丢失,使重建结果过于平坦。因此在实际使用中,几何先验的权重和形式需要结合具体场景进行调整。
三、单目深度估计辅助与不确定性处理
单目深度估计网络近年来取得了显著进展,MiDaS、DPT、Depth Anything 等模型能够从单张图像中预测出视觉上合理的相对深度图。这些深度图虽然不具备精确的绝对尺度,但能提供非常宝贵的稠密几何线索,尤其适合弥补稀疏视图下像素约束不足的问题。将单目深度作为辅助监督信号,可以引导重建模型在未知视角区域产生更符合场景布局的深度分布。
引入单目深度时,最大的障碍是尺度歧义。单目深度网络输出的深度值只表示相对远近关系,不能与场景的真实尺度直接对齐。如果直接使用 L1 或 L2 损失将渲染深度与单目深度对齐,优化器会为了强行匹配绝对数值而扭曲场景尺度,反而引入新的误差。更合理的做法是使用尺度不变损失或先进行尺度对齐。尺度不变损失通常计算对数深度差,并在每个批次内减去均值,从而只关注深度的相对变化,忽略全局尺度和偏移。这样既能利用单目深度的结构信息,又不会把错误的绝对尺度强加给模型。
单目深度估计本身也存在不确定性。在天空、反光表面、透明物体和低纹理区域,深度预测容易出错。如果将这些不可靠的深度值平等地作为监督信号,会误导重建过程。一种有效的策略是利用深度网络的置信度或图像边缘信息生成掩码,只对高置信度区域施加深度损失。也可以根据深度梯度调整损失权重,在深度不连续处降低权重,避免单目深度边缘与真实几何不一致时产生对抗。此外,将单目深度作为初始化或软约束,而不是硬性监督,也是降低风险的重要手段。
四、融合方案与代码示例
在神经辐射场或三维高斯泼溅等框架中,融合几何先验与单目深度估计的典型做法是在原有光度损失基础上增加两项:一项是渲染深度与单目深度之间的尺度不变损失,另一项是基于深度图或法向量的几何平滑正则项。训练时,每轮迭代从输入视图中采样像素,渲染深度图并与单目深度图计算损失,同时计算法向量平滑项,最后加权求和回传梯度。下面给出一个简化版 PyTorch 风格实现,展示损失函数的核心逻辑。
import torch
def scale_invariant_depth_loss(rendered_depth, mono_depth, mask, eps=1e-6):
# 计算尺度不变对数深度损失,避免单目深度绝对尺度不一致
log_rendered = torch.log(torch.clamp(rendered_depth, min=eps))
log_mono = torch.log(torch.clamp(mono_depth, min=eps))
diff = log_rendered - log_mono
diff = diff[mask]
if diff.numel() < 10:
return torch.tensor(0.0, device=rendered_depth.device)
return torch.sqrt((diff - diff.mean()).pow(2).mean() + 0.1 * diff.mean().pow(2))
def normal_prior_loss(normals, mask):
# 法向量局部平滑先验,抑制高频噪声和漂浮几何
dx = normals[:, :, 1:, :] - normals[:, :, :-1, :]
dy = normals[:, :, :, 1:] - normals[:, :, :, :-1]
mask_x = mask[:, :, 1:, :] & mask[:, :, :-1, :]
mask_y = mask[:, :, :, 1:] & mask[:, :, :, :-1]
loss_x = (dx.abs().sum(dim=2) * mask_x).mean()
loss_y = (dy.abs().sum(dim=2) * mask_y).mean()
return loss_x + loss_y
def total_loss(rendered_depth, mono_depth, normals, mask, lambda_depth=1.0, lambda_normal=0.5):
depth_term = scale_invariant_depth_loss(rendered_depth, mono_depth, mask)
normal_term = normal_prior_loss(normals, mask)
return (lambda_depth * depth_term + lambda_normal * normal_term)
在上述代码中,scale_invariant_depth_loss 通过对数变换和去均值操作消除单目深度的尺度与偏移影响,使渲染深度只需要在相对结构上与单目深度保持一致。normal_prior_loss 则从渲染法向量图中计算相邻像素差异,并对无效区域进行掩码,避免背景或未被观测到的像素干扰梯度。这两个损失项可以根据场景特点调整权重,lambda_depth 控制深度辅助强度,lambda_normal 控制几何平滑强度。
实际训练中,单目深度图通常来自预训练模型,渲染深度则来自神经场景表示的体积渲染或高斯泼溅光栅化。为了提升稳定性,可以先使用稀疏重建结果进行尺度对齐,再计算深度损失。例如利用 COLMAP 得到的稀疏三维点,将单目深度图线性对齐到该尺度下,或者直接在损失中使用可学习的尺度因子和偏移参数。这样能进一步减少单目深度与场景之间的系统偏差,使辅助信号更加可靠。
五、调优建议与常见误区
权重选择是融合方案中最关键的调优点。深度辅助损失权重过大,会导致重建表面过度平滑,丢失高频细节;权重过小,则无法有效缓解稀疏视图带来的歧义。通常可以从较小的权重开始,例如将深度损失设为光度损失的 0.1 到 0.5 倍,观察深度误差和法向量误差的变化趋势。如果新视角下出现明显漂浮物,可以适当增加法向量平滑项的强度;如果表面过于平坦,则应降低平滑权重或引入边缘感知机制。
一个常见误区是把单目深度估计结果当作绝对真值来使用。单目深度网络输出的数值本身并没有绝对尺度含义,直接使用 L1 或 MSE 损失会迫使场景深度向错误尺度收敛。另一个误区是对所有像素一视同仁。在天空、反光、透明物体等区域,单目深度可能严重失准,如果这些区域也参与深度损失计算,会显著损害重建质量。合理做法是根据深度不确定性或边缘信息加权,只对高置信度区域施加较强的深度约束。
评估时不能只看渲染图像的 PSNR 或 SSIM,因为这些指标可能掩盖几何错误。同一张新视角图像,即使几何结构已经塌缩,只要颜色预测正确,PSNR 仍可能较高。更有效的评估方式是使用深度误差、法向量误差、点云完整性等几何指标,或者将重建结果与真实扫描数据对比。在缺少真值时,可以通过交叉验证观察模型在不同视角下的几何一致性,及时发现并修正过拟合或歧义问题。将几何先验与单目深度估计合理结合,能够显著提升稀疏视图三维重建的稳定性和可用性。