Metric3D深度估计模型使用问题解析与解决方案

2025-07-08 22:25:50作者：舒璇辛Bertina

问题背景

Metric3D是一个基于视觉Transformer架构的单目深度估计模型，能够从单张RGB图像预测出场景的深度信息。在实际使用过程中，用户遇到了深度图输出稀疏和预测值异常的问题。

通过测试发现，模型输出的深度图存在两种不同表现：

稀疏深度图：这是模型对KITTI数据集测试时产生的输出，其稀疏性源于KITTI数据集本身使用LiDAR采集的深度真值(Ground Truth)就是稀疏的。模型在可视化时会将预测结果与真值进行对比展示，因此第三行显示的稀疏点云实际上是LiDAR采集的真值数据。
密集深度图：当使用test_vit.sh脚本测试时，模型能够输出完整的密集深度图(第二行显示)，这是模型的实际预测结果。密集深度图是Metric3D的核心输出能力。

在尝试使用已知相机内参进行测试时(test_kitti.sh和test_nyu.sh)，出现了预测值异常的情况。从日志可见：

-- pred --
torch.Size([1, 1, 480, 1216])
tensor(24.2716, device='cuda:0')
tensor(24.2192, device='cuda:0')
tensor(24.2716, device='cuda:0')

预测深度值集中在24左右，这显然不符合实际场景深度分布。同时出现RankWarning: Polyfit may be poorly conditioned警告，表明在尺度对齐过程中出现了数值计算问题。

数据预处理检查：确保输入图像已正确进行归一化处理(像素值范围0-1)，且图像尺寸符合模型要求。
相机参数验证：确认提供的相机内参矩阵格式正确，特别是焦距和主点坐标的单位和顺序。
模型权重加载：检查是否加载了正确的预训练权重，不同测试脚本可能需要特定训练的模型。
尺度对齐优化：对于RankWarning警告，可以尝试：
- 增加有效深度点的采样数量
- 添加微小正则化项防止矩阵奇异
- 实现更鲁棒的RANSAC-based对齐方法
测试脚本选择：根据应用场景选择合适的测试脚本：
- 无相机参数时使用test_vit.sh
- 有准确相机参数时使用test_kitti.sh或test_nyu.sh