FastDeploy中PPYOLOE模型在TensorRT批量推理时输入尺寸小于224的问题分析

2025-06-26 13:55:52作者：宣利权Counsellor

问题背景

在使用FastDeploy部署PPYOLOE-S目标检测模型时，当输入图像尺寸小于224×224（如192×192或160×96）时，在TensorRT后端进行批量推理会出现异常结果。具体表现为在批量推理相同图片时，检测结果中随机出现NaN值或零值，特别是当图片中目标较少时，这种现象更容易出现。

在Windows 10系统下，使用FastDeploy 1.0.7版本，搭配NVIDIA 3080TI/1660S显卡和CUDA 11.2环境进行测试时发现：

经过深入排查，发现问题根源在于Paddle2ONNX转换过程中生成的BatchedNMSDynamic_TRT算子。这个算子在处理小尺寸输入图像时存在稳定性问题，特别是在批量推理场景下表现更为明显。

TensorRT在处理动态形状输入时，会为每个新形状范围重建引擎。当输入尺寸较小时，某些计算可能超出了数值稳定范围，导致结果异常。从日志中可以看到TensorRT引擎重建的过程：

[WARNING] [New Shape Out of Range] input name: image, shape: [10, 3, 96, 192]
[INFO] Start to building TensorRT Engine...

针对这一问题，可以采取以下几种解决方案：

对于需要在生产环境中部署PPYOLOE模型的开发者，建议：

这个问题提醒我们，在模型部署过程中，不仅需要考虑算法本身的准确性，还需要关注不同后端实现的特性和限制，特别是在边缘计算等资源受限场景下，输入尺寸的选择可能对最终结果产生重大影响。

登录后查看全文