oneDNN在ARM架构上的卷积性能回归问题分析与解决
问题背景
在深度学习推理框架oneDNN中,开发人员发现当使用ARM Compute Library(ACL)作为后端时,在Apple M2 Pro处理器上出现了卷积操作的性能退化现象。具体表现为某些特定卷积配置在ACL版本升级后执行时间显著增加。
性能退化现象
通过benchdnn测试工具,开发人员复现了以下典型性能退化案例:
-
对于输入形状为mb1_ic16oc96_ih112oh112kh1的卷积操作:
- ACL 24.09版本耗时:0.135毫秒
- ACL 24.11版本耗时:0.4毫秒
-
对于输入形状为mb1_ic144oc24_ih56oh56kh1的卷积操作:
- ACL 24.09版本耗时:0.1毫秒
- ACL 24.11版本耗时:0.22毫秒
-
对于输入形状为mb1_ic24oc144_ih56oh56kh1的卷积操作:
- ACL 24.09版本耗时:0.099毫秒
- ACL 24.11版本耗时:0.196毫秒
问题分析
经过技术团队调查,发现性能退化主要源于以下几个方面:
-
ACL版本兼容性问题:oneDNN 3.6.2版本要求最低ACL版本为24.11.1,而早期测试中使用了不兼容的ACL 24.09版本,导致性能基准不一致。
-
特定卷积配置敏感:某些特定形状的卷积操作(如1x1卷积)对底层实现的变化特别敏感,微小的算法调整可能导致显著的性能差异。
-
内存布局影响:测试中使用的"acdb"内存布局(一种特殊的NHWC变体)对性能有较大影响,当切换为"any"布局时性能表现会有所不同。
解决方案与验证
技术团队采取了以下措施解决该问题:
-
版本控制:确保使用兼容的ACL版本组合,避免因版本不匹配导致的性能问题。
-
问题定位:通过分析发现,导致性能退化的补丁已被回滚,后续版本中性能退化程度有所减轻。
-
持续监控:建立更完善的性能基准测试体系,对关键卷积操作进行定期性能监控。
-
版本升级验证:在ACL v52.1.0版本上验证,确认性能已恢复到合理水平:
- 原始测试案例在ACL v52.1.0上分别耗时0.15毫秒、0.11毫秒和0.11毫秒
技术建议
对于使用oneDNN和ACL的开发者,建议:
-
始终使用官方推荐的版本组合,避免兼容性问题。
-
对于性能关键的应用,建议进行全面的基准测试,覆盖各种可能的输入形状和内存布局。
-
关注oneDNN的verbose输出(使用ONEDNN_VERBOSE=dispatch),了解实际调用的内核实现。
-
对于Apple Silicon等ARM架构处理器,特别注意内存布局对性能的影响,必要时进行布局优化。
结论
本次性能回归问题展示了深度学习框架底层优化的重要性。通过技术团队的及时响应和深入分析,不仅解决了特定版本下的性能退化问题,还建立了更完善的性能监控机制。这为oneDNN在ARM架构上的持续优化奠定了坚实基础,也为开发者提供了宝贵的性能调优经验。
Kimi-K2.5Kimi K2.5 是一款开源的原生多模态智能体模型,它在 Kimi-K2-Base 的基础上,通过对约 15 万亿混合视觉和文本 tokens 进行持续预训练构建而成。该模型将视觉与语言理解、高级智能体能力、即时模式与思考模式,以及对话式与智能体范式无缝融合。Python00
GLM-4.7-FlashGLM-4.7-Flash 是一款 30B-A3B MoE 模型。作为 30B 级别中的佼佼者,GLM-4.7-Flash 为追求性能与效率平衡的轻量化部署提供了全新选择。Jinja00
VLOOKVLOOK™ 是优雅好用的 Typora/Markdown 主题包和增强插件。 VLOOK™ is an elegant and practical THEME PACKAGE × ENHANCEMENT PLUGIN for Typora/Markdown.Less00
PaddleOCR-VL-1.5PaddleOCR-VL-1.5 是 PaddleOCR-VL 的新一代进阶模型,在 OmniDocBench v1.5 上实现了 94.5% 的全新 state-of-the-art 准确率。 为了严格评估模型在真实物理畸变下的鲁棒性——包括扫描伪影、倾斜、扭曲、屏幕拍摄和光照变化——我们提出了 Real5-OmniDocBench 基准测试集。实验结果表明,该增强模型在新构建的基准测试集上达到了 SOTA 性能。此外,我们通过整合印章识别和文本检测识别(text spotting)任务扩展了模型的能力,同时保持 0.9B 的超紧凑 VLM 规模,具备高效率特性。Python00
KuiklyUI基于KMP技术的高性能、全平台开发框架,具备统一代码库、极致易用性和动态灵活性。 Provide a high-performance, full-platform development framework with unified codebase, ultimate ease of use, and dynamic flexibility. 注意:本仓库为Github仓库镜像,PR或Issue请移步至Github发起,感谢支持!Kotlin07
compass-metrics-modelMetrics model project for the OSS CompassPython00