Highway项目中的WidenMulAccumulate操作优化探讨

2025-06-12 08:19:30作者：廉皓灿Ida

性能可移植的、长度无关的SIMD

项目地址：https://gitcode.com/GitHub_Trending/hi/highway

背景介绍

Highway是一个高性能SIMD指令抽象库，它提供了跨平台的向量化操作接口。在实际应用中，特别是在图像处理领域，经常需要进行向量元素的扩展乘法累加操作（Widen Multiply Accumulate），即将两个向量的元素分别扩展后进行乘法运算，再与第三个向量相加。这种操作在颜色空间转换、矩阵变换等场景中非常常见。

问题核心

在Highway项目中，当前提供的ReorderWidenMulAccumulate接口虽然能够实现扩展乘法累加功能，但其行为在不同平台上并不完全一致。具体来说：

在ARM NEON平台上，它使用vmlal指令，直接对向量的高低部分进行扩展乘法累加
在ARM SVE平台上，它处理的是奇偶索引的元素而非高低部分

这种不一致性导致开发者在使用时需要针对不同平台编写特殊处理代码，增加了开发复杂度和维护成本。

技术分析

当前实现的问题

当前实现的主要问题在于平台间的行为差异：

NEON的vmlal指令直接处理向量高低部分
SVE的svmlalb/svmlalt指令处理的是奇偶索引元素

这种差异使得开发者无法编写统一的跨平台代码，必须针对不同平台进行特殊处理。

性能考量

性能测试表明：

直接使用vmlal指令的实现比使用PromoteTo+MulAdd组合快约25%
虽然现代编译器（如Clang 9+和GCC 11+）能够将PromoteTo+MulAdd优化为vmlal指令，但优化效果仍不如直接使用

解决方案探讨

社区提出了几种可能的解决方案：

新增专用API：添加一个保证行为一致的WidenMulAccumulate接口，在支持平台上使用原生指令，在不支持平台上使用通用实现
依赖编译器优化：继续使用PromoteTo+MulAdd组合，依赖编译器进行优化
平台特定代码：让开发者自行编写平台特定的优化代码

最佳实践建议

基于讨论和分析，对于需要使用扩展乘法累加操作的开发者，目前建议：

如果性能要求极高且主要目标平台是ARM NEON，可以直接使用平台特定的实现
对于需要跨平台兼容性的场景，可以使用PromoteTo+MulAdd组合，现代编译器能够进行较好的优化
关注Highway项目的更新，未来可能会提供更统一的接口

未来展望

Highway项目团队正在考虑添加一个行为更一致的API，这将大大简化跨平台开发。同时，随着编译器优化的不断进步，PromoteTo+MulAdd组合的性能差距有望进一步缩小。开发者可以根据自己的需求选择最适合的方案。

在SIMD编程中，理解底层指令的行为差异和性能特性非常重要。Highway这样的抽象库正在努力简化这一过程，但在某些情况下，了解平台特性仍然是获得最佳性能的关键。

性能可移植的、长度无关的SIMD

项目地址：https://gitcode.com/GitHub_Trending/hi/highway

登录后查看全文

最新内容推荐

OMNeT++中文使用手册：网络仿真的终极指南与实用教程 Python案例资源下载 - 从入门到精通的完整项目代码合集 VSdebugChkMatch.exe：专业PDB签名匹配工具全面解析与使用指南高效汇编代码注入器：跨平台x86/x64架构的终极解决方案中兴e读zedx.zed文档阅读器V4.11轻量版：专业通信设备文档阅读解决方案 XMODEM协议C语言实现：嵌入式系统串口文件传输的经典解决方案电脑PC网易云音乐免安装皮肤插件使用指南：个性化音乐播放体验 PhysioNet医学研究数据库：临床数据分析与生物信号处理的权威资源指南 SAP S4HANA物料管理资源全面解析：从入门到精通的完整指南 ZLIB 1.3 静态库 Windows x64 版本：高效数据压缩解决方案完全指南

项目优选

收起

deepin linux kernel

OpenHarmony documentation | OpenHarmony开发者文档

Ascend Extension for PyTorch

本项目是CANN提供的数学类基础计算算子库，实现网络在NPU上加速计算。

flutter_flutter

ohos_react_native

React Native鸿蒙化仓库

openEuler内核是openEuler操作系统的核心，既是系统性能与稳定性的基石，也是连接处理器、设备与服务的桥梁。

Nop Platform 2.0是基于可逆计算理论实现的采用面向语言编程范式的新一代低代码开发平台，包含基于全新原理从零开始研发的GraphQL引擎、ORM引擎、工作流引擎、报表引擎、规则引擎、批处理引引擎等完整设计。nop-entropy是它的后端部分，采用java语言实现，可选择集成Spring框架或者Quarkus框架。中小企业可以免费商用

🎉 (RuoYi)官方仓库基于SpringBoot，Spring Security，JWT，Vue3 & Vite、Element Plus 的前后端分离权限管理系统

🔥LeetCode solutions in any programming language | 多种编程语言实现 LeetCode、《剑指 Offer（第 2 版）》、《程序员面试金典（第 6 版）》题解