首页
/ OpenBLAS 0.3.29版本发布:性能优化与跨平台支持全面升级

OpenBLAS 0.3.29版本发布:性能优化与跨平台支持全面升级

2025-06-09 13:15:57作者:齐冠琰

OpenBLAS是一个高性能的基础线性代数子程序库(BLAS),它针对各种处理器架构进行了高度优化。作为科学计算和机器学习领域的基础组件,OpenBLAS为矩阵运算、向量操作等提供了高效的实现。最新发布的0.3.29版本带来了多项重要改进,包括性能优化、错误修复以及对新硬件平台的支持。

核心架构改进

本次更新在基础架构层面进行了多项重要改进。首先解决了多线程构建中可能出现的空指针解引用问题,增强了库的稳定性。同时增加了GEMMT函数的别名GEMMTR,以保持与Reference-BLAS的兼容性。对于使用CMake构建的项目,最低CMake版本要求提升至3.16.0,消除了许多兼容性和废弃警告。

在多线程性能方面,SBGEMV(单精度带状矩阵向量乘法)和TRTRI(三角矩阵求逆)的线程扩展性得到了显著改善。此外,还修复了多线程BLAS3调用中可能出现的精度问题,确保了计算结果的准确性。

跨平台与编译器支持

0.3.29版本显著扩展了对不同平台和编译器的支持:

  • 新增了对NAG Fortran编译器的支持
  • 针对LLVM18及更高版本的flang-new编译器改进了选项处理
  • 适应了Cray和NVIDIA编译器的最新调用约定变化
  • 修复了Windows on Arm平台的编译问题
  • 增加了对IOS系统和NetBSD(evbarm架构)的支持
  • 解决了使用NVIDIA编译器编译SVE目标时的问题

各架构专项优化

ARM64架构

ARM64平台获得了多项重要更新,包括修复了c/zgemm_beta内核中长期存在的数组越界问题,重写了CPU自动检测逻辑以扫描所有核心并返回最高性能类型。对于SVE(可伸缩向量扩展)目标,DGEMM(双精度矩阵乘法)在小矩阵情况下的性能得到提升,并新增了ROT和SWAP操作的SVE内核。

特别值得注意的是,SGEMV和DGEMV(单/双精度矩阵向量乘法)在A64FX和NEOVERSEV1处理器上的SVE内核性能得到优化,同时增加了对Apple M4处理器的自动检测和初步支持。

x86_64架构

x86_64平台修复了Cooper Lake架构上SBGEMV内核的存储大小问题,增加了对Intel Granite Rapids和AMD Ryzen 5系列处理器的自动检测。新增了针对AVX目标的优化SOMATCOPY_CT(单精度矩阵转置复制)实现,并重新启用了EXPRECISION选项的构建。

POWER架构

POWER平台修复了多线程SBGEMM(单精度带状矩阵乘法)的问题,改进了SGEMV性能,并增加了向量化的SBGEMV实现。特别针对POWER10处理器,新增了优化的CGEMM和ZGEMM(单/双精度复数矩阵乘法)内核。

其他架构

MIPS64、Loongarch64和RISC-V架构也获得了多项改进。Loongarch64平台新增了LASX目标的优化SOMATCOPY实现,并引入了新的CPU命名方案。RISC-V平台则优化了SNRM2/DNRM2(单/双精度向量2范数)在RVV1.0目标上的性能,并修复了多个实现问题。

构建系统与工具链改进

构建系统方面,0.3.29版本修复了pkgconfig文件中-fopenmp标志和libsuffix的放置问题,改进了Makefile构建生成的CMakeConfig文件。新增了单独的"make install_tests"目标,便于交叉编译场景下的使用。

对于开发者而言,修复了使用gcc14编译CBLAS测试套件的问题,并改进了pybench基准测试的构建说明。文档方面增加了对WoA(Windows on Arm)和HarmonyOS的构建指导,以及影响构建和运行时行为的环境变量说明。

数值计算与API改进

在数值计算方面,修复了PPC架构上SSCAL和DSCAL(单/双精度向量缩放)处理NaN和Inf参数的问题,确保了特殊值的正确处理。API层面修正了cblas.h中cblas_?geadd的const正确性,并修复了转换后的LAPACK C版本中TRTRS(三角方程组求解)的函数签名。

总结

OpenBLAS 0.3.29版本是一个重要的维护更新,在多线程性能、跨平台支持和特定架构优化方面都有显著提升。特别是对ARM SVE扩展和RISC-V向量指令集的支持不断完善,使得OpenBLAS能够在更多新兴硬件平台上发挥最佳性能。对于科学计算和高性能计算应用开发者来说,升级到这个版本将获得更好的稳定性和性能表现。

登录后查看全文
热门项目推荐

热门内容推荐

最新内容推荐

项目优选

收起
docsdocs
OpenHarmony documentation | OpenHarmony开发者文档
Dockerfile
143
1.92 K
kernelkernel
deepin linux kernel
C
22
6
nop-entropynop-entropy
Nop Platform 2.0是基于可逆计算理论实现的采用面向语言编程范式的新一代低代码开发平台,包含基于全新原理从零开始研发的GraphQL引擎、ORM引擎、工作流引擎、报表引擎、规则引擎、批处理引引擎等完整设计。nop-entropy是它的后端部分,采用java语言实现,可选择集成Spring框架或者Quarkus框架。中小企业可以免费商用
Java
8
0
ohos_react_nativeohos_react_native
React Native鸿蒙化仓库
C++
192
274
RuoYi-Vue3RuoYi-Vue3
🎉 (RuoYi)官方仓库 基于SpringBoot,Spring Security,JWT,Vue3 & Vite、Element Plus 的前后端分离权限管理系统
Vue
929
553
openHiTLSopenHiTLS
旨在打造算法先进、性能卓越、高效敏捷、安全可靠的密码套件,通过轻量级、可剪裁的软件技术架构满足各行业不同场景的多样化要求,让密码技术应用更简单,同时探索后量子等先进算法创新实践,构建密码前沿技术底座!
C
422
392
openGauss-serveropenGauss-server
openGauss kernel ~ openGauss is an open source relational database management system
C++
145
189
金融AI编程实战金融AI编程实战
为非计算机科班出身 (例如财经类高校金融学院) 同学量身定制,新手友好,让学生以亲身实践开源开发的方式,学会使用计算机自动化自己的科研/创新工作。案例以量化投资为主线,涉及 Bash、Python、SQL、BI、AI 等全技术栈,培养面向未来的数智化人才 (如数据工程师、数据分析师、数据科学家、数据决策者、量化投资人)。
Jupyter Notebook
75
65
Cangjie-ExamplesCangjie-Examples
本仓将收集和展示高质量的仓颉示例代码,欢迎大家投稿,让全世界看到您的妙趣设计,也让更多人通过您的编码理解和喜爱仓颉语言。
Cangjie
344
1.3 K
easy-eseasy-es
Elasticsearch 国内Top1 elasticsearch搜索引擎框架es ORM框架,索引全自动智能托管,如丝般顺滑,与Mybatis-plus一致的API,屏蔽语言差异,开发者只需要会MySQL语法即可完成对Es的相关操作,零额外学习成本.底层采用RestHighLevelClient,兼具低码,易用,易拓展等特性,支持es独有的高亮,权重,分词,Geo,嵌套,父子类型等功能...
Java
36
8