FlashInfer项目对ARM架构的aarch64平台支持进展

2025-06-29 09:48:23作者：董灵辛Dennis

FlashInfer: Kernel Library for LLM Serving

项目地址：https://gitcode.com/gh_mirrors/fl/flashinfer

随着ARM架构处理器在数据中心和高性能计算领域的广泛应用，FlashInfer项目团队近期完成了对aarch64架构的官方支持工作。这项改进使得FlashInfer推理框架能够在Grace Hopper和Blackwell等基于ARM架构的硬件平台上原生运行。

技术背景

aarch64是ARMv8-A架构的64位执行状态，广泛应用于服务器级ARM处理器。传统的x86_64架构与aarch64架构在指令集和内存模型上存在显著差异，因此需要专门编译的二进制包才能获得最佳性能。

实现方案

FlashInfer团队通过以下技术方案实现了对aarch64的支持：

构建系统增强：在CI/CD流水线中增加了aarch64架构的构建矩阵选项，使得每次发布都能同时生成x86_64和aarch64两种架构的预编译二进制包。
容器化构建环境：采用了专为aarch64优化的manylinux构建容器，包括pytorch/manylinux2_28_aarch64-builder和pytorch/manylinuxaarch64-builder，确保生成的二进制包与主流ARM Linux发行版兼容。
持续集成扩展：为长期维护aarch64支持，项目配置了专用的aarch64构建节点，保证未来版本都能提供ARM架构的预编译包。

技术意义

这项改进为ARM生态带来了多重好处：

性能优化：原生aarch64二进制包能够充分利用ARM处理器的特有指令集，相比通过模拟或兼容层运行x86代码，可获得显著的性能提升。
部署便利：用户不再需要从源码编译，直接安装官方提供的wheel包即可在ARM服务器上运行。
生态兼容：与PyTorch等主流框架的ARM版本保持兼容，便于构建完整的ARM AI推理栈。

未来展望

随着ARM架构在AI加速领域的持续发展，FlashInfer对aarch64的支持将为用户提供更多硬件选择，特别是在能效比敏感的应用场景中。项目团队将持续优化ARM版本的性能，并探索针对特定ARM处理器特性的深度优化。

FlashInfer: Kernel Library for LLM Serving

项目地址：https://gitcode.com/gh_mirrors/fl/flashinfer

登录后查看全文

项目优选

收起

Ascend Extension for PyTorch

openEuler内核是openEuler操作系统的核心，既是系统性能与稳定性的基石，也是连接处理器、设备与服务的桥梁。

本项目是CANN提供的数学类基础计算算子库，实现网络在NPU上加速计算。

Claude Code 的开源替代方案。连接任意大模型，编辑代码，运行命令，自动验证 — 全自动执行。用 Rust 构建，极致性能。｜ An open-source alternative to Claude Code. Connect any LLM, edit code, run commands, and verify changes — autonomously. Built in Rust for speed. Get Started

deepin linux kernel

华为昇腾面向大规模分布式训练的多模态大模型套件，支撑多模态生成、多模态理解。

flutter_flutter

昇腾LLM分布式训练框架

🎉 (RuoYi)官方仓库基于SpringBoot，Spring Security，JWT，Vue3 & Vite、Element Plus 的前后端分离权限管理系统