async-profiler中nativemem未捕获所有内存分配的问题分析

2025-05-28 08:58:21作者：范靓好Udolf

项目地址：https://gitcode.com/gh_mirrors/asy/async-profiler

问题背景

在Rust应用程序的性能分析过程中，开发者发现async-profiler的nativemem功能未能捕获所有的内存分配调用。与jemalloc/jeprof工具相比，async-profiler的结果中缺失了部分调用栈信息。这些缺失的调用栈包括通过__GI___libc_malloc和_int_malloc等底层分配函数的路径。

技术分析

经过深入调查，发现async-profiler在内存分配拦截机制上存在两个关键问题：

特定分配函数未被拦截：async-profiler原本没有拦截像posix_memalign这样的特殊内存分配函数。这些函数在Rust的标准库中被广泛使用，特别是在处理对齐内存分配时。
函数入口点修补不完整：当函数引用同时存在于.rela.plt和.rela.dyn节区时，async-profiler只修补了其中一个节区的引用，导致部分调用路径未被正确捕获。

解决方案

开发团队针对这两个问题进行了修复：

扩展了拦截范围，现在能够正确捕获posix_memalign等特殊分配函数。
改进了函数入口点修补机制，确保无论函数引用出现在哪个节区都能被正确拦截。

实际影响

这个问题特别影响Rust应用程序的分析，因为Rust的内存分配器会使用多种底层分配策略。修复后，async-profiler能够提供更完整的内存分配分析结果，与jemalloc等工具的结果更加一致。

技术细节

在Linux系统中，内存分配通常通过以下路径进行：

应用程序调用标准库分配函数
这些函数最终调用底层的内存管理实现
性能分析工具通过拦截这些调用点来收集数据

async-profiler通过动态修补这些调用点来实现无侵入式的分析。之前的实现遗漏了一些特殊情况，现在已得到完善。

结论

这个修复使得async-profiler在内存分配分析方面更加可靠，特别是对于使用Rust等现代语言开发的应用程序。开发者现在可以更有信心地使用async-profiler来进行全面的内存性能分析。

项目地址：https://gitcode.com/gh_mirrors/asy/async-profiler

登录后查看全文

项目优选

收起

deepin linux kernel

OpenHarmony documentation | OpenHarmony开发者文档

Ascend Extension for PyTorch

本项目是CANN提供的数学类基础计算算子库，实现网络在NPU上加速计算。

flutter_flutter

Nop Platform 2.0是基于可逆计算理论实现的采用面向语言编程范式的新一代低代码开发平台，包含基于全新原理从零开始研发的GraphQL引擎、ORM引擎、工作流引擎、报表引擎、规则引擎、批处理引引擎等完整设计。nop-entropy是它的后端部分，采用java语言实现，可选择集成Spring框架或者Quarkus框架。中小企业可以免费商用

ohos_react_native

React Native鸿蒙化仓库

🔥LeetCode solutions in any programming language | 多种编程语言实现 LeetCode、《剑指 Offer（第 2 版）》、《程序员面试金典（第 6 版）》题解

🎉 (RuoYi)官方仓库基于SpringBoot，Spring Security，JWT，Vue3 & Vite、Element Plus 的前后端分离权限管理系统

cangjie_compiler

仓颉编译器源码及 cjdb 调试工具。