深入理解OLLVM-TLL项目中的LibFuzzer覆盖率引导模糊测试技术
2025-06-12 01:14:11作者:廉皓灿Ida
概述
LibFuzzer是LLVM生态系统中的一个核心组件,它是一种进程内(in-process)、覆盖率引导(coverage-guided)的进化式模糊测试引擎。在OLLVM-TLL项目中,LibFuzzer被深度整合用于提升代码的安全性和鲁棒性测试。
LibFuzzer核心原理
LibFuzzer的工作原理是与被测库链接,通过特定的模糊测试入口点(称为"目标函数")向库提供模糊输入。它通过跟踪代码覆盖情况,并根据输入数据语料库生成变异,以最大化代码覆盖率。
关键特性包括:
- 进程内执行:无需进程间通信,效率极高
- 实时覆盖率反馈:利用LLVM的SanitizerCoverage插桩获取精确覆盖率数据
- 进化算法:智能地变异输入以探索新的代码路径
快速入门指南
编写模糊测试目标
模糊测试目标是使用被测API处理输入字节数组的函数,基本结构如下:
extern "C" int LLVMFuzzerTestOneInput(const uint8_t *Data, size_t Size) {
// 使用Data和Size调用被测API
return 0;
}
编写高质量模糊测试目标的要点:
- 必须能处理任何类型的输入(空、超大、畸形等)
- 不能因任何输入而退出进程
- 尽量保持确定性
- 执行速度要快
- 最好不修改全局状态
构建与运行
使用Clang构建时,通过-fsanitize=fuzzer标志启用LibFuzzer:
clang -g -O1 -fsanitize=fuzzer,address mytarget.c # 带ASAN
clang -g -O1 -fsanitize=fuzzer,undefined mytarget.c # 带UBSAN
高级使用技巧
语料库管理
初始语料库应包含多样化的有效和无效输入样本。LibFuzzer会基于这些样本生成随机变异。
语料库最小化技巧:
mkdir MIN_CORPUS
./my_fuzzer -merge=1 MIN_CORPUS FULL_CORPUS
并行模糊测试
通过-jobs=N和-workers=M参数实现并行化:
-jobs指定总任务数-workers控制同时运行的进程数
选项配置
关键运行选项:
-max_len:控制输入最大长度-timeout:单个测试超时时间-rss_limit_mb:内存限制-dict:提供输入关键字字典-artifact_prefix:指定崩溃样本保存路径
实战示例
简单示例
检测特定输入字符串的测试目标:
extern "C" int LLVMFuzzerTestOneInput(const uint8_t *data, size_t size) {
if (size >= 3 && data[0] == 'H' && data[1] == 'I' && data[2] == '!')
__builtin_trap(); // 触发崩溃
return 0;
}
输出解读
典型输出包含:
cov:覆盖的代码块/边数量ft:覆盖的特征数corp:内存中语料库条目数和大小exec/s:每秒执行次数rss:内存消耗
事件类型:
NEW:发现新覆盖的输入REDUCE:找到更小的等效输入PULSE:周期性状态报告
最佳实践
- 目标设计:保持目标函数简单专注,一个目标测试一个功能点
- 初始种子:提供高质量的初始输入样本
- 资源控制:合理设置超时和内存限制
- 持续集成:将模糊测试纳入自动化测试流程
- 结果分析:定期检查发现的崩溃和异常
在OLLVM-TLL项目中合理应用LibFuzzer,可以显著提升代码质量和安全性,发现传统测试方法难以触达的边界条件问题。
登录后查看全文
热门项目推荐
atomcodeClaude Code 的开源替代方案。连接任意大模型,编辑代码,运行命令,自动验证 — 全自动执行。用 Rust 构建,极致性能。 | An open-source alternative to Claude Code. Connect any LLM, edit code, run commands, and verify changes — autonomously. Built in Rust for speed. Get StartedRust0171
cann-learning-hubCANN 学习中心仓,支持在线互动运行、边学边练,提供教程、示例与优化方案,一站式助力昇腾开发者快速上手。Jupyter Notebook092
Step-3.7-FlashStep-3.7-Flash是一个拥有 1980 亿参数的稀疏混合专家(MoE)视觉语言模型,由 1960 亿参数的语言主干网络和 18 亿参数的视觉编码器组合而成,具备原生图像理解能力。Python00
BitCPM-CANN-8BBitCPM-CANN 是首个基于华为昇腾 NPU 原生构建的端到端 1.58 位(三值化)大语言模型训练系统。该系统将量化感知训练(QAT)集成到 Megatron-LM 框架中,并结合 MindSpeed 加速,覆盖了从自定义三值算子到基于昇腾 910B 的分布式并行训练的完整训练栈。Python00
MiniCPM5-1BMiniCPM5-1B,这是 MiniCPM5 系列的首款模型。它是一个专为端侧、本地部署和资源受限场景打造的 10 亿参数密集型 Transformer 模型,达到了 10 亿参数级开源模型的 SOTA 水平Jinja00
skillhubopenJiuwen 生态的 Skill 托管与分发开源方案,支持自建与可选 ClawHub 兼容。Python0239
热门内容推荐
最新内容推荐
项目优选
收起
暂无描述
Dockerfile
748
4.86 K
本项目是CANN提供的神经网络类计算算子库,实现网络在NPU上加速计算。
C++
641
1.26 K
Ascend Extension for PyTorch
Python
685
828
本项目是CANN提供的transformer类大模型算子库,实现网络在NPU上加速计算。
C++
834
1.83 K
openEuler内核是openEuler操作系统的核心,既是系统性能与稳定性的基石,也是连接处理器、设备与服务的桥梁。
C
450
417
本项目是CANN提供的数学类基础计算算子库,实现网络在NPU上加速计算。
C++
1.02 K
1.04 K
Claude Code 的开源替代方案。连接任意大模型,编辑代码,运行命令,自动验证 — 全自动执行。用 Rust 构建,极致性能。 | An open-source alternative to Claude Code. Connect any LLM, edit code, run commands, and verify changes — autonomously. Built in Rust for speed.
Get Started
Rust
1.51 K
171
CANNBot 是面向 CANN 开发的用于提升开发效率的系列智能体,本仓库为其提供可复用的 Skills 模块。
Python
935
554
暂无简介
Dart
995
257
昇腾LLM分布式训练框架
Python
172
211