liburing项目中io_uring_submit_and_wait()性能问题深度分析

2025-06-26 22:09:10作者：宗隆裙

**liburing：释放现代I/O的强大魔力** liburing是专为高效I/O操作设计的库，它简化了Linux下的io_uring接口，让开发者无需深入内核细节即可利用先进的异步I/O能力。无论你的系统新旧，liburing都能通过其独立于特定内核版本的设计，让你轻松享受最新特性（当然受限于内核支持）。这不仅仅是技术堆砌——它解决了内存锁定限制问题，即便是普通用户也能通过适当配置突破束缚，尽管根用户天然无此顾虑。此外，liburing包含丰富的回归测试，确保性能与稳定性，但请注意，这些测试在较老内核上可能不完全兼容。构建liburing灵活简单，FFI（Foreign Function Interface）支持使其能融入多种编程语言环境。这一项目，以其LGPL/MIT双许可，为追求高性能I/O的应用打开了大门，是Jens Axboe的杰作，引领你进入高效率数据处理的新纪元。

项目地址：https://gitcode.com/gh_mirrors/li/liburing

问题背景

在Linux高性能I/O编程领域，io_uring作为新一代异步I/O框架，以其出色的性能表现获得了广泛关注。然而在实际使用过程中，开发者可能会遇到一些意料之外的性能表现。本文将以liburing项目中io_uring_submit_and_wait()函数的异常行为为切入点，深入分析其背后的技术原理和优化策略。

现象描述

开发者在使用io_uring进行NVMe设备上的随机4K读取时，观察到了以下现象：

当提交512个读取请求后调用io_uring_submit_and_wait()时，预期该调用应在70-100微秒内返回部分完成的读取
实际行为却是该调用阻塞6-8毫秒，并一次性返回所有512个完成请求
这种现象在EXT4文件系统和裸设备(/dev/nvmeXnX)上均会出现

技术分析

1. 请求提交开销

通过详细的测试和分析，发现问题的核心不在于等待部分(wait)，而在于提交(submit)阶段。提交大量I/O请求时，内核需要为每个请求执行以下操作：

准备NVMe命令
处理可能的块设备层限制
处理可能的文件系统层操作(如EXT4的atime更新)
处理可能的QoS和节流机制

在典型配置下，每个4K读取请求的提交开销约为1.4微秒(约5000个CPU周期)。对于512个请求，累计开销约为700微秒，这与观察到的现象相符。

2. 设备队列深度限制

NVMe设备和内核块层都有队列深度限制：

设备本身的硬件队列深度(通常1023)
内核通过/sys/block/nvmeXn1/queue/nr_requests设置的软件限制(通常32-64)
文件系统可能引入的额外限制

当提交的请求数超过这些限制时，提交过程会出现等待，导致延迟增加。

3. 内核配置影响

默认的发行版内核配置包含多项可能增加I/O路径开销的特性：

blk-throttle(块设备节流)
blk-latency(延迟跟踪)
blk-wbt(回写节流)
各种时间戳记录

这些特性虽然对系统稳定性有帮助，但会增加每个I/O请求的处理开销。

优化建议

1. 合理的批量大小

避免一次性提交过多请求(如512个)
推荐批量大小在32-128之间
保持总在途请求数不超过设备队列深度

2. 内核配置优化

对于高性能场景，可以考虑：

禁用不必要的块设备层特性
调整/sys/block/nvmeXn1/queue/nr_requests
使用更新的内核版本(6.8+)

3. io_uring高级特性

使用IORING_SETUP_DEFER_TASKRUN延迟任务运行
考虑IORING_SETUP_IOPOLL轮询模式(需配合nvme.poll_queues)
使用注册文件和注册缓冲区减少开销

4. 编程模式优化

将大批量请求拆分为多个小批量提交
使用非阻塞方式检查完成状态
实现请求提交和完成的流水线处理

性能数据参考

在优化后的测试中，不同批量大小的性能表现：

64个请求：约0.5μs/请求
128个请求：约0.7μs/请求
256个请求：约0.7μs/请求

第一轮测试由于内存访问冷启动会有额外开销，后续轮次性能更稳定。

结论

io_uring的submit-and-wait行为看似"阻塞"，实际上是大量请求提交开销的累积表现。通过理解底层机制并采用合理的优化策略，开发者可以充分发挥io_uring的高性能潜力。关键是要平衡批量大小与系统各层的处理能力，避免任何一个环节成为瓶颈。

对于追求极致性能的场景，建议从少量请求开始测试，逐步增加批量大小，同时监控各阶段的延迟变化，找到最适合特定硬件配置的请求调度策略。

**liburing：释放现代I/O的强大魔力** liburing是专为高效I/O操作设计的库，它简化了Linux下的io_uring接口，让开发者无需深入内核细节即可利用先进的异步I/O能力。无论你的系统新旧，liburing都能通过其独立于特定内核版本的设计，让你轻松享受最新特性（当然受限于内核支持）。这不仅仅是技术堆砌——它解决了内存锁定限制问题，即便是普通用户也能通过适当配置突破束缚，尽管根用户天然无此顾虑。此外，liburing包含丰富的回归测试，确保性能与稳定性，但请注意，这些测试在较老内核上可能不完全兼容。构建liburing灵活简单，FFI（Foreign Function Interface）支持使其能融入多种编程语言环境。这一项目，以其LGPL/MIT双许可，为追求高性能I/O的应用打开了大门，是Jens Axboe的杰作，引领你进入高效率数据处理的新纪元。

项目地址：https://gitcode.com/gh_mirrors/li/liburing

登录后查看全文

最新内容推荐

PCDViewer-4.9.0-Ubuntu20.04：专业点云可视化与编辑工具全面解析 Qt控件CSS样式实例大全 - 打造现代化GUI界面的终极指南基恩士LJ-X8000A开发版SDK样本程序全面指南 - 工业激光轮廓仪开发利器海能达HP680CPS-V2.0.01.004chs写频软件：专业对讲机配置管理利器 TJSONObject完整解析教程：Delphi开发者必备的JSON处理指南 IK分词器elasticsearch-analysis-ik-7.17.16：中文文本分析的最佳解决方案 ONVIF设备模拟器：开发测试必备的智能安防仿真工具 Python开发者的macOS终极指南：VSCode安装配置全攻略 Windows Server 2016 .NET Framework 3.5 SXS文件下载与安装完整指南昆仑通态MCGS与台达VFD-M变频器通讯程序详解：工业自动化控制完美解决方案

项目优选

收起

deepin linux kernel

Nop Platform 2.0是基于可逆计算理论实现的采用面向语言编程范式的新一代低代码开发平台，包含基于全新原理从零开始研发的GraphQL引擎、ORM引擎、工作流引擎、报表引擎、规则引擎、批处理引引擎等完整设计。nop-entropy是它的后端部分，采用java语言实现，可选择集成Spring框架或者Quarkus框架。中小企业可以免费商用

flutter_flutter

Ascend Extension for PyTorch

ohos_react_native

React Native鸿蒙化仓库

本项目是CANN提供的数学类基础计算算子库，实现网络在NPU上加速计算。

Cangjie-Examples

本仓将收集和展示高质量的仓颉示例代码，欢迎大家投稿，让全世界看到您的妙趣设计，也让更多人通过您的编码理解和喜爱仓颉语言。

🎉 (RuoYi)官方仓库基于SpringBoot，Spring Security，JWT，Vue3 & Vite、Element Plus 的前后端分离权限管理系统

🔥LeetCode solutions in any programming language | 多种编程语言实现 LeetCode、《剑指 Offer（第 2 版）》、《程序员面试金典（第 6 版）》题解

TorchAir 支持用户基于PyTorch框架和torch_npu插件在昇腾NPU上使用图模式进行推理。