brpc/braft 中 arm64 架构下 replicator 停止发送日志问题的分析与解决
2025-06-15 19:45:22作者:凤尚柏Louis
问题背景
在分布式系统中,brpc/braft 是一个广泛使用的 Raft 共识算法实现。近期在 arm64 架构下发现了一个稳定性问题:由 leader 创建的 replicator 在运行一段时间后有概率停止向 follower 发送日志,导致 follower 的日志索引落后且不再更新。
问题现象
在由 3 个节点组成的 Raft 组中,系统运行 1-2 天后会出现以下现象:
- 其中一个 follower 的日志索引落后于 leader 且不再更新
- leader 仅向该 follower 发送心跳包,不再发送带有日志内容的 AppendEntries RPC
- 日志分析显示,leader 的两个 replicator 在等待新日志时出现异常:一个 replicator 的回调未被调用,另一个则被调用了两次
深入分析
通过添加调试日志,发现问题的核心在于 log_manager 的 _wait_map flatmap 操作。更具体的发现包括:
- 对象指针重复问题:在 wake_up_waiter 函数中,获取到的两个 wait meta 指针相同,这表明存在对象管理问题
- 线程局部存储问题:butil::get_object 使用了 thread_local 变量,如果在两次 butil::get_object/return_object 调用之间有 bthread 切换(如调用 bthread_start_urgent),就会导致对象管理混乱
- 编译器优化影响:问题可能与编译器优化有关,特别是在 arm64 架构下
根本原因
问题的根本原因可以追溯到 brpc 中对象池的实现方式。在特定条件下(特别是涉及 bthread 切换时),对象池的管理会出现混乱,导致:
- 同一个对象被多次获取
- 对象状态不一致
- 回调函数调用次数异常
这种问题在 arm64 架构下更为明显,可能与架构特定的内存模型或编译器优化策略有关。
解决方案
经过验证,有以下几种解决方案:
- 编译器选项调整:添加
-fno-gcse、-fno-cse-follow-jumps和-fno-move-loop-invariants编译参数可以解决此问题 - 升级编译器版本:使用更高版本的编译器(如 GCC 8+)也可能避免此问题
- 代码修复:从根本上修复对象池的管理逻辑,确保在 bthread 切换时也能正确处理对象生命周期
最佳实践建议
对于使用 brpc/braft 的开发者和运维人员,建议:
- 在 arm64 架构下部署时,特别注意此问题的监控
- 考虑在构建时添加上述编译器选项
- 保持 brpc 版本的及时更新,关注相关修复
- 在生产环境部署前,进行充分的长时稳定性测试
总结
这个问题展示了在跨平台开发中可能遇到的微妙问题,特别是在涉及并发、内存管理和编译器优化的场景下。通过深入分析对象生命周期管理和线程局部存储的使用,我们不仅找到了解决方案,也加深了对分布式系统底层机制的理解。对于类似系统的开发和维护,这种对底层细节的关注至关重要。
登录后查看全文
热门项目推荐
atomcodeClaude Code 的开源替代方案。连接任意大模型,编辑代码,运行命令,自动验证 — 全自动执行。用 Rust 构建,极致性能。 | An open-source alternative to Claude Code. Connect any LLM, edit code, run commands, and verify changes — autonomously. Built in Rust for speed. Get StartedRust0190
cann-learning-hubCANN 学习中心仓,支持在线互动运行、边学边练,提供教程、示例与优化方案,一站式助力昇腾开发者快速上手。Jupyter Notebook0113
Step-3.7-FlashStep-3.7-Flash是一个拥有 1980 亿参数的稀疏混合专家(MoE)视觉语言模型,由 1960 亿参数的语言主干网络和 18 亿参数的视觉编码器组合而成,具备原生图像理解能力。Python00
JoyAI-EchoJoyAI-Echo,这是一个独立的、仅用于推理的版本,旨在实现分钟级多镜头音视频生成。它采用了经过蒸馏的DMD生成器、配对的跨模态记忆以及故事级别的一致性。其性能的核心在于,一个跨模态视听记忆库能够在长达五分钟的视频中保持角色外观和语音音色的一致性。同时,一个训练后处理流程将基于记忆的强化学习与分布匹配蒸馏相结合,实现了7.5倍的速度提升,显著增强了视觉质量和对齐效果。00
omega-aiOmega-AI:基于java打造的深度学习框架,帮助你快速搭建神经网络,实现模型推理与训练,引擎支持自动求导,多线程与GPU运算,GPU支持CUDA,CUDNN。Java04
llm-universe本项目是一个面向小白开发者的大模型应用开发教程,在线阅读地址:https://datawhalechina.github.io/llm-universe/Jupyter Notebook08
热门内容推荐
最新内容推荐
项目优选
收起
deepin linux kernel
C
32
16
暂无描述
Dockerfile
759
4.94 K
Claude Code 的开源替代方案。连接任意大模型,编辑代码,运行命令,自动验证 — 全自动执行。用 Rust 构建,极致性能。 | An open-source alternative to Claude Code. Connect any LLM, edit code, run commands, and verify changes — autonomously. Built in Rust for speed.
Get Started
Rust
1.78 K
188
暂无简介
Dart
1 K
259
Ascend Extension for PyTorch
Python
716
866
本项目是CANN提供的transformer类大模型算子库,实现网络在NPU上加速计算。
C++
854
1.9 K
本项目是CANN提供的数学类基础计算算子库,实现网络在NPU上加速计算。
C++
1.07 K
1.09 K
🎉 (RuoYi)官方仓库 基于SpringBoot,Spring Security,JWT,Vue3 & Vite、Element Plus 的前后端分离权限管理系统
Vue
1.72 K
1.02 K
本项目是CANN提供的神经网络类计算算子库,实现网络在NPU上加速计算。
C++
674
1.32 K
openEuler内核是openEuler操作系统的核心,既是系统性能与稳定性的基石,也是连接处理器、设备与服务的桥梁。
C
454
438