Milvus数据库因ETCD性能问题导致意外停止的故障分析
2025-05-04 12:22:19作者:廉彬冶Miranda
问题背景
在Milvus 2.4.17版本的独立部署环境中,用户报告了数据库服务在正常使用过程中意外停止的问题。通过分析日志发现,该问题与ETCD服务的性能瓶颈密切相关。
故障现象
用户部署的Milvus standalone环境运行在CentOS系统上,配置为32核CPU和256GB内存。从日志中可以观察到ETCD操作出现严重延迟,例如一个简单的KV存储操作耗时超过7秒,这直接导致了Milvus服务的不稳定。
根本原因分析
深入分析日志和技术指标后,可以确定问题的核心在于存储I/O性能不足:
-
ETCD对存储性能的严苛要求:ETCD作为分布式键值存储,其共识算法和日志复制机制对磁盘I/O有极高要求,特别是对低延迟写入的敏感性。
-
磁盘性能测试结果:
- 平均IOPS为1263
- 99百分位延迟达到18.93毫秒
- 最大延迟高达710毫秒
- 磁盘利用率长期保持在95%以上
-
性能瓶颈表现:当ETCD无法及时处理请求时,Milvus会因为心跳超时或元数据操作失败而停止服务。
解决方案与优化建议
针对这一问题,我们建议采取以下措施:
-
存储硬件升级:
- 使用高性能SSD替代机械硬盘
- 确保磁盘的99百分位延迟低于10毫秒
- 建议IOPS保持在500以上
-
配置优化:
- 调整ETCD的选举超时和心跳间隔参数
- 为ETCD分配专用存储设备
- 考虑增加ETCD节点数提高可用性
-
监控与告警:
- 建立ETCD性能监控体系
- 设置操作延迟告警阈值
- 定期进行性能基准测试
经验总结
这次故障提醒我们,在部署Milvus等依赖ETCD的分布式系统时,必须特别关注存储子系统的性能表现。ETCD的性能直接影响整个系统的稳定性,而存储I/O往往是第一个出现瓶颈的环节。通过合理的硬件选型和配置优化,可以有效预防此类问题的发生。
对于生产环境,建议在部署前进行全面的性能基准测试,确保基础设施能够满足系统的性能需求,特别是对于ETCD这样的关键组件。
登录后查看全文
热门项目推荐
相关项目推荐
atomcodeClaude Code 的开源替代方案。连接任意大模型,编辑代码,运行命令,自动验证 — 全自动执行。用 Rust 构建,极致性能。 | An open-source alternative to Claude Code. Connect any LLM, edit code, run commands, and verify changes — autonomously. Built in Rust for speed. Get StartedRust0191
cann-learning-hubCANN 学习中心仓,支持在线互动运行、边学边练,提供教程、示例与优化方案,一站式助力昇腾开发者快速上手。Jupyter Notebook0118
Step-3.7-FlashStep-3.7-Flash是一个拥有 1980 亿参数的稀疏混合专家(MoE)视觉语言模型,由 1960 亿参数的语言主干网络和 18 亿参数的视觉编码器组合而成,具备原生图像理解能力。Python00
JoyAI-EchoJoyAI-Echo,这是一个独立的、仅用于推理的版本,旨在实现分钟级多镜头音视频生成。它采用了经过蒸馏的DMD生成器、配对的跨模态记忆以及故事级别的一致性。其性能的核心在于,一个跨模态视听记忆库能够在长达五分钟的视频中保持角色外观和语音音色的一致性。同时,一个训练后处理流程将基于记忆的强化学习与分布匹配蒸馏相结合,实现了7.5倍的速度提升,显著增强了视觉质量和对齐效果。00
fun-rec推荐系统入门教程,在线阅读地址:https://datawhalechina.github.io/fun-rec/Python03
so-large-lm大模型基础: 一文了解大模型基础知识01
项目优选
收起
暂无描述
Dockerfile
764
4.98 K
本项目是CANN提供的transformer类大模型算子库,实现网络在NPU上加速计算。
C++
857
1.93 K
本项目是CANN提供的神经网络类计算算子库,实现网络在NPU上加速计算。
C++
683
1.33 K
Ascend Extension for PyTorch
Python
719
882
本项目是CANN提供的数学类基础计算算子库,实现网络在NPU上加速计算。
C++
1.08 K
1.1 K
deepin linux kernel
C
32
16
openEuler内核是openEuler操作系统的核心,既是系统性能与稳定性的基石,也是连接处理器、设备与服务的桥梁。
C
457
439
用户可使用该项目在 OpenHarmony 平台开发应用,支持通过 IDE 或终端用 Flutter Tools 指令编译构建,基于 Flutter 3.27.4 版本,新增 impeller-vulkan 渲染模式,兼容多种开发指令与环境配置。
Dart
1.01 K
261
华为昇腾面向大规模分布式训练的多模态大模型套件,支撑多模态生成、多模态理解。
Python
151
253
CANNBot 是面向 CANN 开发的用于提升开发效率的系列智能体,本仓库为其提供可复用的 Skills 模块。
Python
998
609