Kubespray集群升级中kubeadm健康检查失败问题分析
2025-05-13 06:48:24作者:殷蕙予
问题背景
在使用Kubespray进行Kubernetes集群升级时,特别是在从1.30.8版本升级到1.31.4版本的过程中,部分用户遇到了控制平面节点升级失败的问题。该问题表现为第二个控制平面节点升级时,kubeadm的升级前健康检查(upgrade-health-check)作业未能按时完成,导致整个升级过程中断。
问题现象
升级过程中,当第一个控制平面节点成功升级后,第二个控制平面节点执行kubeadm upgrade apply命令时会失败,并显示以下关键错误信息:
[upgrade/health] FATAL: [preflight] Some fatal errors occurred:
[ERROR CreateJob]: Job "upgrade-health-check-rcfkg" in the namespace "kube-system" did not complete in 15s: no condition of type Complete
经过深入分析发现,这个问题具有以下特征:
- 仅当kube-controller-manager组件已经升级到新版本(v1.31.4)时才会出现
- 当kube-controller-manager仍运行旧版本(v1.30.8)时,健康检查作业能够正常完成
- 问题在集群使用VIP(虚拟IP)作为API服务器端点时更容易复现
技术分析
kubeadm升级机制
Kubernetes集群升级过程中,kubeadm采用了分阶段的安全升级策略:
- 对于第一个控制平面节点,使用
kubeadm upgrade apply命令执行完整升级 - 对于后续控制平面节点,理论上应该使用
kubeadm upgrade node命令进行升级
问题根源
Kubespray当前实现中存在一个关键设计问题:它对所有控制平面节点都使用了kubeadm upgrade apply命令。根据Kubernetes官方文档,这实际上是不正确的做法,因为:
kubeadm upgrade apply会执行严格的预检健康检查- 这些健康检查在部分升级完成的集群环境中可能无法通过
- 正确的做法是后续节点使用
kubeadm upgrade node命令,该命令不会执行预检检查
健康检查超时机制
upgrade-health-check作业设计为在15秒内完成,但在以下情况下可能超时:
- 集群组件版本混合状态下的协调延迟
- 网络延迟或API服务器响应变慢
- 控制器管理器版本升级后的短暂不稳定期
解决方案
Kubespray项目已经通过PR#12015修复了这个问题,主要改进包括:
- 正确区分首个控制平面节点和后续节点的升级命令
- 对后续控制平面节点使用
kubeadm upgrade node命令 - 移除了不必要的健康检查环节
最佳实践建议
对于需要进行Kubernetes集群升级的用户,建议:
- 确保使用最新版本的Kubespray进行升级操作
- 对于大型集群,适当增加健康检查超时时间
- 在升级前做好完整的集群状态备份
- 考虑分批次升级控制平面节点,降低风险
总结
Kubernetes集群升级是一个复杂的过程,工具链的正确使用至关重要。Kubespray通过修复这个问题,进一步提高了集群升级的可靠性和成功率。用户应当理解不同升级命令的适用场景,并遵循工具的最佳实践指南,以确保升级过程顺利完成。
登录后查看全文
热门项目推荐
atomcodeClaude Code 的开源替代方案。连接任意大模型,编辑代码,运行命令,自动验证 — 全自动执行。用 Rust 构建,极致性能。 | An open-source alternative to Claude Code. Connect any LLM, edit code, run commands, and verify changes — autonomously. Built in Rust for speed. Get StartedRust0153- DDeepSeek-V4-ProDeepSeek-V4-Pro(总参数 1.6 万亿,激活 49B)面向复杂推理和高级编程任务,在代码竞赛、数学推理、Agent 工作流等场景表现优异,性能接近国际前沿闭源模型。Python00
LongCat-Video-Avatar-1.5最新开源LongCat-Video-Avatar 1.5 版本,这是一款经过升级的开源框架,专注于音频驱动人物视频生成的极致实证优化与生产级就绪能力。该版本在 LongCat-Video 基础模型之上构建,可生成高度稳定的商用级虚拟人视频,支持音频-文本转视频(AT2V)、音频-文本-图像转视频(ATI2V)以及视频续播等原生任务,并能无缝兼容单流与多流音频输入。00
auto-devAutoDev 是一个 AI 驱动的辅助编程插件。AutoDev 支持一键生成测试、代码、提交信息等,还能够与您的需求管理系统(例如Jira、Trello、Github Issue 等)直接对接。 在IDE 中,您只需简单点击,AutoDev 会根据您的需求自动为您生成代码。Kotlin03
Intern-S2-PreviewIntern-S2-Preview,这是一款高效的350亿参数科学多模态基础模型。除了常规的参数与数据规模扩展外,Intern-S2-Preview探索了任务扩展:通过提升科学任务的难度、多样性与覆盖范围,进一步释放模型能力。Python00
skillhubopenJiuwen 生态的 Skill 托管与分发开源方案,支持自建与可选 ClawHub 兼容。Python0112
热门内容推荐
最新内容推荐
项目优选
收起
暂无描述
Dockerfile
733
4.75 K
deepin linux kernel
C
31
16
Ascend Extension for PyTorch
Python
651
797
Claude Code 的开源替代方案。连接任意大模型,编辑代码,运行命令,自动验证 — 全自动执行。用 Rust 构建,极致性能。 | An open-source alternative to Claude Code. Connect any LLM, edit code, run commands, and verify changes — autonomously. Built in Rust for speed.
Get Started
Rust
1.25 K
153
旨在打造算法先进、性能卓越、高效敏捷、安全可靠的密码套件,通过轻量级、可剪裁的软件技术架构满足各行业不同场景的多样化要求,让密码技术应用更简单,同时探索后量子等先进算法创新实践,构建密码前沿技术底座!
C
1.1 K
611
本项目是CANN提供的数学类基础计算算子库,实现网络在NPU上加速计算。
C++
1.01 K
1.01 K
华为昇腾面向大规模分布式训练的多模态大模型套件,支撑多模态生成、多模态理解。
Python
147
237
昇腾LLM分布式训练框架
Python
168
200
openEuler内核是openEuler操作系统的核心,既是系统性能与稳定性的基石,也是连接处理器、设备与服务的桥梁。
C
434
395
暂无简介
Dart
986
253