Harvester集群升级卡滞问题分析与解决方案

2025-06-14 03:06:33作者：霍妲思

问题现象

在Harvester 1.4.0版本升级至1.4.1的过程中，用户遇到了升级过程卡滞的情况。具体表现为：

升级过程持续两天未完成
三节点集群中仅两个节点（含见证节点）完成升级
剩余节点出现longhorn-system命名空间下的backing-image-manager Pod持续重启
关键组件如harvester-network-controller-manager等显示"Available: 1/2"状态

根本原因分析

通过诊断信息可以判断，该问题属于典型的集群升级过程中的节点协调异常。可能原因包括：

节点资源竞争：Longhorn组件在升级过程中需要重新调度存储资源，而节点资源不足导致组件无法正常启动
控制器协调失败：KubeVirt等核心组件的控制器未能及时完成配置更新（观察到generation未同步）
节点状态同步延迟：集群控制平面未能及时感知到节点升级状态变化

解决方案

对于此类升级卡滞问题，建议采取以下步骤：

检查节点状态：

kubectl get nodes
kubectl describe node <问题节点名称>

强制节点重启：
```
sudo reboot now
```
这是最有效的解决方案，重启后集群升级流程会自动恢复

验证升级状态：

kubectl get managedcharts -n fleet-local harvester -o yaml
kubectl get pods -A

预防措施

为避免类似问题再次发生，建议：

升级前确保所有节点有足够资源余量（CPU/内存/存储）
升级过程中保持网络稳定

监控关键组件状态：

watch kubectl get pods -n longhorn-system
watch kubectl get pods -n harvester-system

总结

Harvester作为基于Kubernetes的HCI解决方案，其升级过程涉及多个组件的协调。遇到升级卡滞时，节点重启是最直接有效的解决方案。建议用户在升级前做好资源规划，升级过程中保持耐心，必要时参考官方文档进行故障排查。

harvester

Open source hyperconverged infrastructure (HCI) software

项目地址：https://gitcode.com/gh_mirrors/ha/harvester

登录后查看全文

项目优选

收起

本项目是CANN提供的transformer类大模型算子库，实现网络在NPU上加速计算。

本项目是CANN提供的神经网络类计算算子库，实现网络在NPU上加速计算。

Ascend Extension for PyTorch

openEuler内核是openEuler操作系统的核心，既是系统性能与稳定性的基石，也是连接处理器、设备与服务的桥梁。

本项目是CANN提供的数学类基础计算算子库，实现网络在NPU上加速计算。

本仓库是 Flutter SDK 与 Flutter Engine 的 OpenHarmony 适配版本，由 CPF-Flutter 团队维护。开发者可使用熟悉的 Flutter 技术栈开发 OpenHarmony 应用，3.35.7 及以后的适配版本可基于本仓库源码构建支持 OpenHarmony 的 Flutter Engine。

Claude Code 的开源替代方案。连接任意大模型，编辑代码，运行命令，自动验证 — 全自动执行。用 Rust 构建，极致性能。｜ An open-source alternative to Claude Code. Connect any LLM, edit code, run commands, and verify changes — autonomously. Built in Rust for speed. Get Started

CANNBot 是面向 CANN 开发的用于提升开发效率的系列智能体，本仓库为其提供可复用的 Skills 模块。