Harvester集群升级1.4.2至1.5.0版本实践经验分享

2025-06-14 15:23:45作者：殷蕙予

Harvester 是一个现代、开放、互操作的超融合基础设施（HCI）解决方案，基于 Kubernetes 构建。它为寻求云原生 HCI 解决方案的运营商提供了一个开源替代方案。Harvester 运行在裸金属服务器上，提供集成的虚拟化和分布式存储功能。除了传统的虚拟机（VM），Harvester 还通过与 Rancher 的集成支持容器化环境，统一了传统虚拟化基础设施，同时促进了从核心到边缘的容器采用。

项目地址：https://gitcode.com/gh_mirrors/har/harvester

升级背景与整体情况

在将Harvester集群从1.4.2版本升级至1.5.0版本的过程中，虽然整体升级流程相比之前版本有了显著改善，但仍遇到了一些值得注意的技术问题。本次升级涉及约60个虚拟机，整个升级过程耗时约4小时，相比以往24小时以上的升级时间有了大幅缩短。

主要技术问题与解决方案

PCI直通设备的虚拟机处理问题

在升级过程中，所有配置了PCI直通或特定节点调度的虚拟机都需要手动关闭。虽然理解这些虚拟机在节点处理时需要关闭，但从技术实现角度看，如果采用逐个节点升级的方式，这些虚拟机完全可以在节点处理完成后自动重启。

技术建议：升级控制器应该能够识别这类特殊配置的虚拟机，在节点升级完成后自动恢复其运行状态，而不是要求管理员预先关闭所有相关虚拟机。

虚拟机异常断电问题

升级过程中出现了约三分之二的虚拟机被异常强制断电的情况，而非正常关机。通过日志分析发现，这一问题可能与节点升级时kubelet重启有关。特别值得注意的是，某些节点由于之前进入过维护模式，可能导致升级流程判断异常，跳过了预排空(pre-drain)步骤。

技术建议：

升级前应确保所有节点都处于正常状态
加强对维护模式节点的状态检查
实现更可靠的预排空流程保证

Prometheus资源不足问题

升级期间Prometheus Pod频繁因OOM(内存不足)被终止。这是由于升级过程中系统活动激增，导致监控数据量大幅增加，超出了默认资源配置。

解决方案：临时调整Prometheus的内存预留配置可以缓解此问题。建议在升级前预先调整监控组件的资源配额。

Longhorn实例管理器阻塞问题

在升级第二和第三个节点时，遇到了Longhorn实例管理器阻塞升级流程的情况。这与已知的实例管理器锁定问题类似，需要手动终止特定的实例管理器进程才能继续升级。

技术建议：升级流程应该包含自动检测和处理这类阻塞情况的机制，或者实现实例管理器的自动恢复功能。

升级优化建议

虚拟机迁移策略优化：对于特殊配置的虚拟机，应该实现更智能的迁移和恢复策略，而非简单的关闭操作。
资源预配置机制：对于关键系统组件如Prometheus，升级流程应该自动调整其资源配置以适应升级期间的高负载。
状态检查与恢复：升级前应加强节点状态检查，特别是对曾经进入过维护模式的节点要特别处理。
阻塞问题自动处理：对于Longhorn等存储组件可能出现的阻塞情况，应该实现自动检测和恢复机制。

总结

Harvester 1.5.0的升级体验相比之前版本有了明显改善，特别是在迁移成功率方面。通过本文分享的技术问题和解决方案，管理员可以更好地准备和规划升级过程，避免常见陷阱。随着Harvester的持续发展，期待未来的版本能够进一步优化升级体验，特别是在自动化处理特殊场景方面。

harvester

项目地址：https://gitcode.com/gh_mirrors/har/harvester

登录后查看全文

项目优选

收起

kernel

deepin linux kernel

docs

OpenHarmony documentation | OpenHarmony开发者文档

🔥LeetCode solutions in any programming language | 多种编程语言实现 LeetCode、《剑指 Offer（第 2 版）》、《程序员面试金典（第 6 版）》题解

Java

nop-entropy

Nop Platform 2.0是基于可逆计算理论实现的采用面向语言编程范式的新一代低代码开发平台，包含基于全新原理从零开始研发的GraphQL引擎、ORM引擎、工作流引擎、报表引擎、规则引擎、批处理引引擎等完整设计。nop-entropy是它的后端部分，采用java语言实现，可选择集成Spring框架或者Quarkus框架。中小企业可以免费商用

🎉 (RuoYi)官方仓库基于SpringBoot，Spring Security，JWT，Vue3 & Vite、Element Plus 的前后端分离权限管理系统

喝着茶写代码！最易用的自托管一站式代码托管平台，包含Git托管，代码审查，团队协作，软件包和CI/CD。

kernel

openEuler内核是openEuler操作系统的核心，既是系统性能与稳定性的基石，也是连接处理器、设备与服务的桥梁。

350

203

pytorch

Ascend Extension for PyTorch

无需学习 Kubernetes 的容器平台，在 Kubernetes 上构建、部署、组装和管理应用，无需 K8s 专业知识，全流程图形化管理

Harvester集群升级1.4.2至1.5.0版本实践经验分享

升级背景与整体情况

主要技术问题与解决方案

PCI直通设备的虚拟机处理问题

虚拟机异常断电问题

Prometheus资源不足问题

Longhorn实例管理器阻塞问题

升级优化建议

总结

热门内容推荐

最新内容推荐

项目优选

Harvester集群升级1.4.2至1.5.0版本实践经验分享

升级背景与整体情况

主要技术问题与解决方案

PCI直通设备的虚拟机处理问题

虚拟机异常断电问题

Prometheus资源不足问题

Longhorn实例管理器阻塞问题

升级优化建议

总结

相关内容推荐

热门内容推荐

最新内容推荐

项目优选