Kubernetes Kueue与LeaderWorkerSet集成中的Webhook证书冲突问题分析
问题背景
在Kubernetes生态系统中,Kueue作为一个作业队列管理系统,与LeaderWorkerSet(LWS)工作负载控制器集成时,用户报告了一个关于Webhook证书验证的异常问题。具体表现为当同时部署这两个组件时,系统间歇性出现TLS证书验证失败的错误,提示证书主体名称不匹配。
问题现象
用户在部署环境中观察到以下典型错误信息:
failed calling webhook "vleaderworkerset.kb.io": failed to call webhook: Post "https://lws-webhook-service.namespace.svc:443/validate-leaderworkerset-x-k8s-io-v1-leaderworkerset?timeout=10s": tls: failed to verify certificate: x509: certificate is valid for kueue-webhook-service.namespace.svc, not lws-webhook-service.namespace.svc
该问题表现出明显的间歇性特征,有时操作能成功执行,有时则会失败。这种不稳定性使得问题更加难以排查和定位。
根本原因分析
经过深入调查,发现问题源于Kubernetes服务选择器的配置不当。具体来说:
-
服务选择器过于宽泛:LeaderWorkerSet的Webhook服务(lws-webhook-service)仅使用了
control-plane=controller-manager作为选择器,而没有包含更具体的标签匹配条件。 -
命名空间共享:当Kueue和LWS部署在同一命名空间时,宽泛的选择器会导致服务端点(Endpoint)同时包含两个控制器的Pod实例。
-
证书不匹配:当API服务器尝试调用LWS的Webhook时,负载均衡可能将请求路由到Kueue的Pod实例,而该实例提供的证书是针对kueue-webhook-service签发的,自然无法验证lws-webhook-service的域名。
解决方案
针对这一问题,社区提出了以下解决方案:
-
完善服务选择器:LeaderWorkerSet应该效仿Kueue的做法,在服务选择器中加入应用特定的标签,例如:
selector: app.kubernetes.io/instance: lws app.kubernetes.io/name: lws control-plane: controller-manager -
命名空间隔离:虽然技术上支持共享命名空间,但在实际部署中,建议将不同的控制器部署到独立的命名空间中,这是一种更为清晰和安全的做法。
-
证书管理优化:对于使用内部证书管理的场景,确保每个Webhook服务都有独立的CA和证书配置,避免任何可能的交叉污染。
经验总结
这个案例为我们提供了几个重要的实践经验:
-
Kubernetes服务选择器的设计需要足够精确,特别是在共享命名空间的场景下,避免因选择器过于宽泛而导致的服务端点混淆。
-
Webhook证书管理是Kubernetes扩展开发中的关键环节,必须确保每个Webhook服务都有正确的SAN(Subject Alternative Name)配置和独立的证书链。
-
集成测试应该覆盖组件共存的场景,特别是当多个第三方组件需要协同工作时,需要验证它们在共享命名空间下的兼容性。
-
错误排查时,检查服务端点(Endpoint)资源是一个快速定位服务选择问题的有效方法。
通过这个案例,我们不仅解决了一个具体的技术问题,更重要的是加深了对Kubernetes服务发现和Webhook机制的理解,为今后开发更健壮的Kubernetes扩展组件积累了宝贵经验。
kernelopenEuler内核是openEuler操作系统的核心,既是系统性能与稳定性的基石,也是连接处理器、设备与服务的桥梁。C041
MiniMax-M2.1从多语言软件开发自动化到复杂多步骤办公流程执行,MiniMax-M2.1 助力开发者构建下一代自主应用——全程保持完全透明、可控且易于获取。Python00
kylin-wayland-compositorkylin-wayland-compositor或kylin-wlcom(以下简称kywc)是一个基于wlroots编写的wayland合成器。 目前积极开发中,并作为默认显示服务器随openKylin系统发布。 该项目使用开源协议GPL-1.0-or-later,项目中来源于其他开源项目的文件或代码片段遵守原开源协议要求。C01
PaddleOCR-VLPaddleOCR-VL 是一款顶尖且资源高效的文档解析专用模型。其核心组件为 PaddleOCR-VL-0.9B,这是一款精简却功能强大的视觉语言模型(VLM)。该模型融合了 NaViT 风格的动态分辨率视觉编码器与 ERNIE-4.5-0.3B 语言模型,可实现精准的元素识别。Python00
GLM-4.7GLM-4.7上线并开源。新版本面向Coding场景强化了编码能力、长程任务规划与工具协同,并在多项主流公开基准测试中取得开源模型中的领先表现。 目前,GLM-4.7已通过BigModel.cn提供API,并在z.ai全栈开发模式中上线Skills模块,支持多模态任务的统一规划与协作。Jinja00
agent-studioopenJiuwen agent-studio提供零码、低码可视化开发和工作流编排,模型、知识库、插件等各资源管理能力TSX0121
Spark-Formalizer-X1-7BSpark-Formalizer 是由科大讯飞团队开发的专用大型语言模型,专注于数学自动形式化任务。该模型擅长将自然语言数学问题转化为精确的 Lean4 形式化语句,在形式化语句生成方面达到了业界领先水平。Python00