首页
/ KubeRay v1.4.0 版本深度解析:Kubernetes 上的 Ray 集群管理新体验

KubeRay v1.4.0 版本深度解析:Kubernetes 上的 Ray 集群管理新体验

2025-06-27 17:25:00作者:毕习沙Eudora

KubeRay 是一个专为 Kubernetes 设计的开源项目,它提供了在 Kubernetes 上部署和管理 Ray 集群的能力。Ray 是一个流行的分布式计算框架,广泛应用于机器学习和大规模数据处理场景。KubeRay 作为连接 Ray 和 Kubernetes 的桥梁,极大地简化了分布式计算任务在云原生环境中的部署和管理流程。

核心功能增强

1. Kubectl 插件全面升级

KubeRay v1.4.0 对 Kubectl 插件进行了重大改进,新增了多项实用功能:

  • 集群伸缩能力:新增 scale 命令,允许用户直接调整 RayCluster 中工作节点组的规模,无需手动修改 YAML 文件
  • 资源查看增强:扩展 get 命令功能,支持列出 Ray 节点和工作节点组信息
  • 集群创建优化create 命令现在支持从配置文件创建集群,并允许覆盖默认值,新增支持字段包括:
    • Kubernetes 标签和注解
    • 节点选择器
    • 临时存储配置
    • Ray 启动参数
    • TPU 支持
    • 自动伸缩器版本配置

这些改进使得通过命令行管理 Ray 集群变得更加灵活和高效。

2. KubeRay 仪表盘(Alpha 版本)

v1.4.0 引入了全新的开源仪表盘 UI,虽然目前仍处于实验阶段,但已经提供了集中查看和管理 KubeRay 资源的能力。与 Ray 自带的仪表盘不同,KubeRay 仪表盘提供了集群级别的全局视图,可以同时监控多个 KubeRay 资源的状态。

3. 调度器插件集成

新版本集成了 Kubernetes 社区的 scheduler-plugins 项目,为 RayCluster 资源提供了 Gang Scheduling(组调度)支持。这种调度方式特别适合需要同时启动多个相关任务的场景,确保所有相关任务要么全部成功调度,要么都不调度。

4. API Server V2(Alpha 版本)

全新的 API Server v2 提供了兼容 Kubernetes API 的 HTTP 代理接口,允许用户使用标准的 Kubernetes 客户端工具管理 Ray 资源。主要特点包括:

  • 完全兼容 Kubernetes OpenAPI 规范和 CRD
  • 可作为 Go 库使用,支持通过可插拔的 HTTP 中间件构建自定义代理

重要变更与兼容性说明

1. Bash Shell 行为变更

从 v1.4.0 开始,KubeRay 默认使用非登录 Bash Shell 执行命令,这与之前版本的登录 Shell 行为不同。虽然提供了 ENABLE_LOGIN_SHELL 环境变量作为临时回退方案,但长期建议用户适应新的默认行为。

2. 资源名称规范

新版本加强了对资源名称长度的验证,不再自动截断超长名称,而是会生成无效规范事件。同时,对一些资源名称后缀进行了简化:

  • RayCluster 的无头服务后缀从 headless-worker-svc 缩短为 headless
  • RayCluster 名称后缀从 -raycluster-xxxxx 简化为 -xxxxx
  • 头部 Pod 名称后缀从 -head-xxxxx 简化为 -head

3. 自动伸缩器 v2 配置变更

自动伸缩器 v2 的配置方式更新为通过 spec.autoscalerOptions.version 字段指定,不再推荐使用 RAY_enable_autoscaler_v2 环境变量。

监控与指标增强

KubeRay v1.4.0 引入了服务级别指标(SLI),帮助用户更好地监控 KubeRay 资源的状态和性能。这些指标包括:

  • 集群准备就绪时间
  • 服务条件状态
  • 任务执行时长
  • 集群信息
  • 任务部署状态

这些指标为运维团队提供了更全面的视角,有助于及时发现和解决潜在问题。

技术实现亮点

1. 多架构支持

KubeRay 提供了对多种 CPU 架构的原生支持,包括 AMD64 和 ARM64,确保在不同硬件平台上都能稳定运行。

2. 测试覆盖增强

新版本大幅增加了测试覆盖率,特别是针对自动伸缩功能和 API Server 的测试,提高了系统的稳定性和可靠性。

3. 开发者体验优化

项目改进了开发文档和构建流程,使开发者能够更轻松地参与贡献。同时引入了更严格的代码质量检查,包括 Markdown 文档格式规范和 Go 代码测试规范。

总结

KubeRay v1.4.0 通过引入仪表盘、增强命令行工具、改进调度能力和监控指标,显著提升了在 Kubernetes 上管理 Ray 集群的体验。虽然部分新功能仍处于 Alpha 阶段,但已经展现出强大的潜力。对于需要在云原生环境中运行分布式计算任务的团队,升级到 v1.4.0 将获得更强大、更易用的管理能力。

随着项目的持续发展,KubeRay 正在成为连接 Kubernetes 和分布式计算框架的重要桥梁,为机器学习和大数据处理工作负载提供坚实的云原生基础。

登录后查看全文
热门项目推荐

热门内容推荐

最新内容推荐

项目优选

收起
kernelkernel
deepin linux kernel
C
22
6
ohos_react_nativeohos_react_native
React Native鸿蒙化仓库
C++
192
270
RuoYi-Vue3RuoYi-Vue3
🎉 (RuoYi)官方仓库 基于SpringBoot,Spring Security,JWT,Vue3 & Vite、Element Plus 的前后端分离权限管理系统
Vue
909
541
Cangjie-ExamplesCangjie-Examples
本仓将收集和展示高质量的仓颉示例代码,欢迎大家投稿,让全世界看到您的妙趣设计,也让更多人通过您的编码理解和喜爱仓颉语言。
Cangjie
341
1.21 K
openGauss-serveropenGauss-server
openGauss kernel ~ openGauss is an open source relational database management system
C++
142
188
nop-entropynop-entropy
Nop Platform 2.0是基于可逆计算理论实现的采用面向语言编程范式的新一代低代码开发平台,包含基于全新原理从零开始研发的GraphQL引擎、ORM引擎、工作流引擎、报表引擎、规则引擎、批处理引引擎等完整设计。nop-entropy是它的后端部分,采用java语言实现,可选择集成Spring框架或者Quarkus框架。中小企业可以免费商用
Java
8
0
openHiTLSopenHiTLS
旨在打造算法先进、性能卓越、高效敏捷、安全可靠的密码套件,通过轻量级、可剪裁的软件技术架构满足各行业不同场景的多样化要求,让密码技术应用更简单,同时探索后量子等先进算法创新实践,构建密码前沿技术底座!
C
377
387
金融AI编程实战金融AI编程实战
为非计算机科班出身 (例如财经类高校金融学院) 同学量身定制,新手友好,让学生以亲身实践开源开发的方式,学会使用计算机自动化自己的科研/创新工作。案例以量化投资为主线,涉及 Bash、Python、SQL、BI、AI 等全技术栈,培养面向未来的数智化人才 (如数据工程师、数据分析师、数据科学家、数据决策者、量化投资人)。
Jupyter Notebook
63
58
CangjieCommunityCangjieCommunity
为仓颉编程语言开发者打造活跃、开放、高质量的社区环境
Markdown
1.1 K
0
note-gennote-gen
一款跨平台的 Markdown AI 笔记软件,致力于使用 AI 建立记录和写作的桥梁。
TSX
87
4