Kubeflow Spark Operator v2.2.0 版本深度解析
Kubeflow Spark Operator 是一个 Kubernetes 原生工具,用于在 Kubernetes 集群上运行和管理 Apache Spark 应用程序。它通过自定义资源定义(CRD)扩展了 Kubernetes API,使得用户可以像管理其他 Kubernetes 资源一样管理 Spark 作业。最新发布的 v2.2.0 版本带来了多项重要更新和改进,本文将深入解析这些变化。
核心特性升级
Spark 3.5.5 支持
v2.2.0 版本将支持的 Spark 版本升级到了 3.5.5。这一升级意味着用户现在可以在 Kubernetes 上运行最新的 Spark 版本,获得性能改进、bug 修复和新功能。Spark 3.5 系列引入了多项优化,包括更好的 SQL 性能、增强的 Python 支持和改进的 Kubernetes 集成。
时区支持增强
对于 ScheduledSparkApplication(定时 Spark 应用),新版本增加了 timeZone 配置项。这一改进解决了跨时区调度作业的问题,使得用户可以根据业务需求精确控制作业的执行时间,特别是在全球分布式环境中运行时尤为重要。
内存限制覆盖机制
通过 webhook 添加了 MemoryLimit 的覆盖能力。这一功能增强了资源管理的灵活性,允许管理员在必要时覆盖用户设置的内存限制,确保集群资源的合理分配和使用,同时防止因配置不当导致的资源浪费或不足。
架构改进
动态分配增强
新增了 ShuffleTrackingEnabled 配置项到 DynamicAllocation 结构中。这一改进允许用户根据需要禁用 shuffle 跟踪功能,为特定场景下的性能调优提供了更多选择。动态分配是 Spark 的重要特性,能够根据负载自动调整执行器数量,提高资源利用率。
自定义提交机制
引入了 SparkApplicationSubmitter 接口,允许用户自定义提交机制。这一架构上的改进为高级用户提供了更大的灵活性,可以根据特定需求实现自己的提交逻辑,比如集成特定的安全机制或工作流引擎。
证书管理集成
新增了对 cert-manager 的支持,用于自动生成 webhook 证书。这一改进简化了安全配置流程,cert-manager 是 Kubernetes 上广泛使用的证书管理工具,能够自动处理证书的签发和续期,提高了部署的可靠性和安全性。
稳定性与安全性增强
Webhook 证书验证
修复了 webhook 证书的有效性检查问题。这一改进确保了 webhook 通信的安全性,防止使用过期或无效的证书,是保障集群安全运行的重要措施。
测试覆盖提升
版本中修复并添加了多项单元测试,特别是针对 Volcano 集成和驱动/执行器配置的测试。完善的测试覆盖是保证软件质量的关键,这些改进有助于提高系统的稳定性和可靠性。
向后兼容性考虑
v2.2.0 版本中移除了对 v1beta1 API 的支持,这是向更现代化架构演进的一部分。用户如果需要升级,应当确保他们的应用已经迁移到更新的 API 版本。同时,sparkctl 工具已被正式弃用并移除,用户应当使用 kubectl 或其他 Kubernetes 原生工具来管理 Spark 作业。
总结
Kubeflow Spark Operator v2.2.0 版本在功能、安全性和可用性方面都有显著提升。从支持最新 Spark 版本到增强的调度能力,从改进的资源管理到更灵活的自定义选项,这些变化使得在 Kubernetes 上运行 Spark 作业更加高效和可靠。对于正在使用或考虑使用 Spark Operator 的团队,这一版本值得认真评估和升级。
ERNIE-4.5-VL-28B-A3B-ThinkingERNIE-4.5-VL-28B-A3B-Thinking 是 ERNIE-4.5-VL-28B-A3B 架构的重大升级,通过中期大规模视觉-语言推理数据训练,显著提升了模型的表征能力和模态对齐,实现了多模态推理能力的突破性飞跃Python00
unified-cache-managementUnified Cache Manager(推理记忆数据管理器),是一款以KV Cache为中心的推理加速套件,其融合了多类型缓存加速算法工具,分级管理并持久化推理过程中产生的KV Cache记忆数据,扩大推理上下文窗口,以实现高吞吐、低时延的推理体验,降低每Token推理成本。Python03
Kimi-K2-ThinkingKimi K2 Thinking 是最新、性能最强的开源思维模型。从 Kimi K2 开始,我们将其打造为能够逐步推理并动态调用工具的思维智能体。通过显著提升多步推理深度,并在 200–300 次连续调用中保持稳定的工具使用能力,它在 Humanity's Last Exam (HLE)、BrowseComp 等基准测试中树立了新的技术标杆。同时,K2 Thinking 是原生 INT4 量化模型,具备 256k 上下文窗口,实现了推理延迟和 GPU 内存占用的无损降低。Python00
Spark-Prover-X1-7BSpark-Prover 是由科大讯飞团队开发的专用大型语言模型,专为 Lean4 中的自动定理证明而设计。该模型采用创新的三阶段训练策略,显著增强了形式化推理能力,在同等规模的开源模型中实现了最先进的性能。Python00
MiniCPM-V-4_5MiniCPM-V 4.5 是 MiniCPM-V 系列中最新且功能最强的模型。该模型基于 Qwen3-8B 和 SigLIP2-400M 构建,总参数量为 80 亿。与之前的 MiniCPM-V 和 MiniCPM-o 模型相比,它在性能上有显著提升,并引入了新的实用功能Python00
Spark-Formalizer-X1-7BSpark-Formalizer 是由科大讯飞团队开发的专用大型语言模型,专注于数学自动形式化任务。该模型擅长将自然语言数学问题转化为精确的 Lean4 形式化语句,在形式化语句生成方面达到了业界领先水平。Python00
GOT-OCR-2.0-hf阶跃星辰StepFun推出的GOT-OCR-2.0-hf是一款强大的多语言OCR开源模型,支持从普通文档到复杂场景的文字识别。它能精准处理表格、图表、数学公式、几何图形甚至乐谱等特殊内容,输出结果可通过第三方工具渲染成多种格式。模型支持1024×1024高分辨率输入,具备多页批量处理、动态分块识别和交互式区域选择等创新功能,用户可通过坐标或颜色指定识别区域。基于Apache 2.0协议开源,提供Hugging Face演示和完整代码,适用于学术研究到工业应用的广泛场景,为OCR领域带来突破性解决方案。00