Apache Kyuubi 中 Spark History Server 显示不完整应用时的类型转换问题分析
问题背景
在 Apache Kyuubi 项目中,当用户通过 Spark History Server 查看不完整的应用程序时,会遇到一个类型转换异常。具体表现为访问 Kyuubi 查询引擎 UI 时出现 HTTP 500 错误,错误信息显示无法将 java.lang.Integer 转换为 java.lang.Long。
错误现象
用户在使用 Spark 3.3.2 版本时,通过 ApplicationMaster 直接访问 Kyuubi Query Engine 页面可以正常显示,但当通过 Spark History Server 查看"不完整应用"中的 Kyuubi Query Engine 时,会出现以下错误:
HTTP ERROR 500 java.lang.ClassCastException: java.lang.Integer cannot be cast to java.lang.Long
堆栈跟踪显示错误发生在 Spark UI 的 StatementStatsPagedTable.row 方法中,具体是在处理 EnginePage 相关数据时发生的类型转换问题。
问题根源
经过分析,这个问题与 Jackson 库在处理 Scala 类型时的行为有关。具体来说,当 Jackson 反序列化某些数值类型时,可能会将原本应为 Long 类型的值反序列化为 Integer 类型,从而导致后续的类型转换失败。
这个问题类似于 Jackson 模块中已知的一个问题,即在处理 Scala 集合和数值类型时可能出现的类型不匹配情况。
解决方案
针对这个问题,社区提出了两种解决方案:
- 直接修改相关字段的类型定义,确保类型一致性
- 使用 Jackson 的 @JsonDeserialize 注解显式指定反序列化类型
最终采用了第二种更为优雅的解决方案,即在 operationRunTime 和 operationCpuTime 字段上添加注解:
@JsonDeserialize(contentAs = classOf[java.lang.Long])
这个注解明确告诉 Jackson 在反序列化时将内容转换为 java.lang.Long 类型,从而避免了后续的类型转换异常。
技术意义
这个修复不仅解决了眼前的问题,还具有以下技术意义:
- 增强了 Kyuubi 与 Spark History Server 的兼容性
- 提供了更健壮的类型处理机制
- 为类似的数据类型转换问题提供了参考解决方案
总结
在分布式系统和大数据处理框架中,类型系统的正确处理至关重要。Apache Kyuubi 作为 Spark SQL 的接口服务,需要确保在各种环境下都能正确处理数据类型。这次问题的解决展示了开源社区如何通过协作快速定位和修复复杂系统中的类型相关问题,提高了系统的稳定性和可靠性。
ERNIE-4.5-VL-28B-A3B-ThinkingERNIE-4.5-VL-28B-A3B-Thinking 是 ERNIE-4.5-VL-28B-A3B 架构的重大升级,通过中期大规模视觉-语言推理数据训练,显著提升了模型的表征能力和模态对齐,实现了多模态推理能力的突破性飞跃Python00
Kimi-K2-ThinkingKimi K2 Thinking 是最新、性能最强的开源思维模型。从 Kimi K2 开始,我们将其打造为能够逐步推理并动态调用工具的思维智能体。通过显著提升多步推理深度,并在 200–300 次连续调用中保持稳定的工具使用能力,它在 Humanity's Last Exam (HLE)、BrowseComp 等基准测试中树立了新的技术标杆。同时,K2 Thinking 是原生 INT4 量化模型,具备 256k 上下文窗口,实现了推理延迟和 GPU 内存占用的无损降低。Python00
MiniMax-M2MiniMax-M2是MiniMaxAI开源的高效MoE模型,2300亿总参数中仅激活100亿,却在编码和智能体任务上表现卓越。它支持多文件编辑、终端操作和复杂工具链调用Python00
HunyuanVideo-1.5暂无简介00
MiniCPM-V-4_5MiniCPM-V 4.5 是 MiniCPM-V 系列中最新且功能最强的模型。该模型基于 Qwen3-8B 和 SigLIP2-400M 构建,总参数量为 80 亿。与之前的 MiniCPM-V 和 MiniCPM-o 模型相比,它在性能上有显著提升,并引入了新的实用功能Python00
Spark-Formalizer-X1-7BSpark-Formalizer 是由科大讯飞团队开发的专用大型语言模型,专注于数学自动形式化任务。该模型擅长将自然语言数学问题转化为精确的 Lean4 形式化语句,在形式化语句生成方面达到了业界领先水平。Python00
GOT-OCR-2.0-hf阶跃星辰StepFun推出的GOT-OCR-2.0-hf是一款强大的多语言OCR开源模型,支持从普通文档到复杂场景的文字识别。它能精准处理表格、图表、数学公式、几何图形甚至乐谱等特殊内容,输出结果可通过第三方工具渲染成多种格式。模型支持1024×1024高分辨率输入,具备多页批量处理、动态分块识别和交互式区域选择等创新功能,用户可通过坐标或颜色指定识别区域。基于Apache 2.0协议开源,提供Hugging Face演示和完整代码,适用于学术研究到工业应用的广泛场景,为OCR领域带来突破性解决方案。00