Apache Arrow-Ballista项目中TPC-H查询失败问题分析与解决
Apache Arrow-Ballista项目是一个分布式查询引擎,近期在其主分支上出现了TPC-H基准测试查询失败的问题。本文将深入分析该问题的根源,并探讨解决方案。
问题现象
在分布式模式下运行TPC-H查询时,部分查询成功执行,而另一部分则失败。具体表现为:
- 成功的查询:q1、q3、q4、q5、q6、q11、q12、q13、q16、q17、q19、q20、q21
- 失败的查询:q2、q7、q8、q9、q10、q14、q15、q18、q22
失败查询报错信息显示列引用问题,例如查询q2报错:"PhysicalExpr Column references column 's_acctbal' at index 9 (zero-based) but input schema only has 9 columns"。
问题根源
经过技术分析,发现该问题与DataFusion版本升级有关:
- 在DataFusion 35.0.0版本中,查询能够正常执行
- 升级到DataFusion 39.0.0版本后,问题开始出现
深入调查发现,问题源于DataFusion中的一个优化规则变更,特别是与JoinSelection规则相关。该规则在创建执行阶段时尚未完全支持投影操作,导致列引用出现偏差。
解决方案
针对这一问题,社区提出了两种解决方案:
-
移除特定优化:在execution_stage.rs文件中,注释掉可能导致问题的优化代码行。这一改动直接解决了列引用不匹配的问题。
-
注册缺失函数:部分查询失败还因为缺少必要的标量函数注册。需要在execution_loop.rs中补充注册date_part和substr等函数,确保查询执行时能够找到这些函数实现。
技术启示
这一问题的解决过程为我们提供了几个重要启示:
-
版本升级需谨慎:即使是小版本号的升级,也可能引入不兼容的变更,特别是在分布式查询引擎这类复杂系统中。
-
优化规则的边界条件:查询优化规则在提高性能的同时,必须考虑所有可能的边界条件,特别是涉及分布式执行计划时。
-
测试覆盖的重要性:TPC-H基准测试作为标准测试套件,能够有效发现这类执行计划问题,强调了全面测试的必要性。
通过解决这一问题,Arrow-Ballista项目在分布式查询处理方面又向前迈进了一步,为后续版本的功能完善和性能优化奠定了基础。
Kimi-K2.5Kimi K2.5 是一款开源的原生多模态智能体模型,它在 Kimi-K2-Base 的基础上,通过对约 15 万亿混合视觉和文本 tokens 进行持续预训练构建而成。该模型将视觉与语言理解、高级智能体能力、即时模式与思考模式,以及对话式与智能体范式无缝融合。Python00
GLM-4.7-FlashGLM-4.7-Flash 是一款 30B-A3B MoE 模型。作为 30B 级别中的佼佼者,GLM-4.7-Flash 为追求性能与效率平衡的轻量化部署提供了全新选择。Jinja00
new-apiAI模型聚合管理中转分发系统,一个应用管理您的所有AI模型,支持将多种大模型转为统一格式调用,支持OpenAI、Claude、Gemini等格式,可供个人或者企业内部管理与分发渠道使用。🍥 A Unified AI Model Management & Distribution System. Aggregate all your LLMs into one app and access them via an OpenAI-compatible API, with native support for Claude (Messages) and Gemini formats.JavaScript01
idea-claude-code-gui一个功能强大的 IntelliJ IDEA 插件,为开发者提供 Claude Code 和 OpenAI Codex 双 AI 工具的可视化操作界面,让 AI 辅助编程变得更加高效和直观。Java01
KuiklyUI基于KMP技术的高性能、全平台开发框架,具备统一代码库、极致易用性和动态灵活性。 Provide a high-performance, full-platform development framework with unified codebase, ultimate ease of use, and dynamic flexibility.Kotlin07
compass-metrics-modelMetrics model project for the OSS CompassPython00