Apache Arrow DataFusion 中 Parquet 数据剪枝对更多类型的支持
在 Apache Arrow DataFusion 项目中,Parquet 文件格式的数据剪枝(pruning)功能是一个重要的性能优化手段。它通过利用 Parquet 文件中的列统计信息(如最小值、最大值等)来跳过不相关的数据页或行组,从而减少 I/O 操作和提高查询性能。
目前 DataFusion 的剪枝功能主要支持整数类型等有限的数据类型,而对于浮点类型的支持存在一些限制。当用户使用浮点列进行过滤查询时,如果查询条件中包含浮点字面量(如 10.0),系统会自动将其视为双精度浮点数(Float64),这会导致浮点列被强制转换为双精度类型,从而无法利用现有的统计信息进行剪枝优化。
这个问题源于 DataFusion 物理优化器中的 verify_support_type_for_prune 函数,该函数目前只允许特定类型的转换组合。具体来说,当遇到浮点列与双精度字面量的比较时,系统会阻止使用统计信息进行剪枝。
解决方案可以从两个角度考虑:
-
扩展
verify_support_type_for_prune函数,使其支持更多数值类型之间的转换,特别是浮点类型。一个简单的改进是将检查条件放宽为"如果源类型和目标类型都是数值类型"。 -
在查询解析阶段,对浮点字面量进行更智能的类型推断,避免不必要的类型提升。例如,当浮点列与 10.0 比较时,可以尝试将字面量保持为单精度浮点数(Float32)而非默认的双精度。
值得注意的是,浮点数的剪枝还涉及到一些特殊值的处理,如 NaN(非数字)。根据 Parquet 格式规范,NaN 值的比较行为需要特别处理,这增加了实现的复杂性。在实际查询中,如果统计信息中包含 NaN 值,剪枝逻辑需要确保不会错误地排除有效数据。
这个优化对于数据分析工作负载尤为重要,因为许多科学计算和机器学习应用都广泛使用浮点数据类型。通过完善浮点类型的剪枝支持,可以显著提升这类查询的性能,特别是在处理大型 Parquet 数据集时。
随着 Apache Arrow 生态系统的不断发展,对 Parquet 格式的支持也在持续完善。这个问题的解决不仅会提升 DataFusion 的性能,也将增强其与其他大数据处理工具的互操作性。
kernelopenEuler内核是openEuler操作系统的核心,既是系统性能与稳定性的基石,也是连接处理器、设备与服务的桥梁。C064
MiniMax-M2.1从多语言软件开发自动化到复杂多步骤办公流程执行,MiniMax-M2.1 助力开发者构建下一代自主应用——全程保持完全透明、可控且易于获取。Python00
kylin-wayland-compositorkylin-wayland-compositor或kylin-wlcom(以下简称kywc)是一个基于wlroots编写的wayland合成器。 目前积极开发中,并作为默认显示服务器随openKylin系统发布。 该项目使用开源协议GPL-1.0-or-later,项目中来源于其他开源项目的文件或代码片段遵守原开源协议要求。C01
PaddleOCR-VLPaddleOCR-VL 是一款顶尖且资源高效的文档解析专用模型。其核心组件为 PaddleOCR-VL-0.9B,这是一款精简却功能强大的视觉语言模型(VLM)。该模型融合了 NaViT 风格的动态分辨率视觉编码器与 ERNIE-4.5-0.3B 语言模型,可实现精准的元素识别。Python00
GLM-4.7GLM-4.7上线并开源。新版本面向Coding场景强化了编码能力、长程任务规划与工具协同,并在多项主流公开基准测试中取得开源模型中的领先表现。 目前,GLM-4.7已通过BigModel.cn提供API,并在z.ai全栈开发模式中上线Skills模块,支持多模态任务的统一规划与协作。Jinja00
agent-studioopenJiuwen agent-studio提供零码、低码可视化开发和工作流编排,模型、知识库、插件等各资源管理能力TSX0130
Spark-Formalizer-X1-7BSpark-Formalizer 是由科大讯飞团队开发的专用大型语言模型,专注于数学自动形式化任务。该模型擅长将自然语言数学问题转化为精确的 Lean4 形式化语句,在形式化语句生成方面达到了业界领先水平。Python00