Apache DataFusion 中 APPROX_PERCENTILE_CONT 函数语法变更解析

2025-06-14 08:56:34作者：郦嵘贵Just

arrow-datafusion

Apache Arrow DataFusion SQL Query Engine

项目地址：https://gitcode.com/gh_mirrors/arr/arrow-datafusion

Apache DataFusion 是一个高性能的查询引擎，近期在其最新版本中对 APPROX_PERCENTILE_CONT 聚合函数的使用语法进行了重要变更。这一变更影响了 ClickBench 基准测试中的扩展查询，特别是查询 Q5 的执行。

语法变更背景

在 DataFusion 47.0.0 版本中，APPROX_PERCENTILE_CONT 函数的调用方式从简单的双参数形式变更为符合 SQL 标准的 WITHIN GROUP 语法结构。这一变更使得 DataFusion 的语法更加贴近 PostgreSQL 等主流数据库系统。

旧语法形式：

APPROX_PERCENTILE_CONT(column, percentile)

新语法形式：

APPROX_PERCENTILE_CONT(percentile) WITHIN GROUP (ORDER BY column)

影响分析

这一语法变更主要影响了以下场景：

使用旧语法编写的现有查询
基准测试套件中的特定查询
依赖于 DataFusion 早期版本的应用

在 ClickBench 基准测试的扩展查询中，Q5 查询使用了旧语法形式，导致在最新版本中执行失败，报错信息明确指出需要 WITHIN GROUP 子句。

解决方案

对于受影响的查询，需要进行相应的语法调整。以 ClickBench Q5 查询为例，修正后的语法应为：

SELECT "ClientIP", "WatchID", COUNT(*) c, 
       MIN("ResponseStartTiming") tmin, 
       APPROX_PERCENTILE_CONT(0.95) WITHIN GROUP (ORDER BY "ResponseStartTiming") tp95,
       MAX("ResponseStartTiming") tmax
FROM 'hits.parquet'
WHERE "JavaEnable" = 0
GROUP BY "ClientIP", "WatchID"
HAVING c > 1
ORDER BY tp95 DESC
LIMIT 10;

技术原理

APPROX_PERCENTILE_CONT 是一种有序集聚合函数(Ordered-Set Aggregate Function)，它需要明确知道如何对数据进行排序才能计算百分位数。WITHIN GROUP 子句正是用来指定这种排序方式的。

这种语法结构在 SQL 标准中定义，被 PostgreSQL、Oracle 等数据库广泛采用。DataFusion 的这次变更使其行为更加标准化，提高了与其他系统的兼容性。

迁移建议

对于需要从旧版本迁移的用户，建议：

检查所有使用 APPROX_PERCENTILE_CONT 的查询
按照新语法进行修改
更新相关文档和测试用例
考虑在应用层添加版本检测逻辑，以处理不同版本的语法差异

这一变更虽然带来了短期的适配工作，但从长远看提高了 DataFusion 的标准化程度和与其他系统的互操作性，是项目成熟度提升的表现。

arrow-datafusion

Apache Arrow DataFusion SQL Query Engine

项目地址：https://gitcode.com/gh_mirrors/arr/arrow-datafusion

登录后查看全文

项目优选

收起

deepin linux kernel

OpenHarmony documentation | OpenHarmony开发者文档

Ascend Extension for PyTorch

本项目是CANN提供的数学类基础计算算子库，实现网络在NPU上加速计算。

openEuler内核是openEuler操作系统的核心，既是系统性能与稳定性的基石，也是连接处理器、设备与服务的桥梁。

openJiuwen agent-studio提供零码、低码可视化开发和工作流编排，模型、知识库、插件等各资源管理能力

openGauss-server

openGauss kernel ~ openGauss is an open source relational database management system

flutter_flutter

🎉 (RuoYi)官方仓库基于SpringBoot，Spring Security，JWT，Vue3 & Vite、Element Plus 的前后端分离权限管理系统

华为昇腾面向大规模分布式训练的多模态大模型套件，支撑多模态生成、多模态理解。