Apache DataFusion 中 APPROX_PERCENTILE_CONT 函数语法变更解析
2025-06-14 08:56:34作者:郦嵘贵Just
Apache DataFusion 是一个高性能的查询引擎,近期在其最新版本中对 APPROX_PERCENTILE_CONT 聚合函数的使用语法进行了重要变更。这一变更影响了 ClickBench 基准测试中的扩展查询,特别是查询 Q5 的执行。
语法变更背景
在 DataFusion 47.0.0 版本中,APPROX_PERCENTILE_CONT 函数的调用方式从简单的双参数形式变更为符合 SQL 标准的 WITHIN GROUP 语法结构。这一变更使得 DataFusion 的语法更加贴近 PostgreSQL 等主流数据库系统。
旧语法形式:
APPROX_PERCENTILE_CONT(column, percentile)
新语法形式:
APPROX_PERCENTILE_CONT(percentile) WITHIN GROUP (ORDER BY column)
影响分析
这一语法变更主要影响了以下场景:
- 使用旧语法编写的现有查询
- 基准测试套件中的特定查询
- 依赖于 DataFusion 早期版本的应用
在 ClickBench 基准测试的扩展查询中,Q5 查询使用了旧语法形式,导致在最新版本中执行失败,报错信息明确指出需要 WITHIN GROUP 子句。
解决方案
对于受影响的查询,需要进行相应的语法调整。以 ClickBench Q5 查询为例,修正后的语法应为:
SELECT "ClientIP", "WatchID", COUNT(*) c,
MIN("ResponseStartTiming") tmin,
APPROX_PERCENTILE_CONT(0.95) WITHIN GROUP (ORDER BY "ResponseStartTiming") tp95,
MAX("ResponseStartTiming") tmax
FROM 'hits.parquet'
WHERE "JavaEnable" = 0
GROUP BY "ClientIP", "WatchID"
HAVING c > 1
ORDER BY tp95 DESC
LIMIT 10;
技术原理
APPROX_PERCENTILE_CONT 是一种有序集聚合函数(Ordered-Set Aggregate Function),它需要明确知道如何对数据进行排序才能计算百分位数。WITHIN GROUP 子句正是用来指定这种排序方式的。
这种语法结构在 SQL 标准中定义,被 PostgreSQL、Oracle 等数据库广泛采用。DataFusion 的这次变更使其行为更加标准化,提高了与其他系统的兼容性。
迁移建议
对于需要从旧版本迁移的用户,建议:
- 检查所有使用 APPROX_PERCENTILE_CONT 的查询
- 按照新语法进行修改
- 更新相关文档和测试用例
- 考虑在应用层添加版本检测逻辑,以处理不同版本的语法差异
这一变更虽然带来了短期的适配工作,但从长远看提高了 DataFusion 的标准化程度和与其他系统的互操作性,是项目成熟度提升的表现。
登录后查看全文
热门项目推荐
相关项目推荐
GLM-5智谱 AI 正式发布 GLM-5,旨在应对复杂系统工程和长时域智能体任务。Jinja00
GLM-5.1GLM-5.1是智谱迄今最智能的旗舰模型,也是目前全球最强的开源模型。GLM-5.1大大提高了代码能力,在完成长程任务方面提升尤为显著。和此前分钟级交互的模型不同,它能够在一次任务中独立、持续工作超过8小时,期间自主规划、执行、自我进化,最终交付完整的工程级成果。Jinja00
LongCat-AudioDiT-1BLongCat-AudioDiT 是一款基于扩散模型的文本转语音(TTS)模型,代表了当前该领域的最高水平(SOTA),它直接在波形潜空间中进行操作。00- QQwen3.5-397B-A17BQwen3.5 实现了重大飞跃,整合了多模态学习、架构效率、强化学习规模以及全球可访问性等方面的突破性进展,旨在为开发者和企业赋予前所未有的能力与效率。Jinja00
HY-Embodied-0.5这是一套专为现实世界具身智能打造的基础模型。该系列模型采用创新的混合Transformer(Mixture-of-Transformers, MoT) 架构,通过潜在令牌实现模态特异性计算,显著提升了细粒度感知能力。Jinja00
FreeSql功能强大的对象关系映射(O/RM)组件,支持 .NET Core 2.1+、.NET Framework 4.0+、Xamarin 以及 AOT。C#00
热门内容推荐
最新内容推荐
项目优选
收起
deepin linux kernel
C
27
14
OpenHarmony documentation | OpenHarmony开发者文档
Dockerfile
658
4.26 K
Ascend Extension for PyTorch
Python
502
606
本项目是CANN提供的数学类基础计算算子库,实现网络在NPU上加速计算。
C++
939
862
Oohos_react_native
React Native鸿蒙化仓库
JavaScript
334
378
openEuler内核是openEuler操作系统的核心,既是系统性能与稳定性的基石,也是连接处理器、设备与服务的桥梁。
C
390
284
AscendNPU-IR是基于MLIR(Multi-Level Intermediate Representation)构建的,面向昇腾亲和算子编译时使用的中间表示,提供昇腾完备表达能力,通过编译优化提升昇腾AI处理器计算效率,支持通过生态框架使能昇腾AI处理器与深度调优
C++
123
195
openGauss kernel ~ openGauss is an open source relational database management system
C++
180
258
🎉 (RuoYi)官方仓库 基于SpringBoot,Spring Security,JWT,Vue3 & Vite、Element Plus 的前后端分离权限管理系统
Vue
1.54 K
892
昇腾LLM分布式训练框架
Python
142
168