PrestoDB中TPCH连接器数据生成差异问题分析
问题背景
在PrestoDB项目中,TPCH连接器用于生成标准测试数据集。近期发现,当使用Java实现的TPCH连接器与Prestissimo(基于Velox的C++实现)时,对于lineitem表中的l_quantity字段,两者生成了不同的结果值。
问题现象
通过执行相同的SQL查询语句,对比Java实现和Prestissimo实现的结果:
select l_quantity, l_orderkey from tpch.sf1.lineitem where l_orderkey = 321030;
Java实现返回的结果中,l_quantity值为小数形式(如0.04、0.17等),而Prestissimo返回的结果中,l_quantity值被放大100倍(如4.0、17.0等)。这种差异会导致基于TPCH数据集的测试结果不一致。
问题根源分析
经过深入调查,发现问题主要出在数据生成环节:
-
数据类型处理差异:Velox的TPCH数据生成代码中,decimalToDouble函数在处理小数转换时存在逻辑问题,导致数值被错误放大。
-
规范符合性问题:根据TPCH规范,l_quantity等字段本应使用Decimal类型,但Presto实现中使用了Double类型,这在一定程度上导致了类型转换问题。
-
数据生成工具差异:Presto Java实现的数据生成逻辑与Velox(基于DuckDB的dbgen工具)存在不一致,特别是在Varchar类型字段(如各种comment字段)的处理上。
解决方案
针对l_quantity字段的差异问题,社区已经提出了修复方案:
-
修改Velox中的decimalToDouble函数实现,确保生成与Java实现一致的小数值。
-
对于其他数据类型问题,特别是Varchar字段的差异,将在后续单独处理。
扩展影响
这个问题不仅影响l_quantity字段,还反映出TPCH连接器实现中的几个深层次问题:
-
测试数据集一致性:不同实现生成的数据不一致会影响测试结果的可比性。
-
类型系统设计:理想情况下应遵循TPCH规范使用Decimal类型,但需要考虑向后兼容性。
-
小规模数据集支持:对于tiny scale factor的支持,不同实现间也存在差异。
最佳实践建议
对于PrestoDB用户和开发者,建议:
-
在比较不同实现(Java vs Prestissimo)的性能测试结果时,注意验证数据一致性。
-
对于依赖精确数值的测试场景,建议明确指定使用哪种TPCH连接器实现。
-
关注后续对TPCH连接器的改进,特别是对Decimal类型的支持进展。
这个问题展示了在分布式查询引擎开发中,保持测试数据集一致性的重要性,也为未来改进数据生成工具提供了方向。
- QQwen3-Next-80B-A3B-InstructQwen3-Next-80B-A3B-Instruct 是一款支持超长上下文(最高 256K tokens)、具备高效推理与卓越性能的指令微调大模型00
- QQwen3-Next-80B-A3B-ThinkingQwen3-Next-80B-A3B-Thinking 在复杂推理和强化学习任务中超越 30B–32B 同类模型,并在多项基准测试中优于 Gemini-2.5-Flash-Thinking00
GitCode-文心大模型-智源研究院AI应用开发大赛
GitCode&文心大模型&智源研究院强强联合,发起的AI应用开发大赛;总奖池8W,单人最高可得价值3W奖励。快来参加吧~0118DuiLib_Ultimate
DuiLib_Ultimate是duilib库的增强拓展版,库修复了大量用户在开发使用中反馈的Bug,新增了更加贴近产品开发需求的功能,并持续维护更新。C++03GitCode百大开源项目
GitCode百大计划旨在表彰GitCode平台上积极推动项目社区化,拥有广泛影响力的G-Star项目,入选项目不仅代表了GitCode开源生态的蓬勃发展,也反映了当下开源行业的发展趋势。08- HHunyuan-MT-7B腾讯混元翻译模型主要支持33种语言间的互译,包括中国五种少数民族语言。00
GOT-OCR-2.0-hf
阶跃星辰StepFun推出的GOT-OCR-2.0-hf是一款强大的多语言OCR开源模型,支持从普通文档到复杂场景的文字识别。它能精准处理表格、图表、数学公式、几何图形甚至乐谱等特殊内容,输出结果可通过第三方工具渲染成多种格式。模型支持1024×1024高分辨率输入,具备多页批量处理、动态分块识别和交互式区域选择等创新功能,用户可通过坐标或颜色指定识别区域。基于Apache 2.0协议开源,提供Hugging Face演示和完整代码,适用于学术研究到工业应用的广泛场景,为OCR领域带来突破性解决方案。00- HHowToCook程序员在家做饭方法指南。Programmer's guide about how to cook at home (Chinese only).Dockerfile03
- PpathwayPathway is an open framework for high-throughput and low-latency real-time data processing.Python00
- Dd2l-zh《动手学深度学习》:面向中文读者、能运行、可讨论。中英文版被70多个国家的500多所大学用于教学。Python011
热门内容推荐
最新内容推荐
项目优选









