首页
/ Apache Parquet-MR 项目中 DeltaByteArrayReader 的 ClassCastException 问题分析

Apache Parquet-MR 项目中 DeltaByteArrayReader 的 ClassCastException 问题分析

2025-07-03 12:18:23作者:邬祺芯Juliet

问题背景

在 Apache Parquet-MR 项目的 1.13.1 版本升级到 1.14.1 版本过程中,出现了一个关于 DeltaByteArrayReader 的 ClassCastException 异常。这个异常发生在尝试将 DictionaryValuesReader 强制转换为 DeltaByteArrayReader 时,具体报错信息如下:

java.lang.ClassCastException: class org.apache.parquet.column.values.dictionary.DictionaryValuesReader cannot be cast to class org.apache.parquet.column.values.deltastrings.DeltaByteArrayReader

技术分析

这个问题源于 PARQUET-2431 的代码变更。在旧版本中,CorruptDeltaByteArrays.requiresSequentialReads 方法实际上隐式地执行了类型检查,因为它只会在编码为 DELTA_BYTE_ARRAY 时返回 true,而 RequiresPreviousReader 接口仅由 *DeltaByteArrayReader 类实现。

在 1.14.1 版本中,代码重构移除了这个隐式的类型检查,导致在某些情况下会出现类型转换异常。具体来说,当:

  1. 使用 ColumnIOFactory 读取没有 createdBy 元数据的 Parquet 文件时
  2. 文件中的列使用了字典编码
  3. 系统尝试将字典编码的读取器设置为前一个读取器时

解决方案

目前有两种可行的解决方案:

  1. 显式设置 createdBy 信息:在创建 ColumnIOFactory 时传入 createdBy 参数,确保它包含 PARQUET-246 之后的信息,这样可以避免 CorruptDeltaByteArrays.requiresSequentialReads 返回 true。
val reader: ParquetFileReader = ...
val fileMetadata = reader.getFooter.getFileMetaData
val createdBy = fileMetadata.getCreatedBy
val columnIO: MessageColumnIO = new ColumnIOFactory(createdBy)...
  1. 代码修复:在 initDataReader 方法中添加对 previousReader instanceof RequiresPreviousReader 的检查,确保类型安全。

影响范围

这个问题主要影响以下场景:

  • 读取没有 createdBy 元数据的旧版 Parquet 文件
  • 文件中混合使用了字典编码和 Delta 编码的列
  • 使用默认的 ColumnIOFactory 构造函数

最佳实践建议

  1. 始终确保 Parquet 文件包含正确的 createdBy 元数据
  2. 在升级到 1.14.1 或更高版本前,测试现有文件的兼容性
  3. 考虑在代码中添加防御性编程,处理可能的类型转换异常

总结

这个问题展示了在性能优化和代码重构过程中可能引入的隐式依赖风险。开发者在处理编码相关的逻辑时,应该特别注意类型系统的安全性,特别是在涉及多种编码方式的混合使用时。对于 Parquet 这样的列式存储格式,编码器的正确选择和类型安全尤为重要。

登录后查看全文
热门项目推荐

项目优选

收起
openHiTLS-examplesopenHiTLS-examples
本仓将为广大高校开发者提供开源实践和创新开发平台,收集和展示openHiTLS示例代码及创新应用,欢迎大家投稿,让全世界看到您的精巧密码实现设计,也让更多人通过您的优秀成果,理解、喜爱上密码技术。
C
53
465
kernelkernel
deepin linux kernel
C
22
5
openHiTLSopenHiTLS
旨在打造算法先进、性能卓越、高效敏捷、安全可靠的密码套件,通过轻量级、可剪裁的软件技术架构满足各行业不同场景的多样化要求,让密码技术应用更简单,同时探索后量子等先进算法创新实践,构建密码前沿技术底座!
C
349
381
nop-entropynop-entropy
Nop Platform 2.0是基于可逆计算理论实现的采用面向语言编程范式的新一代低代码开发平台,包含基于全新原理从零开始研发的GraphQL引擎、ORM引擎、工作流引擎、报表引擎、规则引擎、批处理引引擎等完整设计。nop-entropy是它的后端部分,采用java语言实现,可选择集成Spring框架或者Quarkus框架。中小企业可以免费商用
Java
7
0
openGauss-serveropenGauss-server
openGauss kernel ~ openGauss is an open source relational database management system
C++
132
185
RuoYi-Vue3RuoYi-Vue3
🎉 (RuoYi)官方仓库 基于SpringBoot,Spring Security,JWT,Vue3 & Vite、Element Plus 的前后端分离权限管理系统
Vue
873
517
Cangjie-ExamplesCangjie-Examples
本仓将收集和展示高质量的仓颉示例代码,欢迎大家投稿,让全世界看到您的妙趣设计,也让更多人通过您的编码理解和喜爱仓颉语言。
Cangjie
336
1.1 K
ohos_react_nativeohos_react_native
React Native鸿蒙化仓库
C++
179
264
cherry-studiocherry-studio
🍒 Cherry Studio 是一款支持多个 LLM 提供商的桌面客户端
TypeScript
609
59
note-gennote-gen
一款跨平台的 Markdown AI 笔记软件,致力于使用 AI 建立记录和写作的桥梁。
TSX
83
4