Apache Arrow Python与boto3 1.36兼容性问题解析

2025-05-18 10:23:48作者：毕习沙Eudora

Apache Arrow项目是一个高性能的内存分析平台，其Python绑定提供了对多种文件系统的支持。近期在测试过程中发现，当使用boto3 1.36.1版本时，Python测试套件会出现大量与S3文件系统操作相关的失败。

问题现象

测试失败主要集中在S3文件系统操作上，错误信息显示为"Missing required header for this request: Content-Md5"。这些错误发生在执行DeleteObjects操作时，表明在删除S3对象时缺少必要的Content-MD5头信息。

具体表现为：

文件信息获取测试失败
文件复制操作测试失败
文件删除操作测试失败
数据集读取和写入测试出现错误

问题根源

经过深入分析，这个问题实际上是Minio与AWS SDK之间的兼容性问题。当使用较新版本的boto3（1.36+）时，Minio服务端对Content-MD5头的处理发生了变化。

在AWS SDK的较新版本中，某些操作默认不再包含Content-MD5头，而Minio服务端仍然要求这个头信息，导致了兼容性问题。这与AWS SDK Java版本中报告的问题类似。

解决方案

Apache Arrow项目团队采取了以下措施解决这个问题：

在CI环境中暂时锁定boto3版本为1.35.88，避免测试失败
等待Minio发布兼容新AWS SDK行为的版本

对于用户而言，如果遇到类似问题，可以采取以下临时解决方案：

降级boto3到1.35.88版本
或者等待Minio发布兼容性更新

技术影响

这个问题主要影响以下使用场景：

使用PyArrow进行S3文件系统操作
同时使用Minio作为S3兼容存储后端
使用较新版本的boto3客户端

值得注意的是，大多数PyArrow用户可能不会直接受到此问题影响，因为：

大多数用户使用PyArrow的原生S3支持，而不是直接通过boto3
生产环境通常使用AWS S3服务而非Minio

未来展望

一旦Minio发布兼容新AWS SDK行为的版本，Apache Arrow项目将：

移除CI环境中的boto3版本限制
确保所有相关测试能够通过最新版本的boto3

对于长期维护的分支，项目团队将评估是否需要添加运行约束(run_constrained)来确保兼容性，或者仅将其作为测试要求的一部分。

这个问题展示了开源生态系统中组件间依赖关系的复杂性，也体现了Apache Arrow项目对兼容性和稳定性的重视。通过及时的问题定位和合理的临时解决方案，项目团队确保了用户体验不受影响，同时为长期兼容性做好了准备。

arrow

Apache Arrow is a multi-language toolbox for accelerated data interchange and in-memory processing

项目地址：https://gitcode.com/gh_mirrors/arrow13/arrow

登录后查看全文

项目优选

收起

kernel

openEuler内核是openEuler操作系统的核心，既是系统性能与稳定性的基石，也是连接处理器、设备与服务的桥梁。

Ascend Extension for PyTorch

本项目是CANN提供的神经网络类计算算子库，实现网络在NPU上加速计算。

本项目是CANN提供的transformer类大模型算子库，实现网络在NPU上加速计算。

本仓将收集和展示高质量的仓颉示例代码，欢迎大家投稿，让全世界看到您的妙趣设计，也让更多人通过您的编码理解和喜爱仓颉语言。

830

6.18 K

ops-math

本项目是CANN提供的数学类基础计算算子库，实现网络在NPU上加速计算。

AtomGit CLI （ag cli），AtomGit 命令行工具，参考 GitHub CLI (gh) 开发。目前 atomgit-cli 项目已在 AtomCode 的 Coding Plan 项目列表中

cann-learning-hub

CANN 学习中心仓，支持在线互动运行、边学边练，提供教程、示例与优化方案，一站式助力昇腾开发者快速上手。

Apache Arrow Python与boto3 1.36兼容性问题解析

问题现象

问题根源

解决方案

技术影响

未来展望

热门内容推荐

最新内容推荐

项目优选

Apache Arrow Python与boto3 1.36兼容性问题解析

问题现象

问题根源

解决方案

技术影响

未来展望

相关内容推荐

热门内容推荐

最新内容推荐

项目优选