首页
/ Daft项目优化:迁移Parquet集成测试数据至S3存储

Daft项目优化:迁移Parquet集成测试数据至S3存储

2025-06-28 08:02:41作者:何将鹤

在开源数据分析框架Daft的开发过程中,团队发现了一个影响测试稳定性的问题:集成测试依赖的Parquet测试数据存储在GitHub的rawcontent服务上,而频繁的测试请求会导致服务被限流。本文将深入分析这一问题背景、技术解决方案以及迁移到S3存储的优势。

问题背景

Daft框架在进行Parquet文件格式的集成测试时,需要访问特定的测试数据集。原本这些数据文件托管在GitHub的rawcontent服务上,开发团队通过HTTPS协议直接获取。但在持续集成(CI)环境中,频繁的测试请求会导致GitHub对请求进行限流(throttling),表现为HTTP 429 Too Many Requests错误。

这种限流机制严重影响了开发流程:

  1. 导致自动化测试失败
  2. 延长了CI/CD管道的执行时间
  3. 增加了开发人员排查非代码问题的负担

技术解决方案

Daft团队决定将测试数据迁移到Amazon S3存储服务,具体方案包括:

  1. 在daft-public S3桶中创建专用目录存放Parquet测试文件
  2. 修改测试代码,将数据获取路径从GitHub切换到S3
  3. 确保S3桶的访问权限设置为公开读取
  4. 保留原始数据的完整性和校验机制

迁移后的数据访问URL格式示例: s3://daft-public/parquet-test-data/plain-dict-uncompressed-checksum.parquet

S3存储的优势

相比GitHub rawcontent,使用S3存储测试数据具有多方面优势:

  1. 更高的可靠性:S3设计为99.99%的可用性,远高于GitHub rawcontent的服务级别
  2. 更好的性能:S3专为大规模对象存储优化,提供更高的吞吐量和更低的延迟
  3. 弹性扩展:S3自动处理流量激增,不会因为频繁请求而限流
  4. 成本效益:对于公开读取的小型测试数据集,S3的成本几乎可以忽略不计
  5. 访问控制:可以通过IAM策略精细控制访问权限,未来如需限制访问也很方便

实施细节

在技术实现上,Daft团队需要:

  1. 使用AWS CLI或SDK将原始Parquet文件上传至S3
  2. 更新测试用例中的URL引用
  3. 添加适当的错误处理和重试逻辑
  4. 考虑本地开发环境与CI环境的统一访问方式
  5. 在文档中更新测试数据的位置说明

对于Python测试代码的修改,主要涉及将类似:

url = "https://raw.githubusercontent.com/apache/parquet-testing/master/data/plain-dict-uncompressed-checksum.parquet"

改为:

url = "s3://daft-public/parquet-test-data/plain-dict-uncompressed-checksum.parquet"

后续优化方向

这一改进为Daft项目打开了更多优化可能性:

  1. 测试数据版本管理:可以在S3中实现测试数据的版本控制
  2. 性能基准测试:稳定的数据源使得性能测试结果更加可靠
  3. 扩展测试数据集:不受GitHub限制,可以添加更大规模的测试数据
  4. 多区域部署:根据需要可以将测试数据复制到不同区域的S3桶

总结

Daft项目通过将Parquet集成测试数据从GitHub迁移到S3存储,显著提高了测试的稳定性和可靠性。这一改进不仅解决了当前的限流问题,还为项目的持续集成流程奠定了更坚实的基础。这种架构决策体现了开源项目在基础设施选择上的务实态度,平衡了可靠性、成本和维护复杂度等多方面因素。

登录后查看全文
热门项目推荐

项目优选

收起
ohos_react_nativeohos_react_native
React Native鸿蒙化仓库
C++
176
261
RuoYi-Vue3RuoYi-Vue3
🎉 (RuoYi)官方仓库 基于SpringBoot,Spring Security,JWT,Vue3 & Vite、Element Plus 的前后端分离权限管理系统
Vue
860
511
ShopXO开源商城ShopXO开源商城
🔥🔥🔥ShopXO企业级免费开源商城系统,可视化DIY拖拽装修、包含PC、H5、多端小程序(微信+支付宝+百度+头条&抖音+QQ+快手)、APP、多仓库、多商户、多门店、IM客服、进销存,遵循MIT开源协议发布、基于ThinkPHP8框架研发
JavaScript
93
15
openGauss-serveropenGauss-server
openGauss kernel ~ openGauss is an open source relational database management system
C++
129
182
openHiTLSopenHiTLS
旨在打造算法先进、性能卓越、高效敏捷、安全可靠的密码套件,通过轻量级、可剪裁的软件技术架构满足各行业不同场景的多样化要求,让密码技术应用更简单,同时探索后量子等先进算法创新实践,构建密码前沿技术底座!
C
259
300
kernelkernel
deepin linux kernel
C
22
5
cherry-studiocherry-studio
🍒 Cherry Studio 是一款支持多个 LLM 提供商的桌面客户端
TypeScript
596
57
CangjieCommunityCangjieCommunity
为仓颉编程语言开发者打造活跃、开放、高质量的社区环境
Markdown
1.07 K
0
HarmonyOS-ExamplesHarmonyOS-Examples
本仓将收集和展示仓颉鸿蒙应用示例代码,欢迎大家投稿,在仓颉鸿蒙社区展现你的妙趣设计!
Cangjie
398
371
Cangjie-ExamplesCangjie-Examples
本仓将收集和展示高质量的仓颉示例代码,欢迎大家投稿,让全世界看到您的妙趣设计,也让更多人通过您的编码理解和喜爱仓颉语言。
Cangjie
332
1.08 K