首页
/ Daft项目优化:迁移Parquet集成测试数据至S3存储

Daft项目优化:迁移Parquet集成测试数据至S3存储

2025-06-28 15:22:09作者:何将鹤

在开源数据分析框架Daft的开发过程中,团队发现了一个影响测试稳定性的问题:集成测试依赖的Parquet测试数据存储在GitHub的rawcontent服务上,而频繁的测试请求会导致服务被限流。本文将深入分析这一问题背景、技术解决方案以及迁移到S3存储的优势。

问题背景

Daft框架在进行Parquet文件格式的集成测试时,需要访问特定的测试数据集。原本这些数据文件托管在GitHub的rawcontent服务上,开发团队通过HTTPS协议直接获取。但在持续集成(CI)环境中,频繁的测试请求会导致GitHub对请求进行限流(throttling),表现为HTTP 429 Too Many Requests错误。

这种限流机制严重影响了开发流程:

  1. 导致自动化测试失败
  2. 延长了CI/CD管道的执行时间
  3. 增加了开发人员排查非代码问题的负担

技术解决方案

Daft团队决定将测试数据迁移到Amazon S3存储服务,具体方案包括:

  1. 在daft-public S3桶中创建专用目录存放Parquet测试文件
  2. 修改测试代码,将数据获取路径从GitHub切换到S3
  3. 确保S3桶的访问权限设置为公开读取
  4. 保留原始数据的完整性和校验机制

迁移后的数据访问URL格式示例: s3://daft-public/parquet-test-data/plain-dict-uncompressed-checksum.parquet

S3存储的优势

相比GitHub rawcontent,使用S3存储测试数据具有多方面优势:

  1. 更高的可靠性:S3设计为99.99%的可用性,远高于GitHub rawcontent的服务级别
  2. 更好的性能:S3专为大规模对象存储优化,提供更高的吞吐量和更低的延迟
  3. 弹性扩展:S3自动处理流量激增,不会因为频繁请求而限流
  4. 成本效益:对于公开读取的小型测试数据集,S3的成本几乎可以忽略不计
  5. 访问控制:可以通过IAM策略精细控制访问权限,未来如需限制访问也很方便

实施细节

在技术实现上,Daft团队需要:

  1. 使用AWS CLI或SDK将原始Parquet文件上传至S3
  2. 更新测试用例中的URL引用
  3. 添加适当的错误处理和重试逻辑
  4. 考虑本地开发环境与CI环境的统一访问方式
  5. 在文档中更新测试数据的位置说明

对于Python测试代码的修改,主要涉及将类似:

url = "https://raw.githubusercontent.com/apache/parquet-testing/master/data/plain-dict-uncompressed-checksum.parquet"

改为:

url = "s3://daft-public/parquet-test-data/plain-dict-uncompressed-checksum.parquet"

后续优化方向

这一改进为Daft项目打开了更多优化可能性:

  1. 测试数据版本管理:可以在S3中实现测试数据的版本控制
  2. 性能基准测试:稳定的数据源使得性能测试结果更加可靠
  3. 扩展测试数据集:不受GitHub限制,可以添加更大规模的测试数据
  4. 多区域部署:根据需要可以将测试数据复制到不同区域的S3桶

总结

Daft项目通过将Parquet集成测试数据从GitHub迁移到S3存储,显著提高了测试的稳定性和可靠性。这一改进不仅解决了当前的限流问题,还为项目的持续集成流程奠定了更坚实的基础。这种架构决策体现了开源项目在基础设施选择上的务实态度,平衡了可靠性、成本和维护复杂度等多方面因素。

登录后查看全文
热门项目推荐
相关项目推荐

项目优选

收起
docsdocs
OpenHarmony documentation | OpenHarmony开发者文档
Dockerfile
152
1.97 K
kernelkernel
deepin linux kernel
C
22
6
ops-mathops-math
本项目是CANN提供的数学类基础计算算子库,实现网络在NPU上加速计算。
C++
426
34
communitycommunity
本项目是CANN开源社区的核心管理仓库,包含社区的治理章程、治理组织、通用操作指引及流程规范等基础信息
238
9
openGauss-serveropenGauss-server
openGauss kernel ~ openGauss is an open source relational database management system
C++
145
190
openHiTLSopenHiTLS
旨在打造算法先进、性能卓越、高效敏捷、安全可靠的密码套件,通过轻量级、可剪裁的软件技术架构满足各行业不同场景的多样化要求,让密码技术应用更简单,同时探索后量子等先进算法创新实践,构建密码前沿技术底座!
C
988
394
nop-entropynop-entropy
Nop Platform 2.0是基于可逆计算理论实现的采用面向语言编程范式的新一代低代码开发平台,包含基于全新原理从零开始研发的GraphQL引擎、ORM引擎、工作流引擎、报表引擎、规则引擎、批处理引引擎等完整设计。nop-entropy是它的后端部分,采用java语言实现,可选择集成Spring框架或者Quarkus框架。中小企业可以免费商用
Java
8
0
ohos_react_nativeohos_react_native
React Native鸿蒙化仓库
C++
193
274
RuoYi-Vue3RuoYi-Vue3
🎉 (RuoYi)官方仓库 基于SpringBoot,Spring Security,JWT,Vue3 & Vite、Element Plus 的前后端分离权限管理系统
Vue
936
554
金融AI编程实战金融AI编程实战
为非计算机科班出身 (例如财经类高校金融学院) 同学量身定制,新手友好,让学生以亲身实践开源开发的方式,学会使用计算机自动化自己的科研/创新工作。案例以量化投资为主线,涉及 Bash、Python、SQL、BI、AI 等全技术栈,培养面向未来的数智化人才 (如数据工程师、数据分析师、数据科学家、数据决策者、量化投资人)。
Python
75
69