Druid项目中使用AWS S3作为深度存储时的性能优化实践

2025-05-16 08:24:08作者：裘旻烁

项目地址：https://gitcode.com/gh_mirrors/dr/druid

背景介绍

在分布式分析系统Druid的实际部署中，AWS S3作为深度存储(deep storage)是一种常见选择。然而，当Historical节点首次启动或需要重新加载所有数据段(segment)时，从S3拉取数据的性能问题经常成为瓶颈。本文分享一个典型场景下的性能优化经验。

问题现象

在Druid v32.0.0版本中，当Historical节点从空状态启动时，从S3拉取数据的速度仅为50MB/s左右。相比之下，在同一Pod上使用AWS CLI工具下载相同数据时，速度可达400-500MB/s，相差近10倍。

性能对比分析

通过对比测试发现：

Druid原生S3连接器的下载速度显著低于AWS CLI
系统资源(CPU/内存/网络)均未达到瓶颈状态
调整常规参数如线程数、内存配置等效果有限

关键优化参数

经过深入排查，以下配置参数对性能影响最为显著：

Coordinator节点配置

druid.coordinator.loadqueuepeon.http.batchSize=10

控制协调节点批量处理segment加载请求的大小
默认值较小会导致Historical节点无法充分利用网络带宽

Historical节点配置

druid.segmentCache.numLoadingThreads=10

增加segment加载线程数
需要根据节点CPU核心数合理设置

druid.server.http.numThreads=25

调整HTTP服务线程池大小
影响节点处理RPC请求的并发能力

技术原理

Druid从S3加载数据的过程涉及多个组件协同工作：

Coordinator通过HTTP通知Historical加载segment
Historical节点并行下载多个segment文件
每个segment下载又涉及多个小文件的传输

原始配置的问题在于：

批量处理大小不足导致请求序列化
线程池配置不合理造成并发度不够
各组件间缺乏协调导致整体吞吐量下降

最佳实践建议

对于大规模集群，建议进行分段加载测试找到最佳batchSize
Historical节点的加载线程数应与CPU核心数保持合理比例
监控系统资源使用情况，避免线程过多导致上下文切换开销
考虑使用较新的Druid版本，其对S3连接器有持续优化

总结

通过合理调整批量处理大小和线程池配置，我们成功将S3数据加载性能提升了近10倍。这提醒我们，在分布式系统中，组件间的协调参数往往比单个组件的参数更为关键。建议Druid用户在生产环境部署前，都应进行类似的性能基准测试和参数调优。

druid

项目地址：https://gitcode.com/gh_mirrors/dr/druid

登录后查看全文

项目优选

收起

kernel

deepin linux kernel

docs

OpenHarmony documentation | OpenHarmony开发者文档

本项目是CANN提供的数学类基础计算算子库，实现网络在NPU上加速计算。

Ascend Extension for PyTorch

Nop Platform 2.0是基于可逆计算理论实现的采用面向语言编程范式的新一代低代码开发平台，包含基于全新原理从零开始研发的GraphQL引擎、ORM引擎、工作流引擎、报表引擎、规则引擎、批处理引引擎等完整设计。nop-entropy是它的后端部分，采用java语言实现，可选择集成Spring框架或者Quarkus框架。中小企业可以免费商用

openEuler内核是openEuler操作系统的核心，既是系统性能与稳定性的基石，也是连接处理器、设备与服务的桥梁。

leetcode

🔥LeetCode solutions in any programming language | 多种编程语言实现 LeetCode、《剑指 Offer（第 2 版）》、《程序员面试金典（第 6 版）》题解

Java

RuoYi-Vue3

🎉 (RuoYi)官方仓库基于SpringBoot，Spring Security，JWT，Vue3 & Vite、Element Plus 的前后端分离权限管理系统

Vue

1.22 K

671