AWS Load Balancer Controller启动时内存激增问题分析与优化建议

2025-06-16 13:31:28作者：昌雅子Ethen

aws-load-balancer-controller

A Kubernetes controller for Elastic Load Balancers

项目地址：https://gitcode.com/gh_mirrors/aw/aws-load-balancer-controller

问题现象

AWS Load Balancer Controller在启动过程中会出现显著的内存使用峰值，这个峰值可能达到正常运行内存使用量的8倍之多。虽然这个内存激增现象持续时间很短（通常监控系统如cadvisor甚至无法捕捉到），但为了确保服务稳定，用户不得不设置较高的内存请求和限制，导致资源浪费。

问题根源分析

经过技术分析，这个问题主要与Kubernetes的Informer机制有关。在Controller启动阶段，Informer会执行以下操作：

首先会获取所有相关资源对象的完整列表
将这些对象全部加载到内存中
然后传递给存储层进行处理

即使使用了client-go和controller-runtime提供的字段过滤功能（可以去除不需要的对象字段），系统仍然需要先完成完整的资源读取操作。这种设计在资源数量较多时（如大量Secret资源）就会导致内存使用量激增。

复现条件

当集群中存在大量特定类型的资源时，这个问题尤为明显。例如：

在aws-load-balancer-controller命名空间中创建6000个kubernetes.io/tls类型的Secret（即使使用相同的密钥内容）
为Pod设置512MiB的内存限制（基于历史使用数据看似合理）
观察Pod在启动时因内存不足被终止

解决方案探讨

目前有几种可能的优化方向：

使用基于Watch的Informer：这是Kubernetes社区推荐的新方案，可以避免一次性加载所有资源对象。
自定义List-Watcher：通过hack controller-runtime/informer，实现自定义的列表监视机制，但这需要深入理解底层实现。
资源字段过滤优化：虽然当前已有字段过滤功能，但可以进一步优化过滤策略，减少内存占用。

实践建议

对于生产环境用户，建议：

暂时根据峰值设置足够的内存限制，确保服务稳定
关注AWS Load Balancer Controller的版本更新，特别是与Informer相关的优化
对于大型集群，考虑资源分区策略，减少单个Controller需要处理的资源数量

版本演进

从2.8.0到2.9.2版本，由于Go SDK v2的升级，内存使用已经有所改善（约两位数百分比的提升），但根本性问题仍未完全解决。用户应持续关注后续版本中针对此问题的专门优化。

aws-load-balancer-controller

A Kubernetes controller for Elastic Load Balancers

项目地址：https://gitcode.com/gh_mirrors/aw/aws-load-balancer-controller

登录后查看全文

项目优选

收起

deepin linux kernel

OpenHarmony documentation | OpenHarmony开发者文档

openEuler内核是openEuler操作系统的核心，既是系统性能与稳定性的基石，也是连接处理器、设备与服务的桥梁。

flutter_flutter

Ascend Extension for PyTorch

ohos_react_native

React Native鸿蒙化仓库

本项目是CANN提供的数学类基础计算算子库，实现网络在NPU上加速计算。

Nop Platform 2.0是基于可逆计算理论实现的采用面向语言编程范式的新一代低代码开发平台，包含基于全新原理从零开始研发的GraphQL引擎、ORM引擎、工作流引擎、报表引擎、规则引擎、批处理引引擎等完整设计。nop-entropy是它的后端部分，采用java语言实现，可选择集成Spring框架或者Quarkus框架。中小企业可以免费商用

🎉 (RuoYi)官方仓库基于SpringBoot，Spring Security，JWT，Vue3 & Vite、Element Plus 的前后端分离权限管理系统

华为昇腾面向大规模分布式训练的多模态大模型套件，支撑多模态生成、多模态理解。