使用Cloud Custodian监控AWS子网IP使用率并发送邮件告警

2025-06-06 10:03:14作者：明树来

背景介绍

在AWS云环境中，子网IP地址的合理使用是网络管理的重要环节。当子网IP使用率过高时，可能会导致新实例无法启动或服务不可用。Cloud Custodian作为一款云资源治理工具，可以帮助我们自动化监控AWS子网IP使用情况，并在使用率超过阈值时触发告警。

技术实现方案

1. 监控子网IP使用率

Cloud Custodian提供了专门的过滤器ip-address-usage来检查子网的IP地址使用情况。该过滤器可以获取子网中已用IP地址的百分比，并与设定的阈值进行比较。

filters:
  - type: ip-address-usage
    key: PercentUsed
    op: greater-than
    value: 40

2. 配置邮件告警动作

当检测到子网IP使用率超过阈值时，可以通过webhook动作调用SendGrid API发送邮件通知。关键配置点包括：

设置正确的API端点URL
配置认证头信息
构建符合SendGrid要求的邮件内容JSON结构

actions:
  - type: webhook
    url: "https://api.sendgrid.com/v3/mail/send"
    method: POST
    headers:
      Content-Type: "application/json"
      Authorization: "Bearer YOUR_API_KEY"
    body: |
      {
        "personalizations": [{
          "to": [{
            "email": `recipient@example.com`
          }]
        }],
        "from": {
          "email": `noreply@example.com`
        },
        "subject": "AWS子网IP使用率告警",
        "content": [{
          "type": "text/plain",
          "value": "检测到子网IP使用率超过阈值"
        }]
      }

3. JSON格式处理技巧

在编写webhook的body内容时，需要注意JSON字符串的处理方式。Cloud Custodian使用JMESPath表达式来解析配置，因此：

对于固定字符串值，建议使用反引号(`)包裹而非双引号
复杂的JSON结构需要确保正确的嵌套和格式
可以通过本地测试服务验证webhook的输出格式

常见问题排查

400错误响应：通常表示请求格式不正确，可能是：
- 头信息缺失或格式错误
- JSON body不符合API要求
- 认证信息无效
JMESPath解析问题：当JSON中包含特殊字符时，使用反引号可以避免解析错误。
测试验证：建议先使用curl命令测试SendGrid API的连通性，确认API密钥和基本配置正确后再集成到Cloud Custodian策略中。

最佳实践建议

设置合理的阈值：根据业务需求设置适当的告警阈值，既不能太低导致频繁误报，也不能太高失去预警意义。
邮件内容优化：在告警邮件中包含具体的子网信息和使用率数据，便于快速定位问题。
多级告警机制：可以设置不同级别的告警策略，例如：
- 50%使用率：发送提醒邮件
- 80%使用率：发送紧急告警并通知运维团队
- 90%使用率：自动触发扩容流程
定期策略评审：随着业务发展，定期评审和调整监控策略，确保其持续有效。