Skip to main content
Metrics 是系统可观测非常重要的分析数据。AutoMQ 支持通过 Prometheus 透出原生 Apache Kafka 的多项 Metrics 数据。本文介绍 AutoMQ 透出的 Metrics 明细。

Metrics 采集方式

AutoMQ 通过以下两种方式提供 Prometheus 兼容的监控能力:
  1. Remote Write: AutoMQ 将 Metrics 直接推送到用户提供的 Prometheus Remote Write Endpoint。创建或更新实例时配置 Endpoint 和身份验证信息。
  2. Exporter: AutoMQ 提供 Prometheus 兼容的拉取 Endpoint,由用户的监控系统定期采集。
Exporter 的服务发现方式取决于部署平台:
  • Kubernetes 部署: 使用 Kubernetes 资源上的标准 Prometheus Annotation 发现采集 Endpoint。
  • 虚拟机部署: 使用云厂商提供的主机 Tag 发现目标主机。
两种方式均提供 Metrics 采集和传输能力。用户需要在自己的 Prometheus 兼容监控系统中配置仪表盘和告警。AutoMQ 同时提供 Grafana 仪表盘模板Prometheus 告警规则模板

Prometheus Metrics 定义

指标名称、Label 和详细定义请参见开源版文档中的 Prometheus Metrics

Grafana 仪表盘示例

如上文所述, AutoMQ Cloud 暂不提供托管的 Grafana 仪表盘服务,用户参考AutoMQ 提供的 Grafana 模板快速配置仪表盘,相关仪表盘模板请前往此处链接下载。 预置的 Grafana 大盘模板提供了不同维度的指标监控:
  • Cluster Overview: 提供了集群维度的监控,包括节点数量、数据大小、集群流量等,以及Topic、Group、Broker 维度的指标概览,并提供了下钻功能,可跳转至对应的详情监控
  • Broker Metrics: 提供了 Broker 维度的监控,包括连接数量、分区数量、节点流量、节点请求等
  • Topic Metrics: 提供了 Topic 维度的指标监控,包括消息吞吐、数据总量、分区数量、消费延迟等
  • Group Metrics: 提供了 Group 维度的指标监控,包括消费速率和消费延迟

业务监控报警

AutoMQ 基于 Prometheus 集成,将 Metrics 数据推送到 Prometheus 后,用户可以使用 Prometheus 配置自定义报警规则,用于监控业务压力水位等异常情况。

Kafka 集群报警模板

AutoMQ 基于生产环境高频使用的 Metrics 沉淀了一系列报警模板,用户可根据实际需求选择配置其中的报警规则。 报警规则模板列表如下: 完整的报警模板 yaml 文件参考下方,可以用于复制导入。

Managed Connector 报警模板

AutoMQ 针对 Managed Connector 场景同样提供了一系列报警模板,用于监控 Connector 任务状态、资源使用和数据处理异常等情况。 报警规则模板列表如下: 完整的报警模板 yaml 文件参考下方,可以用于复制导入。
使用 Managed Connector 报警模板时,请将 <your-connect-instance-id><your-connector-name> 替换为实际的 Connect 实例 ID 和 Connector 名称。

配置步骤

AutoMQ 提供了上述 Prometheus 报警模板,用户可将该报警模板导入当前的 Prometheus 集群(实例)中,然后基于报警模板配置自定义报警规则。 下文以阿里云 Prometheus 为例,演示报警规则配置方法,如果当前是自建 Prometheus,自行参考调整。

在阿里云 Prometheus 配置报警

  1. 导入报警模板: 打开阿里云 Prometheus 控制台,进入告警规则模板 ,选择批量导入模板
  1. 复制上述模板文件内容,并导入。
  1. 应用报警模板: 导入模板完成后,选择特定的报警模板,点击应用模板, 将想要开启的报警模板应用到对应的 Prometheus 实例。
  1. 配置监控告警规则。 以消费堆积报警 (HighGroupConsumerLag) 为例,点击「应用模板」后,选择对应的 Prometheus 实例,应用成功后,可以在左侧「告警规则列表」中看到已经启用的报警规则。
  1. 点击「编辑」,进入到报警规则的编辑页面,将 “example_topic” 和 “example_group” 更改为想要监控的 topic 和 consumer group,并将报警阈值(下图中的 10000)修改为期望的值。
  1. 配置通知策略。 编辑完成后,选择已有的通知策略,或点击「新建通知策略」进行创建。
  2. 快速复制报警策略(可选)。 如果想要对多个 Topic 或 Consumer Group 进行监控,可点击**「复制」** 创建多条报警规则。