Skip to content

使用手册 · 告警 ​

指标异常时自动记录事件并触发告警。


能力概览 ​

能力说明
阈值告警错误率、延迟、吞吐等指标超线触发
突变检测捕捉指标的突然变化
定时评估每分钟自动检查,回看最近 5 分钟数据
事件记录记录触发、恢复、处理状态(指标恢复后自动标记已解决)
AI 分析告警详情内可直接追问根因

评估机制详见 架构设计 · 告警。


菜单入口 ​

功能路径
检测规则配置管理 → 告警配置
告警列表告警中心 → 告警列表

外部通知(Webhook、邮件等)尚未支持,见 Roadmap「告警更强 → 通知集成」。


使用流程 ​

1. 创建检测规则 ​

配置管理 → 告警配置 → 新建规则

可配置项:

  • 监控对象:服务或实例范围
  • 指标:错误率、平均延迟、P99 延迟、请求量等
  • 条件:阈值(大于/小于)或突变检测
  • 级别:提示 / 警告 / 严重
  • 评估周期:跟随平台默认定时任务(每分钟)

2. 查看与处理告警 ​

告警中心 → 告警列表

按服务、级别、状态筛选。点击告警进入详情,可查看:

  • 异常指标趋势
  • 关联 Trace 与日志
  • (可选)AI 根因分析,或 告警中心 → 手动根因分析 指定时间范围排查
  • 处理日志

指标恢复后告警自动标记为已解决。 ​

配置示例 ​

以「order-service 错误率连续 5 分钟高于 5%」为例。在 配置管理 → 告警配置 → 新建规则 按下表填写:

字段取值说明
规则名称order-service 错误率过高告警列表里用来辨认这条规则
监控对象order-service只评估该服务;也可改成实例
指标错误率(error_rate / service.error.pct)用百分比,不是 0–1 小数
条件阈值,大于(gt)也可用小于,或改成突变检测
阈值5即 5%
回看窗口300 秒每次评估看最近 5 分钟;平台默认每分钟跑一次
级别严重(critical)也可选提示 / 警告
启用是关掉后不再评估

等价 YAML:

yaml
ruleName: order-service 错误率过高
enabled: true
service: order-service
metric: error_rate
detectionWay: threshold
comparator: gt
threshold: 5
period: 300          # seconds, last 5 minutes
level: critical

对应规则查询 JSON(queryJson 里的评估块):

json
{
  "1": {
    "way": "threshold",
    "period": 300,
    "view_unit": "%",
    "thresholds": { "critical": 5 },
    "A": { "metric": "service.error.pct", "from": [] }
  }
}

保存并启用后,评估任务按分钟检查最近 5 分钟错误率。一旦高于 5%,告警中心 → 告警列表 会出现一行,描述类似「错误率的 12% 值超过阈值 5%」,状态为待处理,并可点进详情看指标趋势、关联 Trace / 日志。指标回落后该行自动标为已解决;同一告警下的触发记录可在详情的事件列表里查看。


与 AI 协同 ​

告警详情页或 AI 平台可直接问:

「order-service 错误率告警,帮我分析原因」

AI 会查指标、Trace、拓扑并给出诊断。Agent 集成场景下可通过 MCP 工具 queryServiceAlarms 查询告警,详见 Agent 集成。


常见问题 ​

现象处理
规则创建后无告警确认服务已有指标;评估每分钟执行;检查监控对象是否匹配(见 Docker / K8s 运维排障)
Demo 装完看不到告警先创建并启用检测规则,装 Demo 产生流量后等待 1–2 个评估周期
告警过多调整阈值或收紧监控对象范围