Skip to content

平台自监控与自排障

DataBuff 会「照顾自己」:它把自己也当成一个被监控的系统,盯着三个核心组件——ingest(收数据)、web(查数据)、Doris(存数据)。平台哪里堵了、哪里在丢数据、该调哪个参数,不用你翻日志猜,页面上一眼就能看到,说句话 AI 还能帮你查、帮你修。

平台自监控一共有 5 个能力,下面一个个讲怎么用。


能力一:会看自己 —— 打开「部署状态」页

入口:左侧菜单 安装部署 → 部署状态(路由 /deploy/status)。

打开后先看总览页签的四张卡片,平台健不健康先说结论:

卡片看什么
入站 TPS现在每秒钟收进来多少数据
写出失败有没有数据写不进 Doris(非 0 就要注意)
Doris 磁盘占用存储还够不够
查询失败查数据有没有报错

部署状态 · 总览

再往下翻,还有三个页签,想看哪个组件点哪个:

  • ingest 页签:数据是怎么收进来、怎么处理、怎么写出去的,每路信号(trace / metric / log)有没有丢
  • web 页签:平台查询接口快不快、有没有报错
  • Doris 页签:存储节点活没活着、磁盘和 CPU 什么状态

重点看两个红色信号(只要持续非 0 就要处理):

  • Pipeline 丢弃:管道塞满了,数据会丢
  • 写出丢弃:写 Doris 的队列满了,数据会丢

ingest 页签 · 写出丢弃(实测:log 信号持续丢弃,Ready 队列 16/16 打满)


能力二:懂自己 —— 每个指标都带「说明书」

不用背指标。点任何一张图的标题,右侧会弹出一个说明抽屉,把这个指标讲清楚:

  • 这个指标怎么算的
  • 该不该担心(什么时候算异常)
  • 异常了该调哪个环境变量、默认值是多少

点「写出丢弃」标题,抽屉直接说明怎么算、怎么看、该调哪个参数

比如点「写出丢弃」,它会告诉你:数据只在「队列满」或「连续写入失败」时才会丢,并直接列出该调的参数和默认值。


能力三:会体检 —— 一句话让 AI 做全平台巡检

不想一页页翻图?直接在 AI 平台说一句:

对 DataBuff 平台进行巡检,并出一份 html 巡检报告

产品答疑专家会自动读指标清单、查平台自监控数据、把异常挑出来,最后给你一份能直接转发的 HTML 巡检报告

一句话触发的平台巡检报告(实测)


能力四:会诊断 —— 让 AI 自己查丢数据的原因

页面看到丢数据了,不用自己一层层猜。在 AI 平台让产品答疑专家去查,它会一步步排查:

  1. 排除「不是问题」的项(业务侧正常、Doris 存储正常)
  2. 定位到真正的根因(比如写 Doris 的队列太小,突发数据装不下被整批丢弃)
  3. 给出带证据的结论和修复建议

AI 排查把丢弃链路讲清楚:攒批 → 16 批写出队列 → 队列塞满整批丢弃 → Doris 存储

排查给出的解决方案:该调哪个参数、默认值多少、建议改成多少


能力五:会修复 —— AI 帮你改参数、重启

排查出的建议,产品答疑专家可以自己动手修:登录服务器 → 改配置 → 重启组件 → 复查确认,全程不用你上手。

产品答疑专家执行操作:登录 → 备份配置 → 改参数 → 重启 ingest → 验证生效

实际案例(log 数据一直丢):

参数异常时调整后作用
INGEST_DORIS_MAX_READY_BATCHES1632写出队列太小,调大一倍
INGEST_DORIS_FLUSH_TIMEOUT_MS30s60s恢复默认,避免大批次误失败

修完后复查「写出丢弃」归零,问题解决:

修复后的复查:丢弃归零,曲线恢复正常

修复后自监控图:「写出丢弃」归零


上手三件事

装好 DataBuff 后,建议按顺序做:

  1. 打开部署状态页,先扫一眼四张卡片
  2. 让 AI 做一次巡检,把报告转发给团队
  3. 遇到丢数据,让 AI 排查并修复,别自己翻手册

想深入了解?

指标全名、计算口径、所有环境变量的详细说明,见 平台自监控指标清单