Skip to content

DataBuff v0.1.7 已就绪:平台自监控与自排障上线,部署状态页盯 ingest / web / Doris,产品答疑专家可巡检、诊断并按建议改参数。另完善非 HTTP 接口分析、全局拓扑孤立服务展示、多 FE/BE 地址配置与链路查询加速。相对 v0.1.6:31 commits,Schema 迁移 V007(metric_platform)

本版亮点

  • 平台自监控与自排障:新增部署状态页(安装部署 → 部署状态),总览入站 TPS、写出失败、Doris 磁盘、查询失败;ingest / web / Doris 分 tab 看图;每个指标标题可点开看计算口径与可调环境变量。
  • AI 一键巡检与修复:产品答疑专家可读指标清单、查平台自监控数据,输出 HTML 巡检报告;发现写出丢弃等问题可沿链路诊断,并按建议登录备份配置、改参数、重启 ingest、复查归零(v0.1.7 新增自运维修复能力)。
  • 答疑专家 Doris 只读查询POST /webapi/api/v1/ai/doris/query 与内置工具 platform.queryDoris,平台配置与遥测只读核验,无需手工连库。
  • 非 HTTP 接口分析完善resourceInfo / resourceRelation 支持非 HTTP componentTypes;接口下钻的资源筛选、慢调用与错误路径覆盖 DB / MQ / RPC 等。
  • 服务分类与拓扑:应用服务按 span/componentId 识别 web 与虚拟中间件类型;全局拓扑在无调用边时仍展示孤立服务;服务流卡片服务名最多两行。
  • 多 FE / 多 BEDORIS_FE_HOST / DORIS_BE_HTTP_HOST 支持逗号分隔地址列表,健康轮询失败自动换节点(详见下方专节)。
  • 链路查询加速:span 查询按分钟键裁剪并跳过 call_spans COUNT;按 TraceID 过滤时 Trace 图从 span 聚合。
  • 告警与 MCP:监控规则评估支持 lt / lte / gte 比较符与 warning 阈值;远程 MCP 在 transport 之后正确应用 headers;AI 对话 Mermaid 按节点渲染并带语法修复兜底。
  • 体验修复:日志列表按时间倒序;AI 回复时用户翻看上文不再被自动滚到底;聊天时间范围 end 处理修正。

怎么用:平台自监控(部署状态页)

路径:安装部署 → 部署状态/deploy/status)。打开先看总览四张卡片:入站 TPS、写出失败、Doris 磁盘占用、查询失败。写出失败或 Pipeline 丢弃持续非 0 就要处理。

  • ingest 页签:trace / metric / log 各路信号收进来、怎么处理、怎么写出,有没有丢。
  • web 页签:平台查询接口耗时与错误。
  • Doris 页签:存储节点存活、磁盘与 CPU。
  • 指标说明书:点任意图标题,右侧抽屉说明怎么算、何时异常、该调哪个环境变量。
部署状态总览:入站 TPS、写出失败、Doris 磁盘占用、查询失败四张卡片
图 1 · 部署状态总览:四张卡片先给平台健康结论,再下钻 ingest / web / Doris 各 tab

怎么用:AI 巡检与自排障

不想一页页翻图,在 AI 平台 对产品答疑专家说:「对 DataBuff 平台进行巡检,并出一份 html 巡检报告」。专家会读指标清单、查平台指标,把异常挑出来生成可转发的 HTML 报告。看到写出丢弃后,可继续让它顺着「攒批 → 写出队列 → Doris」链路查根因,并给出该调的参数(如 INGEST_DORIS_MAX_READY_BATCHES)。v0.1.7 起专家还可按建议执行登录、备份配置、改参数、重启 ingest 并复查。

产品答疑专家一句话触发的平台 HTML 巡检报告
图 2 · 一句话触发的平台巡检报告:异常项、证据与建议集中在一页,可直接转发给团队

完整操作案例与指标全表见 平台自监控与自排障 · 自监控指标清单

接口分析与拓扑(简要)

除了自监控,v0.1.7 还把非 HTTP 接口(DB、MQ、RPC 等)的基础信息、调用历史、慢调用与错误下钻补齐了:从服务详情跳到接口分析时 componentType 会正确带上,不会再把 MQ 接口当成 HTTP 去查。全局拓扑在「只有孤立服务、没有调用边」时也会把这些服务画出来,避免空图误判平台没数据。链路查询继续收紧:span 列表按分钟键裁剪并跳过多余的 call_spans COUNT,TraceID 过滤时图表直接从 span 聚合。

怎么用:配置多 FE / 多 BE

生产若已有 Doris 多节点集群,v0.1.7 起 DataBuff 的 Web / Ingest 可以直接填逗号分隔地址列表:查询走多 FE,写入 Stream Load 走多 BE,节点不健康时自动换下一个,并定期 /api/health 探活恢复。单节点一键安装写法不变。

  • 查询:Web、Ingest 都配 DORIS_FE_HOST(JDBC,默认端口 9030)。多 FE 时 JDBC 自动变成 jdbc:mysql:loadbalance://...
  • 写入(推荐):仅 Ingest 配 DORIS_BE_HTTP_HOST,Stream Load 直连 BE:8040,多 BE 健康轮询。一键安装默认已配 BE,请保持配上。
  • 不配 BE 时:写入先打 FE:8030 再 307 到 BE,分离部署不如直连 BE 稳。

地址写法(FE / BE 相同规则):单主机 fe1 / be1;多主机共享端口 fe1,fe2 / be1,be2;每条自带端口 fe1:19030,fe2:19031 / be1:8040,be2:8041

# Docker:外置 Doris 或改地址时写入 docker-compose.override.yml
services:
  ai-apm-web:
    environment:
      DORIS_FE_HOST: "192.168.1.10,192.168.1.11"
      DORIS_FE_QUERY_PORT: "9030"
  ai-apm-ingest:
    environment:
      DORIS_FE_HOST: "192.168.1.10,192.168.1.11"
      DORIS_FE_QUERY_PORT: "9030"
      DORIS_BE_HTTP_HOST: "192.168.1.20,192.168.1.21"
      DORIS_BE_HTTP_PORT: "8040"

改完后 docker compose up -d ai-apm-web ai-apm-ingest。K8s 则在 ConfigMap ai-apm-config 写入同样变量并 rollout restart web / ingest。表多副本(replication_num ≥ 2)是集群内冗余,和应用侧地址列表互补。完整端口说明见 参数配置 §3。

安装与升级

新装请按 Docker 安装部署;已有环境换版本请按 升级与卸载。本版含 Schema 迁移 V007(新增 metric_platformschema_version → 7),升级脚本会自动跑迁移;K8s 本版不支持原地升级,需卸载后重装。

# 新用户安装(全新安装,会清理旧安装目录与 data/)
curl -fsSL https://databuff.ai/databuff/ai-apm-install.sh | bash

# 现有用户升级(就地升级,保留 data/ 观测数据)
curl -fsSL https://databuff.ai/databuff/ai-apm-update.sh | bash

体验与反馈

GitHub Release v0.1.7 · 在线 Demo · 给项目 Star