几乎每款软件,用户都会撞上两类麻烦:
- 用不了:装失败、起不来、跑着挂了。产品只会报错,剩下靠人翻日志、猜命令。
- 不会用:文档在站外、入口找不到、参数不会填。问助手,多半是一句「请参考官方文档」。
对应到产品能力,就是两条线:
自答疑——解决「不会用」:用自然语言问产品本身,答案来自产品内文档与当前部署上下文。
DataBuff 就是按这个思路做的:一款开源、AI Native 的 OpenTelemetry APM。指标、链路、日志先采进来、看清楚;AI 长在同一份遥测上,不是旁边挂个聊天框。架构刻意压到三件套:
Doris——存储与查询
AI 平台 / Web——看板、对话、数字专家(含运维专家、产品答疑)
先看自运维怎么落地。场景很常见:install 过程中 Doris 出了问题。一般产品到此整站黑屏,人自己 SSH 猜;DataBuff 怎么自己查、自己修。
我们注入一个可复现故障:Doris BE 被卡成 mem_limit: 256m,start.sh 非 0 退出。系统进入排障模式——承认 Doris 未就绪,但 Web 仍然拉起,把修复通道留住。
配好大模型,打开 AI 对话,选运维专家,把 SSH 授权交出去,要求定位后直接修复:
专家上机后自己跑完闭环:BE 持续 Restarting → 根因是 mem_limit: 256m 触发 OOM → 把内存提到 4g、改持久化配置、拉起 ingest、验到全栈 Healthy。回报里是「修复措施」和「最终健康状态」——已经改完,不是待办清单。
终端侧也对得上:四容器 healthy,Doris SELECT 1 通过。存储恢复后排障模式自动退出,不用再手动重启 Web。「用不了」就这样被拆掉——坏了,产品还能上场,并且修完。
再看自答疑。系统救回来了,「不会用」还在。同一 AI 入口换产品答疑,先问接入与告警——新人最常卡的两件事:
它翻产品内文档,直接给出可执行路径:OTLP 端点、环境变量、Java Agent 启动命令,以及告警规则在配置管理里的入口。
数据能进来还不够——运维专家、产品答疑本身也要大模型。再问一句更贴近上手的:
答案同样落到菜单与字段:配置管理 → 模型配置,填 Provider Code / Base URL / API Key / 模型列表,保存前点「测试连通性」。配好后专家自动可用,不用再单独开通——它还把 Base URL 漏写 /v1、未配模型列表等常见踩坑一并列出。
业内首个自运维自答疑用不了不会用排障模式