技术博客

阅读约 8 分钟

开源版 Datadog,终于有人做成了

开源版 Datadog,终于有人做成了

开源可观测 · Databuff · AI 对话运维

做运维的兄弟,都知道 Datadog。那可是全球云观测巨头,市值巅峰高达 900 亿美刀

Datadog 市值与定位

链路、指标、日志、服务地图,一套齐。

只是贵、上手慢,预算和人力不是每个团队都扛得住。

于是圈内一直有个说法:能不能有个「开源版 Datadog」。

说白了,大家想要一套能自己装的开源版本。

最近在 GitHub 上刷到一个项目,感觉能满足大家的这个幻想。

它叫 Databuff

Databuff 开源项目

今天就做一个新产品开箱,玩给大家看。

作为一名资深的运维工程师,平时排障靠的是手熟:拓扑上找红色节点、指标曲线找尖峰、日志翻关键字。

体验新产品能不能省掉几步,一试就知道怎么样。

不讲概念,先拆箱。

◆ ◆ ◆

1拆开看看

打开 Demo,第一眼不是密密麻麻的仪表盘。

是一句「有什么可以帮您?」

默认入口竟是 AI 对话。

AI 对话首页

开箱第一眼:默认入口是 AI 对话,不是先翻十几张看板。

上面挂着「看得见、会巡检、会诊断」这类能力条,底下直接给问法模板。

没想到开源工具,开箱第一眼是这个。

左边菜单该有的都有了。大盘、告警、指标,链路、日志、拓扑,一样不少。

不像很多的开源工具,进去就是给你看几十张 Dashboard。

以前:先找菜单;现在:直接问。

◆ ◆ ◆

2更惊喜的是 AI 能力

整个开箱的过程,我全程没有看它的指导手册。

我就是想完全自己探索,看能不能玩转。想到啥问啥。

下面列几个场景,全都是现场问出来的,给大家看看效果。

01 · AI 问数:大白话问出服务,不是陪聊

拆开就试了一句:「查询最近 1 小时的服务列表」。

AI 问数提问
AI 问数返回服务列表

它直接给出答案。还按类别列成表,还带时间范围。

现场这一下:共 7 个服务,service-a / service-b 是 Java Web,底下还挂着 MySQL、ES、Kafka、Redis 和远程支付。

还能看见它把任务派给「智能问数」专家,再去调真实查询——过程透明。

值班时最烦的是:想看家底,还得先记指标名、切 Dashboard。这一下省掉了。

这才叫问数:问得动真实遥测,不是陪你吹牛。

02 · AI 故障诊断:根因 + 处置建议一起给

接着问:「对平均响应时间最高的服务做根因诊断,给出处置建议。」

AI 找出最慢服务

它先找出平均响应时间最高的服务对象。然后将这个服务的调用拓扑绘制出来。

调用拓扑

给出直接原因、深层根因。

直接原因与深层根因

并给出故障链路还原,和处置建议。

故障链路还原
处置建议

整体过程就是:

它先比比各服务的耗时:service-a 约 240ms,是 service-b(约 70ms)的三倍多,还远超告警阈值。

再把调用拆开:对 service-b 的 HTTP + RPC 合起来吃掉大半延迟;往下追,MySQL 一侧错误率很高。

最后给紧急 / 短期 / 中长期建议——查连接池、加熔断、并行化调用,写到能动手的粒度。

惊喜的是:不是甩一堆红点让你自己猜,而是把「慢在哪、先改啥」摊开。

以前这类结论,得人在拓扑、指标、告警之间来回跳;现在一句话甩过去,报告自己拼出来。

开箱试用最怕「会说不会干」——这一下,干货密度上来了。

03 · AI 读链路 / 拓扑:影响面与瓶颈可读

拓扑图很多人会画,但「用大白话读出来」才稀罕。

现场让它解读上下游:谁是前台、谁是后厨、哪一跳最慢、影响谁。

AI 读拓扑
拓扑影响面解读

没想到它真用后厨比喻把影响面讲清楚。

前台等后厨,后厨卡在仓库,瓶颈占了总耗时大半。

这一下的惊喜,不是图更花,而是结论能直接讲给同事听。

值班群里不用再贴一张看不懂的拓扑截图。

瓶颈结论

瓶颈一句话说清:大部分时间花在等下游,最该先修的是仓库那一侧。

04 · 日志分析:把原因那两行抠出来

诊断把矛头指到库存,我顺手进日志分析,搜 stock / Insufficient

WARN 一行接一行:Available stock below threshold (2 units)——库存告急的预警。

ERROR 也不含糊:InsufficientStockException,SKU 对得上,还能点「查看」跳回 Trace。

开箱惊喜收在这儿:日志不再是大海捞针,而是「原因那两行」和链路能对上。

人翻日志容易漏——上游有时还返回 200,真正的 WARN / ERROR 在下游。

问数开局面,诊断给路径,拓扑讲影响,日志钉证据——围着真实遥测转。

日志 WARN

日志分析 · WARN:库存低于阈值,带服务、主机,可回跳 Trace。

日志 ERROR

日志分析 · ERROR:InsufficientStockException 原文可见,和诊断结论对得上。

几下下来,感觉不像在翻产品说明书,更像拆新玩具:问一句,惊喜一下;对不上的,就去面板里再抠一眼。

对运维来说,能少翻几层菜单,就少耽误几分钟排障。

◆ ◆ ◆

3想摸一手的话

公网 Demo 可以直接复现上面几张图,不用先装一整套。

有兴趣的话,建议先打开 Demo 把这几下点一遍——问一句、看结论、再对一下日志面板,比看任何对比表都踏实。

现场就能演示效果;自己摸比听别人安利靠谱。

想自己拉一套,安装脚本也能跑:

curl -fsSL https://www.databuff.ai/databuff/ai-apm-install.sh | bash

应用或 Collector 把 Trace / Metrics / Logs 打到 OTLP 入口即可,常见还是 4317 / 4318

装完别急着炫功能,先把「问一句 → 看结论」走顺,心里就有底了。

路径通了,再谈深不深;通不了,功能再多也只是橱窗。

◆ ◆ ◆

4写在最后

回到标题那句话。

不是 Datadog 买不起,而是「开源版 Datadog」更具性价比。

一套能自建的开源可观测工具。

终于有了能打开 Demo、能跑安装脚本、开箱就能被 AI 惊喜到的落点。

想摸一手的话:先打开公开 Demo,把上面几下复现一遍;觉得对味,再在测试环境跑安装命令。

亲手点一遍,比看任何对比表都踏实。

纸面争论少一点,现场复现多一点。

◆ ◆ ◆

原文:微信原文
了解更多:github.com/databufflabs/databuff