技术博客

阅读约 6 分钟

DataBuff v0.1.6 发版通告

Span 列表查询加速、接口耗时分解新增「接口自身耗时」维度、告警同环比检测修正、AI 稳定性测试,并完善 databuff-proxy 双写迁移路径,SkyWalking 用户业务零改动即可并跑 DataBuff — 含升级指引与两张实拍截图。

DataBuff v0.1.6 已就绪:Span 列表查询加速、接口耗时分解新增「接口自身耗时」维度、告警同环比检测修正、AI 稳定性、工作区文件预览扩展,并完善 databuff-proxy 双写迁移路径,SkyWalking 用户业务零改动即可并跑 DataBuff。相对 v0.1.5:20 commits,本版无 Schema 迁移

本版亮点

  • databuff-proxy 双写迁移:v0.1.6 完善了 SkyWalking→DataBuff 双写迁移路径与稳定性验证,业务零改动(Agent 不换、配置不改、Pod 不重启),平台侧接 databuff-proxy 即可让同一批 Trace 同时进 OAP 和 DataBuff Ingest。
  • 接口耗时分解:接口分析新增「接口自身耗时」维度,把接口自身耗时从下游调用(DB / Redis / MQ / HTTP / RPC)拆出来,慢在自身逻辑还是下游依赖一眼能分。
  • Span 列表查询加速:接口分析 / 链路追踪的 span 列表改用 exact URL 精确匹配、不再单独 count 总数、并对 startTime 做 30 分钟分区裁剪,列表响应更快。
  • 告警同环比检测修正:mutation(同环比)告警尊重 comparePeriodfluctuate 方向(valUp / valDown / yoyUp / yoyDown),不再误判方向。
  • 告警取值与表达式listTagValues 跳过未知 metric tag;eval SQL 覆盖 filter operators。
  • AI 稳定性:brain 多步 handoff 提示改进、剥离 protocol coaching;session 列表/计数 DB-first,Doris 错误时 fail-closed 到内存;model failure 上抛给用户;修复 brain dispatch bug;更新 brain routing 提示词。
  • AI 稳定性测试:5 套 AI 集成测试全部并行(chat/formats/memory/brain + 新增 modelfail),新增专家交互契约测试,修复记忆隔离、模型失败上抛、brain 调度等缺陷。
  • 工作区文件预览:AI 对话工作区在线预览扩展到所有非二进制文件(不再限于 txt/log/csv/json)。
  • 部署与构建:compose health wait 超时提升至 300s;新增 ai-apm-web-base 镜像,web release 跳过 apt 重装。

怎么用:databuff-proxy 双写(SkyWalking 平滑过渡)

已有 SkyWalking 的团队想试 DataBuff,业务侧零改动就能并跑:只在原 OAP 宿主机部署 databuff-proxy 占住 :11800,同一批流量对称抄送两路后端。

  • 业务零改动:Agent 不换、上报地址不改、Pod 不重启。
  • 对称双写:同一批 Trace / JVM / Log 同时进 OAP 和 DataBuff Ingest,不做协议转换。
  • 对照期可回滚:两路 UI 并排看,满意了管理页关 SkyWalking 写入即可。
  • v0.1.6 完善:迁移指南新增方案 B、新增双写稳定性验证文档。
  • proxy 独立仓库github.com/databufflabs/databuff-proxy,单独发布,不在 v0.1.6 主仓代码内。
databuff-proxy 转发监控管理页:入站 5.7k req/s,对称双写至 DataBuff 与 SkyWalking,发送成功 11.4k req/s,丢弃 0
图 1 · databuff-proxy 管理页:同一批流量对称双写两路后端,发送成功约为入站的两倍、丢弃为 0,可随时开关某路写入

迁移步骤见 从 SkyWalking 迁移(方案 B),双写稳定性结论见 proxy 双写稳定性验证

怎么用:接口耗时分解

路径:应用性能 → 接口分析。选中一个 HTTP / RPC / MQ 接口,耗时分解图按时间桶把耗时拆成「接口自身耗时」与各下游组件(DB / Redis / MQ / HTTP / RPC / 远程调用),下游再按对端 service 细分。

  • 接口自身耗时:接口总耗时减去所有下游调用耗时之和。
  • 下游按组件 + 对端 service 拆:例如 HTTP service-bDB [mysql]demo_apmRedis [redis]redis:6379MQ [kafka]order-events
  • 定位瓶颈更直接:响应时间涨,看是自身涨还是某个下游涨,无需逐条翻 Trace。
接口分析耗时分解图:响应时间 240ms,按时间桶拆为接口自身耗时与下游 HTTP/RPC/DB[mysql]/DB[elasticsearch]/Redis/MQ[kafka] 各组件耗时
图 2 · 接口耗时分解:响应时间 240ms,按时间桶拆出接口自身耗时与下游各组件(HTTP / RPC / MySQL / Elasticsearch / Redis / Kafka),自身逻辑和下游依赖各占多少看图即知

怎么用:工作区文件在线预览扩展

路径:AI 平台 → AI 对话。专家执行工具时产出的中间文件会落到工作区,点击即可在右侧在线预览,不用下载到本地。

v0.1.6 把可预览的后缀放开了:除二进制(图片、压缩包、.class.parquet 等)外,.py.sh.yml.sqlDockerfile.md 等文本/代码类文件都能直接看,.md 按 markdown 渲染。交互和 v0.1.5 一样,升级即生效。

重点:AI 稳定性测试

v0.1.6 强化 AI 稳定性测试:新增「模型失败可见性」套件与专家交互契约测试,修复记忆隔离、模型失败上抛、brain 调度等缺陷。5 套全部并行

  • chat 工具参数校验:4 题,覆盖服务/拓扑/慢请求 trace/告警四类工具调用,校验选工具与参数。
  • formats 接入格式:OpenAI Completions + Anthropic Messages 两种接入格式,3 题,验证接入一致。
  • memory 会话记忆:5 用例:巡检多轮记忆/同会话跨专家隔离/问数多轮记忆/大脑多轮记忆/巡检追问生成。
  • brain 大脑异步路由:10 用例:单专家调度/并行调度/专家失败/跨会话隔离/多轮调度/多步巡检-报告/多步延迟巡检-报告/并行巡检+运维/数据→运维/数据+问答。
  • modelfail 模型失败可见性(v0.1.6 新增):3 用例:单专家运维/单专家数据/多专家级联,失败上抛给用户而非静默吞掉。

Java 侧新增专家交互契约测试(BuiltInExpertInteractionContractIntegrationTest 486 行、ExpertMessageContractTest 183 行)。

安装与升级

新装请按 Docker 安装部署;已有环境换版本请按 升级与卸载。本版无 Schema 迁移,升级即替换镜像并重启;K8s 本版不支持原地升级,需卸载后重装。

# 新用户安装(全新安装,会清理旧安装目录与 data/)
curl -fsSL https://databuff.ai/databuff/ai-apm-install.sh | bash

# 现有用户升级(就地升级,保留 data/ 观测数据)
curl -fsSL https://databuff.ai/databuff/ai-apm-update.sh | bash

体验与反馈

GitHub Release v0.1.6 · 在线 Demo · 给项目 Star