指标、日志、链路与告警分散在多套系统,排查时来回切换、上下文丢失;重复告警淹没关键事件,值班人员疲于应对;根因定位依赖专家个人经验,MTTR 居高不下;例行巡检靠手工执行,范围不一致,结论难以沉淀。
SupPulse 连接指标、日志、链路、告警与变更上下文,在同一个控制台完成查询、下钻与关联。AI 辅助诊断按需调用观测工具,逐步收集证据并形成根因假设;定时巡检按计划检查已接入的基础设施,生成可回看的报告并推送到团队消息渠道。它保留现有的数据源与采集工具,不要求迁移观测存储。
核心能力
- AI 辅助诊断与问答:用自然语言发起排查,Agent 调用观测工具逐步取证并形成根因假设;支持多模型配置、专家技能与 MCP 接入,保留会话历史与智能体审计记录
- 一体化可观测性:在一个控制台查询指标(PromQL)、日志(Elasticsearch / Loki)、链路与仪表盘;APM 提供服务拓扑与 RED 指标,可下钻到 Trace 与 Span
- 基础设施定时巡检:按 Cron 与时区设置计划,自定义检查范围,也可立即执行;报告留存,并推送至飞书、钉钉、企业微信或 Webhook
- 异常检测与关联降噪:动态基线与告警规则识别异常,按规则标签关联上下游告警,设置等待窗口并抑制下游通知;支持仅观察、正式执行与紧急放行,决策过程可审计
- 事件中心与运维图谱:集中接入 GitLab、Jenkins、ArgoCD、Kubernetes 等变更与运行事件,提供检索与时间线;启用运维图谱(可选,需 Neo4j)后,AI 可通过只读工具查询服务上下游与近期变更
- 边缘采集与平台治理:以 OpenTelemetry Collector 与 OpAMP 管理采集节点,插件接入主机、中间件、网络与数据库;提供多租户、IAM、审计与配置版本管理