统计各服务每秒 5xx 请求数
sum by (service) (rate(http_requests_total{code=~"5.."}[5m]))
一条规则,覆盖每一套环境
边缘引擎部署在你的机房、云上 VPC 或 Kubernetes 里,就近查询本地数据源,原始数据不用搬出网络。一条规则按名称通配绑定多套数据源,改一次阈值,所有环境一起生效。
Flashduty Monitors
一条规则
API 5xx rate
数据源:prom-*
工厂 A
华东机房
海外 VPC
数据不出网络
引擎在本地查询,原始数据不用复制到云端
引擎失联也会告警
整个集群没了心跳,第一时间通知你
引擎自动接管
同一集群多实例互为备份,不会重复告警
超阈值、有数据、没数据,都能告警
阈值判定、数据存在、数据缺失三种模式,Critical、Warning、Info 三级一起评估;恢复可以用单独的查询来确认,而不只是“数值降下来了”。写不出查询语句,就让 AI 帮你写。
编辑告警规则
查询 A
AI 帮我写
统计各服务每秒 5xx 请求数
导入规则
- Prometheus Rules YAML
- 夜莺 v6–v9 规则 JSON
- Flashduty 规则 YAML / JSON
导入后默认停用,确认无误再启用
判定方式够用
超过阈值、出现了、不见了,都能告警
恢复有依据
用独立查询确认业务真正恢复
描述自带上下文
用模板变量把当前值和标签写进告警
规则再多,也一眼看清哪里在响
规则按目录树组织,节点上直接汇总活跃告警和执行失败;实体树从 Prometheus 查询结果里自动发现主机、Pod 与数据库实例,规则挂在分组上,新实例出现就自动套用。
告警规则
实体树
状态一目了然
哪组在告警、哪条执行失败,树上就能看到
规则跟着实体走
新实例上线,分组规则自动生效
权限按目录继承
每个团队管好自己的那部分规则
排查时,查询只有一个入口
不用再记每套环境的地址和账号。在查询工作台里直接查 Prometheus、Loki、VictoriaLogs、SLS、CLS 和各类数据库;从告警点「去查询」,语句和时间窗口自动带上。
一个入口
所有数据源在同一个界面里查
带着现场来
从告警跳转,查询和时间窗口自动填好
结果好分享
查询历史和分享链接,协作不用截图
告警直达值班人,AI SRE 接着查
Monitors 产生的告警原生进入 Flashduty On-call,在协作空间里完成降噪、分派和升级;Redis、MongoDB、Kafka 这类诊断型数据源交给 AI SRE,排障时可以直接去查。
规则命中
边缘引擎按频率执行规则
On-call 分派
聚合降噪,通知当值的人
AI SRE 排查
查询指标、日志与诊断数据源
自动恢复
恢复条件成立,告警自动关闭
原生对接
不用配 Webhook,告警带着标签进协作空间
降噪交给 On-call
聚合、静默、抑制在一处配置
重复通知可控
按间隔和次数提醒,不被同一条刷屏