动态
精选文章
精选文章
DeepSeek 状态页迁移:从 Atlassian 到 Flashduty
DeepSeek 把公开状态页从 Atlassian Statuspage 迁到了 Flashduty Statuspage。选型看的不只是页面样式,还包括中文、成本、可信度、订阅迁移和故障时的可用性。
Flashduty 支持团队


AI SRE 和你的 Agent 可以互相派活了
在控制台登记一个外部 Agent,AI SRE 就能把任务整个派过去,进度流式地回到对话里;反过来,AI SRE 自己也提供标准 A2A 接口,可以接受别的 Agent 派活。
Flashduty 工程团队

让 AI SRE 安全地访问你的 Kubernetes 集群:不开公网,不交 kubeconfig
把集群接进 AI SRE,我们要三件事同时成立:不开公网、权限收得紧、不做能力表。最后的做法是让 Agent 跑真的 kubectl,但由你的集群主动连出来,权限全部交给 Kubernetes 自己判。
Flashduty 工程团队

介绍 AI SRE Artifacts:把结果留下来,发出去
AI SRE 会话里产出的报告、设计文档和页面现在能发布成产物。产物就做两件事:留下来,有独立地址长期放在产物库里,团队随时能打开;发出去,一条免登录的公开链接谁都能点开。
Flashduty 产品团队

凌晨三点,它已经开工了:AI SRE 自动化的五种用法
每周洞察、告警治理、故障自动分析、发版后巡检、变更风险预检——五种用法各附完整的任务提示词原文,以及跑完之后结果怎么通知到人。
Flashduty 产品团队

介绍 GitHub / GitLab App:AI SRE 可以读你的代码仓库了
AI SRE 现在可以连接你的 GitHub 组织或 GitLab 实例:排障时自己读最近的提交,CI 红了自己翻失败日志,小修小补直接开好 PR 等你评审。全程不用粘贴令牌。
Flashduty 产品团队

从 MCP 到 CLI:AI SRE 怎么操作整个 Flashduty
一月我们把内置 MCP 挂进 Agent 的每个会话,五月底换成了命令行。为什么没有扩充 MCP,为什么放弃了搜索式加载,切换之后又付出了哪些代价。
Flashduty 工程团队

从真实用户报错到修复 PR:RUM × AI SRE 的 8分钟
一名用户在监控规则创建页遇到 3 次前端异常。RUM 留下会话与版本,并通过 SourceMap 还原到具体源码;AI SRE 随后定位仓库、完成一行修复并创建 PR。
Flashduty 工程团队

告警发到群里,不等于故障有人负责
很多团队从群机器人开始做告警治理,但群消息只解决可见性,不解决责任。真正的 On-call 响应要留下 owner、认领、升级、关闭、时间线和复盘。
Flashduty 产品团队

写给人,也写给 AI 的命令行
我们为什么给一个故障响应平台做命令行工具,又为什么把它做成 AI 编程 Agent 操作 Flashduty 的入口。一篇关于 CLI 设计取舍的工程笔记。
Flashduty 工程团队

SDK 不该比 API 更聪明
go-flashduty 是 Flashduty Open API 的官方 Go 客户端:薄、强类型、由 OpenAPI 规范代码生成。我们想聊聊一个覆盖 27 个服务、253 个接口的 SDK 该如何设计与长期维护:为什么选 codegen 而非手写,为什么坚持与 API 严格 1:1,以及这条边界如何让 SDK 多年不腐化。
Flashduty 工程团队

我们不再手写文档
一个没有专职产品经理的小团队,靠一个 AI agent 找出数百个文档缺口、补齐内容并提交 PR。解决办法不是反复提醒工程师写文档,而是让漂移及时暴露出来。
Flashduty 工程团队

如何把告警风暴变成可处理故障:一套告警降噪实践
本文介绍 Flashduty 告警降噪实践,从事件、告警、故障模型出发,梳理标签增强、Pipeline 清洗、告警聚合、风暴预警、抖动检测、静默、抑制和 14 天验证方法。
Flashduty 支持团队

PagerDuty 太贵?100 人技术团队的 On-call 成本怎么算
本文从处理人、通知接收人、License 席位、通信额度和 Add-ons 等维度,拆解 100 人技术团队评估 PagerDuty 与 Flashduty On-call 成本时容易算错的关键问题。
Flashduty 产品团队

Alertmanager 够用吗
从告警路由、值班表、自动升级、故障对象、IM 协同和数据化管理几个维度,拆解 Prometheus Alertmanager 与专业 On-call 平台的职责边界,并给出一张选型对比表和接入 Flashduty 的具体路径。
Flashduty 产品团队

Flashduty Monitors 支持 Loki 和 VictoriaLogs
Flashduty Monitors 支持 Grafana Loki 和 VictoriaLogs 数据源,保留原生查询语法,并提供三种告警模式、独立恢复逻辑和告警中的日志原文样例。
Flashduty 工程团队

排班只是 On-call 的开始
告警集成、标签增强、聚合降噪、告警抑制、排班升级、认领协同、通知统计。把 On-call 的每个环节讲清楚,也讲清楚每个环节该怎么取舍、哪里容易踩坑。
Flashduty 产品团队

期货行业的 On-call 实践
期货行业有多时段交易、高实时性和高风险要求。把管理机制、技术要求和运营机制落到统一的监控事件响应平台,可以提升告警响应速度,降低运维压力。
Flashduty 支持团队

别让 On-call 累垮老实人
很多团队号称全员 On-call,结果最后是最有责任心的那个人干最多的活、拿最普通的绩效,然后离职。怎么把 On-call 做得既公平又可持续,这里有一套办法和一份避坑清单。
Flashduty 产品团队

Google 和 Datadog 怎么做 On-call
Google 把 Borg 开源成了 Kubernetes,把 Borgmon 开源成了 Prometheus,那它内部的 On-call 工具 Outalator 呢?我们拆开 Google SRE 与 Datadog 两套成熟实践,看清 On-call 真正的难点不在工具,并谈谈国内团队能借鉴什么。
Flashduty 产品团队