跳至主内容

动态

精选文章

DeepSeek 状态页迁移:从 Atlassian 到 Flashduty

DeepSeek 把公开状态页从 Atlassian Statuspage 迁到了 Flashduty Statuspage。选型看的不只是页面样式,还包括中文、成本、可信度、订阅迁移和故障时的可用性。

Flashduty 支持团队

阅读全文
DeepSeek 状态页迁移:从 Atlassian 到 Flashduty
  • 状态页嵌入组件(Widget):把服务状态,放到你的用户眼前

    当服务出现故障时,用户的第一反应往往是打开你的官网或帮助中心寻找答案。如果状态页藏在一个他们不知道的地址里,再及时的状态更新也难以触达。

    Flashduty 状态页正式推出 嵌入组件(Widget):一段可以直接粘贴到任意网站 HTML 中的代码,把状态页的实时状态展示在你的官网、帮助中心或内部系统里,让用户在你自己的页面上第一时间看到服务状态。

    两种形态,适配不同场景

    • 状态徽标(Badge):常显当前整体状态的小组件,支持三种尺寸,点击即可跳转完整状态页,适合长期放在页脚或帮助中心首页。
    • 事件横幅(Banner):平时完全隐藏,只在发生故障或维护时出现在页面顶部或底部;访客可以手动关闭,计划维护开始前 24 小时也会自动提前展示,让你的用户早做准备。

    开箱即用,外观可配

    状态页详情 → 设置 → 嵌入组件 中,可以配置主题(自动 / 亮色 / 暗色)、语言(中文 / English)、徽标尺寸与横幅位置,实时预览效果后一键复制嵌入代码。Widget 以 Web Component 形式运行,样式与宿主页面完全隔离,每 30 秒自动刷新状态,页面隐藏时自动暂停以节省请求。

    公开 JSON 接口,集成方式不止一种

    除了现成组件,每个公开状态页还提供无需密钥的状态摘要接口 GET {状态页地址}/api/widget/v1/summary.json,支持 CORS 与 ETag。你可以据此自行渲染状态、接入内部监控大屏,或集成到任何自有系统中。

    嵌入组件对所有公开状态页默认开启,无需任何配置即可使用。

    立即体验

    前往 Flashduty 控制台 → On-call → 状态页,打开任意公开状态页的「设置 → 嵌入组件」即可生成嵌入代码。

    更多介绍请参考产品文档

  • 产物支持公开链接:把报告发给没有账户的人

    产物库上线后,分享一份 Agent 产出的报告有个前提:对方得先登录同一个 Flashduty 账户。可真正要看这份报告的人,往往正好在账户外面——客户、外部协作方、还没开通账户的同事,或者一个需要贴进工单的链接。

    公开链接现在可用。在产物详情页点击 分享,把可见权限从 仅账户内 切到 公开链接,生成后任何拿到链接的人都能直接打开,不需要登录,也不需要 Flashduty 账户。

    看到的是快照,不是实时内容

    公开链接展示的是你生成链接那一刻的内容快照。产物之后被 Agent 更新,公开链接不会自动跟着变——这是有意的:你分享出去的东西不会在背后悄悄改动。当系统检测到产物已有新版本时,分享面板会出现 更新快照,点一下就把公开内容同步到最新,而链接本身保持不变,已经发出去的链接不会失效。

    不想再公开时,点 撤销公开链接,链接立即失效。

    生成前会先提醒你

    公开意味着不可控转发,所以生成前会有一次明确提示:任何拿到链接的人都可以查看,链接也可能被继续转发,请勿分享密钥、个人信息或未经授权的第三方内容。分享面板顶部还会列出这份产物的管理权限,让你清楚谁能改动它的分享状态。

    体积超过 16 MiB 的产物不支持生成公开链接,这类产物仍可用「仅账户内」方式分享。

    能发布的文件类型也变多了

    产物不再局限于 HTML 与 Markdown。图片、PDF,CSV / JSON / YAML / XML 等数据文件,Python / Go / TypeScript / SQL 等常见源码文件,以及 zip / tar.gz 压缩包,现在都可以发布到产物库,卡片会按类型显示对应图标。

    开始使用

    前往 Flashduty 控制台 → AI SRE → 产物,打开任意一份产物,点击右上角 分享

    更多介绍请参考产品文档

    本功能面向 On-call 专业版及以上账户,随 AI SRE 公测一并开放。

  • ServiceMap 服务地图(Beta):这台机器此刻在和谁通信

    排查故障时经常要回答一个问题:这台机器到底在跟谁说话?架构图里写的依赖,和线上此刻真实存在的依赖,常常不是一回事——服务下线了图没删,新加的调用没人补图,容器漂移之后更对不上。于是只能登上主机,一个个看连接。

    ServiceMap(Beta) 换了个做法:不依赖任何手工维护的图,直接用 monit-agent 通过 eBPF 观测到的真实网络连接,自动构建主机、进程、容器与工作负载之间的依赖拓扑。它展示的是此刻实际在通信的对象,而不是文档里应该通信的对象。

    把「一次连接」变成「一条服务依赖」

    Agent 观测到的原始事实是「某个进程连了某个 ip:port」。ServiceMap 会把这个目标端点匹配到同一网络作用域内的已知监听者,从而还原出服务级依赖,并标注可信程度:唯一匹配的记为已确认;匹配到多个可能对端的记为候选,需要你结合上下文判断;匹配不到任何监听者的记为未解析,默认不进画布,避免外部地址和短暂连接淹没真实依赖。

    画布上可以按解析状态筛选、调整上下游跳数、双击任意节点进入聚焦模式只看它的邻居。点开节点或依赖,右侧面板会给出实体身份、可执行文件、容器与工作负载、目标端点、解析原因、候选数量与置信度等字段——判断一条依赖能不能信,看的就是这些。

    未解析的连接不会被藏起来

    匹配不到对端的端点会按原因分组收进独立面板,支持按端点或来源服务过滤,也可以一键导出 CSV 拿去线下核对。你还可以从这里「定位来源」,回到画布上高亮出是谁发起了这条连接。

    先告诉你这张图可不可信

    拓扑来自近期观测窗口内的证据,不是实时快照,也不保证完整。所以查询信息里会明确给出采集模式、证据新鲜度、监听清单与 Kubernetes 元数据的富化状态,以及本次查询是否触发了截断。新鲜度不是 fresh、或者出现截断提示,就说明这张图不能当作完整实时的依赖关系直接下结论——把判断依据摆出来,比给一张看起来很确定的图更有用。

    开始使用

    前往 Flashduty 控制台 → 监控告警 → 监控对象,在主机行点击 拓扑,或用工具栏的 ServiceMap 主机 浏览全部已上报主机。

    ServiceMap 目前处于 Beta 阶段,功能与界面可能继续调整;它依赖 monit-agent 的 eBPF 观测能力,Agent 版本过低、运行环境不支持或未启用时不会有拓扑数据。

    更多介绍请参考产品文档

  • AI SRE 全量开放公测:无需申请,登录即用

    AI SRE 结束灰度,向所有 Flashduty 账户全量开放公测。

    从今天起:

    • 无需申请——公测申请表和白名单流程已移除,所有账户默认可见 AI SRE 入口;
    • 登录即用——进入 Flashduty 控制台 → AI SRE,选一条最近的真实告警,让它先查;
    • 公测期间免费——不单独计费;正式商用前会提前通知计费方式,未经确认不会自动产生费用。

    如果你的团队在用飞书、Slack、钉钉或企业微信:为故障开启作战室后,AI SRE 会自动跑一轮初步诊断,把结论回贴到群里;在群聊里 @ 它即可继续追问。

    第一次上手建议从快速开始走一遍:绑定一条故障、看它给出带证据链的结论,大约五分钟。产品全貌见 AI SRE 产品介绍

  • 产物库上线:Agent 做的报告不会随对话消失

    Agent 在会话里生成的一份报告,比如输入 /insight 得到的运营洞察,看的时候很有用,关掉对话框往往就找不回了,只能翻聊天记录,或者让 Agent 重新跑一遍。

    产物库现在上线,集中存放 Agent 在会话中用 present_files 产出、再经 publish_artifact 发布的网页与报告,支持搜索、按范围筛选、重命名、分享、下载和删除。

    发布出自会话,不是手动上传

    产物库本身没有创建文件的入口,产物都来自 Agent 在会话中的产出。有两条路径:点击产物库页面的新建产物,会跳到会话页并预填一段引导草稿,Agent 先确认目标读者、内容来源、交互和视觉风格再动手构建和发布;或者更直接,任意一次会话里用 present_files 展示出的文件旁边都带一个发布到产物库按钮,把已经产出的内容直接发出去。

    编辑后自动刷新,权限跟着作用域走

    产物初始继承来源会话的作用域:个人会话产出属于创建者,绑定了团队的会话产出属于该团队,可分享给账户内其它成员查看,之后还能在个人和可访问的团队之间转移作用域。如果 Agent 之后编辑了同一份源文件并重新展示,已发布的产物会跟着刷新版本,不需要手动重新发布。能不能重命名、改范围、删除,取决于你和这份产物的关系:创建者本人、账户 Owner 与管理员,以及团队产物下的其它团队成员都能管理;没有管理权限时,只保留复制链接、下载这类只读操作。

    IM 和 API 里,默认还是先给你文字

    网页控制台会在聊天里把产物渲染成卡片。但在 IM、API、自动化这些渠道,Agent 默认仍然先给纯文本回复,只有在你明确要求保存或分享,或者内容本身离不开图表、长表格这类富排版时,才会发布产物并把链接写进回复里。多数场景下,一条清楚的文字回答比一个额外的链接更省事。

    开始使用

    前往 Flashduty 控制台 → AI SRE → 产物

    更多介绍请参考产品文档

    本功能面向 On-call 专业版及以上账户,随 AI SRE 公测一并开放。

  • Kubernetes App:把集群接进 AI SRE,权限收在你划的那条线里

    排查一个 Pod 反复重启的问题,光看监控和日志经常不够,还得看 Pod 的当前状态、事件和最近的变更,这类信息通常只在集群里,Agent 拿不到。

    Kubernetes App 现在上线,把集群接入 AI SRE 的调查流程。它和接入代码仓库用的 GitHub App、GitLab App 是同一套机制,都是 Customize 下的 App,只是这次接的是集群而不是仓库。

    权限收在 namespace 这一级

    创建 Kubernetes App 时先填集群名称,选范围:共享给账户内任意会话使用,或者团队只给该团队的会话和团队成员的个人会话使用。namespace 上有两种选法:选全部 namespace,把同一权限套用到当前和以后新增的 namespace;或者选指定 namespace,为每个 namespace 单独选只读还是读取 + 有限修改。不填具体 namespace 的话,Agent 只能读到集群的基础元数据,看不到 workload 细节。装一个 App,不等于把整个集群的权限交给了 Agent。

    安装命令你自己执行,控制台不代劳

    保存配置后,控制台会生成一条安装命令,拿到目标集群里自己执行。命令会过期,过期了回控制台重新打开配置或查看 Manifest 就能拿到新的,不需要换 Token。改了 namespace 或权限范围之后,要重新执行一次安装命令,集群里的 RBAC 才会同步更新。

    撤销和卸载是两步

    在控制台撤销会立即让连接和 Token 失效,但集群里已经装的 Agent 和 RBAC 资源不会跟着自动清掉,需要用控制台给出的卸载命令,在对应集群里手动执行。卸载命令只清理这一个 Kubernetes App 装的资源,共享的 flashduty namespace 不受影响。

    开始使用

    前往 Flashduty 控制台 → AI SRE → 插件 → Apps → Kubernetes App

    更多介绍请参考产品文档。具体是怎么做的,为什么 Agent 跑的是真的 kubectl、为什么由你的集群主动连出来而不是开端口,写在让 AI SRE 安全地访问你的 Kubernetes 集群

    本功能面向 On-call 专业版及以上账户,随 AI SRE 公测一并开放。

  • AI SRE 的运行环境:云端 Sandbox 与你内网的 Runner

    一个只会给建议的 Agent,和一个能自己去查的 Agent,差别在于它有没有地方动手。

    AI SRE 的每次调查都在一个真实的执行环境里进行:跑命令、调接口、处理数据、生成报告。这个环境有两种形态,按你的系统在哪里选。

    云端 Sandbox:开箱即用

    默认形态,由 Flashduty 托管,会话开始时按需创建,隔离运行。里面预装了排障常用的命令行工具,Agent 可以直接读写文件、执行脚本、调用公网 API。你还可以为云端环境配置出网白名单、环境变量和初始化脚本,让每个新建的 Sandbox 都符合团队约定。

    BYOC Runner:把执行放进你的网络

    如果需要调查的系统在内网,公网环境到不了。这时可以在自己的机器上部署 Runner,让 Agent 在你的网络内部执行。

    连接方向是从 Runner 主动向外建立的,你不需要为它开放任何入站端口,也不需要把内网地址暴露到公网。Runner 自带排障要用的工具链,包括 rgjqgh 以及 Node 和 Python 运行时,安装后不必再逐个装依赖。它支持全平台自动更新,跟随服务端能力演进,不需要你手动升级。

    执行边界仍然由你划定

    无论在哪种环境里,Agent 的写操作范围、可访问的凭证、能触达的网络都按你的配置执行。生产变更、重启、回滚和对外通知一律等待人工确认。

    开始使用

    前往 Flashduty 控制台 → AI SRE → 环境,顶部可切换自托管与云端两个标签页。

    更多介绍请参考产品文档

    本功能面向 On-call 专业版及以上账户,随 AI SRE 公测一并开放。

  • AI SRE 接入代码仓库:调查可以一直追到那次改动

    故障调查经常卡在同一个地方:日志指向某个函数,但没人能立刻说清那几行代码最近被谁改过、为什么改。

    AI SRE 现在支持接入代码仓库。GitHub AppGitLab App 均已可用,其中 GitLab App 在经历一段白名单灰度后,已面向全部账户开放。

    把调查延伸到源码

    授权之后,Agent 可以 clone 仓库、检索代码、阅读提交历史和 PR 讨论。遇到堆栈里的陌生函数,它会直接去仓库确认实现,而不是靠模型印象作答。它也会优先读取仓库自带的约定文件,比如 CLAUDE.mdAGENTS.md,按你团队的规矩行事。

    从报错追到那次改动

    结合 Flashduty 的变更记录和仓库提交历史,Agent 能把一次异常和引入它的那次提交对应起来。我们记录过一个真实例子:用户在页面上连续触发三次前端异常,RUM 保留了会话和 SourceMap 堆栈,AI SRE 由此定位到仓库中的一处表单初始化问题,完成一行修复并提交 PR,从最后一条报错算起用了 8 分钟。完整过程见这篇记录

    需要时才提交 PR

    Agent 不会自作主张改代码。只有你在会话中明确要求修复时,它才会创建分支、提交改动并开 PR,交由你的团队走正常的评审流程合并。是否值得进代码仓库,这个判断仍然在人手里。

    令牌按轮次注入

    仓库访问令牌在每一轮工具调用时注入执行环境,云端 Sandbox 和你自建的 BYOC Runner 走同一条路径。授权记录保存在 Flashduty,令牌支持轮换,你可以随时在控制台解除授权。

    开始使用

    前往 Flashduty 控制台 → AI SRE → 插件 → Apps,选择 GitHub 或 GitLab 完成授权。

    更多介绍请参考产品文档

    本功能面向 On-call 专业版及以上账户,随 AI SRE 公测一并开放。

  • AI SRE 开放公测:告警之后,先让 Agent 跑完第一轮调查

    值班工程师收到告警后的头十分钟,多数时间花在拼凑上下文,而不是判断。

    告警在监控平台,故障时间线在 Flashduty,服务变更在发布系统,指标和日志各有入口,排障步骤写在团队文档里。把这些内容复制进一个通用对话框,它能讲清楚「连接池耗尽通常有哪些原因」,但它不知道这次是哪项变更引起的、哪几个实例在异常。

    AI SRE 现在面向 On-call 专业版及以上账户灰度开放公测。此前几个月它在内测中处理真实告警,现在把入口打开。

    会话不从空白开始

    在控制台新建对话时输入 @ 可以引用故障,Agent 会带着这条故障关联的告警、服务、团队和值班信息进入会话,据此规划调查步骤,而不是先反问你发生了什么。从 IM 召唤时同理,作战室里的讨论也在它的视野内。

    它能调用你已经接入的工具

    通过 MCP 连接器接入监控、日志、云平台等外部系统,内置目录目前有 35 个可选连接器。团队自己的排障方法可以写成 Skill 复用,系统背景写进知识库,Agent 在后续调查中会直接使用,不需要每次重新交代。

    执行环境可以放进你的内网

    默认在 Flashduty 托管的云端 Sandbox 里执行。如果调查需要访问内网系统,可以在自己的网络里部署 BYOC Runner,由它主动向外建立连接,你不需要为此开放任何入站端口。

    生产操作停在人这里

    Agent 完成调查、给出根因判断和处置建议,但变更、重启、回滚以及对外通知仍然由你确认后执行。这条边界不随公测调整。

    开始使用

    前往 Flashduty 控制台 → AI SRE → 新对话

    更多介绍请参考产品文档

    AI SRE 已全量开放公测,无需申请,登录控制台即可使用。公测期间不单独收费,功能与界面可能继续调整。

  • RUM 查看器支持自然语言查询

    在 RUM 查看器里想筛一次「Chrome 上耗时超过 2 秒的报错」,得先知道字段名怎么写、操作符怎么组合。不常用 DQL 的人,往往卡在这一步,只能先去翻语法文档。

    现在查看器支持直接用一句话描述你想找什么。无论是筛 Session,还是 View、Resource、Error 等各类事件,AI 都会把描述转成对应的 DQL 查询条件。

    输入一句话,AI 生成查询条件

    点击查询框左侧的 AI 自然语言查询 图标,或在普通模式下按 ⌘+Enter(Windows/Linux 是 Ctrl+Enter),输入框会切换成自然语言输入。回车后 AI 给出一段预览:生成的 DQL 以代码片段展示,应用前就能看到、能复制;如果这次描述更适合别的事件类型,预览里会单独标出「事件类型」这一项变更。点击应用,DQL 会写进查询框,之后跟手写的查询没有区别,可以继续编辑,应用后的提示条里还带一个「撤销」。

    时间表述按你的时区解析,但最长查 14 天

    「过去一小时」「昨天」这类时间描述会按账户所在时区换算,直接更新时间选择器,不会被写成查询条件里的字段。如果描述的时间跨度超过 14 天,比如「过去一个月」,会自动截断到最近 14 天,预览里会提示已截断。这个上限和查看器本身能查的最大范围一致,不是自然语言查询单独设的限制。

    开始使用

    打开 RUM 查看器,点击查询框左侧的 AI 图标即可尝试。详见产品文档

  • 自定义故障表单:创建、认领、关闭都能收集你要的信息

    故障认领的时候想让处理人填一句说明,关闭的时候想确认影响范围,此前只能在群里或工单系统里另外要求,Flashduty 里没有地方收这些信息。

    自定义故障表单现在支持为创建故障认领故障关闭故障三个动作分别配置一份表单。表单里可以放自定义字段、说明文本、图片上传,每个元素能单独设置是否必填,也能设置只在满足条件时才显示,比如只在严重等级为高时才要求填写影响范围。

    跟着故障状态一起落盘

    认领表单、关闭表单的提交和故障状态变更是原子写入的,不会出现表单点了提交、故障状态却没跟着变的情况,也不会出现状态变了但填写的内容丢了。

    五个 IM 平台统一一套界面

    钉钉、飞书、Slack、Microsoft Teams、企业微信里点认领或关闭按钮,弹出的都是同一套 Console H5 表单抽屉,不用每个平台单独适配一遍表单逻辑,处理人在哪个 IM 里操作体验都一样。

    配置页和列表页重做

    字段配置和表单管理的页面做了重新设计,字段顺序可以拖拽调整,点击某一行就能改它的显示条件、必填规则和帮助文案。

    移动端一并修复

    移动端 App 上,如果某个动作没有配置表单,认领和关闭不再跳转到空表单页,直接按原流程执行。

    开始使用

    前往 Flashduty 控制台的故障配置页面,进入自定义表单

    更多介绍请参考产品文档

  • 登录治理更新:密码登录、密钥权限、账号清理一起收紧

    企业上线一款 SaaS 工具之前,安全负责人的审计清单里几乎都会问到:密码登录能不能关掉、API 密钥的权限能不能收窄到最小、登录失败有没有防护、员工离职后账号怎么处理。

    这些问题过去分散在不同版本里逐步解决,这次一并说明。以下四项更新分别对应登录、密钥授权、私有化环境和成员管理,SaaS 与私有化部署的覆盖范围不完全一致,具体差异见各段。

    强制 SSO,关掉密码登录

    平台管理 → 单点登录 中配置 SAML2.0、OIDC 或 CAS 协议后,可以开启「成员仅支持 SSO 登录」。开启后账户内成员只能通过身份提供商登录,密码和验证码登录会被拒绝,首次配置 SSO 时该开关默认已打开。私有化部署额外支持 LDAP 协议接入同一开关。

    App Key 从「全量授权」改成按需勾选

    以前 APP Key 只能生成一把能调用全部接口的钥匙。现在创建或编辑时可以选自定义权限,只勾选这把 Key 实际要用的接口范围,超出范围的调用会被拒绝,即使选全部权限也仍受创建者角色权限约束。已有 Key 也能重新编辑权限范围,配合定期轮换,缩小密钥暴露面。

    私有化部署:登录防爆破,会话时长可配置

    私有化部署环境下,登录失败次数超过限制会触发图形验证码,降低密码被暴力枚举的风险;会话过期时长也开放为可配置项,团队可以按自己的安全策略设定登录会话的有效期,不再固定用同一个默认值。这两项目前只在私有化部署提供,SaaS 版本不涉及。

    身份映射更严谨,成员删除更彻底

    SSO 场景下,用户 ID 映射改为可选,并移除了 provider_key 身份维度,减少身份提供商字段变化导致的登录异常;多个新成员同时 SSO 首次登录(JIT 建号)时,建号逻辑改为串行,避免并发重复建号。团队与成员页面的删除成员操作,配套了更完整的清理逻辑,减少删除后遗留的关联数据。

    开始使用

    强制 SSO 的开关在 平台管理 → 单点登录,详见单点登录文档。自定义权限的 App Key 在 账户设置 → APP Key 创建,详见 Open API 文档。成员删除入口在 平台管理 → 成员管理,详见成员管理文档

    私有化部署的登录防爆破和会话时长配置,请联系我们的技术支持获取部署指引。