跳至主内容

动态

精选文章

DeepSeek 状态页迁移:从 Atlassian 到 Flashduty

DeepSeek 把公开状态页从 Atlassian Statuspage 迁到了 Flashduty Statuspage。选型看的不只是页面样式,还包括中文、成本、可信度、订阅迁移和故障时的可用性。

快猫技术

阅读全文
DeepSeek 状态页迁移:从 Atlassian 到 Flashduty
  • AI SRE 全量开放公测:无需申请,登录即用

    AI SRE 结束灰度,向所有 Flashduty 账户全量开放公测。

    从今天起:

    • 无需申请——公测申请表和白名单流程已移除,所有账户默认可见 AI SRE 入口;
    • 登录即用——进入 Flashduty 控制台 → AI SRE,选一条最近的真实告警,让它先查;
    • 公测期间免费——不单独计费;正式商用前会提前通知计费方式,未经确认不会自动产生费用。

    如果你的团队在用飞书、Slack、钉钉或企业微信:为故障开启作战室后,AI SRE 会自动跑一轮初步诊断,把结论回贴到群里;在群聊里 @ 它即可继续追问。

    第一次上手建议从快速开始走一遍:绑定一条故障、看它给出带证据链的结论,大约五分钟。产品全貌见 AI SRE 产品介绍

  • 产物库上线:Agent 做的报告不会随对话消失

    Agent 在会话里生成的一份报告,比如输入 /insight 得到的运营洞察,看的时候很有用,关掉对话框往往就找不回了,只能翻聊天记录,或者让 Agent 重新跑一遍。

    产物库现在上线,集中存放 Agent 在会话中用 present_files 产出、再经 publish_artifact 发布的网页与报告,支持搜索、按范围筛选、重命名、分享、下载和删除。

    发布出自会话,不是手动上传

    产物库本身没有创建文件的入口,产物都来自 Agent 在会话中的产出。有两条路径:点击产物库页面的新建产物,会跳到会话页并预填一段引导草稿,Agent 先确认目标读者、内容来源、交互和视觉风格再动手构建和发布;或者更直接,任意一次会话里用 present_files 展示出的文件旁边都带一个发布到产物库按钮,把已经产出的内容直接发出去。

    编辑后自动刷新,权限跟着作用域走

    产物初始继承来源会话的作用域:个人会话产出属于创建者,绑定了团队的会话产出属于该团队,可分享给账户内其它成员查看,之后还能在个人和可访问的团队之间转移作用域。如果 Agent 之后编辑了同一份源文件并重新展示,已发布的产物会跟着刷新版本,不需要手动重新发布。能不能重命名、改范围、删除,取决于你和这份产物的关系:创建者本人、账户 Owner 与管理员,以及团队产物下的其它团队成员都能管理;没有管理权限时,只保留复制链接、下载这类只读操作。

    IM 和 API 里,默认还是先给你文字

    网页控制台会在聊天里把产物渲染成卡片。但在 IM、API、自动化这些渠道,Agent 默认仍然先给纯文本回复,只有在你明确要求保存或分享,或者内容本身离不开图表、长表格这类富排版时,才会发布产物并把链接写进回复里。多数场景下,一条清楚的文字回答比一个额外的链接更省事。

    开始使用

    前往 Flashduty 控制台 → AI SRE → 产物

    更多介绍请参考产品文档

    本功能面向 On-call 专业版及以上账户,随 AI SRE 公测一并开放。

  • Kubernetes App:把集群接进 AI SRE,权限收在你划的那条线里

    排查一个 Pod 反复重启的问题,光看监控和日志经常不够,还得看 Pod 的当前状态、事件和最近的变更,这类信息通常只在集群里,Agent 拿不到。

    Kubernetes App 现在上线,把集群接入 AI SRE 的调查流程。它和接入代码仓库用的 GitHub App、GitLab App 是同一套机制,都是 Customize 下的 App,只是这次接的是集群而不是仓库。

    权限收在 namespace 这一级

    创建 Kubernetes App 时先填集群名称,选范围:共享给账户内任意会话使用,或者团队只给该团队的会话和团队成员的个人会话使用。namespace 上有两种选法:选全部 namespace,把同一权限套用到当前和以后新增的 namespace;或者选指定 namespace,为每个 namespace 单独选只读还是读取 + 有限修改。不填具体 namespace 的话,Agent 只能读到集群的基础元数据,看不到 workload 细节。装一个 App,不等于把整个集群的权限交给了 Agent。

    安装命令你自己执行,控制台不代劳

    保存配置后,控制台会生成一条安装命令,拿到目标集群里自己执行。命令会过期,过期了回控制台重新打开配置或查看 Manifest 就能拿到新的,不需要换 Token。改了 namespace 或权限范围之后,要重新执行一次安装命令,集群里的 RBAC 才会同步更新。

    撤销和卸载是两步

    在控制台撤销会立即让连接和 Token 失效,但集群里已经装的 Agent 和 RBAC 资源不会跟着自动清掉,需要用控制台给出的卸载命令,在对应集群里手动执行。卸载命令只清理这一个 Kubernetes App 装的资源,共享的 flashduty namespace 不受影响。

    开始使用

    前往 Flashduty 控制台 → AI SRE → 插件 → Apps → Kubernetes App

    更多介绍请参考产品文档

    本功能面向 On-call 专业版及以上账户,随 AI SRE 公测一并开放。

  • AI SRE 的运行环境:云端 Sandbox 与你内网的 Runner

    一个只会给建议的 Agent,和一个能自己去查的 Agent,差别在于它有没有地方动手。

    AI SRE 的每次调查都在一个真实的执行环境里进行:跑命令、调接口、处理数据、生成报告。这个环境有两种形态,按你的系统在哪里选。

    云端 Sandbox:开箱即用

    默认形态,由 Flashduty 托管,会话开始时按需创建,隔离运行。里面预装了排障常用的命令行工具,Agent 可以直接读写文件、执行脚本、调用公网 API。你还可以为云端环境配置出网白名单、环境变量和初始化脚本,让每个新建的 Sandbox 都符合团队约定。

    BYOC Runner:把执行放进你的网络

    如果需要调查的系统在内网,公网环境到不了。这时可以在自己的机器上部署 Runner,让 Agent 在你的网络内部执行。

    连接方向是从 Runner 主动向外建立的,你不需要为它开放任何入站端口,也不需要把内网地址暴露到公网。Runner 自带排障要用的工具链,包括 rgjqgh 以及 Node 和 Python 运行时,安装后不必再逐个装依赖。它支持全平台自动更新,跟随服务端能力演进,不需要你手动升级。

    执行边界仍然由你划定

    无论在哪种环境里,Agent 的写操作范围、可访问的凭证、能触达的网络都按你的配置执行。生产变更、重启、回滚和对外通知一律等待人工确认。

    开始使用

    前往 Flashduty 控制台 → AI SRE → 环境,顶部可切换自托管与云端两个标签页。

    更多介绍请参考产品文档

    本功能面向 On-call 专业版及以上账户,随 AI SRE 公测一并开放。

  • AI SRE 接入代码仓库:调查可以一直追到那次改动

    故障调查经常卡在同一个地方:日志指向某个函数,但没人能立刻说清那几行代码最近被谁改过、为什么改。

    AI SRE 现在支持接入代码仓库。GitHub AppGitLab App 均已可用,其中 GitLab App 在经历一段白名单灰度后,已面向全部账户开放。

    把调查延伸到源码

    授权之后,Agent 可以 clone 仓库、检索代码、阅读提交历史和 PR 讨论。遇到堆栈里的陌生函数,它会直接去仓库确认实现,而不是靠模型印象作答。它也会优先读取仓库自带的约定文件,比如 CLAUDE.mdAGENTS.md,按你团队的规矩行事。

    从报错追到那次改动

    结合 Flashduty 的变更记录和仓库提交历史,Agent 能把一次异常和引入它的那次提交对应起来。我们记录过一个真实例子:用户在页面上连续触发三次前端异常,RUM 保留了会话和 SourceMap 堆栈,AI SRE 由此定位到仓库中的一处表单初始化问题,完成一行修复并提交 PR,从最后一条报错算起用了 8 分钟。完整过程见这篇记录

    需要时才提交 PR

    Agent 不会自作主张改代码。只有你在会话中明确要求修复时,它才会创建分支、提交改动并开 PR,交由你的团队走正常的评审流程合并。是否值得进代码仓库,这个判断仍然在人手里。

    令牌按轮次注入

    仓库访问令牌在每一轮工具调用时注入执行环境,云端 Sandbox 和你自建的 BYOC Runner 走同一条路径。授权记录保存在 Flashduty,令牌支持轮换,你可以随时在控制台解除授权。

    开始使用

    前往 Flashduty 控制台 → AI SRE → 插件 → Apps,选择 GitHub 或 GitLab 完成授权。

    更多介绍请参考产品文档

    本功能面向 On-call 专业版及以上账户,随 AI SRE 公测一并开放。

  • AI SRE 开放公测:告警之后,先让 Agent 跑完第一轮调查

    值班工程师收到告警后的头十分钟,多数时间花在拼凑上下文,而不是判断。

    告警在监控平台,故障时间线在 Flashduty,服务变更在发布系统,指标和日志各有入口,排障步骤写在团队文档里。把这些内容复制进一个通用对话框,它能讲清楚「连接池耗尽通常有哪些原因」,但它不知道这次是哪项变更引起的、哪几个实例在异常。

    AI SRE 现在面向 On-call 专业版及以上账户灰度开放公测。此前几个月它在内测中处理真实告警,现在把入口打开。

    会话不从空白开始

    在控制台新建对话时输入 @ 可以引用故障,Agent 会带着这条故障关联的告警、服务、团队和值班信息进入会话,据此规划调查步骤,而不是先反问你发生了什么。从 IM 召唤时同理,作战室里的讨论也在它的视野内。

    它能调用你已经接入的工具

    通过 MCP 连接器接入监控、日志、云平台等外部系统,内置目录目前有 35 个可选连接器。团队自己的排障方法可以写成 Skill 复用,系统背景写进知识库,Agent 在后续调查中会直接使用,不需要每次重新交代。

    执行环境可以放进你的内网

    默认在 Flashduty 托管的云端 Sandbox 里执行。如果调查需要访问内网系统,可以在自己的网络里部署 BYOC Runner,由它主动向外建立连接,你不需要为此开放任何入站端口。

    生产操作停在人这里

    Agent 完成调查、给出根因判断和处置建议,但变更、重启、回滚以及对外通知仍然由你确认后执行。这条边界不随公测调整。

    开始使用

    前往 Flashduty 控制台 → AI SRE → 新对话

    更多介绍请参考产品文档

    AI SRE 已全量开放公测,无需申请,登录控制台即可使用。公测期间不单独收费,功能与界面可能继续调整。

  • RUM 查看器支持自然语言查询

    在 RUM 查看器里想筛一次「Chrome 上耗时超过 2 秒的报错」,得先知道字段名怎么写、操作符怎么组合。不常用 DQL 的人,往往卡在这一步,只能先去翻语法文档。

    现在查看器支持直接用一句话描述你想找什么。无论是筛 Session,还是 View、Resource、Error 等各类事件,AI 都会把描述转成对应的 DQL 查询条件。

    输入一句话,AI 生成查询条件

    点击查询框左侧的 AI 自然语言查询 图标,或在普通模式下按 ⌘+Enter(Windows/Linux 是 Ctrl+Enter),输入框会切换成自然语言输入。回车后 AI 给出一段预览:生成的 DQL 以代码片段展示,应用前就能看到、能复制;如果这次描述更适合别的事件类型,预览里会单独标出「事件类型」这一项变更。点击应用,DQL 会写进查询框,之后跟手写的查询没有区别,可以继续编辑,应用后的提示条里还带一个「撤销」。

    时间表述按你的时区解析,但最长查 14 天

    「过去一小时」「昨天」这类时间描述会按账户所在时区换算,直接更新时间选择器,不会被写成查询条件里的字段。如果描述的时间跨度超过 14 天,比如「过去一个月」,会自动截断到最近 14 天,预览里会提示已截断。这个上限和查看器本身能查的最大范围一致,不是自然语言查询单独设的限制。

    开始使用

    打开 RUM 查看器,点击查询框左侧的 AI 图标即可尝试。详见产品文档

  • 自定义故障表单:创建、认领、关闭都能收集你要的信息

    故障认领的时候想让处理人填一句说明,关闭的时候想确认影响范围,此前只能在群里或工单系统里另外要求,Flashduty 里没有地方收这些信息。

    自定义故障表单现在支持为创建故障认领故障关闭故障三个动作分别配置一份表单。表单里可以放自定义字段、说明文本、图片上传,每个元素能单独设置是否必填,也能设置只在满足条件时才显示,比如只在严重等级为高时才要求填写影响范围。

    跟着故障状态一起落盘

    认领表单、关闭表单的提交和故障状态变更是原子写入的,不会出现表单点了提交、故障状态却没跟着变的情况,也不会出现状态变了但填写的内容丢了。

    五个 IM 平台统一一套界面

    钉钉、飞书、Slack、Microsoft Teams、企业微信里点认领或关闭按钮,弹出的都是同一套 Console H5 表单抽屉,不用每个平台单独适配一遍表单逻辑,处理人在哪个 IM 里操作体验都一样。

    配置页和列表页重做

    字段配置和表单管理的页面做了重新设计,字段顺序可以拖拽调整,点击某一行就能改它的显示条件、必填规则和帮助文案。

    移动端一并修复

    移动端 App 上,如果某个动作没有配置表单,认领和关闭不再跳转到空表单页,直接按原流程执行。

    开始使用

    前往 Flashduty 控制台的故障配置页面,进入自定义表单

    更多介绍请参考产品文档

  • 登录治理更新:密码登录、密钥权限、账号清理一起收紧

    企业上线一款 SaaS 工具之前,安全负责人的审计清单里几乎都会问到:密码登录能不能关掉、API 密钥的权限能不能收窄到最小、登录失败有没有防护、员工离职后账号怎么处理。

    这些问题过去分散在不同版本里逐步解决,这次一并说明。以下四项更新分别对应登录、密钥授权、私有化环境和成员管理,SaaS 与私有化部署的覆盖范围不完全一致,具体差异见各段。

    强制 SSO,关掉密码登录

    平台管理 → 单点登录 中配置 SAML2.0、OIDC 或 CAS 协议后,可以开启「成员仅支持 SSO 登录」。开启后账户内成员只能通过身份提供商登录,密码和验证码登录会被拒绝,首次配置 SSO 时该开关默认已打开。私有化部署额外支持 LDAP 协议接入同一开关。

    App Key 从「全量授权」改成按需勾选

    以前 APP Key 只能生成一把能调用全部接口的钥匙。现在创建或编辑时可以选自定义权限,只勾选这把 Key 实际要用的接口范围,超出范围的调用会被拒绝,即使选全部权限也仍受创建者角色权限约束。已有 Key 也能重新编辑权限范围,配合定期轮换,缩小密钥暴露面。

    私有化部署:登录防爆破,会话时长可配置

    私有化部署环境下,登录失败次数超过限制会触发图形验证码,降低密码被暴力枚举的风险;会话过期时长也开放为可配置项,团队可以按自己的安全策略设定登录会话的有效期,不再固定用同一个默认值。这两项目前只在私有化部署提供,SaaS 版本不涉及。

    身份映射更严谨,成员删除更彻底

    SSO 场景下,用户 ID 映射改为可选,并移除了 provider_key 身份维度,减少身份提供商字段变化导致的登录异常;多个新成员同时 SSO 首次登录(JIT 建号)时,建号逻辑改为串行,避免并发重复建号。团队与成员页面的删除成员操作,配套了更完整的清理逻辑,减少删除后遗留的关联数据。

    开始使用

    强制 SSO 的开关在 平台管理 → 单点登录,详见单点登录文档。自定义权限的 App Key 在 账户设置 → APP Key 创建,详见 Open API 文档。成员删除入口在 平台管理 → 成员管理,详见成员管理文档

    私有化部署的登录防爆破和会话时长配置,请联系我们的技术支持获取部署指引。

  • RUM 补齐微信小程序、鸿蒙与 Android NDK 的崩溃分析

    崩溃日志里的堆栈通常是一串内存地址或混淆后的短名称,看不出是哪个函数、哪一行代码出错,需要符号文件才能还原回真实源码位置。这次更新把符号化能力补齐到微信小程序、HarmonyOS 和 Android NDK 原生代码,加上此前已支持的 Web 和 iOS,RUM 现在覆盖了线上大部分客户端类型。

    原理是:构建时生成的 SourceMap、ProGuard mapping 或调试符号文件记录了压缩混淆后的位置与原始源码位置的对应关系,上传后 RUM 按服务名和版本匹配,把崩溃堆栈里的地址或短名称还原成函数名、文件名和行号。

    微信小程序 RUM

    线上错误堆栈原本只有转换后的文件路径和行列号。现在用 miniprogram-ci get-dev-source-map 生成 sourcemap,通过 Flashduty CLI 上传即可自动还原,同时补上了 issue 分组和小程序专属看板。

    HarmonyOS 鸿蒙 RUM

    鸿蒙崩溃栈可能同时包含 ArkTS/JS 帧和 Native .so 帧。装好 @flashcatcloud/hvigor-plugin 插件后,构建时自动上传 ArkTS sourcemap 和未 strip 的 Native 符号文件,两类帧都能在控制台还原。看板、符号管理页面完成鸿蒙适配,并补了一篇 Trace 集成文档。

    Android NDK 原生崩溃符号化

    修了 NDK 崩溃的分组逻辑,同一个崩溃点不再被拆成多条不相关 issue。上传未剥离、带 GNU build-id 的 .so 文件后,C/C++ 层崩溃地址可还原成函数名和行号;原生启动指标也拆开了冷启动、热启动分别统计。

    告警解耦与私有化部署

    RUM 告警此前必须经过 On-call 模块才能通知到人,现在可以直接以 Webhook 形式 POST 到自己的接收端,纯做前端监控、未接入 On-call 的私有化部署客户也能收到告警。SDK 同步支持自定义数据上报地址和 CDN,便于私有化环境接入。

    开始使用

    前往 Flashduty 控制台 → RUM → 应用管理 → 源码管理上传对应平台的符号文件,告警投递方式在「应用管理 → 告警设置」中配置。

    更多介绍参考源码映射与异常追踪Issue 告警

  • 状态页升级:自定义域名双线路与 Atlassian Statuspage 一键迁移

    从 Atlassian Statuspage 换到别的状态页产品,麻烦的不是重新搭一个页面,是把历史事件和订阅者关系原样搬过去,否则用户手里的邮件订阅和 RSS 链接就全失效了。

    Flashduty 状态页去年底上线,这次更新做两件事:打通从 Atlassian Statuspage 迁移过来的路径,把自定义域名重做成能扛生产流量的双线路方案。

    Atlassian Statuspage 一键迁移

    迁移分两步,都用 Flashduty CLI 执行。flashduty statuspage migrate structure 导入组件、分组、历史事件和通知模板,不会通知订阅者,可以先核对导入结果;确认无误后再用 flashduty statuspage migrate email-subscribers 导入邮件订阅者。历史事件的 RSS/Atom 地址沿用 Atlassian 的 history.rsshistory.atom 路径格式,订阅者不用改订阅地址。迁移接口做了分页和幂等处理,重复执行不会重复写入数据。

    自定义域名 2.0

    自定义域名从原来单一的 CNAME 目标,改成了中国大陆和国际双线路分别托管解析,证书由 Caddy 自动申请和续期,这一步也补上了幂等修复,避免并发请求下重复申请证书。原来用单个 CNAME 接入的老客户,域名解析不用改,是无感升级。

    RSS/Atom 订阅与一键退订

    公开状态页现在支持 RSS/Atom 订阅,不用邮件确认就能拿到事件更新;history 路由加了别名兼容 Atlassian 的地址格式,老订阅者不用换地址。邮件订阅加了一键退订:通知邮件携带 RFC 8058 定义的 List-Unsubscribe 头,Gmail、Apple Mail、Outlook、Yahoo 等客户端会在邮件顶部显示原生退订按钮,点一下立即生效。

    修复

    内部状态页里被隐藏的组件,之前会出现在对外公开的变更历史里,现在已经修掉。

    开始使用

    前往 Flashduty 控制台 → 状态页 → 设置,查看自定义域名配置。迁移步骤和 CLI 命令参考接入 Flashduty 状态页,功能对比参考状态页对比:从 Atlassian Statuspage 迁移

  • 故障复盘上线:让每一次故障,都成为团队进步的起点

    故障恢复并不意味着流程的结束。真正的闭环,始于复盘。

    在实际运营中,许多团队会在故障恢复后迅速回到日常工作:根因分析散落在即时通讯记录中,改进措施停留在口头约定里,而相似问题却可能在未来再次发生。此前的「问题修复」功能仅支持基础字段记录,难以承载完整、系统的事后分析流程。

    为此,Flashduty 正式推出 「故障复盘」,全面替代原有的 「问题修复」 功能。从事件回顾、原因分析到改进追踪,帮助团队建立更完整的复盘闭环,让每一次故障都沉淀为可复用的组织经验,而不是被遗忘的成本。

    如您此前依赖「问题修复」中的数据字段,可通过自定义字段继续实现相同能力。

    AI 辅助生成,快速完成复盘初稿

    故障复盘支持 AI 自动生成报告初稿。系统可综合事件详情、响应时间线,以及飞书或 Slack 作战室中的讨论内容,自动梳理事件经过、提炼关键信息,显著降低复盘的启动成本,让团队将更多精力投入到分析与改进本身。

    实时协同编辑,让复盘更高效地达成共识

    故障从来不是一个人的事,复盘也不应如此。多人可同时在线编辑同一份报告,修改实时同步并自动保存。无需反复传递文档或手动合并版本,团队成员可以在同一页面上对齐事实、补充信息、形成共识。

    模板体系加持,关键问题不再遗漏

    发生了什么?为什么会发生?如何避免再次发生?

    故障复盘提供内置模板,覆盖 摘要、根因、影响、时间线、改进措施、经验教训 六大核心板块。同时,您也可以创建自定义模板,将团队的最佳实践沉淀为标准流程,帮助每一次复盘都更完整、更稳定、更高质量。

    故障不可避免,但同样的问题再次发生可以避免。通过 Flashduty 故障复盘,团队可以更清晰地记录根因、更持续地追踪改进、更系统地沉淀经验。这不仅是一份复盘报告,更是组织韧性不断积累与成长的开始。

    立即体验

    欢迎前往 Flashduty 控制台 → On-call → 故障复盘 开始使用。

    更多介绍请参考产品文档

    本功能在 Flashduty 专业版中可用。