跳至主内容
更新日志
  • AI SRE 开放公测:告警之后,先让 Agent 跑完第一轮调查

    值班工程师收到告警后的头十分钟,多数时间花在拼凑上下文,而不是判断。

    告警在监控平台,故障时间线在 Flashduty,服务变更在发布系统,指标和日志各有入口,排障步骤写在团队文档里。把这些内容复制进一个通用对话框,它能讲清楚「连接池耗尽通常有哪些原因」,但它不知道这次是哪项变更引起的、哪几个实例在异常。

    AI SRE 现在面向 On-call 专业版及以上账户灰度开放公测。此前几个月它在内测中处理真实告警,现在把入口打开。

    会话不从空白开始

    在控制台新建对话时输入 @ 可以引用故障,Agent 会带着这条故障关联的告警、服务、团队和值班信息进入会话,据此规划调查步骤,而不是先反问你发生了什么。从 IM 召唤时同理,作战室里的讨论也在它的视野内。

    它能调用你已经接入的工具

    通过 MCP 连接器接入监控、日志、云平台等外部系统,内置目录目前有 35 个可选连接器。团队自己的排障方法可以写成 Skill 复用,系统背景写进知识库,Agent 在后续调查中会直接使用,不需要每次重新交代。

    执行环境可以放进你的内网

    默认在 Flashduty 托管的云端 Sandbox 里执行。如果调查需要访问内网系统,可以在自己的网络里部署 BYOC Runner,由它主动向外建立连接,你不需要为此开放任何入站端口。

    生产操作停在人这里

    Agent 完成调查、给出根因判断和处置建议,但变更、重启、回滚以及对外通知仍然由你确认后执行。这条边界不随公测调整。

    开始使用

    前往 Flashduty 控制台 → AI SRE → 新对话

    更多介绍请参考产品文档

    AI SRE 面向 On-call 专业版及以上账户灰度开放,如需开通请填写 AI SRE 公测申请表。公测期间不单独收费,功能与界面可能继续调整。