深度解析 | PagerDuty Copilot - 运维领域大模型应用场景

【本文作者:擎创科技资深产品专家 布博士】

最近一年多的时间里,生成式人工智能(我们通常称为大语言模型)已经成为了各行各业提升效率的、降低成本的强大工具。PagerDuty Copilot,作为一款为pagerduty cloud用户提供的生成式AI助手,已经在pagerduty cloud运营云中得到了广泛的应用。本文将深入探讨PagerDuty Copilot到目前为止,实现的四大主要应用场景

事件辅助诊断AI助手

在事件发生时,PagerDuty Copilot能够帮助进行事件诊断。它可以提供事件的上下文支持,帮助识别影响因素和问题隔离,并提出补救路径,从而更快地解决问题。此外,响应者可以与PagerDuty Copilot互动,通过展示变更事件、建议的补救途径和其他可能的原因分析来进行调查。总的来说,PagerDuty Copilot能够减轻响应者的负担并自动执行时间密集型任务。

图片

事件的发生在大型分布式系统中是极其复杂的。在发生事件时,需要探讨和分析各种信息:

  • 服务中断:这可能使用户无法访问或使用关键服务,从而可能影响用户的满意度和信任度。

  • 各种警告:例如500错误、值机失败、航班延误、数据库响应滞后、存储响应不及时、应用无法访问等问题。

  • 各种变更:失败可能是由于变更引起的。

  • 客户投诉:包括来自用户或内部员工的各种投诉信息以及他们收集的背景信息。

  • 杂乱无章:各种信息都统一到事件工作台界面,难以短时间了解问题全貌。

在极短的时间内,人们很难全面了解这些信息,更不用说在这种事件或应急处理的场景下。

图片

在这种背景下,pagerduty提供了pagerduty copilot的能力,如上图右侧所示,通过自然语言的问答模式,可以快速获取针对这些杂乱无章信息的快速洞察能力:

  • 快速了解都发生了什么事情

图片

  • 对客户的影响情况

图片

  • 问题产生的可能原因分析

图片

  • 自动化修复建议,生成修复后对客户的反馈说明,并人工审核和发送

图片

图片

AI生成事件状态更新同步干系人

在出现计划外的罢工或工作中断事件时,沟通和协调对于问题解决至关重要。行业最佳实践建议每30分钟(至少)向利益相关者和领导层进行定期状态更新,以确保企业以统一的声音回应。然而,制作这些更新需要时间,且在您的团队已经处于高压状态时,这将增加认知负担。我们有客户告诉我们,在重大事件期间,他们会有三个人专门负责状态更新。

生成式人工智能的部署正是我们的开始。通过将生成式人工智能集成到我们的状态更新功能中,团队可以节省内容和对象的描述周期——仅需几次点击,他们就可以生成基于角色的状态更新草稿。新功能利用人工智能处理与当前事件相关的所有数据并自动生成摘要,提供关于事件、进展和挑战的关键见解。除节省时间外,此功能还增强了事件管理流程并简化了沟通,使您的团队能够更专注于解决问题的实际工作。

具体操作如下流程:

  • 图1 - 在事件管理界面点击“generate status updates”按钮,进入图2

  • 图2 - 点击“generate“按钮,会自动生成针对该事件的最新状态说明信息,并在下方可以预览生成之后的邮件格式

图片

图1 - 事件详情页

图片

图2 - 生成和发送状态更新页

AI生成事后分析及总结报告

事后分析是卓越运营的主要内容之一,也是由站点可靠性工程 (SRE) 推动的最佳实践。它让您能够理解问题所在、找出可以改进的地方,最重要的是,它让您知道如何避免重复同样的错误。

然而,花费时间进行事后分析可能具有挑战性。这是一个繁琐、手动的过程(有时带有情绪色彩),需要收集所有相关数据点供团队审查。

想象一下,有一组虚拟团队成员始终跟踪事件,他们的主要任务是为您的事后报告创建及时且公正的总结。这正是我们通过利用人工智能应用,自动创建全面的事件后总结报告所能提供的。

图片

如上图所示,一旦问题得到解决,用户可以选择生成事后分析报告。这将触发一个实时且耗时的数据收集过程,搜集所有与当前问题相关的可用数据,包括日志、指标,以及相关的 Slack 或 Microsoft Teams 对话。然后,系统将生成一份详细的报告,包含主要发现、根本原因以及需要改进的领域。此外,PagerDuty 还会生成一份建议的行动项目列表,以防止未来发生类似问题。

此功能不仅可以节省时间,而且还可以为捕获关键知识提供一个起点,培养持续改进的文化,并使团队能够将更多时间花在面向未来的验证上,这让我们回到了人的重要性。当您谈论关键任务工作时,使用循环方法来释放生成式人工智能的力量。

与上面的状态更新示例一样,自动事件事后分析需要一个人提供专业知识、判断和监督,验证和完善报告,然后再将其发布以供更广泛的使用。

图片

如上图所示生成了一份事后总结报告的草稿,并将需要填写的重要信息已经自动填写上。

图片

事件的开始和截止时间以及涉及到的事件列表,也可以自行添加。

图片

事件的发生的timeline信息。

图片

报告的总结以及都发生了什么的简要说明。

图片

影响和触发问题的原因

图片

经验考试和行动项

AI生成流程自动化

自PagerDuty Operations Cloud平台建立以来,他们一直在多平台使用自动化,并与众多人合作提供脚本和插件,以自动化工作流程,帮助客户更快地管理和解决计划外工作。他们的客户每天都在使用他们的服务,在云端和本地进行基础设施自动化,驱动Ansible、Terraform和Power Automate。然而,如果尚未有现成的脚本和工具,客户需要自己进行繁重的工作来编写脚本。

PagerDuty利用生成式人工智能作为用户自动化需求的实现者。这就像在用户团队中多了一位开发人员,他可以被分配去研究如何完成用户想要做的事情,然后为用户创建自动化。最重要的是,该系统可以使用用户最喜欢的脚本语言来完成任务,或者可以轻松地从一种语言转换到另一种语言,因此用户有完全的控制权。PagerDuty正在将低代码功能引入以往的高代码体验中,而不会失去任何功能或灵活性。例如,用户可以简单地声明:“编写一个自动化工作流程,将特定用户添加到Okta中的组中。我应该能够在运行时通过电子邮件和组指定用户。”点击生成按钮后,就可以观察结果。

  • 生成自动化脚本

图片

  • 生成故障时,选择执行自动化脚本

图片

  • 查看执行过程

图片

总结:PagerDuty Copilot所实现的高效、灵活、智能的运维辅助服务,是依赖于像ChatGPT-4这样的大模型的能力。这种大模型具有强大的学习和理解能力,可以处理大量的复杂信息,给出准确的反馈和建议。然而,当前我们看到的国内的大模型,要实现PagerDuty Copilot这样的效果,还存在着非常大的差距。特别是对于那些有安全性考虑的企业客户来说,要在未来的3-5年内实现这样的能力,最大的挑战是国有大模型能否经得起市场的验证,没有对比就没有伤害。因此,我们需要不断地学习和研究,努力提升我们的大模型的能力。

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.hqwc.cn/news/697064.html

如若内容造成侵权/违法违规/事实不符,请联系编程知识网进行投诉反馈email:809451989@qq.com,一经查实,立即删除!

相关文章

通俗易通解读Restaking,潜力如何?(bitget钱包玩转)

关于 Restaking 再质押: 1. Restaking 在功能上,将以太坊安全性标准化,并将其“货币化”,Restaking 出售的就是以太坊的安全性,同时,将安全性用质押后的通证数量直观表现出来 2. Restaking 在经济机制上的逐…

下载npm I就包错解决方案

npm i xxxx -S --legacy-peer-deps 如果包错就执行以上命令

UTONMOS:真正的“游戏元宇宙”还有多遥远?

元宇宙来源于科幻小说的概念,已成为真实世界中的流行语。围绕这一新兴概念,一场产、学、研的实践正在展开。 数字化转型中,元宇宙能否担当大任?这些新概念在中国语境下如何落地?本文将深入挖掘国内元宇宙游戏产业的发…

基于百川大语言模型的RSS新闻过滤应用【云服务器+公网网页,随时随地看自己DIY订阅的新闻内容】

背景 目前从公众号、新闻媒体上获得的新闻信息,都是经过算法过滤推荐的,很多时候会感到内容的重复性和低质量,因为他们也要考虑到自己的利益,并非完全考虑用户想要的、对用户有价值的信息。这时,如果要获取自己认为重要的信息,定制化开发自己的筛选算法更好。 效果 素材…

经验分享打开keil工程下载按钮是灰色的解决办法

问题背景 打开一个工程发现download的按钮是灰色的,这种是怎么回事呢? 调研问题 工程中有使用.lib的文件库,而且是一个私有的库,类似这种祖传的工程,一般是能用则用,不能用则弃之不用。 解决问题 在网络…

打印机 ansible配置dhcp和打印机

部署dhcp服务器 主机发送Discover报文 目标为广播地址 同一网段的dhcp收到报文后,dhcp响应一个offer报文 offer报文:dhcp自己的ip地址。和客户端ip以及使用周期,和客户端ip网络参数 最后主机单独发一个request报文 给那个选择的dhcp服务器 &…

面试题:调整数字顺序,使奇数位于偶数前面

题目: 输入一个整数数组,实现一个函数,来调整该数组中数字的顺序 使得所有奇数位于数组的前半部分,所有偶数位于数组的后半部分 算法1: 利用快速排序的一次划分思想,从2端往中间遍历 时间复杂度&#x…

CSS常用滤镜效果

CSS 提供了多种滤镜效果,可以通过 filter 属性应用于 HTML 元素。以下是一些常用的 CSS 滤镜效果: 一、灰度 (Grayscale) 将图像转换为灰度图像。值在 0%(原始图像)和 100%(完全灰度)之间。 filter: gra…

springmvc核心流程

核心流程及配置 核心流程 执行流程 用户发送请求到DispatcherServlet前端控制器,前端控制器收到请求后自己不进行处理,而是委托给其他的解析器进行处理,作为统一访问点,进行全局的流程控制 DispatcherServlet调用HandlerMapping映…

图生视频,Stable Diffusion WebUI Forge内置SVD了!

在 Stable Diffusion WebUI Forge 版本中内置了一个SVD插件,也就是 Stable Video Diffusion(稳定视频扩散),之前我介绍过这个工具的使用方法:图片生成视频(独立部署SVD) 但是当时还不能集成到Stable Diffu…

Docker运行出现iptables: No chain/target/match by that name报错如何解决?

在尝试重启 Docker 容器时遇到的错误信息表明有关 iptables 的配置出了问题。这通常是因为 Docker 需要配置网络,而 iptables 规则没有正确设置或被意外删除。具体到你的错误信息中,报错 iptables: No chain/target/match by that name 表示 Docker 尝试…

嵌入式人工智能是一个怎样的概念呢?

嵌入式人工智能将会是未来几年人工智能发展的主要方向之一,并且会伴随着一系列的职位和角色的出现。虽然目前还没有嵌入式人工智能的确切定义,但随着人工智能的不断发展,它势必会延伸到边缘、终端和嵌入式市场。 嵌入式人工智能具有速度快、功…