问问任何存储团队过去五年发生了哪些变化,你都会听到大同小异的答案:一切都在增长,同时也变得更加复杂。应用程序更多、数据更多、平台更多,问题也有更多藏身之处。复杂性的增长速度已经超过了负责管理这些环境的团队所能应对的速度。
人员配置问题让情况变得更加严峻。目前,三分之二的数据中心运营商都面临难以招聘或留住合格员工规模更小、负担更重且往往经验更少的团队,却要负责管理规模更大、更加复杂的数据环境,面对过多的工具和告警,而值班人员更是肩负着过重的责任。
这就是异常检测从“锦上添花”变成必不可少的能力的原因。80% 的运维团队表示,他们最近一次停机原本可以避免,通过更完善的流程或管理本可以提前发现问题。因此,数据存储平台最有用的能力并不是告诉你哪里出了问题,而是告诉你哪些问题可以忽略。
这听起来似乎有些本末倒置,所以让我解释一下。任何监控工具都可以在某项数值超过阈值时发出告警,从而标记问题。多年来,运维团队面对数百个仪表板和数千项指标,其中真正紧急的却寥寥无几,长期的告警疲劳已让他们疲惫不堪。而在这堆信息中,真正重要的那个问题可能已经悄然恶化了数小时,最终演变成无人预见的 Sev-1 严重事故——不是因为没有相关数据,而是因为根本没有人有时间从中找出它。
因此,问题从来不在于能否检测,而在于能否辨别轻重缓急。下一步的关键不是发现更多异常,而是知道哪些可以暂且搁置,从而做到按例外管理,而非疲于应对。
智能存储的真正含义
智能存储并不只是一个更聪明的告警工具。它是一个能够理解自身正常状态的平台,会学习其所运行每个工作负载的基准行为,并仅呈现真正偏离正常状态的情况。旧模式会监控一切,并在某项数值超过预设阈值时做出反应;这种模式只能通过增加人手来扩展,而这恰恰是无法持续扩展的。新模式会学习什么是正常状态,并仅在实际情况偏离这一基准时发出提醒。两者之间的差别,会彻底改变管理员每天早上的工作方式。
从 112 到 12
想象一下,存储管理员开始新的一天,咖啡还热着,第一项任务和往常一样:找出真正需要关注的问题。在过去,这意味着要逐一打开 112 个应用程序的仪表板,希望能在最终用户受到影响之前,及时发现那个正走向故障的应用程序。
今天早上的情况有所不同,因为他们刚刚部署了具备 AIOps 异常检测功能的 VSP 360。当他们打开异常检测视图时,VSP 360 管理平台已经完成了初步筛选:共监控 112 个应用程序,其中 12 个检测到异常,并已自动呈现。无需人工审查,也无需调整阈值。一夜之间,VSP 360 已学习每个工作负载的正常状态,并仅标记那些偏离正常基准的工作负载。
12,而不是 112,看似只是一个很容易一眼带过的数字,但它意义重大。这意味着管理员需要记住和处理的复杂性更少,出现问题时能够更快评估根本原因,同时还能为团队节省数小时的人工分析时间。对于管理员而言,这意味着更少陷入死胡同的排查,也更有信心不会遗漏真正重要的问题。对于企业而言,则意味着风险能够更早被发现,平均修复时间 (MTTR) 持续下降,同时团队不必为了勉强维持现状而耗尽精力。
识别“噪声邻居”
当管理员点击优先级最高的异常时,VSP 360 平台会将该应用程序的行为与其底层存储资源进行关联分析,包括卷、端口、处理器和缓存,并将所有信息呈现在同一条共享时间轴上。
想象一下您环境中一种常见情况:Oracle 生产数据库的用户反映高峰时段事务处理缓慢,但大家首先查看的处理器、端口等指标却都显示正常,表面上看不出明显的问题。然而,VSP 360 异常检测仪表板却揭示了隐藏在底层的异常:
检测到严重异常:Oracle 生产数据库
- 延迟高于正常基准 70%
- 受影响资源:前端端口 CL1-A
- 检测时间:15 分钟前
瞧!四行信息就给出了完整的诊断结果。
任何负责运行共享数据基础设施的人都熟悉这种典型情况:一个“噪声邻居”,也就是另一个工作负载耗尽了缓存和处理器的可用余量,导致周围所有应用程序都受到影响。在使用 VSP 360 异常检测之前,要证实这一点,往往需要花上一整个下午调取各个仪表板,并在电子表格中对齐时间戳。现在,只需一个屏幕、一条时间轴,管理员在咖啡变凉之前就能找到答案。
由于诊断结果以清晰、可共享的证据形式呈现,常见的跨团队摩擦也随之减少。当应用程序团队询问服务为何变慢时,根本原因已经确定,因此讨论可以直接转向如何解决问题,而不必停留在争论问题究竟出在哪个团队。
这是问题,还是只是“周一现象”?
在管理员关闭这张工单之前,还会再问一个问题:这是新出现的情况,还是一种规律?查看一周的历史数据就能找到答案。
性能下降的时间与夜间备份窗口完全吻合。其实这从来都不是什么谜团,只是此前没有人将某个批处理作业与这些症状联系起来。而数据呈现出的模式会告诉您应该采取哪种解决措施:如果每周一都会出现峰值,那就是批处理作业造成的,可以重新安排其运行时间;如果呈现持续上升趋势,则说明工作负载正在增长,需要规划扩容;如果是一次孤立事件,同时伴随相关的缓存峰值,则可能是配置错误,需要进行修复。同一个异常视图,可以得出三种不同的结论,而证据会直接指向正确的判断,无需猜测。
这就是转变:从被动响应告警,转向基于证据做出决策。而且请注意,诊断结果本身就提供了解释。您无需盲目信任一个“黑盒”。您可以清楚地看到平台为何做出相应标记,以及这些标记意味着什么。
值得信赖的异常智能。
我们身处这样一个市场:几乎所有事物都被贴上了“AI 驱动”的标签,许多运维团队对此感到疲惫也完全可以理解。异常检测的目标从来都不是成为幻灯片上最炫目的技术,而是成为一种值得信赖、能够据此采取行动的解决方案:检测结果能够说明其判断依据,关联分析可以由您亲自验证,团队也能依据证据而非直觉做出决策。当您的团队需要对所采取的行动负责时,可解释性永远比表面上的亮眼表现更重要。
尽管业界已经让客户习惯于为智能功能支付额外费用——无论是高级分析层级、订阅升级,还是作为单独计费项目的附加 SKU——但企业在接受这一惯例之前应该三思。有关自身存储运行状况的洞察不应该再被作为额外功能卖给您,而应该随平台一同提供,因为这本就是确保平台良好运行的一部分。
一项能力,更大的愿景
异常检测并非全部。它只是一个更广泛理念的初步体现:VSP 360(乃至任何数据存储解决方案)都应该让智能基础设施运维成为默认能力,而不是一个需要单独配置人员和投入资金的项目。
随着组织从异常检测迈向更成熟的阶段,重点将从识别孤立的偏差转向生成基于模式的运维智能。最终,这些能力将为高级 AIOps 奠定基础,包括事件关联、预测性洞察和有针对性的处置建议,从而加快问题解决速度并提升运维韧性。
VSP 360 异常检测是更广泛的 IT 可观测性战略中的一项基础能力,该战略涵盖整个 IT 基础设施栈,从应用程序工作负载到服务器、网络和共享存储资源。通过快速识别存储性能异常,组织可以获得可付诸行动的智能,从而帮助实现存储运维自动化、提高可见性并增强端到端基础设施监控。
借助异常检测,您组织未来的发展方向十分明确:降低存储环境的复杂性,让管理员能够更高效地管理规模更大的 IT 环境,并在问题演变为停机事件之前及时发现,从而降低企业风险。
详细了解 VSP 360 AIOps。该解决方案可提供运维智能、异常检测和预测分析,帮助改善您的数据运维。
Nick Loy
Nick Loy joined Hitachi Vantara in 2021. He currently manages go-to-market strategy for the Intelligent Automation practice, concentrating on hyperautomation, business process and IT automation. Nick is a frequent speaker at conferences and events on topics including AI, hybrid cloud and business process automation.
Sushant Sawant
Sushant Sawant is the Product Manager for VSP 360 Analytics.