使用重新设计的 AutoOps 更快地进行 Elasticsearch 问题排查

发布时间:2026/7/24 22:52:07
使用重新设计的 AutoOps 更快地进行 Elasticsearch 问题排查 作者来自 Elastic Ori Shafir 及 Arnon SternAutoOps 为 Elastic Cloud Hosted 部署和 Cloud Connect 集群引入了更清晰的严重级别、更新后的页面布局以及更简单的问题排查流程。通过实时问题检测和可执行的优化建议简化你的 Elasticsearch 运维提升性能并降低成本。AutoOps 适用于云端和自管理部署。请参阅关于 AutoOps 的更多信息。AutoOps 针对 Elastic Cloud Hosted 部署和 Cloud Connect 集群进行了重新设计。此次更新新增了 Critical 严重级别并刷新了所有页面包括 Template Optimizer、Nodes、Shards 和 Overview。更新后的布局和导航让 Elasticsearch 问题更容易被查看和排查。本文将介绍重新设计后的 UI以及 AutoOps 下一步的发展方向包括无界面、agentic 体验。重新设计后的 AutoOps 部署视图具有更清晰的事件时间线并区分了开放事件和已关闭事件为什么 Elasticsearch 的 AutoOps 需要更清晰的优先级划分大规模运行 Elasticsearch 要求管理员同时监控集群健康状态、性能、容量和配置。现在AutoOps 提供了一种更清晰的方式用于区分可能威胁集群功能的情况以及较为重要但紧急程度较低的性能下降问题。重新设计后的界面也遵循了用户熟悉的 Elastic Cloud Console 模式使活跃问题更容易发现和调查。AutoOps 的变化严重级别、导航、配置和页面设计监控引擎保持不变。重新设计后的布局、导航和工作流程现在遵循用户熟悉的 Elastic 模式。更清晰的严重级别模型新的事件严重级别以及重新分类后的事件严重级别。我们新增了Critical严重级别用于表示对集群功能构成即时威胁、需要紧急处理的情况。之前被分类为 High 的一些事件现在被调整为 Critical。其他一些事件现在调整为 Medium因为它们代表潜在风险而不是正在发生的、严重的性能下降。重新分类的事件包括从 High 提升到 CriticalDisk Watermark Flood Stage、Master Not Discovered 和 Status Red。从 High 降级到 MediumDisk Watermark Low Threshold、Disk Watermark Low 和 Disk Watermark Configuration Incorrect。严重级别含义Critical对集群功能构成即时威胁。需要紧急处理。High对可用性、性能或稳定性造成显著影响。Medium如果不处理可能进一步升级的潜在风险。Low对运行影响很小的轻微异常。Info常规运行更新和配置变更。无需采取操作。将在近期更新中推出。每个严重级别都配备了更新后的图标集合和颜色方案。级别保持固定这样团队可以构建一致的运行手册和通知过滤规则将 Critical 和 High 事件发送到 PagerDuty 或 Slack将 Medium 和 Low 事件保留在控制台中进行定期检查当 Info 事件出现时仅用于了解情况避免产生告警疲劳。部署视图并排展示开放事件和历史记录重新设计后的部署视图以更清晰的布局展示现有的 Open events 和 Event history 标签页。将开放事件和历史记录分开到不同标签页中使当前问题和过去活动更容易查看。事件详情弹窗更清晰地查看关键内容事件详情弹窗围绕操作进行了重新设计。高严重级别事件包含通知提示框以及一个交互式徽章用于显示是否已配置告警并直接链接到设置页面。建议内容默认折叠以便让核心事件保持在关注中心。设置选项位于弹窗菜单中分享功能作为独立图标显示在标题栏中。Dismiss 操作仅在你的角色拥有所需的管理员权限并且该事件支持关闭时才会显示。事件详情弹窗无需离开当前洞察页面即可展示通知设置和推荐操作。AutoOps 概览跨 Elasticsearch 集群资产排查活跃事件Overview 页面围绕运维人员查看整个环境的方式进行了重新组织。Elasticsearch 上下文信息现在直接位于页面标题下方活跃事件则以event ribbon的形式显示在部署列表下方。每个 ribbon 会显示你所选时间范围内最新的活跃事件如果相同类型的事件在其他部署中也处于开放状态新的徽章会让你无需逐个打开资源即可展开查看。事件搜索功能移动到了左侧以便更快速地进行筛选。“Events over time” 图表已从 Overview 页面移除以保持该页面专注于整个集群资产级别的排查当你需要查看时间线时可以打开单个部署。Event ribbon 将多个部署中的活跃问题进行分组展示让你无需逐个打开部署即可进行排查。Nodes、Shards 和 Indices 采用更易用的导航和信息层级设计Nodes 视图现在使用更新后的图表组件和 Elastic UI 配色方案并在折叠面板区域中提供清晰的展开指示。为了减少干扰移除了与部署级视图重复的事件列表和实例列表。Shards 视图改进了节点选择功能并将视图控制选项集中到右上角。新增的水平滚动条支持更宽的布局同时时间滑块现在使用原生 Elastic UI 组件。Shards 视图中的节点选择功能现在可以适用于更大规模的集群并且一次最多展示 100 个节点。Shards 视图整合了控制选项并使用原生 Elastic UI 组件进行时间范围选择。Index 视图保留了你已经熟悉的 Indices 表格体验包括排序、时间范围拖动选择以及针对有意义时间范围优化后的图表缩放行为。Template OptimizerTemplate Optimizer 现在提供了一个可搜索的模板列表并按照最近识别出的建议进行排序。你可以直接打开每条建议或者展开 JSON 面板查看完整的模板内容。Template Optimizer 根据最近发现的问题展示模板列表并提升了搜索能力。配置通知和事件设置通知设置现在支持连接器搜索、更清晰的筛选条件以及更简单的连接器编辑流程。事件设置从弹出窗口迁移到了 flyout与 AutoOps 中使用的统一模式保持一致。通知报告仍然保留相同的 10 天历史记录窗口仅进行了轻微的布局更新关闭事件功能则使用了更新后的确认组件与 Elastic UI 保持一致。事件设置提供了更便捷的导航并支持将自定义配置应用到多个集群。导航和控制部署选择器现在显示部署 ID 和实时集群状态并在下拉子菜单中提供复制部署名称和 ID 的操作。节点选择支持全选、按节点层级分组选择以及清晰标识主节点。日期选择器采用与 Kibana 和其他 Cloud Console 监控视图相同的相对时间范围和自定义时间范围模式。AutoOps 路线图API、MCP、CLI 和 agentic 体验展望未来我们正在构建面向无界面headless的 agentic AutoOps 体验。即将推出的公开 AutoOps API 将使 AutoOps 洞察和原始指标能够在 AutoOps 界面之外使用。管理员和 agent 将能够直接查询API或者将其数据存储到 Elasticsearch 中。该 API 也将为与以下组件的集成提供基础MCPElastic Agent BuilderElastic CLIKibana原生 AutoOps chat具体方向包括托管 MCP server让 Claude 和 Cursor 等 MCP 客户端能够访问 AutoOps 洞察。原生 Elastic Agent Builder tool在 Elastic Agent Builder 中使用 AutoOps 洞察。Elastic CLI 支持通过 Elastic CLI 访问 AutoOps API。Kibana 中的 AutoOps在 Kibana 中展示相关洞察和指标。原生 AutoOps chat在 Elastic Cloud Console 的 AutoOps UI 中通过 agentic chat 体验调查集群问题。应用程序重新设计是这一方向的基础未来这些入口将帮助运维人员在自动化和 AI 已经存在的环境中更高效地工作。更多即将推出的内容请查看 Elastic public roadmap。如何在 Elastic Cloud Console 中开始使用重新设计后的 AutoOps登录 Elastic Cloud Console打开一个部署、项目或已连接集群然后从导航栏中选择AutoOps。更多信息请查看 AutoOps 文档。本文中描述的任何功能或特性的发布时间和推出时间均由 Elastic 自行决定。目前尚未提供的任何功能或特性可能无法按时发布或者可能不会发布。原文AutoOps redesigned experience - triage Elasticsearch faster - Elasticsearch Labs

相关新闻

最新新闻

日新闻

周新闻

月新闻