当底层主机(物理服务器)发生故障时,EC2 恢复操作是自动恢复实例并保留其私有 IP 地址、弹性 IP 地址和所有实例元数据的最佳方法。StatusCheckFailedSystem 指标用于检测底层硬件问题,例如电源故障、网络连接丢失或物理主机故障。当此警报触发时,EC2 恢复操作会将实例迁移到新的健康主机,同时保留其所有配置。将警报配置为发布到 SNS 主题,可以确保 SysOps 团队在恢复开始时收到电子邮件通知。
其他选项不正确的原因如下:
StatusCheckFailedInstance 指标检测的是操作系统或应用程序层面的问题,而不是底层主机故障,因此不能用于触发主机故障恢复。
Auto Scaling 组旨在根据需求自动调整实例数量,并在实例终止时启动新实例。虽然它可以在实例失败时启动新实例,但默认情况下,新实例会获得新的私有 IP 地址,并且不会自动重新关联弹性 IP 地址,这不符合题目要求。即使尝试在启动模板中指定私有 IP 和弹性 IP,也无法保证在 Auto Scaling 组中始终分配到相同的私有 IP 或弹性 IP,尤其是在实例被替换时。