第 10 章 在高可用性集群中配置 SBD 隔离


基于存储的 death (SBD)是一种隔离机制,可为传统的"电源隔离"代理提供替代方案。SBD 使用 watchdog 计时器,并在节点变得无响应或丢失仲裁时使节点自我保护。

在基于网络的电源管理不可用的环境中,您可以使用这种方法,或者确保节点在丢失对共享存储结构的访问时重新引导。

10.1. SBD 隔离概述

如果某些健康检查失败或者无法按磁盘消息传递请求重新启动,则基于存储的 death (SBD)隔离机制为节点提供自我保护的机制。您可以根据硬件和存储的可用性,以两种方式之一实施 SBD。

Expand
表 10.1. watchdog-only 和 poison-pill 隔离的比较
功能仅 watchdog 的隔离Poison-pill 隔离

机制

依赖于健康和仲裁监控。如果节点丢失仲裁或无法验证自己的健康状况,它会停止重置 watchdog 计时器。只有 stonith-watchdog-timeout 过期后,集群才会假设隔离成功。

使用共享存储来通过 fence_sbd 代理发送显式"poison pill"消息。如果目标节点响应,它会读取消息并立即重启。如果节点不响应或存储无法访问,它依赖于 watchdog 计时器来触发重启。

存储要求

无。

需要 1 到 3 个共享块设备(每个设备最少 4 MB)。设备必须可以被所有节点访问,也无法托管文件系统、由 LVM 管理,或者作为集群管理的 RAID/mirroring 层的一部分。

可靠性

可靠性来自 watchdog 设备(硬件 WDT 或 softdog)来监管软件计时器。硬件 WDTs 是首选的;softdog (内核空间)是一个受支持的回退,但如果内核完全挂起或资源不足,则可能会失败。

可靠性从相同的 watchdog 设备机制衍生而来。虽然磁盘有助于通信,但 watchdog 设备负责保证重启。因为 Pacemaker 感知在磁盘不可用时可以访问集群,因此即使单个共享磁盘并不代表单一故障点(SPOF)。但是,当存储设备不可用时,请使用三个磁盘。

性能

通过减少网络延迟 blips,可以配置以加快恢复速度。但是,集群必须在恢复资源前等待完整的 stonith-watchdog-timeout 过期。

有可能提供更快的重启速度,因为响应的目标节点可能会立即响应隔离消息。但是,可能需要更高的存储层超时(如 30s)来考虑存储维护或固件更新。如果节点快速恢复资源恢复时间,则可能会短,否则资源恢复会按照这些存储超时要求保存。

常见用例

没有共享存储的环境。最少有 3 个仲裁投票器(或 2 个节点和 QDevice)的集群首选。

主要用于 2 节点集群来绕过仅 watchdog 设置的 3 票仲裁限制。对于成员之间的网络链接可能会严重但存储可以访问的多站点集群。

Red Hat logoGithubredditYoutubeTwitter

学习

尝试、购买和销售

社区

關於紅帽

我们提供强化的解决方案,使企业能够更轻松地跨平台和环境(从核心数据中心到网络边缘)工作。

让开源更具包容性

红帽致力于替换我们的代码、文档和 Web 属性中存在问题的语言。欲了解更多详情,请参阅红帽博客.

关于红帽文档

Legal Notice

Theme

© 2026 Red Hat
返回顶部