第 10 章 在高可用性集群中配置 SBD 隔离
基于存储的 death (SBD)是一种隔离机制,可为传统的"电源隔离"代理提供替代方案。SBD 使用 watchdog 计时器,并在节点变得无响应或丢失仲裁时使节点自我保护。
在基于网络的电源管理不可用的环境中,您可以使用这种方法,或者确保节点在丢失对共享存储结构的访问时重新引导。
10.1. SBD 隔离概述 复制链接链接已复制到粘贴板!
如果某些健康检查失败或者无法按磁盘消息传递请求重新启动,则基于存储的 death (SBD)隔离机制为节点提供自我保护的机制。您可以根据硬件和存储的可用性,以两种方式之一实施 SBD。
| 功能 | 仅 watchdog 的隔离 | Poison-pill 隔离 |
|---|---|---|
| 机制 |
依赖于健康和仲裁监控。如果节点丢失仲裁或无法验证自己的健康状况,它会停止重置 watchdog 计时器。只有 |
使用共享存储来通过 |
| 存储要求 | 无。 | 需要 1 到 3 个共享块设备(每个设备最少 4 MB)。设备必须可以被所有节点访问,也无法托管文件系统、由 LVM 管理,或者作为集群管理的 RAID/mirroring 层的一部分。 |
| 可靠性 |
可靠性来自 watchdog 设备(硬件 WDT 或 | 可靠性从相同的 watchdog 设备机制衍生而来。虽然磁盘有助于通信,但 watchdog 设备负责保证重启。因为 Pacemaker 感知在磁盘不可用时可以访问集群,因此即使单个共享磁盘并不代表单一故障点(SPOF)。但是,当存储设备不可用时,请使用三个磁盘。 |
| 性能 |
通过减少网络延迟 blips,可以配置以加快恢复速度。但是,集群必须在恢复资源前等待完整的 | 有可能提供更快的重启速度,因为响应的目标节点可能会立即响应隔离消息。但是,可能需要更高的存储层超时(如 30s)来考虑存储维护或固件更新。如果节点快速恢复资源恢复时间,则可能会短,否则资源恢复会按照这些存储超时要求保存。 |
| 常见用例 | 没有共享存储的环境。最少有 3 个仲裁投票器(或 2 个节点和 QDevice)的集群首选。 | 主要用于 2 节点集群来绕过仅 watchdog 设置的 3 票仲裁限制。对于成员之间的网络链接可能会严重但存储可以访问的多站点集群。 |