5.2.7. Down OSD
ceph health detail コマンドは、以下のようなエラーを返します。
HEALTH_WARN 1/3 in osds are down
エラー内容:
サービスの失敗やその他の OSD との通信に問題があるため、ceph-osd プロセスの 1 つを利用することはできません。そのため、残りの ceph-osd デーモンはこの失敗をモニターに報告していました。
ceph-osd デーモンが実行していない場合は、基礎となる OSD ドライブまたはファイルシステムが破損しているか、キーリングが見つからないなどのその他のエラーにより、デーモンが起動しません。
ほとんどの場合、ネットワークの問題により、ceph-osd デーモンが実行中にも down とマークされている場合に状況が生じます。
この問題を解決するには、以下を行います。
downになっている OSD を特定します。[ceph: root@host01 /]# ceph health detail HEALTH_WARN 1/3 in osds are down osd.0 is down since epoch 23, last address 192.168.106.220:6800/11080ceph-osdデーモンの再起動を試行します。OSD_ID をダウンしている OSD の ID に置き換えます。構文
systemctl restart ceph-FSID@osd.OSD_ID例
[root@host01 ~]# systemctl restart ceph-b404c440-9e4c-11ec-a28a-001a4a0001df@osd.0.service-
ceph-osdを起動できない場合は、ceph-osdデーモンが起動しない の手順を行ってください。 -
ceph-osdデーモンを起動できるものの、downとマークされている場合には、ceph-osdデーモンが実行しているが、`down` としてマークされている の手順に従ってください。
-
ceph-osd デーモンを起動できない
- 複数の OSD (通常は 13 以上) が含まれる場合には、デフォルトの最大スレッド数 (PID 数) が十分であることを確認します。詳細は、PID 数の増加 を参照してください。
-
OSD データおよびジャーナルパーティションが正しくマウントされていることを確認します。
ceph-volume lvm listコマンドを使用して、Ceph Storage Cluster に関連付けられたデバイスおよびボリュームをリスト表示してから、適切にマウントされているかどうかを確認することができます。詳細は、man ページのmount(8)を参照してください。 -
ERROR: missing keyring, cannot use cephx for authenticationが返された場合、OSD にはキーリングがありません。 ERROR: unable to open OSD superblock on /var/lib/ceph/osd/ceph-1エラーメッセージが出力されると、ceph-osdデーモンは基礎となるファイルシステムを読み込むことができません。このエラーをトラブルシューティングおよび修正する方法は、以下の手順を参照してください。-
対応するログファイルを確認して、障害の原因を特定します。デフォルトでは、ファイルへのロギングが有効になると、Ceph はデフォルトでログファイルを
/var/log/ceph/CLUSTER_FSID/ディレクトリーに保存します。 -
EIOエラーメッセージは、基盤となるディスクの障害を示します。この問題を修正するには、基礎となる OSD ディスクを交換します。詳細は、OSD ドライブを置き換え を参照してください。 ログに、以下のような他の
FAILED assertエラーが含まれる場合は、サポートチケットを作成してください。詳細は、サービスについて Red Hat サポートへの問い合わせ を参照してください。FAILED assert(0 == "hit suicide timeout")
-
対応するログファイルを確認して、障害の原因を特定します。デフォルトでは、ファイルへのロギングが有効になると、Ceph はデフォルトでログファイルを
dmesg出力で、基礎となるファイルシステムまたはディスクのエラーを確認します。dmesg-
dmesg出力にSCSI errorエラーメッセージが含まれる場合は、Red Hat カスタマーポータルの SCSI Error Codes Solution Finder ソリューションを参照して、問題を修正する最適な方法を判断してください。 - または、基礎となるファイルシステムを修正できない場合は、OSD ドライブを交換します。詳細は、OSD ドライブを置き換え を参照してください。
-
OSD が以下のようなセグメンテーション違反で失敗した場合には、必要な情報を収集してサポートチケットを作成します。詳細は、サービスについて Red Hat サポートへの問い合わせ を参照してください。
Caught signal (Segmentation fault)
ceph-osd が実行中だが、down とマークされている。
対応するログファイルを確認して、障害の原因を特定します。デフォルトでは、ファイルへのロギングが有効になると、Ceph はデフォルトでログファイルを
/var/log/ceph/CLUSTER_FSID/ディレクトリーに保存します。ログに以下のようなエラーメッセージが含まれる場合は、OSD のフラッピング を参照してください。
wrongly marked me down heartbeat_check: no reply from osd.2 since back- 他のエラーが表示される場合は、サポートチケットを作成します。詳細は、サービスについて Red Hat サポートへの問い合わせ を参照してください。