7.4.16. CephNodeDown


意味

Ceph Pod を実行しているノードがダウンしています。Ceph はノード障害に対処するように設計されているため、ストレージ操作は引き続き機能しますが、別のノードがダウンしてストレージ機能に影響を与えるリスクを最小限に抑えるために、問題を解決することを推奨します。

影響

Medium

診断

  1. 実行中および障害が発生しているすべての Pod を一覧表示します。

    oc -n openshift-storage get pods
    重要

    オブジェクトストレージデバイス (OSD) Pod が新しいノードでスケジュールされるように、OpenShift Data Foundation のリソース要件を満たしていることを確認します。Ceph クラスターが障害発生中で現在復旧中の OSD のデータを回復するため、これには数分かかる場合があります。この復旧の動作を確認するには、OSD Pod が新しいワーカーノードに正しく配置されていることを確認します。

  2. 障害が発生していた OSD Pod が現在実行されているかどうかを確認します。

    oc -n openshift-storage get pods

    障害が発生していた OSD Pod がスケジュールされていない場合は、describe コマンドを使用してイベントを確認し、Pod が再スケジュールされなかった理由を特定します。

  3. 障害が発生している OSD Pod のイベントに関する情報を取得します。

    oc -n openshift-storage get pods | grep osd
  4. 障害が発生している 1 つ以上の OSD Pod を見つけます。

    oc -n openshift-storage describe pods/<osd_podname_ from_the_ previous step>

    イベントセクションで、リソースが満たされていないなど、障害の理由を探します。

    さらに、rook-ceph-toolbox を使用して復旧を確認することもできます。このステップはオプションですが、大規模な Ceph クラスターの場合に役立ちます。ツールボックスにアクセスするには、次のコマンドを実行します。

    TOOLS_POD=$(oc get pods -n openshift-storage -l app=rook-ceph-tools -o name)
    oc rsh -n openshift-storage $TOOLS_POD

    rsh コマンドプロンプトから次のコマンドを実行し、io セクションの下の "recovery" を確認します。

    ceph status
  5. 障害が発生したノードがあるかどうかを確認します。

    1. ワーカーノードのリストを取得し、ノードのステータスを確認します。

      oc get nodes --selector='node-role.kubernetes.io/worker','!node-role.kubernetes.io/infra'
    2. NotReady ステータスのノードに対して describe を使用し、障害に関する詳細情報を取得します。

      oc describe node <node_name>

軽減策

デバッグログの情報
  • この手順は任意です。次のコマンドを実行して、Ceph クラスターのデバッグ情報を収集します。

    $ oc adm must-gather --image=registry.redhat.io/odf4/odf-must-gather-rhel9:v4.16
Red Hat logoGithubredditYoutubeTwitter

詳細情報

試用、購入および販売

コミュニティー

会社概要

Red Hat は、企業がコアとなるデータセンターからネットワークエッジに至るまで、各種プラットフォームや環境全体で作業を簡素化できるように、強化されたソリューションを提供しています。

多様性を受け入れるオープンソースの強化

Red Hat では、コード、ドキュメント、Web プロパティーにおける配慮に欠ける用語の置き換えに取り組んでいます。このような変更は、段階的に実施される予定です。詳細情報: Red Hat ブログ.

Red Hat ドキュメントについて

Legal Notice

Theme

© 2026 Red Hat
トップに戻る