Rook Ceph cassé sur Kubernetes?

Sep 08 2020

Utilisation de Ceph v1.14.10, Rook v1.3.8 sur k8s 1.16 sur site. Après 10 jours sans aucun problème, nous avons décidé de drainer certains nœuds, puis, tous les pods déplacés ne peuvent plus se connecter à leur PV, on dirait que le cluster Ceph est cassé:

My ConfigMap rook-ceph-mon-endpointsfait référence à 2 adresses IP mon pod manquantes:

csi-cluster-config-json: '[{"clusterID":"rook-ceph","monitors":["10.115.0.129:6789","10.115.0.4:6789","10.115.0.132:6789"]}]

Mais

kubectl -n rook-ceph get pod -l app=rook-ceph-mon -o wide

NAME                               READY   STATUS    RESTARTS   AGE     IP             NODE                    NOMINATED NODE   READINESS GATES
rook-ceph-mon-e-56b849775-4g5wg    1/1     Running   0          6h42m   10.115.0.2     XXXX   <none>           <none>
rook-ceph-mon-h-fc486fb5c-8mvng    1/1     Running   0          6h42m   10.115.0.134   XXXX   <none>           <none>
rook-ceph-mon-i-65666fcff4-4ft49   1/1     Running   0          30h     10.115.0.132   XXXX   <none>           <none>

Est-ce normal ou dois-je exécuter une sorte de tâche de "réconciliation" pour mettre à jour le CM avec de nouvelles IP mon pod?

(pourrait être lié à https://github.com/rook/rook/issues/2262)


J'ai dû mettre à jour manuellement:

  • secret rook-ceph-config
  • cm rook-ceph-mon-endpoints
  • cm rook-ceph-csi-config

Réponses

ThomasDecaux Sep 10 2020 at 22:48

Comme l'a dit @travisn:

L'opérateur possède la mise à jour de cette configuration et de ce secret. Il n'est pas prévu de les mettre à jour manuellement, sauf en cas de situation de reprise après sinistre décrite àhttps://rook.github.io/docs/rook/v1.4/ceph-disaster-recovery.html.