Rook ceph rotto su kubernetes?

Sep 08 2020

Utilizzando Ceph v1.14.10, Rook v1.3.8 su k8s 1.16 in sede. Dopo 10 giorni senza problemi, abbiamo deciso di svuotare alcuni nodi, quindi tutti i pod spostati non possono più attaccarsi al loro PV, sembra che il cluster Ceph sia rotto:

La mia ConfigMap rook-ceph-mon-endpointsfa riferimento a 2 IP mon pod mancanti:

csi-cluster-config-json: '[{"clusterID":"rook-ceph","monitors":["10.115.0.129:6789","10.115.0.4:6789","10.115.0.132:6789"]}]

Ma

kubectl -n rook-ceph get pod -l app=rook-ceph-mon -o wide

NAME                               READY   STATUS    RESTARTS   AGE     IP             NODE                    NOMINATED NODE   READINESS GATES
rook-ceph-mon-e-56b849775-4g5wg    1/1     Running   0          6h42m   10.115.0.2     XXXX   <none>           <none>
rook-ceph-mon-h-fc486fb5c-8mvng    1/1     Running   0          6h42m   10.115.0.134   XXXX   <none>           <none>
rook-ceph-mon-i-65666fcff4-4ft49   1/1     Running   0          30h     10.115.0.132   XXXX   <none>           <none>

È normale o devo eseguire una sorta di attività di "riconciliazione" per aggiornare il CM con nuovi IP mon pod?

(potrebbe essere correlato a https://github.com/rook/rook/issues/2262)


Ho dovuto aggiornare manualmente:

  • segreto rook-ceph-config
  • cm rook-ceph-mon-endpoint
  • cm rook-ceph-csi-config

Risposte

ThomasDecaux Sep 10 2020 at 22:48

Come ha detto @travisn:

L'operatore possiede l'aggiornamento di quella mappa di configurazione e segreto. Non è previsto che li aggiorni manualmente a meno che non si verifichi una situazione di ripristino di emergenza come descritto inhttps://rook.github.io/docs/rook/v1.4/ceph-disaster-recovery.html.