Rook ceph quebrado em kubernetes?

Sep 08 2020

Usando Ceph v1.14.10, Rook v1.3.8 no k8s 1.16 no local. Após 10 dias sem nenhum problema, decidimos drenar alguns nós, então, todos os pods movidos não podem mais se conectar ao seu PV, parece que o cluster Ceph está quebrado:

Meu ConfigMap rook-ceph-mon-endpointsestá fazendo referência a 2 IPs mon pod ausentes:

csi-cluster-config-json: '[{"clusterID":"rook-ceph","monitors":["10.115.0.129:6789","10.115.0.4:6789","10.115.0.132:6789"]}]

Mas

kubectl -n rook-ceph get pod -l app=rook-ceph-mon -o wide

NAME                               READY   STATUS    RESTARTS   AGE     IP             NODE                    NOMINATED NODE   READINESS GATES
rook-ceph-mon-e-56b849775-4g5wg    1/1     Running   0          6h42m   10.115.0.2     XXXX   <none>           <none>
rook-ceph-mon-h-fc486fb5c-8mvng    1/1     Running   0          6h42m   10.115.0.134   XXXX   <none>           <none>
rook-ceph-mon-i-65666fcff4-4ft49   1/1     Running   0          30h     10.115.0.132   XXXX   <none>           <none>

É normal ou devo executar uma espécie de tarefa de "reconciliação" para atualizar o CM com novos mon pod IPs?

(pode estar relacionado a https://github.com/rook/rook/issues/2262)


Tive que atualizar manualmente:

  • rook-ceph-config secreto
  • cm rook-ceph-mon-endpoints
  • cm rook-ceph-csi-config

Respostas

ThomasDecaux Sep 10 2020 at 22:48

Como @travisn disse:

O operador possui a atualização desse configmap e segredo. Não se espera atualizá-los manualmente, a menos que haja alguma situação de recuperação de desastre, conforme descrito emhttps://rook.github.io/docs/rook/v1.4/ceph-disaster-recovery.html.