
Se un server del cluster Proxmox presenta un problema che impatta i suoi OSD Ceph, sostituire un nodo in Proxmox non deve diventare un incubo.
Per risolvere questo problema, è necessario dismettere correttamente il server guasto ed eseguire la sostituzione del nodo in modo appropriato per garantire la resilienza dei dati Ceph.
Il cluster Ceph dovrebbe indicare il suo stato come healthy per garantire il corretto funzionamento e l'integrità dei dati.

Cosa succede se un host si guasta? È chiaro che l'operazione per sostituire un nodo Proxmox deve essere eseguita il più presto possibile, specialmente se è in uso un sistema iperconvergente come un cluster Ceph, poiché il guasto del nodo comporta la perdita non solo di vCPU e RAM ma anche di storage. In questo esempio, il nodo proxmox03 ha un problema e deve essere sostituito.
Procedura per sostituire un nodo in Proxmox
Il primo step della procedura per sostituire un nodo in Proxmox è verificare gli host disponibili nel cluster.
# pvecm nodes
Rimozione OSD
Verificare gli OSD per identificare quali dischi sono in stato down. Nell'esempio, i dischi 4 e 5 devono essere rimossi dal cluster Ceph.
# ceph osd tree
Rimuovere gli OSD che appartengono al nodo guasto.
# ceph osd purge osd.4 --yes-i-really-mean-it
# ceph osd purge osd.5 --yes-i-really-mean-it
Rimuovere il nodo guasto dalla crush map.
# ceph osd crush remove proxmox03
Rimuovere mon
Rimuovere il monitor guasto dal cluster Ceph.
# ceph mon remove proxmox03
Modificare il file /etc/pve/ceph.conf e rimuovere i riferimenti al mon da mon_host e la voce sottostante.
mon_host= 10.10.201.30
[mon.proxmox03]
public_addr = 10.10.201.30
# vi /etc/pve/ceph.conf
Una volta rimossi i riferimenti al mon guasto, uscire e salvare il file /etc/pve/ceph.conf.
Modificare il file /etc/pve/priv/authorized_keys e rimuovere la chiave relativa al nodo guasto.
# vi /etc/pve/priv/authorized_keys
Spostare le VM orfane su un altro host
Se alcune VM non protette da HA sono in esecuzione sull'host guasto, queste devono essere spostate su un altro host funzionante per consentire la corretta operazione per sostituire un nodo in Proxmox.
Identificare la VM da rimuovere (145 nell'esempio) e spostare la VM su un altro host nel cluster.
# cd /etc/pve/nodes/proxmox03/qemu-server
# ls
# mv 145.conf /etc/pve/nodes/proxmox02/qemu-server/
La VM è stata spostata correttamente su un nodo funzionante del cluster.
Rimuovere il nodo guasto dal cluster
Quando tutte le VM sono state spostate dall'host guasto, il nodo può essere rimosso dal cluster Proxmox.
# pvecm delnode proxmox03
Il nodo è stato rimosso correttamente dal cluster.
Anche il Monitor e il Manager Ceph configurati sul nodo guasto sono stati rimossi.
Il cluster Ceph è ancora funzionante ma, ovviamente, opera in uno stato degradato a causa del nodo mancante.
Aggiungere il nuovo nodo
Per sostituire un nodo in Proxmox, è richiesto un nuovo server con la stessa configurazione degli host esistenti membri del cluster Proxmox.
Dal cluster Proxmox, selezionare Datacenter > Cluster e cliccare su Join Information.
Cliccare su Copy Information per copiare le informazioni necessarie per effettuare il join al cluster.
Andare sul nuovo server Proxmox da aggiungere, selezionare il nodo e andare alla sezione Cluster. Cliccare su Join Cluster.
Inserire la Password dell'account root e cliccare su Join 'nome_cluster'.
Il nodo viene aggiunto al cluster Proxmox.
Il nuovo nodo è stato aggiunto correttamente.
Verificare lo stato del cluster.
# pvecm status
Installare Ceph
Poiché il nuovo nodo farà parte anche del cluster Ceph, selezionare il nuovo nodo e accedere alla sezione Ceph. Cliccare su Install Ceph.
Selezionare il tipo di Repository e verificare di installare squid (19.2) come versione di Ceph. Cliccare su Start squid installation.
Digitare Y per procedere con l'installazione.
Quando l'installazione viene completata, cliccare su Next.
Poiché il cluster Ceph è già installato, non è necessario configurare nulla. Cliccare su Next.
Cliccare su Finish per uscire dalla procedura guidata.
Creare gli OSD
Una volta aggiunto il nodo, è necessario creare l'OSD per aggiungere storage al cluster Ceph. Cliccare su Create OSD.
Selezionare il primo Disk da aggiungere e cliccare su Create.
L'OSD viene creato.
Ripetere la stessa operazione per tutti i dischi disponibili.
Creare Monitor e Manager
Posizionarsi nell'area Monitor e cliccare su Create nella sezione Monitor per creare il monitor relativo al nuovo nodo.
Selezionare il nuovo Host e cliccare su Create.
Eseguire la stessa operazione anche per il componente Manager.
Verificare il cluster Ceph
Quando tutte le attività richieste per sostituire un nodo in Proxmox nel cluster Ceph sono state completate, verificare lo stato del cluster stesso dall'area Cluster della GUI.
Lo stato del cluster Ceph è integro e l'operazione per sostituire un nodo in Proxmox è stata completata correttamente.














































