Come connettere due computer a un cluster H2O in Python

Sep 22 2020

Ho due computer che voglio connettere a un singolo cluster H2O. Uno ha 4 core, l'altro ne ha 6. Quando corro

h2o.init(ip = '10.0.0.89', port = 54321)

sul primo computer, ottengo il seguente output:

H2O cluster uptime: 1 minutes 56 seconds 846 milliseconds
H2O cluster version:    3.8.2.3
H2O cluster name:   H2O_started_from_python_samerens_dii030
H2O cluster total nodes:    1
H2O cluster total free memory:  3.4 GB
H2O cluster total cores:    4
H2O cluster allowed cores:  4
H2O cluster healthy:    True
H2O Connection ip:  10.0.0.89
H2O Connection port:    54321
H2O Connection proxy:   None
Python Version: 3.7.4

Quando eseguo lo stesso comando sul secondo computer, ottengo lo stesso output (tranne ovviamente per il tempo di attività). I nodi totali non dovrebbero essere aumentati a 2 e i core totali non dovrebbero essere aumentati a 10? Sto facendo qualcosa di sbagliato?

Risposte

1 ErinLeDell Sep 22 2020 at 08:29

Quello che stai facendo attualmente è avviare il cluster H2O su una singola macchina e poi connetterti ad esso dall'altra macchina (questo è lo scenario in cui vuoi che due utenti abbiano accesso allo stesso cluster H2O per condividere dati / modelli).

Quello che stai cercando di fare è avviare un cluster H2O multi-nodo. Non è chiaro se questo accelererà o meno il tuo addestramento perché c'è un sovraccarico di comunicazione quando usi un cluster multi-nodo, quindi è sempre bene controllare. Se stai aggiungendo un numero maggiore di core, ad esempio 40 + 40 per un totale di 80 core, mi aspetterei che acceleri le cose nella maggior parte dei casi, ma aggiungere da 4 a 6 potrebbe non aiutare molto è utile testare la velocità di addestramento sul cluster a macchina singola a 6 core rispetto al cluster multi-core a 10 core). Ci sono istruzioni per questo nella guida utente H2O qui . C'è anche una FAQ sui cluster H2O qui . Se i documenti non sono abbastanza chiari, fammelo sapere (noto che è un po 'scarso su esempi / informazioni).

Infine, se desideri utilizzare specificamente Amazon EC2 per il clustering, ci sono maggiori informazioni al riguardo qui .