Progettazione dell'architettura API per letture veloci di file di testo con 150 milioni di etichette univoche

Aug 19 2020

Supponi un file di testo con 150 milioni di record unici.

Ogni record ha due colonne: (1) stringa e (2) intero.

La stringa è un'etichetta univoca e il numero intero è il valore dell'etichetta.

L'unica query restituirà il valore intero per una data etichetta.

Stiamo esplorando più architetture per esporre questo file di testo come un'API.

Questo file di testo viene rigenerato ogni 72 ore. ~ 90% dei dati rimane lo stesso durante la rigenerazione, ma questa rigenerazione è controllata da una terza parte. Riceviamo semplicemente un nuovo file di testo ogni 72 ore.

Puntiamo a prestazioni di query di 100 ms - 500 ms per lettura.

Architettura 1

Memorizza il file di testo su disco. Interroga il file di testo. Cache query in memoria.
Pro: implementazione semplice. Facile aggiornare i dati.
Contro: Inelegant. Le query di lettura non memorizzate nella cache sono lente.

Architettura 2

Analizza il file di testo in un database tradizionale / NoSQL, con ogni riga trattata come un record / documento del database. Esegui query sul database.
Pro: sembra un'architettura standard.
Contro: l'aggiornamento di 150 milioni di record di database è lento e sembra uno spreco, soprattutto perché circa il 90% dei record rimane lo stesso.

Architettura 3

Utilizzare Redis o il database in memoria per archiviare il file di testo da 5 GB. Esegui query sul database in memoria.
Pro: query veloci. Facile aggiornare i dati.
Contro: costoso.

Architettura 4

Utilizza ElasticSearch per eseguire query sui record.
Pro: ElasticSearch è progettato per la ricerca.
Contro: ES può essere eccessivo per domande così semplici.

Domande:

Dovremmo considerare altre architetture o ci sono pro / contro che abbiamo trascurato?
Questa sfida ingegneristica sembra comune: qual è l'architettura più "standard" per bilanciare costi / prestazioni quando si cerca di produrre letture veloci rispetto a un archivio dati di 150 milioni di record che cambiano?

Risposte

6 AvnerShahar-Kashtan Aug 20 2020 at 04:47

In generale, questo sembra un classico caso per un flusso ETL: ottieni il nuovo file, estrai i dati, trasformalo nel tuo formato e carica nel tuo DB. Alcune note:

La cosa importante da ricordare è che il caricamento e l'interrogazione riguardano operazioni diverse e completamente indipendenti. Una domanda è "come faccio a caricare in modo efficiente un file di record di 150 m giornalieri in un archivio dati quando il 90% dei record sono duplicati", e l'altra è "come posso interrogare in modo efficiente un archivio chiave / valore di 150 m". Rispondi a queste due domande separatamente, perché sono indipendenti.
Per la tua prima domanda, ti preoccupi che caricare il 90% di record identici sia uno spreco. Hai misurato il tempo necessario? La lettura di 150 milioni di record da un file di testo dovrebbe richiedere pochi secondi e un buon archivio chiave / valore dovrebbe essere in grado di ottimizzare le operazioni di AGGIORNAMENTO ridondanti. In alternativa, diff il nuovo file con quello precedente per creare un elenco di modifiche effettive come parte del flusso ETL, quindi procedi al caricamento. Definisci le metriche per questa soluzione (tempo totale di lettura, diff, caricamento, interruzione dell'operazione di query durante il caricamento, ecc.) In modo da poter valutare la tua soluzione.
Per la domanda n. 2, evitare di implementare soluzioni personalizzate quando esistono opzioni standard. ElasticSearch potrebbe essere eccessivo perché stai solo archiviando numeri interi con chiave, ma ci sono molti archivi chiave / valore là fuori che ti daranno buone prestazioni per le letture, tra cui la memorizzazione nella cache supportata da disco, la memorizzazione nella cache MRU o diverse strategie di memorizzazione nella cache a seconda del tuo utilizzo, forse la summenzionata operazione UPDATE non operativa e altro ancora. Ancora una volta, come nella domanda n. 1, definisci le metriche per il successo. Hai detto "caricare 5 GB nella RAM è costoso. È? Quanta RAM ha il tuo server? Prendi in considerazione la memorizzazione nella cache delle query comuni. È necessario? Quanto sono veloci le letture non nella cache? Misura! Hai bisogno di una strategia di memorizzazione nella cache personalizzata come il precaching dei record correlati ? Esamina il tuo modello di utilizzo.

Non posso dirti quale sia l'approccio migliore. Ci sono troppe variabili che solo tu conosci: il tuo budget e il tuo modello di utilizzo, i piani futuri per il sistema e il potenziale di estensibilità, relazione con l'origine dati di terze parti (ad esempio possono essere convinti a generare solo differenze o aggiungere timestamp / tag di versione per i record, ecc.). Tutto quello che posso fare è suggerire modelli fondamentali: separare i flussi di importazione dai flussi di query, utilizzare strumenti collaudati e, soprattutto, misurare, misurare, misurare.