Come aggiungere righe per un dataframe timeseries?

Dec 31 2020

Sto scrivendo un programma che caricherà in un file excel timeseries in un dataframe, quindi creo diverse nuove colonne utilizzando alcuni calcoli di base. Il mio programma a volte leggerà file excel che mancano mesi per alcuni record. Quindi, nell'esempio seguente, ho i dati sulle vendite mensili per due diversi negozi. I negozi aprono in mesi diversi, quindi la data di fine del primo mese sarà diversa. Ma entrambi dovrebbero avere dati di fine mese fino al 30/9/2020. Nel mio file, Store BBB non ha record per il 31/8/2020 e il 30/9/2020 perché non ci sono state vendite durante quei mesi.

Negozio	Mese aperto	Stato	Città	Data di fine mese	I saldi
AAA	31/5/2020	NY	New York	31/5/2020	1000
AAA	31/5/2020	NY	New York	30/6/2020	5000
AAA	31/5/2020	NY	New York	30/7/2020	3000
AAA	31/5/2020	NY	New York	31/8/2020	4000
AAA	31/5/2020	NY	New York	30/9/2020	2000
BBB	30/6/2020	CT	Hartford	30/6/2020	100
BBB	30/6/2020	CT	Hartford	30/7/2020	200

Quindi, per qualsiasi istanza come questa, voglio essere in grado di aggiungere due righe per Store BBB per 8/31 e 9/30. Le nuove righe devono utilizzare lo stesso mese di apertura, stato e città dalla data di fine mese più recente. Le vendite dovrebbero essere impostate su 0 per entrambe le nuove righe. A partire da ora, eseguo i seguenti passaggi:

Crea il dataframe "MaxDateData" con il nome del negozio e la data di fine mese massima per ogni negozio e anche la data di fine mese massima per l'intero frame di dati della serie temporale, io chiamo questo campo "Data più recente".

Negozio	Data di fine mese max	Data più recente
AAA	30/9/2020	30/9/2020
BBB	30/7/2020	30/9/2020

Crea il dataframe "MostRecent" con la riga più recente dal dataframe della serie temporale principale. Per fare ciò, eseguo un join interno tra il dataframe della serie temporale e MaxDateData su Nome negozio e Data di fine mese max.

Negozio	Mese aperto	Stato	Città	Data di fine mese	I saldi	Data di fine mese max	Data più recente
AAA	31/5/2020	NY	New York	30/9/2020	2000	30/9/2020	30/9/2020
BBB	30/6/2020	CT	Hartford	30/7/2020	200	30/7/2020	30/9/2020

Creare un dataframe "RequireBackfill_MostRecent" utilizzando una clausola where per filtrare i negozi in cui Max Month End Date <Most Recent Date. Vedere il codice di seguito. Quindi, in questo esempio, la tabella RequireBackfill_MostRecent avrà solo una riga per l'archivio BBB.

RequireBackfill_Stores_MostRecent = MaxDateData.where(MaxDateData['Max Month End Date'] <MaxDateData['Most Recent Date'])
RequireBackfill_MostRecent = MostRecent.merge(RequireBackfill_Stores_MostRecent,how='inner')

Quindi uso due cicli for nidificati per scorrere le date che devo compilare. Sfrutta il dataframe RequireBackfill_MostRecent che conterrebbe solo Store BBB.

X=[]
end = MaxDateData['Most Recent Date'][0]
for i in MonthlyData['Month End Date'].unique():
    per1 = pd.date_range(start = i,  end = end, freq ='M') 
    for val in per1: 
        Data=[]
        Data = RequireBackfill_MostRecent[["Store"
                                           ,"Month Opened"
                                           ,"City"
                                           ,"State"
                                           ]].where(RequireBackfill_MostRecent['Max Month End date']==i).dropna()   

        Data["Month End Date"]= val                
        Data["Sales"]= 0
        X.append(Data)
NewData = pd.concat(X)

Quindi aggiungo NewData al mio dataframe timeseries usando concat

FullData_List = [MonthlyData,NewData]
FullData=pd.concat(FullData_List)

L'intero processo funziona, ma esiste un modo molto più efficiente per farlo? Questo potrebbe diventare costoso quando comincio a lavorare con dati più grandi.

Come aggiungere righe per un dataframe timeseries?

Risposte