Ricostruisci panda Dataframe
sono abbastanza nuovo in Python. Ho problemi con la ricostruzione di un Dataframe difettoso. Il mio Dataframe ha questo aspetto:
df = pd.DataFrame({'col1': ['id 1', 'id 2', 'test 3', 'test 4'],
'col2': ['test 1', 'test 2',
'Number 6135', 'id 4'],
'col3': ['Number 12344', 'Number 21612','id 3','Number 1131']})
Come puoi vedere ho gli "id" nel primo, secondo e Thrid col. Lo stesso per gli altri Valori.
Il mio obiettivo è avere un Dataframe in cui ogni Col ha solo i Valori che iniziano con la stessa sottostringa come questo esempio:
Ho già provato a usare for Loops e if Statments per verificare se una certa sottostringa è nella mia stringa. se è vero creo una nuova colonna e scrivo il mio valore al suo interno
for x in df['col1']:
if 'id' in x:
df['newCol']=x
so che questo codice non risolverà mai il mio problema, forse c'è qualche funzione panda che può aiutarmi a risolvere questo problema
Se qualcosa non è chiaro, chiedimi solo che farò del mio meglio per spiegare il mio problema. Grazie in anticipo per il tuo aiuto e vacci piano con me :)
Risposte
È possibile utilizzare sorted()con la funzione chiave personalizzata:
def key_fn(x):
if 'id' in x:
return 0
if 'test' in x:
return 1
if 'Number' in x:
return 2
return 3
df = df.apply(lambda x: pd.Series(sorted(x, key=key_fn)), axis=1)
df = df.rename(columns=lambda x: 'col{}'.format(x+1))
print(df)
Stampe:
col1 col2 col3
0 id 1 test 1 Number 12344
1 id 2 test 2 Number 21612
2 id 3 test 3 Number 6135
3 id 4 test 4 Number 1131
Un'altra versione, dai commenti:
df = pd.DataFrame([sorted(l, key=key_fn) for l in df.values], columns=df.columns)
print(df)
Se possibile, semplificare la soluzione suddividendo i valori per primo spazio:
df = (df.reset_index()
.melt('index')
.assign(new = lambda x: x['value'].str.split().str[0])
.pivot('index','new','value'))
print (df)
new Number id test
index
0 Number 12344 id 1 test 1
1 Number 21612 id 2 test 2
2 Number 6135 id 3 test 3
3 Number 1131 id 4 test 4
Altrimenti puoi usare Series.str.extract:
L = ['id','test','Number']
df = (df.reset_index()
.melt('index')
.assign(new = lambda x: x['value'].str.extract(f'({"|".join(L)})', expand=False))
.pivot('index','new','value'))
print (df)
new Number id test
index
0 Number 12344 id 1 test 1
1 Number 21612 id 2 test 2
2 Number 6135 id 3 test 3
3 Number 1131 id 4 test 4
Prova questo:
s = df.melt()['value']
df_final = pd.DataFrame({x: s[s.str.startswith(x)].values
for x in s.str.split().str[0].unique()})
Out[27]:
id test Number
0 id 1 test 3 Number 6135
1 id 2 test 4 Number 12344
2 id 4 test 1 Number 21612
3 id 3 test 2 Number 1131
Puoi prima fondere il dataframe, quindi utilizzare numpy select per riordinare i nomi e infine pivot :
(df.melt(ignore_index=False)
.assign(variable=lambda x: np.select([x.value.str.startswith("id"),
x.value.str.startswith("test"),
x.value.str.startswith("Number")],
["col1", "col2", "col3"]))
.reset_index()
.pivot("index", "variable", "value")
.rename_axis(columns=None, index=None))
col1 col2 col3
0 id 1 test 1 Number 12344
1 id 2 test 2 Number 21612
2 id 3 test 3 Number 6135
3 id 4 test 4 Number 1131