Reconstruir Dataframe do pandas

Nov 05 2020

sou muito novo em Python. Estou tendo problemas para reconstruir um Dataframe ruim. Meu Dataframe é parecido com este:

df = pd.DataFrame({'col1': ['id 1', 'id 2', 'test 3', 'test 4'],
               'col2': ['test 1', 'test 2',
                        'Number 6135', 'id 4'],
               'col3': ['Number 12344', 'Number 21612','id 3','Number 1131']})

Como você pode ver eu tenho os "id's" na primeira, segunda e terceira col. O mesmo para os outros Valores.

Meu objetivo é ter um Dataframe em que cada Col tenha apenas os Valores começando com a mesma substring como neste exemplo:

Eu já tentei usar for Loops e instruções if para verificar se um determinado Substring está na minha String. se isso for verdade, eu crio uma nova coluna e escrevo meu valor dentro dela

for x in df['col1']:
if 'id' in x:
    df['newCol']=x

Eu sei que este código nunca vai resolver o meu problema, talvez haja alguma função pandas que pode me ajudar a resolver este problema

Se algo não estiver claro, pergunte-me que farei o possível para explicar o meu problema. Agradeço antecipadamente por sua ajuda e vá com calma comigo :)

Respostas

3 AndrejKesely Nov 05 2020 at 17:34

Você pode usar sorted()com a função de tecla personalizada:

def key_fn(x):
    if 'id' in x:
        return 0
    if 'test' in x:
        return 1
    if 'Number' in x:
        return 2
    return 3 

df = df.apply(lambda x: pd.Series(sorted(x, key=key_fn)), axis=1)
df = df.rename(columns=lambda x: 'col{}'.format(x+1))
print(df)

Impressões:

   col1    col2          col3
0  id 1  test 1  Number 12344
1  id 2  test 2  Number 21612
2  id 3  test 3   Number 6135
3  id 4  test 4   Number 1131

Outra versão, a partir dos comentários:

df = pd.DataFrame([sorted(l, key=key_fn) for l in df.values], columns=df.columns)
print(df)
3 jezrael Nov 05 2020 at 17:34

Se possível, simplifique a solução dividindo os valores pelo primeiro espaço em branco:

df = (df.reset_index()
        .melt('index')
        .assign(new = lambda x: x['value'].str.split().str[0])
        .pivot('index','new','value'))
print (df)
new          Number    id    test
index                            
0      Number 12344  id 1  test 1
1      Number 21612  id 2  test 2
2       Number 6135  id 3  test 3
3       Number 1131  id 4  test 4

Caso contrário, você pode usar Series.str.extract:

L = ['id','test','Number']

df = (df.reset_index()
        .melt('index')
        .assign(new = lambda x: x['value'].str.extract(f'({"|".join(L)})', expand=False))
        .pivot('index','new','value'))
print (df)
new          Number    id    test
index                            
0      Number 12344  id 1  test 1
1      Number 21612  id 2  test 2
2       Number 6135  id 3  test 3
3       Number 1131  id 4  test 4
AndyL. Nov 05 2020 at 17:38

Experimente isto:

s = df.melt()['value']
df_final = pd.DataFrame({x: s[s.str.startswith(x)].values 
                                        for x in s.str.split().str[0].unique()})

Out[27]:
     id    test        Number
0  id 1  test 3   Number 6135
1  id 2  test 4  Number 12344
2  id 4  test 1  Number 21612
3  id 3  test 2   Number 1131
sammywemmy Nov 05 2020 at 17:48

Você poderia primeiro derreter o dataframe, depois usar a seleção numpy para reordenar os nomes e, finalmente, dinamizar :

(df.melt(ignore_index=False)
   .assign(variable=lambda x: np.select([x.value.str.startswith("id"),
                                          x.value.str.startswith("test"),
                                          x.value.str.startswith("Number")],
                                          ["col1", "col2", "col3"]))
    .reset_index()
    .pivot("index", "variable", "value")
    .rename_axis(columns=None, index=None))


    col1    col2    col3
0   id 1    test 1  Number 12344
1   id 2    test 2  Number 21612
2   id 3    test 3  Number 6135
3   id 4    test 4  Number 1131