Como reescrever esse código em uma expressão aplicar lambda?

Aug 25 2020

Meu dataframe (df) tem algumas entradas NaN na nova coluna, 's_score', que posso excluir usando func (x). ou seja, a execução de document_path_similarity () leva a alguns NaNs, impedindo a execução de most_similar_docs () (se eu não usar func (x) primeiro). D1, D2 são df.columns com dados de string.

df
Quality D1                                  D2
0   1   Ms Stewart, the chief executive...  Ms Stewart, 61, its chief executive 
1   1   After more than two years' det...   After more than two years in 
def most_similar_docs():

    def func(x):
        try:
            return document_path_similarity(x['D1'], x['D2'])
        except:
            return np.nan
    df['s_score'] = df.apply(func, axis=1)

Existe uma maneira de reescrever este código como uma linha?

Minhas tentativas, como abaixo, levam a 'ValueError: (' max () arg é uma sequência vazia 'ou SyntaxError.

df['s_scores'] = df.apply(lambda x: document_path_similarity(x.D1, x.D2),axis=1)
paraphrases['s_scores'] = paraphrases.apply(lambda x: document_path_similarity(x.D1, x.D2),axis=1 if np.isnan(x))

Respostas

1 RobRaymond Aug 25 2020 at 18:34

Não acho que haja algo errado com seu pandascódigo. O que eu descobri é que similarity_score()está falhando porque está tentando tirar o máximo de uma lista vazia. Forcei a lista a não ficar vazia, forçando uma pontuação zero. Esta é a primeira vez que vejo esta biblioteca, portanto, não presuma que meu patch é de boa qualidade.

import io
df = pd.read_csv(io.StringIO("""  Quality  D1                                  D2
0   1   Ms Stewart, the chief executive...  Ms Stewart, 61, its chief executive 
1   1   After more than two years' det...   After more than two years in """), sep="\s\s+", engine="python")

def similarity_score(s1, s2):
    list1 = []
    for a in s1:
        # patch +[0] at end so never finding max of empty list
        list1.append(max([i.path_similarity(a) for i in s2 if i.path_similarity(a) is not None]+[0]))
    output = sum(list1)/len(list1)
    return output

df = df.assign(
    s_scores=lambda x: x.apply(lambda r: document_path_similarity(r.D1, r.D2), axis=1)
)

print(df.to_string(index=False))

resultado

 Quality                                  D1                                   D2  s_scores
       1  Ms Stewart, the chief executive...  Ms Stewart, 61, its chief executive  0.838889
       1   After more than two years' det...         After more than two years in  0.912500