Come esplorare e riassumere le variabili categoriali in un dataframe con Python
In qualità di data scientist, è importante comprendere le variabili nel set di dati e il modo in cui sono correlate tra loro. Le variabili categoriali, che assumono un numero limitato di valori, possono fornire preziose informazioni sui dati. Esploreremo i modi per identificare e riassumere le variabili categoriche in un dataframe usando Python.
Innanzitutto, inizieremo importando le librerie necessarie:
import numpy as np
import pandas as pd
import seaborn as sns
import matplotlib.pyplot as plt
Successivamente, caricheremo un set di dati in un dataframe. Per questo esempio, utilizzeremo il set di dati Titanic dalla libreria Seaborn:
df = sns.load_dataset(“titanico”)
Ora creiamo un elenco cat_colscontenente i nomi di tutte le colonne categoriche nel dataframe. Possiamo farlo scorrendo le colonne del dataframe e controllando se il tipo di dati è "category", "object" o "bool":
cat_cols = [col for col in df.columns if str(df[col].dtypes) in [“category”, “object”, “bool”]]
Oltre a queste colonne categoriali, potremmo anche considerare come potenziali variabili categoriali le colonne numeriche che hanno un piccolo numero di valori univoci. Possiamo creare un elenco num_but_catper queste colonne scorrendo le colonne numeriche (quelle con tipi di dati "int64" o "float") e controllando se hanno meno di 10 valori univoci (il numero di 10 che abbiamo determinato qui può variare a seconda la situazione, puoi determinarlo facendo una stima sul set di dati che incontri):
num_but_cat = [col for col in df.columns if df[col].nunique() < 10 e df[col].dtypes in [“int64”, “float”]]
D'altra parte, alcune colonne possono essere etichettate come categoriche, ma in realtà possono essere variabili numeriche. Ad esempio, una colonna contenente ID o nomi univoci potrebbe non avere alcun significato intrinseco e non dovrebbe essere trattata come categoriale. Possiamo creare un elenco cat_but_numper queste colonne scorrendo le colonne categoriali (quelle con tipi di dati "categoria" o "oggetto") e controllando se hanno più di 20 valori univoci. Il numero 20 viene fornito qui come esempio e quando vedi dati che hanno troppi ID univoci nel set di dati che ti interessa, devi specificare un numero per decidere se è significativo o privo di significato:
cat_but_num = [col for col in df.columns if df[col].nunique() > 20 e str(df[col].dtypes) in [“category”, “object”]]
Ora che abbiamo identificato le colonne categoriali, possiamo creare un elenco finale cat_colsche includa tutte le vere colonne categoriali e le colonne numeriche che possono essere trattate come categoriali. Possiamo farlo combinando gli elenchi cat_colse num_but_cat, quindi rimuovendo tutte le colonne che si trovano in cat_but_num:
cat_cols = cat_cols + num_but_cat
cat_cols = [col for col in cat_cols if col non in cat_but_num]
Le variabili categoriali sono importanti nell'analisi dei dati perché possono fornire preziose informazioni sulle relazioni tra le variabili e le caratteristiche dei dati. Ad esempio, nel set di dati del Titanic, le variabili categoriali "sesso" e "classe" possono essere correlate alla variabile "sopravvissuto", che indica se un passeggero è sopravvissuto all'affondamento del Titanic. Esaminando i conteggi ei rapporti di queste variabili, possiamo ottenere una migliore comprensione dei fattori che possono aver contribuito alla sopravvivenza di un passeggero.
Inoltre, le variabili categoriali possono essere utilizzate come predittori nei modelli di machine learning, come i modelli di classificazione o di regressione. Codificando le variabili categoriali e includendole come caratteristiche di input, possiamo addestrare un modello per fare previsioni basate su queste variabili.
Ci sono alcuni motivi per cui è importante identificare le variabili categoriali in un set di dati:
- Le variabili categoriali possono fornire preziose informazioni sulle relazioni tra le variabili e le caratteristiche dei dati. Esaminando i conteggi e i rapporti di diverse categorie, possiamo ottenere una migliore comprensione dei fattori che possono essere correlati a un particolare risultato o fenomeno.
- Le variabili categoriali possono essere utilizzate come predittori nei modelli di machine learning. Codificando le variabili categoriali e includendole come caratteristiche di input, possiamo addestrare un modello per fare previsioni basate su queste variabili.
- Le variabili categoriali possono richiedere un trattamento speciale nell'analisi e nella visualizzazione dei dati. Ad esempio, potrebbe essere necessario codificarli o trasformarli per poter essere utilizzati in determinati test o grafici statistici.

![Che cos'è un elenco collegato, comunque? [Parte 1]](https://post.nghiatu.com/assets/images/m/max/724/1*Xokk6XOjWyIGCBujkJsCzQ.jpeg)



































