Exploratory Data Analysis (EDA) Menggunakan Pandas Profiling

Dec 06 2022
Jelajahi profil panda dan lihat manfaat dari satu baris kode ajaib ini.
Pembuatan profil Panda adalah pustaka Python yang melakukan Analisis Data Eksplorasi otomatis. Ini secara otomatis menghasilkan laporan profil kumpulan data yang memberikan wawasan berharga.

P andas profiling adalah pustaka Python yang melakukan Analisis Data Eksplorasi otomatis. Ini secara otomatis menghasilkan laporan profil kumpulan data yang memberikan wawasan berharga.

pandas-profilingmenghasilkan laporan profil dari panda DataFrame. Fungsi panda df.describe()berguna namun sedikit mendasar untuk analisis data eksplorasi. pandas-profilingextends panda DataFramedengan df.profile_report(), yang secara otomatis menghasilkan laporan univariat dan multivariat standar untuk pemahaman data.

Untuk setiap kolom, informasi berikut (bila relevan untuk jenis kolom) disajikan dalam laporan HTML interaktif:

  • Jenis inferensi: mendeteksi jenis kolom dalam DataFrame
  • Essentials: jenis, nilai unik, indikasi nilai yang hilang
  • Statistik kuantil: nilai minimum, Q1, median, Q3, maksimum, rentang, rentang interkuartil
  • Statistik deskriptif: rata-rata, modus, simpangan baku, penjumlahan, simpangan mutlak median, koefisien variasi, kurtosis, kemiringan
  • Nilai yang paling sering dan ekstrim
  • Histogram: kategorikal dan numerik
  • Korelasi: peringatan korelasi tinggi, berdasarkan metrik korelasi yang berbeda (Spearman, Pearson, Kendall, Cramer's V, Phik)
  • Nilai yang hilang: melalui hitungan, matriks, dan peta panas
  • Baris duplikat: daftar baris duplikat yang paling umum
  • Analisis teks: kategori paling umum (huruf besar, huruf kecil, pemisah), skrip (Latin, Cyrillic) dan blok (ASCII, Cyrilic)
  • Analisis File dan Gambar: ukuran file, tanggal pembuatan, dimensi, indikasi gambar terpotong, dan keberadaan metadata EXIF.

1. Instalasi ️

1.1. Menggunakan pip

Anda dapat menginstal menggunakan pippengelola paket dengan menjalankan:

pip install -U pandas-profiling

Anda dapat menginstal menggunakan condapengelola paket dengan menjalankan:

conda install -c conda-forge pandas-profiling

import numpy as np
import pandas as pd

from pandas_profiling import ProfileReport
data = pd.read_csv("datasets/Telco-Customer-Churn.csv")

3. Menghasilkan laporan

Untuk menghasilkan laporan pembuatan profil standar, cukup jalankan:

profile = ProfileReport(data, title="Pandas Profiling Report")
data.profile_report()

Untuk menghasilkan file laporan HTML, simpan ProfileReportke objek dan gunakan to_file()fungsi:

profile.to_file("your_report.html")

# As a JSON string
json_data = profile.to_json()
# As a file
profile.to_file("your_report.json")

Salah satu cara untuk mengatasi masalah ini adalah dengan membuat laporan hanya dari sebagian dari semua data yang kita miliki.

profile = ProfileReport(df.sample(n=100))
profile.to_file(output_file='output.html')

      
                
Output that the report is ready

Ikhtisar: sebagian besar detail global tentang kumpulan data (jumlah catatan, jumlah variabel, kesalahan dan duplikat keseluruhan, jejak memori)

Bagian ini memberikan analisis detail tentang Variabel/Kolom/Fitur dari Kumpulan Data yang sepenuhnya bergantung pada jenis Variabel/Kolom/Fitur seperti Numerik, String, Boolean, dll.

Bagian interaksi memberikan detail lebih lanjut dengan analisis bivariat/analisis multivariat.

Ini adalah alat umum untuk mendeskripsikan hubungan sederhana tanpa membuat pernyataan tentang sebab dan akibat. Dalam laporan profiling panda memiliki 5 jenis koefisien korelasi: r Pearson, ρ Spearman, τ Kendall, Phik (φk), dan Cramer's V (φc).

Laporan ini juga memberikan analisis detail nilai Missing pada empat jenis grafik Count, matriks, Heatmap dan dendrogram.

Bagian ini menampilkan 10 baris pertama dan terakhir dari kumpulan data.

Kesimpulan

Pandas Profiling adalah paket python yang luar biasa untuk analisis eksplorasi (EDA). Ini memperluas panda untuk ringkasan analisis statistik termasuk korelasi, nilai yang hilang, distribusi (kuantil), dan statistik deskriptif. Anda dapat melihat EDA yang saya buat dengan kumpulan data diabetes di Kaggle di sini. Anda juga dapat memeriksa laporan dataset titanic di sini.

Saya merekomendasikan Anda untuk mencobanya!

Terima kasih telah membaca artikel ini. Anda dapat mengakses kode detail proyek dan proyek lainnya di akun Github atau akun Kaggle saya . Selamat membuat kode!

Jika Anda memiliki umpan balik, silakan bagikan di bagian komentar atau hubungi saya jika Anda memerlukan informasi lebih lanjut.

Referensi

  1. https://pandas-profiling.ydata.ai/docs/master/index.html
  2. https://www.numpyninja.com/post/eda-using-pandas-profiling