Phân tích dữ liệu khám phá bằng thư viện Python

Jan 03 2023
Xin chào người dùng, tôi viết blog này dựa trên kiến ​​thức trước đây của tôi về phân tích và khám phá dữ liệu bằng cách sử dụng các thư viện python có thể giúp bạn lấy thông tin chi tiết về dữ liệu theo chương trình mà không cần sử dụng excel Trong thế giới chuyển đổi kỹ thuật số, mỗi khách hàng đều muốn tự động hóa các quyết định kinh doanh của họ trên cơ sở dữ liệu hành vi và tương tác của khách hàng bằng cách phân tích các hành vi trong quá khứ của họ. Hành vi này được phân tích bằng phân tích mô tả và phân tích dự đoán.

Xin chào người dùng, tôi viết blog này dựa trên kiến ​​thức trước đây của tôi về phân tích và khám phá dữ liệu bằng cách sử dụng các thư viện python có thể giúp bạn lấy thông tin chuyên sâu về dữ liệu theo chương trình mà không cần sử dụng excel

Trong thế giới chuyển đổi kỹ thuật số, mỗi khách hàng đều muốn tự động hóa các quyết định kinh doanh của họ trên cơ sở dữ liệu hành vi và mức độ tương tác của khách hàng bằng cách phân tích các hành vi trong quá khứ của họ.

Hành vi này được phân tích bằng phân tích mô tả và phân tích dự đoán.

Phân tích mô tả là quá trình sử dụng dữ liệu hiện tại và lịch sử để xác định các xu hướng và mối quan hệ .

Chủ yếu là các kỹ sư khoa học dữ liệu và kỹ sư ML sử dụng số liệu thống kê mô tả để đọc về dữ liệu và phân tích dữ liệu, đây là quy trình đầu tiên để tạo mô hình học tập hoặc mô hình phân loại

Ở đây tôi đề cập đến một vài thư viện python có thể giúp bạn đọc và phân tích thống kê dữ liệu.

Bước đầu tiên là cài đặt python trong hệ thống của bạn bằng liên kết này nếu bạn chưa cài đặt python

Tôi khuyên bạn nên cài đặt anaconda Navigator và sử dụng nhân Jupyter cho việc này

Tiếp theo, bạn cần tạo tập dữ liệu của mình hoặc bạn cũng có thể tải xuống bất kỳ tập dữ liệu nào từhttps://www.kaggle.com/

Tải thư viện

import numpy             as np
import pandas            as pd
import scipy.stats       as stats
import matplotlib.pyplot as plt
import seaborn as sns

df=pd.read_csv('basket.csv')
df.head()


df.shape

df.info()

Bần tiện

print("Data:",df.mean())  # print the mean of each attribute. Ignore "Serial No. as it is not a continuous variable"

print("Data:",df.median())  # print the mean of each attribute. Ignore "Serial No. as it is not a continuous variable"

print("Data:",df.mode())  # print the mean of each attribute. Ignore "Serial No. as it is not a continuous variable"

print("Data_quantile(25%):",df.quantile(q=0.25))

print("Data_quantile(50%):",df.quantile(q=0.5))

print("Data quantile(75%):",df.quantile(q=0.75))

print("Data standard deviation:",df.std())

print("Data variance :",df.var())

print("Data summary:",df.describe())

print("Data info:",df.info())

print("Data covariance:",df.cov())

print("Data correlation:",df.corr())

data_column = df['column_name']

Trong blog tiếp theo, tôi sẽ đề cập đến phần 2 của phân tích dữ liệu khám phá bằng thư viện đồ thị dưới dạng SNS và maxplotlib, nơi bạn có thể tìm hiểu về phân tích đồ thị dưới dạng đơn biến, hai biến và đa biến cho dữ liệu đã cho.

Phần kết luận

Sau khi đọc blog này, người dùng sẽ có thể thực hiện phân tích dữ liệu cơ bản bằng API python. Người dùng đã làm quen với các tính năng mô tả dữ liệu cũng như trực quan hóa dữ liệu bằng các hàm API trên.