Phân tích dữ liệu khám phá bằng thư viện Python
Xin chào người dùng, tôi viết blog này dựa trên kiến thức trước đây của tôi về phân tích và khám phá dữ liệu bằng cách sử dụng các thư viện python có thể giúp bạn lấy thông tin chuyên sâu về dữ liệu theo chương trình mà không cần sử dụng excel
Trong thế giới chuyển đổi kỹ thuật số, mỗi khách hàng đều muốn tự động hóa các quyết định kinh doanh của họ trên cơ sở dữ liệu hành vi và mức độ tương tác của khách hàng bằng cách phân tích các hành vi trong quá khứ của họ.
Hành vi này được phân tích bằng phân tích mô tả và phân tích dự đoán.
Phân tích mô tả là quá trình sử dụng dữ liệu hiện tại và lịch sử để xác định các xu hướng và mối quan hệ .
Chủ yếu là các kỹ sư khoa học dữ liệu và kỹ sư ML sử dụng số liệu thống kê mô tả để đọc về dữ liệu và phân tích dữ liệu, đây là quy trình đầu tiên để tạo mô hình học tập hoặc mô hình phân loại
Ở đây tôi đề cập đến một vài thư viện python có thể giúp bạn đọc và phân tích thống kê dữ liệu.
Bước đầu tiên là cài đặt python trong hệ thống của bạn bằng liên kết này nếu bạn chưa cài đặt python
Tôi khuyên bạn nên cài đặt anaconda Navigator và sử dụng nhân Jupyter cho việc này
Tiếp theo, bạn cần tạo tập dữ liệu của mình hoặc bạn cũng có thể tải xuống bất kỳ tập dữ liệu nào từhttps://www.kaggle.com/
Tải thư viện
import numpy as np
import pandas as pd
import scipy.stats as stats
import matplotlib.pyplot as plt
import seaborn as sns
df=pd.read_csv('basket.csv')
df.head()
df.shape
df.info()
Bần tiện
print("Data:",df.mean()) # print the mean of each attribute. Ignore "Serial No. as it is not a continuous variable"
print("Data:",df.median()) # print the mean of each attribute. Ignore "Serial No. as it is not a continuous variable"
print("Data:",df.mode()) # print the mean of each attribute. Ignore "Serial No. as it is not a continuous variable"
print("Data_quantile(25%):",df.quantile(q=0.25))
print("Data_quantile(50%):",df.quantile(q=0.5))
print("Data quantile(75%):",df.quantile(q=0.75))
print("Data standard deviation:",df.std())
print("Data variance :",df.var())
print("Data summary:",df.describe())
print("Data info:",df.info())
print("Data covariance:",df.cov())
print("Data correlation:",df.corr())
data_column = df['column_name']
Trong blog tiếp theo, tôi sẽ đề cập đến phần 2 của phân tích dữ liệu khám phá bằng thư viện đồ thị dưới dạng SNS và maxplotlib, nơi bạn có thể tìm hiểu về phân tích đồ thị dưới dạng đơn biến, hai biến và đa biến cho dữ liệu đã cho.
Phần kết luận
Sau khi đọc blog này, người dùng sẽ có thể thực hiện phân tích dữ liệu cơ bản bằng API python. Người dùng đã làm quen với các tính năng mô tả dữ liệu cũng như trực quan hóa dữ liệu bằng các hàm API trên.

![Dù sao thì một danh sách được liên kết là gì? [Phần 1]](https://post.nghiatu.com/assets/images/m/max/724/1*Xokk6XOjWyIGCBujkJsCzQ.jpeg)



































