การวิเคราะห์ข้อมูลเชิงสำรวจใน Python
การวิเคราะห์ข้อมูลเชิงสำรวจ (EDA) เป็นขั้นตอนสำคัญในเวิร์กโฟลว์วิทยาศาสตร์ข้อมูลที่เกี่ยวข้องกับการตรวจสอบและสรุปลักษณะสำคัญของชุดข้อมูล ช่วยให้เราเข้าใจข้อมูลดีขึ้น ระบุปัญหาที่อาจเกิดขึ้น และวางแผนขั้นตอนต่อไปสำหรับการสร้างแบบจำลองและการวิเคราะห์ ในบทความนี้ เราจะศึกษาวิธีการดำเนินการ EDA โดยใช้ภาษาโปรแกรม Python
Python เป็นภาษายอดนิยมสำหรับวิทยาการข้อมูล เนื่องจากมีไลบรารีที่ทรงพลังและไวยากรณ์ที่ใช้งานง่าย หนึ่งในไลบรารีที่สำคัญที่สุดสำหรับ EDA คือ Pandas ซึ่งมีโครงสร้างข้อมูลประสิทธิภาพสูงและเครื่องมือสำหรับการทำงานกับข้อมูลแบบตาราง เราจะใช้ Pandas เพื่อโหลดและจัดการข้อมูลของเรา และแสดงภาพโดยใช้ไลบรารี Matplotlib
ขั้นแรก เริ่มจากการนำเข้าไลบรารีที่จำเป็น:
นำเข้าแพนด้าเป็น pd
นำเข้า matplotlib.pyplot เป็น plt
ต่อไป เราสามารถโหลดข้อมูลของเราลงใน Pandas DataFrame โดยใช้ฟังก์ชัน read_csv:
df = pd.read_csv (“data.csv”)
ฟังก์ชัน read_csv ส่งคืนวัตถุ DataFrame ซึ่งเป็นโครงสร้างข้อมูลสองมิติที่มีแถวและคอลัมน์กำกับ เราสามารถใช้วิธี head เพื่อดูข้อมูลสองสามแถวแรก:
df.head()
ข้อมูลนี้จะแสดงตัวอย่างข้อมูลและช่วยให้เราเข้าใจโครงสร้างและเนื้อหา
หลังจากโหลดข้อมูลแล้ว เราสามารถเริ่มสำรวจได้โดยการคำนวณสถิติพื้นฐาน ตัวอย่างเช่น เราสามารถใช้วิธีอธิบายเพื่อคำนวณค่าเฉลี่ย ส่วนเบี่ยงเบนมาตรฐาน ค่าต่ำสุด ค่าสูงสุด และสถิติอื่นๆ สำหรับแต่ละคอลัมน์ตัวเลข:
df.describe()
ข้อมูลนี้สามารถให้ภาพรวมอย่างรวดเร็วของข้อมูลและช่วยให้เราระบุปัญหาที่อาจเกิดขึ้น เช่น ค่าที่ขาดหายไปหรือค่าผิดปกติ
เครื่องมือที่มีประโยชน์อีกอย่างสำหรับ EDA คือการแสดงข้อมูล เราสามารถใช้วิธีพล็อตของออบเจกต์ DataFrame เพื่อสร้างพล็อตประเภทต่างๆ เช่น ฮิสโตแกรม พล็อตกระจาย และพล็อตกล่อง ตัวอย่างเช่น เราสามารถสร้างฮิสโตแกรมของคอลัมน์ตัวเลขโดยใช้รหัสต่อไปนี้:
df[“column_name”].plot(ชนิด=”hist”)
สิ่งนี้จะสร้างฮิสโตแกรมของค่าในคอลัมน์ที่ระบุ นอกจากนี้ เรายังสามารถเพิ่มตัวเลือกเพิ่มเติมเพื่อปรับแต่งพล็อต เช่น การเปลี่ยนจำนวนช่องหรือช่วงของแกน x
การแสดงข้อมูลเป็นภาพสามารถช่วยเราเปิดเผยรูปแบบและความสัมพันธ์ในข้อมูลที่ไม่ปรากฏให้เห็นในทันทีจากข้อมูลดิบ ตัวอย่างเช่น แผนภาพกระจายสามารถแสดงความสัมพันธ์ระหว่างคอลัมน์ตัวเลขสองคอลัมน์ และแผนภาพกล่องสามารถช่วยเราระบุการมีอยู่ของค่าผิดปกติ
โดยสรุป การวิเคราะห์ข้อมูลเชิงสำรวจเป็นขั้นตอนสำคัญในเวิร์กโฟลว์วิทยาศาสตร์ข้อมูลที่ช่วยให้เราเข้าใจและสรุปชุดข้อมูล การใช้ไลบรารี่ Pandas และ Matplotlib ใน Python เราสามารถดำเนินการ EDA และแสดงภาพข้อมูลของเราได้อย่างรวดเร็วและง่ายดาย สิ่งนี้สามารถช่วยเราระบุปัญหาที่อาจเกิดขึ้นและวางแผนขั้นตอนต่อไปสำหรับการสร้างแบบจำลองและการวิเคราะห์





































![รายการที่เชื่อมโยงคืออะไร? [ส่วนที่ 1]](https://post.nghiatu.com/assets/images/m/max/724/1*Xokk6XOjWyIGCBujkJsCzQ.jpeg)