Manuel de science des données Python
Mar 31 2023
.
- IPython : au-delà du Python normal
- Présentation de NumPy
- Manipulation de données avec Pandas
- Visualisation avec Matplotlib
- Premiers pas avec l'apprentissage automatique
- Apprendre à partir des données
- Régression linéaire
- Bayes naïf
- k-Voisins les plus proches
- Introduction à l'apprentissage automatique avec Scikit-Learn
- L'apprentissage automatique en pratique
- Le compromis biais-variance
- Estimation de la densité du noyau
- Analyse des composants principaux
- Apprentissage multiple
- Regroupement
- Arbres de décision et forêts aléatoires
- Optimisation basée sur les dégradés
- Clustering K-Means
- En profondeur : la classification naïve de Bayes
- En profondeur : régression linéaire
- Approfondissement : Soutenir les machines vectorielles
- En profondeur : arbres de décision et forêts aléatoires
- Approfondissement : analyse en composantes principales
- En profondeur : Apprentissage multiple
- Approfondissement : regroupement de k-moyennes
- Une visite éclair de Python
- L'essentiel du langage Python
- IPython : au-delà du Python normal
- NumPy
- En savoir plus sur le shell système IPython
- Matplotlib
- SciPy
- Scikit-Learn
- Apprentissage automatique avec Scikit-Learn
- Autres ressources d'apprentissage automatique
- Apprentissage automatique pratique : un exemple simple
- Bibliographie
import numpy as np
# create a 1D array
a = np.array([0, 1, 2, 3, 4])
print(a)
import pandas as pd
# create a Pandas DataFrame
data = {'name': ['Alice', 'Bob', 'Charlie', 'David'],
'age': [25, 32, 18, 47],
'gender': ['F', 'M', 'M', 'M']}
df = pd.DataFrame(data)
print(df)
# filter rows based on a condition
df_filtered = df[df['age'] > 30]
print(df_filtered)
# group data by a column and compute statistics
grouped_data = df.groupby('gender')['age'].mean()
print(grouped_data)
import matplotlib.pyplot as plt
import numpy as np
# create some data to plot
x = np.linspace(0, 10, 100)
y = np.sin(x)
# create a line plot
plt.plot(x, y)
plt.title('Sine Wave')
plt.xlabel('x')
plt.ylabel('y')
plt.show()
# create a scatter plot
x = np.random.randn(100)
y = np.random.randn(100)
plt.scatter(x, y)
plt.title('Random Data')
plt.xlabel('x')
plt.ylabel('y')
plt.show()
from sklearn.datasets import load_iris
from sklearn.model_selection import train_test_split
from sklearn.neighbors import KNeighborsClassifier
# load the iris dataset
iris = load_iris()
# split the data into training and testing sets
X_train, X_test, y_train, y_test = train_test_split(iris['data'], iris['target'], random_state=0)
# create a K-Nearest Neighbors classifier
knn = KNeighborsClassifier(n_neighbors=1)
# fit the classifier to the training data
knn.fit(X_train, y_train)
# predict the classes of the test data
y_pred = knn.predict(X_test)
# compute the accuracy of the classifier
accuracy = knn.score(X_test, y_test)
print('Accuracy:', accuracy)
![Qu'est-ce qu'une liste liée, de toute façon? [Partie 1]](https://post.nghiatu.com/assets/images/m/max/724/1*Xokk6XOjWyIGCBujkJsCzQ.jpeg)



































