Aller au contenu principal
Titre RNCP Niveau 7

Maîtrisez pipelines, cloud & IA pour devenir Data Engineer opérationnel.

DataScientist.fr
Data Scientist
Python
Big Data
SQL

Python Pandas : Lecture et écriture de données tabulaires - Tutoriel interactif

Photo de Romain DE LA SOUCHÈRE

Tech Lead, CTO AXI Technologies

5 min de lecture

Introduction aux données tabulaires et à pandas

Les données tabulaires sont omniprésentes dans divers domaines, allant de la finance à la recherche scientifique. Elles se présentent sous forme de tableaux où les lignes représentent des enregistrements individuels et les colonnes des attributs ou des variables. Manipuler ces données efficacement est essentiel pour extraire des informations significatives et prendre des décisions éclairées.
Pandas est une bibliothèque Python puissante et flexible conçue spécifiquement pour la manipulation et l'analyse de données tabulaires. Elle offre des structures de données de haut niveau et des outils pour travailler avec des données étiquetées ou relationnelles de manière intuitive et performante.
Inspiré de la documentation officielle de Pandas, ce tutoriel interactif vous permet d'apprendre comment lire et écrire des données grâce aux fonctionnalités de la bibliothèque Pandas.

image

Qu'est-ce que pandas ?

Pandas fournit deux principales structures de données : les DataFrames et les Series. Un DataFrame est une structure bidimensionnelle similaire à une feuille de calcul ou une table de base de données, tandis qu'une Series est une structure unidimensionnelle similaire à une colonne dans un DataFrame.

Pourquoi utiliser pandas ?

  • Facilité d'utilisation : Syntaxe simple et intuitive.
  • Performance : Optimisé pour le traitement rapide de grandes quantités de données.
  • Fonctionnalités avancées : Inclut des opérations de fusion, de regroupement, de pivotement, et bien plus encore.
Avec pandas, vous pouvez lire, traiter, analyser et visualiser des données de manière efficace, ce qui en fait un outil indispensable pour les scientifiques de données et les analystes.

Lecture de fichiers CSV et Excel avec pandas

Pour commencer à manipuler des données avec pandas, il est essentiel de savoir comment lire des fichiers de données courants tels que les fichiers CSV et Excel. Pandas simplifie cette tâche avec des fonctions dédiées.

Lecture de fichiers CSV

Les fichiers CSV (Comma-Separated Values) sont l'un des formats les plus couramment utilisés pour stocker des données tabulaires. Pour lire un fichier CSV avec pandas, vous pouvez utiliser la fonction read_csv() :
python
Cette fonction permet également de personnaliser la lecture avec plusieurs paramètres, comme le délimiteur, les en-têtes, et les colonnes à lire.

Lecture de fichiers Excel

Les fichiers Excel sont également très populaires, notamment dans les environnements professionnels. Pandas offre la fonction read_excel() pour lire des fichiers Excel :
python
Cette fonction est très flexible et permet de spécifier la feuille à lire, de gérer les en-têtes, et de lire plusieurs feuilles à la fois.
Grâce à ces fonctions, pandas permet une intégration facile des données provenant de différentes sources, facilitant ainsi le démarrage de votre analyse de données.

Exploration et visualisation des données

Une fois les données chargées dans un DataFrame, la prochaine étape consiste à les explorer et les visualiser pour mieux comprendre leur structure et leur contenu. Pandas offre de nombreuses méthodes pour effectuer ces tâches.

Exploration des données

Pour obtenir un aperçu rapide des données, vous pouvez utiliser les méthodes suivantes :
  • head(): Affiche les premières lignes du DataFrame.
  • info(): Fournit un résumé concis du DataFrame.
  • describe(): Génère des statistiques descriptives pour les colonnes numériques.
python

Visualisation des données

Pour une visualisation rapide, pandas s'intègre bien avec Matplotlib, une bibliothèque de visualisation en Python. Voici quelques exemples de visualisations courantes :
  • Histogrammes : df['colonne'].plot(kind='hist')
  • Graphiques en barres : df['colonne'].value_counts().plot(kind='bar')
  • Graphiques de dispersion : df.plot(kind='scatter', x='colonne1', y='colonne2')
python
Ces outils permettent de découvrir des motifs, des tendances et des anomalies dans vos données, facilitant ainsi une analyse plus approfondie.

Manipulation et nettoyage des données

La manipulation et le nettoyage des données sont des étapes cruciales pour garantir la qualité et la pertinence de votre analyse. Pandas offre une gamme complète de méthodes pour ces opérations.

Manipulation des données

Les opérations courantes de manipulation incluent la sélection, le filtrage et la transformation des données :
  • Sélection de colonnes : Utilisez df['colonne'] pour sélectionner une colonne spécifique.
  • Filtrage des lignes : Utilisez des conditions pour filtrer les lignes, par exemple df[df['colonne'] > valeur].
  • Transformation des données : Appliquez des fonctions à une colonne entière avec df['colonne'].apply(fonction).
python

Nettoyage des données

Le nettoyage des données vise à gérer les valeurs manquantes, les doublons et les incohérences :
  • Valeurs manquantes : Utilisez df.dropna() pour supprimer les lignes avec des valeurs manquantes ou df.fillna(valeur) pour les remplacer.
  • Doublons : Utilisez df.drop_duplicates() pour supprimer les lignes dupliquées.
  • Incohérences : Corrigez les valeurs incorrectes ou normalisez les formats.
python
Ces techniques assurent que vos données soient cohérentes et prêtes pour l'analyse.

Exportation des données dans différents formats

Après avoir nettoyé et manipulé vos données, vous pourriez vouloir les exporter pour les partager ou les utiliser dans d'autres applications. Pandas facilite cette tâche en offrant des fonctions pour exporter les données dans divers formats.

Exportation vers CSV

Pour enregistrer un DataFrame en fichier CSV, utilisez la méthode to_csv() :
python
Le paramètre index=False permet de ne pas inclure les index des lignes dans le fichier CSV.

Exportation vers Excel

Pour exporter des données vers un fichier Excel, utilisez la méthode to_excel() :
python
Vous pouvez spécifier le nom de la feuille avec sheet_name et éviter d'inclure les index avec index=False.

Exportation vers JSON

Le format JSON est très utile pour les échanges de données entre applications web. Utilisez to_json() pour exporter vos données :
python
Le paramètre orient='records' structure les données en listes de dictionnaires, et lines=True permet d'enregistrer chaque enregistrement sur une ligne séparée.
Ces méthodes d'exportation de pandas vous permettent de sauvegarder et de partager vos données facilement dans différents formats adaptés à vos besoins.

Envie d'aller plus loin ?

Ce sujet est au programme de notre formation Devenez Data Analyst. Consultez le détail du parcours, ou recevez le programme complet par email.

Partager avec

💙 Merci d'avoir parcouru l'article jusqu'à la fin !

Photo de Romain DE LA SOUCHÈRE

Romain DE LA SOUCHÈRE

Tech Lead, CTO AXI Technologies

Expert Data Engineering et Cloud, Romain affiche plus de 11 ans d'expérience, dont plusieurs années comme Lead Developer sur des solutions Smart Building haute performance. Il y a conçu et mis en production des moteurs de traitement capables d'absorber des centaines de milliers de données de capteurs par minute, ainsi que des bases clusterisées gérant plus de 10 millions de données dynamiques. Certifié Microsoft Azure DevOps Engineer Expert, il maîtrise aussi bien le développement back-end (Python, C#) que le DevOps (Docker, Kubernetes, Terraform) et les agents LLM. Formateur en Python, cloud, DevOps et IA générative appliquée, il forme avec une obsession : Amener chaque apprenant à concevoir et déployer des architectures réellement scalables en production.

» En savoir plus

Formations associés

Toutes nos formations
Image de la formation Devenez Data Analyst
Devenez Data Analyst
6 mois
Intermédiaire
Garantie

Articles associés

Voir tous nos articles