My training by AVISIA/Atelier Interne | Introduction à Spark sur Databricks

  • 500 €

Atelier Interne | Introduction à Spark sur Databricks

  • Cours
  • 14 Leçons

Cet atelier interne vous permettra d'appréhender le fonctionnement interne du framework Spark et de commencer à manipuler des données structurées via Python en utilisant PySpark et l'API DataFrame.

Contenu

Présentation de l'atelier

Introduction

Prérequis et contenu de l'atelier
Introduction au calcul distribué

Le développement du calcul distribué : du projet Hadoop à la naissance de Spark

Le développement du calcul distribué et MapReduce
De Hadoop à Spark

L'architecture d'exécution de Spark

Les composants de Spark (Spark Core, RDD API, DataFrame API) , DAG et Lazy Evaluation
Les composants du cluster et la hiérarchie d'exécution des tâches

Développer avec Spark sur Databricks

Les différentes possibilités pour développer avec Spark
Inscription et découverte de la plateforme Databricks

Découverte de l'API DataFrame

Les DataFrame : Création, Type de données, Schéma et Formats de données.
Lire et écrire des DataFrame, Afficher ou collecter des données, Accéder à la structure d'un DataFrame
Exemple de lecture écriture dans Databricks

Manipulation de données via l'API DataFrame

Les colonnes : Création, Renommage, Manipulation et Filtrage
Gestion des valeurs manquantes, Jointures, Concaténations et Agrégations