Création et manipulation de DataFrames avec Spark SQL en PySpark
Architecture et concepts fondamentaux
Dans l'écosystème Apache Spark, les DataFrames et Spark SQL constituant des abstractions de haut niveau optimisées. Un DataFrame est une collection de données distribuée organisée en colonnes nommées. Bien qu'il soit conceptuellement équivalent à une table de base de données relationnelle, il bénéficie en a ...
Publié le 19 juillet à 08h47
Optimisation de requêtes Phoenix pour données temporelles multiples : amélioration drastique des performances
Dans le cadre de la gestion de courses de VTC, nous faisions face à une problématique de requête complexe. Le système devait interroger six types d'événements temporels distincts pour chaque commande : l'heure de diffusion, l'heure de prise en charge efficace, l'heure de confirmation, l'heure d'annulation, l'heure d'arrivée et l'heure de paieme ...
Publié le 11 juillet à 01h33
Conception et Implémentation d'un Système d'Analyse de Données à Grande Échelle pour le Secteur des Véhicules à Énergie Nouvelle
Analyse des Besoins et Vue d'Ensemble du Système
Dans un marché automobile de plus en plus concurrentiel, l'exploitation intelligente des données volumineuses est devenue cruciale. Ce système a pour objectif de développer une plateforme intégrée pour la collecte, le traitement, l'analyse et la visualisation de données liées aux véhicules à éner ...
Publié le 22 juin à 03h38
Comprendre les RDD dans Apache Spark : Fondamentaux et Pratiques
Introduction aux RDD
Le concept de RDD (Resilient Distributed Dataset) constitue l'abstraction fondamentale de Spark. Il s'agit d'une collection d'objets immuable et distribuée à travers les différents nœuds d'un cluster.
Résilience : Spark assure la tolérance aux pannes. Si une partition de données est perdue, elle peut être recalculée automa ...
Publié le 6 juin à 01h23