Fondamentaux de Spark MLlib et Statistiques de Base

Types de Données Spark MLlib propose deux API principales : basée sur RDD et sur DataStream. La bibliothèque gère les vetceurs et matrices locaux pour les données simples, ainsi que les matrices distribuées soutenues par des RDD. Vecteurs Locaux Deux types de vecteurs sont supportés : Dense : Majorité d'éléments non-nuls Sparse : Majorité d'él ...

Publié le 30 juillet à 03h33

Comprendre les RDD dans Apache Spark : Fondamentaux et Pratiques

Introduction aux RDD Le concept de RDD (Resilient Distributed Dataset) constitue l'abstraction fondamentale de Spark. Il s'agit d'une collection d'objets immuable et distribuée à travers les différents nœuds d'un cluster. Résilience : Spark assure la tolérance aux pannes. Si une partition de données est perdue, elle peut être recalculée automa ...

Publié le 6 juin à 01h23