Pilotage des clusters EMR avec AWS CLI : du déploiement à l’automatisation
Amazon EMR (Elastic MapReduce) est un service géré facilitant l’exécution de frameworks Big Data tels que Spark, Hadoop, Hive ou Presto. L’AWS CLI offre une interface en ligne de commande complète pour orchestrer l’ensemble du cycle de vie des clusters, depuis leur création jusqu’à leur terminaison, en passantt par la configuration et la superv ...
Publié le 30 août à 15h25
Système de Recommandation de Littérature Académique avec Python, Hadoop et Spark
Contexte et Analyse des Besoins
Avec plus de 300 millions de publications dans CNKI (China National Knowledge Infrastructure) et une croissance annuelle dépassant 15 millions, les chercheurs doivent analyser quotidiennement plus de 200 articles. Les systèmes traditionnels de recherche par mots-clés présentent une efficacité inférieure à 10%, av ...
Publié le 24 juin à 19h23
Intégration d'ElasticJob pour la planification des tâches Flink/Spark avec haute disponibilité
ElasticJob est un framework de planification de tâches distribué, conçu pour les scénarios de big data. Il s'intègre avec des moteurs comme Flink et Spark, offrant une exécution élastique et hautement disponible.
Avantages d'ElasticJob pour la planification big data
Haute disponibilité : coordination via ZooKeeper pour la récupération automati ...
Publié le 2 juin à 02h37