Développement et utilisation d'une UDF Hive de conversion de dates
Cet article montre comment implémenter une fnoction utilisateur (UDF) Hive en Java pour convertir une chaîne de caractères d'un format de date à un autre, puis comment l'utiliser dans HQL.
Créasion du projet Maven
Créez un projet Maven avec l'artefact suivant et adaptez les versions aux dépendances de votre cluster. L'exemple ci-dessous supp ...
Publié le 17 septembre à 02h16
Gestion de l'authentification Kerberos dans les environnements distribués
Dans un environnement distribué, l'authentification Kerberos permet de sécuriser l'accès aux services. Après authentification réussie via Kerberos, et en l'absence de Sentry, l'accès aux services est généralement possible. Cependant, certains services comme HDFS et HBase implémentent des restrictions ACL supplémentaires nécessitent des autorisa ...
Publié le 10 septembre à 04h29
Pilotage des clusters EMR avec AWS CLI : du déploiement à l’automatisation
Amazon EMR (Elastic MapReduce) est un service géré facilitant l’exécution de frameworks Big Data tels que Spark, Hadoop, Hive ou Presto. L’AWS CLI offre une interface en ligne de commande complète pour orchestrer l’ensemble du cycle de vie des clusters, depuis leur création jusqu’à leur terminaison, en passantt par la configuration et la superv ...
Publié le 30 août à 15h25
Guide des opérations de base pour Hadoop et Hive
Dans l'écosystème du Big Data, Hive constitue un entrepôt de données robuste permettant l'interrogation, l'analyse et la gestion des ensembles de données volumineux. Développé sur la plateforme Hadoop, il offre un langage de requête similaire au SQL, appelé HiveQL, pour interagir avec les données stockées dans le Hadoop Distributed File System ...
Publié le 14 juillet à 04h41
Installation de Hadoop sous Windows 10
Prérequis
Pour suivre cette procédure, il est nécessaire de disposer de :
Java JDK 1.8 (préalablement installé)
L'archive de Hadoop, par exemple la version 2.9.2
Les utilitaires winutils spécifiques à Windows
Configuration de l'environnement
1. Assurez-vous que la variable d'environnement JAVA_HOME pointe vers votre installation JDK. Utilisez ...
Publié le 11 juillet à 03h03
Création de tables Kudu avec Impala : Tables internes et externes
Démarrer séquentiellement HDFS, MySQL, Hive, Kudu et Impala.
Se connecter au shell d'Impala :
Impala-shell
1 : Utilisez la commande impala-shell pour démarrer le shell d'Impala. Par défaut, impala-shell essaie de se connecter au démon d'Impala sur localhost, port 21000. Pour vous connecter à un autre hôte, utilisez l'option -i <hôte:port> ...
Publié le 5 juillet à 23h56
Plateforme de visualisation de données météorologiques océaniques basée sur ECharts, Python et Hadoop
Les données météorologiques océaniques se caractérisent par leur volume massif, leur multidimensionnalité et leur exigence de temps réel. Les approches classiques de traitement de données s'avèrent insuffisantes pour répondre aux besoins de visualisation moderne. Une plateforme combinant ECharts, Python et l'écosystème Hadoop permet d'asurer un ...
Publié le 5 juillet à 17h33
Utilisation d'Apache Giraph pour le traitement de graphes distribués
Présentation du projet
Apache Giraph est un système de calcul itératif pour le traitement de graphes à grande échelle. Basé sur MapReduce d'Apache Hadoop, il résout les problèmes de traitement de graphes dans un environnement distribué. Giraph s'inspire de l'architecture Pregel de Google et offre une haute extensibilité pour des algorithmes de ...
Publié le 27 juin à 23h45
Système de Recommandation de Littérature Académique avec Python, Hadoop et Spark
Contexte et Analyse des Besoins
Avec plus de 300 millions de publications dans CNKI (China National Knowledge Infrastructure) et une croissance annuelle dépassant 15 millions, les chercheurs doivent analyser quotidiennement plus de 200 articles. Les systèmes traditionnels de recherche par mots-clés présentent une efficacité inférieure à 10%, av ...
Publié le 24 juin à 19h23
Gestion des bases de données et des tables avec Apache Hive
Types de données fondamentaux
Apache Hive propose une variété de types de données calqués sur les types Java pour assurer une compatibilité optimale lors du traitement de gros volumes de données.
1. Types numériques
Type
Plage (Octets)
Équivalent Java
Suffixe
TINYINT
1 octet
byte
Y
SMALLINT
2 octets
short
S
INT
4 octets
int
-
BIGIN ...
Publié le 20 juin à 01h51