Développement et utilisation d'une UDF Hive de conversion de dates

Cet article montre comment implémenter une fnoction utilisateur (UDF) Hive en Java pour convertir une chaîne de caractères d'un format de date à un autre, puis comment l'utiliser dans HQL. Créasion du projet Maven Créez un projet Maven avec l'artefact suivant et adaptez les versions aux dépendances de votre cluster. L'exemple ci-dessous supp ...

Publié le 17 septembre à 02h16

Gestion de l'authentification Kerberos dans les environnements distribués

Dans un environnement distribué, l'authentification Kerberos permet de sécuriser l'accès aux services. Après authentification réussie via Kerberos, et en l'absence de Sentry, l'accès aux services est généralement possible. Cependant, certains services comme HDFS et HBase implémentent des restrictions ACL supplémentaires nécessitent des autorisa ...

Publié le 10 septembre à 04h29

Pilotage des clusters EMR avec AWS CLI : du déploiement à l’automatisation

Amazon EMR (Elastic MapReduce) est un service géré facilitant l’exécution de frameworks Big Data tels que Spark, Hadoop, Hive ou Presto. L’AWS CLI offre une interface en ligne de commande complète pour orchestrer l’ensemble du cycle de vie des clusters, depuis leur création jusqu’à leur terminaison, en passantt par la configuration et la superv ...

Publié le 30 août à 15h25

Guide des opérations de base pour Hadoop et Hive

Dans l'écosystème du Big Data, Hive constitue un entrepôt de données robuste permettant l'interrogation, l'analyse et la gestion des ensembles de données volumineux. Développé sur la plateforme Hadoop, il offre un langage de requête similaire au SQL, appelé HiveQL, pour interagir avec les données stockées dans le Hadoop Distributed File System ...

Publié le 14 juillet à 04h41

Installation de Hadoop sous Windows 10

Prérequis Pour suivre cette procédure, il est nécessaire de disposer de : Java JDK 1.8 (préalablement installé) L'archive de Hadoop, par exemple la version 2.9.2 Les utilitaires winutils spécifiques à Windows Configuration de l'environnement 1. Assurez-vous que la variable d'environnement JAVA_HOME pointe vers votre installation JDK. Utilisez ...

Publié le 11 juillet à 03h03

Création de tables Kudu avec Impala : Tables internes et externes

Démarrer séquentiellement HDFS, MySQL, Hive, Kudu et Impala. Se connecter au shell d'Impala : Impala-shell 1 : Utilisez la commande impala-shell pour démarrer le shell d'Impala. Par défaut, impala-shell essaie de se connecter au démon d'Impala sur localhost, port 21000. Pour vous connecter à un autre hôte, utilisez l'option -i <hôte:port> ...

Publié le 5 juillet à 23h56

Plateforme de visualisation de données météorologiques océaniques basée sur ECharts, Python et Hadoop

Les données météorologiques océaniques se caractérisent par leur volume massif, leur multidimensionnalité et leur exigence de temps réel. Les approches classiques de traitement de données s'avèrent insuffisantes pour répondre aux besoins de visualisation moderne. Une plateforme combinant ECharts, Python et l'écosystème Hadoop permet d'asurer un ...

Publié le 5 juillet à 17h33

Utilisation d'Apache Giraph pour le traitement de graphes distribués

Présentation du projet Apache Giraph est un système de calcul itératif pour le traitement de graphes à grande échelle. Basé sur MapReduce d'Apache Hadoop, il résout les problèmes de traitement de graphes dans un environnement distribué. Giraph s'inspire de l'architecture Pregel de Google et offre une haute extensibilité pour des algorithmes de ...

Publié le 27 juin à 23h45

Système de Recommandation de Littérature Académique avec Python, Hadoop et Spark

Contexte et Analyse des Besoins Avec plus de 300 millions de publications dans CNKI (China National Knowledge Infrastructure) et une croissance annuelle dépassant 15 millions, les chercheurs doivent analyser quotidiennement plus de 200 articles. Les systèmes traditionnels de recherche par mots-clés présentent une efficacité inférieure à 10%, av ...

Publié le 24 juin à 19h23

Gestion des bases de données et des tables avec Apache Hive

Types de données fondamentaux Apache Hive propose une variété de types de données calqués sur les types Java pour assurer une compatibilité optimale lors du traitement de gros volumes de données. 1. Types numériques Type Plage (Octets) Équivalent Java Suffixe TINYINT 1 octet byte Y SMALLINT 2 octets short S INT 4 octets int - BIGIN ...

Publié le 20 juin à 01h51