Guide des opérations de base pour Hadoop et Hive
Dans l'écosystème du Big Data, Hive constitue un entrepôt de données robuste permettant l'interrogation, l'analyse et la gestion des ensembles de données volumineux. Développé sur la plateforme Hadoop, il offre un langage de requête similaire au SQL, appelé HiveQL, pour interagir avec les données stockées dans le Hadoop Distributed File System ...
Publié le 14 juillet à 04h41
Installation de Hadoop sous Windows 10
Prérequis
Pour suivre cette procédure, il est nécessaire de disposer de :
Java JDK 1.8 (préalablement installé)
L'archive de Hadoop, par exemple la version 2.9.2
Les utilitaires winutils spécifiques à Windows
Configuration de l'environnement
1. Assurez-vous que la variable d'environnement JAVA_HOME pointe vers votre installation JDK. Utilisez ...
Publié le 11 juillet à 03h03
Création de tables Kudu avec Impala : Tables internes et externes
Démarrer séquentiellement HDFS, MySQL, Hive, Kudu et Impala.
Se connecter au shell d'Impala :
Impala-shell
1 : Utilisez la commande impala-shell pour démarrer le shell d'Impala. Par défaut, impala-shell essaie de se connecter au démon d'Impala sur localhost, port 21000. Pour vous connecter à un autre hôte, utilisez l'option -i <hôte:port> ...
Publié le 5 juillet à 23h56
Plateforme de visualisation de données météorologiques océaniques basée sur ECharts, Python et Hadoop
Les données météorologiques océaniques se caractérisent par leur volume massif, leur multidimensionnalité et leur exigence de temps réel. Les approches classiques de traitement de données s'avèrent insuffisantes pour répondre aux besoins de visualisation moderne. Une plateforme combinant ECharts, Python et l'écosystème Hadoop permet d'asurer un ...
Publié le 5 juillet à 17h33
Utilisation d'Apache Giraph pour le traitement de graphes distribués
Présentation du projet
Apache Giraph est un système de calcul itératif pour le traitement de graphes à grande échelle. Basé sur MapReduce d'Apache Hadoop, il résout les problèmes de traitement de graphes dans un environnement distribué. Giraph s'inspire de l'architecture Pregel de Google et offre une haute extensibilité pour des algorithmes de ...
Publié le 27 juin à 23h45
Système de Recommandation de Littérature Académique avec Python, Hadoop et Spark
Contexte et Analyse des Besoins
Avec plus de 300 millions de publications dans CNKI (China National Knowledge Infrastructure) et une croissance annuelle dépassant 15 millions, les chercheurs doivent analyser quotidiennement plus de 200 articles. Les systèmes traditionnels de recherche par mots-clés présentent une efficacité inférieure à 10%, av ...
Publié le 24 juin à 19h23
Gestion des bases de données et des tables avec Apache Hive
Types de données fondamentaux
Apache Hive propose une variété de types de données calqués sur les types Java pour assurer une compatibilité optimale lors du traitement de gros volumes de données.
1. Types numériques
Type
Plage (Octets)
Équivalent Java
Suffixe
TINYINT
1 octet
byte
Y
SMALLINT
2 octets
short
S
INT
4 octets
int
-
BIGIN ...
Publié le 20 juin à 01h51
Formats de Stockage et Compression de Données dans Hadoop et Hive
Formats de Stockage de Fichiers
1. FICHIER TEXTE
Format par défaut lors de la création de tables dans Hadoop, où les données sont stockées sous forme de texte. Les fichiers texte peuvent être divisés et traités en parallèle, et peuvent également être compressés à l'aide de méthodes telles que GZip, LZO ou Snappy. Cependant, la plupart des fichi ...
Publié le 19 juin à 17h34
Mesure et Compréhension des Tailles de Fichiers dans Hadoop HDFS
La gestion de l'espace de stockage est cruciale dans tout système de fichiers distribué. Hadoop HDFS (Hadooop Distributed File System) offre plusieurs commandes pour inspecter la taille des fichiers et répertoires, chacune présentant des particularités en termes d'informations fournies et de performance. Cet article explore les commandes clés e ...
Publié le 19 juin à 05h26
Compilation et installation de Hadoop 3 sur CentOS 7
Installation des prérequis de compilation
Pour compiler Hadoop 3 sur CentOS 7, installez d'abord les bibliothèques et outils nécessaires. Exécutez les commandes suivantes via le gestionnaire de paquets :
# Ajout des paquets de base
yum -y install libXtst zlib-devel openssl-devel ncurses-devel autoconf automake libtool curl gcc gcc-c++ make
# P ...
Publié le 7 juin à 22h08