Prédiction du prix des maisons à Boston avec la régression linéaire
Cet article détaille la mise en œuvre d'un modèle de régression linéaire pour prédire les prix des maisons en utilisant le jeu de données de Boston. Nous couvrirons le chargement des données, leur prétraitemnet, l'entraînement du modèle et l'évaluation de ses performances.
Configuration de l'environnement et chargement des données
Nous comme ...
Publié le 20 août à 08h14
Implémentation manuelle d'une régression linéaire avec PyTorch
Cet article montre comment construire pas à pas une régression linéaire simple avec PyTorch, sans utiliser de couche ou d'optimiseur intégré. On génère un jeu de données synthétique, on implémente un chargeur de mini-lots, on définit un modèle de prédiction, une fonction de coût et une méthode d'optimisation, puis on trace l'évolution de la per ...
Publié le 16 août à 20h57
Construire des Pipelines Robustes pour le Traitement des Données et la Modélisation avec Scikit-learn
L'exploration de données, ou data mining, englobe généralement plusieurs étapes, telles que l'acquisition des données, l'analyse exploratoire, l'ingénierie des caractéristiques, l'entraînement du modèle et son évaluation. La bibliothèque Scikit-learn (sklearn) en Python se révèle être un outil exceptionnel pour rationaliser l'ingénierie des car ...
Publié le 7 août à 00h11
Classification de texte par extraction de caractéristiques avec LDA et SVM
L'utilisation de modèles thématiques comme l'Allocation de Dirichlet Latente (LDA) pour extraire des caractéristiques textuelles, suivie d'une classification par Machine Vector Support (SVM), donne souvent des résultats mitigés par rapport aux approches modernes basées sur le Deep Learning. Dans cette étude, l'implémentation d'un pipeline LDA + ...
Publié le 28 juillet à 20h56
Algorithmes de Clustering : Principes et Mise en Œuvre de K-means et DBSCAN
Le clustering est une technique d'apprentissage non supervisé visant à regrouper des données similaires sans étiquettes préalables. Deux approches fondamentales dominent ce domaine : K-means, basé sur les centroïdes, et DBSCAN, basé sur la densité.
Comparaison des approches
Algorithme
Paramètres clés
Géométrie des clusters
Gestion du bruit
C ...
Publié le 25 juillet à 21h16
Guide pratique des machines à vecteurs de support (SVM) avec scikit-learn
Principe fondamental des SVM
Une machine à vecteurs de support cherche l'hyperplan qui sépare le mieux les classes en maximisant la marge entre les échantillons les plus proches de chaque classe, appelés vecteurs de support. Lorsque les données ne sont pas linéairement séparables, une fonction noyau projette implicitement les données dans un es ...
Publié le 22 juillet à 11h47
Dix méthodes de transformation et encodage de données avec Pandas
Construire le jeu de données de test
Commençons par créer un dataframe exemple pour illustrer les différentes techniques d'encodage.
import pandas as pd
import numpy as np
# Génération d'un dataframe de démonstration
donnees = pd.DataFrame({
'Statut': ['H', 'F', 'H', 'H', 'H', 'F', 'H', 'F', 'F', 'F'],
'Module': ['Francais', 'C', 'M ...
Publié le 12 juillet à 19h25
Implémentation de l'algorithme SMO avec NumPy pour les machines à vecteurs de support
En apprentissage automatique, les machines à vecteurs de support (SVM) sont reconnues pour leurs performances en classification. L'algorithme de minimisation séquentielle (SMO) est un composant essentiel pour l'entraînement de ces modèles. Contrairement à de nombreux tutoriels qui présentent des versions simplifiées et des exemples bidimensionn ...
Publié le 3 juillet à 23h31
Comprendre et implémenter le TF-IDF en Python
Le TF-IDF (Term Frequency - Inverse Docmuent Frequency) est une technique statistique largement utilisée en recherche d'information et en fouille de textes. Elle permet d'évaluer l'importance d'un terme dans un document au sein d'un corpus. L'idée centrale est qu'un mot est d'autant plus représentatif d'un document qu'il y apparaît fréquemment, ...
Publié le 1 juillet à 03h06
Découvrir le Machine Learning : Concepts Clés et Première Implémentation
Approche Pragmatique du Machine Learning
De nombreux tutoriels sur l'apprentissage automatique (Machine Learning) débutent par une immersion profonde dans les fondements mathématiques, les algorithmes complexes, la modélisation mathématique, avant d'aborder le Deep Learning et l'ingénierie logicielle pour la mise en production. Chaque étape de ...
Publié le 26 juin à 23h42