Lutte contre les hallucinations des LLMs : de SFT à PPO avec le renforcement
Problème de base : Les grands modèles de langage (LLMs) génèrent des requêtes « hallucinées » pour des bases de données. Par exemple, pour une question concernant les modifications d'un contrat de projet, le modèle peut interroegr directement la table contract_change_log en ignorant que la relation passe par les tables project et contract. Cela ...
Publié le 31 juillet à 00h49
Optimisation de modèles de langage par RLHF : Analyse approfondie de l'algorithme PPO
Fondamentaux de l'apprentissage par renforcement (RL)
L'apprentissage par renforcement repose sur l'interaction entre deux entités principales : l'Agent et l'Environnement. Cette dynamique s'articule autour de trois concepts clés :
Espace d'état (S) : L'ensemble des situations possibles dans lesquelles l'environnement peut se trouver.
Espace d ...
Publié le 21 juin à 02h12