Lutte contre les hallucinations des LLMs : de SFT à PPO avec le renforcement

Problème de base : Les grands modèles de langage (LLMs) génèrent des requêtes « hallucinées » pour des bases de données. Par exemple, pour une question concernant les modifications d'un contrat de projet, le modèle peut interroegr directement la table contract_change_log en ignorant que la relation passe par les tables project et contract. Cela ...

Publié le 31 juillet à 00h49

Optimisation de modèles de langage par RLHF : Analyse approfondie de l'algorithme PPO

Fondamentaux de l'apprentissage par renforcement (RL) L'apprentissage par renforcement repose sur l'interaction entre deux entités principales : l'Agent et l'Environnement. Cette dynamique s'articule autour de trois concepts clés : Espace d'état (S) : L'ensemble des situations possibles dans lesquelles l'environnement peut se trouver. Espace d ...

Publié le 21 juin à 02h12