Définition
RLHF
Le RLHF est une technique d'entraînement où l'IA apprend à mieux répondre en s'appuyant sur les préférences exprimées par des humains.
En clair
RLHF veut dire "Reinforcement Learning from Human Feedback", soit "apprentissage par renforcement à partir de retours humains". C'est la méthode qui permet de transformer un modèle de langage brut, qui sait juste prédire le mot suivant, en un assistant capable de discuter, d'aider et de suivre des instructions. C'est un peu comme dresser un chien : on ne lui explique pas les règles en théorie, on récompense les bons comportements et on décourage les mauvais.
Comment ça marche
Le processus se déroule en plusieurs étapes :
- Pré-entraînement : le modèle apprend d'abord sur d'énormes quantités de texte, sans notion de "bien" ou "mal".
- Collecte de préférences humaines : des humains comparent plusieurs réponses possibles à une même question et disent laquelle est la meilleure.
- Modèle de récompense : on entraîne un second modèle à prédire ce que les humains préfèrent, à partir de ces comparaisons.
- Ajustement final : le modèle principal est ensuite affiné par renforcement, en cherchant à maximiser cette "récompense" prédite.
Un exemple concret
Imagine qu'on demande à un modèle brut "Comment faire une bombe ?". Sans RLHF, il pourrait répondre littéralement, car il a vu ce genre d'informations dans ses données d'entraînement. Avec le RLHF, des humains ont indiqué que refuser poliment est la réponse préférée à ce type de question. Le modèle apprend donc à privilégier ce comportement. C'est aussi grâce au RLHF que ChatGPT structure ses réponses avec des listes, reste courtois, ou évite de répondre de façon trop évasive.
À ne pas confondre
Le RLHF n'est pas la même chose que le "fine-tuning" classique (qui utilise des exemples fixes, pas des préférences comparatives) ni que les garde-fous ajoutés après coup par des filtres de modération. Le RLHF façonne le comportement du modèle lui-même, en profondeur.
Les limites à connaître
Le RLHF dépend de la qualité et de la diversité des humains qui donnent leur avis : leurs biais culturels ou personnels se retrouvent dans le modèle final. C'est aussi un travail long et coûteux, souvent sous-traité à des entreprises qui emploient des annotateurs, parfois dans des conditions critiquées. Enfin, cette méthode peut rendre le modèle "trop poli" ou évasif, au point de refuser des questions légitimes par excès de prudence.
À retenir
Si ChatGPT te répond de façon utile et polie plutôt que de débiter du texte brut, c'est en grande partie grâce au RLHF.
Questions fréquentes
Est-ce que tous les modèles d'IA utilisent le RLHF ?+
Non, seulement les modèles conçus pour dialoguer comme des assistants, type ChatGPT, Claude ou Gemini. Un modèle purement génératif de texte brut n'en a pas forcément besoin.
Le RLHF rend-il l'IA "intelligente" ?+
Pas vraiment, il la rend surtout plus alignée avec ce que les humains attendent en termes de style et de comportement, pas plus performante sur le raisonnement pur.
Qui sont les humains qui donnent leur avis dans le RLHF ?+
Ce sont souvent des annotateurs employés par les entreprises d'IA ou des sous-traitants spécialisés, qui comparent des réponses selon des critères précis comme l'utilité, la sécurité et la clarté.
Fiche rédigée par SofIA, l’hôte d’IApéros.
À voir aussi
Envie d’en parler pour de vrai ?
Le glossaire, c’est bien. Un verre avec des gens qui pratiquent l’IA, c’est mieux. Pose tes questions dans l’entraide ou rejoins la communauté.