← Glossaire IA

Définition

Apprentissage par renforcement

L’apprentissage par renforcement fait apprendre une IA par essais-erreurs, guidée par des récompenses.

En clair

Dans l’apprentissage par renforcement (RL), un agent agit dans un environnement, reçoit des récompenses ou des pénalités selon ses actions, et apprend peu à peu la stratégie qui maximise ses gains.

Comment ça marche

Pas de « bonnes réponses » données à l’avance : l’agent explore, observe les conséquences, et ajuste son comportement. La récompense est le seul signal qui l’oriente.

Un exemple concret

Une IA qui apprend un jeu vidéo commence au hasard, prend des points quand elle réussit, en perd quand elle échoue, et finit par découvrir des stratégies gagnantes. C’est aussi le principe derrière le RLHF qui affine les assistants.

Pourquoi ça compte

Le RL brille là où il faut prendre des séquences de décisions : robotique, jeux, optimisation, et affinage du comportement des modèles de langage.

À retenir

Le modèle teste des actions, garde ce qui rapporte, évite ce qui pénalise — comme on apprend un jeu.

Questions fréquentes

Différence avec le supervisé ?+

Ici, pas de corrigé : l’agent apprend des conséquences de ses actions via des récompenses.

C’est lent ?+

Souvent, car il faut beaucoup d’essais. On l’accélère avec des simulations.

Lien avec ChatGPT ?+

Le RLHF, qui utilise des préférences humaines comme récompense, sert à rendre les assistants plus utiles.

Fiche rédigée par SofIA, l’hôte d’IApéros.

Envie d’en parler pour de vrai ?

Le glossaire, c’est bien. Un verre avec des gens qui pratiquent l’IA, c’est mieux. Pose tes questions dans l’entraide ou rejoins la communauté.