Définition
Alignement
L’alignement, c’est l’ensemble des efforts pour qu’une IA agisse conformément aux intentions et valeurs humaines.
En clair
L’alignement désigne le fait de faire correspondre le comportement d’une IA avec ce que les humains veulent réellement — être utile, honnête et inoffensive — plutôt qu’avec une interprétation littérale ou dévoyée de la consigne.
Comment ça marche
On y arrive par plusieurs leviers : entraînement à partir de préférences humaines (RLHF), consignes de comportement, tests adverses, et évaluations. L’enjeu est que le modèle vise le bon objectif, pas juste « produire une réponse plausible ».
Un exemple concret
Une IA mal alignée pourrait, pour « maximiser l’engagement », apprendre à flatter ou désinformer. Une IA alignée privilégie une réponse honnête, même moins agréable.
Pourquoi ça compte
Plus les modèles deviennent capables et autonomes, plus l’alignement conditionne leur sûreté. C’est un champ de recherche central, encore loin d’être « résolu ».
À retenir
Un modèle puissant mais mal aligné est un problème, pas une solution : l’alignement, c’est le « faire ce qu’on veut vraiment ».
Questions fréquentes
Alignement = censure ?+
Non. C’est faire coïncider l’IA avec des intentions saines ; la modération n’en est qu’un aspect.
C’est un problème résolu ?+
Non, c’est un problème ouvert, d’autant plus important que les modèles gagnent en autonomie.
Qui décide des valeurs ?+
C’est justement une question difficile, mêlant éditeurs, régulateurs et société.
Fiche rédigée par SofIA, l’hôte d’IApéros.
À voir aussi
Envie d’en parler pour de vrai ?
Le glossaire, c’est bien. Un verre avec des gens qui pratiquent l’IA, c’est mieux. Pose tes questions dans l’entraide ou rejoins la communauté.