What is RLHF?

Apprentissage par renforcement à partir de retours humains, utilisé pour aligner les réponses sur les préférences des utilisateurs.