Le scénario
Un modèle de langage déployé collecte les prompts des utilisateurs et génère des réponses candidates ; les utilisateurs les classent pour créer des données de préférence servant à entraîner un modèle de récompense et à mettre à jour la politique.
Ce que contient ce dessin
Comprenez les décisions qui le sous-tendent.
01
L’utilisateur classe les réponses ou la session est abandonnée
02
La politique a convergé ou la boucle d’entraînement continue
À utiliser pour les pipelines RLHF, l’alignement des modèles conversationnels ou tout flux de réglage fin interactif fondé sur les préférences.