ChatDiagram
AI Alignment · Reinforcement Learning · User Interaction

Flux d’interaction utilisateur RLHF

Type OrganigrammeNorme Sugiyama layered DAG + orthogonal routingMoteur schematex-flowchartMis à jour 29/09/2026
RLHF User Interaction Flowchart
Drawing preview
Le scénario

Un modèle de langage déployé collecte les prompts des utilisateurs et génère des réponses candidates ; les utilisateurs les classent pour créer des données de préférence servant à entraîner un modèle de récompense et à mettre à jour la politique.

Ce que contient ce dessin

Comprenez les décisions qui le sous-tendent.

01

L’utilisateur classe les réponses ou la session est abandonnée

02

La politique a convergé ou la boucle d’entraînement continue

À utiliser pour les pipelines RLHF, l’alignement des modèles conversationnels ou tout flux de réglage fin interactif fondé sur les préférences.

Voir tous les modèles de organigramme →