السيناريو
A deployed language model collects user prompts and generates candidate responses; users rank responses to create preference data used to train a reward model and update the policy.
ما الذي يتضمنه هذا الرسم
اقرأ القرارات الكامنة وراءه.
01
User ranks responses or session discarded
02
Policy converged or continue training loop
Use for RLHF pipelines, chat model alignment, or any interactive preference-based fine-tuning flow.