Le scénario
Une équipe de développement cherche à aligner un système d’IA grâce à des feedbacks humains répétés, à la modélisation des récompenses et à des mises à jour de la politique, tout en surveillant la dérive après déploiement.
Ce que contient ce dessin
Comprenez les décisions qui le sous-tendent.
01
Les feedbacks humains collectés sont-ils suffisamment clairs pour l’entraînement ?
02
Les métriques d’alignement sont-elles acceptables après la mise à jour de la politique ?
03
La surveillance détecte-t-elle une dérive nécessitant de nouveaux feedbacks humains ?
À utiliser pour les pipelines d’alignement de l’IA fondés sur le RLHF ou avec intervention humaine, nécessitant des boucles itératives de feedback et la surveillance de la dérive après déploiement.