What does RLHF (Reinforcement Learning from Human Feedback) enable in language model training?
-
A
Faster convergence by replacing gradient descent with policy gradients
-
B
Aligning model outputs with human preferences using a reward model trained on human rankings
-
C
Enabling zero-shot learning without any pre-training
-
D
Compressing model size through preference-based pruning