Catastrophic Forgetting
When a model loses knowledge from pretraining while being fine-tuned on new data.
When a model loses knowledge from pretraining while being fine-tuned on new data. In RLHF without KL penalty, the RL policy might optimize solely for reward, forgetting useful general knowledge. The KL penalty term prevents this by keeping the policy anchored to the SFT model.
When aggressive fine-tuning degrades a model's previously-good general abilities.
When fine-tuning on a narrow task makes the model worse at things it used to do well. A key risk to manage. (M05)