DPO (Direct Preference Optimization)
A simpler alternative to RLHF that trains directly on chosen/rejected pairs, no reward model or RL needed.
A simpler alternative to RLHF that trains directly on chosen/rejected pairs, no reward model or RL needed. The common default. (M12)