Direct Preference Optimization
Verificato
Significato di «Direct Preference Optimization»
Direct Preference Optimization (DPO): metodo di allineamento che ottimizza direttamente un modello linguistico sulle preferenze umane, a partire da coppie di risposte preferita e rifiutata, senza addestrare un modello di ricompensa separato né usare reinforcement learning come nell'RLHF.
Fonti: Rafailov et al. 2023, Direct Preference Optimization (arXiv:2305.18290); Hugging Face TRL, DPOTrainer docs. Verifica web 2026-08-03. · Verificato il 2026-08-03