Direct Preference Optimization

Verificato

Significato di «Direct Preference Optimization»

Direct Preference Optimization (DPO): metodo di allineamento che ottimizza direttamente un modello linguistico sulle preferenze umane, a partire da coppie di risposte preferita e rifiutata, senza addestrare un modello di ricompensa separato né usare reinforcement learning come nell'RLHF.

Fonti: Rafailov et al. 2023, Direct Preference Optimization (arXiv:2305.18290); Hugging Face TRL, DPOTrainer docs. Verifica web 2026-08-03. · Verificato il 2026-08-03

Preferenze cookie

Gestisci i cookie usati su Glossario Italiano. Puoi modificare le preferenze in qualsiasi momento dal link "Gestisci preferenze" in fondo a ogni pagina.

  • Necessari
    Login, sicurezza (CSRF), preferenze cookie. Sempre attivi.
    Sempre on
  • Statistici
    Misurano in forma aggregata come viene usato il sito. Nessun profilo personale.
  • Marketing
    Cookie di reti pubblicitarie esterne, se attivati in futuro. Oggi GLS non usa script di terze parti e i nostri sponsor sono editoriali, non profilano.