AIPedia LogoAIPedia

Entry № 096

Direct Preference Optimization

(DPO)

တိုက်ရိုက် ဦးစားပေး အကောင်းဆုံးပြုလုပ်ခြင်း

Advanced
Generative AI
Natural Language Processing
Curriculum progress
#96 / 100
Share Entry:FacebookTelegramViberXLinkedIn
DPO Algorithm Diagram
PlateDirect Preference Optimization (DPO) Loss Function and Policy Alignment Pipeline.

DPO ဆိုတာ AI ကို ပိုမို ယဉ်ကျေးလိမ္မာပြီး အသုံးဝင်အောင် သင်ကြားတဲ့အခါ သီးသန့် အမှတ်ပေး ဒိုင်လူကြီး (Reward Model) သုံးစရာ မလိုဘဲ အဖြေကောင်းနဲ့ အဖြေညံ့ နှစ်ခုကို တိုက်ရိုက် ယှဉ်ပြပြီး လေ့ကျင့်ပေးတဲ့ နည်းလမ်း။

See also

Direct Preference Optimization (တိုက်ရိုက် ဦးစားပေး အကောင်းဆုံးပြုလုပ်ခြင်း) — AIPedia · AIPedia