Entry № 096
Direct Preference Optimization
(DPO)တိုက်ရိုက် ဦးစားပေး အကောင်းဆုံးပြုလုပ်ခြင်း
Advanced
Generative AI
Natural Language Processing
Curriculum progress
#96 / 100

DPO ဆိုတာ AI ကို ပိုမို ယဉ်ကျေးလိမ္မာပြီး အသုံးဝင်အောင် သင်ကြားတဲ့အခါ သီးသန့် အမှတ်ပေး ဒိုင်လူကြီး (Reward Model) သုံးစရာ မလိုဘဲ အဖြေကောင်းနဲ့ အဖြေညံ့ နှစ်ခုကို တိုက်ရိုက် ယှဉ်ပြပြီး လေ့ကျင့်ပေးတဲ့ နည်းလမ်း။
