Entry № 097
Group Relative Policy Optimization
(GRPO)အစုလိုက် နှိုင်းယှဉ် မူဝါဒ အကောင်းဆုံးပြုလုပ်ခြင်း
Advanced
Generative AI
Natural Language Processing
Curriculum progress
#97 / 100

GRPO ဆိုတာ DeepSeek-R1 မှာ သုံးထားတဲ့ Reinforcement Learning နည်းလမ်းတစ်ခုဖြစ်ပြီး မေးခွန်းတစ်ခုအတွက် အဖြေ ၄ ခု ၅ ခု ထုတ်ခိုင်းလိုက်ပြီး အဲဒီအဖြေတွေကို အချင်းချင်း နှိုင်းယှဉ် အမှတ်ပေးကာ သင်ယူစေတဲ့ စနစ်။
