AIPedia LogoAIPedia

Entry № 097

Group Relative Policy Optimization

(GRPO)

အစုလိုက် နှိုင်းယှဉ် မူဝါဒ အကောင်းဆုံးပြုလုပ်ခြင်း

Advanced
Generative AI
Natural Language Processing
Curriculum progress
#97 / 100
Share Entry:FacebookTelegramViberXLinkedIn
GRPO Algorithm Diagram
PlateGroup Relative Policy Optimization (GRPO) Group Advantage Pipeline.

GRPO ဆိုတာ DeepSeek-R1 မှာ သုံးထားတဲ့ Reinforcement Learning နည်းလမ်းတစ်ခုဖြစ်ပြီး မေးခွန်းတစ်ခုအတွက် အဖြေ ၄ ခု ၅ ခု ထုတ်ခိုင်းလိုက်ပြီး အဲဒီအဖြေတွေကို အချင်းချင်း နှိုင်းယှဉ် အမှတ်ပေးကာ သင်ယူစေတဲ့ စနစ်။

See also

Group Relative Policy Optimization (အစုလိုက် နှိုင်းယှဉ် မူဝါဒ အကောင်းဆုံးပြုလုပ်ခြင်း) — AIPedia · AIPedia