Entry № 083
RLHF
(RLHF)အာအယ်လ်အိပ်ချ်အက်ဖ် (RLHF / လူသား တုံ့ပြန်ချက်ဖြင့် လေ့ကျင့်ခြင်း)
Advanced
Generative AI
Curriculum progress
#83 / 100
R
RLHF — Concept plate
အာအယ်လ်အိပ်ချ်အက်ဖ် (RLHF / လူသား တုံ့ပြန်ချက်ဖြင့် လေ့ကျင့်ခြင်း) — RLHF (Reinforcement Learning from Human Feedback) ဆိုတာ AI ရဲ့ အဖြေတွေကို လူတွေ ကြိုက်/မကြိုက် အဆင့်သတ်မှတ်ပေးပြီး၊ လူကြိုက်တဲ့ ပုံစံ ဖြေတတ်အောင် ဆက်လေ့ကျင့်ပေးတဲ့ နည်း။ ChatGPT လို AI တွေ ယဉ်ကျေးပြီး အသုံးဝင်တဲ့ အဖြေ ပေးတတ်လာအောင် ဒီနည်းနဲ့ 'လူ့ဆန္ဒနဲ့ ကိုက်ညီ' အောင် ချိန်ညှိထားတာပါ။
RLHF (Reinforcement Learning from Human Feedback) ဆိုတာ AI ရဲ့ အဖြေတွေကို လူတွေ ကြိုက်/မကြိုက် အဆင့်သတ်မှတ်ပေးပြီး၊ လူကြိုက်တဲ့ ပုံစံ ဖြေတတ်အောင် ဆက်လေ့ကျင့်ပေးတဲ့ နည်း။ ChatGPT လို AI တွေ ယဉ်ကျေးပြီး အသုံးဝင်တဲ့ အဖြေ ပေးတတ်လာအောင် ဒီနည်းနဲ့ 'လူ့ဆန္ဒနဲ့ ကိုက်ညီ' အောင် ချိန်ညှိထားတာပါ။
