AIPedia LogoAIPedia

Reinforcement Learning Visualizer

Grid World ပတ်ဝန်းကျင်အတွင်း 🤖 Agent မှ Reward (+10) / Penalty (-10) Signals များ ရယူကာ Q-Table တည်ဆောက် လေ့ကျင့်ပုံကို စမ်းသပ်ကြည့်ပါ။

Reinforcement Learning Q-Learning Simulator
Bellman Equation: Q(s,a) ← Q(s,a) + α [ R + γ max Q(s',a') - Q(s,a) ]
Episodes: 0
Reward: 0
🤖
s0
0.0
s1
0.0
s2
0.0
s3
0.0
s4
0.0
WALL
s7
0.0
s8
0.0
s9
0.0
s11
0.0
s12
0.0
s13
0.0
s14
0.0
Learning α0.2
Discount γ0.9
Explore ε0.2