LLM BPE Tokenizer Simulator
Large Language Models (ChatGPT, Gemini, Llama) များ စာသားများကို Token များအဖြစ် ခွဲခြားပြောင်းလဲပုံနှင့် Token ID များ ထုတ်ယူပုံကို တိုက်ရိုက် လေ့လာပါ။
Tokenizer (တိုကင် ခွဲခြားစနစ်) သည် LLM Models များ စာသား (Text) များကို နားလည်ရန်အတွက် ကိန်းဂဏန်း Token ID များအဖြစ် ပထမဆုံး ပြောင်းလဲပေးသော အဆင့်ဖြစ်သည်။ ခေတ်မီ LLM များသည် **Byte-Pair Encoding (BPE)** algorithm ကို အသုံးပြု၍ စကားလုံးများ၊ စကားလုံးအစိတ်အပိုင်းများ (Subwords) နှင့် သင်္ကေတများကို သီးသန့် Token ID များအဖြစ် ခွဲခြားသည်။
စကားလုံးအပြည့်အစုံ မကဘဲ စကားလုံးအစိတ်အပိုင်းများ (ဥပမာ "learn" + "ing") အဖြစ် ခွဲခြားသဖြင့် Vocabulary အရွယ်အစားကို အထူး ချွေတာပေးသည်။
Vocabulary ထဲတွင် မပါဝင်သော ဘာသာစကားများနှင့် မတူညီသော စာလုံးများကို UTF-8 Bytes များအဖြစ် မပျောက်ပျက်စေဘဲ Tokenize လုပ်ပေးသည်။
မြန်မာစာသားများသည် UTF-8 တွင် 3-bytes ရောက်ရှိသဖြင့် standard English tokenizers တွင် token အရေအတွက် ပိုမို များပြားလေ့ရှိသည်။
