AIPedia LogoAIPedia

LLM BPE Tokenizer Simulator

Large Language Models (ChatGPT, Gemini, Llama) များ စာသားများကို Token များအဖြစ် ခွဲခြားပြောင်းလဲပုံနှင့် Token ID များ ထုတ်ယူပုံကို တိုက်ရိုက် လေ့လာပါ။

LLM BPE Tokenizer Visualizer
Type any text in English or Burmese to observe how LLM Byte-Pair Encoding (BPE) splits characters into subword tokens, token IDs, and UTF-8 bytes.
Tokens: 26
Characters: 102
Bytes: 102
Input Text Area
102 chars
Sample Presets
Token Compression Ratio3.92Chars / Token
Byte-to-Token Ratio3.92Bytes / Token
Color-Coded Token Stream (26 tokens)
Artificial[12891][70159]Intelligence[9412][70159]and[85046][70159]Machine[4321][70159]Learning[4673][70159]models[53787][70159]use[60932][70159]Transformer[31289][70159]neural[18432][70159]networks[84114][70159]for[50080][70159]deep[5129][70159]learning[4673].[15873]
💡 LLM Tokenizer & Byte-Pair Encoding (BPE) ဆိုသည်မှာ ဘာလဲ?

Tokenizer (တိုကင် ခွဲခြားစနစ်) သည် LLM Models များ စာသား (Text) များကို နားလည်ရန်အတွက် ကိန်းဂဏန်း Token ID များအဖြစ် ပထမဆုံး ပြောင်းလဲပေးသော အဆင့်ဖြစ်သည်။ ခေတ်မီ LLM များသည် **Byte-Pair Encoding (BPE)** algorithm ကို အသုံးပြု၍ စကားလုံးများ၊ စကားလုံးအစိတ်အပိုင်းများ (Subwords) နှင့် သင်္ကေတများကို သီးသန့် Token ID များအဖြစ် ခွဲခြားသည်။

1. Subword Tokenization

စကားလုံးအပြည့်အစုံ မကဘဲ စကားလုံးအစိတ်အပိုင်းများ (ဥပမာ "learn" + "ing") အဖြစ် ခွဲခြားသဖြင့် Vocabulary အရွယ်အစားကို အထူး ချွေတာပေးသည်။

2. UTF-8 Byte Fallback

Vocabulary ထဲတွင် မပါဝင်သော ဘာသာစကားများနှင့် မတူညီသော စာလုံးများကို UTF-8 Bytes များအဖြစ် မပျောက်ပျက်စေဘဲ Tokenize လုပ်ပေးသည်။

3. Burmese Token Efficiency

မြန်မာစာသားများသည် UTF-8 တွင် 3-bytes ရောက်ရှိသဖြင့် standard English tokenizers တွင် token အရေအတွက် ပိုမို များပြားလေ့ရှိသည်။