mmdt-tokenizer
အကျဉ်းချုပ် ဖော်ပြချက်
"mmdt-tokenizer" သည် မြန်မာစာသားများကို စကားလုံးနှင့် ဝဏ္ဏ (syllable) အဆင့်များအလိုက် တိကျစွာ ပိုင်းဖြတ်ပေးနိုင်သော Open-Source Python library တစ်ခု ဖြစ်ပါသည်။ သဒ္ဒါစနစ်နှင့် အဘိဓာန်အခြေပြု နည်းစနစ်များကို အသုံးပြုထားပြီး ဝဘ်လိပ်စာ၊ အီးမေးလ်၊ ဖုန်းနံပါတ်နှင့် ကိန်းဂဏန်းများကို မူလအတိုင်း ထိန်းသိမ်းကာ ဝိဘတ်၊ သမ္ဗန္ဓ၊ ပစ္စည်းနှင့် နောက်ဆက်တွဲ စကားလုံးများကို စနစ်တကျ ပိုင်းဖြတ်ပေးပါသည်။ ပြန်လည်လေ့ကျင့်ရန် မလိုဘဲ မြန်မာသဘာဝဘာသာစကား လုပ်ငန်းစဉ်များ (NLP)၊ ဒေတာအစု တည်ဆောက်ခြင်းနှင့် သတင်းအချက်အလက် ရှာဖွေဖော်ထုတ်ခြင်း လုပ်ငန်းများအတွက် အသုံးချနိုင်သော အခြေခံနည်းပညာ အဆောက်အအုံ ဖြစ်ပါသည်။