mmdt-tokenizer

အကျဉ်းချုပ် ဖော်ပြချက်

"mmdt-tokenizer" သည် မြန်မာစာသားများကို စကားလုံးနှင့် ဝဏ္ဏ (syllable) အဆင့်များအလိုက် တိကျစွာ ပိုင်းဖြတ်ပေးနိုင်သော Open-Source Python library တစ်ခု ဖြစ်ပါသည်။ သဒ္ဒါစနစ်နှင့် အဘိဓာန်အခြေပြု နည်းစနစ်များကို အသုံးပြုထားပြီး ဝဘ်လိပ်စာ၊ အီးမေးလ်၊ ဖုန်းနံပါတ်နှင့် ကိန်းဂဏန်းများကို မူလအတိုင်း ထိန်းသိမ်းကာ ဝိဘတ်၊ သမ္ဗန္ဓ၊ ပစ္စည်းနှင့် နောက်ဆက်တွဲ စကားလုံးများကို စနစ်တကျ ပိုင်းဖြတ်ပေးပါသည်။ ပြန်လည်လေ့ကျင့်ရန် မလိုဘဲ မြန်မာသဘာဝဘာသာစကား လုပ်ငန်းစဉ်များ (NLP)၊ ဒေတာအစု တည်ဆောက်ခြင်းနှင့် သတင်းအချက်အလက် ရှာဖွေဖော်ထုတ်ခြင်း လုပ်ငန်းများအတွက် အသုံးချနိုင်သော အခြေခံနည်းပညာ အဆောက်အအုံ ဖြစ်ပါသည်။

အရင်းအမြစ်နည်းပါးသော ဘာသာစကားများဆိုင်ရာ ကဏ္ဍ ကဏ္ဍမှ အခြား သုတေသနများ

MMDT အမည်သတ်မှတ် ဖော်ထုတ်မှုစနစ် (MMDT NER)

MMDT NER သည် မြန်မာစာသားများတွင် ပါဝင်သော လူပုဂ္ဂိုလ်၊ အဖွဲ့အစည်း၊ တည်နေရာ၊ နေ့စွဲ၊ အချိန်နှင့် ကိန်းဂဏန်း အသုံးအနှုန်းများကို အလိုအလျောက် ခွဲခြားဖော်ထုတ်ပေးခြင်းဖြင့် စနစ်တကျ အသုံးချနိုင်သော ဒေတာအဖြစ် ပြောင်းလဲပေးသည့် အခြေခံ ဘာသာစကားနည်းပညာ စီမံကိန်းတစ်ခု ဖြစ်ပါသည်။ တိုကင်ပေါင်း ၂.၁၄ သန်းပါဝင်သော Annotated Corpus ပေါ်တွင် Transformer အခြေပြု မော်ဒယ်များဖြင့် တည်ဆောက်ထားပြီး၊ ဒစ်ဂျစ်တယ် သတင်းမီဒီယာ၊ သုတေသန၊ ဒစ်ဂျစ်တယ် မှတ်တမ်းထိန်းသိမ်းမှုနှင့် လူမှုအကျိုးပြု လုပ်ငန်းများအတွက် မြန်မာဘာသာစကားဆိုင်ရာ ဉာဏ်ရည်တု (AI) နည်းပညာ ဖွံ့ဖြိုးတိုးတက်စေရန် အဓိက အထောက်အကူပြုပါသည်။

← အရင်းအမြစ်နည်းပါးသော ဘာသာစကားများဆိုင်ရာ ကဏ္ဍ သို့ ပြန်သွားရန် သုတေသန စီမံကိန်း အားလုံး →