MMDT အမည်သတ်မှတ် ဖော်ထုတ်မှုစနစ် (MMDT NER)

အကျဉ်းချုပ် ဖော်ပြချက်

MMDT NER သည် မြန်မာစာသားများတွင် ပါဝင်သော လူပုဂ္ဂိုလ်၊ အဖွဲ့အစည်း၊ တည်နေရာ၊ နေ့စွဲ၊ အချိန်နှင့် ကိန်းဂဏန်း အသုံးအနှုန်းများကို အလိုအလျောက် ခွဲခြားဖော်ထုတ်ပေးခြင်းဖြင့် စနစ်တကျ အသုံးချနိုင်သော ဒေတာအဖြစ် ပြောင်းလဲပေးသည့် အခြေခံ ဘာသာစကားနည်းပညာ စီမံကိန်းတစ်ခု ဖြစ်ပါသည်။ တိုကင်ပေါင်း ၂.၁၄ သန်းပါဝင်သော Annotated Corpus ပေါ်တွင် Transformer အခြေပြု မော်ဒယ်များဖြင့် တည်ဆောက်ထားပြီး၊ ဒစ်ဂျစ်တယ် သတင်းမီဒီယာ၊ သုတေသန၊ ဒစ်ဂျစ်တယ် မှတ်တမ်းထိန်းသိမ်းမှုနှင့် လူမှုအကျိုးပြု လုပ်ငန်းများအတွက် မြန်မာဘာသာစကားဆိုင်ရာ ဉာဏ်ရည်တု (AI) နည်းပညာ ဖွံ့ဖြိုးတိုးတက်စေရန် အဓိက အထောက်အကူပြုပါသည်။

အရင်းအမြစ်နည်းပါးသော ဘာသာစကားများဆိုင်ရာ ကဏ္ဍ ကဏ္ဍမှ အခြား သုတေသနများ

mmdt-tokenizer

"mmdt-tokenizer" သည် မြန်မာစာသားများကို စကားလုံးနှင့် ဝဏ္ဏ (syllable) အဆင့်များအလိုက် တိကျစွာ ပိုင်းဖြတ်ပေးနိုင်သော Open-Source Python library တစ်ခု ဖြစ်ပါသည်။ သဒ္ဒါစနစ်နှင့် အဘိဓာန်အခြေပြု နည်းစနစ်များကို အသုံးပြုထားပြီး ဝဘ်လိပ်စာ၊ အီးမေးလ်၊ ဖုန်းနံပါတ်နှင့် ကိန်းဂဏန်းများကို မူလအတိုင်း ထိန်းသိမ်းကာ ဝိဘတ်၊ သမ္ဗန္ဓ၊ ပစ္စည်းနှင့် နောက်ဆက်တွဲ စကားလုံးများကို စနစ်တကျ ပိုင်းဖြတ်ပေးပါသည်။ ပြန်လည်လေ့ကျင့်ရန် မလိုဘဲ မြန်မာသဘာဝဘာသာစကား လုပ်ငန်းစဉ်များ (NLP)၊ ဒေတာအစု တည်ဆောက်ခြင်းနှင့် သတင်းအချက်အလက် ရှာဖွေဖော်ထုတ်ခြင်း လုပ်ငန်းများအတွက် အသုံးချနိုင်သော အခြေခံနည်းပညာ အဆောက်အအုံ ဖြစ်ပါသည်။

← အရင်းအမြစ်နည်းပါးသော ဘာသာစကားများဆိုင်ရာ ကဏ္ဍ သို့ ပြန်သွားရန် သုတေသန စီမံကိန်း အားလုံး →