သုတေသနနှင့် ဖွံ့ဖြိုးရေး

ကျွန်ုပ်တို့ ထုတ်ဝေထားသော သုတေသန စာတမ်းများ၊ Open-Source ကိရိယာများနှင့် အဓိက သုတေသန ကဏ္ဍများကို လေ့လာပါ။

စာတမ်းများနှင့် ထုတ်ကုန်များ အားလုံး

ကျွန်ုပ်တို့ ထုတ်ဝေထားသော ထုတ်ကုန်များ၊ အချက်အလက်များနှင့် သုတေသန စာတမ်းများကို လေ့လာကြည့်ရှုပါ။

အမျိုးသမီးနှင့် နည်းပညာဆိုင်ရာ ကဏ္ဍ

ကဏ္ဍအလိုက် လေ့လာရန် →

မြန်မာနိုင်ငံ နည်းပညာနယ်ပယ်ရှိ အမျိုးသမီးများ အခန်းကဏ္ဍသုတေသနလေ့လာဆန်းစစ်ချက်

မြန်မာနိုင်ငံ၏ နည်းပညာကဏ္ဍတွင် လုပ်ကိုင်နေသော အမျိုးသမီးများ၏ လုပ်ငန်းခွင် အခြေအနေ၊ စိန်ခေါ်မှုများနှင့် အတွေ့အကြုံများကို ဖော်ပြသော အချက်အလက်များ။

အရင်းအမြစ်နည်းပါးသော ဘာသာစကားများဆိုင်ရာ ကဏ္ဍ

ကဏ္ဍအလိုက် လေ့လာရန် →

mmdt-tokenizer

"mmdt-tokenizer" သည် မြန်မာစာသားများကို စကားလုံးနှင့် ဝဏ္ဏ (syllable) အဆင့်များအလိုက် တိကျစွာ ပိုင်းဖြတ်ပေးနိုင်သော Open-Source Python library တစ်ခု ဖြစ်ပါသည်။ သဒ္ဒါစနစ်နှင့် အဘိဓာန်အခြေပြု နည်းစနစ်များကို အသုံးပြုထားပြီး ဝဘ်လိပ်စာ၊ အီးမေးလ်၊ ဖုန်းနံပါတ်နှင့် ကိန်းဂဏန်းများကို မူလအတိုင်း ထိန်းသိမ်းကာ ဝိဘတ်၊ သမ္ဗန္ဓ၊ ပစ္စည်းနှင့် နောက်ဆက်တွဲ စကားလုံးများကို စနစ်တကျ ပိုင်းဖြတ်ပေးပါသည်။ ပြန်လည်လေ့ကျင့်ရန် မလိုဘဲ မြန်မာသဘာဝဘာသာစကား လုပ်ငန်းစဉ်များ (NLP)၊ ဒေတာအစု တည်ဆောက်ခြင်းနှင့် သတင်းအချက်အလက် ရှာဖွေဖော်ထုတ်ခြင်း လုပ်ငန်းများအတွက် အသုံးချနိုင်သော အခြေခံနည်းပညာ အဆောက်အအုံ ဖြစ်ပါသည်။

MMDT အမည်သတ်မှတ် ဖော်ထုတ်မှုစနစ် (MMDT NER)

MMDT NER သည် မြန်မာစာသားများတွင် ပါဝင်သော လူပုဂ္ဂိုလ်၊ အဖွဲ့အစည်း၊ တည်နေရာ၊ နေ့စွဲ၊ အချိန်နှင့် ကိန်းဂဏန်း အသုံးအနှုန်းများကို အလိုအလျောက် ခွဲခြားဖော်ထုတ်ပေးခြင်းဖြင့် စနစ်တကျ အသုံးချနိုင်သော ဒေတာအဖြစ် ပြောင်းလဲပေးသည့် အခြေခံ ဘာသာစကားနည်းပညာ စီမံကိန်းတစ်ခု ဖြစ်ပါသည်။ တိုကင်ပေါင်း ၂.၁၄ သန်းပါဝင်သော Annotated Corpus ပေါ်တွင် Transformer အခြေပြု မော်ဒယ်များဖြင့် တည်ဆောက်ထားပြီး၊ ဒစ်ဂျစ်တယ် သတင်းမီဒီယာ၊ သုတေသန၊ ဒစ်ဂျစ်တယ် မှတ်တမ်းထိန်းသိမ်းမှုနှင့် လူမှုအကျိုးပြု လုပ်ငန်းများအတွက် မြန်မာဘာသာစကားဆိုင်ရာ ဉာဏ်ရည်တု (AI) နည်းပညာ ဖွံ့ဖြိုးတိုးတက်စေရန် အဓိက အထောက်အကူပြုပါသည်။