Дина Оралбекова, Akbayan Bekarystankyzy, Aigerim Yerimbetova, Ulmeken Berzhanova · NEWS OF THE NATIONAL ACADEMY OF SCIENCES OF THE REPUBLIC OF KAZAKHSTAN 2026 · 2026
DOI: 10.32014/2026.2518-1726.467
Counts differ because each database indexes a different set of publications. We treat OpenAlex as the canonical count; Google Scholar is not shown (no API, and crawling it violates its ToS).
Мақалада назар аудару механизмдеріне негізделген ағындық сөйлеуді тану архитектураларына шолу жасалып, салыстырмалы талдау ұсынылады. Зерттеуде рекуррентті нейрондық түрлендіргіш (RNN-T), нейрондық түрлендіргіш (NT) және бөліктер бойынша монотонды назар аудару (MoChA) модельдері қарастырылды. Модельдер қазақ тіліне бейімделіп, нақты уақыт режимінде жұмыс істеуге икемделді. Оқыту үшін 200 сағаттық аннотацияланған қазақша сөйлеу корпусы пайдаланылып, Voice Conversion әдісі арқылы оның көлемі 260 сағатқа дейін кеңейтілді. Акустикалық белгілерді бөліп алу үшін мел-жиіліктік кепстралдық коэффициенттер қолданылып, модель архитектураларында екібағытты рекуррентті нейрондық желілер пайдаланылды. Эксперименттік нәтижелер бөліктер бойынша монотонды назар аудару моделінің ең жоғары дәлдікке қол жеткізгенін көрсетті: WER = 14,8%. Бұл көрсеткіш рекуррентті нейрондық түрлендіргіш пен стандартты нейрондық түрлендіргіш нәтижелерінен жоғары болды, алайда MoChA моделін баптау күрделірек болды. Барлық үш модель ресурстары шектеулі жағдайда да жоғары тиімділік көрсетті. Эксперименттік бағалау көлемі әртүрлі екі корпус негізінде жүргізілді және деректер жиынтығы ұлғайған сайын сөйлеуді тану дәлдігінің артатыны анықталды. Салыстырмалы талдау MoChA моделінің WER көрсеткішін RNN-T және NT модельдерімен салыстырғанда тиісінше 0,7 және 0,5 пайыздық тармаққа төмендеткенін көрсетті. Сонымен қатар MoChA архитектурасында параметрлер саны көп және оңтайландыру үдерісі күрделі болғандықтан, оны баптауға қосымша уақыт қажет болды. Зерттеу нәтижелері қарастырылған тәсілдердің қазақ тілі сияқты ресурстары шектеулі тілдерге арналған ағындық сөйлеуді тану жүйелерін әзірлеуде тиімді екенін көрсетеді. Бұл модельдер алдын ала жазылған аудиофайлдарды қажет етпей, нақты уақыт режимінде жұмыс істей алатындықтан, оларды әртүрлі технологиялық платформалар мен қолданбаларға интеграциялау мүмкіндігі жоғары.
No comments yet — start the discussion below.