Niyetbay Uteuliev, Jabbar Kudaybergenov, Tangirbergen Kudaybergenov · Zenodo (CERN European Organization for Nuclear Research) 2026 · 2026
DOI: 10.5281/zenodo.23082745
Counts differ because each database indexes a different set of publications. We treat OpenAlex as the canonical count; Google Scholar is not shown (no API, and crawling it violates its ToS).
Nutqni diarizatsiya qilish ko‘p so‘zlovchili audioyozuvlarda “kim qachon gapirdi?” savoliga javob berib, nutq segmentlarini alohida so‘zlovchilarga ajratish vazifasidir. Ushbu maqolada x-vector/VBx, EEND, EEND-EDA, TS-VAD, EEND-vector klasterlash va WavLM asosidagi zamonaviy diarizatsiya usullari tahlil qilinadi. DER va JER baholash mezonlari hamda CALLHOME, AMI, DIHARD va VoxConverse mezoniy sinov to‘plamlari ko‘rib chiqiladi. Asosiy e’tibor kam resursli qoraqalpoq tiliga qaratiladi. 50 soatlik va 25 nafar ona tilida so‘zlashuvchini qamrab oluvchi Karakalpak Speech Corpus asosan avtomatik nutqni tanib olish uchun mo‘ljallangan bo‘lib, individual nutq ifodalaridan tashkil topgan. Shu sababli qoraqalpoq nutqini diarizatsiya qilish uchun so‘zlovchilar va ustma-ust nutq segmentlari belgilangan maxsus ko‘p-so‘zlovchili korpusni yaratish hamda oldindan o‘qitilgan modellarni qoraqalpoq nutqiga moslashtirish zarur.
No comments yet — start the discussion below.