Isaac Nugroho, Ryan Putranda Kristianto, Yulia Wahyuningsih · INDOTERA - Indonesian Dissemination of Engineering and Applied Technology Research Applications 2026 · 2026
DOI: 10.68167/indotera.v2i4.171
Counts differ because each database indexes a different set of publications. We treat OpenAlex as the canonical count; Google Scholar is not shown (no API, and crawling it violates its ToS).
Pengguna tunarungu menghadapi hambatan signifikan dalam mengakses konten audio digital seperti video conference, podcast, dan siaran langsung, karena minimnya closed caption otomatis berbahasa Indonesia yang dapat diandalkan. Kondisi ini diperparah oleh jumlah penyandang disabilitas di Indonesia yang mencapai lebih dari 22 juta jiwa, dengan kelompok tunarungu sebagai salah satu bagian terbesar yang membutuhkan solusi aksesibilitas digital yang konkret. Penelitian ini mengimplementasikan model Whisper hasil fine-tuning sebagai model utama untuk closed caption Bahasa Indonesia pada browser extension bernama CaptionAI, dengan model Whisper baseline (zero-shot) dan Fast Conformer sebagai model pembanding untuk mengevaluasi sejauh mana fine-tuning meningkatkan performa model ASR berskala kecil yang dapat di-hosting mandiri. Model Whisper varian small di-fine-tune penuh menggunakan dataset gabungan FLEURS, Common Voice 17, dan Common Voice 19 Bahasa Indonesia (26.400 sampel), dengan konfigurasi learning rate 5e-6, batch size efektif 32, dan max_steps 1.000 langkah menggunakan HuggingFace Seq2SeqTrainer. Checkpoint terbaik dipilih otomatis melalui EarlyStoppingCallback berdasarkan Word Error Rate (WER) validasi terendah, lalu diekspor ke format ONNX untuk deployment. Evaluasi pada 800 sampel test yang belum pernah dilihat model selama pelatihan menunjukkan model Whisper hasil fine-tuning mencapai WER 15,84% dan Character Error Rate (CER) 5,35%, unggul signifikan dibanding Whisper baseline zero-shot (WER 30,83%, CER 9,29%) maupun Fast Conformer (WER 34,72%, CER 15,40%), dengan latensi rata-rata 0,474 detik yang kompetitif untuk live captioning meski belum memenuhi standar real-time ketat di bawah 400 milidetik. Sistem berhasil diimplementasikan sebagai browser extension dengan server backend FastAPI, menerapkan pola inferensi paralel antara Whisper ONNX lokal dan Groq API sebagai jalur cloud. Evaluasi usability melalui System Usability Scale (SUS) terhadap 25 responden menghasilkan skor rata-rata 67,1 dari skala 100 (kategori "ok"), sementara pengujian black-box terhadap 12 skenario fungsional menunjukkan sistem berjalan sesuai harapan. Hasil ini menegaskan bahwa fine-tuning memberikan peningkatan performa signifikan terhadap kemampuan dasar model ASR pre-trained untuk konteks Bahasa Indonesia, serta layak diterapkan sebagai solusi aksesibilitas real-world bagi pengguna tunarungu.
No comments yet — start the discussion below.