Nabila Wulandari, SEKAR AYU PRAMESTI · MUARA KOMPUTER Jurnal Ilmiah Ilmu Komputer & Elektronika 2026 · 2026
DOI: 10.64365/murakom.v2i4.560
Counts differ because each database indexes a different set of publications. We treat OpenAlex as the canonical count; Google Scholar is not shown (no API, and crawling it violates its ToS).
Integrasi kecerdasan buatan multimodal dalam robotika telah membuka peluang baru bagi sistem robot cerdas yang mampu memahami lingkungan dan berinteraksi secara alami dengan manusia. Namun, keterbatasan mendasar pada Model Visi-Bahasa (Vision-Language Models/VLM) dalam persepsi visual menjadi hambatan signifikan dalam mewujudkan sistem robot yang benar-benar otonom dan adaptif. Penelitian ini mengkaji keterbatasan VLM dalam penalaran spasial dan persepsi visual, serta mengeksplorasi strategi integrasi sensorik dan pembelajaran mendalam untuk mengatasi keterbatasan tersebut. Melalui tinjauan literatur sistematis terhadap penelitian terkini, ditemukan bahwa VLM menghadapi tantangan signifikan dalam memahami hubungan spasial yang halus, terutama dalam konteks manipulasi robotik dan interaksi tangan-manusia. Benchmark HandVQA mengungkapkan bahwa model VLM cenderung mengalami halusinasi bagian tangan, kesalahan interpretasi geometris, dan generalisasi yang buruk pada tugas-tugas yang melibatkan pose tangan yang kompleks. Fenomena "modality collapse" juga teridentifikasi, di mana prior visual yang kuat mengalahkan sinyal linguistik yang sparse, menyebabkan agen robot mengabaikan perintah bahasa dan hanya mengandalkan isyarat visual. Untuk mengatasi keterbatasan ini, pendekatan integrasi sensorik multimodal menggabungkan data visual, taktil, audio, dan proprioceptive serta arsitektur pembelajaran mendalam yang menggabungkan representasi multimodal menunjukkan potensi besar. Penelitian ini menyimpulkan bahwa meskipun VLM memiliki keterbatasan fundamental dalam persepsi visual, integrasi sensorik yang cerdas dan pembelajaran mendalam menawarkan jalur yang menjanjikan menuju sistem robot cerdas yang lebih robust dan adaptif.
No comments yet — start the discussion below.