Pengembangan Dataset Video Gerakan Bibir untuk Pengenalan Kata Bahasa Indonesia
Keywords:
Bahasa Indonesia, gerakan bibir, pengenalan kata, visual speech recognition, dataset, Indonesian language, lip movement, word recognitionAbstract
Abstrak
Dataset video gerakan bibir merupakan komponen penting dalam penelitian visual speech recognition karena pengenalan kata berbasis visual membutuhkan data yang mampu merepresentasikan pola artikulasi secara jelas. Kebutuhan tersebut menjadi tantangan pada bahasa Indonesia karena dataset video gerakan bibir masih perlu diperluas, terutama untuk pengenalan kata dengan data yang dikumpulkan secara terkontrol. Penelitian ini bertujuan untuk mengembangkan dataset video gerakan bibir untuk pengenalan kata bahasa Indonesia yang diharapkan dapat menjadi dasar awal bagi penelitian lanjutan dalam pengembangan sistem pengenalan kata berbasis informasi visual. Metode yang digunakan meliputi penentuan kelas kata, perekaman video, pengorganisasian data berdasarkan label, pra-pemrosesan frame, dan validasi awal menggunakan model berbasis deep learning. Dataset yang dihasilkan terdiri dari 796 video dengan 12 kelas kata, dengan setiap video memuat satu kata yang direkam pada posisi wajah frontal. Hasil validasi awal menunjukkan akurasi uji sebesar 96,25%, sehingga dataset yang dikembangkan dapat digunakan sebagai dasar penelitian pengenalan kata bahasa Indonesia berbasis gerakan bibir.
Kata kunci: Bahasa Indonesia, dataset, gerakan bibir, pengenalan kata, visual speech recognition.
Abstract
Lip movement video datasets are an important component in visual speech recognition research because visual word recognition requires data that can clearly represent articulation patterns. This need becomes a challenge for Indonesian because lip movement video datasets still need to be expanded, especially for word recognition using data collected in a controlled manner. This study aims to develop a lip movement video dataset for Indonesian word recognition. The dataset is expected to serve as an initial foundation for further research in developing word recognition systems based on visual information. The method includes word class selection, video recording, label-based data organization, frame preprocessing, and initial validation using a deep learning-based model. The resulting dataset consists of 796 videos with 12 words classes, where each video contains one word recorded in a frontal face position. The initial validation result shows a test accuracy of 96.25%, indicating that the developed dataset can be used as a foundation for Indonesian word recognition research based on lip movements.
Keywords: dataset, Indonesian language, lip movement, visual speech recognition, word recognition.
References
P. Ma, S. Petridis, and M. Pantic, “Visual speech recognition for multiple languages in the wild,” Nat. Mach. Intell., vol. 4, no. 11, pp. 930–939, 2022, doi: 10.1038/s42256-022-00550-z.
J. S. Chung and A. Zisserman, “Lip Reading in the Wild”.
G. Schwiebert, C. Weber, L. Qu, H. Siqueira, and S. Wermter, “A Multimodal German Dataset for Automatic Lip Reading Systems and Transfer Learning,” 2022 Lang. Resour. Eval. Conf. Lr. 2022, no. June, pp. 6829–6836, 2022, doi: 10.25592/uhhfdm.10047.
G. Megiyanto Rahmatullah, “Indonesian Lipreading Dataset (IDLRW),” Dec. 2023, Zenodo. doi: 10.5281/zenodo.10432663.
G. Megiyanto Rahmatullah, “Indonesian Lip Reading (ID-LR),” Jul. 2024, Zenodo. doi: 10.5281/zenodo.12770253.


