Analisis Kemampuan Model Hybrid CNN-GRU dalam Memahami Dinamika Temporal Suara Burung Berbasis Audio Spectrogram
DOI:
https://doi.org/10.61722/jipm.v4i6.3203Keywords:
audio spectrogram, dinamika temporal, Gated Recurrent Unit (GRU), hybrid CNN-GRU, klasifikasi suara burungAbstract
Klasifikasi suara burung berbasis audio spectrogram umumnya mengandalkan Convolutional Neural Network (CNN) untuk mengekstraksi fitur spasial, namun pendekatan tersebut belum optimal dalam memanfaatkan informasi urutan waktu yang terkandung pada sinyal audio, padahal pola vokalisasi burung memiliki karakteristik temporal yang kompleks. Penelitian ini bertujuan menganalisis kemampuan model hybrid Convolutional Neural Network-Gated Recurrent Unit (CNN-GRU) dalam memahami dinamika temporal suara burung. Penelitian menggunakan pendekatan kuantitatif dengan metode eksperimen pada dataset 850 rekaman suara dari lima spesies burung urban Indonesia yang diperoleh dari Xeno-Canto, kemudian ditambah melalui augmentasi data menjadi 1.000 sampel untuk mengatasi ketidakseimbangan kelas. Audio diolah melalui normalisasi, resampling, penghilangan noise, dan dikonversi menjadi mel-spectrogram menggunakan Short-Time Fourier Transform (STFT) sebagai masukan model. Kemampuan model dalam memahami dinamika temporal dianalisis melalui visualisasi hidden state GRU menggunakan t-SNE serta pengujian Frame Shuffle Test. Hasil pengujian menunjukkan model memperoleh akurasi 76%, dengan precision, recall, dan F1-score masing-masing sebesar 77%, 76%, dan 76% pada data uji. Visualisasi hidden state GRU menunjukkan representasi internal model berubah secara bertahap mengikuti urutan frame, sedangkan pengacakan urutan frame menyebabkan penurunan nilai confidence dan perubahan kelas prediksi. Temuan ini membuktikan bahwa model CNN-GRU tidak hanya mengandalkan fitur spasial dari spectrogram, tetapi juga secara aktif memanfaatkan hubungan temporal antarframe dalam proses klasifikasi, sehingga integrasi GRU pada arsitektur hybrid terbukti mampu menangkap dinamika temporal suara burung secara efektif.
References
Alberto, J., & Hermanto, D. (2023). Klasifikasi Jenis Burung Menggunakan Metode CNN Dan Arsitektur ResNet-50. JATISI (Jurnal Teknik Informatika Dan Sistem Informasi), 10(3), 34–46.
Alsyaibani, O. M. A., Utami, E., Raharjo, S., & Hartanto, A. D. (2022). Stacked LSTM-GRU Model for Traffic Anomalies Detection. Telematika, 15(2), 81–91. https://doi.org/10.35671/telematika.v15i2.1855
Baowaly, M. K., Sarkar, B. C., Walid, M. A. A., Ahamad, M. M., Singh, B. C., Alvarado, E. S., Ashraf, I., & Samad, M. A. (2024). Deep transfer learning-based bird species classification using mel spectrogram images. PLoS ONE, 19(8 August). https://doi.org/10.1371/journal.pone.0305708
Chang, Y.-T., & Sinnott, R. (2022). Machine Learning-based Classification of Birds through Birdsong. ArXiv, abs/2212.04684. https://doi.org/10.48550/arXiv.2212.04684
Elsayed, N., Maida, A. S., & Bayoumi, M. (2019). Deep Gated Recurrent and Convolutional Network Hybrid Model for Univariate Time Series Classification. https://doi.org/10.14569/IJACSA.2019.0100582
Ferdiana, R., Dicka, W. F., & Boediman, A. (2021). Cat sounds classification with convolutional neural network. International Journal on Electrical Engineering and Informatics, 13(3), 755–765.
Foggia, P., Greco, A., Roberto, A., Saggese, A., & Vento, M. (2023). Degramnet: effective audio analysis based on a fully learnable time–frequency representation. Neural Computing and Applications, 35(27), 20207–20219. https://doi.org/10.1007/s00521-023-08849-7
Hernández-Navarro, A. J., Robledano, F., Jiménez-Franco, M. V., Royle, J. A., & Calvo, J. F. (2024). Long-term trends of local bird populations based on monitoring schemes: are they suitable for justifying management measures? Journal of Ornithology, 165(2), 355–367. https://doi.org/10.1007/s10336-023-02114-3
Levy, J., Naitsat, A., & Zeevi, Y. Y. (2022). Classification of audio signals using spectrogram surfaces and extrinsic distortion measures. Eurasip Journal on Advances in Signal Processing, 2022(1). https://doi.org/10.1186/s13634-022-00933-9
Myagila, K., Nyambo, D. G., & Dida, M. A. (2025). Efficient spatio-temporal modeling for sign language recognition using CNN and RNN architectures. Frontiers in Artificial Intelligence, 8. https://doi.org/10.3389/frai.2025.1630743
Ozcan, T., & Gungor, H. (2025). Baby Cry Classification Using Structure-Tuned Artificial Neural Networks with Data Augmentation and MFCC Features. Applied Sciences, 15(5), 2648.
Revadekar, S., Panchal, V., Kanani, P., Shah, K., Vasoya, A., & Pandey, R. (2023). Bird Sound Classification using Deep Neural Networks: A Comparative Analysis of State-of-the-Art Models and Custom Architectures. International Journal of Intelligent Systems and Applications in Engineering, 11(4), 614–622. https://ijisae.org/index.php/IJISAE/article/view/3596
Zarzycki, K., & Ławryńczuk, M. (2021). LSTM and GRU neural networks as models of dynamical processes used in predictive control: A comparison of models developed for two chemical reactors. Sensors, 21(16). https://doi.org/10.3390/s21165625
Downloads
Published
How to Cite
Issue
Section
License
Copyright (c) 2026 JURNAL ILMIAH PENELITIAN MAHASISWA

This work is licensed under a Creative Commons Attribution-ShareAlike 4.0 International License.











