Analisis Kemampuan Model Hybrid CNN-GRU dalam Memahami Dinamika Temporal Suara Burung Berbasis Audio Spectrogram

Authors

  • Mario Lusiano Klau Universitas Katolik Darma Cendika
  • Ryan Putranda Kristianto Universitas Katolik Darma Cendika

DOI:

https://doi.org/10.61722/jipm.v4i6.3203

Keywords:

audio spectrogram, dinamika temporal, Gated Recurrent Unit (GRU), hybrid CNN-GRU, klasifikasi suara burung

Abstract

Klasifikasi suara burung berbasis audio spectrogram umumnya mengandalkan Convolutional Neural Network (CNN) untuk mengekstraksi fitur spasial, namun pendekatan tersebut belum optimal dalam memanfaatkan informasi urutan waktu yang terkandung pada sinyal audio, padahal pola vokalisasi burung memiliki karakteristik temporal yang kompleks. Penelitian ini bertujuan menganalisis kemampuan model hybrid Convolutional Neural Network-Gated Recurrent Unit (CNN-GRU) dalam memahami dinamika temporal suara burung. Penelitian menggunakan pendekatan kuantitatif dengan metode eksperimen pada dataset 850 rekaman suara dari lima spesies burung urban Indonesia yang diperoleh dari Xeno-Canto, kemudian ditambah melalui augmentasi data menjadi 1.000 sampel untuk mengatasi ketidakseimbangan kelas. Audio diolah melalui normalisasi, resampling, penghilangan noise, dan dikonversi menjadi mel-spectrogram menggunakan Short-Time Fourier Transform (STFT) sebagai masukan model. Kemampuan model dalam memahami dinamika temporal dianalisis melalui visualisasi hidden state GRU menggunakan t-SNE serta pengujian Frame Shuffle Test. Hasil pengujian menunjukkan model memperoleh akurasi 76%, dengan precision, recall, dan F1-score masing-masing sebesar 77%, 76%, dan 76% pada data uji. Visualisasi hidden state GRU menunjukkan representasi internal model berubah secara bertahap mengikuti urutan frame, sedangkan pengacakan urutan frame menyebabkan penurunan nilai confidence dan perubahan kelas prediksi. Temuan ini membuktikan bahwa model CNN-GRU tidak hanya mengandalkan fitur spasial dari spectrogram, tetapi juga secara aktif memanfaatkan hubungan temporal antarframe dalam proses klasifikasi, sehingga integrasi GRU pada arsitektur hybrid terbukti mampu menangkap dinamika temporal suara burung secara efektif.

 

References

Alberto, J., & Hermanto, D. (2023). Klasifikasi Jenis Burung Menggunakan Metode CNN Dan Arsitektur ResNet-50. JATISI (Jurnal Teknik Informatika Dan Sistem Informasi), 10(3), 34–46.

Alsyaibani, O. M. A., Utami, E., Raharjo, S., & Hartanto, A. D. (2022). Stacked LSTM-GRU Model for Traffic Anomalies Detection. Telematika, 15(2), 81–91. https://doi.org/10.35671/telematika.v15i2.1855

Baowaly, M. K., Sarkar, B. C., Walid, M. A. A., Ahamad, M. M., Singh, B. C., Alvarado, E. S., Ashraf, I., & Samad, M. A. (2024). Deep transfer learning-based bird species classification using mel spectrogram images. PLoS ONE, 19(8 August). https://doi.org/10.1371/journal.pone.0305708

Chang, Y.-T., & Sinnott, R. (2022). Machine Learning-based Classification of Birds through Birdsong. ArXiv, abs/2212.04684. https://doi.org/10.48550/arXiv.2212.04684

Elsayed, N., Maida, A. S., & Bayoumi, M. (2019). Deep Gated Recurrent and Convolutional Network Hybrid Model for Univariate Time Series Classification. https://doi.org/10.14569/IJACSA.2019.0100582

Ferdiana, R., Dicka, W. F., & Boediman, A. (2021). Cat sounds classification with convolutional neural network. International Journal on Electrical Engineering and Informatics, 13(3), 755–765.

Foggia, P., Greco, A., Roberto, A., Saggese, A., & Vento, M. (2023). Degramnet: effective audio analysis based on a fully learnable time–frequency representation. Neural Computing and Applications, 35(27), 20207–20219. https://doi.org/10.1007/s00521-023-08849-7

Hernández-Navarro, A. J., Robledano, F., Jiménez-Franco, M. V., Royle, J. A., & Calvo, J. F. (2024). Long-term trends of local bird populations based on monitoring schemes: are they suitable for justifying management measures? Journal of Ornithology, 165(2), 355–367. https://doi.org/10.1007/s10336-023-02114-3

Levy, J., Naitsat, A., & Zeevi, Y. Y. (2022). Classification of audio signals using spectrogram surfaces and extrinsic distortion measures. Eurasip Journal on Advances in Signal Processing, 2022(1). https://doi.org/10.1186/s13634-022-00933-9

Myagila, K., Nyambo, D. G., & Dida, M. A. (2025). Efficient spatio-temporal modeling for sign language recognition using CNN and RNN architectures. Frontiers in Artificial Intelligence, 8. https://doi.org/10.3389/frai.2025.1630743

Ozcan, T., & Gungor, H. (2025). Baby Cry Classification Using Structure-Tuned Artificial Neural Networks with Data Augmentation and MFCC Features. Applied Sciences, 15(5), 2648.

Revadekar, S., Panchal, V., Kanani, P., Shah, K., Vasoya, A., & Pandey, R. (2023). Bird Sound Classification using Deep Neural Networks: A Comparative Analysis of State-of-the-Art Models and Custom Architectures. International Journal of Intelligent Systems and Applications in Engineering, 11(4), 614–622. https://ijisae.org/index.php/IJISAE/article/view/3596

Zarzycki, K., & Ławryńczuk, M. (2021). LSTM and GRU neural networks as models of dynamical processes used in predictive control: A comparison of models developed for two chemical reactors. Sensors, 21(16). https://doi.org/10.3390/s21165625

Downloads

Published

2026-09-12

How to Cite

Mario Lusiano Klau, & Ryan Putranda Kristianto. (2026). Analisis Kemampuan Model Hybrid CNN-GRU dalam Memahami Dinamika Temporal Suara Burung Berbasis Audio Spectrogram. JURNAL ILMIAH PENELITIAN MAHASISWA, 4(6), 880–891. https://doi.org/10.61722/jipm.v4i6.3203

Issue

Section

##section.default.title##

Similar Articles

1 2 3 4 5 6 7 8 9 > >> 

You may also start an advanced similarity search for this article.