Perbandingan Kinerja Model CNN EfficientNetB0 dan Vision Transformer Untuk Klasifikasi Citra Real-Fake

Authors

  • Akhlaqul Muhammad Fadwa Universitas Riau Author
  • M. Sohibbal Universitas Riau Author
  • Rachel Ditya Syaharani Universitas Riau Author
  • Dian Ramadhani Universitas Riau Author
  • Al Aminuddin Universitas Riau Author

Keywords:

CIFAKE, Deep Learning, EfficientNetB0, Klasifikasi Citra, Vision Transformer

Abstract

Model generatif berbasis Generative Adversarial Network (GAN) seperti StyleGAN, Stable Diffusion, DALL·E, dan DeepFaceLab kini mampu menghasilkan citra sintetis yang sulit dibedakan dari citra asli, memicu penyalahgunaan berupa deepfake, manipulasi identitas digital, dan misinformasi visual yang mengancam kepercayaan terhadap konten digital. Penelitian ini mengusulkan pendekatan komparatif antara Convolutional Neural Network (CNN) berbasis EfficientNetB0 dan Vision Transformer (ViT) untuk mengklasifikasikan citra real dan fake guna mengidentifikasi arsitektur paling efektif dalam deteksi konten sintetis. Kedua model dikonfigurasi dengan backbone frozen menggunakan bobot pre-trained dan classifier head identik: Dense(512, ReLU), Dropout(0,4), Dense(256, ReLU), Dropout(0,4), Dense(1, Sigmoid), untuk memastikan perbandingan yang objektif. Dataset CIFAKE terdiri dari 120.000 citra — 60.000 real (CIFAR-10) dan 60.000 fake (Stable Diffusion v1.4) — diproses dengan resizing ke 224×224 piksel, normalisasi, dan augmentasi data, dengan pembagian 80:20 untuk pelatihan-validasi dan 20.000 citra untuk pengujian. Evaluasi dilakukan menggunakan akurasi, precision, recall, F1-score, dan confusion matrix. EfficientNetB0 mencapai akurasi 84,79% dengan waktu pelatihan ±1 jam 12 menit, namun lemah pada deteksi kelas fake dengan recall 72,17% dan false positive 2.783 citra. Sebaliknya, Vision Transformer mencapai akurasi 97,15% dengan precision, recall, dan F1-score seimbang di atas 97% pada kedua kelas, dengan waktu pelatihan ±14 jam 18 menit. Vision Transformer terbukti mengungguli EfficientNetB0 pada seluruh metrik, sementara EfficientNetB0 tetap relevan pada skenario dengan keterbatasan komputasi. Secara khusus, untuk menekan angka false positive pada EfficientNetB0, penelitian selanjutnya dapat menerapkan class-weighted loss atau focal loss guna meningkatkan sensitivitas model terhadap kelas fake, serta threshold tuning pada output sigmoid untuk menyeimbangkan precision dan recall.

Downloads

Download data is not yet available.

References

[1] B. Liu, B. Liu, T. Zhu, and M. Ding, “A Review of Deepfake and Its Detection: From Generative Adversarial Networks to Diffusion Models,” 2025, John Wiley and Sons Inc. doi: 10.1155/int/9987535.

[2] Dhruv Bhatada, Nimesh Gujari, Priyanka Pandey, Yashvant Chhapwale, and Dr. Yogita Shelar, “AI-Generated-Image Detection Using Deep Learning Techniques,” International Journal of Advanced Research in Science, Communication and Technology, pp. 292–302, Apr. 2025, doi: 10.48175/ijarsct-25140.

[3] S. Aribe, “A Hybrid Deep Learning and Forensic Approach for Robust Deepfake Detection,” Oct. 2025. [Online]. Available: www.ijacsa.thesai.org

[4] D. A. Ramadhan and D. Ramadhani, “Classification of Riau Batik Motifs Using the Convolutional Neural Network (CNN) Algorithm,” International Journal of Electrical, Energy and Power System Engineering, vol. 7, no. 3, pp. 201–211, Nov. 2024, doi: 10.31258/ijeepse.7.3.201-211.

[5] L. Wahyuni and D. Ramadhani, “CNN-Based Eucalyptus Disease Classification Using MobileNet,” International Journal of Electrical, Energy and Power System Engineering, vol. 8, no. 3, pp. 293–304, Oct. 2025, doi: 10.31258/ijeepse.8.3.293-304.

[6] H. A. Shah, F. Saeed, S. Yun, J. H. Park, A. Paul, and J. M. Kang, “A Robust Approach for Brain Tumor Detection in Magnetic Resonance Images Using Finetuned EfficientNet,” IEEE Access, vol. 10, pp. 65426–65438, 2022, doi: 10.1109/ACCESS.2022.3184113.

[7] R. Hernández-López, C. M. Travieso-González, and N. I. Ajali-Hernández, “Sky Image Classification Based on Transfer Learning Approaches,” Sensors, vol. 24, no. 12, Jun. 2024, doi: 10.3390/s24123726.

[8] Y. Wang, Y. Deng, Y. Zheng, P. Chattopadhyay, and L. Wang, “Vision Transformers for Image Classification: A Comparative Survey,” Jan. 01, 2025, Multidisciplinary Digital Publishing Institute (MDPI). doi: 10.3390/technologies13010032.

[9] D. A. Coccomini, R. Caldelli, F. Falchi, C. Gennaro, and G. Amato, “Cross-Forgery Analysis of Vision Transformers and CNNs for Deepfake Image Detection,” in MAD 2022 - Proceedings of the 1st International Workshop on Multimedia AI against Disinformation, Association for Computing Machinery, Inc, Jun. 2022, pp. 52–58. doi: 10.1145/3512732.3533582.

[10] J. J. Bird and A. Lotfi, “CIFAKE: Image Classification and Explainable Identification of AI-Generated Synthetic Images,” IEEE Access, vol. 12, pp. 15642–15650, 2024, doi: 10.1109/ACCESS.2024.3356122.

[11] S. Kumar, P. Asiamah, O. Jolaoso, and U. Esiowu, “Enhancing Image Classification with Augmentation: Data Augmentation Techniques for Improved Image Classification,” Feb. 2025, [Online]. Available: http://arxiv.org/abs/2502.18691

[12] K. Alomar, H. I. Aysel, and X. Cai, “Data Augmentation in Classification and Segmentation: A Survey and New Strategies,” J. Imaging, vol. 9, no. 2, Feb. 2023, doi: 10.3390/jimaging9020046.

[13] B. Ghita, I. Kuzminykh, A. Usama, T. Bakhshi, and J. Marchang, “Deepfake Image Detection using Vision Transformer Models,” IEEE, Jun. 2024. [Online]. Available: http://shura.shu.ac.uk/information.html

[14] J. Ha, A. El Azzaoui, and J. H. Park, “FL-TENB4: A Federated-Learning-Enhanced Tiny EfficientNetB4-Lite Approach for Deepfake Detection in CCTV Environments,” Sensors, vol. 25, no. 3, Feb. 2025, doi: 10.3390/s25030788.

[15] M. Sharafudeen, A. J, and V. Chandra S. S, “Leveraging Vision Attention Transformers for Detection of Artificially Synthesized Dermoscopic Lesion Deepfakes Using Derm-CGAN,” Diagnostics, vol. 13, no. 5, Mar. 2023, doi: 10.3390/diagnostics13050825.

[16] B. G. Deepa, C. K. Lokesh, D. Umamaheswari, B. Ayshwarya, P. V. Yethish, and K. P. Suhaas, “An enhanced deep learning framework for DeepFake detection using EfficientNet-B3 comparative evaluation of deep and machine learning techniques,” Discover Computing, vol. 29, no. 1, Jan. 2026, doi: 10.1007/s10791-025-09890-x.

[17] D. W. Deressa, H. Mareen, P. Lambert, S. Atnafu, Z. Akhtar, and G. Van Wallendael, “GenConViT: Deepfake Video Detection Using Generative Convolutional Vision Transformer,” Mar. 2025, [Online]. Available: http://arxiv.org/abs/2307.07036.

Published

2026/06/30

How to Cite

Fadwa, A. M., Sohibbal, M., Syaharani, R. D. ., Ramadhani, D., & Aminuddin, A. (2026). Perbandingan Kinerja Model CNN EfficientNetB0 dan Vision Transformer Untuk Klasifikasi Citra Real-Fake. Journal of System & Technology (SYSTEC), 2(1), 39-45. https://systec.ejournal.unri.ac.id/index.php/systec/article/view/48