Perancangan Sistem Klasifikasi Cacat Produk Berbasis Vision Language Model Pada Aplikasi Web untuk Proses Quality Control Tanpa Training Dataset
Penelitian
DOI:
https://doi.org/10.31004/jerkin.v5i1.7480Keywords:
Vision Language Model; Quality Control; Klasifikasi Cacat Produk; GPT-4o Vision; Zero-Shot Learning; Aplikasi WebAbstract
Proses quality control (QC) pada industri manufaktur umumnya bergantung pada inspeksi visual manual yang rentan terhadap kelelahan dan subjektivitas manusia. Pendekatan berbasis deep learning konvensional memerlukan dataset berlabel dalam jumlah besar serta proses pelatihan model yang memakan waktu dan biaya. Penelitian ini merancang arsitektur sistem berbasis aplikasi web yang memanfaatkan Vision Language Model (VLM) siap pakai, khususnya GPT-4o Vision, untuk mengklasifikasikan cacat produk secara otomatis tanpa memerlukan proses pelatihan dataset. Metode yang digunakan adalah zero-shot visual reasoning melalui pendekatan zero-shot inference berbasis deskripsi tekstual. Sistem dirancang menggunakan three-tier architecture yang mencakup antarmuka pengguna berbasis web, lapisan logika bisnis, dan integrasi API VLM. Evaluasi kelayakan konseptual dilakukan melalui analisis komparatif, skenario use-case, dan matriks risiko sistem. Hasil perancangan menunjukkan bahwa pendekatan ini mampu mengurangi kebutuhan anotasi data, mempercepat deployment, dan menghasilkan output klasifikasi yang dapat dijelaskan. Penelitian ini memberikan kontribusi berupa blueprint perancangan sistem QC berbasis VLM sebagai acuan implementasi di lingkungan industri
References
Pham, H., & Alcock, R. (2003). Reducing Human Error in Manufacturing. Human Factors and Ergonomics in Manufacturing, 13(4), 319–335.
Kumar, S., Singh, R., & Sharma, A. (2021). Human Error in Manual Visual Inspection. International Journal of Advanced Manufacturing Technology, 114(7), 2023–2041.
Bergmann, P., et al. (2019). MVTec AD — A Comprehensive Dataset for Unsupervised Anomaly Detection. Proc. CVPR, 9592–9600.
OpenAI. (2024). GPT-4o System Card. OpenAI Technical Report. https://openai.com/research/gpt-4o-system-card
Liu, H., Li, C., Wu, Q., & Lee, Y. J. (2023). Visual Instruction Tuning. Advances in NeurIPS, 36, 34892–34916.
Brown, T. B., et al. (2020). Language Models are Few-Shot Learners. Advances in NeurIPS, 33, 1877–1901.
Jiang, X., Peng, Z., & Wang, H. (2022). Deep Learning-Based Visual Defect Detection: A Review. Journal of Manufacturing Systems, 65, 691–708.
Radford, A., et al. (2021). Learning Transferable Visual Models from Natural Language. Proc. ICML, 8748–8763.
Cao, Z., Chen, Y., & Liu, W. (2024). VLM-Inspect: Zero-Shot Industrial Defect Classification. IEEE Trans. Industrial Informatics, 20(3), 2145–2157.
Menon, S., & Vondrick, C. (2023). Visual Classification via Description from LLMs. ICLR 2023.
Hevner, A. R., et al. (2004). Design Science in IS Research. MIS Quarterly, 28(1), 75–105.
Nielsen, J. (1994). Usability Engineering. Morgan Kaufmann Publishers.
Roth, K., et al. (2022). Towards Total Recall in Industrial Anomaly Detection. Proc. CVPR, 14318–14328.
Google. (2024). Gemini 1.5 Technical Report. Google DeepMind. https://deepmind.google/technologies/gemini
Downloads
Published
How to Cite
Issue
Section
License
Copyright (c) 2026 Mohammad Zacky Valentino Putra, Imelda Regina Siswi, Sahdila Adinda Putri, Dicky Apdillah

This work is licensed under a Creative Commons Attribution-ShareAlike 4.0 International License.












