Perancangan Sistem Klasifikasi Cacat Produk Berbasis Vision Language Model Pada Aplikasi Web untuk Proses Quality Control Tanpa Training Dataset

Penelitian

Authors

  • Mohammad Zacky Valentino Putra Universitas Asahan
  • Imelda Regina Siswi Universitas Asahan
  • Sahdila Adinda Putri Universitas Asahan
  • Dicky Apdillah Universitas Asahan

DOI:

https://doi.org/10.31004/jerkin.v5i1.7480

Keywords:

Vision Language Model; Quality Control; Klasifikasi Cacat Produk; GPT-4o Vision; Zero-Shot Learning; Aplikasi Web

Abstract

Proses quality control (QC) pada industri manufaktur umumnya bergantung pada inspeksi visual manual yang rentan terhadap kelelahan dan subjektivitas manusia. Pendekatan berbasis deep learning konvensional memerlukan dataset berlabel dalam jumlah besar serta proses pelatihan model yang memakan waktu dan biaya. Penelitian ini merancang arsitektur sistem berbasis aplikasi web yang memanfaatkan Vision Language Model (VLM) siap pakai, khususnya GPT-4o Vision, untuk mengklasifikasikan cacat produk secara otomatis tanpa memerlukan proses pelatihan dataset. Metode yang digunakan adalah zero-shot visual reasoning melalui pendekatan zero-shot inference berbasis deskripsi tekstual. Sistem dirancang menggunakan three-tier architecture yang mencakup antarmuka pengguna berbasis web, lapisan logika bisnis, dan integrasi API VLM. Evaluasi kelayakan konseptual dilakukan melalui analisis komparatif, skenario use-case, dan matriks risiko sistem. Hasil perancangan menunjukkan bahwa pendekatan ini mampu mengurangi kebutuhan anotasi data, mempercepat deployment, dan menghasilkan output klasifikasi yang dapat dijelaskan. Penelitian ini memberikan kontribusi berupa blueprint perancangan sistem QC berbasis VLM sebagai acuan implementasi di lingkungan industri

References

Pham, H., & Alcock, R. (2003). Reducing Human Error in Manufacturing. Human Factors and Ergonomics in Manufacturing, 13(4), 319–335.

Kumar, S., Singh, R., & Sharma, A. (2021). Human Error in Manual Visual Inspection. International Journal of Advanced Manufacturing Technology, 114(7), 2023–2041.

Bergmann, P., et al. (2019). MVTec AD — A Comprehensive Dataset for Unsupervised Anomaly Detection. Proc. CVPR, 9592–9600.

OpenAI. (2024). GPT-4o System Card. OpenAI Technical Report. https://openai.com/research/gpt-4o-system-card

Liu, H., Li, C., Wu, Q., & Lee, Y. J. (2023). Visual Instruction Tuning. Advances in NeurIPS, 36, 34892–34916.

Brown, T. B., et al. (2020). Language Models are Few-Shot Learners. Advances in NeurIPS, 33, 1877–1901.

Jiang, X., Peng, Z., & Wang, H. (2022). Deep Learning-Based Visual Defect Detection: A Review. Journal of Manufacturing Systems, 65, 691–708.

Radford, A., et al. (2021). Learning Transferable Visual Models from Natural Language. Proc. ICML, 8748–8763.

Cao, Z., Chen, Y., & Liu, W. (2024). VLM-Inspect: Zero-Shot Industrial Defect Classification. IEEE Trans. Industrial Informatics, 20(3), 2145–2157.

Menon, S., & Vondrick, C. (2023). Visual Classification via Description from LLMs. ICLR 2023.

Hevner, A. R., et al. (2004). Design Science in IS Research. MIS Quarterly, 28(1), 75–105.

Nielsen, J. (1994). Usability Engineering. Morgan Kaufmann Publishers.

Roth, K., et al. (2022). Towards Total Recall in Industrial Anomaly Detection. Proc. CVPR, 14318–14328.

Google. (2024). Gemini 1.5 Technical Report. Google DeepMind. https://deepmind.google/technologies/gemini

Downloads

Published

21-07-2026

How to Cite

Mohammad Zacky Valentino Putra, Imelda Regina Siswi, Sahdila Adinda Putri, & Dicky Apdillah. (2026). Perancangan Sistem Klasifikasi Cacat Produk Berbasis Vision Language Model Pada Aplikasi Web untuk Proses Quality Control Tanpa Training Dataset: Penelitian . Jurnal Pengabdian Masyarakat Dan Riset Pendidikan, 5(1), 1590–1594. https://doi.org/10.31004/jerkin.v5i1.7480

Most read articles by the same author(s)

1 2 > >>