Model Prediksi Kelulusan Mahasiswa Berbasis Machine Learning dengan Seleksi Fitur
Keywords:
Prediksi Kelulusan, Machine Learning, Seleksi Fitur, Information Gain, Decision TreeAbstract
Kelulusan tepat waktu mahasiswa merupakan salah satu indikator penting dalam mengevaluasi kualitas penyelenggaraan pendidikan tinggi serta mendukung pengambilan keputusan akademik berbasis data. Penelitian ini bertujuan mengembangkan model prediksi kelulusan tepat waktu mahasiswa menggunakan algoritma Decision Tree, Random Forest, dan Naïve Bayes, serta menganalisis pengaruh seleksi fitur berbasis Information Gain terhadap performa model. Penelitian menggunakan pendekatan eksperimen komputasional dengan dataset simulasi yang terdiri atas 850 rekaman mahasiswa dan sembilan atribut akademik serta demografis. Tahapan penelitian meliputi preprocessing data, seleksi fitur menggunakan Information Gain, pemodelan machine learning, dan evaluasi menggunakan 10-fold cross-validation dengan metrik accuracy, precision, recall, dan F1-score. Hasil penelitian menunjukkan bahwa algoritma Random Forest memberikan performa terbaik dengan akurasi sebesar 89,4% sebelum seleksi fitur dan meningkat menjadi 91,2% setelah penerapan Information Gain. Seleksi fitur berhasil mereduksi atribut prediktor dari sembilan menjadi lima fitur utama, yaitu IPK, nilai rata-rata semester, jumlah SKS ditempuh, kehadiran, dan status beasiswa, sehingga meningkatkan efisiensi komputasi tanpa mengurangi kualitas prediksi. Temuan ini menunjukkan bahwa kombinasi Random Forest dan Information Gain berpotensi diterapkan sebagai bagian dari early warning system pada Sistem Informasi Akademik untuk mengidentifikasi mahasiswa yang berisiko mengalami keterlambatan kelulusan secara lebih dini dan akurat.
Downloads
References
Ahmed, E. (2024). Student performance prediction using machine learning algorithms. Applied Computational Intelligence and Soft Computing, 2024(1), 4067721. https://doi.org/10.1155/2024/4067721
Ahmed, W., Wani, M. A., Plawiak, P., et al. (2025). Machine learning-based academic performance prediction with explainability for enhanced decision-making in educational institutions. Scientific Reports, 15, 26879. https://doi.org/10.1038/s41598-025-12353-4
Aldisa, R. T., Rochim, A. F., & Triayudi, A. (2026). Student achievement prediction models: A PRISMA-based systematic literature review. Journal of Information Systems and Informatics, 8(2), 2638–2663. https://doi.org/10.63158/journalisi.v8i2.1526
Almalki, A. J. (2021). Accuracy analysis of educational data mining using feature selection algorithm. https://doi.org/10.48550/arXiv.2107.10669
Breiman, L. (2001). Random forests. Machine Learning, 45(1), 5–32.
Breiman, L., Friedman, J. H., Olshen, R. A., & Stone, C. J. (1984). Classification and regression trees. Wadsworth.
Chen, Y., Sun, J., Wang, J., Zhao, L., Song, X., & Zhai, L. (2025). Machine learning-driven student performance prediction for enhancing tiered instruction. https://doi.org/10.48550/arXiv.2502.03143
Forman, G. (2003). An extensive empirical study of feature selection metrics for text classification. Journal of Machine Learning Research, 3, 1289–1305.
Gu, H., & Zhang, Y. (2026). Efficient and interpretable machine learning for student academic outcome prediction. Mathematics, 14(4), 626. https://doi.org/10.3390/math14040626
Han, J., Kamber, M., & Pei, J. (2022). Data mining: Concepts and techniques (4th ed.). Morgan Kaufmann.
Mitchell, T. M. (1997). Machine learning. McGraw-Hill.
Mohammed, A. A. A., Kanaan, A. M. J., Meng, G. C., Elsmany, E. F., Tyng, C. M., & Ibrahim, A. O. (2025). Feature selection for student performance prediction: A review. In 2025 IEEE International Conference on Computing (ICOCO) (pp. 195–200). IEEE. https://doi.org/10.1109/ICOCO67189.2025.11334101
Pedregosa, F., Varoquaux, G., Gramfort, A., Michel, V., Thirion, B., Grisel, O., Blondel, M., et al. (2011). Scikit-learn: Machine learning in Python. Journal of Machine Learning Research, 12, 2825–2830.
Quinlan, J. R. (1986). Induction of decision trees. Machine Learning, 1(1), 81–106.
Rish, I. (2001). An empirical study of the naive Bayes classifier. In IJCAI 2001 Workshop on Empirical Methods in Artificial Intelligence (Vol. 3, pp. 41–46).
Romero, C., & Ventura, S. (2020). Educational data mining and learning analytics: An updated survey. Wiley Interdisciplinary Reviews: Data Mining and Knowledge Discovery, 10(3), e1355.
Salim, M., Al-Din, N., & Al Abdulqader, H. A. (2024). Students' academic performance prediction using educational data mining and machine learning: A systematic review. International Journal of Research and Innovation in Social Science. https://doi.org/10.47772/IJRISS
Setiadi, H., Josi, F. A. I., Winarno, Doewes, A., & Damayanti, R. W. (2025). Optimizing student performance prediction: A comparative analysis of regression algorithms and feature selection techniques on LMS log data. Vietnam Journal of Computer Science. https://doi.org/10.1142/S2196888825500265
Wang, C., & Yao, S. (2025). Enhancing student dropout and academic success prediction using machine learning and over-sampling techniques. ICCK Transactions on Educational Data Mining, 1(1), 36–43. https://doi.org/10.62762/TEDM.2025.732573
Wijayaningrum, V. N., Kirana, A. P., & Putri, I. K. (2024). Student academic performance prediction framework with feature selection and imbalanced data handling. Jurnal Ilmiah Kursor, 12(3), 123–134. https://doi.org/10.21107/kursor.v12i3.356
Downloads
Published
Data Availability Statement
Seluruh data yang mendukung hasil penelitian ini telah disertakan dalam artikel. Informasi tambahan atau dokumen pendukung terkait dapat diperoleh dari penulis
Issue
Section
License
Copyright (c) 2026 Rizal Fauzi Bakri, Vina Dewi Uswatun (Author)

This work is licensed under a Creative Commons Attribution-ShareAlike 4.0 International License.
Hak cipta artikel tetap berada pada penulis.
Seluruh artikel yang diterbitkan dalam JINTEN: Journal of Intelligent Systems and Digital Science dilisensikan di bawah Creative Commons Attribution-ShareAlike 4.0 International License (CC BY-SA 4.0).
Lisensi ini mengizinkan pengguna untuk membaca, mengunduh, menyalin, mendistribusikan, mencetak, menelusuri, menautkan, serta mengadaptasi karya untuk tujuan yang sah dengan tetap memberikan atribusi yang sesuai kepada penulis dan sumber publikasi serta mendistribusikan karya turunan dengan lisensi yang sama.
Penulis memberikan hak publikasi pertama kepada jurnal dan tetap memiliki hak cipta atas artikel yang diterbitkan. Penulis juga diperbolehkan menyimpan, membagikan, dan mengarsipkan versi artikel yang telah dipublikasikan pada repositori institusi, situs web pribadi, maupun platform ilmiah lainnya dengan tetap mencantumkan sitasi yang sesuai terhadap publikasi asli dalam jurnal ini.