Klasifikasi Sentimen Publik di X Menggunakan Multinomial Naive Bayes

Yanuar Pramana Samsudin, Abdul Kudus · Bandung Conference Series Statistics · 2025

Abstract. This study aims to classify public sentiment towards an issue using the Multinomial Naive Bayes method. The data used are Indonesian-language tweets that have undergone preprocessing stages, such as case folding, punctuation removal, stopword removal, and stemming. Feature representation is performed using CountVectorizer to convert the text into numeric form. The data is then divided into training data and test data with a ratio of 80:20. To address class imbalance, the Synthetic Minority Over-sampling Technique (SMOTE) method is used. Performance evaluation is carried out by calculating accuracy, precision, recall, f1-score, and constructing a confusion matrix. The results show that the model without SMOTE produces an accuracy of 63%, with performance tending to be biased towards the majority class. After applying SMOTE, the accuracy increases to 65%, and the distribution of predictions between classes becomes more balanced. These findings indicate that Multinomial Naive Bayes is quite effective for short text classification tasks, and the application of SMOTE contributes to improving performance on imbalanced data. This research can be a basis for the development of more accurate and applicable sentiment analysis systems in the future. Abstrak. Penelitian ini bertujuan untuk mengklasifikasikan sentimen publik terhadap suatu isu menggunakan metode Multinomial Naive Bayes. Data yang digunakan berupa tweet berbahasa Indonesia yang telah melalui tahap pre-processing, seperti case folding, penghapusan tanda baca, stopwords removal, dan stemming. Representasi fitur dilakukan menggunakan CountVectorizer untuk mengubah teks menjadi bentuk numerik. Data kemudian dibagi menjadi data latih dan data uji dengan perbandingan 80:20. Untuk menangani ketidakseimbangan kelas, digunakan metode Synthetic Minority Over-sampling Technique (SMOTE). Evaluasi performa dilakukan dengan menghitung akurasi, precision, recall, f1-score, serta menyusun confusion matrix. Hasil penelitian menunjukkan bahwa model tanpa SMOTE menghasilkan akurasi sebesar 63%, dengan kinerja yang cenderung bias terhadap kelas mayoritas. Setelah penerapan SMOTE, akurasi meningkat menjadi 65%, dan distribusi prediksi antar kelas menjadi lebih seimbang. Temuan ini menunjukkan bahwa Multinomial Naive Bayes cukup efektif untuk tugas klasifikasi teks pendek, dan penerapan SMOTE berkontribusi dalam meningkatkan performa pada data tidak seimbang. Penelitian ini dapat menjadi dasar bagi pengembangan sistem analisis sentimen yang lebih akurat dan aplikatif di masa depan.

Read the paper · More papers on PaperTik