Fraud Detection in Indonesian Administrative Health Records Using Cluster-Based Oversampling Methods

Tegar Ganang Satrio Priambodo, Hilmi Zharfan Rachmadi, Fajra Hanifa Nuridi Radam, Laurensia Simanihuruk, Diana Purwitasari · 2025

This study aims to improve healthcare fraud detection in BPJS Kesehatan's claims verification, where mismatches between billed amounts and INACBGs rates often cause underpayment and financial strain on providers. A key challenge is class imbalance in fraud datasets, limiting conventional detection methods. While prior work used oversampling like SMOTE and ROS–which often generate noisy samples–this study introduces a cluster-based oversampling framework preserving claims data distribution. It combines six cluster-guided techniques (AgglomerativeROS, AgglomerativeSMOTE, DBSCANROS, DBSCANSMOTE, KMeansROS, KMeansSMOTE) with ensemble learning (Decision Tree, Random Forest, Balanced Random Forest, Gradient Boosting, CatBoost). The CatBoost model with KMeansROS achieved strong results (AUC-PRC: 0.93924, precision: 0.85714, recall: 0.92308), improving recall by 19.3%, benefiting fraud detection and financing sustainability.

Read the paper · More papers on PaperTik