Research case study
Handling Class Imbalance in Random Forest
Resampling techniques for imbalanced classification.
1:100
Maximum imbalance ratio
Focus
Python · Scikit-learn
Methods
SMOTE · Classification
01 / Context
The research question
Standard Random Forest classifiers degrade on imbalanced datasets common in fraud detection and credit risk.
02 / Method
Research design
Systematically compared SMOTE, ADASYN, Tomek links, cost-sensitive learning, and ensemble balancing across multiple imbalance ratios.
03 / Evaluation
How it was tested
- 5-fold stratified CV across imbalance ratios (1:10 to 1:100)
- Metrics: F1, AUC-ROC, precision-recall AUC
- Tested on synthetic and benchmark imbalanced-classification datasets
04 / Findings
What the work showed
The strongest cost-sensitive and resampling configuration improved minority-class F1 versus the unweighted baseline in the reported experiments.
05 / Next iteration
Where I would take it next
Extend to gradient-boosted ensembles and evaluate on real-world credit default data.