Skip to main content
← Selected research

Research case study

Handling Class Imbalance in Random Forest

Resampling techniques for imbalanced classification.

1:100

Maximum imbalance ratio

Focus

Python · Scikit-learn

Methods

SMOTE · Classification

Repository

View source on GitHub for Handling Class Imbalance in Random Forest (opens in a new tab)

01 / Context

The research question

Standard Random Forest classifiers degrade on imbalanced datasets common in fraud detection and credit risk.

02 / Method

Research design

Systematically compared SMOTE, ADASYN, Tomek links, cost-sensitive learning, and ensemble balancing across multiple imbalance ratios.

03 / Evaluation

How it was tested

  • 5-fold stratified CV across imbalance ratios (1:10 to 1:100)
  • Metrics: F1, AUC-ROC, precision-recall AUC
  • Tested on synthetic and benchmark imbalanced-classification datasets

04 / Findings

What the work showed

The strongest cost-sensitive and resampling configuration improved minority-class F1 versus the unweighted baseline in the reported experiments.

05 / Next iteration

Where I would take it next

Extend to gradient-boosted ensembles and evaluate on real-world credit default data.