This repository focuses on statistical techniques for handling missing values, detecting and treating outliers, and transforming data distributions to improve data quality for machine learning models.
- Identifying missing values
- Filling missing data using:
- Mean
- Median
- Mode
- Outlier detection using IQR method
- Removing outliers using boolean masking (
~) - Handling outliers across multiple numerical columns
- Capping / Winsorization (1st–99th percentile)
- Data transformation techniques:
- Log transformation
- Square root / Power transformation (Yeo-Johnson)
- Box-Cox transformation
- Scaling
- Normalizing
- pandas, numpy
- scikit-learn
- scipy
Outlier treatment and data transformation help stabilize variance, reduce skewness, and improve the performance of machine learning algorithms.
⭐ Star the repository if you find it useful!