dataset-profiling
Installation
SKILL.md
You have deep expertise in dataset profiling and data quality assessment. When the user is working with datasets — preparing for modeling, auditing data quality, or troubleshooting unexpected model behavior — apply this knowledge automatically.
Core competencies
Missing-value analysis:
- Distinguish MCAR (missing completely at random), MAR (missing at random), and MNAR (missing not at random) — each requires a different imputation strategy
- Visualize missingness patterns (heatmap, dendrogram) before choosing handling
- For MNAR, missingness itself is a feature — encode an indicator column
Outlier detection:
- IQR rule for univariate continuous, z-score for normally distributed columns
- Isolation Forest or DBSCAN for multivariate outliers
- Always distinguish data-entry errors (drop) from legitimate extreme values (keep, but consider robust models or transformation)
Class imbalance:
- Below 10% positive class, flag accuracy as misleading; recommend ROC-AUC, PR-AUC, F1
- Below 1%, recommend resampling techniques (SMOTE, undersampling) or anomaly-detection framing
- Stratified splits are mandatory for imbalanced data