ai-model-evaluation
Installation
SKILL.md
Contract
- Input: model predictions, ground truth, subgroup labels, feature data.
- Output: evaluation report with recommendation.
- Side effects: none (analysis only; does not deploy).
- Dependencies: model artifacts, test set, subgroup metadata.
- Stop condition: report complete with subgroup analysis.
- Risk: medium — recommendations affect deployment; requires validation.
- Boundary: evaluates; does not deploy.
Model Evaluation
Evaluate a machine-learning or LLM model with metrics, subgroup fairness, robustness, and explainability — and recommend deployment or revision.