ai-model-evaluation

Installation
SKILL.md

Contract

  • Input: model predictions, ground truth, subgroup labels, feature data.
  • Output: evaluation report with recommendation.
  • Side effects: none (analysis only; does not deploy).
  • Dependencies: model artifacts, test set, subgroup metadata.
  • Stop condition: report complete with subgroup analysis.
  • Risk: medium — recommendations affect deployment; requires validation.
  • Boundary: evaluates; does not deploy.

Model Evaluation

Evaluate a machine-learning or LLM model with metrics, subgroup fairness, robustness, and explainability — and recommend deployment or revision.

Process

Installs
2
First Seen
Sep 7, 2026
ai-model-evaluation — quantumquirkxyz/skills-quirk