ai-evaluation
Installation
SKILL.md
AI Evaluation
Purpose: Systematically measure and validate AI/ML model quality across accuracy, safety, and reliability dimensions.
When to Use This Skill
- Designing evaluation frameworks for LLM-based applications
- Implementing automated evaluation pipelines (CI/CD for AI)
- Measuring RAG pipeline quality (retrieval + generation)
- Running benchmarks for model selection or fine-tuning validation
- Establishing quality gates before model deployment
- Evaluating safety, bias, and alignment properties