ai-evaluation

Installation
SKILL.md

AI Evaluation

Purpose: Systematically measure and validate AI/ML model quality across accuracy, safety, and reliability dimensions.


When to Use This Skill

  • Designing evaluation frameworks for LLM-based applications
  • Implementing automated evaluation pipelines (CI/CD for AI)
  • Measuring RAG pipeline quality (retrieval + generation)
  • Running benchmarks for model selection or fine-tuning validation
  • Establishing quality gates before model deployment
  • Evaluating safety, bias, and alignment properties

Prerequisites

Installs
4
Repository
jnpiyush/agentx
GitHub Stars
13
First Seen
Apr 25, 2026
ai-evaluation — jnpiyush/agentx