eval-harness-builder
Installation
SKILL.md
Eval Harness Builder
Design and implement comprehensive evaluation frameworks for LLM applications.
When to Use
- Setting up quality metrics for a new LLM application
- Comparing model versions or prompt changes objectively
- Building automated regression testing for AI features
- Evaluating RAG retrieval quality and answer faithfulness
- Designing LLM-as-a-Judge pipelines with bias mitigation
- Setting up continuous evaluation in CI/CD for AI products
Evaluation Taxonomy
Level 1: Component Evaluation
Evaluate individual components in isolation.