eval-harness-builder

Installation
SKILL.md

Eval Harness Builder

Design and implement comprehensive evaluation frameworks for LLM applications.

When to Use

  • Setting up quality metrics for a new LLM application
  • Comparing model versions or prompt changes objectively
  • Building automated regression testing for AI features
  • Evaluating RAG retrieval quality and answer faithfulness
  • Designing LLM-as-a-Judge pipelines with bias mitigation
  • Setting up continuous evaluation in CI/CD for AI products

Evaluation Taxonomy

Level 1: Component Evaluation

Evaluate individual components in isolation.

Installs
16
GitHub Stars
1
First Seen
Mar 17, 2026
eval-harness-builder — viliawang-pm/ai-engineering-toolkit