improvement-evaluator
Installation
SKILL.md
Improvement Evaluator
Measures whether a Skill actually makes AI perform better on real tasks.
When to Use
- Verify that a SKILL.md change improves AI task execution (not just document structure)
- Run a task suite against a candidate SKILL.md and compare with baseline
- Get execution_pass_rate as a concrete quality metric
- Run standalone evaluation on current SKILL.md to discover baseline failures
When NOT to Use
- 只想检查 SKILL.md 结构质量 → use
improvement-learner - 只想给候选打分 → use
improvement-discriminator - 跑全流程 → use
improvement-orchestrator