agent-evaluation
Installation
SKILL.md
Agent evaluation
What to measure
| Dimension | Examples |
|---|---|
| Task success | End state matches spec (binary or rubric) |
| Tool use | Correct tool, valid args, no spurious calls |
| Safety | No policy violations, no secret leakage |
| Efficiency | Tokens, latency, tool call count |
| Stability | Same input -> consistent outcome across runs |