agent-evaluation

Installation
SKILL.md

Agent evaluation

What to measure

Dimension Examples
Task success End state matches spec (binary or rubric)
Tool use Correct tool, valid args, no spurious calls
Safety No policy violations, no secret leakage
Efficiency Tokens, latency, tool call count
Stability Same input -> consistent outcome across runs

Workflow

Installs
3
GitHub Stars
25
First Seen
May 25, 2026
agent-evaluation — charlieviettq/awesome-agent-skill