anthropic-evaluations
Installation
SKILL.md
Anthropic Evaluations
Build rigorous evaluations for AI agents using Anthropic's proven patterns.
Quick Reference
You MUST read the reference files for detailed guidance:
- Grader Types - Code-based, model-based, human graders
- Agent Type Patterns - Coding, conversational, research, computer use
- Roadmap - Steps 0-8 for building evals from scratch
- Frameworks - Harbor, Promptfoo, Braintrust, etc.
YAML Templates:
- coding-agent-eval.yaml - Coding agent template
- conversational-agent-eval.yaml - Support agent template