agent-evaluator
Installation
SKILL.md
Agent Evaluator:智能体能力自动测试与评估技能
概述
本技能系统化地自动测试与评估智能体(Agent)的综合能力。Agent 的核心公式为:Agent = LLM + 工具使用 + 记忆 + 规划与执行循环。评测从 LLM 基座能力 和 Agent 架构能力 两个层面解耦进行,最终输出综合成熟度等级与精准优化建议。
核心设计理念
- 双轨解耦:LLM 能力(大脑)与 Agent 架构能力(躯干)分开评测,精准定位瓶颈
- 六维场景:覆盖 RAG、小说创作、新媒体创作、编程、行业研究、问题解决 6 大应用场景
- EPFMS 指标:效能(Efficacy)、过程(Process)、效率(Frugality)、记忆(Memory)、安全(Safety)
- 成熟度分级:M0 玩具 → M1 助手 → M2 干将 → M3 专家,附 LLM/Agent 双轨等级
快速开始
# 运行完整评估(交互式选择场景)
python scripts/run_evaluation.py