skills/modelscope.cn/agent-evaluator

agent-evaluator

Installation
SKILL.md

Agent Evaluator:智能体能力自动测试与评估技能

概述

本技能系统化地自动测试与评估智能体(Agent)的综合能力。Agent 的核心公式为:Agent = LLM + 工具使用 + 记忆 + 规划与执行循环。评测从 LLM 基座能力Agent 架构能力 两个层面解耦进行,最终输出综合成熟度等级与精准优化建议。

核心设计理念

  • 双轨解耦:LLM 能力(大脑)与 Agent 架构能力(躯干)分开评测,精准定位瓶颈
  • 六维场景:覆盖 RAG、小说创作、新媒体创作、编程、行业研究、问题解决 6 大应用场景
  • EPFMS 指标:效能(Efficacy)、过程(Process)、效率(Frugality)、记忆(Memory)、安全(Safety)
  • 成熟度分级:M0 玩具 → M1 助手 → M2 干将 → M3 专家,附 LLM/Agent 双轨等级

快速开始

# 运行完整评估(交互式选择场景)
python scripts/run_evaluation.py
Installs
1
First Seen
Aug 12, 2026
agent-evaluator from modelscope.cn