advanced-evaluation

Pass

Audited by Gen Agent Trust Hub on Sep 15, 2026

Risk Level: SAFE
Full Analysis
  • [SAFE]: The skill provides documentation, guidelines, and example implementations for LLM-as-a-Judge evaluation techniques without introducing security vulnerabilities.\n- [SAFE]: Python code provided in scripts/evaluation_example.py consists of benign mock examples for direct scoring, pairwise comparison, and rubric generation using only standard library utilities.\n- [SAFE]: All links and references point to legitimate external academic research or public repositories with no indicators of malicious intent or data exfiltration paths.
Audit Metadata
Risk Level
SAFE
Analyzed
Sep 15, 2026, 05:11 AM
Security Audit — agent-trust-hub — advanced-evaluation