advanced-evaluation
Pass
Audited by Gen Agent Trust Hub on Sep 15, 2026
Risk Level: SAFE
Full Analysis
- [SAFE]: The skill provides documentation, guidelines, and example implementations for LLM-as-a-Judge evaluation techniques without introducing security vulnerabilities.\n- [SAFE]: Python code provided in
scripts/evaluation_example.pyconsists of benign mock examples for direct scoring, pairwise comparison, and rubric generation using only standard library utilities.\n- [SAFE]: All links and references point to legitimate external academic research or public repositories with no indicators of malicious intent or data exfiltration paths.
Audit Metadata