prepare-training-corpus
Pass
Audited by Gen Agent Trust Hub on Aug 26, 2026
Risk Level: SAFE
Full Analysis
- [SAFE]: No malicious patterns or security risks were identified. The skill implements standard data science practices for ensuring corpus provenance and split validation.
- [INDIRECT_PROMPT_INJECTION]: The skill processes user-provided datasets, creating a surface for potential indirect prompt injection, though the tools are limited in capability.
- Ingestion points: The
scripts/build_corpus_manifest.pyscript reads JSONL files provided via the command line. - Boundary markers: The instructions explicitly mandate checking for prompt leakage and sensitive information within the datasets before processing.
- Capability inventory: The script performs deterministic operations including file I/O, JSON parsing, and SHA-256 hashing. It has no network access and does not use dynamic code execution functions.
- Sanitization: Content is parsed using standard JSON libraries and is utilized for metadata calculation and validation purposes only.
Audit Metadata