prepare-training-corpus

Pass

Audited by Gen Agent Trust Hub on Aug 26, 2026

Risk Level: SAFE
Full Analysis
  • [SAFE]: No malicious patterns or security risks were identified. The skill implements standard data science practices for ensuring corpus provenance and split validation.
  • [INDIRECT_PROMPT_INJECTION]: The skill processes user-provided datasets, creating a surface for potential indirect prompt injection, though the tools are limited in capability.
  • Ingestion points: The scripts/build_corpus_manifest.py script reads JSONL files provided via the command line.
  • Boundary markers: The instructions explicitly mandate checking for prompt leakage and sensitive information within the datasets before processing.
  • Capability inventory: The script performs deterministic operations including file I/O, JSON parsing, and SHA-256 hashing. It has no network access and does not use dynamic code execution functions.
  • Sanitization: Content is parsed using standard JSON libraries and is utilized for metadata calculation and validation purposes only.
Audit Metadata
Risk Level
SAFE
Analyzed
Aug 26, 2026, 03:59 AM
Security Audit — agent-trust-hub — prepare-training-corpus