nemo-curator

Pass

Audited by Gen Agent Trust Hub on Sep 9, 2026

Risk Level: SAFEINDIRECT_PROMPT_INJECTIONCOMMAND_EXECUTIONEXTERNAL_DOWNLOADS
Full Analysis
  • [INDIRECT_PROMPT_INJECTION]: The skill processes untrusted data from web scrapes and S3 buckets for LLM training preparation.
  • Ingestion points: SKILL.md specifies reading Parquet files from common_crawl/ and s3://.
  • Boundary markers: No specific delimiters or 'ignore' instructions for the data content are mentioned.
  • Capability inventory: Performs file writing via to_parquet and executes GPU-accelerated processing.
  • Sanitization: Includes robust sanitization tools like PIIRedactor, NSFWClassifier, and QualityClassifier.
  • [COMMAND_EXECUTION]: Provides standard installation commands for the NeMo Curator package using uv pip in SKILL.md.
  • [EXTERNAL_DOWNLOADS]: Downloads pre-trained models from Hugging Face for quality classification and embedding, including models from nvidia, openai, and sentence-transformers.
Audit Metadata
Risk Level
SAFE
Analyzed
Sep 9, 2026, 07:07 PM
Security Audit — agent-trust-hub — nemo-curator