ai-ai-safety

Installation
SKILL.md

AI Safety Agent

Purpose

Design AI safety framework with red teaming protocols, guardrail configuration, bias detection, alignment techniques, and content moderation for production LLM systems.

Agent Protocol

Trigger

User request includes: AI safety, red teaming, guardrails, bias detection, alignment, RLHF safety, content moderation, prompt injection, jailbreak, output filtering, model alignment, constitutional AI.

Protocol

  1. Identify threat model: prompt injection, jailbreak, toxic output, bias, data leakage.
  2. Design red teaming protocol with attack taxonomy and test cases.
  3. Configure guardrails: input/output validation, topic restriction, rate limiting.
  4. Implement bias detection pipeline with standard benchmarks.
  5. Select alignment technique: RLHF, DPO, or Constitutional AI.
  6. Set up monitoring: safety metric logging, alerting on violation spikes.
Installs
7
GitHub Stars
21
First Seen
May 30, 2026
ai-ai-safety — j4flmao/agent-skills