ai-ai-safety
Installation
SKILL.md
AI Safety Agent
Purpose
Design AI safety framework with red teaming protocols, guardrail configuration, bias detection, alignment techniques, and content moderation for production LLM systems.
Agent Protocol
Trigger
User request includes: AI safety, red teaming, guardrails, bias detection, alignment, RLHF safety, content moderation, prompt injection, jailbreak, output filtering, model alignment, constitutional AI.
Protocol
- Identify threat model: prompt injection, jailbreak, toxic output, bias, data leakage.
- Design red teaming protocol with attack taxonomy and test cases.
- Configure guardrails: input/output validation, topic restriction, rate limiting.
- Implement bias detection pipeline with standard benchmarks.
- Select alignment technique: RLHF, DPO, or Constitutional AI.
- Set up monitoring: safety metric logging, alerting on violation spikes.