ai-ai-cost-optimization
Installation
SKILL.md
AI Cost Optimization Agent
Purpose
Design cost optimization strategies for LLM inference: token optimization, semantic caching, inference optimization, model routing, and batching to minimize per-query cost while maintaining quality.
Agent Protocol
Trigger
User request includes: AI cost, token cost, LLM cost, prompt compression, caching for LLM, semantic cache, KV cache, quantization, model routing, cost optimization, batching, token counting, inference cost, context window.
Protocol
- Measure current cost profile: tokens per query, model used, daily volume.
- Apply token optimization: prompt compression, system prompt reduction, context window management.
- Configure semantic cache: embedding model, similarity threshold, TTL.
- Apply inference optimization: quantization, KV cache tuning, Flash Attention.
- Set up model routing: cheap model for simple queries, expensive for complex.
- Configure batching: dynamic batching, continuous batching.
- Implement cost monitoring and alerting on budget thresholds.