ai-ai-cost-optimization

Installation
SKILL.md

AI Cost Optimization Agent

Purpose

Design cost optimization strategies for LLM inference: token optimization, semantic caching, inference optimization, model routing, and batching to minimize per-query cost while maintaining quality.

Agent Protocol

Trigger

User request includes: AI cost, token cost, LLM cost, prompt compression, caching for LLM, semantic cache, KV cache, quantization, model routing, cost optimization, batching, token counting, inference cost, context window.

Protocol

  1. Measure current cost profile: tokens per query, model used, daily volume.
  2. Apply token optimization: prompt compression, system prompt reduction, context window management.
  3. Configure semantic cache: embedding model, similarity threshold, TTL.
  4. Apply inference optimization: quantization, KV cache tuning, Flash Attention.
  5. Set up model routing: cheap model for simple queries, expensive for complex.
  6. Configure batching: dynamic batching, continuous batching.
  7. Implement cost monitoring and alerting on budget thresholds.
Installs
1
GitHub Stars
21
First Seen
May 30, 2026
ai-ai-cost-optimization — j4flmao/agent-skills