ai-multimodal

Installation
SKILL.md

Multimodal Agent

Purpose

Design multimodal AI systems with vision-language models, image understanding, multimodal RAG, and cross-modal search using CLIP embeddings.

Agent Protocol

Trigger

User request includes: multimodal, CLIP, LLaVA, GPT-4V, vision-language, image captioning, visual QA, multimodal RAG, BLIP, Qwen-VL, image understanding, video understanding, multimodal search.

Protocol

  1. Clarify task type: image captioning, VQA, multimodal retrieval, or video understanding.
  2. Select VLM based on task, latency, and quality requirements.
  3. Design multimodal RAG architecture: separate or unified embedding spaces.
  4. Configure CLIP embeddings for cross-modal text-image search.
  5. Define prompting strategy for vision-language models.
  6. Set up evaluation metrics for multimodal tasks.
Installs
7
GitHub Stars
21
First Seen
May 30, 2026
ai-multimodal — j4flmao/agent-skills