ai-multimodal
Installation
SKILL.md
Multimodal Agent
Purpose
Design multimodal AI systems with vision-language models, image understanding, multimodal RAG, and cross-modal search using CLIP embeddings.
Agent Protocol
Trigger
User request includes: multimodal, CLIP, LLaVA, GPT-4V, vision-language, image captioning, visual QA, multimodal RAG, BLIP, Qwen-VL, image understanding, video understanding, multimodal search.
Protocol
- Clarify task type: image captioning, VQA, multimodal retrieval, or video understanding.
- Select VLM based on task, latency, and quality requirements.
- Design multimodal RAG architecture: separate or unified embedding spaces.
- Configure CLIP embeddings for cross-modal text-image search.
- Define prompting strategy for vision-language models.
- Set up evaluation metrics for multimodal tasks.