vision-language-models

Installation
SKILL.md

Vision Language Models ()

Integrate vision capabilities from leading multimodal models for image understanding, document analysis, and visual reasoning.

Overview

  • Image captioning and description generation
  • Visual question answering (VQA)
  • Document/chart/diagram analysis with OCR
  • Multi-image comparison and reasoning
  • Bounding box detection and region analysis
  • Video frame analysis

Model Comparison (January )

Installs
13
GitHub Stars
212
First Seen
Jan 22, 2026
vision-language-models — yonatangross/orchestkit