image-text-extractor
Installation
SKILL.md
图片文字提取器
任务目标
- 本 Skill 用于:批量处理用户上传的图片,识别并提取每张图片中的文字内容
- 能力包含:图片OCR识别、文字内容整理、分段输出、文档生成
- 触发条件:用户上传一张或多张图片,并要求提取文字、识别内容、转为文档
操作步骤
步骤1:接收图片
- 引导用户上传图片(支持批量上传)
- 接受的图片格式:PNG、JPG、JPEG、GIF、WebP等常见格式
- 确认图片数量和顺序
步骤2:识别文字内容
- 对每张图片调用
read_image工具进行文字识别 - 识别参数设置:
prompt: "提取图片中的所有文字内容,保持原有的段落和格式"
- 按图片上传顺序依次处理