gemini-pdf-summary
Installation
SKILL.md
用 Gemini 多模态长上下文直接"读懂"任意 PDF,按文档类型路由到对应结构化模板输出中文 Markdown。
4 类文档(学术论文 / 产品手册 / 白皮书 / 书籍)共用同一套 SDK 调用 + Markdown 风格指纹 + 错误处理契约,
各自走一份独立模板(assets/template-{paper,manual,whitepaper,book}.md + 共享 _base.md)。
agent 可以直接调用本 skill 的脚本做单篇处理,也可以按 references/api-quickstart.md 在会话内自行调用 SDK。
依赖:Python ≥ 3.7、
google-genai(pip install -U google-genai)、 环境变量GEMINI_API_KEY(在 Google AI Studio 创建)。 详细的依赖与失败排查见文末"前置条件"。
何时使用 / 不使用
使用
- 用户给出一份本地 PDF,要按文档类型(论文 / 手册 / 白皮书 / 书)输出中文结构化总结
- 用户要在多份 PDF 里批量过稿,每份走同一种类型
- PDF 含大量图表 / 公式 / 版式信息,纯文本抽取(pdftotext / PyPDF2)会丢信息
- 用户希望用 Gemini 直接读 PDF,而不是先 OCR
- 产物最终要落到
llm-wiki-management的raw/<type>/<slug>/下做后续 ingest - 用户不确定 PDF 类型——
--auto-detect让脚本自动识别(PDF 元数据 + 首页文本 + Gemini 看首页 1-3 页验证)