gemini-pdf-summary

Installation
SKILL.md

用 Gemini 多模态长上下文直接"读懂"任意 PDF,按文档类型路由到对应结构化模板输出中文 Markdown。 4 类文档(学术论文 / 产品手册 / 白皮书 / 书籍)共用同一套 SDK 调用 + Markdown 风格指纹 + 错误处理契约, 各自走一份独立模板(assets/template-{paper,manual,whitepaper,book}.md + 共享 _base.md)。 agent 可以直接调用本 skill 的脚本做单篇处理,也可以按 references/api-quickstart.md 在会话内自行调用 SDK。

依赖:Python ≥ 3.7、google-genaipip install -U google-genai)、 环境变量 GEMINI_API_KEY(在 Google AI Studio 创建)。 详细的依赖与失败排查见文末"前置条件"。

何时使用 / 不使用

使用

  • 用户给出一份本地 PDF,要按文档类型(论文 / 手册 / 白皮书 / 书)输出中文结构化总结
  • 用户要在多份 PDF 里批量过稿,每份走同一种类型
  • PDF 含大量图表 / 公式 / 版式信息,纯文本抽取(pdftotext / PyPDF2)会丢信息
  • 用户希望用 Gemini 直接读 PDF,而不是先 OCR
  • 产物最终要落到 llm-wiki-managementraw/<type>/<slug>/ 下做后续 ingest
  • 用户不确定 PDF 类型——--auto-detect 让脚本自动识别(PDF 元数据 + 首页文本 + Gemini 看首页 1-3 页验证)
Installs
7
First Seen
Jul 5, 2026
gemini-pdf-summary — yzr95924/yzr-skill