scanned-pdf-to-epub
Installation
SKILL.md
PDF → EPUB(扫描书转换工作流)
何时使用
- 输入是一本 PDF 书籍,内页全是扫描图片、没有文字层(用 PyMuPDF 提取不出文本,或全是空白)。
- 目标产物是一本干净、带完整导航目录、目录可点击跳转的 EPUB。
- 中间产物可以是 Markdown。
- 本 skill 面向通用流程:任何页数的纯文字中文书籍,不针对某一本书特化。
本 skill 不适用于:有文字层的数字原生 PDF(直接用提取工具即可);漫画书(图为主,本流程去除插图)。
核心原则:职责边界
| 环节 | 承担方 | 理由 |
|---|---|---|
| 拆页渲染、标记检查、批次合并、分章、打包、校验 | CLI 脚本(scripts/) |
确定性、可复现、可重跑 |
| 识图、错别字校对、版权页判定、锚点转标题 | Agent(Claude 子代理 / 主代理) | 需要视觉与语义判断,不写脚本 |
| 全流程编排与规范 | SKILL.md | 承载流程与严谨规则 |