byted-sol-biz-pdf-audio-player
Installation
SKILL.md
byted-sol-biz-pdf-audio-player: PDF 逐页语音讲解在线展示系统
目标
将任意一份 PDF 演示稿变成一个在线可翻页 + 同步语音讲解的 Web 页面。整套流程端到端自动化,覆盖:解析 → 讲稿 → 合成 → 上传 → 部署。
能力边界
- 输入:一份本地 PDF 文件(任意页数,建议 ≤ 50 页,控制成本与 TTS 时长)
- 输出:
- 本地产物:
output/<task_id>/{parsed.md, pages_detail.json, speech.json, manifest.json, audio/page_XXX.mp3} - 线上产物:TOS 对象(
upload/pdf-share/<share_id>/)+ vefaas 在线站点
- 本地产物:
🧭 执行交互规则(严禁跳过)
- 每完成一步必须输出进展:任何耗时步骤结束后,都要向用户报告当前阶段、已产出文件、下一步动作;长步骤内部每 30 秒左右也要输出一次进展,避免用户以为任务卡住。
- 讲稿确认是强制 Gate:Step 2 生成
speech.json后,必须先运行review_speech.py,并把脚本输出的逐页讲稿正文完整展示给用户;不允许只说“讲稿已生成,请确认”。用户没有明确回复“确认无误/继续/可以合成音频”之前,禁止进入 Step 3 TTS、上传或部署。 - 用户有修改意见时必须先整改:默认使用当前 Agent 自带模型改写
speech.json中对应页内容;再次运行review_speech.py --only <页码>输出给用户确认;循环直到用户确认无误。 - 进展输出模板:推荐使用
✅ Step X 完成:<结果文件/数量>;下一步:<动作>。失败时使用❌ Step X 失败:<错误>;建议:<修复方式>。