scrapling
Installation
SKILL.md
Scrapling — 自适应网页抓取框架
Scrapling 是 Google Chrome DevTools 生态之外最强大的 Python 网页抓取框架之一,能够处理从单次 HTTP 请求到大规模并发爬取的所有场景。它的自适应解析引擎在网页改版后自动重新定位元素,内置 Cloudflare Turnstile 绕过能力,Spider 框架支持暂停/恢复,并提供 MCP 服务器让 AI 直接辅助数据提取,从源头减少 Token 消耗。
核心使用场景
- 反爬虫网站抓取:
StealthyFetcher内置 Cloudflare Turnstile 绕过,支持 TLS 指纹伪装和浏览器自动化 - 自适应数据采集:网页改版后,
auto_save=True保存元素快照,adaptive=True自动重新定位变化元素 - 大规模并发爬取:Spider 框架支持多 Session、代理轮换、暂停恢复,像 Scrapy 一样定义爬虫
- AI 辅助提取:内置 MCP 服务器,Claude/Cursor 等 AI 工具可直接调用 Scrapling 提取目标内容
- 动态页面处理:
DynamicFetcher基于 Playwright,支持完整浏览器自动化和网络空闲等待