web-scraper
Installation
SKILL.md
Web Scraper
触发条件
- 当需要从第三方公开网站获取大规模数据(如价格监控、社交媒体趋势、新闻聚合)时。
- 在没有官方 API 或官方 API 限制过多、功能不足的情况下,需要直接从 HTML 中提取结构化信息。
- 需要自动化执行网页交互任务(如自动登录、表单填写、文件下载)时。
- 建立行业数据库、训练 AI 模型或进行市场调研需要大量原始网页数据支撑时。
- 需要实时监控网页内容变化(如库存变动、价格降价提醒)并触发警报时。
核心能力
1. HTTP 请求与会话管理 (Requests & Sessions)
- 请求头 (Headers) 伪装: 模拟真实浏览器行为,随机切换 User-Agent, Referer, Accept-Language。
- Cookie 维持: 使用 Session 对象自动处理 Cookie 传递,维持登录态。
- 代理池 (Proxy Pool): 动态切换 IP 地址,防止因单一 IP 频繁访问导致的封禁。
- 重试与退避: 实现自定义 Retry 策略,处理网络波动或短暂的服务端拒绝。