网页抓取 API 常见问题
本章汇总了关于 JoyProxy 网页抓取 API(Web Scraping API)的工作机制、计费扣点逻辑、核心参数用法、并发限制及开发者常见疑问。
机制与产品定位
什么是网页抓取 API?它与传统代理有什么不同?
Web Scraping API 是专为数据采集开发者打造的全托管网页抓取接口,采用 RESTful API 设计。
- 传统代理:你拿到的是代理通道,必须自己搭建无头浏览器集群(如 Puppeteer/Playwright/Selenium)、自行破解目标站点的 JavaScript 混淆与 WAF 防护、处理请求头伪装并承受代理节点超时掉线的重试成本。
- 网页抓取 API:你只需向接口发送一条包含目标网址(URL)的 HTTP 请求,服务端的自动化调度系统会自动选取最优出口、模拟真实硬件指纹、绕过常见反爬盾、执行客户端 JS 渲染,并直接向你返回最终解析好的 HTML 内容或 JSON 数据。
为什么说这是「零风险抓取」?它的扣费机制是怎样的?
JoyProxy 坚持**仅对成功请求扣费(Only pay for successful requests)**原则:
- 只要目标页面成功返回了有效内容(HTTP 状态码为 2xx),系统才会扣除对应的服务积分(Credits)。
- 若因目标站点阻断、接口超时、反爬挑战未通过或网络闪断导致抓取失败,系统承诺绝对不扣除任何积分。
- 你购买的所有 Credits 积分永久有效、无到期时间限制,用完为止。
计费规则与 Credits 消耗标准
网页抓取 API 如何购买 Credits 积分?套餐有哪些?
登录控制台打开「网页抓取 API」页面,进入「购买(Buy)」页,可用账户余额直接结算。当前提供 8 档积分包(也可以自定义购买数量,最低 10,000 Credits 起):
- Micro:$5.00 / 10,000 Credits(折合约 $0.50 / 千次标准抓取,最大并发 5)
- Starter:$12.00 / 28,000 Credits(折合约 $0.43 / 千次标准抓取,最大并发 10)
- Hobby:$39.00 / 100,000 Credits(折合约 $0.39 / 千次标准抓取,最大并发 20)
- Growth:$99.00 / 300,000 Credits(折合约 $0.33 / 千次标准抓取,最大并发 40)
- Pro:$249.00 / 1,000,000 Credits(折合约 $0.25 / 千次标准抓取,最大并发 75)
- Business:$599.00 / 4,000,000 Credits(折合约 $0.15 / 千次标准抓取,最大并发 120)
- Scale:$1,500.00 / 15,000,000 Credits(折合约 $0.10 / 千次标准抓取,最大并发 200)
每次抓取请求消耗多少 Credits?
扣费额度取决于你在请求中启用的高级特性:
| 请求类型 | 启用参数 | 单次扣除 Credits | 说明 |
|---|---|---|---|
| 标准请求 | 默认参数(数据中心网络) | 1 Credit | 适合风控宽松的常规静态网站或开放接口 |
| JS 动态渲染 | render=true | 5 Credits | 启用服务端无头浏览器,完整执行客户端 JavaScript 脚本并等待 DOM 加载完毕 |
| 高级住宅出口 | super=true | 10 Credits | 出口自动切换至全球真实住宅宽带/移动网络,破解严格的 IP 信誉风控 |
| 住宅出口 + JS 渲染 | super=true 且 render=true | 25 Credits | 组合方案,应对全球防护最严密的大型电商、社交平台与旅行比价网站 |
官方结构化数据插件如何扣费?
针对特定主流平台,API 提供了免解析的开箱即用插件(Plugins):
- Amazon 商品详情与评论插件:仅需约 1 Credit / 次,直接返回结构化商品规格、现价与评论列表;
- Google 搜索结果 / YouTube 插件:约 10 Credits / 次,直接返回结构化 SERP 数据。
接口调用与参数说明
抓取 API 的标准请求地址与鉴权方式是什么?
JoyProxy 网页抓取 API 提供统一的托管抓取端点:
- 请求地址:
https://api.joyproxy.com/v1/fetch - 支持请求方法:
GET与POST(POST 请求建议设置Content-Type: application/json) - 鉴权方式:支持 URL Query 参数携带
?token=YOUR_TOKEN,或在请求头中携带Authorization: Bearer <YOUR_TOKEN>或X-Token: <YOUR_TOKEN>。
什么是 Scraping API Token?在哪里获取?
Scraping API Token 是专用于调用抓取接口的独立凭证,与你控制台的主用户密码、代理提取 API Token 以及 AI Token 完全隔离。 你在购买 Credits 套餐后,登录控制台进入「网页抓取 API」页面,在「API 中心」即可直接复制该 Token,也可以在凭证泄露时点击一键轮换。
常用参数有哪些?如何保持黏性会话?
在向 /v1/fetch 发送请求时,常用参数如下:
url(必填):需要抓取的目标页面完整地址。geoCode(可选):指定出境的国家二字代码(如us、gb、jp),覆盖全球 200+ 国家。render(可选):设为true开启浏览器内核渲染,等待页面 AJAX 与异步元素渲染完成。super(可选):设为true启用真实住宅 IP 出口池。sessionId(可选):用于多步骤操作的黏性会话。传入相同的字符串(例如sessionId="cart_step_1"),服务端将在数分钟内优先复用同一会话上下文与出口,便于处理登录后多页跳转或连续加购。
网页抓取支持异步队列抓取任务吗?
支持。对于大规模采集或渲染耗时较长的重型网页,抓取服务提供了异步队列接口:
POST /v1/fetch/async/jobs:提交批量抓取任务包,即时返回job_id与task_id列表;GET /v1/fetch/async/jobs/{job_id}:轮询任务进度;GET /v1/fetch/async/jobs/{job_id}/{task_id}:获取单个任务的抓取结果。
网页抓取 API 控制台包含哪些功能?
网页抓取 API 控制台(admin-web-unblocker.html)包含四大核心页签:
- 购买(流量包):订购预设 Credits 积分包或自定义积分充值;
- API 中心(在线试玩 · 测试与集成):提供在线测试工作台、Token 查看与轮换、多语言代码请求示例;
- 使用明细(余额、并发与用量查询):监控实时积分消耗量、成功率报表与请求日志;
- 文档(API 概览):查阅最新参数规范、错误代码与 OpenAPI 规范。