Skip to main content
本页解答开发者关于 Bright Data Scraper API 最常问的问题,从第一个请求到快照投递和计费。

开始使用

什么是 Scraper API?

Bright Data Scraper API 通过数千个预构建爬虫按需从网站提取最新数据。您发送 URL 或搜索输入,API 返回结构化的 JSON、NDJSON 或 CSV 记录。用它自动化数据采集并对接其他系统,无需编写或维护爬虫。

如何开始?

开通 Bright Data 账户,在账户设置中创建 API 密钥,然后按照目标网站的快速开始操作。第一个请求只是一次 POST 调用。

如何进行身份验证?

在每个请求的 Authorization 标头中发送 API 密钥:

如何在不写代码的情况下测试爬虫?

控制面板中打开爬虫,输入您的输入项,选择同步或异步模式以及投递方式,然后从代码示例面板复制生成的代码。该面板中已预填数据集 ID。使用 webhook.sitePostman 这样的工具即可运行。

什么是数据集 ID,在哪里可以找到?

数据集 ID 标识一个爬虫,放在每个请求的 dataset_id 查询参数中,形如 gd_l1viktl72bvl7bjuj0。可在两处找到:
  • 在控制面板中打开爬虫时的浏览器地址栏:/cp/scrapers/gd_...
  • 爬虫”配置”标签页的代码示例面板中,已预填在 cURL 命令里。
sd_ 开头的 ID(例如 sd_m7hm4et0141r2rhojq)是快照 ID,不是数据集 ID。快照是一次请求采集到的数据。

哪些网站有爬虫?

数千个预构建爬虫覆盖 LinkedIn、Instagram、TikTok、亚马逊、Google 地图等众多网站。可在控制面板浏览完整列表;使用最多的十个平台有各自的文档。对于没有爬虫的网站,可用 Scraper Studio 构建,或咨询托管服务

采集型与发现型爬虫有什么区别?

每个爬虫接受不同的输入。分为两类:
  • **采集型(Collect)**爬虫接受 URL,提取每个 URL 背后的详情页:商品规格、价格、个人资料字段。
  • **发现型(Discover)**爬虫根据关键词、分类 URL 或位置等搜索输入查找新记录,然后采集每条结果。同一网站可以有多个发现型爬虫,每种搜索方式一个。
发现型爬虫还可以以仅发现模式运行,只返回发现阶段找到的 URL 而不访问每个页面。关闭该模式后,爬虫会继续访问找到的每个页面并提取数据。
采集型爬虫接受 URL;发现型爬虫根据搜索输入查找记录

请求与结果

控制面板中的”同步”和”异步”有什么区别?

这两个标签对应两个 API 端点: 同步请求最多等待 1 分钟。如果作业需要更长时间,响应为 HTTP 202 并带有 snapshot_id,作业转为异步继续。详见了解同步与异步请求

Scraper API 有多快?

响应时间取决于目标网站和爬虫负载,Bright Data 不公布固定数值。少量 URL 的采集型爬虫通常在 1 分钟同步窗口内返回。发现型爬虫需要访问多个页面,耗时更长,请以异步方式运行。控制面板中每个爬虫的页面会显示其平均运行时间的参考值。

支持哪些输出格式?

/scrape/trigger 端点支持 json(默认)、ndjsoncsv;通过 format 查询参数设置。投递到存储的文件还可以是 jsonl

快照为空意味着什么?

空快照没有可用记录,但通常仍包含说明原因的错误记录:无效输入、访问受限,或 404、商品已下架等失效页面。在请求中添加 include_errors=true 即可查看。

快照可保留多久?

作业完成后 30 天。可通过下载快照端点凭快照 ID 下载,或投递到存储或 webhook。

管理快照

在哪里获取快照 ID?

POST /datasets/v3/trigger 的响应会返回一个。运行超过 1 分钟的同步请求也会在其 202 响应中返回。使用获取快照可列出账户下的所有快照。

如何取消正在运行的快照?

/datasets/v3/snapshot/{snapshot_id}/cancel 发送 POST
在控制面板中,打开爬虫的日志标签页,将鼠标悬停在运行中的快照上并点击 X。已取消的快照不会投递数据,已完成采集的快照无法取消。

可以重新运行失败的快照吗?

可以,使用重新运行快照端点:

如何取回我发送的输入?

调用获取快照输入

notify URL 和 webhook 端点有什么区别?

notify URL 在作业完成时收到一条简短的状态消息:快照 ID 及其状态,不含数据。endpoint URL 在快照就绪后直接收到数据本身。用 notify 触发您自己的下载;用 endpoint 让 Bright Data 推送记录。详见如何将结果投递到 webhook 或 S3

投递快照

以下问题涉及投递快照端点 POST /datasets/v3/deliver/{snapshot_id},它将已有快照推送到存储目标。

响应中的投递任务 ID 怎么用?

响应中的 id 是投递任务 ID。轮询 GET /datasets/v3/delivery/{delivery_id},直到状态为 done

快照需要处于特定状态吗?

需要,必须为 ready。请先用 GET /datasets/v3/progress/{snapshot_id} 检查。可能的状态为 startingrunningreadyfailedcanceled。对每个目标各调用一次该端点,即可将同一快照投递到多个目标。

如何让投递文件不超过大小限制?

每个投递文件的硬性上限为 5 GB。用 batch_size 设置每个文件的记录数:用 5 GB 除以平均记录大小,从较低值开始,再根据实际收到的文件大小调整。记录约 5 KB 时,batch_size 为 1,000,000 正好触及上限,因此建议从 500,000 左右开始。该端点返回 400 最常见的原因是 batch_size 生成的文件超过 5 GB。设置 compress: true 可接收 gzip 压缩文件。

计费与套餐

有免费试用吗?

每个新 Bright Data 账户每月获得 5,000 个免费信用额度,无需信用卡。Scraper API 每条记录消耗一个信用额度,因此该额度最多覆盖 5,000 条记录。信用额度每月 1 日重置。详见免费套餐

Scraper API 如何计费?

按交付记录计费。由于输入错误导致失败的记录仍会计费,因为请求消耗了资源。截至 2026 年 9 月,按量付费为每 1,000 条记录 $1.50,Scale 套餐超出包含额度后为每 1,000 条记录 $1.30。当前费率请查看价格页面或您的账户。

如何升级套餐?

打开控制面板的账单部分并选择套餐。其他问题请联系支持团队

API 密钥过期了怎么办?

账户管理员在账户设置中创建新密钥。
账户设置中没有有效的 API 密钥,并显示创建新密钥的按钮
账户用户请向账户管理员申请新密钥。
没有 API 密钥的用户账户,只有管理员可以签发

平台限制与特定爬虫

特定爬虫或网站有限制吗?

有三个平台的限制值得在构建前了解:
  • Instagram:响应中的媒体链接在采集 24 小时后过期。请在此时间内下载所需媒体。
  • TikTok:媒体仅可通过同一会话中生成的令牌访问,因此请保存记录而非媒体 URL。
  • LinkedIn:帖子采集仅限个人资料公开显示的帖子,通常约 10 条。自 2025 年 11 月 13 日起,Position、Experience 和 Education 个人资料字段来自缓存;详见 LinkedIn Scraper API 简介

有酒店数据的爬虫吗?

有。Google Scraper API 包含 Google Hotels 爬虫,可按 URL 采集酒店列表。对于库中未覆盖的网站,可用 Scraper Studio 构建自定义爬虫。

如何抓取 Google 地图评价?

在控制面板中打开 Google 地图评价爬虫或从代码发送请求,传入地点 URL 和要获取评价的天数,然后运行并采集数据。Google Scraper API 端点页面展示了该请求。

ChatGPT 爬虫是否在启用网络搜索的情况下运行?

网络搜索默认开启。在输入中传入 web_search: false 可禁用,并读取响应中的 web_search_triggered 以确认是否执行了搜索。详见查询扩展与网络搜索控制

可以查看爬虫背后的代码吗?

不可以。预构建爬虫是封闭的,代码无法查看或修改。想了解爬虫的工作原理,可在 Scraper Studio 中新建爬虫,它提供可阅读和改编的示例模板。

选择合适的产品

哪个 Bright Data 产品能提供我需要的数据?

  • 现成数据数据集市场出售 Bright Data 已采集并定期更新的数据集。
  • 受支持网站的最新数据:Scraper API 中的预构建爬虫按需返回记录。
  • 其他网站的最新数据:在 Scraper Studio 中构建爬虫,或通过托管服务由 Bright Data 构建并运行。

Scraper API 的典型用例有哪些?

竞品基准分析、价格监控、市场调研、情感分析以及机器学习管道的训练数据,涵盖电商、金融科技和社交媒体分析。教程端到端演示了其中三个。