Skip to main content
使用异步 /trigger 端点可在单个任务中抓取超过 20 个 URL、运行发现型采集,或将结果投递到 webhook 或云存储。所有 Bright Data 抓取器的工作流程都相同:触发、轮询、下载,只有 dataset_id 不同。
不确定该用同步还是异步?请阅读了解同步与异步请求

先决条件

我应该使用哪个 dataset ID?

每个抓取器都有各自的 dataset_id。本页示例使用 LinkedIn 个人资料,请替换为您所抓取平台的 ID。 每个抓取器提供多个端点,例如 Amazon 的商品、评论和卖家分别拥有不同的 ID。完整列表见各平台的介绍页,也可在抓取器库中浏览全部 ID。

步骤 1:触发采集

/trigger 端点发送 POST 请求,带上您的输入 URL:
您应会收到包含 snapshot_id200 响应:
请保存该 ID,用于查询进度和下载结果。

步骤 2:监控进度

轮询快照状态直到显示 ready。根据 URL 数量,这需要 30 秒到几分钟不等。
状态值:

步骤 3:下载结果

当状态为 ready 时,下载已抓取的数据:
您已完成批量抓取任务的触发、监控和下载。

使用 webhook 跳过轮询

如果不想轮询状态,可添加 endpoint 参数以自动接收结果:
完整配置见将结果投递到 webhook 与云存储

限制与约束

限制每个输入的记录数

运行发现型采集时,您可以为每个输入设置返回结果的数量上限。请在控制面板的抓取器配置中设置。
未启用每输入限制
设置为 10 时,每个输入最多返回 10 条记录。
每输入限制设为 10

故障排除

您已超出并发请求限制。请减少并行请求数量,或将输入合并为更少、更大的批次。每个批次最多可包含 1 GB 输入数据。
请检查所有输入 URL 对所调用的抓取器是否有效。将 LinkedIn URL 发送到 Amazon 的 dataset_id 会失败。可在快照响应或 Bright Data 控制面板的日志页中查看错误详情。
部分 URL 可能单独失败,而整体任务仍然成功。请检查快照响应中的 errors 字段,并在单独的请求中重试失败的 URL。

常见问题

一次异步请求可以发送多少个 URL?

异步请求每个任务最多接受 1 GB 输入数据,相当于数万个 URL。仅当 URL 不超过 20 个且希望在同一响应中获得结果时,才使用同步端点。

每个平台都需要不同的 dataset ID 吗?

需要。dataset_id 查询参数同时决定平台和端点,例如 Amazon 商品与 Amazon 评论。上表列出了各平台的主要 ID,其余 ID 见各平台的介绍页。

快照可保留多久?

任务完成后快照可下载 30 天。如需更长的保留期,请将结果投递到 webhook 或云存储。

相关内容