Skip to main content
本指南介绍如何在 Clay 工作流中调用 Bright Data Scraper API,让 Clay 按计划或按事件触发抓取,并将记录传递给团队已在使用的工具。

前置条件

  • 一个具有管理员权限的 Clay 账户。
  • 来自账户设置的 Bright Data API 密钥。
  • 要运行的爬虫的数据集 ID。可在控制面板的爬虫页面找到;亚马逊商品爬虫为 gd_l7q7dkf244hwjntr0

第 1 步:准备爬虫

  1. 在控制面板中打开爬虫,选择所需的端点。
  2. 以 JSON 或 CSV 形式加载计划发送的输入。
  3. 开启在结果中包含错误报告,这样失败的输入会被报告而不是被静默丢弃。
  4. 根据 Clay 收集数据的位置,开启将结果投递到外部存储发送到 webhook

第 2 步:在 Clay 工作流中添加请求

  1. 在 Clay 中打开工作流并选择触发方式:手动、定时,或来自已连接到 Clay 的其他服务的事件。
  2. 添加一个 HTTP 请求块。
  3. 将方法设为 POST,URL 设为触发端点:
  4. 添加标头:
  5. 将请求体设为输入。纯 JSON 数组适用于所有爬虫:
    若要在任务完成时将记录推送到某个 URL,请在查询字符串中添加 endpoint=https://your-server.com/webhook。详见如何将结果投递到 webhook 或 S3
  6. 使用 Clay 的测试工具发送测试请求。响应是一个 snapshot_id;任务完成后记录会到达投递目标。触发采集参考列出了所有查询参数。

第 3 步:在 Clay 中使用记录

  • 将记录发送到数据库、Google 表格、邮件或 Clay 连接的任何其他服务。
  • 添加条件或过滤,例如只处理价格高于某个阈值的记录。

第 4 步:安排工作流

将工作流设为按所需计划运行(每小时或每天),或保留手动触发。

相关内容

异步请求

触发端点返回什么,以及如何轮询或下载快照。

投递结果

存储目标、格式以及各自所需的 IAM 设置。