前置条件
- 一个具有管理员权限的 Clay 账户。
- 来自账户设置的 Bright Data API 密钥。
- 要运行的爬虫的数据集 ID。可在控制面板的爬虫页面找到;亚马逊商品爬虫为
gd_l7q7dkf244hwjntr0。
第 1 步:准备爬虫
- 在控制面板中打开爬虫,选择所需的端点。
- 以 JSON 或 CSV 形式加载计划发送的输入。
- 开启在结果中包含错误报告,这样失败的输入会被报告而不是被静默丢弃。
- 根据 Clay 收集数据的位置,开启将结果投递到外部存储或发送到 webhook。
第 2 步:在 Clay 工作流中添加请求
- 在 Clay 中打开工作流并选择触发方式:手动、定时,或来自已连接到 Clay 的其他服务的事件。
- 添加一个 HTTP 请求块。
-
将方法设为
POST,URL 设为触发端点: -
添加标头:
-
将请求体设为输入。纯 JSON 数组适用于所有爬虫:
若要在任务完成时将记录推送到某个 URL,请在查询字符串中添加
endpoint=https://your-server.com/webhook。详见如何将结果投递到 webhook 或 S3。 -
使用 Clay 的测试工具发送测试请求。响应是一个
snapshot_id;任务完成后记录会到达投递目标。触发采集参考列出了所有查询参数。
第 3 步:在 Clay 中使用记录
- 将记录发送到数据库、Google 表格、邮件或 Clay 连接的任何其他服务。
- 添加条件或过滤,例如只处理价格高于某个阈值的记录。
第 4 步:安排工作流
将工作流设为按所需计划运行(每小时或每天),或保留手动触发。相关内容
异步请求
触发端点返回什么,以及如何轮询或下载快照。
投递结果
存储目标、格式以及各自所需的 IAM 设置。