Skip to main content

将 Bright Data Amazon Scraper API 配置为直接交付数据到 Amazon S3 存储桶

本指南展示如何配置 Bright Data Amazon Scraper API,以在集合作业完成时将抓取的数据直接交付到您的 Amazon S3 存储桶。

前置条件

第 1 步:创建 S3 存储桶

如果您已有一个存储桶,请跳到第 2 步。 AWS S3 控制台中:
  1. 点击创建存储桶
  2. 输入存储桶名称(例如,amazon-scraper-data
  3. 选择您首选的 AWS 区域
  4. 保持默认设置并点击创建存储桶

第 2 步:设置 IAM 权限

创建一个 IAM 角色,授予 Bright Data 对您的存储桶的写入访问权限。

创建策略

IAM 控制台中,转到策略并使用以下 JSON 创建新策略:
amazon-scraper-data 替换为您实际的存储桶名称。

为 Bright Data 创建角色

  1. 转到角色 > 创建角色
  2. 选择 AWS 账户作为受信实体类型
  3. 输入 Bright Data 的 AWS 账户 ID:422310177405
  4. 附加您上面创建的策略
  5. 为角色命名(例如,BrightDataS3Delivery
  6. 记下角色 ARN(例如,arn:aws:iam::123456789012:role/BrightDataS3Delivery
向信任策略添加外部 ID 条件:
账户设置中找到您的客户 ID。

第 3 步:在 Bright Data 中配置交付

  1. 导航到您的 scraper 配置
  2. 点击交付设置选项卡
  3. 选择 Amazon S3 作为交付目的地
  4. 输入您的凭证:
    • 存储桶名称:您的 S3 存储桶名称
    • 角色 ARN:第 2 步中的 IAM 角色 ARN
    • 区域:您的 S3 存储桶区域
    • 路径前缀(可选):存储桶内的文件夹路径(例如,amazon/products/
  5. 选择您首选的文件格式(JSON、NDJSON 或 CSV)
  6. 点击保存

第 4 步:触发集合

触发异步集合。结果自动交付到您的 S3 存储桶:

第 5 步:验证交付

集合完成后,检查您的 S3 存储桶中是否有交付的文件:
您应该看到以快照 ID 命名的文件(例如,s_m1a2b3c4d5e6f7g8h.json)。 下载并检查它:
您也可以使用 Monitor Delivery API 验证交付状态。

故障排除

  • 验证 IAM 角色 ARN 和外部 ID 是否正确
  • 检查存储桶策略是否允许来自 Bright Data 账户的 s3:PutObject
  • 确保存储桶区域与您的配置相匹配
  • 在 Bright Data 仪表板的日志下查看交付状态
验证 IAM 角色上的信任策略包含 Bright Data 的账户(422310177405),并且您的外部 ID 与在 账户设置中找到的 Bright Data 客户 ID 相匹配。
在 Bright Data 仪表板中检查集合状态。如果某些 URL 失败,交付的文件仅包含成功的结果。在单独的请求中重试失败的 URL。

后续步骤

设置 webhooks

在您的 HTTP 端点接收结果。

所有交付选项

Snowflake、Azure、GCS、SFTP 等。