将 Bright Data Amazon Scraper API 配置为直接交付数据到 Amazon S3 存储桶
本指南展示如何配置 Bright Data Amazon Scraper API,以在集合作业完成时将抓取的数据直接交付到您的 Amazon S3 存储桶。前置条件
- 一个 Bright Data 账户,具有有效的 API 密钥
- 一个具有 S3 存储桶的 AWS 账户
- 具有对该存储桶的写入访问权限的 IAM 凭证
- 熟悉 异步请求工作流
第 1 步:创建 S3 存储桶
如果您已有一个存储桶,请跳到第 2 步。 在 AWS S3 控制台中:- 点击创建存储桶
- 输入存储桶名称(例如,
amazon-scraper-data) - 选择您首选的 AWS 区域
- 保持默认设置并点击创建存储桶
第 2 步:设置 IAM 权限
创建一个 IAM 角色,授予 Bright Data 对您的存储桶的写入访问权限。创建策略
在 IAM 控制台中,转到策略并使用以下 JSON 创建新策略:amazon-scraper-data 替换为您实际的存储桶名称。
为 Bright Data 创建角色
- 转到角色 > 创建角色
- 选择 AWS 账户作为受信实体类型
- 输入 Bright Data 的 AWS 账户 ID:
422310177405 - 附加您上面创建的策略
- 为角色命名(例如,
BrightDataS3Delivery) - 记下角色 ARN(例如,
arn:aws:iam::123456789012:role/BrightDataS3Delivery)
第 3 步:在 Bright Data 中配置交付
- 导航到您的 scraper 配置
- 点击交付设置选项卡
- 选择 Amazon S3 作为交付目的地
- 输入您的凭证:
- 存储桶名称:您的 S3 存储桶名称
- 角色 ARN:第 2 步中的 IAM 角色 ARN
- 区域:您的 S3 存储桶区域
- 路径前缀(可选):存储桶内的文件夹路径(例如,
amazon/products/)
- 选择您首选的文件格式(JSON、NDJSON 或 CSV)
- 点击保存
第 4 步:触发集合
触发异步集合。结果自动交付到您的 S3 存储桶:第 5 步:验证交付
集合完成后,检查您的 S3 存储桶中是否有交付的文件:s_m1a2b3c4d5e6f7g8h.json)。
下载并检查它:
故障排除
文件没有出现在 S3 中?
文件没有出现在 S3 中?
- 验证 IAM 角色 ARN 和外部 ID 是否正确
- 检查存储桶策略是否允许来自 Bright Data 账户的
s3:PutObject - 确保存储桶区域与您的配置相匹配
- 在 Bright Data 仪表板的日志下查看交付状态
访问被拒绝错误?
访问被拒绝错误?
验证 IAM 角色上的信任策略包含 Bright Data 的账户(
422310177405),并且您的外部 ID 与在 账户设置中找到的 Bright Data 客户 ID 相匹配。交付的文件为空或缺少记录?
交付的文件为空或缺少记录?
在 Bright Data 仪表板中检查集合状态。如果某些 URL 失败,交付的文件仅包含成功的结果。在单独的请求中重试失败的 URL。
后续步骤
设置 webhooks
在您的 HTTP 端点接收结果。
所有交付选项
Snowflake、Azure、GCS、SFTP 等。