同步 /scrape | 响应等待时长 | 1 分钟 | API 返回 HTTP 202 和 snapshot_id,任务继续运行。retry-after 响应头给出轮询前应等待的时长,撰写本文时为 10 秒。详见如何处理 202 响应 |
异步 /trigger | 每个任务的输入数据 | 1 GB | 约数万个 URL。更大的输入请拆分到多个任务 |
异步 /trigger | 最少输入数 | 由各爬虫设定 | 部分爬虫需要多个输入。输入过少的请求返回 HTTP 400 Should be at least LIMIT inputs |
/trigger 和 /scrape | 运行中任务数 | 5,000 个活动任务或快照 | 新请求返回 HTTP 429 You have too many running jobs for this dataset |
/trigger 和 /scrape | 每个 IP 的 HTTP 429 响应数 | 5 分钟内 25 次 | Bright Data 会拦截该 IP 的所有 API 请求,直到支持团队解除 |
| Webhook 投递 | 负载大小 | 1 GB | 更大的结果请使用存储投递 |
| Webhook 投递 | 响应时限 | 30 秒 | Bright Data 视为投递失败并重试。请先返回 HTTP 200,再处理负载。详见如何在生产环境中处理 webhook |
| 下载快照 | 快照保留期 | 任务完成后 30 天 | 快照无法再下载。如需更长时间保留结果,请投递到存储或 webhook |
| 下载快照 | 每个请求的下载大小 | 5 GB | 使用 batch_size 和 part 分段下载快照 |
| 下载快照 | 分段下载的最小 batch_size | 1,000 条记录 | 使用 1,000 或更大的 batch_size |
| 投递快照 | 投递文件大小 | 每个文件 5 GB | HTTP 400。调低 batch_size,使每个文件小于 5 GB |
| 流式投递 | 每批行数 | 10 至 100,000 | 在此范围内设置 stream_max_lines。流式投递需要存储或 Webhook 目标 |
| Instagram | 媒体链接有效期 | 采集后 24 小时 | 记录中的媒体 URL 失效。请在 24 小时内下载媒体 |
| LinkedIn | 每个个人资料的帖子数 | 个人资料公开显示的帖子,通常约 10 条 | 不会采集更早的帖子 |