全局选项
这些标志适用于任何命令:brightdata login
使用 Bright Data 进行身份验证。默认在浏览器中打开 OAuth。
brightdata logout
清除存储的凭证。
brightdata scrape <url>
使用 Bright Data 的 Web Unlocker 抓取任何 URL。自动处理验证码、JavaScript 渲染和反爬虫保护。
brightdata search <query>
通过 Bright Data 的 SERP API 搜索 Google、Bing 或 Yandex。Google 返回带有有机结果、广��、相关问题和相关搜索的结构化 JSON。Bing 和 Yandex 默认返回 markdown。
brightdata pipelines <type> [params...] [options]
从 40 多个平台提取结构化数据。触发异步收集作业,轮询直到结果准备就绪,然后返回数据。
支持的平台
电子商务
电子商务
专业网络
专业网络
社交媒体
社交媒体
地图、评论及其他
地图、评论及其他
brightdata scraper
从终端构建、运行和维护自定义 Bright Data Scraper Studio 爬虫。每个爬虫由一个 Collector ID(c_* 字符串)标识,该 ID 在多次运行和自我修复之间保持稳定。
brightdata scraper create <url> <description>
使用 Bright Data 的 AI Agent 根据自然语言描述构建爬虫。返回一个 Collector ID。
AI 生成通常耗时 5 到 15 分钟,复杂目标可能长达 25 分钟。
scraper create 的 JSON 输出
使用 --json、--pretty、-o 或在任何非 TTY 流中运行时,scraper create 返回信封结构而非人类可读摘要:
--legacy-output 会将信封替换为 v0.3 之前的原始 AI 进度负载。仅在将脚本迁移到信封结构期间使用。
scraper create 的并发任务上限
Bright Data AI Flow 会限制同时运行的生成任务数量。当您的账户达到上限时,API 返回 HTTP 429,CLI 会等待并重试,默认重试 4 次。每次等待时间按指数增长并带有抖动,两次尝试之间最长约 4 分钟。使用 --max-retries 调整次数,或使用 --no-retry 在首次 429 时失败。
brightdata scraper run <collector_id> [url]
在一个或多个 URL 上运行爬虫并返回数据。CLI 会先尝试实时模式,当某次运行超过实时模式的页面加载上限时,自动回退到批处理模式。
抓取单个页面时将 URL 作为参数传入;批量运行时使用
--urls 或 --input-file。使用任一批处理标志时请省略 URL 参数。
--sync 不能与 --urls 或 --input-file 同时使用。/dca/crawl 端点一次只接受一个 URL,批量运行时请去掉 --sync。brightdata scraper heal <collector_id> <prompt>
通过 AI 自我修复就地修复现有爬虫。Collector ID 不变。默认情况下,heal 会停在批准关口,返回 status: "awaiting_approval" 和 preview_result。
brightdata scraper approve <collector_id>
提交等待批准的修复,或使用 --reject 拒绝它。
修复状态
heal 与 approve 会通过以下状态报告任务进度。请轮询直到进入 done 或 error。
修复进入
done 只能说明有值返回,并不代表该值正确。在下游使用前,请对照实际页面核对修复后的字段。brightdata status <job-id>
检查异步快照作业的状态(来自 --async 抓取或管道收集)。
brightdata zones
列出并检查 Bright Data 代理区域。
brightdata budget
查看账户余额和按区域的成本/带宽。只读。
brightdata config
查看和管理 CLI 配置。
brightdata init
交互式设置向导。引导完成身份验证、区域选择和默认配置。
brightdata skill
将 Bright Data AI 代理技能安装到编码代理中(Claude Code、Cursor、Copilot 等)。
可用技能:
search、scrape、data-feeds、bright-data-mcp、bright-data-best-practices