什么是 Archive API?
什么是 Archive API?
Archive API 是 Bright Data 提供的一个庞大、持续扩展的缓存存储库,旨在大规模捕获和提供公共网页数据。它提供完整的网页和元数据,非常适合用于 AI 训练、机器学习和大规模数据分析。与传统网页抓取不同,Archive API 更加注重相关性、新鲜度和可用性,让你能够访问每天抓取的互联网上最重要的内容。
可用的数据量有多少?
可用的数据量有多少?
截至 2026 年 8 月,Bright Data Archive 已存储 114 PB 数据,涵盖来自约 3.8 亿个域名的约 7950 亿个页面。采集持续进行,总量每天都在增长:
这样的增长速度使 Archive 成为最大规模、最新的网页数据存储库,非常适合 AI 和数据驱动型应用。
我能多快访问这些数据?
我能多快访问这些数据?
你可以通过 Archive API 立即开始访问数据。Archive API 允许你搜索、检索和筛选 Archive 中的数据快照。
- 最近 24 小时的数据:根据快照规模,从几分钟到数小时不等
- 超过 24 小时的数据:根据快照规模,处理和交付最长需要 72 小时
Archive API 的费用是多少?
Archive API 的费用是多少?
Archive API 按数据年龄定价,以 CPM(每千个页面的费用)计费。
在运行转储之前,
GET /webarchive/search/{search_id} 会返回该搜索的 dump_cost_usd,以及将估算费用拆分为缓存页面和存档页面的 cost_breakdown 对象。我的数据可以通过哪些方式交付?
我的数据可以通过哪些方式交付?
Archive API 提供四种交付方式:
- Amazon S3 存储桶: 将数据快照直接传输到你的 S3 存储桶。
- Azure Blob Storage: 将数据快照直接传输到你的 Azure Blob 容器。
- Google Cloud Storage: 将数据快照直接传输到你的 GCS 存储桶。
- Webhook: 通过 webhook 获取,实现系统的实时集成。
我可以筛选 Archive 的数据,只获取需要的内容吗?
我可以筛选 Archive 的数据,只获取需要的内容吗?
当然可以!Archive API 支持按类别、域名、日期、语言和国家进行筛选,以确保你只获取真正需要的数据。
Bright Data 的 Archive 与 Common Crawl 有何不同?
Bright Data 的 Archive 与 Common Crawl 有何不同?
在处理大规模网页数据时,新鲜度、相关性和可访问性至关重要。Common Crawl 提供的是广泛的网页历史快照,而 Bright Data 的 Archive API 则提供实时、持续更新的数据,并支持高级筛选和交付。以下是两者的对比: