Skip to main content

正在构建 AI 初创公司?

您可能符合我们的初创计划资格。获得本文所介绍基础设施的全额资助访问权限(最高价值 $20,000)。
将 Bright Data 与 Haystack 集成可以为您的 RAG 管道和 AI 应用程序增强可靠、可扩展的网页数据提取功能,适用于真实场景。 haystack-brightdata Python 包是 Bright Data 的官方 Haystack 集成,包括对以下功能的支持:
  • Bright Data 网页爬虫 - 从 45+ 个支持的网站提取结构化数据,包括 Amazon、LinkedIn、Instagram、Facebook、TikTok、YouTube 等,使用 Bright Data 的数据集 API。
  • Bright Data SERP - 查询搜索引擎(Google、Bing、Yahoo),支持地理定位和语言自定义,获取实时搜索结果。
  • Bright Data Unlocker - 访问地理限制和机器人保护的网站,绕过验证码和反机器人措施,以多种格式提取内容。

如何使用 Haystack 集成 Bright Data

1

获取您的 Bright Data API 密钥

2

安装 Bright Data 集成

运行以下命令安装 Bright Data 的 Haystack 集成包:
3

设置环境变量

将您的 Bright Data API 密钥设置为环境变量:
4

选择您首选的 Bright Data 组件

Bright Data + Haystack 集成目前支持:
API 参考: 爬虫文档
从 45+ 个支持的网站(包括电子商务、社交媒体和商业智能平台)提取结构化数据。

RAG 管道示例

产品数据 RAG 管道

构建一个检索增强生成 (RAG) 管道,使用 Bright Data 从 Amazon 提取产品数据并回答有关产品的问题:

SERP + 网页内容 RAG 管道

使用 SERP API 查找相关网页,然后使用 Web Unlocker 提取内容用于 RAG 管道:

支持的数据集

BrightDataWebScraper 组件支持 45+ 个数据集,涵盖多个类别:
有关每个数据集及其所需参数的详细信息:

用例

Bright Data 的 Haystack 集成支持强大的用例:
  • 电子商务智能: 价格监测、产品数据提取和竞争分析
  • 社交媒体分析: 跨平台的内容监测和参与度分析
  • 商业智能: 公司研究和竞争格局分析
  • 搜索分析: 具有地理定位搜索结果的 SEO/SEM 研究
  • 内容聚合: 使用实时网页数据构建 RAG 管道
  • 市场研究: 访问地理限制内容��行全球研究