跳转到主要内容
该工具连接到 Bright Data,使您的代理能够爬取网站、搜索网页,并从 LinkedIn、Amazon 及社交媒体等平台访问结构化数据。 Bright Data 工具提供强大的网页抓取功能,内置 CAPTCHA 解决和反爬虫检测规避,允许您可靠地从网页提取数据。

为什么在 LlamaIndex 中使用 Bright Data?

Bright Data 工具提供以下功能:
  • scrape_as_markdown
    抓取网页并将内容转换为 Markdown 格式。该工具可以绕过 CAPTCHA 和反爬虫检测。
  • get_screenshot
    截取网页并保存到文件。
  • search_engine
    搜索 Google、Bing 或 Yandex,并以 JSON 或 Markdown 格式获取结构化搜索结果。支持高级参数以进行更具体的搜索。
  • web_data_feed
    从多个平台获取结构化数据,包括 LinkedIn、Amazon、Instagram、Facebook、X (Twitter)、Zillow 等。
Bright Data 工具为特殊用例提供多种配置选项:

搜索引擎参数

search_engine 函数支持高级参数,例如:
  • 语言定向(language 参数)
  • 国家/地区搜索(country_code 参数)
  • 不同搜索类型(图片、购物、新闻等)
  • 分页控制
  • 移动设备模拟
  • 地理位置定向
  • 酒店搜索参数

支持的网页数据源

web_data_feed 函数支持从以下平台获取结构化数据:
  • LinkedIn(个人资料和公司)
  • Amazon(产品和评价)
  • Instagram(个人资料、帖子、Reels、评论)
  • Facebook(帖子、市场列表、公司评价)
  • X/Twitter(帖子)
  • Zillow(房产列表)
  • Booking.com(酒店列表)
  • YouTube(视频)
  • ZoomInfo(公司资料)
更多信息,请访问 Bright Data 文档

如何将 Bright Data 与 LlamaIndex 集成?

1

获取 Bright Data API Key

2

安装

安装所需的包:
3

使用方法

以下示例展示如何在 LlamaIndex 中使用 BrightDataToolSpec: