Skip to main content

正在构建 AI 初创公司?

您可能符合我们的初创计划资格。获得本文所介绍基础设施的全额资助访问权限(最高价值 $20,000)。
构建一个 AI 驱动的销售研究助手,从 LinkedIn、Crunchbase 和新闻来源提取实时数据,将其存储在 MongoDB Atlas 中以进行语义搜索,并使用 HaystackBright Data 回答复杂的销售问题。
本 cookbook 将指导您构建一个完整的潜在客户智能管道 - 从抓取到 RAG 驱动的问答。

您将构建什么

一个 AI 销售研究助手,具有以下功能:
  1. 查找公司:匹配您的理想客户档案 (ICP) 标准
  2. 识别决策者:研究他们的背景
  3. 提取痛点:来自职位发布、新闻文章和公司数据
  4. 生成个性化外展:基于全面的公司智能
技术栈:
  • Bright Data:来自 45+ 数据源的网页抓取(LinkedIn、Crunchbase、新闻、招聘板块)
  • MongoDB Atlas:用于语义搜索的向量数据库 + 结构化元数���过滤
  • Haystack:用于构建 RAG 管道的开源 LLM 框架
  • Google Gemini 2.5:从原始数据生成可操作的销售智能

架构概览

Haystack 销售智能架构

组件分解

1. Bright Data 层(数据收集)
  • 抓取工具:从 45+ 来源提取结构化数据
    • linkedin_company_profile:公司规模、行业、描述、位置
    • linkedin_person_profile:决策者职位、背景、经验
    • crunchbase_company:融资轮次、投资者、员工数
  • SERP API:来自谷歌/必应的实时搜索结果
    • 公司新闻和新闻稿
    • 职位发布(痛点信号)
    • 行业趋势和提及
2. MongoDB Atlas(存储和检索)
  • 向量搜索:嵌入式公司/人员描述的语义相似性匹配
  • 元数据过滤:混合搜索,将向量与结构化过滤器相结合(行业、融资阶段、位置、公司规模、职位)
  • 文档存储:存储原始抓取数据 + 嵌入向量 + 元数据
3. Haystack 管道(编排)
  • 嵌入器:使用 Google 的 text-embedding-004 将查询和文档转换为向量表示
  • 检索器:根据语义 + 元数据匹配从 MongoDB 查找最相关的潜在客户
  • 提示构建器:使用检索到的潜在客户数据构建上下文丰富的提示
  • LLM 生成器:Gemini 2.5 Flash 综合见解并生成可操作的智能

前置要求


步骤 1:安装依赖


步骤 2:设置环境变量

获取您的 API 密钥:

Bright Data 数据集参考


步骤 3:初始化组件

列出可用数据集

MongoDB Atlas 设置

MongoDB Atlas 作为向量数据库,用于存储嵌入式潜在客户数据并启用语义搜索。 1. 创建 MongoDB Atlas 集群 遵循开始使用 Atlas 指南来:
  • 创建免费集群(M0 层足以用于测试)
  • 设置数据库访问凭证
  • 配置网络访问(允许您的 IP 或使用 0.0.0.0/0 进行测试)
  • 获取您的连接字符串
2. 创建向量搜索索引
  1. 在 Atlas UI 中转到您的集群
  2. 点击 “Search” 选项卡 → “Create Search Index”
  3. 选择 “Atlas Vector Search” → “JSON Editor”
  4. 配置:
    • 索引名称:lead_vector_index
    • 数据库:sales_intelligence
    • 集合:leads
  5. 粘贴此配置:
  1. 等待索引状态从 “Building” 变为 “Active”

初始化文档存储

初始化检索器和抓取工具


步骤 4:从多个来源抓取数据

示例 1:抓取 Crunchbase 公司数据

从 Crunchbase 提取公司智能 - 融资信息、投资者、员工数等。
预期输出:

示例 2:抓取 LinkedIn 公司数据

从 LinkedIn 提取更广泛的公司信息。

示例 3:抓取 LinkedIn 人员档案

从 LinkedIn 提取决策者档案 - 关键联系人、他们的背景和经验。
预期输出:

步骤 5:SERP API 用于市场信号

Bright Data 的 SERP API 让您通过搜索结果收集市场信号 - 招聘信号、新闻和痛点。

销售研究的 SERP 查询示例

搜索公司新闻


步骤 6:数据处理和索引管道

处理和索引抓取的数据到 MongoDB Atlas 以进行语义搜索。

辅助函数:将抓取的数据转换为 Haystack 文档

构建索引管道

创建一个 Haystack 管道,自动生成嵌入向量并写入 MongoDB Atlas。

索引示例公司

通过抓取公司并将其索引到 MongoDB Atlas 来测试完整的索引流。

步骤 7:用于销售智能的 RAG 管道

RAG 将检索(查找相关文档)与生成(LLM 综合)相结合,以根据您的索引数据回答问题。

组件

构建 RAG 管道


步骤 8:查询销售研究助手


数据模型设计

潜在客户智能数据库使用灵活的模式,可适应来自多个来源的数据,同时启用强大的混合搜索功能。 此结构支持三种搜索模式:
  1. 语义搜索:根据含义查找相似的公司/人员
    • 查询:“AI startups focused on enterprise automation”
    • 匹配:公司有相似的描述,即使措辞不同
  2. 元数据过滤:对结构化字段进行精确匹配
    • 过滤:funding_stage = "Series A" AND location = "New York, NY"
    • 返回:仅满足精确标准的公司