> ## Documentation Index
> Fetch the complete documentation index at: https://docs.brightdata.com/llms.txt
> Use this file to discover all available pages before exploring further.

# 道德网页抓取最佳实践

> 了解合乎道德的网络数据收集的核心原则、不合规爬取的风险，以及构建可持续数据管道的实用检查清单。

# 如何构建不会因诉讼、监管变化或IP封禁而被关闭的数据管道

随着网络爬虫诉讼的增加和AI特定监管的加速，你如何收集数据与你收集什么数据同样重要。

本指南涵盖了不合规爬虫的风险、伦理数据收集的五个核心原则，以及你今天就可以应用的实践清单。

<iframe className="w-full aspect-video rounded-xl" src="https://www.youtube.com/embed/oCwiN3pNfS4" title="Ethical web scraping best practices" frameBorder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture" allowFullScreen />

## 为什么伦理爬虫现在很重要

对网络数据的需求不断增长，尤其是在AI训练、竞争情报和实时分析中。但审查力度也在增加。

三种趋势正在汇聚：

* **监管压力在增加。** 全球政府都在起草AI特定的监管规定，其中包括数据收集要求。《欧盟AI法案》、《美国AI行动计划》和《中国全球AI倡议》都涉及数据的来源方式。
* **法律纠纷在增加。** 网站所有者和平台越来越频繁地对数据收集者提起诉讼。涉及社交媒体平台、出版商和AI公司的案件每周都占据新闻头条。
* **对数据的需求没有放缓。** 数据现在是AI三角形（计算、人才和数据）中的关键区分因素。互联网是人类迄今为止构建的最大数据集，但以负责任的方式访问它本身就是一项挑战。

如果你现在就建立伦理数据收集实践，你将在后期避免代价高昂的中断。如果你不这样做，你将面临诉讼、访问被阻止、声誉受损和数据管道被污染的风险。

## 不伦理数据收集的风险

不合规爬虫的后果分为两类。

### 法律、声誉和财务风险

* **来自网站所有者的诉讼。** 来自平台和出版商的法律诉讼正在增加。这些案件花费很大，需要数年才能解决，即使在判决前也会损害你的声誉。
* **高调媒体报道。** 你不需要法庭案件就能遭受声誉受损。关于你数据实践的负面新闻可能会迅速侵蚀客户信任，特别是在AI空间中，数据来源正处于聚光灯下。
* **供应商风险。** 如果你的数据供应商被起诉或关闭，你就会失去数据来源。更糟的是，你的AI模型或产品可能已经摄入了不伦理来源的数据，而纠正这一点的成本远高于防止它。

### 技术和运营风险

* **IP封禁和访问被阻止。** 激进或配置不当的爬虫会触发导致数据质量和可用性下降的封禁。
* **无声数据降级。** 被阻止的爬虫不总是会明显失败。它们可能返回看起来有效但数据错误的HTML，意味着你的下游系统会摄入坏数据而没有任何警报。
* **产品受损。** 如果你的产品依赖于爬虫数据，任何数据管道的中断都会直接影响你的用户。

<Warning>
  这些风险不是理论上的。数据供应商已因销售非公开数据而被起诉并被迫关闭，让他们的客户面临数据丢失和法律责任。
</Warning>

## 伦理网络爬虫的五个原则

### 1. 仅收集公开可用的数据

这是最重要的原则。公开网络数据是指无需登录即可访问的内容。如果数据需要登录、位于付费墙后或需要受限访问凭据，则不是公开数据。

这种区分在法律和实践上都很重要：

| 数据类型         | 示例              | 伦理爬虫？     |
| ------------ | --------------- | --------- |
| **公开网络数据**   | 产品列表、公开资料、已发表文章 | 是（应用其他原则） |
| **需要登录的数据**  | 私人消息、账户仪表板、限制内容 | 否         |
| **付费墙保护的数据** | 仅限订阅的文章、高级数据库   | 否         |

<Tip>
  构建你的爬虫基础设施以通过设计来区分公开和非公开数据。能够通过代码、政策或审计来证明这种区分是你能拥有的最强防御之一。
</Tip>

### 2. 仅收集你需要的数据

在开始爬虫之前，将数据收集的范围限定为特定的业务目的。这不仅是良好实践。它直接减少你的法律风险。

在任何爬虫项目前问三个问题：

* 你需要**什么**具体数据字段？
* **为什么**需要这些数据？（它解决了什么业务问题？）
* **如何**使用和存储这些数据？

宽泛、无焦点的数据收集会增加风险而不增加价值。你的爬虫越有针对性，就越容易证明和辩护。

### 3. 保护网络

当你使用自动化流程和机器人爬虫时，你的流量不应该伤害或降低目标网站的性能。机器人和人类都应该能够正常使用网站。

实际措施包括：

* **监控域响应时间。** 实时测量目标网站的响应时间，以检测你的流量是否影响性能。
* **实施速率限制。** 限制你的请求速率以避免压倒服务器。
* **尊重 `robots.txt`。** 虽然在所有司法管辖区都不具有法律约束力，但尊重 `robots.txt` 表示善意。
* **错误时退避。** 如果你开始收到429（请求过多）或503（服务不可用）响应，请立即降低你的请求速率。

<Note>
  伦理爬虫需要积极的方法。不仅要避免造成伤害。主动监控并相应调整你的行为。
</Note>

### 4. 保持详细的日志

许多代理和爬虫提供商将"无日志"宣传为一个功能。对于伦理爬虫，情况正好相反。

保持日志允许你：

* **监控**你的爬虫活动是否存在异常或政策违规
* **调查**来自网站所有者的任何问题或投诉
* **通过**合规行为的证据来防御虚假指控
* **根据**历史模式改进你的实践

如果你不想保持日志，问问自己为什么。日志是保护，不是责任。它们实现了透明度和问责制，这是监管机构和法院高度重视的两件事。

### 5. 实施治理和报告

有政策是不够的。你需要主动执行。

这意味着：

* **对不合规活动零容忍。** 定义清晰的边界并一致地执行它们。
* **内部和外部报告渠道。** 允许利益相关者（包括网站所有者）报告可疑活动。
* **第三方审计。** 独立验证确保你的政策实际上被遵循。
* **事件调查。** 在处理大规模数据收集时，问题会出现。重要的是你是否检测到它们、调查它们并修复它们。

## 监管环境

关于网络爬虫和AI数据收集的监管正在迅速演变，并因司法管辖区而异。

| 方法           | 关键框架            | 重点                              |
| ------------ | --------------- | ------------------------------- |
| **基于风险（欧盟）** | 《欧盟AI法案》、自愿行为准则 | 伦理和安全优先，对AI系统有多层合规要求            |
| **创新优先（美国）** | 《美国AI行动计划》      | 强调消除AI发展的障碍。将访问公开数据视为美国AI领导力的关键 |
| **混合**       | 《中国全球AI倡议》      | 结合创新目标与数据治理要求                   |

无论你的司法管辖区如何，有三个要点：

1. **数据收集实践受到越来越多的审查。** 监管机构正在区分数据收集和数据使用。两者都有单独的风险和要求。
2. **本地监管很重要。** 要求根据你的组织运营地、数据来源位置和用户所在地而有所不同。
3. **现有法律仍然适用。** 隐私法规、著作权法和计算机欺诈法规正在今天的爬虫案件中被应用。不要等待AI特定的立法来解决合规问题。

<Tip>
  定期与你的法律团队咨询。监管在迅速变化，六个月前可接受的东西现在可能不再可接受。持续风险管理是必需的，而不是可选的。
</Tip>

## 实践清单

使用此清单评估你自己的爬虫实践或审查数据供应商。

<AccordionGroup>
  <Accordion title="1. 了解你的数据来源">
    仅收集公开可用的数据。如果你使用数据供应商或代理提供商，请尽职调查：了解你与谁做生意，他们如何以及在哪里获取数据，以及他们是否遵循伦理实践。并非所有供应商都是平等的。
  </Accordion>

  <Accordion title="2. 保护网络">
    监控目标网站健康状况，实施速率限制，并使用响应时间跟踪来确保你的爬虫不会降低网站性能。伦理爬虫意味着在数据收集期间和之后，网站对所有访问者都正常工作。
  </Accordion>

  <Accordion title="3. 维护日志和文档">
    保持你的爬虫活动的详细记录。日志用于合规、事件调查和持续改进。如果你的实践曾被质疑，它们是你最好的防御。
  </Accordion>

  <Accordion title="4. 构建报告和治理渠道">
    为内部团队和外部利益相关者创建报告关切的机制。及时调查任何异常活动。在大规模运营中，问题会出现。你对它们的反应定义了你的伦理立场。
  </Accordion>

  <Accordion title="5. 保持对监管的关注">
    追踪你运营或获取数据的每个司法管辖区的监管发展。定期与你的法律团队咨询。加入专注于负责任数据收集的行业集团和联盟以保持信息灵通。
  </Accordion>
</AccordionGroup>

## 常见误解

**"如果数据在互联网上，就可以自由爬虫。"**
公开可访问并不意味着没有规则。隐私法、服务条款和著作权保护仍可能适用。与爬虫登录后的内容相比，公开访问显著降低了法律风险，但它并不消除所有义务。

**"验证码求解意味着你在访问受保护的数据。"**
解决验证码并不意味着你在突破隐私墙或访问受限内容。验证码是反机器人措施，而不是访问控制。法院已认可这一区分：验证码后的内容仍可以是公开可用的。

**"无日志政策保护你。"**
没有日志，你无法证明你做了什么或没做什么。如果网站所有者声称你爬虫了非公开数据或造成了服务中断，日志是你的证据。"无日志"是一项责任，而不是一个功能。

**"数据收集和数据使用具有相同的风险。"**
这些是具有不同法律和伦理考量的不同活动。你如何收集数据（爬虫实践、来源、方法）和如何使用它（训练模型、商业分析、转售）由监管机构和法院分别评估。

## FAQs

<AccordionGroup>
  <Accordion title="什么是'公开网络数据'？">
    公开网络数据是指通过网络浏览器可访问的内容，无需登录、提供凭据或绕过访问限制。产品列表、公开社交媒体资料、已发表新闻文章和政府数据库是常见示例。
  </Accordion>

  <Accordion title="网络爬虫在法律上合法吗？">
    公开数据的网络爬虫在大多数司法管辖区通常是合法的，但具体情况取决于当地法律、数据类型和使用方式。隐私法规（如GDPR）、著作权法和服务条款都可能造成限制。针对你的具体情况咨询法律顾问。
  </Accordion>

  <Accordion title="我如何评估数据供应商的伦理实践？">
    询问他们是否仅收集公开数据、如何区分公开内容与非公开内容、是否保留日志、如何处理网站所有者的投诉，以及是否接受第三方审计。无法清晰回答这些问题的供应商存在风险。
  </Accordion>

  <Accordion title="遵守 robots.txt 是否就让爬虫合乎伦理？">
    遵守 `robots.txt` 是善意的一个信号，但不是全部。合乎伦理的爬虫还要求只收集公开数据、保护网站性能、维护日志，并建立治理流程。仅仅遵守 `robots.txt` 是不够的。
  </Accordion>

  <Accordion title="如果我的数据供应商被起诉或停止运营该怎么办？">
    这就是为什么前期对供应商进行尽职调查至关重要。如果发生这种情况，请评估你已经获取的数据、是否合乎伦理来源，以及是否需要删除或替换。在数据管道中构建冗余，以便单个供应商的故障不会影响你的运营。
  </Accordion>
</AccordionGroup>

## 延伸阅读

* [负责任数据收集联盟（ARDC）](https://responsibledatacollection.org)
* [Bright Data 信任中心](https://www.bright.cn/trustcenter)
* [不被阻止的网络爬虫：12 种技术](https://www.bright.cn/blog/web-data/web-scraping-without-getting-blocked)
* [Bright Data 如何处理反爬虫阻止](/cn/concepts/how-bright-data-handles-blocking)
