单元 5 · 规范与综合实战 — 预计 30 分钟

爬虫伦理与合规

📍 本课路径30 分钟 · 3 个目标
  1. 读懂并尊重 robots.txt
  2. 遵循合理的访问频率
  3. 了解国内数据相关法规底线
🎯 学习节奏:① 看目标 → ② 先思考再动手 → ③ 在运行器写代码 → ④ 失败时按提示重试 → ⑤ 通过后看思路

技术再溜,越过红线就是风险。这一章讲底线:什么能爬、什么不能碰。

一、robots.txt:网站的门牌告示

绝大多数站点根目录有 /robots.txt,声明哪些路径允许/禁止。Python 标准库 RobotFileParser 能程序化判断:

can_fetch 返回 True 只代表站方没禁止,不代表数据可随意使用。

二、访问频率

三、法规底线(国内)

红线 说明
个人信息 个人信息保护法:需合法基础,禁止非法收集
重要数据 数据安全法:金融地图人口等受分级保护
版权内容 受著作权保护,未经授权商用有风险
突破防护 故意绕过技术措施可能触犯刑法

四、合规清单

五、小结