单元 4 · 反爬与动态页面 — 预计 60 分钟

反爬对抗

📍 本课路径60 分钟 · 4 个目标
  1. 理解常见反爬机制
  2. 学会 UA 与请求头伪装
  3. 掌握延时与频率控制
  4. 了解代理与 IP 池的原理
🎯 学习节奏:① 看目标 → ② 先思考再动手 → ③ 在运行器写代码 → ④ 失败时按提示重试 → ⑤ 通过后看思路

网站不希望被爬,于是设关卡。反爬不是攻防秀,而是在合规前提下让请求像正常用户

一、常见反爬机制

机制 表现 应对
UA 检测 没 UA 直接 403 伪装浏览器 UA
频率限制 太快返回 429 time.sleep 控频
登录校验 需 Cookie 才给数据 Session 带登录态
验证码 行为异常弹验证 降速模拟真人

二、随机 UA

固定一个 UA 容易被识别。准备一组真实 UA,每次随机挑:

三、随机延时

固定延时也像机器。用随机区间更像真人:

四、代理原理(进阶)

proxies = {"http": "http://1.2.3.4:8080"}
resp = requests.get(url, proxies=proxies, timeout=5)

代理来源务必合规,免费代理常不稳定且有安全风险。

五、小结