靶向练习站
这是课程专用的「待爬取」目标网站,按难度分 5 个等级,全部部署在本站的 /practice/ 目录下。 你可以用本地 Python,也可以直接在本页下面的浏览器运行区里用 requests 抓取—— 因为同源,浏览器运行器可以直接请求这些页面。
伦理提醒:本站所有靶站均为教学用虚构数据。练习真实网站前,请务必阅读其
robots.txt,控制请求频率,遵守相关法律法规。就地练习
直接抓取 Level 1 靶站试试(同源请求,浏览器运行器即可完成)。这是挑战模式:不直接给参考代码, 先按任务尝试写,实在卡住再展开查看。
import requests
from bs4 import BeautifulSoup
url = SITE_BASE + "/practice/level1-books/"
r = requests.get(url, timeout=10)
r.encoding = "utf-8"
soup = BeautifulSoup(r.text, "html.parser")
# TODO: 把所有表格行存入 rows,后续 print 与 for 循环会取前 5 行验证
# rows = ...
print("抓到图书数:", len(rows))
for row in rows[:5]:
tds = row.select("td")
print(tds[1].get_text(), "|", tds[2].get_text(), "|", tds[5].get_text())