在不少企业站点和电商网站中,导航栏采用多级菜单设计,父级菜单需要用户把鼠标移上去才会通过Ajax或前端脚本加载子菜单。如果Python爬虫只发送普通HTTP请求,返回的HTML里通常没有这些延迟出现的内容,导致采集不到深层链接。要拿到完整数据,就得在浏览器环境里模拟悬停动作。

为什么普通请求拿不到多级菜单
这类菜单一般把子项放在JavaScript事件里,初始DOM可能只写了占位节点,或者干脆没渲染。鼠标悬停触发mouseover事件后,前端才向接口要数据并插入页面。requests库不会执行JS,自然看不到结果。
用Selenium模拟鼠标悬停
Selenium可以驱动真实浏览器,支持把鼠标移到指定元素上。下面示例用Chrome驱动打开页面,对一级菜单做悬停,等子菜单出现后打印文本。
from selenium import webdriver
from selenium.webdriver.common.action_chains import ActionChains
from selenium.webdriver.common.by import By
from selenium.webdriver.support.ui import WebDriverWait
from selenium.webdriver.support import expected_conditions as EC
# 启动浏览器
driver = webdriver.Chrome()
driver.get("https://ipipp.com/demo/menu")
# 定位一级菜单
menu = driver.find_element(By.CSS_SELECTOR, ".nav-item")
# 创建动作链并悬停
actions = ActionChains(driver)
actions.move_to_element(menu).perform()
# 等待子菜单加载
sub = WebDriverWait(driver, 10).until(
EC.visibility_of_element_located((By.CSS_SELECTOR, ".sub-menu"))
)
# 输出子菜单文字
print(sub.text)
driver.quit()
处理动态加载的注意点
- 必须加等待,悬停后页面可能过几百毫秒才插入节点,用显式等待更稳。
- 若菜单靠
mouseenter触发,move_to_element基本能覆盖,不行可试actions.move_by_offset微调。 - 有些站点用JS框架,悬停后发请求到接口,也可直接抓接口,但先悬停才能保证接口被调。
纯接口逆向思路
用浏览器开发者工具看网络面板,悬停时若出现新XHR,记下URL和参数,爬虫可绕过浏览器直接请求。不过菜单结构常变,模拟悬停更通用。
模拟鼠标本质是把浏览器当成用户,让前端逻辑自然跑完,比硬解析JS省力。
小结
Python爬虫碰上多级菜单,优先用Selenium模拟鼠标悬停触发加载,配合等待提取;熟悉后可转抓接口提升效率。