将网页保存为html格式是留存网页内容的基础操作,无论是Chrome、Edge还是Firefox等主流浏览器,都内置了对应的保存功能,操作门槛很低,不需要额外安装工具就能完成。

不同浏览器的保存操作步骤
Chrome/Edge浏览器操作
打开需要保存的网页后,点击浏览器右上角的三个点图标,在弹出的菜单中找到更多工具选项,再选择保存网页为,也可以直接使用快捷键Ctrl+S(Mac系统为Cmd+S)。在弹出的保存窗口中,选择保存路径,文件类型选择网页,单个文件(*.mhtml)或者网页,HTML(*.htm;*.html),前者会把页面所有资源整合到单个文件,后者会生成html文件和对应的资源文件夹,确认后点击保存即可。
Firefox浏览器操作
打开目标网页后,点击右上角的三条横线菜单图标,选择保存页面为,或者直接使用Ctrl+S快捷键。在保存设置中,格式选择网页,完整(*.htm;*.html)即可保存为html格式,同样可以选择保存路径后完成操作。
Safari浏览器操作
Mac系统的Safari浏览器打开网页后,点击顶部菜单栏的文件选项,选择导出为PDF旁边的存储为,在弹出的窗口中,格式选择网页归档(.webarchive)或者HTML文件,选择对应格式后保存即可。
保存后的文件结构说明
如果选择保存为网页,完整格式,会生成一个html文件和一个同名文件夹,文件夹中存放了网页的图片、CSS样式、JS脚本等资源文件,html文件通过相对路径引用这些资源,离线打开时也能正常显示页面样式和内容。如果选择单个文件格式,所有资源会被编码整合到同一个文件中,方便传输和存储,但部分复杂页面的样式可能会出现轻微偏差。
常见问题及解决方法
- 保存后打开html文件样式错乱:检查对应的资源文件夹是否和html文件在同一目录,且没有被重命名或移动,若资源路径错误,html文件无法加载对应的CSS和JS文件,就会出现样式问题。
- 动态加载的内容没有保存:部分网页的内容是通过JS动态加载的,直接保存可能无法获取动态内容,此时可以先等待页面所有内容加载完成后再执行保存操作,或者查看页面是否有打印预览功能,通过打印预览后再保存完整内容。
- 保存的文件无法打开:检查文件后缀是否为
.html或.htm,如果后缀错误,手动修改为正确的后缀即可正常打开。
代码示例:通过Python自动保存网页为html
如果需要批量保存网页,也可以通过Python的requests库实现,以下是简单的实现代码:
import requests
def save_webpage_as_html(url, save_path):
# 发送请求获取网页内容
response = requests.get(url)
# 设置编码,避免中文乱码
response.encoding = response.apparent_encoding
# 将内容写入html文件
with open(save_path, 'w', encoding='utf-8') as f:
f.write(response.text)
print(f"网页已保存到{save_path}")
# 示例调用,保存百度首页
save_webpage_as_html("https://www.ipipp.com", "baidu_homepage.html")
需要注意的是,这种自动保存方式只能获取初始加载的html内容,无法执行JS代码,因此动态加载的内容不会被保存到文件中,适合保存静态内容较多的网页。