HTTrack 网站镜像完整指南:三步离线保存任意网站,从零到精通
HTTrack 网站镜像完整指南:三步离线保存任意网站,从零到精通
【免费下载链接】httrackHTTrack Website Copier, copy websites to your computer (Official repository)项目地址: https://gitcode.com/gh_mirrors/ht/httrack
你在深夜赶一份离线参考文档,翻遍整个浏览器缓存却只找到零散的图片——这种场景,是不是很眼熟?更常见的是:即将出差、断网在即,却想把整个技术文档站、产品官网甚至整本在线教程装进笔记本里随身带走。
HTTrack Website Copier(HTTrack 网站镜像工具)就是为这个问题而生的免费开源软件。它会把目标网站完整"搬"到你的电脑上——HTML 页面、CSS 样式、图片、脚本全部保留,连目录结构和相对链接都被原样重建。本地双击打开首页,点哪都能跳,跟在线的体验几乎一模一样。更关键的是,它完全免费、跨平台支持 Windows / Linux / macOS,且源码完全开放。
HTTrack 会实时展示每个文件的接收进度、传输速率和连接状态
一、离线场景下,HTTrack 比"另存网页"强在哪
很多人习惯用浏览器"另存为"保存网页,但这种方式有三个硬伤:只保存当前这一页、图片脚本常常丢、链接全部失效。HTTrack 解决了这三个痛点:
| 对比项 | 浏览器"另存为" | HTTrack 网站镜像 |
|---|---|---|
| 覆盖范围 | 单页 | 整站(递归抓取全部链接) |
| 资源文件 | 经常遗漏 | 图片 / CSS / JS 一并保存 |
| 链接结构 | 全部指向在线地址 | 重建为本地相对链接 |
| 断点续传 | 无 | 支持,中断后继续 |
| 增量更新 | 无 | 只下载新增/变更内容 |
| 多站点合并 | 无 | 支持多个站点共享链接 |
再叠加三个让它成为"杀手级"工具的能力:
- 智能增量更新:定期备份网站时,只需下载有变化的文件,节省带宽与时间。
- 精细过滤规则:可以用
+/-规则精确控制"要什么、不要什么"。 - 完全命令行化:支持脚本化、定时任务自动化,这是 GUI 工具做不到的。
一句话要点:HTTrack 的定位是"整站离线备份方案",而不是单页抓取工具,这正是它 20 多年来持续活跃的原因。
二、安装:三条路选一条,五分钟跑通
方式一:发行版软件源(最快)
# Ubuntu / Debian sudo apt install httrack # Fedora sudo dnf install httrack # macOS(Homebrew) brew install httrack方式二:源码编译(想尝鲜最新特性)
git clone https://gitcode.com/gh_mirrors/ht/httrack cd httrack ./configure --prefix=$HOME/usr make -j8 make install方式三:使用自带 GUI 版 WebHTTrack
某些发行版会把图形界面拆成单独包,比如 Debian 系的webhttrack。装上后从应用菜单启动即可,界面操作适合新手。
| 安装方式 | 适合人群 | 耗时 | 难度 |
|---|---|---|---|
| 软件源 | 绝大多数用户 | 1 分钟 | 无 |
| 源码编译 | 开发者、追新党 | 5-10 分钟 | 中 |
| 图形界面 | 不爱敲命令的用户 | 1 分钟 | 无 |
要点:日常使用首选软件源安装;想研究代码、跑最新版再考虑源码编译。
三、第一次镜像:图形界面的三步走
图形界面 WebHTTrack 的核心流程可以压缩成三步:
第 1 步:填写项目信息与目标网址
启动后填上项目名、保存路径和目标 URL,认证字段留空即可,点击确认进入选项页。
填写项目名称、存储路径与目标网站地址,即可开始镜像*
第 2 步:调整关键选项(默认值其实已经很聪明)
点击"Set options"打开选项卡。对新手来说,只需关注三个位置:
- Limits(限制):设置最大深度、最大下载量、限速,防止镜像失控。
- Spider(蜘蛛):控制 Cookie、robots.txt 遵守程度与 URL 规整策略。
- Links(链接):决定是否抓取链接旁的非 HTML 文件(如压缩包、图片)。
Limits 选项卡可精确控制镜像深度、文件大小与传输速率
第 3 步:启动并等待完成
确认后任务开始,界面会滚动显示每个文件的请求与接收状态,底部可随时中止。
实时统计已保存字节、传输速率、扫描链接数与错误数
完成后点击"Browse Mirrored Website"即可在浏览器中离线浏览整站。
镜像完成后可直接浏览本地网站或查看日志确认完整性
要点:GUI 的默认设置足够完成 80% 的镜像任务,选项页只在需要精调时才动。
四、命令行进阶:把镜像变成一条命令
4.1 最常用的四条命令
# 基本镜像:保存到指定目录 httrack https://example.com -O /home/you/mirrors # 限制深度并静默运行 httrack https://example.com -O /home/you/mirrors -r3 -%v # 增量更新:只下载新增与变更文件 httrack https://example.com -O /home/you/mirrors -%v --update # 断点续传:中断后接着抓 httrack -i -O /home/you/mirrors4.2 过滤规则:精确控制抓什么
# 只要 HTML 与 CSS,跳过图片与视频 httrack https://example.com -O ./m -+*.html -+*.htm -+*.css -*.jpg -*.png -*.mp4 # 只允许 example.com 域内资源 httrack https://example.com -O ./m +*.example.com/* -*要点:
+规则表示"允许下载",-规则表示"拒绝下载",二者可自由组合。
4.3 常用参数速查表
| 参数 | 作用 | 示例 |
|---|---|---|
-O | 指定镜像保存路径 | -O ./backup |
-rN | 链接抓取深度 | -r2表示跟踪两层链接 |
-cN | 并发连接数 | -c8同时 8 个连接 |
-mN | 单个非 HTML 文件大小上限 | -m2000000 |
-MN | 整站下载总量上限 | -M500000000 |
-EN | 最大耗时(秒) | -E3600一小时 |
-AN | 限速(字节/秒) | -A100000约 100KB/s |
-%v | 实时显示下载文件名 | 默认建议开启 |
-sN | 遵守 robots.txt 的程度 | -s2完全遵守 |
--update | 增量更新已有镜像 | 配合-O使用 |
--spider | 只扫描链接不保存内容 | 检查死链用 |
要点:
-O指定目录、--update增量、-rN控制深度,这三板斧覆盖了 90% 的需求。
五、避坑指南:镜像失败最常见的五个原因
坑 1:只抓到首页,点进去全是空的多半是深度限制太死。把-r调大,或用-r9999(默认值)表示不限制深度。
坑 2:下载一半就停了网络抖动导致连接被重置。用-TN调大超时时间、-RN增加重试次数,再用--update续传。
坑 3:抓下来一堆无关的外部链接内容忘了限定域名范围。用+*.example.com/*规则把范围锁死,外部资源一律跳过。
坑 4:登录后才能看的页面抓不下来先手动导出浏览器的 Cookie 文件,再用-%K cookies.txt导入,配合-F "你的User-Agent"伪装浏览器标识。
坑 5:镜像占满硬盘用-mN限制单文件大小、-MN限制总量、-A*限速,三个参数三保险。
要点:绝大多数镜像失败都可以归结为"深度不够、范围失控、连接中断",对应参数逐一排查即可。
六、实战场景:六种典型玩法
场景 1:离线技术文档库
httrack https://docs.python.org/3/ -O ~/docs/python -r5 -%v把常用文档镜像到本地,飞机上、地铁里随时查阅。
场景 2:网站定期备份归档
0 2 * * 0 httrack https://important-site.com -O /backups/site -%v --update -X每周日凌晨两点自动增量更新,-X同时清理镜像中已消失的旧文件。
场景 3:研究资料批量下载
httrack https://research-hub.example -O ~/research -r2 -%v -*.pdf只抓页面骨架、跳过 PDF 原文,先看目录再决定下载哪些论文。
场景 4:把多个相关站点合并镜像
httrack https://site-a.com https://site-b.com -O ./docs -%v +*.site-a.com/* +*.site-b.com/*两个站共享链接时也能在一个项目里保持结构完整。
场景 5:镜像到可搜索索引
httrack https://example.com -O ./m -%v -%I-%I生成可搜索索引,离线也能全文检索镜像内容。
场景 6:抓成 WARC 存档
httrack https://example.com -O ./m -%v -%r-%r输出符合 ISO-28500 标准的 WARC/1.1 归档,适合做长期数字存档。
要点:先明确"我要拿镜像干什么",再选命令——查文档选深度、做备份选增量、做存档选 WARC。
七、三句话总结
- HTTrack 是一个免费开源的整站离线镜像工具,跨平台、可 GUI 可命令行,能把任意网站连同资源与链接结构完整保存到本地。
- 入门只记三板斧:
-O指定目录、--update增量更新、-rN控制深度,配合过滤规则即可应对绝大多数场景。 - 用好它要守两条底线:遵守目标网站的 robots.txt 与版权条款,只镜像允许公开访问的内容;镜像完成后记得用日志确认无缺失、无报错。
无论你是想给技术文档建个离线副本,还是为公司站点做定期备份,HTTrack 都能让你在断网时照样"云游四海"。现在就去把第一份网站镜像跑起来吧。🚀
使用提醒:请在下载前阅读目标网站的 robots.txt 与使用条款,尊重内容版权,不要镜像任何需要授权访问或禁止抓取的站点。
【免费下载链接】httrackHTTrack Website Copier, copy websites to your computer (Official repository)项目地址: https://gitcode.com/gh_mirrors/ht/httrack
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
