“`html
你有没有试过上班或上学时,想重温某个重要网页,结果对方突然改版、删除内容,甚至整个网站都消失了?这种情况在新闻、研究资料或投资信息上特别常见,尤其是现在网络内容变化迅速,单靠书签或浏览历史很难保证完整保存。ArchiveBox 就是一款开源自架工具,专门帮你自动捕捉 URL、浏览记录、书签,甚至 Pocket 或 Pinboard 收藏,将 HTML、JS、PDF、媒体文件等全部下载存档,让你随时离线查看,面向研究员、记者、历史爱好者或任何需要长期保存网络资源的用户。
导入浏览历史和书签,自动生成完整存档库
ArchiveBox 最大的方便之处,在于它支持多种输入来源,一次性处理你的浏览器历史、书签,甚至第三方服务如 Pocket 和 Pinboard。想象一下,你只需将 Chrome 或 Firefox 的历史文件导入,系统就会逐一爬取每个 URL,将网页完整快照保存,包括所有图片、视频和脚本。这个过程不仅保留原始样貌,还会生成多种格式如单页 HTML、PDF 和截图,方便日后搜索和比较。
打开 ArchiveBox 界面之后,你会看到一个干净的列表视图,每个存档项目都显示标题、日期和预览。它还内置搜索功能,让你用关键字快速过滤结果,例如输入“2023 财报”,就能即时拉出相关存档。相比传统书签工具,ArchiveBox 不仅存链接,还确保内容永远可用,即使原站已倒闭。

保存单一 URL 多个时间点快照,追踪内容变化
网络内容不是静态的,ArchiveBox 明白这一点,所以支持对同一 URL 多次存档,每次生成独立快照。你可以设置定时任务,例如每周自动重新爬取指定清单,这样就能轻松追踪网站更新,例如新闻跟进报道、价格变动或政策调整。这个功能特别适合监测竞争对手或长期研究项目,避免错过关键转变。
在实际操作上,它会为每个快照标记时间戳,并在界面显示差异预览,例如用 diff 工具突出新增或删除的部分。这种多版本管理,与 Git 版本控制类似,但专为网页设计,是自架工具中少见的贴心设计。
绕过反爬虫机制,存取私人内容和动态 JS 页面
很多网站为了防爬虫,会封锁自动工具或要求登录,ArchiveBox 提供多种 workaround,例如用无头浏览器模拟真人操作,成功率大幅提升。对于私人内容,你可以通过 VPN 或自定义 header 存取会员专区,虽然要小心安全风险,尤其是在执行 archived JS 时,可能隐藏恶意代码。
另外,它还支持自定义排除清单,避免存档敏感或无用页面。这些进阶设置,让 ArchiveBox 不仅是简单爬虫,而是专业级自架存档方案,适合需要深度控制的进阶用户。
自架部署简单,开源免费随时扩展
作为 Docker 原生工具,ArchiveBox 安装只需几个指令,即可在 Raspberry Pi 或 VPS 上运行,无需复杂配置。它用 SQLite 作为数据库,资源消耗低,适合个人或小型团队。开源性质意味着你可以随意修改代码,加入自定义 extractor 或整合其他服务,从长远来看性价比极高。
总的来说,ArchiveBox 解决了网络内容易失真的痛点,提供可靠的自控存档方案。如果你经常处理研究或收藏,值得一试。
产品名称:ArchiveBox
官方网站:https://github.com/ArchiveBox/ArchiveBox
“`

