思源笔记网页剪藏指南:5 步把网页完整存进本地知识库
【免费下载链接】siyuanAn open-source, privacy-first, self-hosted knowledge workspace where humans and AI agents work together 开源、隐私优先、自托管的知识工作空间,让人与智能体在此协作项目地址: https://gitcode.com/GitHub_Trending/si/siyuan
整理资料时你会发现一个尴尬的事实:同一个网页,你可能在浏览器书签、微信收藏、笔记软件里各存了一份,但三年后点开来,网页改版了、图片裂了、原文删了。思源笔记的网页剪藏功能解决的就是这件事——它能把浏览器里的网页连同排版、图片和表格一起抓下来,转成本地笔记,离线可读、可编辑、可被块引用。
它是什么:一个"抓网页、留本地"的剪藏工具
网页剪藏(Clipping)是思源笔记编辑器里的一项功能:把网页内容按块拆进笔记,而不是存一个链接。它服务的对象很简单——所有"今天看到的网页,希望三个月后还能完整打开"的人。
价值主张用一句话说清:相比浏览器书签只存一个 URL,剪藏存的是内容本身;相比直接复制粘贴丢样式,剪藏保留标题层级、列表、表格和图片,并且把图片下载到本地资源目录,断网也能看。
工作原理:先拆块,再落盘,最后建索引
把剪藏想成搬家而不是拍照:
- 抓取:浏览器扩展在网页上读取 DOM 结构(网页的骨架),而不是截图。这样标题、段落、列表这些"语义"被完整带过来。
- 拆块:内容进入思源后,按内容块(Block,思源笔记的基本存储单位,每段文字、每个表格都是一块)拆分。拆成块的好处是后面可以单独引用、移动、搜索。
- 落盘:正文写成 Markdown 格式的 .sy 文档,图片等资源下载到工作区的 assets 目录,彻底和原网站脱钩。
- 建索引:新块进入全文检索库,立刻能被搜索和块引用找到。
整个链路在本地客户端完成,网页内容不经过第三方服务器。
快速上手:5 步完成第一次剪藏
- 安装思源官方 Chrome/Edge 剪藏扩展,在思源设置里填写本机 API 地址,建立连接。
- 打开想保存的网页,点击浏览器工具栏的思源图标,选择"完整页面"。
- 确认目标笔记本和存放位置,等待 3~5 秒处理完成。
- 在思源中打开剪藏文档,检查标题层级和图片是否正常。
- 给文档加一两个标签,顺手建一个到已有笔记的块引用,剪藏内容就接入知识网络了。
深度玩法:三种模式各管一类场景
全页面模式:保存长文和文档
- 适用场景:技术文档、论文、长文章,需要完整上下文。
- 操作要点:选"完整页面"后系统自动处理。保存后在编辑器里直接删掉导航栏、广告位等无关块,块级删除比在浏览器里 Ctrl+A 复制干净得多。
选区模式:只剪需要的部分
- 适用场景:一页里只要一段结论、一张数据表、一个代码示例。
- 操作要点:选中目标文字,右键选"剪藏",保存前可补标签和备注。适合从新闻文章里只留下关键段落,避免整页噪音。
批量静默模式:收集文献不盯屏
- 适用场景:调研阶段连续收藏十几篇资料。
- 操作要点:开启"后台剪藏"后逐个点图标即可,页面处理完会通过通知提醒。全部收完再统一整理、打标签,比边剪边整理省时间。
剪藏进库的内容立刻参与全文搜索:输入关键词,结果直接定位到具体块,而不是跳回网页重新翻找。
横向对比:剪藏和传统做法差在哪
| 维度 | 浏览器复制粘贴 | 浏览器书签 | 剪藏进思源笔记 |
|---|---|---|---|
| 保存内容 | 纯文本,样式丢失 | 仅 URL | 正文+排版+图片 |
| 网页删除后 | 文本还在但断章取义 | 链接失效(404) | 本地副本照常打开 |
| 图片可用性 | 需手动另存 | 依赖原站 | 资源下载到本地 assets 目录 |
| 搜索粒度 | 依赖系统文件搜索 | 只能搜书签标题 | 块级全文检索 |
| 内容可编辑性 | 打开文本编辑器改 | 不可编辑 | 直接块级编辑、拆分、合并 |
| 与已有笔记关联 | 无 | 无 | 块引用、双向链接、SQL 查询 |
| 处理耗时 | 即时 | 即时 | 约 3~5 秒/页 |
真实案例:三类人怎么用
案例一:写技术方案的后端工程师
- 痛点:方案里要引用的 API 文档分散在十几个官网页面,链接半年后可能失效,复制出来又丢了表格格式。
- 做法:调研期用全页面模式把相关文档页剪藏进"参考"笔记本,每个文档打
#api标签,方案正文用块引用指向具体段落。 - 可验证的效果:方案评审时所有引用点开即见原文,且离线环境可用;后续官网改版不影响方案中的引用内容。
案例二:写行业分析的内容运营
- 痛点:素材散落在书签、聊天记录和浏览器历史里,找一份旧数据要翻半天。
- 做法:建"素材库"笔记本,选区模式只剪关键段落和表格,保存时统一打主题标签。
- 可验证的效果:找素材从"翻书签"变成"输关键词",块级搜索直接定位到段落,检索时间从分钟级降到秒级。
案例三:读文献的研究生
- 痛点:下载的 PDF 和网页论文各管各的,无法互相引用,复习时来回切换。
- 做法:网页论文用剪藏保存,PDF 用思源内置标注,两边通过块引用互相指向;再用数据库视图按主题归档。
- 可验证的效果:一篇论文的所有资料(网页版、PDF、自己的批注)在一条引用链上,复习不再需要重新回忆"那篇文章在哪"。
剪藏文档和手写笔记一样能进数据库(属性视图),按作者、标签、日期做卡片视图,批量管理比翻文件树直观。
进阶与集成:把剪藏接进自己的工作流
- 自定义剪藏规则:剪藏文档的模板和元数据可在 app/src/config/ 目录对应的设置项里调整,不同站点可以存不同的字段(比如论文加"作者""年份")。
- API 自动化:思源提供完整的 HTTP API,剪藏结果落库后可被外部脚本调用,实现"监控某个页面更新 → 自动拉取 → 入库"的流程。接口文档见 docs/API.zh-CN.md。
- 与数据历史联动:每次剪藏和后续编辑都会生成历史快照,误删可回滚,历史规则见 docs/WORKSPACE.zh-CN.md。
- 与块引用/图谱联动:剪藏块被引用后会自动出现在引用方文档的回链列表里,图谱视图能直接看到一篇剪藏内容被哪些笔记用到。
行动清单:今天就能做的 4 件事
- 装好剪藏扩展,用当前浏览器打开这篇页面做一次完整剪藏,验证本地落库流程。
- 建一个"剪藏收件箱"笔记本,先剪后理,避免每次剪藏都纠结归档。
- 给最近 5 篇剪藏文档补标签,再各建一个块引用指回你正在写的笔记,让新内容和旧知识产生连接。
- 用全文搜索输入一个你三个月前剪藏过的关键词,确认能秒级定位到块——这就是剪藏的价值闭环。
【免费下载链接】siyuanAn open-source, privacy-first, self-hosted knowledge workspace where humans and AI agents work together 开源、隐私优先、自托管的知识工作空间,让人与智能体在此协作项目地址: https://gitcode.com/GitHub_Trending/si/siyuan
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考