news 2026/9/2 17:12:26

(论文速读)Noise2Void:只用单张噪声图像训练去噪网络

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
(论文速读)Noise2Void:只用单张噪声图像训练去噪网络

论文题目:Noise2Void - Learning Denoising from Single Noisy ImagesNoise2Void:从单张噪声图像中学习图像去噪

会议:CVPR 2019

摘要:当前图像去噪领域主要由判别式深度学习方法主导,这些方法通常使用成对的噪声输入图像和干净目标图像进行训练。近期研究表明,这类方法也可以在没有干净目标的情况下训练:可以使用相互独立的噪声图像对,这种方法被称为 Noise2Noise(N2N)。本文进一步提出 Noise2Void(N2V)训练方案,它既不需要成对的噪声图像,也不需要干净目标图像。因此,N2V 可以直接在待去噪的数据本身上进行训练,从而适用于其他方法无法使用的场景。尤其值得关注的是生物医学图像,因为在这类数据中,干净或带噪的训练目标往往都难以获得。作者将 N2V 与能够使用干净目标图像和/或噪声图像对的方法进行比较。直观上,由于 N2V 在训练时可利用的信息更少,因此不能期望它超过这些方法;但实验表明,Noise2Void 的去噪性能下降幅度较为有限,并且相较于无需训练的去噪方法仍具有较强竞争力。


一、研究背景与核心问题

图像去噪可以写成一个很简单的模型:观测图像 (x=s+n),其中 (s) 是希望恢复的真实信号,(n) 是需要去除的噪声。传统深度学习去噪通常需要成对数据,即“噪声图像 → 干净图像”。网络看见带噪输入,再用对应的 clean target 计算损失。这种监督方式效果很好,但它把一个很强的数据条件写进了训练流程:必须能够获得与噪声图像严格对应的干净真值。

Noise2Noise(N2N)把条件放宽了一步:不再需要 clean target,而是使用同一信号 (s) 的两次独立噪声观测 (s+n) 与 (s+n')。但 N2N 仍要求同一场景可以重复采集且真实信号基本不变;在动态生物样本或受电子束损伤的样品中,这一条件本身就可能不成立。

论文 Figure 1:Traditional、Noise2Noise 与 Noise2Void 三种训练范式的对比

这张图是整篇论文最直观的切入点。Traditional 需要 noisy-clean 配对,N2N 需要 noisy-noisy 配对,而 N2V 进一步把训练数据要求压缩到只有单张 noisy image。换句话说,N2V 真正想解决的问题不是“设计一个更强的去噪网络”,而是:当 clean target 和第二次噪声观测都不存在时,能不能仍然从数据自身构造监督信号?

作者的答案建立在两个统计假设上:真实信号在空间上不是逐像素独立的,因此中心像素可以由邻域部分预测;给定真实信号后,各像素噪声条件独立,因此邻域无法预测当前像素的随机噪声。

二、从 Noise2Noise 到 Noise2Void:为什么单张噪声图也能训练

作者首先把图像生成过程写成联合分布。对相邻像素 (i,j),假设,表示真实信号具有空间相关性;同时噪声满足,即在给定信号后各像素噪声条件独立。进一步假设噪声为零均值 (),于是有 ()。

这也是 N2N 能成立的关键:如果同一信号能够得到两次独立噪声观测,那么第二张 noisy target 虽然单次看起来不干净,但从期望上仍然指向真实信号。N2V 的关键思考是:能不能连第二张 noisy image 都不要?

如果直接把同一张噪声图同时作为输入和目标,普通 CNN 会立即学成恒等映射,因为预测中心像素时,输入里本来就包含这个像素自己的值。网络最简单的策略不是学习图像结构,而是把中心值原样复制到输出,这当然不会产生去噪效果。

论文 Figure 2:普通网络与 Blind-Spot Network 的感受野差异

Figure 2 给出了全文最核心的思想:预测像素 (i) 时,把输入感受野中心的 (x_i) 从网络可见信息中拿掉,形成一个blind spot。此时网络只能根据周围像素预测中心位置。

在作者的假设下,邻域包含与 () 相关的结构信息,却不能预测随机噪声 ()。因此网络无法“猜中”当前像素这一次的噪声,只能学习可预测的信号部分。N2V 的训练目标为:

其中 () 表示中心像素被隐藏后的感受野,() 仍然来自原始噪声图,并直接作为监督目标。看起来目标仍然是 noisy pixel,但因为输入端已经看不到这个像素自身,网络无法通过恒等映射完成任务。更重要的是,在条件独立噪声假设下,这个 noisy target 与 N2N 中从第二次采集得到的 noisy target 在统计意义上具有同样的真实信号部分,只是噪声是另一份独立采样。

因此,N2V 最重要的变化不是损失函数,而是改变网络在计算该位置损失时能够看见的信息

三、Blind Spot 不必重写网络:用随机掩码实现自监督

理论上的 Blind-Spot Network 很清楚,但如果真的为每个输出像素构造一个“中心缺失”的特殊感受野,实现和计算都会比较麻烦。作者因此提出了一个更实用的方案:不修改标准 CNN 的整体结构,而是在训练数据上做稀疏随机掩码。

论文 Figure 3:Noise2Void 的 Blind-Spot Masking 训练方式

具体做法是从噪声图像中随机裁剪 64 × 64 patch,在每个 patch 内通过分层采样选出 (N) 个像素。对于这些被选中的像素,不把其原始强度送入网络,而是用周围区域随机选取的一个像素值进行替换;目标图仍然保留原始未修改的 noisy value。损失只在这些被掩码的位置计算,其余位置的预测不参与这一轮梯度。

掩码值不是固定设为 0,而是从邻域随机取值;同时一个 patch 会遮住多个位置以提高效率。论文实验中通常在每个 64 × 64 patch 内同时操作 (N=64) 个像素。

网络本身并没有追求新结构。作者基于 CSBDeep 使用 U-Net,并在激活函数前加入 Batch Normalization。也就是说,Noise2Void 的贡献主要是训练策略而不是某个专门的 backbone:理论上,只要网络的训练过程能够保证被监督位置无法直接读取自身像素,就可以利用同样的思想。

把整个训练过程压缩成一条流程就是:

单张 noisy image → 随机裁剪 patch → 选择少量像素 → 用邻域随机值遮掉这些像素 → CNN 预测 → 仅在被遮挡位置与原 noisy value 计算损失。

这一步把“没有标签”转化成了“从输入自身构造标签”,也是 N2V 作为自监督去噪方法最核心的工程实现。

四、实验结果:少用监督信息,性能损失到底有多大

实验覆盖自然图像、模拟显微图像和真实生物医学图像。BSD68 加入标准差 () 的零均值高斯噪声;模拟显微数据使用 Poisson + Gaussian 噪声;真实数据包括 cryo-TEM、Fluo-C2DL-MSC 和 Fluo-N2DH-GOWT1。

对比方法包括传统 clean-target 训练、N2N、BM3D,以及 non-local means、均值/中值滤波。不同方法可用的训练信息并不相同,因此论文关注的是:训练条件大幅放宽后,性能损失是否仍可接受。

论文 Figure 4:BSD68、模拟显微数据、cryo-TEM 与两组 CTC 数据上的主要结果

Figure 4 是论文最重要的实验图。先看 BSD68:BM3D 的平均 PSNR 为 28.59 dB,传统监督训练为 29.06 dB,N2N 为 28.86 dB,而 N2V 为 27.71 dB。这里 N2V 不仅落后于监督方法和 N2N,也低于 BM3D,因此不能把论文结论理解为 N2V 在所有自然图像上都更强。它的价值首先体现在训练数据要求最低

到了模拟显微数据,结果明显不同。BM3D 为 29.96 dB,传统训练为 32.56 dB,N2N 为 32.43 dB,N2V 达到 32.28 dB。N2V 与拥有更多监督信息的两种 CNN 方法已经非常接近,并明显高于 BM3D。这说明当图像本身具有较强可预测结构、噪声又更符合像素独立假设时,blind-spot 自监督能够提取到非常有效的去噪信息。

真实显微数据更能体现应用价值。cryo-TEM 无法获得 clean target,但可构造 N2N 噪声对;BM3D 推理约 33.2 s,N2N 和 N2V 都约 1.3 s,且 N2V 对标注结构的保留接近 N2N。CTC-MSC 和 CTC-N2DH 连第二张噪声图都没有,传统监督和 N2N 无法使用,而 N2V 仍可训练;图中 BM3D 分别约 4.6 s 和 5.2 s,N2V 约 0.1 s。

因此 Figure 4 支撑的不是“性能全面第一”,而是一个更重要的结论:当监督信息逐步从 clean pair 降到 noisy pair,再降到只有单张 noisy image 时,N2V 仍然能维持有竞争力的去噪质量,并把深度学习去噪带到原本无法构造训练目标的数据上。

五、失败案例与局限:N2V 的两个统计假设什么时候会失效

这篇论文没有常见的“模块消融表”,但 Figure 5 和 Figure 6 实际上承担了更重要的假设验证:作者直接展示当两个核心统计假设不成立时,N2V 会怎样失败。

论文 Figure 5:信号难以从邻域预测时的 N2V Failure Cases

Figure 5 上半部分是一个孤立的高亮像素。由于这个像素与周围区域缺少可预测关系,N2V 看不到中心像素自身后,就很难判断这里应该突然出现一个亮点,因此预测失败。下半部分展示了高频、颗粒化结构,传统网络和 N2V 都会损失细节,但 N2V 的高频信息丢失更明显。

这正对应第一条假设:真实信号必须在局部具有可预测性。如果某些真实结构本来就是孤立、稀有或高度不规则的,那么“只看邻域猜中心”本身就缺少足够信息。相比传统监督或 N2N,N2V 又额外屏蔽了中心像素,因此这一问题会更加突出。

论文 Figure 6:结构化噪声违反像素独立假设时的结果

第二个边界来自噪声。如果噪声不是逐像素独立的,而是带有空间相关结构,邻域就可以预测这部分“噪声”。在 Figure 6 的人工实验中,N2V 去除了不可预测的随机成分,却把隐藏的棋盘状结构保留下来;在真实 Fluo-C2DL-MSC 数据中,去噪后甚至显现出成像系统的条纹模式。对 N2V 来说,这些具有空间规律的成分与真实信号在统计上很难区分,因此不会被当作随机噪声去掉。

论文 Figure 7:不同 Gaussian 噪声强度下 N2V 与多种基线的 PSNR 变化

作者还改变 BSD68 的 Gaussian noise 强度并加入更多基线。Figure 7 显示 N2V 整体优于简单均值/中值滤波和 non-local means,但在这一自然图像设置下仍落后于使用更多监督信息的方法,也没有对 BM3D 形成全面优势。

另外,论文明确指出 N2V 的设定针对的是denoising,而不是任意图像恢复问题。它依赖“多次独立噪声观测的期望回到真实信号”这一统计逻辑,因此像 blur 这类确定性或结构化退化不能直接套用同样推导。换句话说,N2V 的适用边界与它的理论假设是绑定在一起的。

六、总结与思考

如果把 Noise2Void 压缩成一句话:只要真实图像局部可预测、噪声在像素间近似独立,就可以故意遮住某个像素,让网络用周围上下文预测它,再把这个像素原本的 noisy value 当作自监督目标。

这篇论文真正重要的不是更复杂的 U-Net,而是重新思考“监督信号从哪里来”:Traditional 依赖 noisy-clean pair,N2N 改成第二次 noisy observation,N2V 再把第二次采集也去掉,只从待处理数据内部制造训练任务。对很多生物医学场景而言,这直接决定方法“能不能训练”。

当然,这种自由并不是没有代价。N2V 看不到中心像素,因此对于不可从邻域预测的孤立结构和高频细节更容易出错;一旦噪声具有空间相关性,网络也可能把结构化噪声当成信号保留下来。因此它并不是“无条件的无监督去噪”,而是一种建立在明确统计假设上的 self-supervised denoising 方法。

从方法设定上看,Noise2Void 最值得记住的研究思路是:当标签无法获得时,不一定要先想办法伪造一份 clean label,也可以重新设计网络能看到的信息,让原始观测本身变成一个不会退化成恒等映射的预测任务。这也是 Blind-Spot 思想在后续自监督图像恢复工作中最有启发性的部分。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/2 17:12:14

Vue 3 + TypeScript 实战:从环境搭建到类型安全应用开发

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/2 17:12:07

本地嵌入+小模型:RSSMonster打造agentic RSS阅读器

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/2 17:11:31

按摩机器人品牌怎么选?艾利特以人机协作技术重构康养服务新范式

前言:按摩机器人品牌排行榜背后的行业痛点与升级刚需当下消费者选购智能康养设备、企业布局智慧理疗赛道时,按摩机器人品牌排行榜已成为核心参考依据。纵观2026年行业市场格局,国内按摩机器人领域形成“两超多强”的竞争态势,奥佳…

作者头像 李华
网站建设 2026/9/2 17:10:40

计算机单片机毕设实战-基于 STM32 的多传感火灾预警与室内智能调控系统设计 基于 STM32 的物联网环境参数采集与远程控制平台设计

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于嵌入式单片机,Java、小程序技术领域和毕业项目实战 ✌️…

作者头像 李华
网站建设 2026/9/2 17:08:49

STM32 PID参数整定实战:从电机控制到温度调节的快速调试指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/2 17:08:38

源代码论文分享|校园一卡通项目,适合毕设/课设参考!

做校园一卡通这类项目,真正费时间的往往不是写某一个功能,而是前期不知道整体该怎么搭:功能怎么分、数据库怎么设计、论文每一章写什么,尤其到了毕设后期,很容易出现“代码差不多了,但论文不知道怎么展开”…

作者头像 李华