news 2026/9/1 5:56:09

(论文速读)Noise2Noise:没有干净数据,也能训练图像恢复网络

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
(论文速读)Noise2Noise:没有干净数据,也能训练图像恢复网络

论文题目:Noise2Noise: Learning Image Restoration without Clean Data无需干净数据的图像恢复学习

会议:ICML 2018

摘要:本文将基础统计推理应用于机器学习中的信号重建,即学习将受损观测映射为干净信号,并得到一个简单而有力的结论:仅观察受损样本,也可以学习恢复图像,其性能能够达到、甚至有时超过使用干净数据训练的结果,同时不需要显式的图像先验或噪声似然模型。实践中,作者展示了同一个模型可以仅基于噪声数据学习照片去噪、合成 Monte Carlo 图像去噪,以及欠采样 MRI 扫描重建;这些任务中的数据分别受到不同过程的破坏。


一、研究背景与核心问题

传统监督式图像恢复通常需要成对数据:输入是一张受损图像,target 是对应的干净图像 y,网络通过最小化学习从坏图到好图的映射。问题在于,很多任务里最昂贵的恰恰不是输入,而是所谓“干净 target”:低照度摄影需要长曝光,Monte Carlo 渲染需要极高采样数,MRI 完整采集 k-space 也会受到扫描时间和动态场景的限制。

Noise2Noise 提出的核心问题非常直接:如果训练时根本拿不到干净图像,只能得到同一场景的两次独立受损观测,网络还能不能学会恢复干净信号?

作者的答案是:可以。在合适的统计条件下,noisy target 与 clean target 对应相同的最优解。论文的新意不在网络结构,而在于重新审视“监督目标必须干净”这一默认前提。

二、核心原理:网络真正学到的是统计量

理解 Noise2Noise,先看最简单的点估计问题。假设我们有很多次不可靠测量 y,希望找到一个数 z 与这些观测尽可能接近。如果使用 L2 损失:

最优解就是均值;如果换成 L1 损失,最优解则是中位数。

神经网络回归本质上只是把这个点估计推广到“给定输入 x”的条件分布。对于 L2,网络会趋向学习条件均值。因此,只要把 clean target 换成 noisy target 后,新的 target 在给定输入条件下仍满足

那么 L2 对应的最优预测不会改变。于是传统的 Noise2Clean 训练可以写成

而 Noise2Noise 则变成

这里输入与 target 都可以被污染,甚至不要求两边服从完全相同的噪声分布。关键不是“target 本身必须干净”,而是loss 对应的统计量必须仍然指向我们真正想恢复的 clean signal

Noise2Noise 也不是在学习“把一份噪声变成另一份噪声”:随机噪声不可预测,网络能学到的是不同 realization 共享的稳定结构。

更重要的是,这个思想并不只适用于 L2。L2 对应均值,L1 对应中位数;如果正确答案对应分布的众数,就需要更加接近 mode-seeking 的损失。因此 Noise2Noise 的适用条件,不应该被简化成一句“噪声必须是零均值”,而应该理解为:所选 loss 恢复的统计中心,必须等于目标干净信号。

三、基础实验:Gaussian、Poisson、Bernoulli 与异常值噪声

3.1 Gaussian 噪声:noisy target 几乎不损失性能

论文 Figure 1:Gaussian 去噪的收敛速度、空间相关噪声以及固定采集预算实验

Figure 1a 中,白高斯噪声下 clean target 与 noisy target 的训练曲线几乎重合,最终 PSNR 也非常接近。Figure 1b 进一步引入空间相关噪声:像素之间相关性越强,网络收敛越慢,但最终质量仍接近。这说明 noisy target 主要让梯度更“吵”,却没有改变最终应该收敛到哪里。

Figure 1c 进一步说明,固定采集预算下,把成本用于更多噪声 realization、尤其更多不同 latent images,可能比把少量 target 做得极干净更有效。

论文 Table 1:Gaussian、Poisson、Bernoulli 三类噪声在 KODAK、BSD300、SET14 上的 PSNR 对比

Table 1 是基础实验的核心定量证据。Gaussian 噪声下,clean/noisy target 的平均 PSNR 分别为 31.63/31.61 dB;Poisson 下为 30.59/30.57 dB,几乎没有差别。Bernoulli 缺失像素实验中,noisy target 甚至达到 32.02 dB,高于 clean target 的 31.85 dB。作者推测,这可能与 noisy target 在输出端产生类似 dropout 的效果有关。

论文 Figure 2:Gaussian、Poisson、Bernoulli 三种噪声的定性恢复结果

Figure 2 中论文没有重复展示 clean-target 版本,因为三类任务里二者在视觉上几乎一致。它证明的是:只用受损 target,并没有阻止 CNN 学到高质量恢复映射。

3.2 当“均值”不是正确答案:L1 与近似 L0

论文 Figure 3:随机文字遮挡实验,比较 L2、L1 与 clean-target 训练

随机文字覆盖时,被污染像素的颜色与原图无关,因此均值并不是正确答案。L2 会把预测结果向文字颜色的平均值拉动;但只要某个像素保留原始颜色的概率超过一半,原始颜色就是中位数,因此 L1 更合适。Figure 3 中,输入只有 17.12 dB,L2 得到 26.89 dB,而 L1 达到 35.75 dB,已经非常接近 clean-target 训练的 35.82 dB。

论文 Figure 4:70% 随机彩色 impulse noise 下,L2、L1 与近似 L0 的恢复结果

论文 Figure 5:随着 target 随机像素污染比例上升,L1 与近似 L0 相对 clean-target 训练的 PSNR 变化

随机 impulse noise 更极端:像素以概率 p 被均匀随机颜色替换。此时正确颜色对应分布中的尖峰,也就是众数;当污染比例超过 50% 后,中位数也不再可靠。作者因此使用退火的近似 L0 损失:

其中,训练过程中从 2 线性退火到 0,使优化逐渐趋向 mode seeking。Figure 4 中,当输入有 70% 像素被随机替换时,L2/L1 分别只有 13.02/16.36 dB,而近似 L0 达到 28.43 dB,接近 clean target 的 28.86 dB。Figure 5 则进一步说明:L1 在污染比例低于 50% 时表现良好,一旦超过这个阈值便迅速退化,而近似 L0 在更高污染比例下依然稳定。

这组实验把 Noise2Noise 的理论边界说得很清楚:不是 noisy target 天然有效,而是 corruption 的统计性质与 loss 必须匹配。

四、复杂噪声:Monte Carlo 渲染与 HDR

Monte Carlo path tracing 的噪声远比 Gaussian 复杂:分布随场景、材质和采样过程变化,还可能长尾、多峰。但 Monte Carlo 积分器有一个关键性质——像素采样的期望等于真实辐射度,因此 Noise2Noise 所需要的统计条件仍然成立。

真正的难点是 HDR。亮度可能跨越多个数量级,直接使用普通 L2 会被极亮 outlier 支配;但如果先对 target 做非线性 tone mapping,又会破坏这一期望关系。作者因此提出相对损失:

并在计算梯度时把分母视为常数。输入可以先做 tone mapping,但网络输出和 noisy target 仍保持在线性 HDR 空间,从而尽量保持期望的正确性。

论文 Figure 6:Monte Carlo HDR 去噪中不同输入表示与损失函数的比较

Figure 6 是这一节最关键的消融。8 spp 输入只有 11.32 dB;普通 L2 约 25 dB,而对输入做 tone mapping、同时采用后达到 30.09 dB。相反,如果连 noisy target 一起做非线性 tone mapping,结果明显偏暗,PSNR 只有 15.50 dB。这个现象直接验证了前面的理论:如果对 target 的处理改变了其期望,Noise2Noise 的监督目标就会被带偏。

论文 Figure 7:64 spp 输入下,使用 noisy target 与 131k spp clean target 训练的结果

作者用 860 张建筑场景训练、34 张不同场景验证。64 spp 输入平均只有 22.31 dB;训练 2000 epochs 后,clean target 模型达到 31.83 dB,noisy target 低约 0.5 dB;训练到 4000 epochs 后 noisy target 也达到 31.83 dB。相比之下,131k spp clean target 极其昂贵,Figure 7d 中一张参考图在 8 张 Tesla P100 上仍需约 40 分钟。

论文 Figure 8:单场景 1000 帧 flythrough 的在线训练曲线

Figure 8 给出更直接的工程结论:noisy target 每帧约 190 ms,clean target 约 7 分钟,相差超过 2000 倍,而最终性能仍接近,因此在线训练更适合使用 noisy target。

五、从去噪走向逆问题:欠采样 MRI 重建

Noise2Noise 最后把思想推广到 MRI。MRI 采样的是 Fourier 域,也就是 k-space。作者把频率采样设计成随机 Bernoulli 过程,每个频率以 $p(k)=e^{-\lambda|k|}$ 的概率保留,并对保留频率按 $1/p(k)$ 加权,使随机欠采样频谱的期望仍然等于完整频谱。由于 Fourier 变换是线性的,回到图像域后仍可以使用 L2。

训练时,同一个 volume 生成两份独立欠采样图像,一份作为 input,一份作为 noisy target。作者还加入 data consistency:网络输出变换到 Fourier 域后,把输入中真实采集到的非零频率重新写回,再逆变换计算 loss,从而保证已观测信息不会被网络随意修改。

实验使用 IXI 脑 MRI 的 2D slice,训练集为 50 个 subject 的 4936 张 256 × 256 图像,验证集来自另外 10 个 subject 的 500 张图像,仅保留完整频谱约 10% 的采样。

论文 Figure 9:10% k-space 欠采样输入、noisy-target 重建、clean-target 重建与完整参考图

直接 IFFT 的验证集平均 PSNR 只有 20.03 dB;noisy-target 训练达到 31.10 dB,clean-target 为 31.14 dB,差距仅 0.04 dB。Figure 9 的单个样例也给出 29.77 dB 对 29.81 dB 的接近结果。

这说明 Noise2Noise 不只是去噪技巧:只要能构造期望正确的随机观测过程,它就可推广到更一般的信号重建。需要注意,论文 MRI 使用的是模拟 FFT 欠采样,并非真实 1D 采集轨迹,因此证明的是原理可行性。

六、总结与思考

如果把 Noise2Noise 压缩成一句话:

监督学习不一定需要“干净标签”,真正需要的是 noisy target 在所选损失函数对应的统计意义上,仍然指向正确答案。

这篇论文可以记住四点。第一,L2 对应条件均值,因此当 noisy target 的条件期望等于 clean target 时,Noise2Noise 与 Noise2Clean 在理想情况下具有相同最优解。第二,loss 必须与 corruption 匹配:L1 对应中位数,随机 impulse noise 则需要更接近众数的估计。第三,有限数据仍然重要,noisy target 会增加方差、某些复杂任务可能收敛更慢,但它的低采集成本可以换来更多场景和更多噪声 realization。第四,这个思想不要求显式建立噪声似然模型或图像先验,只要训练数据本身来自合适的随机过程即可。

从方法设定上看,它的边界也同样清楚:如果 corruption 引入系统性偏差,使 target 的统计中心不再指向 clean signal,简单的 Noise2Noise 就会失败。论文提到饱和裁剪会破坏期望,Monte Carlo 实验也展示了对 target 做非线性 tone mapping 会直接得到错误结果。

Noise2Noise 最有价值的地方,是把问题从“怎样获得完美标签”改成了“怎样构造统计上正确的监督信号”。对于 clean target 昂贵、缓慢甚至无法获得的任务,这个视角会直接改变数据采集和训练方案的设计方式。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/1 5:54:48

微带三工器仿真设计全流程:HFSS三路合成、匹配与隔离度调试

三工器(Triplexer)是射频前端里比双工器再进一步的多频合成器件。这次我们来看的是微带三工器的仿真设计,重点解决三个频段如何共用一路馈电、互不干扰,以及如何在 HFSS/CST/ADS 这类电磁仿真软件里把设计闭环跑通。很多人在做多频…

作者头像 李华
网站建设 2026/9/1 5:52:35

智能缝纫机如何提升人效与质量?实测方法与避坑指南

1. 先搞清楚“省人工”到底省在哪儿看到“一台顶几个工人”这种说法,很多人第一反应是“机器换人,直接裁员”。但如果你真打算在服装厂、裁缝店或者小批量定制工作室里引入智能缝纫机,这么想就太简单了。一台机器能不能“顶”几个人&#xff…

作者头像 李华
网站建设 2026/9/1 5:52:16

iOS虚拟摄像头实现全解析:从AVFoundation到越狱Tweak注入

简介:面向iOS开发与逆向工程人员的虚拟摄像头插件源码包,聚焦通过MobileSubstrate注入系统相机进程并Hook AVCaptureSession相关方法,实现视频流替换与自定义视频源接入。资源共5个文件,压缩包仅15KB,含2个HTML说明文档…

作者头像 李华
网站建设 2026/9/1 5:51:59

C++11:基本语法与使用方法

1、C11的{ } 1、c11以后想统一初始化方式,试图实现一切对象皆可用{ }初始化,所以{ }也叫做初始化列表2、 内置类型支持,自定义类型也支持,自定义类型本质是类型转换,中间会产生临时对象,最后优化了以后变成…

作者头像 李华
网站建设 2026/9/1 5:51:42

LLM知识蒸馏实战:构建轻量级RL网络安全防御智能体

# LLM知识蒸馏实战:构建轻量级RL网络安全防御智能体网络攻防对抗的复杂性呈指数级增长。传统的规则引擎难以应对零日漏洞和多变攻击手法,自动化防御系统面临严峻挑战。强化学习(RL)在马尔可夫决策过程(MDP)…

作者头像 李华
网站建设 2026/9/1 5:51:35

产线串码写入与校验工具包:从串口通讯到工位检测的完整方案

简介:面向创维电视等智能终端工厂生产线,这份串码写入与校验工具包提供了从SN码、MAC地址批量写入读取,到合规条码打印及工位自动化检测的完整解决方案,适合设备调试、产线运维及测试工程人员使用。包内共18个文件,压缩…

作者头像 李华