论文题目:Noise2Noise: Learning Image Restoration without Clean Data(无需干净数据的图像恢复学习)
会议:ICML 2018
摘要:本文将基础统计推理应用于机器学习中的信号重建,即学习将受损观测映射为干净信号,并得到一个简单而有力的结论:仅观察受损样本,也可以学习恢复图像,其性能能够达到、甚至有时超过使用干净数据训练的结果,同时不需要显式的图像先验或噪声似然模型。实践中,作者展示了同一个模型可以仅基于噪声数据学习照片去噪、合成 Monte Carlo 图像去噪,以及欠采样 MRI 扫描重建;这些任务中的数据分别受到不同过程的破坏。
一、研究背景与核心问题
传统监督式图像恢复通常需要成对数据:输入是一张受损图像,target 是对应的干净图像 y,网络通过最小化
学习从坏图到好图的映射。问题在于,很多任务里最昂贵的恰恰不是输入,而是所谓“干净 target”:低照度摄影需要长曝光,Monte Carlo 渲染需要极高采样数,MRI 完整采集 k-space 也会受到扫描时间和动态场景的限制。
Noise2Noise 提出的核心问题非常直接:如果训练时根本拿不到干净图像,只能得到同一场景的两次独立受损观测,网络还能不能学会恢复干净信号?
作者的答案是:可以。在合适的统计条件下,noisy target 与 clean target 对应相同的最优解。论文的新意不在网络结构,而在于重新审视“监督目标必须干净”这一默认前提。
二、核心原理:网络真正学到的是统计量
理解 Noise2Noise,先看最简单的点估计问题。假设我们有很多次不可靠测量 y,希望找到一个数 z 与这些观测尽可能接近。如果使用 L2 损失:
最优解就是均值;如果换成 L1 损失,最优解则是中位数。
神经网络回归本质上只是把这个点估计推广到“给定输入 x”的条件分布。对于 L2,网络会趋向学习条件均值。因此,只要把 clean target 换成 noisy target 后,新的 target 在给定输入条件下仍满足
那么 L2 对应的最优预测不会改变。于是传统的 Noise2Clean 训练可以写成
而 Noise2Noise 则变成
这里输入与 target 都可以被污染,甚至不要求两边服从完全相同的噪声分布。关键不是“target 本身必须干净”,而是loss 对应的统计量必须仍然指向我们真正想恢复的 clean signal。
Noise2Noise 也不是在学习“把一份噪声变成另一份噪声”:随机噪声不可预测,网络能学到的是不同 realization 共享的稳定结构。
更重要的是,这个思想并不只适用于 L2。L2 对应均值,L1 对应中位数;如果正确答案对应分布的众数,就需要更加接近 mode-seeking 的损失。因此 Noise2Noise 的适用条件,不应该被简化成一句“噪声必须是零均值”,而应该理解为:所选 loss 恢复的统计中心,必须等于目标干净信号。
三、基础实验:Gaussian、Poisson、Bernoulli 与异常值噪声
3.1 Gaussian 噪声:noisy target 几乎不损失性能
论文 Figure 1:Gaussian 去噪的收敛速度、空间相关噪声以及固定采集预算实验
Figure 1a 中,白高斯噪声下 clean target 与 noisy target 的训练曲线几乎重合,最终 PSNR 也非常接近。Figure 1b 进一步引入空间相关噪声:像素之间相关性越强,网络收敛越慢,但最终质量仍接近。这说明 noisy target 主要让梯度更“吵”,却没有改变最终应该收敛到哪里。
Figure 1c 进一步说明,固定采集预算下,把成本用于更多噪声 realization、尤其更多不同 latent images,可能比把少量 target 做得极干净更有效。
论文 Table 1:Gaussian、Poisson、Bernoulli 三类噪声在 KODAK、BSD300、SET14 上的 PSNR 对比
Table 1 是基础实验的核心定量证据。Gaussian 噪声下,clean/noisy target 的平均 PSNR 分别为 31.63/31.61 dB;Poisson 下为 30.59/30.57 dB,几乎没有差别。Bernoulli 缺失像素实验中,noisy target 甚至达到 32.02 dB,高于 clean target 的 31.85 dB。作者推测,这可能与 noisy target 在输出端产生类似 dropout 的效果有关。
论文 Figure 2:Gaussian、Poisson、Bernoulli 三种噪声的定性恢复结果
Figure 2 中论文没有重复展示 clean-target 版本,因为三类任务里二者在视觉上几乎一致。它证明的是:只用受损 target,并没有阻止 CNN 学到高质量恢复映射。
3.2 当“均值”不是正确答案:L1 与近似 L0
论文 Figure 3:随机文字遮挡实验,比较 L2、L1 与 clean-target 训练
随机文字覆盖时,被污染像素的颜色与原图无关,因此均值并不是正确答案。L2 会把预测结果向文字颜色的平均值拉动;但只要某个像素保留原始颜色的概率超过一半,原始颜色就是中位数,因此 L1 更合适。Figure 3 中,输入只有 17.12 dB,L2 得到 26.89 dB,而 L1 达到 35.75 dB,已经非常接近 clean-target 训练的 35.82 dB。
论文 Figure 4:70% 随机彩色 impulse noise 下,L2、L1 与近似 L0 的恢复结果
论文 Figure 5:随着 target 随机像素污染比例上升,L1 与近似 L0 相对 clean-target 训练的 PSNR 变化
随机 impulse noise 更极端:像素以概率 p 被均匀随机颜色替换。此时正确颜色对应分布中的尖峰,也就是众数;当污染比例超过 50% 后,中位数也不再可靠。作者因此使用退火的近似 L0 损失:
其中,训练过程中
从 2 线性退火到 0,使优化逐渐趋向 mode seeking。Figure 4 中,当输入有 70% 像素被随机替换时,L2/L1 分别只有 13.02/16.36 dB,而近似 L0 达到 28.43 dB,接近 clean target 的 28.86 dB。Figure 5 则进一步说明:L1 在污染比例低于 50% 时表现良好,一旦超过这个阈值便迅速退化,而近似 L0 在更高污染比例下依然稳定。
这组实验把 Noise2Noise 的理论边界说得很清楚:不是 noisy target 天然有效,而是 corruption 的统计性质与 loss 必须匹配。
四、复杂噪声:Monte Carlo 渲染与 HDR
Monte Carlo path tracing 的噪声远比 Gaussian 复杂:分布随场景、材质和采样过程变化,还可能长尾、多峰。但 Monte Carlo 积分器有一个关键性质——像素采样的期望等于真实辐射度,因此 Noise2Noise 所需要的统计条件仍然成立。
真正的难点是 HDR。亮度可能跨越多个数量级,直接使用普通 L2 会被极亮 outlier 支配;但如果先对 target 做非线性 tone mapping,又会破坏这一期望关系。作者因此提出相对损失:
并在计算梯度时把分母视为常数。输入可以先做 tone mapping,但网络输出和 noisy target 仍保持在线性 HDR 空间,从而尽量保持期望的正确性。
论文 Figure 6:Monte Carlo HDR 去噪中不同输入表示与损失函数的比较
Figure 6 是这一节最关键的消融。8 spp 输入只有 11.32 dB;普通 L2 约 25 dB,而对输入做 tone mapping、同时采用后达到 30.09 dB。相反,如果连 noisy target 一起做非线性 tone mapping,结果明显偏暗,PSNR 只有 15.50 dB。这个现象直接验证了前面的理论:如果对 target 的处理改变了其期望,Noise2Noise 的监督目标就会被带偏。
论文 Figure 7:64 spp 输入下,使用 noisy target 与 131k spp clean target 训练的结果
作者用 860 张建筑场景训练、34 张不同场景验证。64 spp 输入平均只有 22.31 dB;训练 2000 epochs 后,clean target 模型达到 31.83 dB,noisy target 低约 0.5 dB;训练到 4000 epochs 后 noisy target 也达到 31.83 dB。相比之下,131k spp clean target 极其昂贵,Figure 7d 中一张参考图在 8 张 Tesla P100 上仍需约 40 分钟。
论文 Figure 8:单场景 1000 帧 flythrough 的在线训练曲线
Figure 8 给出更直接的工程结论:noisy target 每帧约 190 ms,clean target 约 7 分钟,相差超过 2000 倍,而最终性能仍接近,因此在线训练更适合使用 noisy target。
五、从去噪走向逆问题:欠采样 MRI 重建
Noise2Noise 最后把思想推广到 MRI。MRI 采样的是 Fourier 域,也就是 k-space。作者把频率采样设计成随机 Bernoulli 过程,每个频率以 $p(k)=e^{-\lambda|k|}$ 的概率保留,并对保留频率按 $1/p(k)$ 加权,使随机欠采样频谱的期望仍然等于完整频谱。由于 Fourier 变换是线性的,回到图像域后仍可以使用 L2。
训练时,同一个 volume 生成两份独立欠采样图像,一份作为 input,一份作为 noisy target。作者还加入 data consistency:网络输出变换到 Fourier 域后,把输入中真实采集到的非零频率重新写回,再逆变换计算 loss,从而保证已观测信息不会被网络随意修改。
实验使用 IXI 脑 MRI 的 2D slice,训练集为 50 个 subject 的 4936 张 256 × 256 图像,验证集来自另外 10 个 subject 的 500 张图像,仅保留完整频谱约 10% 的采样。
论文 Figure 9:10% k-space 欠采样输入、noisy-target 重建、clean-target 重建与完整参考图
直接 IFFT 的验证集平均 PSNR 只有 20.03 dB;noisy-target 训练达到 31.10 dB,clean-target 为 31.14 dB,差距仅 0.04 dB。Figure 9 的单个样例也给出 29.77 dB 对 29.81 dB 的接近结果。
这说明 Noise2Noise 不只是去噪技巧:只要能构造期望正确的随机观测过程,它就可推广到更一般的信号重建。需要注意,论文 MRI 使用的是模拟 FFT 欠采样,并非真实 1D 采集轨迹,因此证明的是原理可行性。
六、总结与思考
如果把 Noise2Noise 压缩成一句话:
监督学习不一定需要“干净标签”,真正需要的是 noisy target 在所选损失函数对应的统计意义上,仍然指向正确答案。
这篇论文可以记住四点。第一,L2 对应条件均值,因此当 noisy target 的条件期望等于 clean target 时,Noise2Noise 与 Noise2Clean 在理想情况下具有相同最优解。第二,loss 必须与 corruption 匹配:L1 对应中位数,随机 impulse noise 则需要更接近众数的估计。第三,有限数据仍然重要,noisy target 会增加方差、某些复杂任务可能收敛更慢,但它的低采集成本可以换来更多场景和更多噪声 realization。第四,这个思想不要求显式建立噪声似然模型或图像先验,只要训练数据本身来自合适的随机过程即可。
从方法设定上看,它的边界也同样清楚:如果 corruption 引入系统性偏差,使 target 的统计中心不再指向 clean signal,简单的 Noise2Noise 就会失败。论文提到饱和裁剪会破坏期望,Monte Carlo 实验也展示了对 target 做非线性 tone mapping 会直接得到错误结果。
Noise2Noise 最有价值的地方,是把问题从“怎样获得完美标签”改成了“怎样构造统计上正确的监督信号”。对于 clean target 昂贵、缓慢甚至无法获得的任务,这个视角会直接改变数据采集和训练方案的设计方式。