论文标题:Unifying Channel Independence and Mixing: Multi-Scale Patch Recursion for Global–Local Representation Synergy in Multivariate Time Series Forecasting
代码及讲解改进思路:https://space.bilibili.com/51422950?spm_id_from=333.1007.0.0
摘要
多元时间序列预测支撑金融、气象与工业运营,但长期存在两大障碍:一是模型通常在通道独立(CI)与通道混合(CM)两种范式间二选一,二者各有优势,导致跨数据集性能方差大;二是短期动态与长期趋势难以联合建模,无法同时捕捉瞬态爆发与周期模式。为此作者提出FusionTimePatch(FTP),一个纯MLP驱动的轻量框架,包含三个模块:双视图全局-局部融合Dual-GLF并行运行CI与CM视图,并用多尺度补丁递归自适应调整回看窗口、耦合全局与局部;通道增强CE放大显著通道特征并跨通道扩散;线性融合层统一Dual-GLF与CE的输
出。
Q1:这个模型试图解决什么问题?
核心问题是:通道独立与通道混合长期被二选一、各有短板,且短期瞬态与长期趋势难以联合;如何在保持纯MLP线性效率的前提下,同时统一CI/CM两种视角并实现全局-局部表征协同。
1.CI与CM二选一:通道独立能抑制过拟合、泛化稳健,却丢失跨变量交互;通道混合能建模变量依赖,但高维下易过拟合、注意力开销大;不同数据集偏好不同,造成性能方差大;
2.全局-局部割裂:局部补丁擅长短期瞬态、全局窗口擅长长期趋势,二者难以同时兼顾。
Q2:相关研究
1.通道独立类(如PatchTST):各通道独立建模、泛化好,但完全不建模跨变量交互;
2.通道混合类(如Crossformer):显式建模跨通道依赖,但在高维数据上易过拟合,且注意力复杂度高;
3.线性/MLP类(如DLinear、SOFTS、TSMixer、PatchMLP):计算高效,但表达能力受限、难以兼顾双视图与多尺度;
4.FTP:坚持纯MLP,用CI/CM双视图并行统一两种范式,再以多尺度补丁递归耦合全局-局部。
Q3:模型如何解决这个问题?
输入序列依次经过Dual-GLF、CE与线性融合层得到最终预测。
图注:FTP整体架构:左上GLF-CI、左中GLF-CM分别以多级递归(Level=1,2,...)做局部补丁与全局窗口嵌入;左下CE做隐维与通道维Softmax、采样主导通道并广播;右侧为整体数据流,融合层堆叠e层后由MLP头输出。
双视图全局-局部融合Dual-GLF
Dual-GLF在两个互补视图下并行捕捉短期动态与长期趋势,并组织为多个层级递归。在递归层i采用多尺度自适应补丁,跨度Pi=i×unit,unit为基础补丁长度;为完整覆盖回看窗L,在末尾填充一个步长S,该层补丁数Ni=⌊(L-Pi)/S⌋+2。
局部信息上,把每个长Pi的补丁嵌入得到Xl∈RD;全局信息上,把整个窗口L嵌入得到Xg∈RD;随后沿隐维拼接Xg与Xl并投影回长度L,再以更新后的补丁跨度传入下一层,递归进行。
GLF-CI保持通道独立、逐通道做尺度嵌入:RC×L→RC×Ni×Pi→RC×D;GLF-CM则在每个补丁内堆叠通道,在多尺度上显式建模跨通道交互:RC×L→R[C×Pi]×Ni→RC×D。两视图最终由一个线性映射器融合,在保留互补线索的同时减少相互干扰。
通道增强CE
CE先沿时间维嵌入每个通道得到高维特征Xe∈RC×D;再用隐维Softmax评估各潜在成分的重要性并乘性加权,放大显著维度、抑制次要维度。接着用通道维Softmax产生通道间重要性权重,按权重做概率采样选出主导通道(权重越高采样概率越大),把其特征广播到所有通道,再经MLP得到增强表示,从而突出关键异常与突变、同时保留跨通道依赖。
线性融合与预测
融合层先把Dual-GLF的CI、CM输出XI、XM∈RC×L投影到统一隐维D,与CE输出Xe拼接成[XI,XM,Xe]∈RC×3D,经线性层压缩为融合表示XF∈RC×D;再把XF与当前层的原始嵌入Xo拼接成[XF,Xo]∈RC×2D,经MLP映射回序列空间X∈RC×L,穿过E个编码层,最后由MLP头输出预测Y∈RC×T。
计算复杂度
每个自适应层在GLF-CI与GLF-CM中含补丁与MLP投影,复杂度为O(ACL);CE因两次Softmax与一个线性层贡献O(CL);整体前向复杂度约为O(ACL)(A为自适应层数),保持MLP的线性效率,而基于Transformer的模型为O(CL²)。
Q4:实验结果
实验在12个公开多元时序数据集上进行:四个变压器油温基准ETTh1/ETTh2/ETTm1/ETTm2,以及八个交通-天气-能源数据集Electricity、Traffic、Weather、Solar、PEMS03/04/07/08;统一用RevIN归一化,指标为MSE/MAE,回看窗L=96。
对比三族代表性基线:Linear-MLP类PatchMLP、SOFTS、TSMixer、TiDE、DLinear;Transformer类FreDF、iTransformer、PatchTST、Crossformer;CNN类SCINet、TimesNet。
主结果
图注:主结果(4个预测长度平均,MSE/MAE,加粗为第一、下划线为第二):FTP在12个数据集中的10个上排名第一,显著领先包括最具竞争力的补丁MLP模型PatchMLP在内的全部基线。
FTP在所有对比方法中取得最多的top-1结果。例如在PEMS08(170个变量)上,平均MSE从之前最优的0.138降到0.121,相对提升12.31%;在高维与低维数据上都表现稳健。
递归层级分析
图注:自适应递归层级影响(MSE随层级1—14变化):随递归层级增加,多尺度补丁覆盖更充分,MSE整体下降,到一定层级后趋于稳定。
消融实验
图注:消融(Avg为平均误差、Range为相对变化):分别移除Dual-GLF、GLF-CI、GLF-CM、CE、Concat Original、Fusion六个组件。
移除GLF-CM在PEMS04、Weather、Electricity上带来最大的误差上升,凸显跨通道全局-局部互补在多元场景中的关键作用;移除Concat Original在多个数据集上也明显恶化,说明保留原始输入对稳定建模很重要。
效率分析
图注:效率-精度权衡(Electricity,L=96、T=96):横轴为每迭代训练时间、气泡大小为内存、纵轴为MSE;FTP位于左下角且气泡最小。
FTP仅用276MB内存、8.5ms/iter并取得最低MSE;相比之下PatchTST需要约4713MB、137.3ms/iter,同范式的PatchMLP也需476MB、21.2ms/iter,且误差更高。
预测可视化
图注:预测可视化(PEMS04,预测长度T={12,24,48,96}):蓝色为真值、橙色为FTP预测,整体能较好贴合波形走势与突变。
Q5:有什么可以进一步探索的点?
1.让CI/CM两视图的融合权重完全内容感知、随数据集与样本自适应;
2.让递归层级与补丁跨度根据信号自动增长或停止,避免人工设定上限;
3.把CE中的概率采样改为可微操作,实现端到端的通道选择;
4.把多尺度补丁递归与双视图思想迁移到频域、图网络或状态空间模型。
Q6:总结一下模型的主要内容
FTP由双视图全局-局部融合Dual-GLF(CI/CM并行加多尺度补丁递归)、通道增强CE与线性融合层组成,是一个纯MLP轻量框架,在12个数据集中的10个上取得第一。
它的核心价值是:用双视图并行统一通道独立与混合、用多尺度递归协同全局与局部,在保持线性计算效率的同时显著提升预测精度与跨数据集稳健性。