大家读完觉得有帮助记得关注和点赞!!!
摘要 — 在现代分布式网络环境中,尤其是在物联网基础设施和5G网络中,严格的隐私保护和可扩展性要求给入侵检测系统带来了重大挑战。尽管联邦学习通过防止数据集中化来保护隐私,但在严重的统计异质性和边缘节点的资源限制下,其效率和稳定性显著下降。为解决这些限制,本研究引入了FedTransKD-IDS框架,该框架通过整合基于几何中值的鲁棒聚合、联邦迁移学习和知识蒸馏,同时增强了系统的稳定性和效率。在该框架内,协作训练的全局教师模型将其特征提取组件迁移给轻量级的学生模型。在异构数据集上的实验评估展示了峰值检测性能,达到了99.18%的准确率和99.99%的召回率,从而表明了结构化知识迁移在联邦环境中的有效性。
关键词 — 入侵检测系统 (IDS)、联邦迁移学习 (FTL)、知识蒸馏 (KD)、物联网 (IoT)
I. 引言
在过去十年中,由云基础设施、物联网、5G网络和智能系统的广泛集成所驱动的数字化转型,已将通信网络转变为动态的、完全分布式的和数据驱动的环境[1]。尽管这些进步显著提高了效率和可扩展性,但它们同时扩大了攻击面,并将网络威胁转变为复杂的、多层次的和混合的模式[2]。因此,依赖静态规则或集中式模型的传统入侵检测系统已无法有效应对。
此外,异构网络的普及导致安全数据在不同节点上生成,这些数据具有高度不平衡的统计分布和显著不同的数据量。这种异构性被认为是分布式机器学习中的基本挑战之一,导致收敛不稳定和模型泛化能力降低。此外,边缘设备上严重的计算资源限制以及流量数据的高度隐私敏感性,为完全集中的方法设置了重大障碍。因此,设计一个同时确保高可扩展性、对数据异构性的鲁棒性以及高效计算性能的智能框架,已成为网络入侵检测领域的关键问题。
A. 联邦学习
联邦学习(FL)最近已成为解决分布式环境中数据隐私和可扩展性双重挑战的一种有前景的方法。在FL中,各个设备(或客户端)使用其私有数据训练本地模型,然后仅将模型更新共享给中央服务器。服务器聚合这些更新以生成全局模型,确保原始数据永远不会离开本地设备。这种去中心化的方法对于物联网和5G网络尤其有利,因为将大量敏感数据传输到中央服务器既不切实际也不安全。最近的研究已将FL应用于各种网络安全应用,如恶意软件检测、垃圾邮件过滤、网络流量异常检测和入侵检测。这些工作表明,FL可以实现与集中式训练相当的性能,同时显著降低数据泄露的风险。
B. 联邦迁移学习
联邦迁移学习(FTL)是机器学习中的一种新颖方法,它解决了传统联邦学习的局限性,并能够在不同领域(具有不同特征或样本)之间进行知识迁移,而无需共享原始数据。在该框架中,两个独立方——一方拥有丰富的标签数据,另一方拥有有限的标签数据——在有限的公共样本和隐私保护技术(如加法同态加密或秘密共享)的帮助下进行协作。FTL通过神经网络构建一个共享特征空间,并通过同时优化预测损失和特征对齐损失来生成高精度模型[3]。
C. 知识蒸馏
知识蒸馏(KD)是一种压缩深度学习模型的技术,它将大型复杂模型(教师)的预测知识迁移给更小、更高效的学生模型。该方法主要使用软目标来训练学生模型,即由教师模型在高温软最大化温度(T > 1)下生成的类概率分布。这些软目标提供了关于类间关系和教师泛化模式的更丰富信息;因此,较小的模型可以达到接近教师的性能,但计算成本低得多,适合部署在资源受限的环境中[4]。
II. 相关工作
Sheikhi等人[5]提出了一个名为特征感知联邦学习(FAFL)的框架,用于分布式5G网络中的无监督异常检测。通过在每个客户端利用变分自编码器(VAE),该框架在本地学习正常流量模式,无需标签。FAFL的主要创新在于将特征重要性整合到联邦聚合过程中;特征重要性使用集成梯度等方法计算,与用于差分隐私的高斯噪声聚合,然后转换为注意力权重,以正确执行模型参数的加权平均。此外,还整合了一种动态更新特征重要性的机制,以适应数据分布的变化。与在统计异质性下表现不佳的FedAvg和FedProx等传统方法相比,FAFL通过关注关键特征和保护隐私,展示了更高的效率。对5G数据集的评估表明,其在ROC-AUC、F1分数和收敛速度等指标上具有优越性,同时也突显了特征可解释性作为一个实际优势。尽管取得了这些进展,该方法仍面临诸如易受恶意客户端攻击、数据集大小限制以及在极端异构条件下缺乏理论收敛保证等挑战[5]。
Sheikhi等人[6]提出了一种名为混合信誉聚合(HRA)的先进防御机制,用于5G和边缘网络中的联邦学习。HRA由两个主要部分组成:几何异常检测,用于识别每轮训练中的异常更新;以及一个基于动量的信誉系统,用于评估客户端随时间的行为。与依赖静态过滤器的传统方法不同,HRA通过分析客户端行为,区分恶意模式与非均匀或非独立同分布数据引起的良性偏差,从而提高了系统在动态和异构环境中的弹性。在大规模数据集(一个5G数据集和NF-CSE-CIC-IDS2018基准)上的实验验证结果表明,HRA在各种攻击下均实现了高准确率(分别为98.66%和96.60%),并且计算开销可忽略,性能显著优于先前的方法。该方法的一个局限性是可能容易受到高度先进的自适应攻击。
Maiga等人[7]提出了一种基于深度神经网络的混合联邦框架,用于检测5G网络中的DDoS攻击。该方法的新颖之处在于,在联邦学习架构中集成了基于XGBoost的特征工程与混合深度学习模型(BiLSTM、GRU和LSTM),实现了无需交换原始数据的协作训练。实验结果显示出99.61%的准确率、0.046%的假阳性率和低于一毫秒的检测延迟,表明其性能优于相关方法。然而,依赖模拟数据集、无法检测零日攻击以及缺乏先进的隐私保护机制被认为是本研究的主要局限性。
Zeytouni等人[8]提出了一种基于联邦学习的入侵检测系统,用于5G和6G网络,通过利用FedAvg+聚合算法有效解决了异构(非IID)数据带来的挑战。在该框架中,边缘设备使用5G-NIDD数据集的流量特征训练本地模型,并通过基于准确率和信任水平的动态加权在中央服务器上聚合,旨在减少恶意客户端的影响。另一方面,在聚合过程中注入高斯噪声以确保差分隐私。实验结果报告了96.34%的检测准确率、识别出92.9%的恶意流量,以及对模型投毒攻击的高鲁棒性和低计算开销。尽管如此,对模拟环境的依赖以及缺乏对未知(零日)攻击的综合评估仍然是该研究的主要局限性。
Alalyan等人[9]提出了一种安全的点对点联邦学习框架,用于在O-RAN网络中检测DDoS攻击,该框架基于分层RIC架构和用于隐私保护的加密平均计算机制。在这种方法中,通过智能地为聚类选择更高质量的客户端,并对其余节点应用迁移学习,显著降低了通信成本。在真实5G测试平台上的评估展示了高准确率和实时处理能力;然而,半诚实客户端的假设以及可能忽略罕见数据仍是该方法的主要局限性。
研究[10]提出了一种用于入侵检测的联邦迁移学习框架,该框架在分布式架构中集成了包括随机森林、AdaBoost和XGBoost在内的集成模型。一个基于CIC-IDS-Collection数据集预训练的全局模型在本地网络上进行微调,更新后的参数被迭代聚合到中央模型中,从而能够在保护数据隐私的同时适应不断演变的攻击。然而,所提出的框架很大程度上仍停留在概念层面,评估主要基于理论性能分析,而非广泛的实证验证。
联邦学习通过依赖本地训练和参数交换,减少了通信开销,同时保护了隐私并防止原始数据传输;然而,它面临着诸如严重的统计数据异构性(非IID)、收敛不稳定、每个节点的数据量和多样性有限,以及在边缘设备上训练完整模型的高昂计算成本等挑战。在经典设置中,每个节点实际上是从头开始学习,由于本地数据不足以提取深度和可泛化的表示,即使在聚合之后,全局模型在准确性和稳定性方面仍然次优,需要更大的模型和更多的通信轮次来弥补这些缺陷。因此,通过利用联邦迁移学习并从预训练模型或更丰富的领域迁移知识表示,可以减少由数据稀缺引起的方差,加速收敛,并限制可训练参数的数量,从而降低通信成本并提高异构条件下的稳定性。最后,为了确保与资源受限节点的兼容性,采用知识蒸馏将知识从大型模型迁移到轻量级模型,从而在保持准确性的同时最小化计算成本、能耗和执行延迟。为此,本文提出了FedTransKD-IDS方法。
III. 提出的方法
A. 数据集概览
在本研究中,BoT-IoT数据集被用作主要来源之一。该数据集是为了模拟物联网环境而开发的,由实验室环境中生成的真实网络流量组成,主要关注僵尸网络相关攻击。其训练数据分为五个部分,总共包含超过73,000条网络流记录。该数据的主要特征包括协议类型(主要是TCP和UDP)、每个方向的数据包和字节数、流持续时间以及连接状态。该数据集的类别分布极度不平衡,超过90%的记录属于攻击类别。其中,DDoS攻击类别占主导地位,约占68-75%,其次是数据窃取类别,约占20-25%。相比之下,代表正常流量的记录占比非常小(不到10%)。这种严重的不平衡构成了建模过程中的主要挑战,并凸显了采用类别不平衡处理技术的必要性。
UNSW-NB15数据集提供了更多样化的现代攻击类型,除了正常流量外,还包括九种攻击类别。在本研究中,使用了其四个子集。首先,均匀子集通过有针对性的抽样设计,实现了大致平衡的类别分布,包含五个分区,能够在接近平衡的条件下评估模型,其中正常流量与侦察、DoS和通用等类别所占份额相对均匀。接下来,imbalance1和imbalance2子集更加不平衡,总共包含超过1,200,000条记录;在这些子集中,正常流量约占50-55%,而侦察和DoS攻击占有显著份额。从imb1到imb2,不平衡程度增加,从而模拟了更真实的网络场景。
为了评估模型性能,使用了独立的测试集。对于BoT-IoT,使用了约3,000条记录的Bot_test文件,其分布与训练数据相似,以DDoS和窃取攻击为主,适合用于检查模型在僵尸网络环境中的泛化能力。对于UNSW-NB15,选择了超过82,000条记录的DET_TEST集作为测试数据,其中包括利用、通用、模糊器和侦察等多种攻击,能够评估模型在面对现代攻击和更真实分布时的鲁棒性。这些测试集补充了训练数据,并增强了所获得结果的有效性。
B. 数据处理
本文针对BoT-IoT和UNSW-NB15数据集开发了两个不同的预处理函数,以有效地为基于卷积神经网络(CNN)的分类准备原始网络数据。这两个函数的关键共性在于处理的主要阶段:根据有效协议和连接状态过滤记录;提取并将二元标签转换为one-hot编码;对偏斜的数值特征应用对数变换以归一化分布;对分类变量进行one-hot编码,同时保持固定维度(总共24个特征);使用StandardScaler进行特征标准化;最后重塑为四维数组,以将特征向量解释为类似图像的CNN输入,便于提取局部入侵模式。
尽管有基本的相似性,但每个函数特定的差异源于数据集独特的结构。BoT-IoT函数通过标准化列名(例如,转换saddr/daddr/dport)、直接从攻击列提取标签、更健壮的端口处理(处理NaN、十六进制和浮点值)、简化本地IP地址以及明确移除冗余的one-hot列以避免维度不一致而得到优化。相反,用于多样化UNSW-NB15数据集的函数则侧重于直接的列命名(srcip/dstip/dsport)、标签来源以及更复杂的IP地址处理(包括更广泛地处理十六进制情况),使其更适合这些数据集内增加的数据多样性。
C. FedTransKD-IDS
鉴于该领域讨论的挑战,本研究旨在提供一种能够有效解决这些问题的全面且创新的方法。所提出的方法通过创造性地结合联邦迁移学习和知识蒸馏技术来实现预期目标。这种方法使得在联邦环境中能够将知识从强大的教师模型迁移到更轻量、更紧凑的学生模型,使得客户端(节点)可以在本地执行高效且优化的模型,而不会牺牲联邦迁移学习的关键优势。
所提出的基础模型,同时作为教师模型和联邦迁移学习框架内的主要模型,是在BoT-IoT数据集上使用联邦学习进行训练的。如图1所示,该过程从数据预处理开始,然后是全局模型的初始化。训练随后在满足Server_round < Num_rounds条件的情况下进行全局轮次;在每一轮中,服务器首先将全局模型广播给客户端。客户端使用热启动,对接收到的模型进行特定数量的本地周期训练,并将结果更新(权重或梯度)返回给服务器。接收到这些更新后,服务器使用几何中值方法对其进行鲁棒聚合,计算并记录性能指标,并更新全局模型。每轮结束时,Server_round计数器递增,此循环持续到指定轮次完成,之后记录报告并保存最终模型。此外,采用几何中值提高了模型在面对数据异构性和潜在恶意客户端时的稳定性和鲁棒性。
在联邦学习聚合中,当存在异常或潜在的恶意客户端更新时,几何中值被用作简单平均的鲁棒替代方案。给定来自n个客户端的本地模型更新 {w1,…,wn},聚合模型w* 通过解决优化问题(1)获得。
(1)
其中 ∥⋅∥2 表示欧几里得范数。通过最小化距离之和而非平方距离之和,该方法降低了对异常更新的敏感性,使其特别适用于异构环境和具有拜占庭鲁棒性的联邦设置。
在FedTransKD-IDS方法中,预训练的教师模型被用作全局知识源。其最后几层被移除,特征提取组件被冻结,作为本地节点的共享主干。对于每个节点,构建一个学生模型,由这个固定的主干和几个专用的全连接层组成。经过预处理步骤——包括过滤、数值特征归一化和分类特征编码——每个节点的数据被转换为标准输入格式。该架构的目标是将知识从全局模型迁移到具有不平衡和异构数据分布的本地环境,同时降低本地学习成本。
如图2的实现流程图所示,训练过程包括对验证数据的初始评估,然后逐周期使用混合知识蒸馏损失函数进行训练,该函数包括来自真实标签的硬损失和教师与学生输出在温度T下的KL散度。在每个周期中,将验证准确率与先前的最佳值进行比较;如果观察到改进,则保存模型并重置耐心计数器;否则,计数器递增。如果未改进的次数达到阈值,则触发早停。该机制防止过拟合,并确保为每个节点选择最佳权重。最终,为数据集的每个部分保存一个优化模型,该模型已在本地高效地吸收了全局模型的知识。
图1. 基础模型联邦学习过程流程图
图2. FedTransKD-IDS框架
IV. 性能评估
A. 实验环境
该研究实验在Google Colab环境中进行(运行时:CPU),配备Intel(R) Xeon(R) CPU(2.20 GHz)处理器和13.61 GB主内存。使用的编程环境是Jupyter Notebook,与Python 3集成,在Colab中作为运行实验的框架。采用仅CPU的执行设置,而不是依赖GPU加速器,提供了更接近资源受限边缘设备的条件,并允许评估模型行为而不依赖于专用硬件。此外,在所提出的联邦架构中,模型训练和聚合在服务器端执行,而物联网节点仅负责执行训练好的模型。因此,将实验结果映射到真实物联网环境主要需要在目标设备上部署兼容的机器学习库和Python运行时,而无需物联网节点本身进行密集计算处理。下一节将讨论输出结果。
B. 评估指标与结果
鉴于所提出的方法属于人工智能领域,系统评估指标包括精确率、准确率和召回率,以及F1分数。
混淆矩阵:混淆矩阵是用于分类型人工智能模型的评估参数。它通过将样本的真实标签与系统对这些样本的预测进行比较来构建,如(2)所示。该表由以下部分组成:TP——真阳性,TN——真阴性,FP——假阳性,和FN——假阴性[7]。
混淆矩阵 = [𝑇𝑃 𝐹𝑁; 𝐹𝑃 𝑇𝑁] (2)
准确率:反映机器学习方法正确预测结果频率的指标称为准确率。准确率的计算方法是将正确预测的数量除以总预测数量,如(3)所示[7]。
准确率 = (𝑇𝑃+𝑇𝑁) / (𝐹𝑃+𝑇𝑃+𝐹𝑁+𝑇𝑁) (3)
召回率:召回率是识别数据集中所有相关实例的能力。它定义为真阳性与真阳性和假阴性之和的比率,如(4)所示[7]。
召回率 = 𝑇𝑃 / (𝐹𝑁+𝑇𝑃) (4)
精确率:精确率是衡量机器学习方法有效性的指标。它表明算法阳性预测的准确性。它定义为真阳性与阳性预测总数的比率,如(5)所示[7]。
精确率 = 𝑇𝑃 / (𝐹𝑃+𝑇𝑃) (5)
F1分数:F1分数是精确率和召回率的平衡平均值。它将精确率和召回率结合成一个指标,如(6)所示,以提高对所提出框架有效性的理解[7]。
F1分数 = 2 × (召回率 × 精确率) / (召回率 + 精确率) (6)
在本节中,FedTransKD-IDS框架在三个不同的数据集上进行了评估。鉴于每个场景中存在多个节点以及联邦环境,选择节点零作为代表性节点来呈现场景的混淆矩阵。这些矩阵如图3所示。包括准确率、召回率、F1分数和精确率在内的其他性能指标直接根据这些矩阵的值计算,并在下文进行分析。
在本节中,基础模型在BoT-IoT数据集上进行训练。如前几节详细讨论的,FedTransKD-IDS框架的性能在四个不同的模型和四个不同的场景中进行了评估。图4至图11展示了在这些不同场景下所有节点(0到4)的关键性能指标,包括准确率、召回率、F1分数和精确率。
图3. 不同数据集分布下节点0分类的混淆矩阵:(a) BoT-IoT,(b) Uniform,(c) Imbalance1,(d) Imbalance2
图4. FedTransKD-IDS在BoT-IoT场景上的准确率指标图
图5. FedTransKD-IDS在其他三个场景上的准确率指标图
图6. FedTransKD-IDS在BoT-IoT场景上的精确率指标图
图7. FedTransKD-IDS在其他三个场景上的精确率指标图
图8. FedTransKD-IDS在BoT-IoT场景上的召回率指标图
图9. FedTransKD-IDS在其他三个场景上的召回率指标图
图10. FedTransKD-IDS在BoT-IoT场景上的F1分数指标图
图11. FedTransKD-IDS在其他三个场景上的F1分数指标图
仔细检查这些图表表明,所提出的模型在两种情况下都表现出非常强劲和稳定的性能——即当数据与训练数据集相似时,以及当数据完全不同且存在严重类别不平衡时。在大多数情况下,即使在具有挑战性的条件下,也能达到0.98以上的值,这证明了该框架在处理异构和多样化数据时具有高泛化能力和显著的鲁棒性,从而证实了所提出方法在现实环境中的优越性。
V. 结论
FedTransKD-IDS框架旨在解决联邦入侵检测中的数据异构性、隐私要求和计算限制。通过整合基于几何中值的鲁棒聚合、全局特征迁移和知识蒸馏,该框架实现了稳定收敛以及在边缘节点上高效部署轻量级模型。结果表明,将全局模型的一部分迁移到本地模型显著降低了计算和通信成本,同时在非独立同分布条件下有效保持了检测性能。这些发现表明,在联邦架构中将迁移学习与模型压缩相结合,显著增强了分布式安全系统的可扩展性和运营能力。