1.2.2国内研究现状
国内相关研究起步稍晚,但发展速度较快。早期工作集中在中文文本分析领域,2015年复旦大学团队提出基于语义相似度的检测方法,通过计算多条转发内容的文本重复率识别可疑信息。这种方法对原样转发的简单谣言有效,但无法应对修改关键词的变种传播。2017年,北京邮电大学团队尝试结合用户社交关系数据,通过分析传播路径中的关键节点属性(如粉丝数、认证状态)构建决策树模型,准确率达到76%。这类方法依赖人工设计规则,难以适应动态变化的网络环境。
2019年后,国内学者开始关注传播网络的结构特征。浙江大学研究团队利用社区发现算法,将微博转发用户划分为不同群体,通过分析群体间信息流动模式识别异常传播。该方法在公共安全事件数据集上取得82%的召回率,但计算复杂度较高。2020年,中国科学院信息工程研究所首次将图注意力网络应用于中文谣言检测,通过自动学习转发关系中的权重分布,有效识别传播网络中的核心节点。实验表明,该方法在相同数据集上的准确率比传统图卷积网络提高5%。2021年,清华大学团队改进模型结构,在神经网络中加入时间衰减因子,使算法能够捕捉信息传播的热度变化趋势,这对识别短期爆发的谣言具有显著效果。
当前国内研究呈现两个主要方向。一方面,部分团队致力于优化中文文本处理,例如将分词技术与预训练模型结合,提升对网络流行语、谐音词的识别能力。2022年,哈尔滨工业大学团队发布中文谣言检测专用预训练模型,在35万条微博数据上微调后,文本语义分析的准确率提升至88%。另一方面,研究者开始探索轻量级应用方案。2023年,南京理工大学团队开发基于Flask框架的检测系统,支持用户上传传播数据并返回可视化分析结果,这对降低技术使用门槛具有实际意义。不过现有系统大多停留在实验室环境,在实时响应速度和复杂场景适应性方面仍需改进。
1.3 研究主要内容
本研究围绕社交媒体谣言检测需求,设计并实现基于图神经网络的自动化检测系统。首先针对中文微博传播数据特点,开发数据解析模块处理JSON格式的原始数据,提取关键信息并构建转发关系图。通过分析传播网络的节点连接方式,提取包括传播深度、转发密度、时间跨度等六类结构特征。系统采用图注意力网络作为核心模型,通过三层网络结构学习节点间的权重关系,实现传播模式的深度挖掘。在应用层搭建Flask框架实现可视化交互,用户可通过网页上传数据或输入文本,系统返回检测结果及传播网络分析图表。整个研究覆盖数据处理、特征工程、模型训练和系统部署全流程,重点解决传统方法在传播结构特征提取不充分、检测结果可解释性差等问题,最终形成一套可在普通计算机运行的轻量化检测工具。
3.2功能需求分析
系统需要实现四个核心功能模块以满足谣言检测需求,每个模块的具体要求如下:
数据上传与解析模块:负责处理用户输入的微博传播数据。支持两种输入方式:上传JSON文件或直接粘贴JSON文本。系统需要检查文件格式是否符合要求,包含微博ID、用户ID、文本内容、发布时间和转发关系字段。解析过程中自动过滤缺失关键字段的数据条目,将有效数据转换为Python字典格式存储。该模块需在5秒内完成50条以下数据的解析工作,并在检测到格式错误时弹出提示信息。
传播树构建模块:将解析后的数据转化为图结构。根据每条微博的转发关系字段,使用NetworkX库构建有向图。根节点自动识别为没有父节点的微博,子节点通过边连接表示转发路径。模块需要处理可能存在的孤立节点问题,对无法匹配父节点的数据单独存放但不加入传播树。构建过程需在10秒内完成200节点以内的数据处理,输出包含所有节点属性和边关系的图对象。
特征提取模块:从构建好的传播树中提取八类结构特征。包括基础指标如节点总数、转发次数,复杂指标如传播最大深度、网络密度等。时间特征需计算首条与末条微博的时间差并转换为小时单位。该模块要求所有特征在1秒内完成计算,输出格式为字典类型,便于后续模型直接调用。
谣言检测模块:调用训练好的图神经网络模型进行预测。将特征提取模块的输出转换为模型可处理的张量格式,经过两层图注意力网络计算后得到分类概率。模块需返回“谣言”或“非谣言”的二分类结果,同时显示置信度百分比。检测过程需在3秒内完成,支持同时处理5个以下并发请求。
结果显示模块:在网页界面直观呈现检测结果。顶部显示红色或绿色的结论标签,中部用表格列出传播树节点数、转发层级等关键指标,底部展示置信度数值。对于传播树规模小于50节点的数据,附加显示简化的树状结构示意图。页面元素要求自适应屏幕尺寸,在主流浏览器上正常显示无错位。
3.3模型分析
系统数据模型围绕微博传播数据的处理流程展开,主要包含五个核心部分:原始数据层负责接收用户上传的JSON文件或文本输入,通过解析模块提取微博ID、转发关系等关键信息;传播树构建层将这些离散数据转换为NetworkX图对象,节点存储文本内容与时间戳,边记录转发路径;特征计算层遍历图结构提取网络密度、传播深度等八类数值特征,转换为标准化的字典格式;模型推理层将特征字典转换为张量格式输入预训练好的GAT模型,经过两层注意力网络计算后输出分类概率;结果展示层将概率值映射为“谣言/非谣言”标签,结合传播树可视化生成最终检测报告。各层之间通过数据格式转换实现解耦,例如JSON解析器输出标准字典后触发传播树构建器,特征提取完成后自动调用模型预测模块,这种流水线设计确保单个模块故障不影响整体流程。
5.1谣言检测
谣言检测系统代码运行后,访问端口,进入检测界面,该界面的主要作用便是上传微博传播数据,AI将分析其是否为谣言。通过上传JSON格式的微博传播数据,文件应包含微博ID、用户ID、文本内容、日期和转发关系等信息。点击开始检测。下方检测结果DIV中便会展示该文件的检测结果。如下图5-1所示:
图5-1 谣言检测界面图
5.2文件选择
点击选择文件,弹出文件选择的界面窗口,窗口访问系统的文件系统,选择相应的JSON文件进行检测。如下图5-2所示:
图5-2 文件选择界面图
5.3文本检测
下方文本框中,可直接输入JSON格式的微博传播数据进行检测。输入数据后,点击使用文本数据检测。检测结果框中也会生成检测结果。最下方的使用说明栏中介绍描述输入数据的格式要求和关于模型介绍。如下图5-3所示:
图5-3 文本检测界面图