1. 从一个真实的“乌龙”事件说起
去年美赛(MCM/ICM)成绩公布后,我认识的一位学弟团队经历了一场过山车。他们提交的论文在初步评审中获得了“Meritorious Winner”(一等奖)的评定,团队上下欢欣鼓舞。然而,几周后,他们收到了一封来自COMAP(美赛主办方)的官方邮件,通知他们论文因“疑似违反竞赛规则”而被取消资格,最终成绩被标记为“Disqualified”(取消资格)。邮件内容非常简短,只提到了“Unusual Similarity”(异常相似性),并要求他们如有异议可以申诉。整个团队瞬间懵了,他们反复确认,绝对没有抄袭、没有购买成品、没有使用任何违规的AI工具生成核心模型和论文正文。经过紧张的材料准备和申诉,又过了漫长的一个月,他们才收到复核通知,确认是误判,恢复了奖项。这件事让我深刻意识到,对于美赛这样一项全球性的学术竞赛,其“反作弊”机制远比我们想象的要复杂和严格,而且其判定逻辑并非完全透明,很多细节是参赛者容易忽略的“雷区”。今天,我就结合这个案例以及多年来辅导和观察的经验,深入拆解一下美赛官方是如何判定作弊的,以及我们该如何在规则内安全地“航行”。
2. 美赛反作弊系统的核心:多重过滤与交叉验证
很多人以为美赛查作弊就是查重,类似知网。这个认知是片面的,甚至是有害的。美赛的反作弊是一个立体的、多层次的系统,其核心目标不是抓住“作弊者”,而是维护竞赛的公平性和学术诚信。这套系统可以理解为几道连续的过滤网。
2.1 第一道网:格式与基础规则审查
在论文进入实质内容评审前,系统会进行自动化与人工结合的基础审查。这部分主要针对硬性规则:
- 页数限制:严格检查正文是否超过20页(2023年及之后规则),附录是否超过25页。超页会直接导致扣分甚至取消资格。
- 控制编号与摘要页:检查是否包含了正确的控制编号和摘要页。摘要页是独立于正文页数之外的,但必须存在。
- 文件格式与命名:提交的PDF文件是否符合要求,命名是否正确(如
2312345.pdf)。 - 团队信息一致性:注册时填写的队员信息与最终论文署名是否一致。
这部分看似简单,但每年都有团队因疏忽在此翻车。例如,有团队将摘要算入了正文页数导致超页;或者提交了错误的文件版本。这些“低级错误”会被系统快速标记,可能影响后续评审的观感,甚至触发更严格的审查。
2.2 第二道网:文本相似性检测(查重)
这是大家最熟悉的环节,但美赛使用的系统和比对库有其特殊性。
- 比对库:主要包括历年美赛优秀论文库、公开的学术数据库(如部分期刊、会议论文),以及当届所有提交的论文。这意味着,你抄袭往届O奖论文、抄袭网上某篇相关研究,或者与其他参赛队“交流”过度导致论文部分雷同,都会被检测出来。
- 检测重点:
- 摘要:这是重中之重。摘要需要高度原创,清晰概括你们的方法和结论。直接套用往届摘要模板或大量使用常见套话,可能导致相似度偏高。
- 模型描述与假设:对问题背景、模型假设的通用性描述如果完全照搬教科书或网络资料,也可能被标记。关键在于要用自己的语言重新组织。
- 结论:结论部分的独创性也很关键。
- 阈值与人工研判:系统会生成一个相似度百分比报告,但没有一个固定的、公开的“合格线”。相似度报告会提交给评审委员会和仲裁委员会。他们关注的是“异常相似”的模式,例如:两篇毫不相干的论文在模型核心推导部分出现大段重合;或者一篇论文的摘要与某篇网络资源高度相似。低比例的、不可避免的相似(如对通用名词的定义)通常不会被追究。
注意:直接使用翻译软件将中文思路翻译成英文论文是极度危险的行为。这不仅会导致语言生硬,更重要的是,如果多人采用类似的中文模板再翻译,其生成的英文文本结构可能会呈现出诡异的相似性,容易被系统捕捉到。
2.3 第三道网:模型与结果的“合理性”审查
这是美赛反作弊的“高阶”部分,也是很多团队意识不到的。评审专家和仲裁委员会成员都是经验丰富的教授和研究者,他们具备强大的专业直觉。
- 模型与问题的匹配度:如果一个问题明显需要用动态规划或模拟,而你的论文通篇只用了简单的线性回归,却得出了非常“漂亮”的结果,这会引起怀疑。
- 结果的“过于完美”:在存在大量不确定性的实际问题中,如果你的结果精确到小数点后很多位,且与任何合理预期都完全吻合,这反而不真实。合理的模型应该能处理噪声,结果应有适当的误差分析。
- 代码与论文的对应关系:虽然不要求提交代码,但论文中描述的算法、流程图必须清晰、合理。如果描述了一个复杂的算法,但给出的结果看起来像是用简单方法就能生成的,专家会质疑其真实性。在申诉或争议处理阶段,组委会可能会要求提供代码、数据或计算中间过程进行验证。
- 可复现性逻辑:论文中的步骤是否逻辑自洽,他人根据论文描述是否能大致复现你们的工作。如果关键步骤缺失或逻辑跳跃巨大,也会被标记审查。
我那位学弟团队的“乌龙”事件,事后分析,很可能就是在“模型合理性”环节被初步标记的。他们针对一个非线性优化问题,使用了一种改进的启发式算法,并在论文中引用了一篇较为冷门的参考文献来佐证其有效性。巧合的是,当届可能有另一支队伍也引用了同一篇文献,并采用了类似的技术名词表述框架。系统在文本相似性检测中可能发现了这种“共引”和“术语簇”的相似,结合他们模型结果的一些突出特性,触发了“异常相似”的警报,从而进入了人工仲裁流程。
2.4 第四道网:跨团队比对与行为模式分析
这是针对集体作弊或购买“成品”论文的终极手段。
- 当届论文横向比对:COMAP拥有当届所有提交的论文。计算机会对所有论文进行交叉比对,寻找超出正常范围的相似段落、相同的图表数据、甚至相同的排版错误或字体。
- 写作风格分析:虽然不公开说明,但高级的文本分析工具可以评估写作风格的一致性。如果一篇论文的不同部分(如摘要、模型、结论)在句式复杂度、词汇选择、学术风格上存在显著差异,可能暗示有多人代写或拼凑的痕迹。
- IP地址与提交行为:虽然官方强调不基于IP判定,但极端情况下(如大量论文从同一IP地址或极小地理范围提交),这可能作为辅助信号,结合内容相似性进行综合判断。
3. 哪些行为会被明确判定为作弊?
根据COMAP官方规则和历年判例,以下行为几乎100%会导致被取消资格(Disqualified):
- 购买或获取现成的论文/解决方案:从任何渠道获取非本团队独立完成的成果。
- 与竞赛以外的任何人讨论赛题或获取思路:包括咨询老师、学长、网友等。团队所有讨论应仅限于三名队员内部。
- 使用禁用的人工智能工具生成论文内容:这是当前最大的灰色地带和风险区。COMAP规则明确禁止使用AI生成“文本”(Prose)。这意味着,用ChatGPT、Gemini等工具直接生成论文段落、摘要、模型描述是违规的。但是,使用AI进行语法检查、润色表达、翻译辅助(非生成)、或者作为编程工具(如生成和调试代码)是允许的。关键在于“生成核心学术内容”的边界。
- 抄袭:直接复制粘贴任何来源(书籍、论文、网页、往届赛题论文)的句子或段落而不引用。
- 团队协作超出范围:两个或多个参赛队之间分享任何形式的成果。
- 在竞赛期间公开讨论赛题:在社交媒体、论坛等公共场所发布或讨论赛题细节、解题思路。
- 提交非参赛队员完成的成果:请他人代写、代码、代做模型。
4. 高风险行为与“灰色地带”避坑指南
很多队伍并非故意作弊,而是在一些“灰色地带”操作不当,引火烧身。以下是我总结的避坑要点:
4.1 关于文献与资料的使用
- 可以做的:阅读任何公开的书籍、论文、网站资料来获取知识背景。在文中合理引用。
- 不能做的:直接复制资料中的文字作为自己的描述。即使是“常识性”描述,也务必改写。例如,描述“蒙特卡洛模拟是一种基于随机抽样的统计方法”,这句话在很多资料里都有,你必须换种说法,如“我们采用蒙特卡洛模拟技术,该技术的核心是通过大量随机采样来近似求解复杂问题的数值结果”。
- 建议:在文献调研阶段,用自己理解的话做笔记,而不是复制粘贴。写作时,关闭所有参考资料窗口,凭自己的笔记和理解来撰写。
4.2 关于编程与计算工具
- 可以做的:使用任何软件(MATLAB, Python, R, SPSS等)、任何库、任何开源代码包。使用AI助手(如GitHub Copilot, ChatGPT)来帮助编写、调试或解释代码。
- 高风险行为:直接使用网上找到的、针对该赛题的完整代码或模型,并将其结果作为自己的成果。即使你修改了参数,其核心框架和算法思路如果不是你们独立构思的,就存在风险。
- 建议:将AI生成的代码视为一个“高级搜索引擎”的结果。你必须完全理解每一行代码的作用,并能根据你们的具体模型进行调整和重写。在论文中,应重点阐述你们如何设计算法,而不是仅仅贴出代码。
4.3 关于写作与润色
- 可以做的:使用Grammarly等工具检查语法和拼写。使用词典和同义词工具丰富表达。在竞赛结束后,可以请他人阅读并提出修改建议(但必须在提交前完成所有修改)。
- 绝对不能做的:在竞赛期间,将你们的思路、模型描述或数据输入给ChatGPT等工具,并让它“写一段关于这个模型的论文段落”或“生成摘要”。这是典型的“生成文本”违规行为。
- 高风险区域:用AI工具“重写”(Rewrite)或“扩写”(Expand)你们自己写的句子。如果只是调整语序、替换同义词,风险较低;但如果AI完全改变了句子的学术内涵或添加了原本没有的论点,就进入了危险区。
- 建议:最安全的做法是,所有核心学术内容(问题重述、假设、模型建立、推导、结论)的初稿必须由队员亲手写出,哪怕句子很生涩。之后,可以基于自己写的句子,使用AI工具进行“polishing”(打磨),即只改善语言流畅度、纠正语法,而不改变技术事实和逻辑。保留你们最初的草稿版本,以备不时之需。
4.4 关于团队合作与外部沟通
- 可以做的:三名队员之间任意讨论。使用任何工具进行内部沟通(微信、腾讯会议等)。
- 绝对不能做的:在比赛期间,与任何非队员(包括指导老师、其他队伍同学、线上网友)讨论赛题的具体内容、模型思路、数据或结果。甚至在私人聊天中抱怨“这个题好难,我们用了XXX方法”都可能构成风险(虽然被发现的概率小,但原则如此)。
- 建议:比赛期间,团队自成一个信息孤岛。所有资料查找都应是“只读”的,即从公开渠道获取信息,但不向外输出你们的任何进展。
5. 如果被误判,申诉流程与材料准备
就像我学弟团队的经历,误判是有可能发生的。如果你坚信自己没有违规,可以申诉。申诉流程通常如下:
- 收到通知:COMAP会发送正式邮件,告知论文被标记,并给出初步原因(如“Unusual Similarity”)。
- 准备申诉信:这是最关键的一步。申诉信不是情绪宣泄,而是一份严谨的“辩护状”。
- 态度:保持尊重、冷静、专业。
- 内容:
- 清晰陈述你们没有违反任何规则。
- 针对指控点进行逐条反驳。如果原因是“相似性”,详细解释你们模型中任何可能与他人相似的部分是如何独立得出的。可以提供思维导图、草稿纸记录、软件操作历史日志(如MATLAB命令历史、Overleaf版本历史)作为证据。
- 提供你们的工作过程证据:这是最有说服力的。包括:
- 版本历史:Overleaf/Git的版本提交记录,显示论文是如何一步步由简到丰富写成的。
- 代码开发记录:脚本文件的修改时间戳、带有时间注释的代码版本。
- 数据文件:原始数据、中间处理数据、最终结果数据。
- 团队内部聊天记录(关键部分):显示你们在比赛期间的讨论过程,注意抹去个人信息。
- 解释模型与结果的合理性:从学术角度,详细阐述你们为什么选择这个模型,结果为什么是合理的,任何看似“突出”或“巧合”的地方都有其内在逻辑。
- 提交申诉:在截止日期前,通过官方指定渠道提交申诉信和所有证据。
- 等待仲裁:COMAP会有一个仲裁委员会重新审查论文和你们的材料。这个过程可能长达数周。
- 收到结果:最终裁定为维持原判或撤销判罚。
申诉的成功率取决于证据的扎实程度和指控的具体性质。对于明显的抄袭或购买行为,申诉毫无意义。但对于因独立研究巧合或AI使用边界模糊导致的误判,充分的证据链是翻盘的唯一希望。
6. 终极建议:将学术诚信内化为工作习惯
与其战战兢兢地躲避规则,不如从一开始就将学术诚信作为团队的工作准则。
- 独立是金:坚信你们三个人的智慧足以解决这个问题。所有想法,从最蠢的开始,自己推导、自己验证。
- 过程留痕:养成随时记录的习惯。用Overleaf写论文,用Git管理代码,用共享文档记录每天的讨论要点和决策。这些痕迹不仅是申诉的证据,更是你们团队协作的宝贵财富。
- 理解而非套用:对于任何引用的方法、代码、公式,确保每个队员都理解其原理和在本问题中的应用方式。这样写出来的文字才是你们自己的。
- 诚实面对结果:如果模型结果不理想,分析原因并写在论文里,这比一个完美但无法解释的结果更真实、更安全、也往往更能体现你们的工作量。
- 赛后复盘:比赛结束后,可以公开讨论,对比其他队伍的思路,找出自己的不足。这才是参赛最大的收获。
美赛的魅力在于用96小时挑战一个开放性问题,这个过程本身的价值远大于奖项。官方严格的反作弊机制,虽然有时会带来“误伤”的阵痛,但根本上是为了守护这份价值的纯粹性。清晰了解规则,在界限内尽情发挥你们的创造力,这才是通往成功最稳健的道路。记住,你们产出的不仅仅是一篇论文,更是一个关于团队、关于思考、关于诚信的完整故事。