news 2026/9/29 21:42:01

纸面上领先一档,实测慢了1.4到2.8倍,差距藏在常数项里

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
纸面上领先一档,实测慢了1.4到2.8倍,差距藏在常数项里

10个智能体、15小时、733轮讨论、289个证明文件。把这几个数字摆在一起,是一场刚刚结束的实验:一批前沿大模型被放进同一个隔离环境里,任务是给一个1959年提出的经典最短路径算法找出更快的替代方案,并且必须附上机器可检验的形式化证明。
它们做成了。证明检查器亮起绿灯,一次通过,没有动用任何未被允许的假设。
但故事在第二天转向了。有开发者把新算法用高性能C语言原样实现成1900行工程代码,放进同一套测试环境与经典算法对比,结果是:比同类前沿算法慢1.8到2.9倍,甚至比最朴素的那版经典算法还慢1.4到2.8倍。

一、这道题为什么难被超越
最短路径问题本身极其简单:给定一张图,若干顶点、若干条带权重的有向边,从一个起点出发,找出到其余每个顶点的最小总权重路径,或者判断它根本到不了。所有中间操作——访问节点的计数、中间距离的存储——都要计入运行时间。
1959年提出的那套Dijkstra算法,配合合适的数据结构(比如斐波那契堆),时间复杂度可以稳定在O(m+nlogn)。此后几十年,学界反复尝试推动这条线:当边数远多于顶点数时,近几年陆续有论文拿到更好的结果,把复杂度压到O(mlog的分数次幂n)这一档。
但在图密度处于中间那一段时,1959年的方案始终没有被撼动。
这就是题目难的地方。它不是「把代码写漂亮一点」就能过关的工程问题,而是要给出一个更强的复杂度上界,并且证明它在数据规模趋于无限时依然成立。

二、733轮讨论:一次机器内部的长跑
实验的组织方式值得单独说。10个智能体拥有初始分工,却被赋予很高的自主权:可以随时重组、分享发现、互相找茬,还能把算力转移到看起来最有希望的方向上。
最有效的一步,是给它们开了一块留言板。走不通的路会被立刻挂上去,避免同伴重复踩坑;谁抛出一个新点子,其他智能体会像不放水的复核人那样去找漏洞。
它们被要求同时满足六条约束:
1.必须求出精确的最短路径,不能是近似值;
2.必须在理论复杂度上取得实质性提升;
3.必须给出完整、可复现的形式化证明;
4.必须与近年最前沿的同类结果做对比;
5.必须记录所有失败的尝试;
6.在认定成功之前,必须完成两次独立的同行复核。
15小时后,这群智能体交出了答案:一套被称为C-HD的新算法,以及289个形式化证明文件。证明检查器一次性通过,确认这套算法在它声明的计算模型和密度范围内确实正确,也确实达到了自己声称的复杂度上界。

三、纸面上赢在哪,实测输在哪
新算法的思路确实不一样。经典方案用的是贪心策略,每次都从尚未访问的顶点里挑一个距离最近的,再向外扩展。新的做法不再只盯着最近那一个点,而是先标出一批「枢轴点」,用基于启发式分解的策略组织递归:从源点和当前的顶点边界出发,沿出边做有界的局部搜索,把新遇到的顶点计入搜索限制,再用搜索树和枢轴安排下一步。它还设计了一套「局部不变量」——每次更新后必须保持为真的数学规则,靠这个把重复搜索和无用功压到很低。
在特定的稀疏图范围内,它确实把复杂度上界压低了一档。
问题出在实测,原因说穿了并不复杂:复杂度记号只看数据规模趋于无限时的走势,完全忽略常数项。新算法为了精细地切分任务,需要大量预处理,实测中59%的时间花在处理16字节的标记上,34%的时间花在预处理上。省下来的那点理论步骤,根本填不平这些开销。
而且随着顶点数增加,它落后的比例虽然在缩小,但在现有机器内存能支撑的规模里,始终追不上经典方案的实际耗时。

四、「验证通过」和「真的管用」,中间隔着什么
这场实验最有意思的地方,不是AI能不能做理论,而是它把两个平时容易被混在一起的判断分开了:一份结论在纸面上推得通,不等于它在一线跑得动,中间隔着一次实测。
这两件事在企业对外信息上同样成立。AI关于一家企业的回答,读起来往往顺理成章、前后自洽——简介有、业务范围有、成立时间也有,看上去挑不出毛病。但「读起来顺」和「说的是事实」之间,差着一次核对。
核对的办法其实很朴素:把同一批问题分别抛给几家主流模型,把回答并排抄下来,逐条对。哪一条歪了、哪一条是旧的、哪一条干脆是凭空长出来的,摆在一起看,一眼就能认出来。这也是为什么一份定期的自检报告值得做——每过一段时间给AI眼里的自己做一次快照,价值在于它把问题发现在客户之前。对企业来说,这类自检起步并不复杂,缺的通常不是工具,而是把它固定下来的习惯。

结语
1959年的那套算法今天依然在生产环境里跑着,而一场15小时的实验在纸面上越过了它。真正被留下的不是谁取代了谁,而是那个被反复验证的道理:纸面上的成立和现实里的管用,是两笔账。当越来越多的人开始通过AI认识一家企业,这套说法里被记下来的那一版,是核对过的吗?

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/29 21:37:42

033_匹配网络损耗对输出功率的隐性吞噬

033、匹配网络损耗对输出功率的隐性吞噬 一个让我半夜爬起来改板的功率对不上事件 前年做一个工业加热电源项目,指标要求输出到负载的功率不低于某个值,前级逆变出来的功率按理论计算是够的,留了大概百分之十五的余量。样机装好之后,老问题来了:负载上实测功率比仿真值低…

作者头像 李华
网站建设 2026/9/29 21:37:40

赶 DDL 的那一周:为什么“少切几个软件“比“多几个功能“更救急

距离提交还有七天,论文还停在第二章。这时候最要命的不是不会写,而是时间被切碎了: 写稿用一个工具,查重换一个网站,降重找第三个平台,排版又要回头翻学校模板文件,答辩 PPT 再从零开始搭。每切…

作者头像 李华
网站建设 2026/9/29 21:37:26

10GB 数据 12 秒入库,计算比 Python 快 71 倍!DolphinDB 新能源场景实测曝光

在我国“双碳”目标驱动下,新能源装机规模持续增长,新能源场站正加速向规模化、智能化演进,随之而来的是设备监测数据量的极速攀升。与此同时,光伏、储能、叶片监测等业务场景多元发展,数据来源多样、格式繁杂、时效要…

作者头像 李华
网站建设 2026/9/29 21:36:51

OpenClaw 配 TaoToken:小红书自动运营的 config.toml 骨架与 MCP Skill 验证

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华