ARC 得分只差 4.7 个点,推理成本却差 57 倍:150M 参数的 BDH-CQ 把单题成本打到 0.07 美分
一道抽象推理题,跑一次只要 0.07 美分,约等于半厘钱。在这个价位上,一个只有 1.5 亿参数的模型拿到了 29.5% 的正确率。作为对照,OpenAI 的 GPT-5.6 Luna 用省电模式能答对 34.2%,只比它高 4.7 个百分点,但单题成本是 4 美分,贵了大约 57 倍。也就是说,一个参数规模小了几个数量级的模型,在 ARC-AGI-1 上差点追平大模型,成本却只是零头。
这篇论文 8 月中旬出现在 Hugging Face 每日论文上,arXiv 编号 2608.09888。研究团队来自 Pathway,一家专做后 Transformer 架构的 AI 实验室。BDH-CQ 的名字拆开看,前一半来自实验室自研的 BDH(Dragon Hatchling)架构,后一半指向它最特别的地方:把上下文学习和循环隐空间推理装进同一个系统。它不打一个字草稿,也能把一道没见过的推理题解出来。
一、先看两个数字
ARC-AGI-1 是什么,决定了 29.5% 这个分数有多大分量。它全称 Abstraction and Reasoning Corpus,是一个专测「从极少示例里现场学新规则」的抽象推理基准。每道题先给几个输入输出的彩色网格示范,再给一个待解的网格,模型要当场悟出背后的变换规则并应用。它不允许调用任何外部知识,也没法靠背题,被认为是衡量「举一反三」能力的硬骨头。
BDH-CQ 在这套公开评测的 400 道题上,用 ARC 榜单通行的 pass@2 口径(两次尝试里答对一次就算对)拿到了 29.5%。跑一道题平均约 0.85 个 H200 GPU 秒,按每小时 3 美元的算力价格折算,单题成本约 0.0007 美元,也就是 0.07 美分。
真正刺眼的是把它放进「得分对成本」坐标里看。按 ARC Prize 截至 2026 年 7 月的成本口径,GPT-5.6 Luna(低推理档)得分 34.2%,单题 4 美分,是 BDH-CQ 的约 57 倍。即便把 OpenAI 在 7 月 30 日对 Luna 公开 API 降价 80% 算进去,价差仍然有约 11 倍。论文的表述是:这个工作点刷新了 ARC-AGI-1 此前报告的成本精度帕累托前沿,在同等或更低成本下,没有任何已记录系统能拿到至少这个分数。
二、要解决的问题:想得越深,烧得越贵
为什么 ARC 上一直只有大模型玩得起?根子在主流推理模型的实现方式。
今天的推理模型普遍靠「思维链」思考,也就是把推理过程一步步写成文字 token,再把这些 token 喂回模型继续推。思路越绕,生成的 token 越多,成本几乎跟着字数线性涨。ARC 这类题又偏偏要求模型在极短的时间里学会一个新规则,很多模型会把思考过程拉得极长来「硬想」,单题成本因此居高不下。
另一条路是上下文学习,把几个示范直接塞进上下文窗口,让模型在推理时照着学。可上下文窗口是越长越贵的东西,示范一多,注意力计算和缓存占用都跟着涨,同样不便宜。
BDH-CQ 想同时拆掉这两个成本来源:既不在推理时吐一堆文字草稿,也不把示范无限堆进上下文。它把「记忆新规则」和「多步思考」都搬进一个不产生文字的隐空间,让推理成本的增速和思考深度脱钩。
这篇论文另一个不寻常的地方,是把成本账算到了每一道题。过去 ARC 榜单上的高分大多来自数百亿甚至数千亿参数模型的长思维链,单题成本动辄几美分甚至更高;BDH-CQ 用实测的硬件时间而不是 API 报价来折算成本,把「单题多少钱」摆到台面上,这也是「刷新帕累托前沿」这个说法能够成立的前提。成本口径一旦统一,模型的架构差异就直接转化成了账单上的数字差。
三、方法关键创新:不吐字的推理,推理期更新的记忆
BDH-CQ 的处理流程可以分成三步看。
第一步是吸收示范。题目给出的若干示范会被逐条送进模型,不断更新一个循环记忆状态。这个状态是固定大小的,不随示范数量线性膨胀,相当于把示范背后的「规则」压缩进一个紧凑的表示,而不是把示范原文全部摊开。
第二步是隐空间思考。示范吸收完之后,模型在一个高维隐空间工作区里做多轮迭代计算,逐步精化对答案的估计。整个过程不把中间推理状态翻译成语言,你只会看到输入进去,答案出来,中间想了几轮、想了什么,都不以文字形式出现。
第三步是输出。模型把最终隐状态解码成答案网格。
有几个设计细节值得单独说。第一,推理过程中参数完全冻结,不更新任何权重,变的只是记忆状态。第二,训练时既不给任务标识符,也不用评估任务的示范对,避免模型靠「认题」作弊。第三,训练数据是一套 ARC 风格数据混合,包括 ARC-AGI-1 训练集、RE-ARC、ConceptARC、ARC-Heavy、ARC-GEN100K 等,再叠加数据增强。
和 Transformer 最本质的差别在这里:Transformer 的「记忆」是越来越长的 KV 缓存,上下文多长,缓存就多长;BDH-CQ 用的是有界循环关联状态,上下文信息被压进固定大小的记忆里。这套设计源自 Pathway 的 BDH 架构,用高维正激活和低秩通信替代标准的注意力前向过程。
推理深度还能按需调节。论文里报告了一个 effort 旋钮:推理轮数从低档提到高档,pass@2 从 21% 涨到 29.5%,成本同步上升。也就是说,你可以对简单的题少想几步、对难的题多想几步,部署时多了一个精度和成本的自由调节项。
四、实验结果:一张表看懂差距
把 29.5% 放进主流系统里比较,最直观的是一张对照表。
| 系统 | ARC-AGI-1 pass@2 | 单题推理成本 | 说明 |
|---|---|---|---|
| BDH-CQ(150M 参数) | 29.5% | 约 0.07 美分 | 约 0.85 H200 GPU 秒/题 |
| GPT-5.6 Luna(低推理档) | 34.2% | 约 4 美分 | ARC Prize 2026 年 7 月口径 |
| 两者差距 | 4.7 个百分点 | 约 57 倍 | Luna 7 月 30 日降价后约 11 倍 |
论文不只报了一个总分,还做了一组受控实验,看这个小模型到底「学会」了什么。结果有四条:它能绑定新的映射关系,示范里出现过的颜色、形状对应能被记住并应用;它能外推部分学过的算子,见过的变换换一种长相出现也能处理;示范覆盖度越高,准确率越高,说明它确实在利用上下文信息;当需要把两个算子组合时,它的失败是结构化的,而不是均匀乱错,说明模型的局限有规律可循,不是纯粹碰运气。
五、意义与局限
这篇论文最有冲击力的结论是一个观念层面的反转:思考不必等于说话。过去几年,AI 推理的能力几乎和「生成长文本思维链」画等号,成本也跟着 token 数走。BDH-CQ 用 150M 参数证明,把推理搬进隐空间迭代,可以让「聪明」和「便宜」不再互斥,至少在这个任务上是这样。
它对行业也有现实含义。如果这类架构能从 ARC 扩展到大语言模型擅长的领域,token 计费式的推理成本模型会被重估:不吐字的思考,天然没有 token 费。论文也提到,团队在 1B 到 600B 参数规模的预训练中观察到与 Transformer 类似的扩展规律,说明这条路在更大规模上未必会撞墙,计划下一步把架构推向数学推理、ARC-AGI-2 和 ARC-AGI-3。
局限同样要讲清楚。第一,评测主要落在 ARC-AGI-1 公开 400 题上,语言、数学、长文本推理都还没有证明。第二,ConceptARC 细分上,严格任务准确率和 test-pair 准确率之间有差距,意味着同一道规则换一组测试输入时,它仍会翻车。第三,0.07 美分是折算成本,由实测硬件时间乘单价得到,不是 API 报价。第四,150M 参数是当前主打配置,更大的模型还没发布,说它能全面挑战前沿大模型为时尚早。
还要提醒一句:4.7 个百分点的差距是在 ARC-AGI-1 公开 400 题上测出来的,论文作者的结论也严格限定在「成本效率」而非「绝对能力」,没有宣称小模型已经全面超越大模型。ARC 的分数只是衡量通用智能的一个窗口,距离真正的通用能力还很远。
对读者来说,值得记住的不是「29.5 超过 34.2」这种错误结论,而是另一句话:当推理不再按字计费,AI 应用的成本结构可能会被整个重算。这条路刚开了一个头。