8月初的杭州,阿里云大楼里有人给千问的模型团队传了个视频。镜头对准一个几乎空白的文件夹,里面只有一条简短的指令:创建一个自进化的智能体 Harness。
然后屏幕自动开始滚动。16天之后,这个文件夹里躺着一个名叫 oh-my-cli 的可运行框架,达到 Hermes Agent 级别——整个过程中,没有任何一个工程师伸手碰过键盘。
这是阿里巴巴千问 Qwen3.8-Max 在8月3日正式上线时抛出的一个演示。2.4万亿参数,Qwen 家族迄今最强的模型。官方没有先讲参数怎么堆出来的,而是先讲了这样一个"没人干预"的项目。这个细节,比任何跑分数字都更能说明问题。
从"回答"到"交付",差了整整一个量级
过去一年,各家大模型的竞争焦点其实一直在悄悄移动。早期比的是谁能答得更准、更全面;后来比谁能推理得更深。而到了这一两年,门槛变成了一个更硬核的词:交付。
Qwen3.8-Max 想做的,就是把这个词变成现实。官方给它设定了一个有些苛刻的测试场景:从一个空文件夹出发,自主完成一个需要十数天的真实项目,全程无需人工干预。结果它真的做到了——不只是写几段代码,而是从需求拆解、技术选型、模块开发到最终交付,一整套流程自己跑了下来。
另一个演示更贴近普通人的日常。官方说,它能"把一支法务团队约一周的审阅量压缩到一小时"。不管这个数字有没有营销成分,它指向的趋势是实在的:过去 AI 只是帮人干活,现在它开始顶替一整条工作流。
这种能力不是刷出来的。千问团队在真实环境和算力上做了联合强化学习(RL)扩展,让模型在数百种高频专业任务里反复试错、迭代。换句话说,它不再只是"读过很多书",而是"真刀真枪干过很多活"。
把200页财报和100小时长视频装进记忆
文本能力之外,Qwen3.8-Max 在多模态上的动作也值得留意。它能跨页理解200页的财报,能把100小时的长视频组织成可检索、可追溯的 Graph 记忆。
这背后的思路其实很朴素:人类看一份厚厚的年度报告,不会从头到尾死记硬背,而是在脑子里建一张"谁跟谁有关、哪笔钱流到哪"的图。千问想做的,就是把这种"图式记忆"给到 AI,让它处理长文档、长视频的时候,不再抓瞎。
更关键的是,它在执行中会持续审视自己的中间产物。一旦发现出错了,就自己定位、重新规划、修正方向。这有点像人类工程师的"代码审查"习惯——不是一次性把活干完就结束,而是边干边回头看。
这听起来像是工程细节,但恰恰是它和上一代模型的本质区别:上一代模型更像一个"回答问题的人",它给的是结果;新一代模型更像一个"能对结果负责的人",它会检查和修正。
榜单之外,真正的信号是什么
今天放榜的 Arena 三方榜单里,阿里 Qwen 仅次于 Anthropic 的 Claude 系列,整体处于全球第一梯队。价格方面也给了个很有竞争力的数:国内每百万 Tokens 输入12元、输出36元,国际价格约为 Claude Opus 5 的40%和24%。
但比榜单和价格更值得注意的,是阿里这轮的动作节奏。Qwen3.8-Max 上线的同一天,阿里的企业级 Agent 产品"千问办公"也开启了公测,直接集成进这个最新旗舰模型。下周,Qwen3.8-Max 的权重还会开源,同时开源 Qwen3.8-27B。
这释放的信号很清楚:模型本身只是地基,阿里真正想搭建的,是模型+Agent+开源生态的组合拳。模型负责"能想",Agent 负责"能干活",开源负责"让更多人基于它长出东西"。
过去两年,关于"国产大模型能不能追上海外第一梯队"的讨论从来没停过。Qwen3.8-Max 的成绩单给出一个相对明确的回答:在模型能力这个维度上,差距已经收窄到可以正面对话的程度;而在开源、生态和 Agent 落地这些维度上,中国企业甚至走得更靠前。
回到开头那个空文件夹。它其实是一个很好的隐喻:当模型足够强的时候,起点是什么并不重要。一个空文件夹、一句指令,剩下的交给时间去发酵。16天前那里空空如也,16天后那里站着一个能自己持续进化的智能体。
这一次,敲下第一行代码的,不再是人。
文中所用图片来源于网络,仅供技术学习与交流。如权利人认为存在侵权,请联系我们,我们将在24小时内处理。