阿里巴巴周一正式推出迄今为止规模最大的人工智能模型Qwen3.8-Max,进一步丰富其企业级AI产品矩阵。这是一款专为软件工程、多模态推理及其他知识密集型业务场景设计的开放权重模型。
在发布公告中,阿里巴巴介绍称,Qwen3.8-Max采用混合专家架构(MoE),总参数量达2.4万亿,但在推理阶段仅激活约950亿个参数。该架构旨在提升推理效率,同时支持编程、推理和多模态任务。其开放权重版本计划于下周通过阿里云模型工厂正式发布。
阿里巴巴在社交媒体平台X上表示:"我们认为这是目前市场上最强大的模型之一,性能可与前沿AI模型媲美,仅次于Fable 5。"
性能基准测试与竞品对比
阿里巴巴公布了Qwen3.8-Max与Claude Opus 4.8、Claude Fable 5以及OpenAI GPT-5.6 Sol在编程基准测试上的对比结果,测试项目包括SWE-bench Pro以及阿里巴巴自研的NL2Repo-Bench评测集。评测中,各竞品模型均使用其官方编程工具进行测试,Anthropic模型采用Claude Code,GPT-5.6 Sol则采用Codex。
弗雷斯特研究公司副总裁兼首席分析师查理·戴表示,此次发布表明阿里巴巴正在追近闭源模型头部厂商,但背后更值得关注的是更宏观的趋势:"阿里巴巴确实在缩小差距,但更重要的故事是开放权重模型的快速成熟。企业用户在软件工程、领域定制、数据主权以及成本敏感型部署场景中,已经拥有越来越可信的替代方案,开放性的价值往往不亚于模型的绝对性能。"
16天自主编程项目引发质疑
阿里巴巴表示,其对该模型进行了三项无监督多日编程任务测试,要求模型在无人工干预的情况下从零开始完成项目,其中一个项目据称耗时16天自主完成。
Kanerika公司AI开发经理阿米特·耶纳对此提出了质疑:"真正值得审视的,不是参数数量。阿里巴巴声称模型在16天内独立完成了一个软件工程项目。这句话被到处转载,却从未被认真追问——16天到底是什么概念?期间有多少次人工介入?最终代码通过代码审查了吗?"
耶纳同时对"开放权重"的表述提出了警示:"发布权重与开放API接口是两回事。在仓库地址、许可协议和模型说明卡都到位之前,'开放权重'描述的只是一种意图。"
推理效率成企业关注焦点
阿里巴巴表示,混合专家架构每次推理仅激活约950亿参数,有助于降低推理成本。
查理·戴表示,这种成本效益权衡对企业买家的重要性已超过原始模型规模:"对大多数企业而言,推理效率的重要性已超过模型的原始规模。仅激活总参数中的一小部分,可以显著降低服务成本和基础设施要求,使前沿级别的模型性能在对可扩展性、延迟和经济性更为敏感的生产环境中变得更加可及。"
耶纳则认为,效率提升本身已不是核心问题,真正的瓶颈在于企业实际评测模型的能力:"效率已经不再是最有价值的问题,真正制约企业的是评测吞吐量。"
Gartner高级首席分析师尼提什·泰亚吉指出,此次发布的意义不在于参数规模,而在于它所传递的信号——AI部署成本竞争压力正在加剧:"Gartner此前预测,若缺乏有效的成本管控,AI编程支出可能超过开发者的平均薪资。开放权重、混合专家架构与百万Token上下文窗口的组合,代表着在使AI辅助软件开发更具经济可行性方面迈出了重要一步。"
企业部署面临的隐性成本与治理挑战
泰亚吉同时提醒企业,在评估生产部署时不应仅关注推理成本:"许多中国以外的企业可能对依赖在中国境内托管的模型有所顾虑,这将促使它们转向超大规模云服务商或本地基础设施进行部署,而两种方式都会引入额外成本。"
他还指出,开放权重模型通常缺乏商业AI厂商提供的知识产权赔偿保障,企业需要自行建立安全、治理和代码扫描机制,以在生产部署前识别版权和知识产权风险。
耶纳认为,周一发布的旗舰模型未必是企业最终会使用的版本:"与旗舰模型同步发布、却几乎在报道中被完全忽视的Qwen3.8-27B,对大多数组织而言才是更具实际部署价值的选择——它可以运行在自有基础设施上,并基于自有数据进行微调。"
查理·戴最后表示,企业管理者在评估此次发布时,应将透明度和总拥有成本置于优先位置,而非聚焦于宣传性数据:"核心问题在于,与竞品模型相比,Qwen3.8能否带来可量化的业务成果、企业级可靠性、更低的总拥有成本以及数字主权方面的灵活选项。"
Q&A
Q1:Qwen3.8-Max的混合专家架构(MoE)有什么特别之处?
A:Qwen3.8-Max总参数量达2.4万亿,但采用混合专家架构,每次推理时仅激活约950亿个参数。这种设计的核心优势在于大幅降低推理成本和基础设施要求,使模型在对延迟、可扩展性和经济性要求较高的生产环境中更具实用价值,而不必为全量参数付出算力代价。
Q2:阿里巴巴声称Qwen3.8-Max自主编程16天完成项目,这个说法可信吗?
A:这一说法目前存在较大争议。Kanerika公司AI开发经理阿米特·耶纳指出,"16天"的具体含义从未被认真追问:期间是否有人工介入?最终代码是否通过了代码审查?他认为这个数字被广泛引用,却缺乏足够的事实核查,企业在参考这类指标时应保持审慎态度。
Q3:企业在部署Qwen3.8-Max时需要注意哪些风险?
A:主要有三点风险需要关注:第一,中国境外的企业可能对将数据托管于中国服务器有所顾虑,转向超大规模云服务商或本地部署会带来额外成本;第二,开放权重模型通常不提供商业AI厂商所附带的知识产权赔偿保障,企业需自行建立安全和治理机制;第三,旗舰版本Qwen3.8-Max对基础设施要求较高,规模较小的Qwen3.8-27B或许更适合多数企业实际落地。