news 2026/8/7 10:18:02

阿里巴巴发布Qwen3.8-Max:自主编程16天完成项目

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
阿里巴巴发布Qwen3.8-Max:自主编程16天完成项目

阿里巴巴周一正式推出迄今为止规模最大的人工智能模型Qwen3.8-Max,进一步丰富其企业级AI产品矩阵。这是一款专为软件工程、多模态推理及其他知识密集型业务场景设计的开放权重模型。

在发布公告中,阿里巴巴介绍称,Qwen3.8-Max采用混合专家架构(MoE),总参数量达2.4万亿,但在推理阶段仅激活约950亿个参数。该架构旨在提升推理效率,同时支持编程、推理和多模态任务。其开放权重版本计划于下周通过阿里云模型工厂正式发布。

阿里巴巴在社交媒体平台X上表示:"我们认为这是目前市场上最强大的模型之一,性能可与前沿AI模型媲美,仅次于Fable 5。"

性能基准测试与竞品对比

阿里巴巴公布了Qwen3.8-Max与Claude Opus 4.8、Claude Fable 5以及OpenAI GPT-5.6 Sol在编程基准测试上的对比结果,测试项目包括SWE-bench Pro以及阿里巴巴自研的NL2Repo-Bench评测集。评测中,各竞品模型均使用其官方编程工具进行测试,Anthropic模型采用Claude Code,GPT-5.6 Sol则采用Codex。

弗雷斯特研究公司副总裁兼首席分析师查理·戴表示,此次发布表明阿里巴巴正在追近闭源模型头部厂商,但背后更值得关注的是更宏观的趋势:"阿里巴巴确实在缩小差距,但更重要的故事是开放权重模型的快速成熟。企业用户在软件工程、领域定制、数据主权以及成本敏感型部署场景中,已经拥有越来越可信的替代方案,开放性的价值往往不亚于模型的绝对性能。"

16天自主编程项目引发质疑

阿里巴巴表示,其对该模型进行了三项无监督多日编程任务测试,要求模型在无人工干预的情况下从零开始完成项目,其中一个项目据称耗时16天自主完成。

Kanerika公司AI开发经理阿米特·耶纳对此提出了质疑:"真正值得审视的,不是参数数量。阿里巴巴声称模型在16天内独立完成了一个软件工程项目。这句话被到处转载,却从未被认真追问——16天到底是什么概念?期间有多少次人工介入?最终代码通过代码审查了吗?"

耶纳同时对"开放权重"的表述提出了警示:"发布权重与开放API接口是两回事。在仓库地址、许可协议和模型说明卡都到位之前,'开放权重'描述的只是一种意图。"

推理效率成企业关注焦点

阿里巴巴表示,混合专家架构每次推理仅激活约950亿参数,有助于降低推理成本。

查理·戴表示,这种成本效益权衡对企业买家的重要性已超过原始模型规模:"对大多数企业而言,推理效率的重要性已超过模型的原始规模。仅激活总参数中的一小部分,可以显著降低服务成本和基础设施要求,使前沿级别的模型性能在对可扩展性、延迟和经济性更为敏感的生产环境中变得更加可及。"

耶纳则认为,效率提升本身已不是核心问题,真正的瓶颈在于企业实际评测模型的能力:"效率已经不再是最有价值的问题,真正制约企业的是评测吞吐量。"

Gartner高级首席分析师尼提什·泰亚吉指出,此次发布的意义不在于参数规模,而在于它所传递的信号——AI部署成本竞争压力正在加剧:"Gartner此前预测,若缺乏有效的成本管控,AI编程支出可能超过开发者的平均薪资。开放权重、混合专家架构与百万Token上下文窗口的组合,代表着在使AI辅助软件开发更具经济可行性方面迈出了重要一步。"

企业部署面临的隐性成本与治理挑战

泰亚吉同时提醒企业,在评估生产部署时不应仅关注推理成本:"许多中国以外的企业可能对依赖在中国境内托管的模型有所顾虑,这将促使它们转向超大规模云服务商或本地基础设施进行部署,而两种方式都会引入额外成本。"

他还指出,开放权重模型通常缺乏商业AI厂商提供的知识产权赔偿保障,企业需要自行建立安全、治理和代码扫描机制,以在生产部署前识别版权和知识产权风险。

耶纳认为,周一发布的旗舰模型未必是企业最终会使用的版本:"与旗舰模型同步发布、却几乎在报道中被完全忽视的Qwen3.8-27B,对大多数组织而言才是更具实际部署价值的选择——它可以运行在自有基础设施上,并基于自有数据进行微调。"

查理·戴最后表示,企业管理者在评估此次发布时,应将透明度和总拥有成本置于优先位置,而非聚焦于宣传性数据:"核心问题在于,与竞品模型相比,Qwen3.8能否带来可量化的业务成果、企业级可靠性、更低的总拥有成本以及数字主权方面的灵活选项。"

Q&A

Q1:Qwen3.8-Max的混合专家架构(MoE)有什么特别之处?

A:Qwen3.8-Max总参数量达2.4万亿,但采用混合专家架构,每次推理时仅激活约950亿个参数。这种设计的核心优势在于大幅降低推理成本和基础设施要求,使模型在对延迟、可扩展性和经济性要求较高的生产环境中更具实用价值,而不必为全量参数付出算力代价。

Q2:阿里巴巴声称Qwen3.8-Max自主编程16天完成项目,这个说法可信吗?

A:这一说法目前存在较大争议。Kanerika公司AI开发经理阿米特·耶纳指出,"16天"的具体含义从未被认真追问:期间是否有人工介入?最终代码是否通过了代码审查?他认为这个数字被广泛引用,却缺乏足够的事实核查,企业在参考这类指标时应保持审慎态度。

Q3:企业在部署Qwen3.8-Max时需要注意哪些风险?

A:主要有三点风险需要关注:第一,中国境外的企业可能对将数据托管于中国服务器有所顾虑,转向超大规模云服务商或本地部署会带来额外成本;第二,开放权重模型通常不提供商业AI厂商所附带的知识产权赔偿保障,企业需自行建立安全和治理机制;第三,旗舰版本Qwen3.8-Max对基础设施要求较高,规模较小的Qwen3.8-27B或许更适合多数企业实际落地。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/7 10:17:04

SpringSecurity 6.x实战:从基础配置到生产级安全加固

1. SpringSecurity基础认知与核心价值 SpringSecurity作为Spring生态中负责认证授权的标准组件,本质上是一个基于过滤器链的安全框架。我初次接触时曾被其复杂的配置吓退,直到某次线上系统遭遇撞库攻击后才真正理解它的价值——它用声明式配置替代了传统…

作者头像 李华
网站建设 2026/8/7 10:15:05

低温对动力电池 SOX(SOC/SOH)算法估算的影响机理、误差分析与工程优化方案

文章目录 前言 一、锂电池低温核心电化学特性变化 1.1 电解液黏度上升,离子电导率指数衰减(欧姆内阻 R 0 R_0 R0​增大) 1.2 电极界面电荷转移阻力大幅提升(极化内阻激增) 1.3 固相锂离子扩散系数急剧下降(固相扩散受限,表观可用容量可逆衰减) 1.4 OCV-SOC曲线温漂、充…

作者头像 李华
网站建设 2026/8/7 10:14:07

如何写好的skill

skill的基本组成参考:Specification - Agent Skills skill写的好的地址参考: https://github.com/datawhalechina/hello-agents/blob/main/Extra-Chapter/Extra08-%E5%A6%82%E4%BD%95%E5%86%99%E5%87%BA%E5%A5%BD%E7%9A%84Skill.md 1、基础认知&#…

作者头像 李华
网站建设 2026/8/7 10:13:21

Word图表自动化管理:题注与交叉引用原理及实践指南

1. 从混乱到秩序:为什么图表管理是学术写作的“隐形门槛” 写论文、做报告,最让人头疼的环节之一,往往不是核心内容的撰写,而是那些看似“边角料”的图表管理。你有没有经历过这种场景:初稿洋洋洒洒写了五十页&#xf…

作者头像 李华
网站建设 2026/8/7 10:07:49

HMCL启动器:5个核心功能打造你的Minecraft游戏管理中心

HMCL启动器:5个核心功能打造你的Minecraft游戏管理中心 【免费下载链接】HMCL A Minecraft Launcher which is multi-functional, cross-platform and popular 项目地址: https://gitcode.com/gh_mirrors/hm/HMCL HMCL(Hello Minecraft! Launcher…

作者头像 李华
网站建设 2026/8/7 9:59:42

Windows系统MongoDB部署指南:从零安装到安全配置

1. 项目概述:为什么选择在Windows上部署MongoDB? 如果你是一名刚接触后端开发或者想自己捣鼓点小项目的开发者,数据库选型大概率会绕不开MongoDB。和传统的关系型数据库(比如MySQL)不同,MongoDB是一种文档数…

作者头像 李华