阿里发布 Qwen3.8-Max 叫板 OpenAI 与 Anthropic:2.4 万亿参数旗舰,号称自主编程 16 天

这是一款全新的开放权重模型,瞄准企业软件工程与多模态工作负载——当企业开始在部署效率与模型性能之间权衡时,它来了。
新闻资讯 AI 阿里巴巴
2026-08-07 18:06:34  |   作者:开源爱好者  |   来源:

阿里发布 Qwen3.8-Max 叫板 OpenAI 与 Anthropic:2.4 万亿参数旗舰,号称自主编程 16 天

这是一款全新的开放权重模型,瞄准企业软件工程与多模态工作负载——当企业开始在部署效率与模型性能之间权衡时,它来了。
新闻资讯 AI 阿里巴巴
2026-08-07 18:06:34
作者:开源爱好者
来源:

阿里巴巴本周一发布了其迄今规模最大的人工智能模型 Qwen3.8-Max,以一款面向软件工程、多模态推理及其他知识密集型业务负载的开放权重模型,扩充了其企业级 AI 产品组合。

在发布公告博客中,阿里将 Qwen3.8-Max 描述为一款 2.4 万亿参数的混合专家(MoE)模型,推理时仅激活约 950 亿参数。公司表示,该架构旨在提升推理效率,同时支持编码、推理与多模态任务;开放权重版本计划于下周通过阿里云百炼(Model Studio)发布

阿里在 X(推特)上发文称:

"我们相信这是目前最强大的模型之一,可与领先的前沿 AI 模型比肩,仅次于 Fable 5。"

基准测试剑指 Anthropic 与 OpenAI 的编程模型

阿里公布了内部测试结果:在 SWE-bench Pro 及一项名为 NL2Repo-Bench 的自研评测上,将 Qwen3.8-Max 与 Claude Opus 4.8、Claude Fable 5 以及 OpenAI 的 GPT-5.6 Sol 进行了编程基准对比。

公司表示,评测使用各家厂商自有的编码工具链——Anthropic 的模型用 Claude Code,GPT-5.6 Sol 用 Codex——并取各竞品在可用配置下公开的最高分数进行对照。

Forrester 副总裁兼首席分析师 Charlie Dai(戴鲲)表示,此次发布标志着阿里正在缩小与闭源领先者之间的差距,尽管这只是全貌的一部分。

"阿里正在缩小差距,但更值得关注的故事是开放权重模型的迅速成熟。企业正越来越多地拥有闭源前沿模型之外的可信替代方案,尤其是在软件工程、领域定制、主权以及成本敏感型部署场景——在这些场景中,开放性往往与绝对的模型性能同样重要。"

公司力推"16 天自主编程"

阿里表示,它在三个无监督的多日编程项目上测试了该模型,要求模型从空项目文件夹开始、在无人类协助的情况下独立完成任务——其中有一个项目据称耗时 16 天自主完成

阿里还强调了法律合规、财务分析、工程设计、量化研究及多模态内容创作等企业应用,称该模型的定位是完成完整的业务流程,而非单个 AI 辅助任务。

Kanerika 公司 AI 开发经理 Amit Jena 表示,这一说法值得比目前更多的审视。

"值得审视的不是参数数量。阿里说模型 16 天完成了一个软件工程项目——这句话到处被转载,却无人追问。16 天到底在做什么?人类中途介入过多少次?交付成果经得起代码评审吗?"

Jena 认为,开放权重的承诺本身也应当谨慎解读

"发布权重与开放 API 端点是两回事。在没有代码仓库、许可证和模型卡之前,开放权重描述的只是一种意图。"

分析师:推理效率并非真正的瓶颈

阿里的混合专家架构每次请求仅激活 2.4 万亿参数中的约 950 亿,公司称这一设计可降低推理成本。

戴鲲表示,对企业买家而言,这一取舍现在比单纯的模型规模更重要:

"对大多数企业来说,推理效率现在比原始模型规模更重要。只激活总参数的一小部分,可以显著降低服务成本与基础设施要求,让前沿级性能在生产部署中更容易落地——在这些场景中,可扩展性、延迟与成本往往比榜单领先更重要。"

Jena 则表示,效率提升的重要性比不上组织实际测试该模型的能力

"效率已经不是那个有趣的问题了。真正构成约束的是评测吞吐量。"

Gartner 高级首席分析师 Nitish Tyagi 认为,此次发布的意义与其说在参数数量,不如说在它释放出的、关于 AI 部署成本竞争压力的信号:

"Gartner 此前曾预测,如果缺乏更有力的成本控制,AI 编程开支可能超过普通开发者的年薪。开放权重、混合专家架构与百万 token 上下文窗口的组合,是让 AI 辅助软件开发在经济上更可行的重要一步。"

Tyagi 同时提醒,企业在评估该模型用于生产时,不能只看推理成本

"中国以外的许多组织可能不愿依赖托管在中国的模型,从而会选择通过超大规模云厂商或本地基础设施部署,这两条路都会带来额外成本。"

他还指出,开放权重模型通常缺少商业 AI 厂商附带的责任保障(indemnification),这意味着企业需要自行建立安全、治理与代码扫描管控,在生产部署前发现版权与知识产权风险。

CIO 们应该注意什么

Jena 表示,周一发布的旗舰模型未必是企业最终会跑的那个模型

"与旗舰同台发布、却几乎被报道完全忽视的 Qwen3.8-27B,才是大多数组织更可部署的选择。"

因为它可以运行在组织自有的基础设施上,并用自有数据进行微调。

戴鲲则建议,评估此次发布的企业领导者应将透明度与总拥有成本(TCO)置于头条数字之上:

"关键问题是:与竞品相比,Qwen3.8 能否带来可衡量的业务成果、企业级的可靠性、更低的总拥有成本,以及数字主权方面的选项。"