阿里发布 Qwen3.8-Max 叫板 OpenAI 与 Anthropic:2.4 万亿参数旗舰,号称自主编程 16 天
阿里发布 Qwen3.8-Max 叫板 OpenAI 与 Anthropic:2.4 万亿参数旗舰,号称自主编程 16 天
作者:开源爱好者
来源:
|
阿里巴巴本周一发布了其迄今规模最大的人工智能模型 Qwen3.8-Max,以一款面向软件工程、多模态推理及其他知识密集型业务负载的开放权重模型,扩充了其企业级 AI 产品组合。 在发布公告博客中,阿里将 Qwen3.8-Max 描述为一款 2.4 万亿参数的混合专家(MoE)模型,推理时仅激活约 950 亿参数。公司表示,该架构旨在提升推理效率,同时支持编码、推理与多模态任务;开放权重版本计划于下周通过阿里云百炼(Model Studio)发布。 阿里在 X(推特)上发文称:
基准测试剑指 Anthropic 与 OpenAI 的编程模型阿里公布了内部测试结果:在 SWE-bench Pro 及一项名为 NL2Repo-Bench 的自研评测上,将 Qwen3.8-Max 与 Claude Opus 4.8、Claude Fable 5 以及 OpenAI 的 GPT-5.6 Sol 进行了编程基准对比。 公司表示,评测使用各家厂商自有的编码工具链——Anthropic 的模型用 Claude Code,GPT-5.6 Sol 用 Codex——并取各竞品在可用配置下公开的最高分数进行对照。 Forrester 副总裁兼首席分析师 Charlie Dai(戴鲲)表示,此次发布标志着阿里正在缩小与闭源领先者之间的差距,尽管这只是全貌的一部分。
公司力推"16 天自主编程"阿里表示,它在三个无监督的多日编程项目上测试了该模型,要求模型从空项目文件夹开始、在无人类协助的情况下独立完成任务——其中有一个项目据称耗时 16 天自主完成。 阿里还强调了法律合规、财务分析、工程设计、量化研究及多模态内容创作等企业应用,称该模型的定位是完成完整的业务流程,而非单个 AI 辅助任务。 Kanerika 公司 AI 开发经理 Amit Jena 表示,这一说法值得比目前更多的审视。
Jena 认为,开放权重的承诺本身也应当谨慎解读:
分析师:推理效率并非真正的瓶颈阿里的混合专家架构每次请求仅激活 2.4 万亿参数中的约 950 亿,公司称这一设计可降低推理成本。 戴鲲表示,对企业买家而言,这一取舍现在比单纯的模型规模更重要:
Jena 则表示,效率提升的重要性比不上组织实际测试该模型的能力:
Gartner 高级首席分析师 Nitish Tyagi 认为,此次发布的意义与其说在参数数量,不如说在它释放出的、关于 AI 部署成本竞争压力的信号:
Tyagi 同时提醒,企业在评估该模型用于生产时,不能只看推理成本:
他还指出,开放权重模型通常缺少商业 AI 厂商附带的责任保障(indemnification),这意味着企业需要自行建立安全、治理与代码扫描管控,在生产部署前发现版权与知识产权风险。 CIO 们应该注意什么Jena 表示,周一发布的旗舰模型未必是企业最终会跑的那个模型:
因为它可以运行在组织自有的基础设施上,并用自有数据进行微调。 戴鲲则建议,评估此次发布的企业领导者应将透明度与总拥有成本(TCO)置于头条数字之上:
|
商情
