阿里发布 Qwen3.8-Max:2.4 万亿参数,押注长任务与自主编程
阿里巴巴发布 Qwen3.8-Max,扩展至 2.4 万亿参数、推理激活 95B 参数并支持图像、文本与视频输入,最长上下文达 1M tokens。官方强调长任务和自主编程能力,模型权重将于下周开源,但外部独立验证仍待跟进。
阿里巴巴发布 Qwen3.8-Max,扩展至 2.4 万亿参数、推理激活 95B 参数并支持图像、文本与视频输入,最长上下文达 1M tokens。官方强调长任务和自主编程能力,模型权重将于下周开源,但外部独立验证仍待跟进。
阿里巴巴 Qwen 团队在 8 月 2 日发布旗舰模型 Qwen3.8-Max,并称这是 Qwen 家族目前最强的版本之一。按照官方博文的说法,这款模型基于 Qwen 3.5 的架构基础扩展到 2.4 万亿参数,其中 95B 参数在推理时激活;模型权重将于下周开源,而现在已经可以通过 QwenCloud 的 API 调用。
QwenCloud 的模型页显示,Qwen3.8-Max 支持图像、文本和视频输入,最长上下文窗口达到 1M tokens,最大输出为 131K tokens。页面同时列出价格:输入 每百万 tokens 2 美元,输出 每百万 tokens 6 美元;页面更新时间标注为 8 月 2 日。
阿里想证明的不只是“更大”
这次发布最受关注的,并不只是参数规模。Qwen 在博文中把 Qwen3.8-Max 形容为一个能够“端到端交付复杂任务”的模型,重点强调编码、办公、科研和长周期任务能力。官方还把它的能力描述为覆盖视觉理解、长文档分析和长视频理解,并称模型在复杂任务中会通过反馈闭环持续迭代。
在代码能力上,Qwen 给出了一组最具传播性的案例:模型被要求从零创建一个名为 oh-my-cli 的项目,并在一个持续 16 天 的自主编程流程里不断改进;Qwen 说,这个过程累计留下 265 次 commits、127 个 PR 和 151 个 issues。官方还披露,另一个长程案例里,模型连续工作约 125 小时,写下约 7,600 行代码,执行超过 1,100 步操作,完成 33 轮 GPU 训练,并在此基础上继续优化结果。
Qwen 在博文中强调,这些任务“全程没有任何人工帮助”。不过,这类演示仍然属于厂商自测,尤其在长任务、工具链和自我修复能力上,外部独立复现仍然是判断其真实水位的关键。
官方 benchmark 亮眼,但仍需外部验证
Qwen 公布的 benchmark 图表同样很激进。按原始发布材料,Qwen3.8-Max 在 PaperBench、OSWorld-Verified 和 Terminal Bench 2.1 上分别拿到 93.0、86.1 和 86.6 的分数;Qwen 方面同时表示,部分对比使用了不同 harness 或公开榜单数据,因此这些结果更适合作为厂商自报能力的参考,而不是终局判断。
Reuters 的报道也延续了这种谨慎语气。该社在 8 月 3 日的报道中写道,Qwen3.8-Max 让阿里巴巴股价在港股盘中上涨约 7%,并指出该模型在公开排行榜上迅速上升,但仍落后于 Anthropic 的部分旗舰模型。Reuters 同时提到,Qwen3.8-Max 支持文本、图像和视频,最长可处理 100 万 tokens,并且其混合专家设计使得每次推理只激活 95B 参数。Reuters
CNBC 的报道进一步强调了它的产品定位:Qwen3.8-Max 被阿里描述为“最强”的模型之一,支持 100 万 token 上下文,能够处理编码、现实工作、研究、长任务和视觉理解;CNBC 还援引阿里展示的结果称,该模型在 Vision Arena 中位列第二、在 Text Arena 中位列第五。CNBC
中国前沿模型竞争继续升温
Qwen3.8-Max 的发布时间点并不孤立。过去几周,中国前沿模型厂商都在把叙事重点从“更大参数”转向“更长任务、更强工具调用、以及更容易部署”。AIFlux 早前已分别报道过 DeepSeek 发布 V4-Flash-0731:Agent 能力升级,开放部署继续推进 和 Moonshot 正式放出 Kimi K3 开放权重,2.8 万亿参数模型进入可下载阶段,两篇报道都把“agent 能力”“开放权重”和“本地部署”放在了同一条主线上。
在这条竞争线上,Qwen3.8-Max 的表述更像是在把“会写代码”升级成“能把项目做完”。这和 Qwen 过去几周另一篇围绕 Qwen-Image-3.0:阿里巴巴把图像生成推向“更像工作工具”的阶段 的报道也能对应起来:阿里旗下 Qwen 产品线正在把生成式 AI 一路往“更可用、更像工具”的方向推进,只是这一次的主战场换成了代码、文档和长任务。
还要等哪些答案
最关键的问题,是这套能力在外部环境里能否稳定复现。Qwen 现在给出的,是官方演示、官方 benchmark 和官方工作流样例;但权重要到下周才开源,第三方独立评测也还没有跟上。对开发者和企业用户来说,真正需要看的不仅是模型能否在一次演示里跑赢对手,而是它在真实代码库、真实文档流、真实成本约束下,能不能持续工作。
如果说过去一轮大模型竞争的关键词是“更会答题”,那么 Qwen3.8-Max 想证明的,是下一轮竞争已经变成“更会做事”。而这件事,最终还是要由外部验证来定。
不错过任何一条 AI 大事
订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

