阿里发布 Qwen3.8-27B,并开放 Qwen3.8 旗舰模型权重
阿里 Qwen 团队在 8 月中旬开放发布了两个关键版本:面向开发者的多模态 Qwen3.8-27B(27亿参数)已在 Hugging Face 与 ModelScope 上线,同时旗舰级 Qwen3.8-2.4T-A95B 的模型权重也已开放下载。此次开放降低了获取权重的门槛,但部署旗舰模型仍需面对显存、并行推理和运维成本等工程挑战,实际能力有待独立评测与社区验证。
阿里 Qwen 团队在 8 月中旬开放发布了两个关键版本:面向开发者的多模态 Qwen3.8-27B(27亿参数)已在 Hugging Face 与 ModelScope 上线,同时旗舰级 Qwen3.8-2.4T-A95B 的模型权重也已开放下载。此次开放降低了获取权重的门槛,但部署旗舰模型仍需面对显存、并行推理和运维成本等工程挑战,实际能力有待独立评测与社区验证。
阿里巴巴旗下 Qwen 团队在 8 月中旬完成了 Qwen3.8 系列的两项关键开放发布:面向开发者的 270 亿参数稠密视觉语言模型 Qwen3.8-27B 于 8 月 14 日登陆 Hugging Face 和 ModelScope;此前,旗舰级 Qwen3.8-2.4T-A95B 的模型权重已于 8 月 12 日开放下载。
这意味着 Qwen3.8 的开放策略已经从“发布一个旗舰模型”推进到同时提供不同规模的可部署模型。对于开发者而言,新增的重点不只是模型规格,而是能否下载权重、选择推理框架并在自己的环境中进行部署或二次开发。
27B 模型把视觉能力带到更易部署的规模
根据 Qwen 官方 GitHub 仓库的发布记录,Qwen3.8-27B 于 8 月 14 日在 Hugging Face Hub 和 ModelScope 上线,旗舰模型 Qwen3.8-2.4T-A95B 则于 8 月 12 日上线。阿里云在官方公告中称,27B 版本是一款原生视觉语言模型,支持图像和视频理解,并面向编码、专业工作、研究和长周期 Agent 任务。
Qwen3.8-27B 模型卡显示,该模型拥有 270 亿参数,原生上下文长度为 262,144 tokens,并可通过相关配置扩展到 100 万 tokens。模型卡还列出了 Terminal Bench 2.1、SWE-bench Pro、OSWorld-Verified、WebArena-Verified 等测试结果,覆盖终端编码、软件工程、电脑操作和浏览器使用等场景。
Qwen 还强调,27B 版本具备可调节的思考模式:默认开启思考,开发者可以按请求关闭,并通过 reasoning_effort 调整推理深度。模型同时支持图像、视频输入以及多种主流推理和部署框架,包括 Transformers、vLLM、SGLang 和 TokenSpeed。
不过,这些 benchmark 分数目前主要是 Qwen 官方模型卡披露的结果。模型卡说明了部分测试所使用的 harness、上下文窗口、评测设置和基线处理方式,但这并不等同于独立机构在完全相同条件下完成的复测。对需要把模型用于生产环境的团队而言,真实代码库、工具链和任务分布中的表现仍需进一步观察。
旗舰权重开放,但并不等于完整产品能力一并开放
Qwen3.8-2.4T-A95B 是此次开放动作中更具象征意义的部分。根据其官方 Hugging Face 模型卡,该模型总参数约为 2.4 万亿,推理时激活约 950 亿参数,采用混合专家架构,原生上下文长度为 262,144 tokens,最长可扩展至约 101 万 tokens。
这是 Qwen 首次把 Qwen-Max 级别的旗舰模型以开放权重形式提供给开发者。与 27B 版本不同,2.4T-A95B 是文本模型,必须使用思考模式,模型卡明确表示不支持多模态输入,也不能关闭思考。换句话说,开发者拿到的是旗舰模型的可下载权重,但并不是 Qwen3.8-Max 商业服务的全部功能集合。
Qwen 官方模型卡将 Qwen3.8-Max描述为基于 Qwen3.8-2.4T-A95B 的正式服务版本,并列出视觉输入、非思考模式、默认 100 万 tokens 上下文和官方内置工具等额外能力。这样的区分对部署者很重要:本地运行的开放权重版本与云端托管版本,在输入模态、上下文默认值、工具支持和运维成本上并不完全相同。
这也延续了AIFlux此前对 Qwen3.8-Max 的报道。此前的报道重点放在模型发布、长任务和自主编程定位;此次新增信息则是权重已经实际进入开发者可下载、可部署和可修改的阶段。
开放权重扩大了选择,也提高了部署门槛
从软件兼容性看,Qwen3.8-27B 的门槛相对较低。官方仓库给出了 Transformers、vLLM、SGLang 和 TokenSpeed 的启动示例,并建议在需要高吞吐或生产服务时使用专门的推理引擎。模型支持 262K 原生上下文,但如果扩展到接近 100 万 tokens,开发者还需要调整 YaRN 等位置编码配置,并根据实际上下文长度选择合适的缩放因子。
2.4T-A95B 则是另一种部署问题。虽然稀疏混合专家架构意味着每次推理只激活部分参数,但模型总规模、权重存储、并行推理和长上下文缓存仍然会对显存、通信和系统工程提出更高要求。开放下载降低了获取权重的门槛,却没有消除运行旗舰模型所需的硬件和运维成本。
服务可用性也需要谨慎表述。27B 模型卡仍写明,面向无需自行维护基础设施的托管版本“即将提供”;因此,不能把 27B 权重开放写成其 Qwen Cloud 商业 API 已经全面上线。另一方面,旗舰版本模型卡和 Qwen 官方介绍已经提供了通过 Qwen Cloud 调用相关服务的说明。两者所指的模型版本和服务状态需要分别理解。
Qwen 的开放策略进入下一阶段
阿里云在公告中称,Qwen 生态已经覆盖数百个模型,并在 Hugging Face 和 ModelScope 上形成了大量衍生模型。对于一个模型家族来说,同时开放旗舰权重和较小的多模态版本,有助于覆盖两类开发者:一类希望研究大规模模型、进行蒸馏或二次训练;另一类则更关心本地部署、应用集成和成本控制。
但开放发布的价值最终仍取决于三个问题。第一,官方 benchmark 能否被外部评测稳定复现;第二,27B 模型在不同硬件和推理框架上的实际吞吐与成本如何;第三,旗舰模型的开放权重能否形成足够多的第三方工具、量化版本和应用生态。
目前可以确认的是,Qwen3.8 的两个关键版本已经完成权重发布,开发者可以通过 Hugging Face、ModelScope 及 Qwen 官方仓库获取相关信息。至于它们在真实生产任务中能否兑现 Qwen 所强调的长任务、编码和 Agent 能力,则仍需要独立测试和更长时间的社区使用来回答。
不错过任何一条 AI 大事
订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

