阿里发布 Qwen3.8-Flash,训练成本降至上一代约九分之一
阿里 Qwen 团队发布多模态混合专家模型 Qwen3.8-Flash,并开放了 Qwen3.8-Flash-Next 的权重作为 Qwen4 架构预览。官方宣称训练成本降至上一代约九分之一,模型默认支持 26 万 tokens 并可扩展至 100 万,API 定价面向高频调用场景,生产版与开放权重在功能和可用性上存在差异。
阿里 Qwen 团队发布多模态混合专家模型 Qwen3.8-Flash,并开放了 Qwen3.8-Flash-Next 的权重作为 Qwen4 架构预览。官方宣称训练成本降至上一代约九分之一,模型默认支持 26 万 tokens 并可扩展至 100 万,API 定价面向高频调用场景,生产版与开放权重在功能和可用性上存在差异。
阿里巴巴旗下 Qwen 团队于 2026 年 8 月 26 日发布多模态混合专家模型 Qwen3.8-Flash,并公布了面向 API 用户的价格与部分模型规格。公司称,新模型在编码和办公任务上的表现有所提升,同时将训练成本压低至上一代 Qwen3.7-Plus 的约九分之一。
此次发布还包括 Qwen3.8-Flash-Next 的开放权重。Qwen 方面将其描述为下一代 Qwen4 架构的早期预览。不过,开放权重的实验性版本与面向生产环境的 Qwen3.8-Flash API 并不是同一项发布,后者仍需等待官方服务逐步提供。
默认支持 26 万 tokens,上限可扩展至 100 万
根据 Qwen 官方账号在 X 上发布的公告,Qwen3.8-Flash 是一款多模态 MoE 模型,主模型包含 1250 亿参数,另有 510 亿参数的 N-gram Embedding,每个 token 约激活 60 亿参数。
模型默认上下文窗口为 262,144 tokens,并可扩展至 100 万 tokens。这样的上下文容量主要面向大型文件、长对话、研究资料以及需要持续处理较长任务的工作流。对于开发者而言,长上下文并不只是一个规格数字:随着输入长度增加,注意力计算、显存占用、缓存管理和推理延迟都会成为实际部署中的约束。
Qwen 团队介绍,Qwen3.8-Flash-Next 在注意力、残差结构、嵌入方式和优化器等方面进行了调整。其中,Qwen Sparse Attention(QSA)按照微区块选择上下文,目标是降低长序列处理成本;N-gram Embedding 则把一部分容量扩展放在本地上下文查找上,以减少每个 token 的矩阵计算负担。
Qwen3.8-Flash-Next 的官方 GitHub 仓库进一步说明,这一版本采用 Gated DeltaNet 与 Qwen Sparse Attention 的混合注意力结构,并配合 Gated Residual 和改进后的 Muon 优化方案。仓库同时给出了 Transformers、vLLM、SGLang 和 TokenSpeed 等框架的部署入口。
价格面向高频 API 调用场景
路透社在 2026 年 8 月 26 日的报道中称,Qwen 将通过 API 按每百万输入 tokens 1 元人民币、每百万输出 tokens 3 元人民币收费。Qwen 官方公告给出的美元口径则约为每百万输入 tokens 0.16 美元、每百万输出 tokens 0.47 美元,两种口径大致对应。
这一价格将 Qwen3.8-Flash 放在高频调用、批量处理和对成本敏感的应用场景中。编码辅助、文档处理、企业知识库、办公自动化以及需要同时处理文字和图像的工作流,都可能成为其目标用户。
不过,价格不能单独代表使用成本。企业实际支出还会受到输入输出比例、缓存命中率、长上下文调用频率、并发限制、区域服务条款和工具调用次数影响。尤其是在接近 100 万 tokens 的任务中,开发者需要同时评估上下文管理和请求延迟,而不能只按照单次 token 单价估算总成本。
官方称能力提升,外部复测仍需跟进
Qwen 表示,Qwen3.8-Flash 相比 Qwen3.7-Plus 在编码和办公任务上具有更强表现,训练开销约为上一代的九分之一。路透社转述了这些数据,但目前这些成本和性能描述仍属于阿里及 Qwen 的对外披露,并非独立机构在相同条件下完成的复测。
Qwen3.8-Flash-Next 的官方模型资料列出了包括编码、办公智能体、多模态工具使用和电脑操作在内的多项测试结果。但不同模型的评测往往涉及不同的 harness、提示词、采样参数、工具环境和基准版本,分数之间不能简单视为完全可比。开发者还需要观察模型在真实代码库、实际办公软件和自有工具链中的稳定性。
这也是 AIFlux此前关于 Qwen3.8-Max 的报道中反复出现的一个问题:厂商演示和官方 benchmark 可以说明产品定位,但长任务、自主编程和工具调用能力仍需要更多第三方验证。
Flash-Next 是 Qwen4 架构的提前预览
Qwen3.8-Flash-Next 的开放权重是此次发布中更具研究意义的部分。Qwen 在 官方仓库中称,该模型用于让社区提前检查 Qwen4 所采用的架构变化,类似于此前 Qwen3-Next 为后续模型系列提供的架构预览。
ModelScope 的模型页面显示,开放版本包含模型权重和配置文件,可与多种开源推理框架配合使用。页面列出的模型文件规模约为 360GB,并标注了相应的社区许可。由于模型总规模达到 1250 亿主参数、另有 N-gram Embedding,开发者即使使用稀疏激活,也仍需为权重存储、显存、跨设备通信和长上下文缓存准备足够的基础设施。
官方资料也特别区分了两个版本:Qwen3.8-Flash-Next 是开放权重和架构预览版本;生产版 Qwen3.8-Flash 则是在此基础上加入更多产品化能力的服务版本,包括默认 100 万 tokens 上下文和官方内置工具。因而,不能把实验版本的权重下载,直接写成生产 API 已经全面上线,也不能假定云端服务与本地部署版本拥有完全相同的功能和限制。
阿里正在同时推进模型、云和应用
Qwen3.8-Flash 的发布发生在阿里加大 AI 基础设施投入的背景下。根据 AIFlux此前对阿里财报的报道,阿里云及算力服务收入正在增长,但资本开支和模型投入也对短期利润与自由现金流形成压力。
从这一角度看,Qwen3.8-Flash 的重点不只是推出一款更便宜的模型,而是尝试把模型效率、云端 API、开放权重和办公应用连接成一套产品路线。低激活参数量有助于降低推理过程中的计算开销,开放权重则可以扩大开发者和研究社区的参与范围;而 API 与办公产品则为模型提供更直接的商业化入口。
这条路线也带来新的衡量标准:模型是否能在较低价格下维持可靠的输出质量,开放权重能否形成足够的第三方生态,以及长上下文和多模态能力在真实企业工作流中是否能够转化为稳定的效率提升。
截至目前,可以确认的是 Qwen 已公开 Qwen3.8-Flash 的主要定位、价格口径和上下文规格,并开放了 Qwen3.8-Flash-Next 的模型权重。尚待观察的是生产版 API 的实际可用时间、不同地区的服务范围、完整价格条款,以及独立测试能否验证 Qwen 所称的编码、办公和成本优势。
来源:
不错过任何一条 AI 大事
订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

