通义千问发布 Qwen3.8-Omni-Flash,将文本、图像、音频和视频放入同一模型并提供 100 万 token 上下文窗口,强调把音视频理解能力扩展为可执行的 Agent 工作流,支持剪辑、翻译、会议纪要等任务。官方公布了多项 benchmark 和价格估算,并开源或发布了相关插件与实时运行环境,但第三方复测与开源仓库可用性仍需验证。
通义千问团队于 2026 年 9 月 18 日发布 Qwen3.8-Omni-Flash,将文本、图像、音频和视频输入放进同一个模型,并提供 100 万 token 上下文窗口。与此前主要强调“看懂”音视频的全模态模型相比,Qwen此次更明确地把新模型定位为生产力 Agent:模型不仅要理解素材,还要规划任务、调用工具,并交付剪辑、翻译、解说或研究等结果。
Qwen官方发布文章称,Qwen3.8-Omni-Flash 已上线千问 AI 平台。阿里云百炼文档则将其列为音视频理解、会议纪要和内容分析模型,支持 Chat Completions 与 Responses API,并提供 Function Calling 和联网搜索能力。模型支持的输入包括文本、图片、音频和视频,输出以文本为主;需要语音回复或实时语音交互时,阿里云文档另行列出了 Qwen3.5-Omni 和实时模型系列。
从音视频理解走向任务执行
Qwen此次发布的重点不只是上下文长度,而是围绕长音视频建立一套工作流。官方示例包括视频剪辑、音乐视频创作、短剧翻译、电影解说、会议纪要、音视频摘要和视频中心的深度研究。
在长视频场景中,Qwen称,模型可以从用户的问题出发,自主决定需要查看和聆听哪些片段,再通过由粗到细的多轮取证定位关键信息。官方在 OmniVideoBench 的对比中称,Agentic Understanding 将准确率从 63.4 提高到 67.8,同时把每个问题的 token 消耗从 145,736 降至 79,117,减少约 45.7%。这意味着模型试图把计算资源集中在与问题相关的片段,而不是对整部视频进行同等强度的处理。
会议场景是另一个重点。Qwen称,模型可以在音频和画面之间对齐说话人身份、转录内容与视觉线索,生成会议纪要、行动事项和项目风险分析。结合工具调用后,系统还可以根据会议要求发送邮件、整理任务,甚至开始编写代码。
面向内容生产,官方演示了 Music2MV、短剧翻译和长篇电影解说等流程。例如,在音乐视频制作中,模型可分析歌曲的节奏、情绪、人声和器乐变化,并生成带时间戳的歌词,以辅助镜头和字幕设计。在短剧本地化中,Qwen则把说话人识别、翻译、配音、混音和质量检查串成一条工作流。
官方 benchmark 与价格比较仍需谨慎解读
Qwen官方称,在列出的 29 项音频、音视频和音视频 Agent 评测中,Qwen3.8-Omni-Flash 相比 Qwen3.5-Omni-Plus 的平均得分提升超过 25%。官方还称,模型在 WildClawBench-MM 上提升 36.5 分,在 AgenticVBench 上提升 22.3 分;在多说话人识别测试 AliMeeting 中,DER 和 cpWER 从上一代的 88.11 / 89.61 降至 3.35 / 17.18。
这些数字来自 Qwen自己的发布材料,且不同测试使用的模型、提示词、工具环境和 Agent Harness 并不完全相同。例如,官方说明 WildClawBench-MM 和 AgenticVBench 使用 Claude Code,UniClawBench 使用 OpenClaw,而 OmniGAIA 不使用 Harness。因而,这些结果可以说明 Qwen对产品的定位和测试方向,但不能直接等同于独立第三方复测。
价格比较也有同样的限制。Qwen称,按其估算方法计算,每小时音频输入价格较 Qwen3.5-Omni-Plus 下降超过 98%,音视频输入价格下降超过 93%。官方的计算方式是把两分钟素材的输入成本乘以 30,音视频按 720p、每秒一帧计算,并使用特定的模型参数和汇率进行横向比较。实际账单仍取决于输入输出 token、缓存、请求次数、区域、并发限制和工具调用情况,不能只依据“每小时下降比例”判断总成本。
阿里云百炼文档目前确认,Qwen3.8-Omni-Flash 支持北京、新加坡、中国香港、日本东京、德国法兰克福和美国弗吉尼亚等地域,具体 API Key 和服务条款按地域区分。文档同时提醒,模型按音频、图像和视频等不同模态消耗的 token 计费,完整价格以控制台为准。
模型之外,Qwen也在补齐 Agent 运行环境
Qwen将这次发布描述为模型、插件和运行环境协同演进的一部分。官方同时扩展了 Qwen-MM-Plugins,其仓库把能力拆分为可安装的插件,包括图像、视频和文档理解、长视频记忆、视频编辑,以及把演示视频转化为可复用 Agent Skill 等。该项目支持 Claude Code、Codex、Qwen Code、OpenClaw 和 Gemini CLI 等多个 Agent Harness。
官方文章还宣布开源 Qwen-Live Harness,把它定位为围绕 Qwen3.8-Omni-Flash-Realtime API 的实时全模态交互运行环境,支持任务委派、主动交互、长期记忆和上下文管理。文章中提供的安装命令是 npm install -g qwen-live-harness,随后运行 qwen-live-harness init。不过,Qwen文章相关资源指向的 Qwen-Live-Harness GitHub 页面在本次核验时返回了 GitHub 404 页面,因此该项目仓库的公开状态、代码内容和可复现程度仍需后续确认。
对于实时交互,Qwen官方还发布了 Qwen3.8-Omni-Flash-Realtime。文章称,该模型能够接收持续的音视频流,并结合实时上下文进行工具调用;示例包括口语练习、空间声音定位和带业务知识的客服交互。阿里云实时模型文档则显示,实时接入支持 WebSocket、WebRTC 和 AOQ 等协议,但不同实时模型的名称、地域、输入输出能力和会话限制需要以具体文档为准。
长上下文并不等于低成本或自动完成任务
Qwen3.8-Omni-Flash的发布反映出全模态模型竞争正在从单项识别能力转向完整生产链路。模型需要处理的已不只是“视频里发生了什么”,还包括如何找到相关片段、如何规划下一步、如何调用外部工具,以及如何把结果交付为用户可以继续使用的文件或任务。
但这一转变也提高了评估难度。长上下文窗口能容纳更多素材,却不代表模型会始终有效利用这些信息;主动取证可能降低 token 消耗,也可能因为重复检索、误判片段或多轮工具调用增加延迟。对于视频剪辑、配音、会议跟进等任务,输出质量之外,稳定性、可追溯性、权限边界和人工复核成本同样重要。
目前可以确认的是,Qwen已公布 Qwen3.8-Omni-Flash 的产品定位、API接入路径、音视频 Agent 工作流和一组官方评测结果,并在阿里云文档中提供了模型调用说明。至于其 benchmark 优势能否在独立环境中复现,以及 Qwen-Live Harness 是否会以完整、可访问的开源项目形式持续维护,仍需等待更多第三方测试和后续文档更新。
来源: Qwen官方发布;阿里云百炼 Qwen-Omni 文档;Qwen-Omni 实时模型文档。
在相关的长上下文模型报道中,AIFlux此前也梳理过阿里发布 Qwen3.8-Flash 及其百万级上下文路线,以及谷歌推出的智能体式视频理解方案。