阿里巴巴发布 Wan3.0,支持从文档生成 30 秒视频
阿里巴巴于 2026 年 8 月 24 日发布视频生成模型 Wan3.0,支持最多 30 秒的视频生成并可直接接受文档、表格、演示和网页等输入。虽可输出 480P/720P/1080P 并已进入公测与 Model Studio,但可用性、输出准确率和商业化规模仍需更多数据验证。
阿里巴巴于 2026 年 8 月 24 日发布视频生成模型 Wan3.0,支持最多 30 秒的视频生成并可直接接受文档、表格、演示和网页等输入。虽可输出 480P/720P/1080P 并已进入公测与 Model Studio,但可用性、输出准确率和商业化规模仍需更多数据验证。
阿里巴巴于 2026 年 8 月 24 日正式推出视频生成模型 Wan3.0。阿里云称,该模型单次最多可生成 30 秒视频,并首次把文档、电子表格、演示文稿和网页等内容纳入视频生成的输入范围。
这次发布发生在阿里巴巴宣布并推进约 800 亿港元、约合 102 亿美元的新股配售之后。公司表示,配售所得净额将全部用于全栈人工智能能力和基础设施建设。不过,Wan3.0 的推出本身并不意味着这笔融资已经转化为具体项目收入,也不能证明模型已经产生相应规模的商业回报。
从“文生视频”扩展到“文档生视频”
根据阿里云官方介绍,Wan3.0 支持文本、图片、音频、视频以及文档输入。官方列出的文件格式包括 DOC、XLS、PPT、PDF、TXT、KEY、PAGES、NUMBERS 和 Markdown;单次请求最多处理一个文件或网页链接,文件大小上限为 100MB、页数上限为 50 页。
这意味着,用户可以把品牌介绍、产品资料、课程材料、分镜脚本或数据内容作为创作素材,再通过提示词指定视频的风格、节奏和表达方式。与只根据一句文字描述生成镜头相比,这类输入方式试图让模型直接理解已有的结构化信息,并将其转化为品牌片、产品演示或其他视频内容。
官方同时称,Wan3.0 在指令遵循、跨镜头一致性和真实世界还原方面进行了升级。模型被定位为“全能参考”视频模型,能够支持文生视频、图生视频,以及基于参考图像、视频、音频或文件的视频生成。阿里云的 API 文档则显示,模型支持 480P、720P 和 1080P 输出,视频生成任务通常采用异步调用,生成过程可能需要数分钟。
不过,阿里云不同页面对开放状态的表述并不完全相同。官方发布文章称 Wan3.0 已可在 Model Studio 使用,而部分 API 文档仍将其标注为邀测或受限状态。因此,读者需要区分“产品正式发布”与“所有地区、所有用户均可直接调用”这两个概念,具体可用性仍取决于账户、区域和平台配置。
30 秒时长改变的是什么
Wan3.0 的另一项主要变化是单次生成时长提高到最多 30 秒。阿里云把这一变化与更完整的叙事、连续镜头和复杂摄影机运动联系在一起:模型不再只是生成几秒钟的单个镜头,而是尝试在一次生成中完成更长的场景表达。
但更长时长并不等于更稳定的成片质量。阿里云在官方材料中也承认,音频质感和画面文字渲染的准确性仍在改进。这一点对于文档生视频尤其重要,因为企业资料往往包含产品名称、价格、图表和界面文字;如果模型无法准确保留这些信息,用户仍需要进行人工校对和后期剪辑。
官方给出的 API 价格按输出视频秒数计算:480P 为每秒 0.05 美元,720P 为每秒 0.10 美元,1080P 为每秒 0.20 美元。按这一口径计算,生成一条 30 秒的 1080P 视频,基础生成费用为 6 美元;30 秒 480P 草稿的费用为 1.5 美元。阿里云还宣布,在 8 月 24 日至 9 月 23 日期间,部分平台提供 Wan3.0 API 限时七折优惠,实际适用范围应以平台页面为准。
公测案例尚不能代表商业规模
路透社在相关报道中引述阿里云信息称,Wan3.0 自 8 月 6 日开启公测以来,已经被用于短剧和电影制作、广告营销、旅游推广及音乐视频创作。
这些案例说明模型已经被放入若干内容生产流程,但它们并不提供用户数量、调用量、收入或客户留存等商业指标。现阶段更稳妥的判断是,Wan3.0 正在从模型演示和公测阶段走向更广泛的产品化,而不是已经验证了某种市场规模。
这也延续了阿里巴巴近期把生成模型推向实际工作流的方向。此前,阿里发布的 Qwen-Image-3.0也强调把图像生成从“好看”推向更适合排版、内容制作和商业设计的工作工具。Wan3.0 则把类似的思路延伸到视频:竞争重点不只是画面是否逼真,还包括模型能否理解企业已有素材、降低制作环节的重复劳动,并在修改时保持人物、场景和产品的一致性。
发布背后的资本开支压力
Wan3.0 的发布时间,使这次模型发布与阿里巴巴正在扩大的 AI 投资计划联系在一起。阿里巴巴 8 月 23 日宣布拟配售约 800 亿港元新股,并承诺将所得净额全部投入全栈 AI 能力和基础设施;AIFlux此前的配售报道指出,这是一项融资安排,最终到账和具体项目分配仍需以后续公告为准。
根据路透社 8 月 20 日对阿里巴巴季度业绩的报道,公司 2026 年 4 月至 6 月收入同比增长 9%,AI 云和算力服务收入增长 45%至 484.4 亿元人民币;与此同时,资本开支同比增长 75%至 676.8 亿元人民币,季度净利润则同比下降 75%。阿里巴巴解释称,资本开支增加与 AI 基础设施、CPU 算力容量以及芯片组件价格等因素有关。AIFlux对这一背景的整理也将收入增长与短期利润压力分开讨论。
阿里巴巴此前表示,计划在 2026 年至 2029 年投入约 3800 亿元人民币用于 AI 和云基础设施。管理层在业绩电话会上称,随着 AI 云服务需求增长,公司希望通过扩大算力供给获得长期回报,并逐步提高自研芯片在数据中心中的使用比例。
接下来要看商业化,而不只是生成时长
对阿里巴巴而言,Wan3.0 的价值取决于它能否成为云服务和模型服务收入的一部分,而不只是一个具有传播力的产品发布。文档输入、30 秒生成和多种参考方式,确实把模型接近了广告、影视、旅游和企业内容生产等场景,但这些能力仍需要经过更长时间的稳定性、成本和版权流程检验。
至少有三个问题仍未得到公开数据的充分回答:
- Wan3.0 在复杂文档、图表和屏幕文字上的还原准确率是多少;
- 模型在重复生成、修改和长视频连续性方面的实际成功率如何;
- 公测案例能否转化为可持续的 API 调用量、企业客户和云业务收入。
因此,8 月 24 日的事件可以确认是一次产品层面的正式推出,也是阿里巴巴 AI 基础设施扩张背景下的一次能力展示。但截至目前,公开材料尚未提供独立性能复测、用户规模或 Wan3.0 专项商业收入数据。模型能否从“更长的视频生成”进一步变成稳定的生产工具和可持续的云业务,仍有待后续使用数据和财务披露验证。
来源
- Reuters:Alibaba launches Wan3.0 AI video model after $10 billion share sale(2026 年 8 月 24 日)
- TechNode:Alibaba launches Wan3.0 video model with 30-second generation and document input(2026 年 8 月 24 日)
- Alibaba Cloud:Wan3.0: 30-Second AI Video Generation from Any Input
- Alibaba Cloud Model Studio:Wan3.0 Video Generation API Reference
- [Reuters:Alibaba quarterly profit fell 75% due to AI infrastructure spend(2026 年 8 月 20 日)](https://www.reuters.com/business/retail-consumer/alibaba-beats-quarterly-revenue-estimates-2026
不错过任何一条 AI 大事
订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

