Gemini Omni 1.1 Flash发布:谷歌把视频生成推进到可控生产阶段
谷歌发布 Gemini Omni 1.1 Flash,带来场景延展、首尾帧插值、视频参考、360p 草稿和最高 4K 输出等功能,旨在把生成式视频从一次性输出推进为可反复修改、衔接镜头的可控生产流程。该版本通过更长视频上下文、关键帧式控制和多模态参考,降低试错成本并服务开发者与企业级生产链,但在一致性、复杂运动和精确文字渲染方面仍有待验证。
谷歌发布 Gemini Omni 1.1 Flash,带来场景延展、首尾帧插值、视频参考、360p 草稿和最高 4K 输出等功能,旨在把生成式视频从一次性输出推进为可反复修改、衔接镜头的可控生产流程。该版本通过更长视频上下文、关键帧式控制和多模态参考,降低试错成本并服务开发者与企业级生产链,但在一致性、复杂运动和精确文字渲染方面仍有待验证。
谷歌发布 Gemini Omni 1.1 Flash,为开发者带来场景延展、首尾帧插值、视频参考、360p 草稿和最高 4K 输出等一组视频生成与编辑功能。谷歌称,这些更新旨在让生成式视频更容易控制、更快迭代,并通过 Gemini API 和 Google AI Studio 服务于专业生产流程。
这次更新的重点并不是单纯提高画面分辨率,而是把视频生成从“一次提示、一次输出”的模式,进一步推向可以反复修改、衔接镜头和管理素材的工作流。对广告、产品演示、教育内容和影视预演等场景而言,能否保持人物、场景与叙事的连续性,往往比一次生成的视觉效果更重要。
从短片生成走向连续叙事
Gemini Omni 1.1 Flash新增了场景延展功能。用户可以把一段已有视频作为上下文,让模型从原片段结束的位置继续生成,而不必重新描述整个场景。
谷歌表示,模型现在最多可以分析此前 10 秒的视频内容,而此前模型只能参考最后一秒。按照官方说法,这种更长的上下文能够改善画面连续性和叙事一致性。视频可以按每次 10 秒的增量延展,累计长度最高达到 40 秒。
这项变化针对的是生成式视频长期存在的一个问题:单个镜头可能看起来足够逼真,但当用户试图把多个片段拼接起来时,人物外观、摄影机运动、光线和空间关系容易发生变化。延展功能并不能自动解决所有连续性问题,但至少把“接着拍”变成了模型明确支持的操作,而不只是用户反复试错的结果。
谷歌此前发布 Gemini Omni 时,曾把它描述为能够接受文字、图像、音频和视频等多种输入,并通过对话修改视频的模型。此次 1.1 更新,则把这种多模态和对话式编辑进一步具体化为镜头延展、帧控制和参考素材等开发者接口。
首帧和尾帧之间的镜头控制
Omni 1.1还支持指定视频的第一帧和最后一帧,让模型生成两个关键画面之间的连续镜头。谷歌称,这适合复杂的镜头环绕、推拉变焦和无缝循环等场景。
在传统视频制作中,首尾帧通常是分镜和后期合成的重要控制点。对生成式模型而言,明确给出两个边界画面,意味着模型不必只根据文字猜测镜头应该在哪里开始、在哪里结束,而是需要在两个已知状态之间安排动作和摄影机路径。
不过,这仍然不是传统动画软件意义上的确定性关键帧系统。官方材料展示的是模型根据提示词在两帧之间生成连续视频,实际结果仍会受到动作复杂度、人物数量和场景变化的影响。谷歌的模型卡也承认,复杂运动、编辑过程中的完全一致性和准确渲染文字,仍然是 Gemini Omni Flash 的已知限制。
360p草稿降低试错成本
为帮助开发者更快筛选创意,Omni 1.1支持以 360p 分辨率生成视频草稿。谷歌表示,与标准 720p 输出相比,360p 草稿最高可快 60%,成本约为三分之一。
这项设计的意义在于改变生成流程的经济性。视频创作者通常需要先尝试多个镜头、动作和构图,再把有限的预算投入到最终版本。如果每一次尝试都直接以高分辨率渲染,生成成本和等待时间都会限制创意探索;低分辨率草稿则可以先用于分镜、节奏和镜头运动的判断。
谷歌没有在公告正文中列出完整的价格表,因此“约为三分之一”的成本比例应理解为官方对 360p 与 720p 的相对描述,而不是适用于所有地区、账户和调用方式的统一报价。开发者仍需要以 Google AI Studio、Gemini API 或企业平台的实时价格页面为准。
最高4K输出,但高分辨率不等于成片质量
在输出端,Gemini Omni 1.1 Flash支持 1080p 和 4K 视频。谷歌将其称为面向专业生产的高分辨率输出,目标包括广告、产品展示和其他需要更高画面清晰度的内容。
但分辨率只是视频质量的一部分。高分辨率可以放大细节,也可能同时放大人物边缘、文字、纹理和运动中的生成瑕疵。对于企业内容而言,产品标识、界面文字和品牌资产是否准确,往往比画面是否达到 4K 更直接地影响成片能否发布。
因此,Omni 1.1的4K能力更适合被看作生产链条的一环,而不是无需人工审核的最终交付保证。谷歌的模型卡明确指出,模型在复杂运动、持续一致性和精确文字渲染方面仍存在局限。
视频参考把素材控制延伸到动作层
Omni 1.1还允许开发者在多模态输入中加入最长 3 秒的视频参考。谷歌给出的示例,是上传舞蹈视频、角色图像和场景图片,再要求不同角色分别模仿参考视频中的动作,并把它们合成为一个连续镜头。
这类能力与单纯的图生视频不同。图像参考主要解决“角色是谁”“场景长什么样”,而视频参考进一步提供“动作如何发生”的信息。对广告、角色动画和预演工具来说,开发者可以把动作样片、角色设计和场景设定拆开提供,再由模型尝试完成合成。
不过,参考视频时长仍然很短,而且“模仿动作”与“准确复现动作”之间存在差异。官方公告展示的是产品能力和示例,并没有给出跨人物、跨场景动作迁移的独立成功率或第三方评测结果。
从模型发布到开发者生态
谷歌称,Gemini Omni 1.1 Flash正在进入 Google 的开发者生态:开发者可以在 Google AI Studio 中试用,也可以通过 Gemini API 官方文档 集成场景延展、视频参考和放大输出;企业用户则可以在 Gemini Enterprise Agent Platform 上部署。
官方示例使用 Interactions API 保存前一段视频交互,再通过 previous_interaction_id 继续延展场景。这说明谷歌希望把视频生成设计成有状态的连续工作流,而不是每次调用都从零开始。AIFlux此前对 Interactions API 的整理也提到,这套接口强调服务器端状态、后台执行和多模态交互,对需要长时间运行的生成任务尤其重要。
在产品层面,Omni 1.1同时面向 Google Flow 的订阅用户开放。谷歌表示,Google AI Plus、Pro 和 Ultra 用户可以在 Flow 中使用 Omni 1.1;场景延展也向这些订阅层级的 Gemini 应用用户开放。Google Flow此前已经把视频生成、图片生成和编辑组织成较完整的创作工作区,最新更新还加入了代理式协作和自然语言创建工具的功能。
这条产品化路径与 Google Vids加入 Gemini Omni 和个人头像 的方向相互呼应。谷歌已经在 Vids 中加入 Gemini Omni 和个人头像,让用户用自然语言生成、编辑视频,并通过自拍和短语音生成数字出镜形象。对于企业用户而言,Omni 1.1的价值可能不只在于生成一个漂亮镜头,而在于把素材制作、修改和复用嵌入现有办公与内容生产系统。
谷歌与视频模型竞争进入“控制权”阶段
生成式视频市场的竞争,正在从“谁能生成更逼真的几秒钟视频”,转向“谁能让用户更稳定地完成一条可修改、可交付的视频”。谷歌此次强调的场景延展、首尾帧、视频参考、草稿分辨率和高分辨率输出,分别对应连续性、镜头控制、动作控制、成本控制和交付规格。
这也是 Gemini Omni 1.1与 Veo 3.1定位上的重要区别。Google 的开发者文档把 Omni Flash描述为适合快速视频生成和对话式编辑的默认选择,而把 Veo 3.1定位为需要场景延展、最后一帧控制、原生音频或既有生成流程兼容性的场景。随着 Omni 1.1补充场景延展和首尾帧能力,两个产品之间的边界可能会继续变化,但谷歌目前仍把它们作为不同工作流的选择。
行业内的其他模型也在向更长时长、更高分辨率和更多输入类型发展。比如,AIFlux此前报道的 阿里巴巴 Wan3.0 已把文档、表格、演示文稿和网页纳入视频生成输入,并强调单次生成最长 30 秒。不同产品的参数不能直接等同为实际生产能力,但它们共同显示,视频模型的竞争重点正在从单一的文本生成扩展到素材理解和完整工作流控制。
仍待验证的,是生产可靠性
Gemini Omni 1.1 Flash的公告展示了一个清晰方向:视频模型不再只是创意草图工具,而是试图成为可嵌入专业软件、企业平台和内容流水线的基础能力。场景延展让故事可以继续,首尾帧让镜头边界更明确,视频参考让动作更容易被指定,360p草稿则降低了早期试错成本。
但谷歌目前公布的材料主要是产品说明、示例和客户引述,尚未提供足以独立判断生产可靠性的完整第三方评测。未来更值得观察的指标包括:连续延展在不同类型场景中的成功率、人物和产品的一致性、文字与品牌元素的准确度、4K输出的实际稳定性,以及多轮编辑后内容是否仍然可控。
换句话说,Gemini Omni 1.1 Flash确实把视频生成的“控制面板”做得更丰富了,但它能否成为专业团队日常依赖的生产工具,还要取决于开发者在真实项目中反复调用后的成本、速度、可预测性和人工审核负担。
来源: Google:Gemini Omni 1.1 Flash lets you build with more control;Google:Introducing Gemini Omni;Google AI for Developers:Generate and edit videos with Gemini Omni Flash;Google DeepMind:Gemini Omni Flash Model Card。
不错过任何一条 AI 大事
订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

