Gemini Omni 1.1 Flash 发布:强化视频延展、镜头控制与低成本试错

谷歌发布新视频模型,强化场景延展、镜头控制、低成本草稿及4K输出。

冷月清谈:

谷歌发布视频生成模型 Gemini Omni 1.1 Flash,重点改善连续生成、镜头控制和制作效率。模型可读取最多10秒的前序视频并继续生成,累计长度最高40秒;新增首尾帧控制,可根据指定的起止画面补全镜头运动。360p草稿模式的吞吐速度最高比720p提升约60%,成本约为其三分之一,方便创作者批量试错,成片则可提升至1080p或4K。模型还支持输入最长3秒的参考视频,用于提取动作、节奏和视觉关系。目前相关能力已接入Gemini API、Google AI Studio、Google Flow及Gemini App。实测显示其生成速度和画面细节表现较好,但参考图还原、风格一致性及内容审核机制仍有改进空间。

怜星夜思:

1、最长40秒的场景延展,真的能解决AI视频的人物和剧情一致性吗?
2、360p批量试错再升到4K,会成为AI视频创作的标准流程吗?
3、首尾帧控制和视频动作参考普及后,原创与模仿的边界该怎么划?
4、模型莫名拒绝生成熟悉的影视片段时,平台是否应该解释触发了哪条规则?

原文标题:刚刚,Gemini 新视频模型发布,文生视频冲到第一

原文作者:机器之心

原文内容

图片
机器之心编辑部


前些天,牛来模型(Ox Alpha)显露真身之前,谷歌 DeepMind Gemini 团队在 𝕏 上甚是热闹,让人一度以为 Ox Alpha 是某个新版 Gemini。



事实证明,牛来是地道的中国模型 GLM-5.3-Flash。气氛一度有点尴尬。


随后,Logan Kilpatrick 专门出来澄清:此前那些引发猜测的评论,指向的是 Gemini 3.7 Flash 的发布。



这场乌龙刚过去没多久,今天凌晨,谷歌又发布了一个新的视频模型:Gemini Omni 1.1 Flash。



虽然似乎在孙割大瓜阴影下,Gemini Omni 1.1 Flash 热度一般,但从榜单成绩来看,这个模型还是挺牛的,值得一点关注。



总结起来,Omni 1.1 Flash 此次更新的重点集中在视频制作流程的连续性、可控性和迭代效率。


首先是场景延展能力。Omni 1.1 Flash 现在可以读取最多 10 秒的前序视频上下文,并在此基础上继续生成后续画面。单次可扩展 10 秒,累计视频长度最高可达到 40 秒。



上下文长度提升后,模型可以获得更多人物状态、场景关系、镜头运动和剧情信息。对于连续对白、长镜头、叙事视频以及需要多段生成的视频项目,这项能力会直接影响成片的一致性。


Google 展示的案例中,同一个场景可以连续完成对话、镜头后拉、空间转换等动作,同时保持人物和环境关系相对稳定。创作者也可以从同一段素材继续生成不同镜头方案,例如推轨变焦、快速变焦以及环绕镜头。



其次,Omni 1.1 Flash 增加了首帧和尾帧控制。创作者可以指定一个镜头的起始画面与结束画面,由模型补全中间的连续运动。这项能力适用于环绕镜头、推拉镜头、快速转场以及循环视频等场景,也进一步提升了生成视频对镜头语言的可编排程度。




在制作效率方面,Google 为 Omni 1.1 Flash 提供了 360p 草稿模式。官方数据显示,360p 模式的系统吞吐速度最高可比 720p 提升约 60%,生成成本约为 720p 的三分之一。



这一模式更适合创作前期。AI 视频制作通常需要反复尝试提示词、镜头运动、人物动作和构图。创作者可以先批量生成低分辨率版本,从多个方案中筛选方向,再进入高分辨率生产阶段。


Google 在演示中展示了一套类似「Draft Room」的工作流:一次生成多个 360p 版本,每个版本调整一个变量,再进行并排比较。



成片输出方面,Omni 1.1 Flash 支持将视频提升至 1080p 和 4K 分辨率。4K 的加入,使这款模型能够覆盖更多面向成片交付的场景,包括广告素材、品牌视频、产品展示、影视预演以及高分辨率社交媒体内容。




多模态参考能力也是此次升级的重要部分。用户可以在输入中加入最长 3 秒的视频参考,让模型提取动作、节奏、视觉关系等信息,再结合图片和文字提示生成新的场景。例如,开发者可以将不同舞蹈视频作为动作参考,再将动作映射到指定角色和场景中。




从整体定位来看,Gemini Omni 1.1 Flash 正逐渐形成一套面向开发者和创意工具厂商的视频生成基础能力。场景延展解决连续内容生成,首尾帧提供镜头级控制,360p 草稿模式提升试错效率,4K 输出承担成片交付,视频参考输入则进一步增强素材复用和动作迁移能力。


目前,Omni 1.1 Flash 已面向开发者开放 Gemini API 和 Google AI Studio 接入,企业客户可通过 Agent Platform API 使用;消费端则覆盖全球 Google AI Plus、Pro 和 Ultra 用户,相关能力已进入 Google Flow 和 Gemini App。


我们也在Gemini 网页版体验了下 Gemini Omni 1.1 Flash。



这里使用《牛来》截图与何润东版吕布剧照,再加一句极简提示词,生成了一段「三动物战吕布」:




有一说一,Flash 速度确实快。效果还行,但视频内容没有严格遵照参考图,失了「牛来」原版拙劣画风的搞笑精髓。


下面我们试图复现一下「华强买瓜」的经典视频片段,但遗憾的是,不管是基于参考图,还是单纯的文生视频,Gemini 都拒绝了生成——我们也不清楚撞上了什么奇怪护栏。



接下来,我们蹭个热点,截取大热散文生成一个视频,看看 Gemini 的文生视频表现:



整体来说,细节相当出色。最后我们生成了一个人类进化视频,也相当好:



大家体验这个新模型了吗,觉得效果如何?


另外,Gemini 3.5 Pro 什么时候发?



© THE END 

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

我做短视频的话会用这个流程,但360p只能筛大方向。脸部细节、材质和文字在低清画面里看不准,最后升4K前仍要做一次中等分辨率确认。

1 个赞

关于40秒延展,我觉得对短广告和剧情切片已经挺实用了。真要拍几分钟内容,还是得拆分镜头,再靠首尾帧、参考图和后期剪辑把它们接起来。

2 个赞

回应“平台是否该解释拒绝原因”:应该提供规则类别,但未必公开全部检测细节。例如明确提示涉及真人、版权角色还是暴力内容,用户才知道如何合规修改。

1 个赞

我的标准比较朴素:参考镜头节奏可以,直接照搬某个舞者的标志性动作、角色造型和运镜组合就有点过了。商用前最好让法务看一眼。

2 个赞

回应“360p草稿会不会成为标准流程”:很可能会,逻辑和影视预演、设计打样差不多。低成本阶段先验证构图、节奏和运镜,高分辨率资源只留给入选方案。

3 个赞

回应“原创与模仿的边界”:关键不只是成片像不像,还包括参考素材是否获得授权、是否复现可识别表演,以及输出是否构成实质性相似。平台最好保留素材来源和生成记录。

3 个赞