谷歌Gemini Omni 1.1带来三项AI视频大跃进
谷歌刚推出的Gemini Omni 1.1 Flash,在Arena评测中把文本生成视频推到全球第一,图像生成视频也拿到全球第二(得分1488)。但排名只是表象,这次更新真正改变了AI视频创作里几件长期难题的处理方式——它让续拍、镜头运动和参考动作都能更自然、更可控。
首先,模型的上下文记忆从之前只有1秒大幅提升到每段最多10秒,且可以以10秒为一段累积到最长40秒的连续延展。也就是说,AI在续拍时能“记住”更多的角色站位、光源色温、镜头运动方向和语气,从而实现更连贯的接戏,而不再是随机抽帧般的断裂。
第二项能力是“首尾帧”设定:你把起始帧和结束帧给它,模型负责生成中间那段连续运动,特别适合复杂运镜、变焦过渡和无缝循环。官方还宣称在速度和成本上有优势:相较720p可快最多60%、成本约为三分之一,草稿可先产出360p,再把选中的片段一路升到1080p或4K。 龙8国际登录
第三项是“视频参考”输入:最多允许加入3秒的参考视频,和图片、文字一并作为条件输入,用以传递动作、运镜和节奏。这样你不用把动作细节逐字描述,只需“指给它看”。
效果方面非常直观:用几句提示就能把一个短场景从特写一路拉远、延展成宏大场面——比如先是红发女子侧脸的红光特写,接着镜头横摇带入一个男人的背影并出现台词,再拉出显露出被尘封的地下墓穴,继续推远又变成漂浮书架的巨大图书馆,全程无剪辑点,角色脸色与光线稳定不崩。另有示例直接要求实现电影级镜头语言:希区柯克变焦(dolly-zoom)、机械急推入眼、时间冻结后高速360度环绕等复杂镜头,都能在连续画面里完成。
对话续写也已可行:系统能把一段人物互动从最初的对话一路延续到30秒以上,语气、表情和镜头运动连贯无断裂;甚至能让生成角色看向镜头并直接与观众对话,把“打破第四面墙”的效果做出来。 龙8国际登录
举几个更具实用性的场景:用首尾帧生成一镜到底的大厅表演,镜头从鼓手切到萨克斯手再转到旋转的芭蕾舞者,或者推进到一台老电视屏幕内呈现同一房间的递归画面,做到无缝衔接。用视频参考的例子是:上传三段舞蹈短片,让三个不同素材角色分别照着三段舞跳各自风格,并在一条连续镜头里呈现,系统会把动作与节奏抄写过来并保持连贯。
总之,Gemini Omni 1.1让AI视频创作从“能生成单帧”走向“能接戏、能走位、会思路”,把上下文记忆、首尾帧插补和短视频参考这三把钥匙交到创作者手里。已经有应用开始接入这些能力,未来在镜头语言和叙事连贯性上,AI生成视频的可用性将明显提高。
那个时代的宠爱:刘銮雄与李嘉欣的奢华与温柔
篮球教会你如何团队协作,如何在挑战中找到自己!...