Google 发布 Gemini Omni 1.1 Flash:场景扩展达 40 秒、支持首尾帧控制与 4K 超分

Google Gemini Omni 1.1 Flash 视频生成模型更新演示

Google DeepMind 宣布了其原生多模态视频生成与编辑模型 Gemini Omni 1.1 Flash 的重大更新。这一发布不仅标志着视频生成技术在细节控制和逻辑连贯性上的突破,也进一步巩固了 Google 在多模态 AI 领域的领先地位。此次更新重点解决了视频生成中常见的连贯性差、分辨率受限以及难以精准控制镜头运动等问题,为专业创作者和开发者提供了更强大的工具。

场景扩展能力的质变:从单帧到 10 秒上下文

在视频生成的“场景扩展”功能上,1.1 版本引入了革命性的变化。早期的模型在延续视频时,往往只能读取最后一帧作为参考,导致生成的下一部分画面与前一部分在物理规律或视觉风格上出现不自然的断裂或“帧复制”现象。而 Gemini Omni 1.1 Flash 现在可以读取多达 10 秒的上下文信息。这意味着模型不再仅仅是在“复制”像素,而是在真正理解视频的物理环境和叙事逻辑。这种对长时序上下文的理解能力,使得生成的视频片段能够更加平滑、自然地融入原有场景,极大地提升了视频长度的可扩展性,单次生成的时长上限因此大幅提升。

精准的镜头控制:首尾帧锁定与摄像机运动

对于视频制作而言,镜头的构图和运动轨迹至关重要。新版本允许用户“锁定”视频的首帧和尾帧。这一功能赋予了创作者前所未有的控制力。用户可以指定视频的起始状态和结束状态,AI 模型将自动计算并生成中间的过渡过程。这实际上等同于控制了摄像机的运动轨迹——无论是推拉摇移,还是焦距的变化,用户都可以通过设定首尾帧来精准引导。这对于需要特定转场效果或特定景别的视频创作来说,是一个极具实用性的功能,降低了专业视频剪辑的技术门槛。

角色一致性与 4K 超分辨率

除了逻辑连贯性和镜头控制,1.1 Flash 在视觉细节上也进行了优化。模型现在支持通过视频片段作为参考,来确保生成内容中角色的外观一致性。这在制作包含连续角色的复杂视频时尤为重要,避免了角色在不同镜头中变形或外貌不一致的尴尬情况。同时,Gemini Omni 1.1 Flash 增加了 4K 超分辨率功能。这意味着生成的视频不仅在逻辑上通顺,在视觉清晰度上也能满足高端内容制作的需求,细节更加丰富,画面更加锐利。

行业影响与应用前景

随着 OpenAI 的 Sora 等模型的崛起,视频生成领域竞争日趋白热化。Google 此次对 Gemini Omni 1.1 Flash 的更新,展示了其在“速度”与“质量”之间寻找平衡的尝试。作为“Flash”版本,它可能在生成速度上保持了优势,同时通过上述多项技术升级弥补了以往模型的短板。从应用场景来看,这一技术将广泛赋能于影视预演、游戏资产生成、在线教育内容制作以及广告营销等领域。对于内容创作者而言,Gemini Omni 1.1 Flash 提供了一个从脚本到成片的高效工作流,极大地缩短了内容生产周期。

综上所述,Google AI 推出的 Gemini Omni 1.1 Flash 不仅仅是一个小版本的迭代,而是向通用视频生成模型迈出的坚实一步。通过增强对长时序的理解、提供精确的帧控制以及提升输出画质,该模型正在重新定义 AI 视频生成的标准。

信息来源:MarkTechPost,原文链接:https://www.marktechpost.com/2026/08/29/google-ai-releases-gemini-omni-1-1-flash-40-second-scene-extension-first-last-frame-control-and-4k-upscaling/

封面图片来源:Unsplash / 摄影师 Google DeepMind

oaido_ai

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注