在人工智能生成内容(AIGC)的浪潮中,视频生成模型(如Sora、Veo等)的进步令人瞩目。然而,尽管这些模型能够生成高度逼真的画面,它们在模拟物理规律时却频频“翻车”。例如,黄油涂抹时像油漆一样流淌,或者小球直接穿过墙壁而非弹开。为了解决这一长期存在的“物理幻觉”难题,NVIDIA与MIT、牛津大学的研究团队近日共同推出了一种名为Physis-Lang的创新框架。
打破物理幻觉:从视觉信号到语言信号
现有的视频生成模型主要依赖视觉、潜在空间或数值信号来推断物理规律。然而,这些高维数据往往难以精确捕捉复杂的物理交互细节。Physis-Lang团队认为,语言本身可能蕴含了解释物理世界的足够信息。
该框架的核心创新在于将“物理语言”视为一种共享的、可优化的目标。它不再单纯依赖像素对像素的匹配,而是通过语言模型来引导视频生成过程,确保生成的视频在重力、碰撞、摩擦等物理属性上保持高度一致。这种“以语言为纲”的方法,为解决视频生成中的物理不一致问题提供了一条全新的路径。
Cosmos 3 的物理基准测试胜出
为了验证Physis-Lang的有效性,研究团队将其集成到了NVIDIA的高性能视频生成模型Cosmos 3中。实验结果显示,集成该框架后的Cosmos 3在物理基准测试中表现出色,其物理一致性的评分超越了Google的Veo 3.1。
这一结果具有里程碑意义。它证明了单纯依靠视觉信号或潜在空间优化的局限性,而引入结构化的语言信号能够显著提升模型对物理世界的建模能力。Veo 3.1作为当前业界领先的模型之一,Cosmos 3的超越意味着AI在理解现实物理法则方面又迈进了一大步。
自进化机制与未来应用
Physis-Lang不仅是一个静态的修正工具,更具备“自进化”的能力。随着模型在大量数据上的训练和迭代,它可以不断优化其物理语言的理解深度,从而在生成更复杂的物理场景时表现更加稳定。
这一技术的突破将对多个行业产生深远影响:
- 影视与动画制作: 剪辑师和动画师将获得更可靠的工具,减少后期修修补补的工作量,实现更流畅的物理特效。
- 游戏开发: 开发者可以利用这种物理一致的视频生成技术,快速生成高保真的游戏过场动画或环境素材。
- 自动驾驶与模拟: 高精度的物理世界模型是自动驾驶训练的基础,Physis-Lang有望帮助构建更真实的虚拟测试环境。
总的来说,NVIDIA及其合作机构的这一研究,标志着AI视频生成技术正从“画得像”向“懂物理”转变。通过重新定义物理语言,Physis-Lang为打造真正可信的AI世界模型奠定了坚实的技术基础。
参考来源: MarkTechPost | 原文链接
信息来源:MarkTechPost,原文链接:https://www.marktechpost.com/2026/09/30/nvidia-researchers-introduce-physis-lang-self-evolving-physical-language-that-lifts-cosmos-3-past-veo-3-1-on-physics-benchmarks/
封面图片来源:Unsplash / 摄影师 Brecht Corbeel
