Code-as-World:让 AI 通过“写代码”来理解物理世界

在人工智能,特别是强化学习和机器人技术领域,构建一个能够准确模拟物理世界的“世界模型”一直是科研人员追求的终极目标之一。近期,MarkTechPost 报道了一项名为“Code-as-World”的创新研究,该研究提出了一种革命性的框架,能够将现实世界的视频转化为可执行的 MuJoCo 物理场景代码,从而极大地提升了 AI 的物理推理能力。

传统的 AI 训练往往依赖于静态的标注数据或像素级的输入,这限制了模型对复杂动态物理环境的理解。而“Code-as-World”的核心突破在于它引入了“代码即世界”的概念。通过一种智能体循环机制,该系统不仅能从视频流中恢复出可编辑的 MuJoCo 场景代码,还能利用这些经过验证的物理世界来训练智能体进行复杂的物理推理。

从像素到代码:重新定义 AI 的环境交互

MuJoCo 是机器人学领域广泛使用的物理仿真环境,它以精确的物理引擎和复杂的场景支持而闻名。然而,直接让 AI 在像素空间中进行物理推理是极其困难且低效的。

“Code-as-World”的工作原理可以概括为三个步骤:首先,系统分析输入的视频,提取其中的物体、动作和物理规律;其次,它将这些视觉信息转化为结构化的代码,即 MuJoCo 的场景描述文件;最后,它利用这些代码构建一个“智能体循环”。在这个循环中,AI 智能体在由代码生成的虚拟环境中行动,系统则根据物理引擎的反馈不断调整智能体的策略。

这种方法的巨大优势在于其“可编辑性”和“可验证性”。与原始视频不同,代码描述的世界是逻辑化的,研究人员可以随意修改参数、增加物体或改变物理规则,而无需重新拍摄视频。这种能力使得 AI 训练过程更加高效、可控且成本低廉。

解决“模拟到现实”的鸿沟

该技术的推出,对于解决机器人技术中的“模拟到现实”差距具有重要意义。在机器人研发中,在仿真环境中训练智能体是降低成本和安全风险的唯一途径。然而,仿真环境往往难以完美复刻真实世界的复杂性。

通过将现实世界的视频数据编码为代码,“Code-as-World”实际上是在为 AI 构建一个“数字孪生”环境。这意味着训练出来的机器人不仅能在虚拟世界中表现出色,还能更好地适应现实世界中的物理挑战。例如,在处理物体抓取、流体模拟或动态障碍物避障等任务时,这种基于代码的物理推理能力将发挥关键作用。

行业影响与应用前景

这一突破不仅限于机器人领域,其潜在应用场景极为广泛。在自动驾驶领域,类似的物理仿真代码可以帮助车辆更准确地预测行人行为和天气影响;在视频游戏开发中,开发者可以利用这种技术生成更加逼真的物理交互效果;甚至在科学计算领域,它也能帮助研究人员快速验证物理模型的有效性。

总的来说,“Code-as-World”代表了一种从感知到认知的范式转变。它不再满足于让 AI“看”懂世界,而是试图让 AI“写”出世界,进而通过代码来理解并操控物理规律。这为未来的通用人工智能(AGI)发展开辟了一条新的路径。

信息来源:MarkTechPost,原文链接:https://www.marktechpost.com/2026/08/29/mirros-code-as-world-executable-world-representations/

oaido_ai

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注