Dyna Robotics 发布 Dyna-2:首个在百万小时人类视频上预训练的通用机器人模型

在人工智能与机器人技术深度融合的当下,具身智能正成为科技界竞相角逐的“必争之地”。近日,Dyna Robotics 正式对外发布了其最新研发的 Dyna-2 模型。作为业界首个在超过 100 万小时第一人称人类视频中完成预训练的世界-动作模型,Dyna-2 的问世标志着机器人学习领域在数据规模和泛化能力上迈出了关键性的一步。

传统的机器人训练往往依赖于昂贵的模拟环境或极其有限的物理世界数据集,这限制了机器人学习复杂任务的能力。Dyna-2 试图打破这一瓶颈,通过利用海量的人类视频数据来构建对物理世界的理解,进而迁移到具体的机器人控制任务中。

什么是“世界-动作模型”?

Dyna-2 的核心创新在于其架构——一个“世界-动作模型”(World-Action Model)。与传统的仅根据指令执行动作的简单模型不同,WAM 模型旨在通过观察环境的变化来“理解”世界。简单来说,它通过学习第一人称视角的视频,掌握了“当我在某个位置执行某个动作时,环境(如物体位置、光照、遮挡关系)会发生什么变化”这一规律。

这种模型不仅仅是执行命令,更是对物理世界因果关系的模拟。通过这种预训练,机器人能够更好地预测动作的后果,从而在执行复杂任务时表现出更高的鲁棒性和适应性。

百万小时数据与缩放定律

Dyna Robotics 在其技术报告中详细阐述了 Dyna-2 的训练过程。他们利用了超过 100 万小时的第一人称人类视频数据,这一数据规模在机器人领域是前所未有的。

技术报告建立了一项重要的“缩放定律”(Scaling Law),证明了随着人类视频数据量的增加,模型的性能会呈现线性的提升。这一发现验证了在视觉-语言-动作(VLA)模型中广泛应用的缩放理论,并成功将其从纯人类数据拓展到了机器人数据领域。这意味着,只要拥有足够的数据,AI 模型就能不断逼近甚至超越人类的操作水平。

跨具身泛化的突破性成果

Dyna-2 最引人注目的成果之一是其强大的跨具身泛化能力。在机器人研究中,一个巨大的难题是“具身鸿沟”——即在一个机器人身上训练好的模型,往往无法直接应用到另一个完全不同的机器人上。

Dyna Robotics 证明了,通过视频联合训练,模型能够有效地克服这一障碍。他们将 Dyna-2 应用于未见过的机器人数据集上,结果显示模型不仅能够适应新的平台,还能在未见过的任务中展现出优异的表现。这相当于让一个在人类身上学会了“做饭”的 AI,能够迅速适应机械臂或无人机,去执行类似的操作逻辑,而不需要从头开始重新学习。

行业影响与应用前景

Dyna-2 的出现对整个 AI 行业具有深远的启示意义。它提供了一种新的范式:利用人类数据作为基础,通过模型泛化能力去适应各种具体的机器人硬件。这极大地降低了机器人训练的门槛和成本。

在未来的应用场景中,Dyna-2 有望推动家庭服务机器人、工业物流自动化以及人机协作系统的发展。例如,未来的家庭机器人可能不需要针对每一个具体的家务进行微调,而是直接利用 Dyna-2 的泛化能力,根据人类演示视频学会如何整理房间或辅助烹饪。

随着这项技术的进一步成熟,我们或许将很快看到更加通用、更加智能的实体机器人走进现实世界,真正实现从“专用工具”到“通用助手”的转变。

信息来源: MarkTechPost

原文链接: https://www.marktechpost.com/2026/08/13/dyna-robotics-introduces-dyna-2-a-world-action-model-pre-trained-on-1-million-hours-of-human-video/

信息来源:MarkTechPost,原文链接:https://www.marktechpost.com/2026/08/13/dyna-robotics-introduces-dyna-2-a-world-action-model-pre-trained-on-1-million-hours-of-human-video/

oaido_ai

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注