在人工智能领域,尤其是视频理解和多模态大模型的发展中,数据标注一直是一个难以绕过的痛点。传统的视频学习代理通常需要明确知道每一帧画面是由哪种动作产生的,这种对“动作标签”的依赖被 Induction Labs 认为是当前技术发展的主要瓶颈。为了打破这一限制,Induction Labs 最近发布了一项名为“想象力模型”的基础模型架构,并推出了其首个测试系统——Photon-1。
Photon-1 是一个稀疏的 106B-A5B 混合专家模型。其核心创新在于,它不需要任何动作标签,仅通过对原始视频数据的预训练,就能学会理解世界的因果关系。这并不意味着模型在“猜测”动作,而是通过观察像素的变化,自主推断出物理规律和动态过程。
Induction Labs 的研究团队通过一系列实验证明了 Photon-1 的强大能力。令人印象深刻的是,该模型在一次预训练运行中,不仅学会了模拟桌面环境,还能熟练地玩跳棋,并精准地建模台球物理。这意味着模型不仅理解了物体的外观,还深入学习了物体的运动轨迹、碰撞反弹以及动量守恒等复杂的物理法则。
这种“无标签学习”的能力具有深远的意义。首先,它极大地降低了训练成本和对人工标注数据的依赖。在视频数据标注成本高昂且难以获取的今天,Photon-1 提供了一种更高效的训练范式。其次,它更接近人类的认知方式——人类在观察世界时,往往也是先通过视觉感知变化,再在脑海中构建模拟场景,而不是预先获得精确的动作指令。Photon-1 正是这种“思维模拟”能力的数学化体现。
随着大模型参数量的不断膨胀,如何提高推理效率和降低计算成本成为了行业关注的焦点。Photon-1 采用的稀疏混合专家架构(MoE)在这方面表现优异,它通过激活 5B 参数来处理 106B 参数的模型,在保持高智能水平的同时,有效控制了计算资源的消耗。
对于未来的应用场景而言,Photon-1 的出现可能预示着通用人工智能(AGI)在物理交互领域的突破。无论是在复杂的桌面机器人控制、游戏开发中的物理引擎优化,还是自动驾驶系统的环境模拟中,这种能够从原始数据中自主学习物理规律的能力都将是关键。Induction Labs 的这一尝试,或许正在重新定义我们对于“视频理解”和“世界模型”的认知边界。
参考来源: MarkTechPost
原文链接: https://www.marktechpost.com/2026/07/26/induction-labs-photon-1-simulates-desktops-plays-checkers-and-models-billiard-physics-from-one-pretraining-run/
信息来源:MarkTechPost,原文链接:https://www.marktechpost.com/2026/07/26/induction-labs-photon-1-simulates-desktops-plays-checkers-and-models-billiard-physics-from-one-pretraining-run/
封面图片来源:Unsplash / 摄影师 Egor Komarov
