Generalist AI 发布 GEN-1.5:只需 3-12 秒演示,机器人即可掌握新技能

在具身智能与通用机器人的赛道上,一项里程碑式的进展近日引发了业界的广泛关注。总部位于美国旧金山的初创公司 Generalist AI 正式对外发布了其最新的机器人基础模型——GEN-1.5。该模型最引人注目的特性在于,它打破了传统机器人必须通过海量数据训练或编写复杂代码才能掌握新技能的固有范式,实现了真正意义上的“所见即所得”的零样本学习。

根据官方发布的技术报告,GEN-1.5 的核心能力在于“单次演示学习”。在传统的机器人控制技术中,当需要机器人执行一个新的抓取或操作任务时,工程师通常需要编写特定的运动学代码,或者利用强化学习算法进行数百万次的试错训练。这不仅耗时耗力,而且难以泛化。然而,GEN-1.5 展示了一种截然不同的路径:它接受 3 到 12 秒的传感器运动数据作为输入。这短短十几秒的视频或数据流被映射到该模型长达 30 秒的上下文窗口中,模型便能够瞬间理解任务意图,并直接输出相应的动作指令。

值得注意的是,这一过程完全不需要进行梯度更新或任务特定的微调。这意味着,GEN-1.5 并不是在后台通过学习来改变参数,而是在推理阶段通过上下文学习的能力,即时地将新的任务模式“注入”到现有的模型能力中。这种机制极大地提升了机器人系统的灵活性和适应性。

在测试环节,Generalist AI 团队验证了 GEN-1.5 在 10 个多样化操作任务中的表现。结果显示,该模型在单次演示的上下文提示下,平均准确率达到了 59%。虽然 59% 的成功率对于完美的自动化来说并非完美,但在机器人基础模型尚处于早期发展阶段、且无需经过复杂训练的情况下,这一数据已经证明了其巨大的潜力。这表明,通过模仿学习,机器人能够跨越从感知到行动的鸿沟。

从行业背景来看,GEN-1.5 的发布契合了当前人工智能领域向“具身智能”进化的趋势。随着像 GPT-4 这样的大型语言模型在文本处理上达到极致,业界正致力于将这些大模型的能力迁移到物理世界中。通用机器人不再仅仅是机械臂的堆砌,而是需要具备理解自然语言指令、观察环境变化并自主做出决策的智能体。GEN-1.5 正是这一趋势下的产物,它试图让机器人像人类学徒一样,通过看一眼老师傅的操作,就能学会类似的技能。

这一技术的潜在应用场景十分广泛。在工业制造领域,它可以帮助生产线快速适应新产品组装,无需停机等待长时间的程序重写;在仓储物流领域,机器人可以快速切换处理不同尺寸和形状的包裹;在家庭服务机器人领域,这意味着未来的机器人保姆或清洁工可以迅速学会用户新摆放的物品位置,或者适应新家的环境布局。

当然,目前的 59% 准确率也意味着该模型在鲁棒性和泛化能力上仍有提升空间。真实的物理世界充满了不确定性,比如光照变化、物体滑落等,如何在复杂的非结构化环境中保持高精度的操作,仍是通用机器人面临的最大挑战。不过,GEN-1.5 的出现无疑为解决这些难题提供了一个极具吸引力的新思路——利用大模型的上下文学习能力,让机器人具备即插即用的技能获取能力。

总而言之,Generalist AI 发布的 GEN-1.5 不仅是技术参数上的更新,更代表了机器人领域一种新的范式转移。它预示着未来的机器人可能不再需要针对每一个新任务都进行漫长的训练,而是能够像人类一样,通过观察和模仿,快速融入新的工作环境。

信息来源:MarkTechPost,原文链接:https://www.marktechpost.com/2026/08/24/generalist-ai-releases-gen-1-5-a-robot-foundation-model-that-learns-new-tasks-from-one-3-12-second-demo/

oaido_ai

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注