LLM 能否自主设计 Agent Harness?字节 Seed 实验室新基准揭示泛化难题

随着大语言模型(LLM)从简单的对话机器人向能够执行复杂任务的智能体(Agent)演进,一个核心问题日益凸显:模型是否具备自主构建自身工作流工具的能力?近日,由字节跳动 Seed 实验室联合新加坡科技设计大学(SUTD)、佐治亚理工学院(Georgia Tech)、M-A-P 以及 TokenWave.AI 等机构的研究团队,发布了一项名为 HarnessDev 的全新基准测试。这项研究不仅重新定义了评估智能体能力的标准,更通过实验数据揭示了一个令人深思的现象:尽管模型生成文本的能力惊人,但在自主构建可复用的 Harness(智能体框架/工具链)时,其泛化能力仍存在巨大局限。

在传统的 AI 评估体系中,我们往往关注模型给出的最终答案是否正确。然而,随着智能体应用的深入,这种评价方式显得力不从心。智能体需要像程序员一样,设计、编写并维护一套能够反复使用的“Harness”,即控制其执行逻辑、调用外部工具并处理中间反馈的代码或配置。HarnessDev 的核心创新在于,它不再仅仅给智能体的最终回答打分,而是去评分智能体所构建的 Harness 本身——即考察模型是否构建了一个能够真正运行、解决问题的工具。

为了测试这一能力,研究团队构建了一个极其严苛的实验环境。他们从零分开始,让六位顶尖的创作者级 LLM 从零开始构建 Harness。这六个模型需要在五个不同的基准测试(涵盖写作、机器学习实验、代码、搜索等多个领域)上处理超过 2,207 个任务。模型构建 Harness 后,会根据执行反馈进行自我进化,试图通过微调 Harness 来提升性能。

实验结果令人惊讶地揭示了两极分化的表现。在写作和机器学习实验等任务中,模型自主构建的 Harness 表现出色,能够与人类专家编写的参考 Harness 匹敌,甚至在某些特定场景下表现优异。这表明 LLM 在处理结构化任务和逻辑推理时,确实已经具备了类似人类的工程直觉。

然而,当场景切换到代码编写和搜索任务时,模型的“幻觉”问题暴露无遗。在代码生成领域,模型往往构建出无法运行的 Harness,或者虽然能运行但逻辑低效;在搜索任务中,模型难以构建出能够有效筛选信息的复杂工具链。最关键的数据来自于“泛化能力”的测试:在 64 次进化尝试中,只有 34 次的变化能够在未见过的测试任务上保持一致的方向。这意味着,模型在特定任务上习得的“经验”,很难迁移到新的场景中。大多数时候,模型的自我进化是针对特定任务的“小聪明”,而非通用的“大智慧”。

这一发现对 AI 行业具有深远的启示意义。首先,它指出了当前 LLM 在“元认知”能力上的短板。虽然模型很聪明,但它并不真正理解“如何设计一个通用的工具”。其次,这也凸显了 HarnessDev 作为评估工具的重要性。如果没有像 HarnessDev 这样关注“构建过程”而非仅仅关注“结果”的基准,我们可能会误判智能体的真实能力,导致在部署 Agent 时遇到难以预料的故障。

综上所述,虽然 LLM 已经在许多领域展现出惊人的适应性,但在自主工程和系统设计方面,我们距离完全自主的“AI 工程师”还有很长的路要走。未来的研究重点或许不应仅限于模型参数的堆叠,更应放在如何提升模型的架构设计能力以及跨任务迁移能力上。

信息来源: MarkTechPost
原文链接: https://www.marktechpost.com/2026/09/11/can-llms-engineer-their-own-agent-harness-bytedance-seeds-harnessdev-says-only-34-of-64-changes-generalize/

信息来源:MarkTechPost,原文链接:https://www.marktechpost.com/2026/09/11/can-llms-engineer-their-own-agent-harness-bytedance-seeds-harnessdev-says-only-34-of-64-changes-generalize/

oaido_ai

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注