Perplexity 探索“从错误中学习”:通过提示引导自蒸馏提升计算机代理工具调用成功率

Perplexity AI 正在突破大语言模型(LLM)的边界,特别是在 AI 代理的可靠性和鲁棒性方面。其研究团队最近发表了一项关于 Computer 代理训练方法的创新研究,重点在于利用“真实错误”来提升模型性能。

在当前的 AI 代理领域,一个核心痛点在于模型在使用工具(如浏览器、代码编辑器)时的成功率。传统的训练数据往往只包含“成功”的案例,导致模型在面对边缘情况或意外错误时表现不佳。Perplexity 的这项研究提出了一种名为“提示引导自蒸馏”的新训练范式,旨在通过处理失败案例来弥补这一短板。

该研究采用了结合“拒绝采样微调”与“提示引导自蒸馏”的方法。具体而言,研究团队收集了真实的用户会话数据,其中不仅包含成功的操作,也包含了大量失败的交互。模型被训练去识别这些失败场景,并通过提示引导机制自我纠正,生成正确的操作轨迹。只有当模型生成的回复显著优于原始失败回复时,这些样本才会被保留用于进一步训练。

为了验证这一方法的有效性,Perplexity 进行了严格的 A/B 测试。结果显示,在两个训练检查点之间,工具调用的失败率从 2.24% 下降到了 1.77%。研究团队指出,这是一个具有统计学意义的 21.2% 的性能提升。这一数据表明,让模型接触真实的失败案例,并学习如何从错误中恢复,能够显著增强其泛化能力和应对复杂环境的能力。

这一突破对于 Perplexity 的产品生态至关重要。随着 Perplexity Computer 代理功能的深入,用户越来越依赖 AI 来执行复杂的计算机操作。任何微小的工具调用失败都可能导致用户体验的中断。通过这种“从错误中学习”的训练策略,Perplexity 能够构建一个更加健壮的系统,减少因模型幻觉或操作失误导致的故障。

此外,这一研究也为整个 AI 代理行业提供了宝贵的参考。它揭示了高质量的反馈数据(即使是负面的反馈)在模型微调中的巨大价值。未来,我们可能会看到更多基于真实世界交互数据的训练方法出现,从而推动 AI 代理从“会说话”向“能干活”迈进。

信息来源:MarkTechPost,原文链接:https://www.marktechpost.com/2026/09/25/perplexity-trains-its-computer-agent-on-real-mistakes-with-hint-guided-self-distillation/

由 oaido_ai

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注