Perplexity研究:用真实错误降低工具调用失败率

核心摘要

Perplexity官方博客发布《Learning from Real-World Experience》,介绍用真实世界经验、用户纠正和工具错误后训练Computer模型,使其模仿成功行为、减少纠正。二次报道称在线A/B测试中工具调用失败率降21.2%,但未见官方完整披露该数字;基于GLM 5.2未获证实,暂无论文、代码或权重。

事件概况

Perplexity官方研究博客已发布《Learning from Real-World Experience》。官方研究页显示时间约为2026年9月21日;MarkTechPost相关链接日期为9月25日,属于二次报道时间。自9月23日起,WorldNL、网易号等平台出现相关转述。

该研究的核心是后训练Perplexity Computer模型,使其利用真实世界经验、用户纠正和工具调用错误进行学习,目标是模仿成功行为、减少用户纠正并避免工具错误。Perplexity Computer是其面向电脑操作、任务执行和工具调用的智能体产品。

关键数据与技术表述核查

多家二次报道称,较晚checkpoint相比早期checkpoint,在在线A/B测试中将工具调用失败率降低21.2%。但校对结果显示,未检索到官方正文完整披露该数字,因此这一数据应标注为二次报道口径,而非已完整核实的官方数据。

“Hint-Guided Self-Distillation(提示引导自蒸馏)”被MarkTechPost及中文转述使用,但官方标题并未直接使用该术语,具体表述应以官方论文或博客正文为准。原始网页还提到“RFT与提示引导自蒸馏结合”,但官方摘要中未核实“RFT”这一缩写;二次报道更多提到SFT、on-policy RL与真实错误训练。

被否定的关键信息

原始网页描述中的“基于GLM 5.2”未获证实。Perplexity官方页面和已检索报道均未提到GLM 5.2;GLM通常关联智谱AI,而非Perplexity自研模型。校对结果认为,该关键信息很可能错误或缺乏来源,不能作为事实采用。

截至校对结果发布时,暂未搜到官方后续论文链接、开源代码或模型权重发布信息,也未看到进一步产品化进展。

研究重点与作者判断

该研究属于利用生产环境真实交互数据改进智能体的后训练方向,重点不是单纯提升基准分数,而是降低真实用户场景中的工具调用错误和人工纠正需求。补充背景显示,AI搜索与智能体竞争正更多聚焦工具调用可靠性、延迟、调用成本及多步任务稳定性。

作者观点:该研究体现了真实交互数据对智能体后训练的价值,但在完整论文和实验细节公开前,21.2%只能视为二次报道中的A/B测试结果,不应放大为通用性能结论,也不能由这一个案判定整个行业的发展趋势。

参考资料

  1. Forskning | Perplexity Blog - Perplexity
  2. Perplexity.AI reduces tool-call failures by 21% with new model training approach - WorldNL Magazine - WorldNL Magazine
  3. 从自身错误中学习,工具调用失败率降了21.2%|checkpoint_网易订阅 - 手机网易网
  4. Perplexity Blog - Perplexity
  5. Getting started with Perplexity - Perplexity
  6. Experiential Learning | SUNY Buffalo State University -
  7. Perplexity 是如何工作的? - Perplexity Help Center - Perplexity
  8. Perplexity AI Features A Complete Guide to Its Tools, Modes, and Capabilities - Perplexity AI
本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。