登录体验完整功能(收藏、点赞、评论等) — 已累计有 13104 人加入

BrowseComp基准失效 美团LongCat推LoHoSearch重设搜索智能体标尺

详情页推荐

2026年7月17日,美团LongCat正式发布全新搜索智能体评测基准LoHoSearch。此前行业通用的BrowseComp基准推出仅10个月,模型最优成绩就从30%飙升至90%,因可通过定向刷分失去参考价值。LoHoSearch基于覆盖762万实体的维基百科知识图谱自动出题,11款前沿模型测试最优成绩仅34.74%,大幅拉高评测难度上限。

配图

搜索智能体的能力到底该怎么衡量,过去一年整个行业都在盯着BrowseComp的跑分。这个2025年推出的基准一度是公认的“黄金标尺”:它要求模型模拟真实用户的搜索路径,在多轮交互中完成信息检索、推理、整合的全流程,跑分高低直接和厂商的技术实力挂钩。

免责声明:本网站AI资讯内容仅供学习参考,不构成任何建议,不对信息准确性与完整性负责。