2026年7月17日,美团AI团队LongCat发布全新搜索智能体评测基准LoHoSearch。此前业内通用的BrowseComp基准上线仅10个月,前沿模型准确率已从初始的30%攀升至90%,评测区分度基本消失。新基准依托涵盖762万实体的维基百科知识图谱自动生成考题,首批11款主流前沿模型测试最高得分仅34.74%,大幅抬高了行业评测门槛。搜索智能体作为大语言模型落地的核心场景之一,其能力评估长期依赖标准化基准测试,但技术迭代速度远超基准设计生命周期的问题,正在成为行业共同的痛点。仅在一年前,BrowseComp基准推出时的30%准确率天花板,还被视为搜索智能体难以跨越的门槛,而到2026年中,几乎所有主流模型都能在该基准上拿到90%以上的分数,高分模型的实际落地效果却参差不齐。BrowseComp的快速失效,本质上是人工出题模式的先天缺陷导致的。该基准的所有测试用例均由专业标注人员设计,出题逻辑和难度上限都受限于标注者的认知边界,模型研发团队很容易针对固定的出题逻辑做定向优化,也就是行业俗称的“刷分”。 当所有头部模型都能拿到90分以上的成绩时,基准本身已经无法区分不同模型的真实...