Keenable AI开源NEEDLE实时基准 重构AI搜索能力评测体系

近日,AI技术厂商Keenable AI正式开源全新AI Agent搜索能力评测基准NEEDLE,该基准首创每小时全量更新搜索查询集的实时评测机制,可对市面上15款主流Agent API的实时搜索准确率、响应效率、幻觉率等核心指标完成标准化评分,解决了传统静态评测基准数据滞后、无法匹配真实搜索场景需求的痛点,为AI Agent的搜索能力迭代提供了统一参考标尺。

随着Agentic AI赛道融资规模在2026年上半年突破120亿美元,具备联网搜索能力的智能代理产品已成为科技大厂和创业公司的布局焦点,但行业长期缺乏可量化的真实场景评测标准。

当前行业常用的AI能力评测基准大多基于固定的静态数据集构建,不少查询问题的答案甚至是3-5年前的旧信息,仅能测试AI模型的存量知识储备,完全无法衡量其调用实时搜索接口、获取最新信息的能力。

免责声明:本网站AI资讯内容仅供学习参考,不构成任何建议,不对信息准确性与完整性负责。