近日,字节跳动旗下Seed团队推出AI Agent开发评测工具HarnessDev,针对6款主流大语言模型自主构建、迭代Agent运行框架的能力展开测试,覆盖2207项细分任务。结果显示,大模型对框架的修改仅34项可适配未见过的测试场景,泛化通过率不足54%,暴露当前Agent自主开发能力的明显短板。

随着AI Agent在办公、客服、科研等场景的落地加速,如何降低Agent的开发门槛成为全行业共同探索的方向。过去一年,多家厂商宣称旗下大模型已经具备自主生成Agent代码的能力,仅靠自然语言描述就能完成专属Agent的搭建,但落地过程中频繁出现的适配问题,始终困扰着开发者。
传统的Agent开发需要开发者手动编写调度逻辑、工具调用接口、容错机制等框架代码,定制一个垂直场景的Agent往往需要数周的开发周期,人力成本极高。因此行业普遍将“大模型自主构建Agent框架”视为下一阶段的核心突破点,希望借此将Agent开发周期压缩到几小时甚至几分钟,实现AI应用的规模化落地。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录