
近日,AI企业Moonshot AI正式推出面向多模态视觉模型的专用评测工具PerceptionBench。该工具搭载高鲁棒性数据加载模块与全自动判分系统,可将多模态模型视觉能力的评测周期缩短70%以上,评测结果一致性较传统人工标注方案提升92%,为大模型厂商、AI应用开发者提供了标准化的多模态能力验证路径。
过去两年多模态大模型的迭代速度不断刷新行业认知,从细粒度图像识别、复杂视觉推理到跨模态生成对齐,各家厂商的模型能力边界持续拓展,但与之配套的评测体系却始终没有跟上研发节奏。长期以来,多模态视觉能力的评测高度依赖人工标注,不仅单轮评测成本动辄超过10万元、周期长达一周以上,不同标注团队的判断标准差异还经常导致评测结果缺乏横向参考性,有调研显示,不少AI研发团队需要花费近30%的项目时间搭建定制化评测流程。
此次推出的PerceptionBench直击上述行业痛点,两大核心能力实现了评测流程的全自动化升级。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录