2026年9月,大模型厂商DeepSeek在Hugging Face平台上线V4家族首款实验性多模态模型DeepSeek-V4-Flash-Vision-Exp,采用MIT开源协议,参数量达305B。不同于传统多模态模型主打C端视觉问答的定位,该产品聚焦多模态Agent能力,支持Agent识别界面、图表等视觉信息后调用工具执行任务,为AI Agent规模化落地提供了全新技术路径。

长期以来,AI Agent的视觉感知能力都是行业落地的核心短板:多数现有Agent仅能处理结构化文本输入,当用户抛出软件报错截图、仪表盘数据图、操作界面录屏帧这类非结构化视觉内容时,往往需要先经过OCR识别转译,不仅丢失布局、色彩等关键信息,准确率也难以满足自动化执行的要求。
过去两年多模态大模型的迭代始终围绕C端用户需求展开,多数产品优化方向集中在看图答题、生成图片描述、图文创作等场景,模型对视觉信息的解析逻辑更贴合人类的阅读习惯,而非Agent的执行逻辑。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录