对话蚂蚁百灵团队:大模型落地金融医疗 克制也是核心能力

2026年9月14日,蚂蚁集团基础智能技术部负责人、百灵大模型负责人西亭,联合阿福模型技术负责人进捷、百灵金融模型负责人月引、百灵语言基座负责人零幺,在外滩大会期间就百灵3.0、金融与医疗垂直大模型落地真实场景等话题,与网易科技等多家媒体展开交流,提出大模型落地需跳出参数竞赛逻辑,兼顾能力、成本与可靠性。

跳出参数竞赛:真实场景没有标准答案

过去一年,大模型行业的主战场先是围绕参数和榜单展开竞争,随后转向Coding和Agent领域。但在西亭看来,当前真实世界中仍然有大量任务没有被很好解决,覆盖金融、医疗、法律、日常工作流等多个维度。
这类任务未必像Coding一样拥有标准数据和清晰答案,却更贴近普通人的日常生活,因此大模型如果要真正走向真实世界,不能仅停留在“会回答问题”的层面,还要能把实际任务做扎实。

智效比成核心评估标尺

交流过程中,西亭反复提及智效比这一核心评估指标。在百灵团队的语境中,智效比并非单纯指向降低推理成本,而是要将模型能力、运行速度、落地成本和结果可靠性放在同一框架下综合考量。
西亭明确表示“生成的快并不代表整个任务完成的快”,衡量模型落地效果的核心标准,要综合看完成一个任务总共消耗的成本、用户等待的时长、中间的重复操作次数,以及最终输出结果的可靠性。基于这一逻辑,百灵3.0并未将宣传重点放在更大参数上,而是选择开源Tiny、Flash等小尺寸模型。

垂直场景落地更需克制能力

针对金融、医疗这类对结果容错率极低的垂直场景,西亭也明确提出,克制也是大模型落地的核心能力,团队不会为了追求短期的参数、榜单成绩,牺牲落地场景的实际使用体验。

本文基于公开信息分析整理,仅供参考。更多AI工具动态与行业解读,请持续关注本站更新。