
2026年7月31日,由上海人工智能实验室牵头,联合广州实验室钟南山院士团队、复旦大学附属中山医院葛均波院士团队共同研发的中文医疗大模型评测基准MedBench正式升级至5.0版本。该版本首创医疗原子技能评测范式,可全维度校正AI模型幻觉,是国内首个原生医疗垂直评测体系,同时为上海市指定的前置医疗AI应用技术评测载体。
随着大语言模型技术向垂直场景渗透,医疗AI已经成为当下产业落地最热门的赛道之一,但由于医疗场景的强专业性、高风险性,模型幻觉、专科适配性不足等问题,始终是阻碍医疗大模型走进临床、面向患者的核心瓶颈。
此前国内医疗AI领域始终缺乏统一的原生垂直评测体系,多数大模型的医疗能力评测沿用通用基准,既没有适配中文语境下的医患沟通习惯、临床诊疗规范,也很少覆盖呼吸、心血管等高发专科的细分场景,导致不少通过通用评测的医疗AI产品,在实际落地中频频出现不符合临床要求的错误输出,埋下安全隐患。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录