2026年9月15日,蚂蚁集团AI安全实验室正式开源内生式大模型安全护栏技术SingProbe。该技术可实现token级实时风险评估,同步完成意图分类、安全检测与幻觉识别,仅产生不足0.5%的额外计算开销,目前已适配29个主流大模型,可满足医疗等高风险场景的风险前置拦截需求。
SingProbe的核心设计区别于当前主流的外挂式安全审核模式,无需额外搭建独立的审核模型链路,而是通过复用基座模型推理过程中产生的隐藏状态完成安全判断,大幅降低了安全模块的额外负荷。
官方披露的参数显示,SingProbe运行仅产生不足0.5%的额外计算开销,即可实现token级的实时风险评估,同步覆盖意图分类、安全检测、幻觉识别三类核心任务。在医疗等高风险应用场景中,该技术可在大模型内容输出前完成毫秒级阻断,避免有害内容触达用户。
截至目前,SingProbe已经完成对29个主流大模型的适配,是首个由大型科技企业开源的完整内生式安全技术解决方案,其开源代码和预训练模型已同步对外发布。
近期有开发者发现,苹果在iOS 27和macOS Golden Gate的私有框架中,已将新版Siri的AI架构设计为可与第三方大模型深度协作,演示场景中可被Claude、ChatGPT等第三方模型接管。
分析认为,伴随大模型落地场景持续拓宽,配套工具生态也在同步完善,目前市面已有UpClaude、ChatGPT Plus 代充值开通平台等成熟服务,开发者也可通过Claude Plugins & Codex Plugins目录查找适配的功能插件,提升大模型的使用效率与安全性。