登录体验完整功能(收藏、点赞、评论等) — 已累计有 13602 人加入

MIT最新研究:大模型规模扩张将显著加剧AI归因困境

详情页推荐

近日麻省理工学院(MIT)研究团队发布AI归因领域最新研究成果,证实随着扩散类生成式AI模型参数量、训练数据集规模持续扩张,单条训练样本对模型输出的可测量影响将持续下降,这种被命名为「归因衰减」的现象,将直接提升AI版权纠纷判定、合规审计、行业治理的落地难度。

过去两年,全球范围内已有数十起生成式AI相关版权诉讼落地,从Getty Images起诉Stability AI未经授权使用海量版权图片训练模型,到多位插画师联合起诉Midjourney、OpenAI侵犯著作权,几乎所有纠纷的核心卡点都指向同一个问题:如何证明某条AI输出内容,确实用到了特定的版权训练素材。

此前行业普遍认为,归因技术的迭代将逐步解决这一问题——通过算法追溯单条训练样本对AI输出的贡献度,就能直接判断特定输出是否使用了未授权素材,为版权判定、合规审计提供明确依据。但MIT的最新研究却打破了这一预期,证明大模型的规模扩张本身就会抵消归因技术的效果。

MIT研究团队针对不同参数规模的扩散模型做了多组对照实验,在控制训练数据构成、模型训练方法、测试prompt完全一致的前提下,发现模型参数量每提升一个数量级,单条训练样本对输出结果的贡献度可测量值平均下降27%。当模型参数量突破千亿级之后,超过92%的训练样本对输出的个体贡献已经无法被现有追溯技术识别。

免责声明:本网站AI资讯内容仅供学习参考,不构成任何建议,不对信息准确性与完整性负责。