Anthropic披露自改进AI最新研究 定向优化无通用性能衰减

近日,人工智能企业Anthropic的研究员公开了其在自改进AI领域的最新研究成果:在针对10项特定错位行为设计的基准测试中,其自研的自改进自动化系统实现了所有测试项的性能提升,且全程未出现模型通用能力衰减的问题,为解决AI对齐难题、实现安全可控的模型迭代提供了新的可行路径。

配图

在大模型迭代速度不断加快的当下,纯人工驱动的RLHF(基于人类反馈的强化学习)已经逐渐难以覆盖海量的对齐需求,自改进AI被视作下一代模型迭代的核心方向,但其安全性始终未能得到验证。

免责声明:本网站AI资讯内容仅供学习参考,不构成任何建议,不对信息准确性与完整性负责。