近日,人工智能企业Anthropic的研究员公开了其在自改进AI领域的最新研究成果:在针对10项特定错位行为设计的基准测试中,其自研的自改进自动化系统实现了所有测试项的性能提升,且全程未出现模型通用能力衰减的问题,为解决AI对齐难题、实现安全可控的模型迭代提供了新的可行路径。

在大模型迭代速度不断加快的当下,纯人工驱动的RLHF(基于人类反馈的强化学习)已经逐渐难以覆盖海量的对齐需求,自改进AI被视作下一代模型迭代的核心方向,但其安全性始终未能得到验证。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录