2026年9月,人工智能领域先驱李飞飞携World Labs团队在投资机构a16z的前沿技术论坛上首次公开自研多模态世界模型Atlas。该模型打破大语言模型预测下一token、视频模型预测下一帧的传统范式,以“新视角预测”为核心,可基于少量视角图像或文本生成任意时空视角画面,原生支持多模态数据处理,被视为AGI领域的突破性方向。
作为硅谷顶级风投机构a16z每年最受关注的AI前沿论坛环节之一,李飞飞团队的这次亮相几乎承包了2026年9月初全球AI圈的全部讨论热度。毕竟在大语言模型参数迭代陷入边际效应递减、生成式AI落地场景长期集中在内容生产领域的当下,整个行业都在寻找下一个能够推动AGI落地的核心技术支点。
过去十年,AI领域的核心技术突破始终围绕两大预测逻辑展开:大语言模型以“下一token预测”为核心,实现了自然语言理解与生成能力的跃迁;视频生成模型以“下一帧预测”为核心,推动了AIGC内容生态的爆发。
但随着技术迭代深入,两大路径的固有缺陷也逐渐暴露:大语言模型始终无法完全解决幻觉问题,很难适配对精准度要求极高的工业、机器人场景;视频生成模型的长时序时空一致性问题迟迟得不到突破,传统三维重建技术又依赖高密度的多视角采集数据,落地成本居高不下,整个行业都在呼唤新的技术范式。
登录后解锁全文,体验收藏、点赞、评论等完整功能
立即登录