xAI首席执行官埃隆·马斯克近期在X平台公开Grok系列大模型最新进展,旗下新一代大模型Grok 4.8参数量达2.5万亿,采用全新C++软件栈训练,将于本周内完成训练随即启动强化学习环节。此前原定9月12日发布的Grok 4.7因强化学习参数调校问题延期,也侧面凸显了大模型训练后期调试的技术门槛。

美国时间9月14日,马斯克在X平台的一条短帖瞬间引爆全球AI从业者的讨论:这是继Grok 4.7宣布延期后,xAI首次对外公布下一代模型的明确进展,也直接把大模型参数竞赛的门槛拉到了2.5万亿的新刻度。
据马斯克披露,Grok 4.8最大的技术突破不仅是2.5万亿的参数量,更是其首次采用全自研的C++软件栈完成训练。相比于行业通用的Python为主的训练框架,C++栈在执行效率、内存占用上有着数量级的优势,能大幅降低万亿参数模型的训练能耗和时间成本,也为后续推理端的性能优化预留了充足空间。按照xAI的规划,模型训练完成后将立刻进入强化学习阶段,进一步优化输出的准确性和可用性。
就在Grok 4.8消息公布的两天前,马斯克刚宣布原定9月12日发布的Grok 4.7延期,而延期的原因也颇为实在:强化学习环节的回复长度惩罚设置过重,导致模型遇到复杂任务时会过早停止输出,也不会主动回查自身输出的错误,相当于训练流程卡在了最后一公里。
这一细节也打破了外界“大模型只靠堆参数”的刻板印象:万亿参数规模的模型,训练后期的强化学习参数调校、对齐效果,直接决定了用户实际感知到的能力高低,哪怕是头部团队也会在这一环节遇到卡壳的情况。
值得注意的是,Grok 4.8并非首个公开的2.5万亿参数大模型,国内厂商月之暗面此前就宣布旗下Kimi K3大模型参数规模达2.5万亿,预计将于2026年第三季度正式发布。
当前全球大模型赛道已经明显分化出两条路线:一条是以xAI、月之暗面为代表的“堆参数+基础设施优化”路线,通过不断提升参数规模和训练效率冲击通用人工智能能力;另一条则是侧重小参数模型垂直优化的路线,主打低成本、低算力需求的落地场景。而随着C++软件栈这类训练基础设施的创新出现,万亿参数模型的训练门槛有望逐步降低,未来两年大模型的能力升级速度还将进一步加快。
免责声明:本网站AI资讯内容仅供学习参考,不构成任何建议,不对信息准确性与完整性负责。