把最新模型换进旧工作流,表现反而退步了。这句话,成为Grok 4.7发布日最值得琢磨的注脚。9月21日,xAI(对外亦称SpaceXAI)正式发布Grok 4.7,新模型支持50万token上下文窗口,可处理文本和图像,提供从low到xhigh四档推理强度,同步登陆xAI API、Grok Build和Cursor,并开始向GitHub Copilot用户开放。

官方公告显示,Grok 4.7 Fast版仅限Cursor和Grok Build使用。GitHub Copilot则采取渐进式开放策略——Pro、Pro+、Max、Business、Enterprise用户将逐步获得访问权限,管理员可单独控制是否启用。API定价同步公开:输入价格每百万token 2美元,输出价格每百万token 6美元。官方称,该模型定位编程与知识工作,推理速度是同类产品的两倍,价格仅为一半。
在这次发布中,安全公司XBOW的一组测试结果引起了注意。据报道,XBOW在50项漏洞测试中发现,Grok 4.7的早期候选版接入原有框架时,表现略逊于4.6;换到基于Grok Build的系统后,结果反转,真实问题发现数从42项增至68项。
两套工具得出相反结果,差别不只在模型本身的智能水平,还在于Agent如何保存上下文、调用工具,以及失败后如何重试。Grok 4.7在推理时偏爱短步骤、频繁获取反馈,Grok Build恰好顺着这种方式设计。可以推断,新一代模型的进步,需要配合Agent工具才能完全释放。
按照xAI官方的说法,Grok 4.7采用了更大的基础模型,强化学习时间比上一代更长,训练任务也更偏向需要数小时才能完成的问题。从测试表现来看,这种训练取向与模型偏好短步骤、频繁反馈的行为模式是一致的。
值得注意的是,Grok 4.7与Cursor的深度捆绑并非偶然。据公开信息,Cursor已于2026年8月14日被SpaceX收购,成为其子公司。因此在新模型发布时,Grok Build和Cursor得以率先集成新版本,形成“模型+工具”的组合输出。
分析认为,Grok 4.7的测试分歧给开发者提了一个醒:模型能力与Agent工具框架之间可能存在深度耦合。同样的模型,放在不同调用方式下,结果可能截然不同。仅仅把API里的模型版本从4.6改成4.7,未必能获得预期提升;适配新模型的工作方式,或许比模型本身更重要。
当然,这并不意味着Grok 4.7自身不够强。官方公布的上下文长度、多模态输入和推理档位,都说明这是一个面向复杂任务的旗舰模型。只是当模型对工具框架表现出明显“偏好”时,如何评测模型真实能力,也成了一个新问题。