SpaceXAI于2026年9月21日发布新一代旗舰模型Grok 4.7,采用更大基座模型并融入SpaceX工程数据训练,API定价与Grok 4.6持平:每百万Token输入2美元、输出6美元。官方称其在EEBench和Harvey法律基准上领先竞品,但独立评测提示跑分优势部分源于更高推理强度。马斯克透露,下一代2.5T模型Grok 4.8已完成训练。

当GPT-5.6 Sol以每百万输入Token 4美元、输出20美元的定价被视作“旗舰基准”时,SpaceXAI在9月21日发布的Grok 4.7依然沿用前代的价签:每百万输入Token 2美元、输出6美元。与之形成对照的是,Fable 5.1的定价高达输入10美元、输出50美元。更名后的SpaceXAI用“速度两倍、价格一半”来概括这一代旗舰的定位——这也是其前身xAI时期一贯策略的延续。
从官方披露的信息来看,Grok 4.7的底层基座大于4.6版本。据多家媒体报道,其参数规模可能达到2.1万亿,而Grok 4.6为1.5万亿。尤为值得注意的是,训练数据中加入了SpaceX的工程数据,这在大型语言模型中并不常见。与此同时,强化学习训练时间被显著拉长,官方将长时任务、自检能力和长上下文处理作为此次优化的重点方向。
SpaceXAI给出了颇为亮眼的跑分成绩。在EEBench(电气工程基准)上,Grok 4.7得分64.0%,而Grok 4.6为53.0%,同期GPT-5.6 Sol仅得到39.4%;在Harvey法律智能体基准上,Grok 4.7得分19.6%,同样领先4.6版本的15.8%。这些数字足以在官方对比表中占据榜首位置。
但独立评测机构对“领先”的含金量提出了质疑。有分析指出,Grok 4.7跑分时按“xHigh”推理强度计分,而Grok 4.6按“High”计分;在统一推理强度下,Grok 4.7在CursorBench上的优势从高推理模式下的46.3%缩水至43.9%。OpenTools的测评也提醒,虽然Token单价不变,但任务耗时的延长与Token消耗量的上升,可能导致实际单任务API成本高于前代。
模型本身已经上线多个入口,包括xAI API(模型名为grok-4.7)、Cursor、Grok Build以及主流云平台。在Artificial Analysis的综合智能指数统计中,Grok 4.7拿到46分,位列第二梯队。
马斯克在发布后表态称,凭借Grok 4.7,SpaceXAI在“智能体编程”领域已位列全球第三,仅次于Anthropic与OpenAI。他还透露,下一代模型Grok 4.8已完成训练,规模达到2.5T参数。围绕Grok生态,Grok Bot、Grok Image 2.0以及Grok Bot Templates等配套工具也在持续迭代,开发者构建应用的路径正在被逐渐拉平。
可以推断,SpaceXAI刻意保持定价不变的策略,意在抢占API市场的价格心智。纵向来看,Grok 4.7的能力上限确实有明显提升,但横向对比时,跑分优势的表述仍需谨慎对待。只要推理强度的设定没有统一标准,benchmark数字就只能作为参考维度之一。实际使用中,长任务场景下的token消耗增加,意味着“每百万token两美元”的单价并不等同于单次任务成本的下降。
从行业角度看,Grok 4.7的真正看点不在于榜单名次,而在于它把“更高能力”与“更贵总账”这一矛盾摆上了台面——这一点,对于所有按token计费的大模型厂商而言,都是绕不开的考题。