8月12日,SpaceXAI发布Grok 4.6, benchmark得分61,和GPT-5.6 Sol打平。但价格只有GPT-5.6 Sol的40%。
这是什么意思?马斯克在AI竞争里找到了一个别人没有的切口:不是拼最强,而是拼最划算。
三个数字说清楚:
(1) 61分——和GPT-5.6 Sol并列,落后Claude Opus 5的63分。差距只有2分。
(2) $2/$6——每百万token的输入/输出价格。GPT-5.6 Sol是$5/$30,Claude Opus 5是$5/$25。Grok便宜了60%到75%。
(3) 53次对话轮次——完成同等任务,Claude Opus 5需要103次。Grok用一半的对话量搞定。
平均每个任务成本$0.84。Artificial Analysis把它放在了"智能-成本帕累托前沿"上——意思是在这个价格区间,没有对手能跑出更好的智能表现。
当然,马斯克没说的是:超过20万token的请求,整个请求按双倍计费。$4/$12每百万token。那些跑长文本分析、代码库理解的用户,实际账单会比封面价格高出一截。
Grok 4.7已经在路上了。8月12日的SpaceX Q2财报电话会上,马斯克说3到4周后发布。参数从1.5万亿跳到2.1万亿,还会用SpaceX工程数据做增量训练。
他的原话是:SpaceX的训练语料"太牛了,独一无二",如果Grok 4.7在真实工程任务上不是最强,他会"感到震惊"。
这话听着耳熟。上一次有人这么自信地预告模型,还是GPT-5.6发布前夜。
有意思的是,SpaceX正在以600亿美元股票收购Cursor。Grok 4.5和4.6都是用Cursor上的真实开发者会话数据联合训练的——数万亿token的开发者实际工作记录,这是其他公司拿不到的护城河。
Grok 5预计年底前发布,届时会用上SpaceX 25年的完整数据档案。这包括了1.4到1.5万名员工的生产和思考内容——至于员工有没有选择退出的机制,马斯克没有公开说明。
现在的情况是这样的:Grok 4.6不是最强的模型,但在"花多少钱办多少事"这件事上,它暂时没有对手。Claude Opus 5单轮智力更强,但跑一个完整的工作流,账单可能是Grok的4倍。
对那些不在乎面子、在乎里子的开发者和公司来说,这个选择不难做。
马斯克不一定是AI技术的领头羊,但他似乎摸到了AI商业化的一根神经:贵的不一定好,适合的才是真的好。