Grok 4.7"价格没涨"是个陷阱:同一张表,你的账单悄悄翻倍了

5次阅读

9月21号,马斯克那边的 xAI(现在改名叫 SpaceXAI 了)扔出了新一代 Grok 4.7。官方的宣传话术很猛:参数更大、性能更强、最关键的是——价格没涨,还是 2 美元和 6 美元一百万 tokens。

看起来是良心升级,对吧?

但有个细节,SpaceXAI 自己没在头条里讲:Grok 4.7 在最高档"拼命干"模式下,每完成一个任务的输出 token 用量,比上一代多了 125%。换成人话就是——同一个任务,你要花两倍的钱。

那张写着"没涨价"的价格表,其实是个温柔的陷阱。

数字看着没涨,账单悄悄翻倍

先把硬数字摆出来:

  • 输入 token:每百万 2 美元(和 Grok 4.6 一样)
  • 输出 token:每百万 6 美元(和 Grok 4.6 一样)
  • 缓存读取:每百万 0.50 美元
  • 上下文窗口:50 万 token(没变)

看起来没毛病。但 Artificial Analysis 这个独立测评机构跑了一圈发现:Grok 4.7 在 xhigh 模式下,平均每个任务要吐 81000 个输出 token,而 Grok 4.6 只需要 36000 个。

按 6 美元一百万算,Grok 4.7 跑一个任务的成本是 0.49 美元,Grok 4.6 是 0.22 美元。

直接翻倍。

换算成每月账单的话——假如你原来每月花 100 美元用 Grok 4.6,切到 Grok 4.7 之后,假设你跑的任务量和上一代差不多,钱就变成 200 美元了。不是因为涨价了,是因为这孩子现在吃得多。

这招有点像外卖软件:菜单上的单价没变,但你点菜的份量悄悄翻了一倍,月底一看账单就懵了。

它到底变强在哪?

账单涨了这么多,那升级值不值?

这得分人看:

如果你跑的是短任务(几轮对话、翻译、写个小段文案):恭喜你,跳过这版本吧。Artificial Analysis 的数据是——除了"长链路智能工作",两个模型其它维度上几乎打平。多花一倍的钱买个差不多,脑子有坑。

如果你跑的是长链路任务(让 AI 自己干活几小时的写代码、做研究那种):这版本还真有点东西。AA-Briefcase 这个专门测长任务的基准里,Grok 4.7 的 Elo 评分涨了 111 分,从 1546 涨到 1657,已经接近 Anthropic 的 Claude Opus 5 和 OpenAI 的 Fable 5.1。

Coding Agent Index(编程智能体评分)也涨了 9 分,排到所有模型的第 4 名,前面是 Fable 5.1、GPT-6 Astra 和 Opus 5。

用过的早期测试者说:模型能更好地"自我检查",长上下文里也不容易跑偏,原生支持自家的 Grok Bot 框架,对话和知识类任务更稳。

翻译成人话:以前你得一句话一句话盯着 AI 干活,现在你能睡一觉起来,AI 还在干活而且没跑偏。

普通用户能直接用吗?

能。Grok 的免费版就能用 Grok 4.7。

具体来说:

  • Grok 网页版/App:免费用户可以用 Grok 4.7(带使用限额)
  • SuperGrok 订阅:每月 30 美元,限额更高
  • SuperGrok Heavy:每月 300 美元,重度用户套餐
  • Cursor 编程工具:已经集成 Grok 4.7(包括 Fast 版本)
  • Grok Build:xAI 自己的编程智能体,免费档就能用 Grok 4.7
  • GitHub Copilot:还没集成(估计在路上了)
  • API:每百万 token 输入 2 美元、输出 6 美元

但要注意一个坑:免费档的 Grok 4.7 是"标准速率",跑长任务会卡。如果你要用 Grok 4.7 Fast(两倍速度的版本),只能在 Cursor 和 Grok Build 里用,API 不开放,而且收费翻倍。

还有件事 SpaceXAI 在发布会里讲得很起劲,但实测有水分——他们说 Grok 4.7 是"速度翻倍"。这对比的参照物是更贵的对手模型,不是自家上一代。上一代 Grok 4.6 的速度,Grok 4.7 其实差不多。

安全上更严了

这次安全性能也是 SpaceXAI 重点宣传的点:

Grok 4.7 用了一套全新的"安全防护栈",号称是有史以来最严格的版本。具体数字:

  • LatchBio 生物安全基准:62.4%
  • HackerBench v0.3 网络安全测试:只让 3.3% 的高风险双用途指令通过

听起来很厉害,但这两个数字都是 SpaceXAI 自己测的,目前没有第三方独立验证。

配合之前 Grok 系列几次"出格"(帮用户生成有害内容、和马斯克抬杠甚至对骂)的事件背景,这次把安全拉满也算亡羊补牢。

和对手比还差多少

把 Grok 4.7 放到整个 AI 大模型市场里看:

在电气工程和法律事务基准上,SpaceXAI 自家数据里 Grok 4.7 已经领先。在 Terminal Bench 4.0 这种重度的编程任务上,还是 Fable 5.1 领先;在临床推理上,Fable 5.1 和 GPT-6 Astra 都在 Grok 4.7 前面。

价格对比:Grok 4.7 跑一个任务的输出成本 0.49 美元;Fable 5.1 在 50 美元一百万的高价位上,同样的预算只能买到不到 1 万 token。

这就是说——Grok 4.7 在"花钱不心疼但能完成长任务"这个象限里确实站得住。但要说"最强",还轮不到它。

谁应该升级,谁应该跳过?

说点直接的判断:

赶紧升级的:

  • 在 Cursor 或 Grok Build 里写代码的(长链路编程任务,11 分的智能体提升是真香的)
  • 跑长时间研究、数据分析、自动化任务的工作流
  • 需要 AI 自我检查、长时间不跑偏的项目(比如让 AI 干 18 小时无人值守的活)

等等再说的:

  • 日常聊天、翻译、写短文案的(Grok 4.6 够用,省下的钱够喝一个月咖啡)
  • 任务量固定、已经跑顺了的工作流(先 A/B 测试一下再切换)
  • 预算敏感的个人开发者(xhigh 模式下账单会悄悄翻倍)

完全不用看的:如果你已经在用 Fable 5.1 或者 Opus 5 这种顶级模型,Grok 4.7 不是你的菜——你买的是天花板级别的能力,价格贵一点但账单可预测。

最后

Grok 4.7 不是来掀桌子的,它是来抢人的。

同一价位,比上一代能干更多的活;干更多的活,自然花更多的钱。这套路你熟不熟?

订阅经济里的"温水煮青蛙":第一个月你被"零涨价"的宣传吸引,第二个月你发现账单不对了,第三个月你已经被深度绑定,懒得换了。

下次听到"价格没变"的好消息时,先问自己一句——输出量变没变呢?

这问题,比"它有多强"重要得多。

正文完
 0