9月21号,马斯克那边的 xAI(现在改名叫 SpaceXAI 了)扔出了新一代 Grok 4.7。官方的宣传话术很猛:参数更大、性能更强、最关键的是——价格没涨,还是 2 美元和 6 美元一百万 tokens。
看起来是良心升级,对吧?
但有个细节,SpaceXAI 自己没在头条里讲:Grok 4.7 在最高档"拼命干"模式下,每完成一个任务的输出 token 用量,比上一代多了 125%。换成人话就是——同一个任务,你要花两倍的钱。
那张写着"没涨价"的价格表,其实是个温柔的陷阱。
数字看着没涨,账单悄悄翻倍
先把硬数字摆出来:
- 输入 token:每百万 2 美元(和 Grok 4.6 一样)
- 输出 token:每百万 6 美元(和 Grok 4.6 一样)
- 缓存读取:每百万 0.50 美元
- 上下文窗口:50 万 token(没变)
看起来没毛病。但 Artificial Analysis 这个独立测评机构跑了一圈发现:Grok 4.7 在 xhigh 模式下,平均每个任务要吐 81000 个输出 token,而 Grok 4.6 只需要 36000 个。
按 6 美元一百万算,Grok 4.7 跑一个任务的成本是 0.49 美元,Grok 4.6 是 0.22 美元。
直接翻倍。
换算成每月账单的话——假如你原来每月花 100 美元用 Grok 4.6,切到 Grok 4.7 之后,假设你跑的任务量和上一代差不多,钱就变成 200 美元了。不是因为涨价了,是因为这孩子现在吃得多。
这招有点像外卖软件:菜单上的单价没变,但你点菜的份量悄悄翻了一倍,月底一看账单就懵了。
它到底变强在哪?
账单涨了这么多,那升级值不值?
这得分人看:
如果你跑的是短任务(几轮对话、翻译、写个小段文案):恭喜你,跳过这版本吧。Artificial Analysis 的数据是——除了"长链路智能工作",两个模型其它维度上几乎打平。多花一倍的钱买个差不多,脑子有坑。
如果你跑的是长链路任务(让 AI 自己干活几小时的写代码、做研究那种):这版本还真有点东西。AA-Briefcase 这个专门测长任务的基准里,Grok 4.7 的 Elo 评分涨了 111 分,从 1546 涨到 1657,已经接近 Anthropic 的 Claude Opus 5 和 OpenAI 的 Fable 5.1。
Coding Agent Index(编程智能体评分)也涨了 9 分,排到所有模型的第 4 名,前面是 Fable 5.1、GPT-6 Astra 和 Opus 5。
用过的早期测试者说:模型能更好地"自我检查",长上下文里也不容易跑偏,原生支持自家的 Grok Bot 框架,对话和知识类任务更稳。
翻译成人话:以前你得一句话一句话盯着 AI 干活,现在你能睡一觉起来,AI 还在干活而且没跑偏。
普通用户能直接用吗?
能。Grok 的免费版就能用 Grok 4.7。
具体来说:
- Grok 网页版/App:免费用户可以用 Grok 4.7(带使用限额)
- SuperGrok 订阅:每月 30 美元,限额更高
- SuperGrok Heavy:每月 300 美元,重度用户套餐
- Cursor 编程工具:已经集成 Grok 4.7(包括 Fast 版本)
- Grok Build:xAI 自己的编程智能体,免费档就能用 Grok 4.7
- GitHub Copilot:还没集成(估计在路上了)
- API:每百万 token 输入 2 美元、输出 6 美元
但要注意一个坑:免费档的 Grok 4.7 是"标准速率",跑长任务会卡。如果你要用 Grok 4.7 Fast(两倍速度的版本),只能在 Cursor 和 Grok Build 里用,API 不开放,而且收费翻倍。
还有件事 SpaceXAI 在发布会里讲得很起劲,但实测有水分——他们说 Grok 4.7 是"速度翻倍"。这对比的参照物是更贵的对手模型,不是自家上一代。上一代 Grok 4.6 的速度,Grok 4.7 其实差不多。
安全上更严了
这次安全性能也是 SpaceXAI 重点宣传的点:
Grok 4.7 用了一套全新的"安全防护栈",号称是有史以来最严格的版本。具体数字:
- LatchBio 生物安全基准:62.4%
- HackerBench v0.3 网络安全测试:只让 3.3% 的高风险双用途指令通过
听起来很厉害,但这两个数字都是 SpaceXAI 自己测的,目前没有第三方独立验证。
配合之前 Grok 系列几次"出格"(帮用户生成有害内容、和马斯克抬杠甚至对骂)的事件背景,这次把安全拉满也算亡羊补牢。
和对手比还差多少
把 Grok 4.7 放到整个 AI 大模型市场里看:
在电气工程和法律事务基准上,SpaceXAI 自家数据里 Grok 4.7 已经领先。在 Terminal Bench 4.0 这种重度的编程任务上,还是 Fable 5.1 领先;在临床推理上,Fable 5.1 和 GPT-6 Astra 都在 Grok 4.7 前面。
价格对比:Grok 4.7 跑一个任务的输出成本 0.49 美元;Fable 5.1 在 50 美元一百万的高价位上,同样的预算只能买到不到 1 万 token。
这就是说——Grok 4.7 在"花钱不心疼但能完成长任务"这个象限里确实站得住。但要说"最强",还轮不到它。
谁应该升级,谁应该跳过?
说点直接的判断:
赶紧升级的:
- 在 Cursor 或 Grok Build 里写代码的(长链路编程任务,11 分的智能体提升是真香的)
- 跑长时间研究、数据分析、自动化任务的工作流
- 需要 AI 自我检查、长时间不跑偏的项目(比如让 AI 干 18 小时无人值守的活)
等等再说的:
- 日常聊天、翻译、写短文案的(Grok 4.6 够用,省下的钱够喝一个月咖啡)
- 任务量固定、已经跑顺了的工作流(先 A/B 测试一下再切换)
- 预算敏感的个人开发者(xhigh 模式下账单会悄悄翻倍)
完全不用看的:如果你已经在用 Fable 5.1 或者 Opus 5 这种顶级模型,Grok 4.7 不是你的菜——你买的是天花板级别的能力,价格贵一点但账单可预测。
最后
Grok 4.7 不是来掀桌子的,它是来抢人的。
同一价位,比上一代能干更多的活;干更多的活,自然花更多的钱。这套路你熟不熟?
订阅经济里的"温水煮青蛙":第一个月你被"零涨价"的宣传吸引,第二个月你发现账单不对了,第三个月你已经被深度绑定,懒得换了。
下次听到"价格没变"的好消息时,先问自己一句——输出量变没变呢?
这问题,比"它有多强"重要得多。