9 月下旬马斯克旗下的 SpaceXAI原 xAI发布了新一代主力模型 Grok 4.7。官方给的定位很直白面向编程与知识工作。据报道它的 API 定价与上一代 Grok 4.6 完全持平——每百万输入 token 2 美元、输出 6 美元。换代不加价是这次发布最响的卖点。消息出来后社区的评价明显分成两派一派说性价比拉满一派说跑分没涨服人。先把事实摆清楚再说它对写代码、做后端的人到底意味着什么。这次变了什么没变什么变了的是长任务能力。据官方口径Grok 4.7 换用了比 4.6 更大的基础模型训练阶段延长了强化学习周期任务组合也更难——不少训练样本需要跑几个小时才能完成。它宣称的重点不是单轮问答更聪明而是三件事在持续数小时的任务里少走弯路、更仔细地检查自己的产出、更可靠地管理长上下文。这里有个容易被忽略的读法。官方公布的对比表里Terminal-Bench 4.0多小时终端任务从 20.3% 涨到 38.0%涨幅最大CursorBench 4.0 从 40.4% 升到 46.3%DeepSWE v1.1 从 65.2% 升到 71.0%。但涨幅大往往只是因为起点低。同一张表里Terminal-Bench 的绝对位置仍然是落后的据报道GPT-6 Astra 在 57.9%、Fable 5.1 在 55.8%差了将近 20 个百分点。综合智能指数上Grok 4.7 是 46 分而 53 分那一档站着 GPT-6 Astra 与 Fable 5.1。没变的是它的位置。据报道官方在宣发里坦诚在智能体编程这件事上排在 Anthropic 和 OpenAI 后面卖点落在便宜、快、成本低、适合日常干活。换句话说厂商自己把定位说成长编码任务的性价比前沿而不是全面领先。马斯克把这次发布称为把 SpaceXAI 送上了智能体编程的第三把交椅并称下一代的 4.8 已经训练完成。对开发者来说这其实是个更省心的信号不用猜它是不是第一直接按够用且便宜来评估就行。真正影响账单的几个细节选型时最容易被每百万 token 2 美元带节奏。但单价从来不是你能直接拿去乘的数。至少有四件事要一起看。一、长上下文是加倍计费而且看整次请求。据报道Grok 4.7 按提示词长度分两档低于 200K 时输入 2 美元、输出 6 美元达到或超过 200K 时输入 4 美元、输出 12 美元。关键在整次请求按高价档计价——不是只对超出 200K 的那部分加价。也就是说你把 210K 的上下文塞进去整单都按贵的一档算。二、缓存输入那一栏别漏看。据报道标准档的缓存输入低至每百万 0.5 美元只有普通输入的几分之一。凡是重复投喂同一段长系统提示、同一份代码库上下文、同一套文档的场景账单大头其实落在这一栏。只看 2 美元和 6 美元两个数字做预算方向容易看错。三、token 膨胀可能吃掉价格优势。有分析指出Grok 4.7 在长推理阶段输出的 token 明显变多据媒体报道平均每个任务约 8.1 万 token而前代约 3.6 万。单价没涨单次任务的成本却可能翻倍。举个账4.6输入 2 万 输出 3.6 万 → 2万×$2/M 3.6万×$6/M ≈0.256 美元4.7输入 2 万 输出 8.1 万 → 2万×$2/M 8.1万×$6/M ≈0.526 美元这不是说 4.7 更贵——它可能更快干完、更少返工那些都是收益。它只说明一件事预算要用单价 × 你自己的真实 token 数而不是单价 × 去年的用量。四、推理强度可调Fast 版买不到。据报道模型提供 low / medium / high默认/ xhigh 四档推理强度档位越高思考越久简单任务手动调低一档比换模型更省钱。另外 Fast 版虽然响应更快但价格是标准版的 2 倍且据报道只在 Cursor 与 Grok Build 两个平台内提供不在公开 API 上——想在自家后端直接调它来降延迟这条路走不通。怎么用接入方式和一次小验证Grok 4.7 已上线 Cursor 与官方编程产品 Grok BuildAPI 也同步开放。xAI 的接口是 OpenAI 兼容的切换成本很低fromopenaiimportOpenAI clientOpenAI(api_keyYOUR_XAI_API_KEY,base_urlhttps://api.x.ai/v1,# xAI 提供 OpenAI 兼容接口)respclient.chat.completions.create(modelgrok-4.7,messages[{role:system,content:你是一个严谨的代码助手。},{role:user,content:把这段 Python 函数改成带类型注解、并补上边界处理的版本。},],)print(resp.choices[0].message.content)print(resp.usage)# 关注 prompt_tokens / completion_tokens做成本预算就看这两项接入前还有两个小坑值得记一下一是它的知识截止据报道在 2026 年 5 月7 月以后的事它并不知道涉及近期事实的任务仍要检索或把资料喂进上下文二是据报道它的 Responses API 响应里总会带上加密的推理内容字段照抄旧版本的响应处理逻辑可能出问题。最省事的验证方式不是读对比文章而是在自己正在跑的工作流里挑 5 到 10 个有代表性的真实任务只把 model ID 从grok-4.6换成grok-4.7其他都不动跑一遍然后比对三件事——完成质量、token 总量、账单金额。这三项里任何一项变差都值得再想想。写在最后旗舰模型的迭代节奏已经快到月度更新价格战也在继续。对开发者来说好处是选择变多坏处是每百万 token 单价这个数字越来越不能直接用来做预算。真正要盯的是模型在自己任务上的完成率和总账单。所以问题其实不是Grok 4.7 强不强而是你会把新模型直接切进生产还是先小流量跑一遍评论区聊聊你踩过的计费坑。