AIHub

Grok 4.7 正式版上手实战:速度翻倍、价格不变的编程旗舰,基准、API 接入与 fast 版成本一次算清

进阶约 13 分钟读完2026-09-22#Grok 4.7#SpaceXAI#xAI#API 接入#AI 编程#模型选型#成本控制
Grok 4.7 正式版上手实战:速度翻倍、价格不变的编程旗舰,基准、API 接入与 fast 版成本一次算清

半个月前,我们写过一篇《Grok 4.7 承诺今天发布:先把「新模型当天接入 xAI API」的全套准备做齐》——当时模型卡还没影,只能教大家用脚本盯模型列表、用环境变量做灰度切换。9 月 21 日,这只靴子终于落地:SpaceXAI 正式发布 Grok 4.7,官方口径是「迄今编程和知识工作能力最强的模型」。

对开发者来说,这次发布最值得注意的不是参数,而是三件事:价格没变、速度翻倍、发布当天就能用。本文把官方公布的基准数字摊开对比、把 API 接入代码写全、把标准版和 fast 版的成本账算清楚,并讲清 Grok 4.6 用户迁移时真正需要动的地方(答案可能让你意外)。

一、发布了什么:一次「加量不加价」的换代

Grok 4.7 的定价与 Grok 4.6 完全一致——输入 $2 / 百万 Token,输出 $6 / 百万 Token——但官方声称推理速度达到同类可比模型的两倍,也就是「一半的价钱买两倍的速度」。除此之外还有几个结构性变化:

项目 Grok 4.6 Grok 4.7
发布日期 2026-08-12 2026-09-21
输入 / 输出价格(每百万 Token) $2 / $6 $2 / $6(不变)
基础模型 2T 级 更大、全新训练的基础模型
训练方式 强化学习 更长的 RL 周期,专攻需数小时完成的困难任务
fast 版本 无 输出速度 ×2,输出价 $12 / 百万 Token
首日可用渠道 Grok API 等 Cursor、Grok Build、Grok API、第三方工具与云平台

三个值得记住的产品决策:一是为 Grok Bot 框架做了原生训练——8 月 11 日上线的这支「永远在线、拥有自己的电脑、在工具和应用里干活」的 Agent 团队,4.7 是它的大脑升级;二是自我验证能力被明确写进卖点,官方强调模型会更长时间地处理困难任务、更仔细地检查自己的输出;三是文档与演示生成被单独点名,知识工作场景的权重明显加大。

二、官方基准:数字先收下,结论先别下

SpaceXAI 公布的对比表把 Grok 4.7 放在 Grok 4.6、GPT-5.6 Sol 和 Claude Fable 5.1 之间(厂商自报,评测条件以官方口径为准;Fable 5.1 在 GDPval 的 Elo 为 1735,作为参照):

基准 Grok 4.7 Grok 4.6 GPT-5.6 Sol Fable 5.1
CursorBench 4.0(长时编码) 46.3% 40.4% 41.7% 51.8%
DeepSWE v1.1(软件工程) 71.0% 65.2% 72.7% 70.0%
Terminal-Bench 4.0(多小时图终端) 38.0% 20.3% 37.3% 57.9%
AA Briefcase v1.1(多小时图办公) 1,657 1,546 1,487 1,678
HealthBench Professional(临床推理) 56.7% 48.5% 60.5% 62.1%
EEBench(电气工程) 64.0% 53.0% 39.4% 56.4%
GDPval Elo(最大努力,专业任务众包评分) 1,695 1,605 1,542(GPT-6 Astra) 1,735

怎么读这张表?三个观察:

  1. 最大跃升在 Terminal-Bench:38.0% 对 4.6 的 20.3%,接近翻倍,也小幅反超 GPT-5.6 Sol(37.3%)。官方把这归因于「更长的 RL 训练 + 专攻需数小时完成的任务」——终端任务恰恰是最吃长程坚持的场景,叙事和数据是自洽的。
  2. 编码主战场是「性价比领先」而非「分数领先」:DeepSWE 71.0% 略低于 GPT-5.6 Sol 的 72.7%,但后者的价格是 $4/$20 每百万 Token——输出价是 Grok 的 3.3 倍。按「每美元买到的基准分」算,官方称自己站在前沿。
  3. 不是全项碾压。Fable 5.1 在 CursorBench、Terminal-Bench、AA Briefcase、HealthBench 上仍然全面领先,GDPval Elo 也高 40 分。如果你的任务集中在高难度前端重构或长程 Agent 编排,Fable 5.1 依然是标杆——只是它的价格是 $10/$50,输出价是 Grok 4.7 的 8 倍多。

一句话总结选型:预算敏感、终端与长时编码密集的负载,Grok 4.7 是新的默认候选;不计成本的极致任务,Fable 5.1 守擂。

三、API 接入:沿用 xAI 体系,模型 ID 换成 grok-4.7

Grok API 走 OpenAI 兼容协议,base URL 和鉴权方式与 Grok 4.6 完全一致,接入时只改模型名:

curl https://api.x.ai/v1/chat/completions   -H "Content-Type: application/json"   -H "Authorization: Bearer $XAI_API_KEY"   -d '{
    "model": "grok-4.7",
    "messages": [
      {"role": "system", "content": "你是一名资深后端工程师,回答精简、给可运行代码。"},
      {"role": "user", "content": "用 Node.js 写一个带并发限制的队列执行器"}
    ]
  }'

Python SDK 版本:

from openai import OpenAI

client = OpenAI(api_key="XAI_API_KEY", base_url="https://api.x.ai/v1")

resp = client.chat.completions.create(
    model="grok-4.7",
    messages=[
        {"role": "user", "content": "审查这段 Python 代码的并发缺陷并给出修复"}
    ],
)
print(resp.choices[0].message.content)

如果你此前按「新模型发布日接入」那篇教程准备了轮询脚本,现在就是收获时刻——模型列表里出现 grok-4.7 后,把环境变量 XAI_MODEL 从 grok-4.6 改成 grok-4.7 就是一次完整的灰度切换,业务代码零改动。需要注意:若你的 SDK 或代理层对未知模型名有白名单校验,记得把新 ID 加进去;上线第一天各平台和第三方路由器的放量节奏可能不同步,Cursor 和 Grok Build 是首日渠道,其余路由器逐步跟进。

四、标准版 vs fast 版:这笔账用吞吐和延迟算

fast 版本的规则很简单:输出速度 ×2,输出价格 ×2($12 / 百万 Token),输入价格不变。它不是「更聪明的模型」,而是「更贵的车道」。怎么选取决于你的场景单位成本:

  • 交互式编程助手(补全、局部重构、对话式改 bug):用户盯着屏幕等,延迟就是体验。此时有效吞吐 = 价值,fast 版贵出的 $6 摊到一次几千 Token 的回答上只有零点几美分,几乎无感,建议默认开。
  • 批量离线任务(整库审查、批量生成测试、文档转换):没有人在等,跑快一倍不产生额外收益,只产生额外账单。同样 100 万 Token 的输出,标准版 $6,fast 版 $12——这种场景请关掉 fast。
  • 长输出 Agent 循环:Agent 一次跑几小时、输出几十万 Token 是常态,账单大头在输出侧。建议给 Agent 框架加一条路由规则:计划与反思阶段用标准版,最终交付长文(报告、文档、演示内容)再切 fast,或者干脆全程标准版——因为 Terminal-Bench 的成绩本来就是标准版跑出来的。

工程落地的一个朴素做法:把模型选择收敛到一个配置函数里,按「是否人在等待」这个布尔值路由,而不是按任务类型写死。

五、三条注意事项

  1. 厂商自报基准,先复测再上生产。 表里所有数字出自官方发布公告,评测档位(effort 设置)也不完全一致(4.7 为 xhigh,对比模型多为 max)。拿你自己仓库里 10 个真实任务做小基准,比任何发布表都可靠——尤其在你的代码风格和业务领域上和公开数据集差异大的时候。
  2. Grok 4.6 用户迁移近乎零成本,但注意行为差异。 价格、API 形态、上下文计费方式都没变,切换本身一行配置。但新基础模型 + 更长 RL 训练意味着输出风格会变:4.6 上调好的系统提示词、 few-shot 示例和「自我检查」触发话术,建议在 4.7 上重跑一遍回归集,别默认旧提示词仍然最优。
  3. 安全护栏明显收紧,双用途场景预期要变。 SpaceXAI 称 4.7 是拒绝响应和防越狱测试中最强的版本,内部 HackerBench v0.3 上仅 3.3% 的风险双用途提示通过,并已启动仅限邀请的网络安全红队能力——安全防护与可用性之间的边界在哪里,官方还在校准。如果你做安全研究、红队或生物相关工作,遇到拒绝率上升不要惊讶,官方给出的路径是申请红队资格,而不是绕护栏。

常见问题

Q:4.7 和 4.6 同价,那 4.6 还有存在的必要吗? 短期内 4.6 仍然是低风险选项:它已经铺到了 GitHub Copilot、Amazon Bedrock 等平台,行为经过一个月生产验证。新项目直接 4.7;存量稳定 pipeline 可以等自己的回归测试跑完再迁。

Q:fast 版值得吗? 见第四节——看「是否有人在等待」。交互场景值,批量场景不值。它是体验税,不是能力税。

Q:官方说「同类一半价格两倍速度」,可信吗? 「两倍速度」是官方口径,需以你所在区域的实测延迟为准;「一半价格」有明确锚点——对比 GPT-5.6 Sol 的 $4/$20 和 Fable 5.1 的 $10/$50,$2/$6 的输出价确实只有前者的 30%、后者的 12%。速度自己测,价格是真的。

小结

Grok 4.7 的发布把「编程旗舰」的性价比坐标又挪了一次:$2/$6 不变的价格、号称翻倍的推理速度、Terminal-Bench 近翻倍的提升,以及 fast 车道给了交互场景一个花钱换体验的选择。对开发者,今天的行动清单很短:在 Cursor 或 Grok Build(x.ai/build 有免费额度)里拿真实任务试一轮;用第 三 节的代码把 API 接好并跑一个小基准;然后按「人在不在等」决定 fast 版开关。厂商的数字负责吸引你,你自己的 10 个任务负责做决定。

相关教程

Grok 4.7 正式版上手实战:速度翻倍、价格不变的编程旗舰,基准、API 接入与 fast 版成本一次算清 | AIHub