AIREITER

Grok 4.6 API:价格、基准测试与更新变化

最后更新: 2026-08-13 02:30:04

Grok 4.6 在 2026 年 8 月 12 日上线,比 Elon Musk 所说“两周后”的推算日期晚了五天。乍看之下,价格没有任何变化:每百万 token 输入 $2.00、输出 $6.00、上下文 500K,与 Grok 4.5 完全一致。但实际账单并不会保持不变:缓存输入价格比 4.5 高 67%,独立测量还显示,模型完成相同工作时会生成更多 token。

8 月 12 日上线了什么

新模型 ID 为 grok-4.6。SpaceXAI 的更新日志显示,它于 2026 年 8 月 12 日通过 API 提供服务。官方给出的规格如下:

项目Grok 4.6
模型 IDgrok-4.6
上下文窗口500K tokens
输入文本和图像
输出仅文本,未说明输出上限
推理强度low、medium、high(默认)、xhigh
知识截止日期2026 年 2 月 1 日
SpaceXAI 更新日志中日期为 2026 年 8 月 12 日的条目,宣布 Grok 4.6 登陆 xAI API,并列出其上下文窗口和价格

其中有两项是新增内容。首先,xhigh 成为第四档推理强度,Grok 4.5 最高只有 high。其次,文档现在标注了 2026 年 2 月 1 日这一知识截止日期;如果你此前会为带有明确时间要求的问题绕开模型知识盲区,这一点就很关键。

模型目录将 Grok 4.6 列为代码与对话场景的旗舰模型,侧边栏标注 Latest,页面日期为 2026 年 8 月 12 日。Grok 4.5 并未下线,价格页上仍保留着它自己的定价。

SpaceXAI 开发者文档显示 Grok 4.6 标记为 New,具备 500k 上下文,输入价格 $2.00、输出价格 $6.00

首日分发范围很广。SpaceXAI 的公告列出了 Cursor 和 Grok Build,两者首周都提供 2 倍包含用量;此外还可通过 API 以及 OpenRouter、Vercel、Cloudflare 等合作方使用。公告还提到一个价格翻倍的快速版本,但公共价格页尚未列出该版本,因此“2 倍”应视为公告中的说法,而不是已发布的标准费率。

标价没变,缓存输入却贵了

Grok 4.6 的输入和输出单价沿用 Grok 4.5,缓存输入则没有。

每 1M tokens 费率Grok 4.5Grok 4.6
输入(低于 200K)$2.00$2.00
缓存输入(低于 200K)$0.30$0.50
输出(低于 200K)$6.00$6.00
输入 / 缓存 / 输出(200K+)$4.00 / $0.60 / $12.00$4.00 / $1.00 / $12.00
分组柱状图,对比 Grok 4.5 和 Grok 4.6 在 200K 以下上下文中的输入、缓存输入和输出费率

缓存输入折扣从 85% 缩至 75%,即每百万 token 多 20 美分。对于 agent 而言,这项费用随步骤数增长,而不是随任务数增长。一个每天重放 50M 缓存 token 的测试框架,在 4.6 上需支付 $15.00,而在 4.5 上只需 $9.00。

长上下文计费规则没有改变,但仍然容易被忽略。只要一次请求的 prompt 达到 200K tokens,整次请求的所有 token 都按更高档位收费。换句话说,一个 210K-token 请求的全部输入都按每百万 $4.00 计费,并不是两个档位混合计算。OpenRouter 的公开模型页也列出了相同费率和相同的 200K 覆盖规则,因此经由第三方路由并不会改变这笔账。

官方评测中,Grok 4.6 赢在哪里、输在哪里

SpaceXAI 发布了一张包含十项评测的对比表,对手包括 Grok 4.5、GPT-5.6 Sol Max 和 Fable 5 Max。Grok 4.6 在其中三项拿到最高分:GDPVal-AA v2(1753)、AA-Briefcase(1577)和 Harvey LAB(15.8%)。其余七项均未登顶。以下八项与模型路由最相关:

SpaceXAI 官方评测表,对比 Grok 4.6、Grok 4.5、GPT-5.6 Sol 和 Fable 5 在十项基准测试中的表现
评测Grok 4.6Grok 4.5GPT-5.6 SolFable 5
AA Intelligence Index61566162
GDPVal-AA v21753152617281741
CursorBench v3.269.9%66.7%67.2%70.5%
DeepSWE v1.165.9%54%73%70%
FrontierCode v1.161.3%56.6%60.6%63.6%
APEX-Agents57.5%47.1%56.7%59.2%
Terminal-Bench v3.026%15.7%34.6%34.1%
AA-Briefcase1577131315021574

Terminal-Bench 的差距尤其值得关注。Grok 4.6 得分为 26%,而 GPT-5.6 Sol 为 34.6%,Fable 5 为 34.1%。在这项最接近 agent 操作 shell 的评测中,它以约八分之差排在第三。DeepSWE 也反映出同样的问题,只是数字不同:Grok 4.6 为 65.9%,Sol 为 73%。如果你的负载主要是终端驱动型 agent,厂商自己的表格已经说明,它并不是领先选择。

不过,相比 Grok 4.5 的进步确实存在,而且每一项都有提升。APEX-Agents 从 47.1% 升至 57.5%,Terminal-Bench 从 15.7% 升至 26%,增幅都超过十个百分点。SpaceXAI 将其归因于更长的补充训练、重新生成的 SFT 轨迹,以及覆盖编码和知识工作环境的 agentic RL。需要注意的是,公告从未给出参数量;与该模型关联的 2 万亿参数说法来自 Musk,而非正式发布材料。

能力提升的真实成本

厂商评测表会展示得分,却不会展示获得这些得分要花多少钱。Artificial Analysis同时公布这两类数据,其 8 月 13 日的测量结果正好揭示了 Grok 4.6 的真实取舍。

同一指数下的测量结果Grok 4.5 (high)Grok 4.6 (high)
Intelligence Index56(184 个模型中第 16)61(184 个模型中第 6)
输出速度56.9 tokens/s(第 102)67.6 tokens/s(第 74)
生成的输出 tokens60M72M
完成整套评测的成本$579.21$1,068.47
柱状图,对比 Grok 4.5 和 Grok 4.6 运行 Artificial Analysis Intelligence Index 的成本

智能指数提高五分,成本却达到 1.8 倍。尽管表面费率相同,同一套基准测试多花了 $489:一部分来自更高的输出量,Grok 4.6 输出 72M tokens,而 4.5 为 60M;另一部分则来自前文提到的缓存价格上调。Artificial Analysis 未公布此次测试的逐项费用拆分,因此 1.8 倍是观察到的总成本,而不是可以自行反推的公式。

速度则有所改善:Grok 4.6 的输出速度为每秒 67.6 tokens,高于 4.5 的 56.9 tokens/s。这使它从该类别 184 个模型的后半区,来到大致中位的位置。

Musk 的说法与实际发布的差异

这个名字最早以三个词的回复进入公众视野。7 月 18 日,Musk 在回复@minchoi 时写道:“我们的 2T 模型在各方面都优于 1.5T 模型,将于下周完成初始训练。它或许能超越 Kimi,同时速度和 token 效率接近我们的 1.5T 模型,也就是 Grok 4.5。”Andrew Curran 问这是否就是 Grok 4.6,Musk 回复:“Yeah, Grok 4.6。”

Elon Musk 在 X 上的讨论串,描述一款在各方面优于 1.5T Grok 4.5 的 2T 模型,随后以三个词确认其名称为 Grok 4.6

7 月 24 日,他又给出了时间表:“Grok 4.6 两周后推出,Grok 4.7 四周后推出。”从这一天算起,两周大约落在 8 月 7 日,而模型实际在 8 月 12 日发布,晚了五天。

Elon Musk 的 X 帖子称 Grok 4.6 将在两周后推出、Grok 4.7 将在四周后推出,作为对其 FrontierCode 帕累托前沿图表的回复

这些帖子中的三项说法,在发布后都未能得到完整印证:

  • 2 万亿参数仍未获证实。SpaceXAI 的公告、模型文档和更新日志均未给出 Grok 4.6 的参数量。
  • “token 效率接近 Grok 4.5”与 Artificial Analysis 的测量结果相矛盾:在相同评测中,Grok 4.6 输出了 72M tokens,而 Grok 4.5 为 60M。
  • “或许能超过 Kimi”仍未经过验证。SpaceXAI 的表格没有将它与 Moonshot 的 K3 对比,只比较了 GPT-5.6 Sol 和 Fable 5。

该不该从 Grok 4.5 迁移到 Grok 4.6

如果你目前使用 Grok 4.5,且工作负载偏向 agent 和知识任务,答案是可以迁移;但不要在迁移时看一次账单就下结论,最好运行一周后再核查 token 成本。Grok 4.5 仍按原费率提供,因此切换是可逆的,值得实测而不是想当然。

若你的工作是长周期 agent 或知识任务,可以现在迁移:APEX-Agents 提升 10.4 分,GDPVal-AA 提升 227,生成速度提高后,在多步任务中的收益还会累积。若流量高度依赖缓存且对价格敏感,则建议留在 4.5:缓存读取价格提高 67% 是实打实的退步,而 4.5 的得分也不会因为 4.6 发布而下降。终端 agent 则应考虑其他选择,SpaceXAI 自己的表格显示,Grok 4.6 比 GPT-5.6 Sol 和 Fable 5 低八分。

在生产环境切换路由前,先检查以下三件事:

  1. 两个 ID 都是别名。SpaceXAI 的别名规则中,grok-4.6 指向最新稳定版本,grok-4.6-latest 指向最新版本;只有带日期的 <modelname>-<date> ID 才会固定。模型目录和 OpenRouter 都没有列出带日期的 4.6 变体,因此目前无法为可复现工作流锁定版本。
  2. 重新测试推理强度设置。新的 xhigh 档位不是免费升级。该模型本身已被测得比前代更易生成冗长输出,xhigh 会消耗更多 token。默认的 high 才是与 4.5 做同等比较的设置。
  3. 确认你的服务商已经接入。SpaceXAI 首日可用,不代表所有平台首日可用。8 月 13 日查询 /v1/models 时,官方 API 和 OpenRouter 都返回了 grok-4.6;但我测试的一个 OpenAI 兼容转售商端点最高仍只支持 grok-4.5,并以 model_not_found 拒绝新 ID。路由流量前,请用自己的 key 确认准确的模型 ID 能正常响应。

常见问题

Grok 4.6 API 怎么收费?

上下文低于 200K 时,每百万输入 tokens $2.00、每百万输出 tokens $6.00,缓存输入为 $0.50。prompt 超过 200K tokens 后,整次请求按每百万输入 $4.00、缓存 $1.00、输出 $12.00 计费。公告提到一个价格翻倍的快速版本,但公共价格页尚未列出。

Grok 4.6 比 Grok 4.5 更好吗?

按照 SpaceXAI 公布的全部基准测试,是的:AA Intelligence Index 从 56 升至 61,最大的提升出现在 agent 评测中。但独立测量也给出了限定条件:在相同评测中,它生成了 72M 输出 tokens,而 Grok 4.5 为 60M,因此完成相同任务的成本更高。

Grok 4.6 有多少参数?

未公开。Musk 在 2026 年 7 月 18 日描述过一款 2 万亿参数模型,并确认其名称是 Grok 4.6;但 SpaceXAI 的发布材料没有给出参数量、架构细节,也没有说明每个 token 会激活多少参数。

Grok 4.6 的上下文窗口和知识截止日期是什么?

上下文窗口为 500K tokens,支持文本和图像输入,仅输出文本。文档标注的知识截止日期是 2026 年 2 月 1 日;若未启用服务端 Web Search 或 X Search,模型无法获知之后发生的事件。

Grok 是 xAI 还是 SpaceXAI 开发的?

两个名称指向同一家公司。开发者文档标题为“SpaceXAI Docs”,而在 2026 年迁入 SpaceX 后,公告页脚仍显示 X.AI LLC。x.ai 域名和 grok-* 模型 ID 均未改名。

Grok 4.7 什么时候发布?

尚未公布日期。Musk 在 7 月 24 日的帖子中称 Grok 4.7 大约四周后推出,按此推算约为 2026 年 8 月 21 日;而 Grok 4.6 已比其自身暗示的日期晚了五天。

延伸阅读

价格、模型 ID 和基准测试数据已于 2026 年 8 月 13 日根据 SpaceXAI 文档、Grok 4.6 公告及 Artificial Analysis 核实。