Grok Imagine 2 是 xAI 新推出的图像模型:它作为 grok.com/imagine 的 Quality Mode,于 2026 年 8 月 7 日正式 GA。不要把它和 Grok Imagine 1.5 的视频模型混为一谈。在 LM Arena 的文生图和图像编辑榜单中,它都排在 #2,仅次于 GPT-Image-2。不过有一点需要先说清:它的 API 目前还没开放。如果你今天就要通过程序生成或编辑图片,只能使用 Grok 的消费者应用,或者转向已开放 API 的竞品。
先分清:Grok Imagine 2 是图像模型,不是视频 2.0
理解“Grok Imagine 2”最关键的一点,就是确认它究竟指什么。这个名称对应的是图像模型 Imagine Image 2.0,模型 ID 为 grok-imagine-image-quality,作为 Grok 图像生成器的 Quality Mode 上线。它不是我们此前在 Grok Imagine 1.5 评测中介绍的 grok-imagine-video-1.5 视频模型。
这两个名字确实容易混淆。看到某个页面提到原生 4K 分辨率、30 秒片段、Aurora 视频引擎,或口型同步语音时,要知道那是视频模型的规格,被误套到了图像模型上。Image 2.0 只负责生成和编辑静态图像,不涉及时长、音频或视频时间轴。其输出可在 grok.com/imagine 以及 iOS、Android 应用中查看。
xAI 的发布公告是了解本次上线信息最直接的来源:
Image 2.0 能做什么
Imagine Image 2.0 是一款兼顾生成与编辑的图像模型,重点在于画面布局还原能力和编辑可控性。它主打的能力是生成文字清晰、元素密集的复杂构图,例如海报、产品页面和信息图,同时尽量避免旧一代图像模型常见的文字乱码问题。
根据 xAI 的发布页面整理,以下能力已于 2026 年 8 月 7 日核实:
| 能力 | 具体作用 |
|---|---|
| 魔棒局部编辑 | 指定一个区域,只修改该区域,类似局部重绘。 |
| 语义分割 | 编辑前可精确选取对象,无需手动涂抹蒙版。 |
| 背景移除 | 去除背景,并可导出带透明通道的图片。 |
| 多图参考编辑 | 一次编辑最多可输入 5 张参考图,以保持主体或风格的一致性。 |
| Smart Resize | 支持 9 种画幅比例的生成式扩图:1:2、9:16、2:3、3:4、1:1、4:3、3:2、16:9、2:1,模型会自动延展画布。 |
| 文字与版式还原 | 小字号文字和多元素布局能保持清晰、对齐。 |
| 15 个模板 | Photo Edit、Product Color Change、Editorial Product Poster、Reimagine、Photo Collage、Mascot Maker、BG Removal & Change、E-Commerce Photos、UGC Photos、Professional Headshot、Icon Maker、Character Sprite、Props & UI Kit、Emoji Creator、Merch Maker。 |
| 为视频搭建世界观 | 分别生成角色、场景和道具,并维持统一风格,可作为视频前期制作的一环。 |
归根结底,它的核心卖点是编辑控制力。这也是竞品拿来与 Image 2.0 对比的重点,下面我们会用已开放 API 的对手进行测试。
LM Arena 排名怎么看才不失真
xAI 表示,Imagine Image 2.0 在 LM Arena 的文生图和图像编辑两项榜单中均位居全球 #2,榜单上使用的名称是 SpaceXAI,即 xAI 在该榜单中的条目。两个类别的 #1 都是 GPT-Image-2。
解读这张图时要把预期放准。Elo 分数来自 xAI 对公开 Arena 数据的自行披露,并非我们独立完成的测试。图像编辑中,它与 GPT-Image-2 的差距较小,为 1,439 对 1,463;文生图差距则更大,为 1,320 对 1,380。#2 已是很强的成绩,但不代表 Image 2.0 与榜首模型处于同一水平。而且由于其 API 尚未公开,我们无法进行可控的 API 正面对比。你可以前往 lmarena.ai 查看实时榜单;再下一梯队包括 Reve 2.1、Meta Muse-Image、Qwen-Image-3.0-Pro、Gemini Image 和 Seedream。
Grok Imagine 2 API 现在能调用吗?不能
API 尚未开放。在 xAI 的发布页面中,官方明确写道:“API access is coming soon,”,但没有给出具体日期。该信息于 2026 年 8 月 10 日核实。
这里有个看似矛盾的地方需要解释。docs.x.ai 已经列出了模型 ID grok-imagine-image-quality,以及 POST /v1/images/generations 和 POST /v1/images/edits 两个端点,后者最多可使用 3 张参考图。但文档中存在模型 ID,不等于已经提供可计费的实际访问权限。目前没有公开的单图价格;在访问权限仍标注为“coming soon”的情况下,grok-imagine-image-quality 还不能调用。官方的“coming soon”优先于文档列表。
这也回答了中转平台的问题:AIReiter 目前只列出了 Grok 的视频模型 grok_imagine_1_5,没有可通往 Grok 图像模型的 AIReiter 路径。现在要使用 Imagine Image 2.0,只能通过 Grok 的消费者应用,包括 grok.com、iOS 和 Android。
现在能用 API 调什么:实测结果
既然 Grok 的图像 API 尚未开放,更实际的问题是:同在 Arena 榜单上的模型里,哪些今天就能调用?排名靠前的竞争者中,有三款已开放 API:GPT-Image-2(#1)、Nano Banana Pro(基于 Gemini 图像技术)和 Seedream V5 Pro(ByteDance)。我用它们完成了 Image 2.0 两项标志性任务——文字准确生成和可控编辑——看看让 Image 2.0 受到关注的能力是否只有它能实现。
生成测试:同一提示词对决
我给三款模型使用了完全相同的提示词:制作一张复古旅行海报,要求包含大标题 NEON KYOTO、副标题 2049 EXPRESS 和价格行 TICKETS FROM 29000 YEN,配色为低饱和青绿色与洋红色。同样使用 1:1 比例、默认设置,每个模型各生成一次。测试重点是 Image 2.0 所宣传的文字渲染和版式能力。
结果是:三款模型都正确渲染出了三段文字,包括标题、副标题和价格行,没有拼写错误或凭空出现的字符。这个样本规模仅为 n=1,也就是一条提示词、每个模型一次生成,并非基准测试。因此无法据此给三款模型的文字能力排出高低,只能确认它们在这张海报提示词中都正确生成了要求的文字。这意味着,Image 2.0 所宣传的文字渲染能力,在这类任务中也可以通过已开放 API 的竞品获得;但这不表示它在所有场景下都不再有差异化。价格上三者有所不同:同一任务中,GPT-Image-2 收取 1 个积分,Nano Banana Pro 为 6 个积分,Seedream V5 Pro 为 7 个积分。如果想直接试用,GPT-Image-2、Nano Banana Pro 和 Seedream V5 Pro 都提供了 API 页面。
编辑测试:竞品的可控前后对比
编辑是 Image 2.0 的另一半卖点:保留整体结构,只改一个部分。我把上面的海报作为参考图输入 Nano Banana Pro,要求它保留布局、三段文字、富士山和列车,同时把霓虹夜景城市替换成飘雪的京都黎明,加入柔和粉金色调的樱花。
结果是:三段文字都被正确保留——NEON KYOTO、2049 EXPRESS、TICKETS FROM 29000 YEN——富士山和列车也都还在。场景则从深色霓虹夜晚转为了明亮黎明。需要坦诚指出一个限制:编辑结果的画幅比例发生了变化,为 1376×768,而原图是 1024×1024。因此它更像一次有引导的重新生成,而不是严格保留画布的局部重绘。这只是对单个模型进行的一次测试,说明“保留文字和主体、改变场景”这类编辑,如今可以通过开放 API 的竞品完成;但不能据此断言每个竞品都能匹配 Grok 更精细的魔棒局部重绘。Grok 的 API 尚未开放,我们无法自行测试其能力;官方展示的 Grok 编辑案例应视为厂商演示,而不是我们已验证的结果。
价格对比:不同路径生成一张图要多少钱
以下为各模型 AIReiter 页面所列的单次生成价格,表内均附有链接,信息于 2026 年 8 月 10 日核实。Grok Image 2.0 没有 API,因此也没有 API 价格;它目前仅能在 Grok 消费者应用中使用,官方没有公布单张图片价格。
| 模型 | AIReiter 是否可用 | 约 1K 图像价格(每次生成) | Arena 排名 | 说明 |
|---|---|---|---|---|
| GPT-Image-2 | 是 | $0.02 | #1(T2I & Edit) | 三者中最便宜,且排名最高。 |
| Nano Banana Pro | 是 | $0.05 | 顶级梯队 | 基于 Gemini;文字生成和编辑能力都很强。 |
| Seedream V5 Pro | 是 | $0.07(7 credits) | 顶级梯队 | ByteDance;没有 4K 档位;参考图每张 $0.005。 |
| Grok Image 2.0 | 否(API 待开放) | n/a | #2(T2I & Edit) | 仅限消费者端,可在 Grok 应用中使用。 |
现在该怎么选
按你的需求,可以走三条路线:
- 你就是想用 Grok Image 2.0。使用 Grok app,支持网页、iOS 和 Android。目前没有 API 路径,官方也没有给出开放日期。
- 你今天就需要通过 API 生成或编辑图片。可以选用 GPT-Image-2:它是 Arena #1,在 1K 分辨率下每次生成 $0.02;也可以对比 Nano Banana Pro 和 Seedream V5 Pro。三者都通过了我们的一次生成文字样本测试,Nano Banana Pro 也在编辑测试中表现稳定。
- 你真正想找的是视频模型。那是另一个模型:
grok-imagine-video-1.5。可查看我们的 Grok Imagine 1.5 评测,以及 Grok 视频页面。
常见问题
Grok Imagine 2 是图像模型还是视频模型?
它是图像模型。“Grok Imagine 2”指的是 Imagine Image 2.0,模型 ID 为 grok-imagine-image-quality,即 grok.com/imagine 的 Quality Mode。视频模型则是独立的 grok-imagine-video-1.5。如果介绍中提到 4K、30 秒片段或音频,说的就是视频模型,而不是这一款。
我能调用 Grok Imagine 2 API 吗?
暂时不能。xAI 表示 API 访问“coming soon”,该信息于 2026 年 8 月 7 日核实。docs.x.ai 虽然列出了模型 ID,以及 /v1/images/generations 和 /v1/images/edits 端点,但截至 2026 年 8 月 10 日,尚无实际可计费的访问权限,也没有公布单张图片价格。
Grok Imagine 2 怎么收费?
由于 API 尚未开放,因此没有 API 价格。在 Grok 消费者应用中,xAI 也没有公布独立的单图价格。
通过 API 使用时,Grok Imagine 2 最好的替代方案是什么?
GPT-Image-2。它在 LM Arena 的文生图和图像编辑两项中都排名 #1,领先于 Grok Image 2.0;在我们测试过的已开放 API 的顶级模型里,它在 1K 分辨率下约 $0.02 每次生成,也是最便宜的选择。