在 AIReiter 上运行 Grok Imagine Image 2.0 API,实现精准编辑
Grok Imagine Image 2.0 是 xAI 的图像生成和编辑模型,适用于基于提示词的创作、参考图引导修改、排版和结构化布局。可使用 AIReiter playground 或 API,在十四种宽高比选项中以 1K 或 2K 生成。
文生图生成
将详细提示词转化为海报、产品场景、社媒创意、概念艺术和其他可直接用于生产的视觉内容。描述主体、构图、光线、风格以及应出现的任何文字。
参考图引导编辑
附加一到三张参考图,并描述所需更改。模型可利用参考图来引导主体身份、风格、构图或基于提示词的修改。
排版与布局
该模型专为结合视觉构图与可读标签、标题及结构化图形布局的图像而设计,非常适合海报和信息图。
灵活的输出控制
通过主模型模式选择 1K 或 2K 分辨率、Low 或 Medium 质量、十四种宽高比选项,以及每次请求一到十个输出。
使用 Grok Imagine Image 2.0 进行创作和编辑
将自然语言指令与可选参考图结合,在一个工作流中从初步概念推进到精修结果。
面向设计师的排版
在生成海报、菜单、标签或信息图时,使用明确的文案、层级、位置和风格指令。清晰的提示有助于模型保持预期的视觉结构。
提示词引导的精准编辑
提供最多三张参考图,并明确说明哪些内容应保持一致、哪些内容应更改。使用详细说明进行定向修改,同时保留重要的主体、风格或构图。
多参考图一致性
使用多张输入图像来引导统一的角色、产品、配色或视觉方向。每次请求中,针对每张附加图片仅计收一次参考图费用。
批量生成
在单个任务中请求多个候选结果。主模式支持一到十个输出,而同一页面上的 Ext 模式支持一到十二个输出。
使用 Grok Imagine Image 2.0 可创建的内容
海报和信息图
生成活动海报、活动图、菜单和信息丰富的视觉内容。在提示词中指定准确文案、布局层级和视觉风格,然后使用 2K Medium 进行最终质量检查。
电商和产品图
创建产品场景、广告变体和用户生成内容风格的图像。若视觉身份必须在新的背景或构图中保持一致,请附加产品参考图。
一致的角色和世界观
使用参考图来保持角色、服装、配色或环境的一致性,同时探索新的场景。生成多个候选结果,为后续视频工作建立统一的视觉方向。
支持的 Grok Imagine Image 2.0 控件
这些是当前 AIReiter playground 和 API 集成中提供的控件。
参考图像
主模式可选。最多可附加三张图片。每张参考图每个请求会额外增加 0.95 积分,与生成输出数量无关。
宽高比
在主模式中可选择 Auto、1:1、4:3、3:4、3:2、2:3、16:9、9:16、2:1、1:2、19.5:9、9:19.5、20:9 或 9:20。
分辨率和质量
主模式支持 1K 或 2K 输出,并可选择 Low 或 Medium 质量。需要更快草稿时选择 Low;更注重细节时选择 Medium。
输出数量
主模式每个请求支持一到十个输出。Ext 子模式支持从一到十二的任意整数,包括 3 这样的值,而不只是预设批量大小。
Grok Imagine Image 2.0 定价
1K Low
每个输出 3.8 积分。这是用于草稿和提示词迭代的最快、成本最低的档位。
1K Medium 或 2K Low
每个输出 5.7 积分。选择 1K Medium 可在标准分辨率下获得更多细节,或选择 2K Low 以更快的质量设置生成更大的图片。
2K Medium
每个输出 7.6 积分。这是主模式中最高的档位,适用于最终质量检查和对细节敏感的工作。
参考图附加费
每张附加的参考图每个请求会额外增加 0.95 积分。该附加费不会乘以 output_n。最多支持三张输入图片。
多输出
输出费用会乘以 output_n。例如,三个 1K Low 输出在不计参考图附加费前的费用为 3.8 x 3 积分。
Grok Imagine 2.0 Ext
Ext 子模式每张生成图片收取 2 积分,并支持一到十二个输出。总费用为 2 x output_n 积分。
使用 Grok Imagine Image 2.0 生成
从 playground 开始,然后通过 OpenAPI endpoints 使用相同的 model 和 parameters。
试用 playground
输入提示词,选择模型类型,并选择宽高比、分辨率、质量和输出数量。使用主模型进行编辑工作流时,可添加最多三张参考图。
获取 API 访问权限
创建一个 AIReiter API key,并将 grok_imagine_image_2_0 作为主模型 ID。请将密钥保存在服务器端,切勿在浏览器代码中暴露。
提交并查询
将任务发送到 POST /api/openapi/submit,并使用唯一的 out_task_id,然后使用相同的 ID 轮询 POST /api/openapi/query,直到任务完成或失败。
通过 AIReiter API 使用 Grok Imagine Image 2.0
AIReiter 为图像生成和结果检索提供一套异步 task contract。
主 model ID
将 grok_imagine_image_2_0 作为 model value 发送,适用于完整的 1K/2K、quality、multi-reference 和 one-to-ten-output parameter set。
Ext model ID
当你选择 Ext child mode 时,发送 grok_imagine_2_0_ext。它支持 text-to-image,支持七种 aspect ratios,并接受一到十二个 outputs。
提交端点
POST /api/openapi/submit 接受 model、params、可选 attachments 和唯一的 out_task_id。响应包含 task status 和预计的 credit cost。
查询端点
POST /api/openapi/query 接受相同的 out_task_id。轮询直到 completed 或 failed;completed 响应包含 output URLs 和最终的 credits_used。
相关 AI 图像和视频 models
GPT-Image 2
一款通用图像 model,输出支持 1K 到 4K、自定义像素尺寸以及 multi-reference 编辑。当前述更高分辨率或自定义尺寸更重要时使用它。
Nano Banana Pro
一款参考引导的图像生成和编辑 model,支持广泛的 aspect-ratio 和最高 4K 的分辨率选项。
Seedream 5.0 Pro
一款细节丰富的图像生成和编辑 model,支持更大的 reference sets,以及 1K 或 2K 输出。
Grok Imagine 1.5 Video
当目标输出是运动而非静态图片时,请使用 Grok video model,包括 text-to-video 和 image-to-video workflows。
Grok Imagine Image 2.0 常见问题
关于模型模式、参考图像、支持的输出设置、定价和 API 使用的解答。
/ 01什么是 Grok Imagine Image 2.0?
Grok Imagine Image 2.0 是 xAI 的一个用于 text-to-image generation 和 prompt-guided image editing 的 model。在 AIReiter 上,主模式支持可选的 reference images、1K 和 2K 输出、Low 和 Medium quality,以及 batch generation。
/ 02Grok Imagine Image 2.0 生成图片还是视频?
此页面生成静态图片。对于 motion output,请使用 /video/grok-imagine-1-5 上的 Grok Imagine 1.5 Video。
/ 03我可以上传多少张 reference images?
当前 AIReiter API 在主 grok_imagine_image_2_0 mode 中最多接受三张 reference images。Ext child mode 是 text-to-image,不提供 reference-image 输入。
/ 04支持哪些 aspect ratios 和 resolutions?
主模式提供 Auto 以及十三种明确的 ratios:1:1、4:3、3:4、3:2、2:3、16:9、9:16、2:1、1:2、19.5:9、9:19.5、20:9 和 9:20。分辨率可为 1K 或 2K。
/ 05Grok Imagine Image 2.0 的价格是多少?
主模式输出的费用为:1K Low 3.8 credits,1K Medium 或 2K Low 5.7 credits,2K Medium 7.6 credits。每张 reference image 每次请求额外增加 0.95 credits,输出费率会乘以 output_n。
/ 06什么是 Grok Imagine 2.0 Ext?
Grok Imagine 2.0 Ext 是本页面 Model Type 选择器中的一个 child model。每个输出收费 2 credits,每次请求支持一到十二张图片,并使用更小的 text-to-image parameter set。
/ 07它与 GPT-Image 2 相比如何?
这两个 model 都支持通用图像生成。Grok Imagine Image 2.0 提供 Low 和 Medium quality tiers,采用公式化定价,并最多支持三张参考图;而 GPT-Image 2 提供更多分辨率和自定义尺寸选项,并支持更大的 reference-image 限制。请根据你的工作流所需的 controls 进行选择。
/ 08我应该使用哪个 API model ID?
针对主模式使用 grok_imagine_image_2_0,或针对 Ext 使用 grok_imagine_2_0_ext。通过 POST /api/openapi/submit 提交,并使用相同的 out_task_id 通过 POST /api/openapi/query 查询结果。
