OpenAI 发布 ChatGPT Images 2.0 和 gpt-image-2
OpenAI 发布了下一代图像模型 gpt-image-2,支持 2K 分辨率输出、多语言文字渲染增强和自主推理能力。新模型在 gpt-image-1 的基础上大幅提升了质量和功能集。
Previous generation image generation model.
GPT Image 1(gpt-image-1)是 OpenAI 首个原生多模态图像生成模型,基于 GPT-4 级别解码器架构,配备专用视觉 token 嵌入和跨模态注意力机制。该模型于 2025 年 4 月发布,是 ChatGPT 图像生成功能背后的核心技术——上线首周就有超过 1.3 亿用户创建了 7 亿多张图像。与早期的扩散模型(DALL·E 3)不同,gpt-image-1 采用自回归解码器将图像视为 token,从而具备世界知识理解能力和执行复杂设计指令的能力。
通过 TheRouter,gpt-image-1 可通过标准的 OpenAI 兼容 Images API 端点 api.therouter.ai/v1/images/generations 访问。它支持文本生图、图生图编辑、带遮罩的局部重绘以及透明背景输出。该模型最适合需要可靠、高保真视觉内容生成的生产管线,而非实验性或开源工作流。
OpenAI 通过 /v1/images/generations 和 /v1/images/edits 提供直接的 gpt-image-1 调用,其模型页面也列出该模型 ID 支持 /v1/responses。
TheRouter 在 https://api.therouter.ai/v1 下为 openai/gpt-image-1 暴露图像生成和图像编辑。使用 OpenAI SDK 形态时需替换为 TheRouter baseURL、API key 和路由模型 slug;不要假设该图像模型可用于 chat/completions。
| 类型 | 费率 |
|---|---|
| 图片 | $0.0454 每张图片 |
| 输入 | $5.40 每百万 Tokens |
| 输出 | $43.20 每百万 Tokens |
| Image input | $10.80 每百万 Tokens |
| Low quality | $0.0119 每张图片 |
| Medium quality | $0.0454 每张图片 |
| High quality | $0.1804 每张图片 |
image is medium-quality generation price per image
| 发布日期 | 2025-04-23openai.com ↗ | 已核实 |
| 架构 | 面向文本和图像输入到图像输出的原生多模态语言模型;更深层架构细节未公开披露developers.openai.com ↗ | 已核实 |
| 原生输出分辨率 | 1024×1024、1024×1536、1536×1024developers.openai.com ↗ | 已核实 |
| 输出格式 | PNG、JPEG、WebPdevelopers.openai.com ↗ | 已核实 |
| 背景支持 | 透明、不透明和自动;透明输出必须使用 PNG 或 WebPdevelopers.openai.com ↗ | 已核实 |
| 每次调用最大图片数 | 通过 n 参数支持 1 到 10 张developers.openai.com ↗ | 已核实 |
| 质量等级 | GPT Image 模型支持 low、medium、high 和 autodevelopers.openai.com ↗ | 已核实 |
| 许可 | 专有(OpenAI API 条款) | 已核实 |
| Benchmark | Distribution | Score | Source |
|---|---|---|---|
GIE-Bench | Highest functional-correctness among tested models | arxiv.org ↗ | |
STRICT text-rendering 少数在密集文字场景下保持低错误率的专有模型之一 | — | 未公开披露 | — |
所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。
建议使用异步 API
图像生成通常需要 30–180 秒,超过同步请求的边缘超时。下方示例已使用 ?async=true + 轮询模式。 查看异步图像生成 / 编辑完整指南 →
# 1) Submit job (returns 202 immediately with a polling URL).
# Image generation takes 30-180s — always use the async path in production.
JOB=$(curl -s -X POST "https://api.therouter.ai/v1/images/generations?async=true" -H "Content-Type: application/json" -H "Authorization: Bearer $THE_ROUTER_API_KEY" -d '{
"model": "openai/gpt-image-1",
"prompt": "A cinematic product render with soft studio lighting"
}' | python3 -c "import sys,json;print(json.load(sys.stdin)['id'])")
echo "submitted: $JOB"
# 2) Poll until terminal (succeeded / failed / cancelled / expired).
while :; do
R=$(curl -s "https://api.therouter.ai/v1/jobs/$JOB" -H "Authorization: Bearer $THE_ROUTER_API_KEY")
S=$(echo "$R" | python3 -c "import sys,json;print(json.load(sys.stdin)['status'])")
echo "status: $S"
case "$S" in
succeeded) echo "$R" | python3 -c "import sys,json;print(json.load(sys.stdin)['unsigned_urls'][0])"; break ;;
failed|cancelled|expired) echo "$R"; exit 1 ;;
esac
sleep 5
done使用标准的 OpenAI Images API 从文本提示生成图像。支持质量等级、输出格式选择、透明背景和批量生成。
curl https://api.therouter.ai/v1/images/generations \
-H "Authorization: Bearer $THEROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "openai/gpt-image-1",
"prompt": "A serene mountain landscape at sunset, photorealistic style",
"n": 1,
"size": "1024x1024",
"quality": "medium",
"output_format": "png"
}'上传一张图片并用文本 prompt 描述编辑要求;模型会返回编辑后的图片(base64)。
# Same async submit + poll pattern as /v1/images/generations.
JOB=$(curl -s -X POST "https://api.therouter.ai/v1/images/edits?async=true" -H "Authorization: Bearer $THE_ROUTER_API_KEY" -F "model=openai/gpt-image-1" -F "prompt=Turn this scene into a watercolor painting" -F "size=1024x1024" -F "image=@input.png" | python3 -c "import sys,json;print(json.load(sys.stdin)['id'])")
echo "submitted: $JOB"
while :; do
R=$(curl -s "https://api.therouter.ai/v1/jobs/$JOB" -H "Authorization: Bearer $THE_ROUTER_API_KEY")
S=$(echo "$R" | python3 -c "import sys,json;print(json.load(sys.stdin)['status'])")
echo "status: $S"
case "$S" in
succeeded) echo "$R" | python3 -c "import sys,json;print(json.load(sys.stdin)['unsigned_urls'][0])"; break ;;
failed|cancelled|expired) echo "$R"; exit 1 ;;
esac
sleep 5
doneOpenAI 发布了下一代图像模型 gpt-image-2,支持 2K 分辨率输出、多语言文字渲染增强和自主推理能力。新模型在 gpt-image-1 的基础上大幅提升了质量和功能集。
OpenAI 发布了 gpt-image-1.5,作为 gpt-image-1 的继任者,生成速度提升约 4 倍,指令遵循能力增强,密集/小文字的渲染效果更好,图像编辑更精确,支持 Logo 和人脸保留。
OpenAI 将 gpt-image-1 通过 API 开放,把驱动 ChatGPT 爆款图像功能(首周 1.3 亿+用户、7 亿+张图像)的原生多模态图像生成能力带给开发者和企业。
gpt-image-1 是原生多模态自回归 Transformer,而非扩散模型。这意味着它拥有源于 GPT-4o 家族的世界知识理解能力,可以遵循极其详细的指令,更精确地渲染图像中的文字,并支持图像输入以进行编辑。DALL·E 3 使用扩散方法,在较低分辨率下生成简单单张草图时通常更快。
可以。gpt-image-1 与 OpenAI Images API 完全兼容。将 OpenAI SDK 客户端指向 https://api.therouter.ai/v1,将模型设置为 "openai/gpt-image-1",然后使用 images.generate() 或 /v1/images/generations 端点。请注意 gpt-image-1 使用的是 Images API,而非 Chat Completions API。
有。OpenAI 提供 gpt-image-1-mini,成本约为 gpt-image-1 的 20%,同时保持大部分场景下稳定的质量。此外,gpt-image-1 有三个质量等级(低、中、高)——选择「低」质量可显著降低草图和快速迭代的单张成本。
gpt-image-1 在所有生成的图像中包含 C2PA 溯源元数据,通过 moderation 参数(auto 或 low)提供可调的内容审核,以及限制有害图像生成的安全堆栈。OpenAI 默认不会使用客户 API 数据进行训练。
| 来源 | URL | 采集于 | |
|---|---|---|---|
| 发布日期 | openai.com ↗ | 2026-05-29 | 已核实 |
| 架构 | developers.openai.com ↗ | 2026-08-11 | 已核实 |
| 原生输出分辨率 | developers.openai.com ↗ | 2026-08-11 | 已核实 |
| 输出格式 | developers.openai.com ↗ | 2026-08-11 | 已核实 |
| 背景支持 | developers.openai.com ↗ | 2026-08-11 | 已核实 |
| 每次调用最大图片数 | developers.openai.com ↗ | 2026-08-11 | 已核实 |
| 质量等级 | developers.openai.com ↗ | 2026-08-11 | 已核实 |
| 许可 | — | — | 已核实 |
| GIE-Bench | arxiv.org ↗ | 2026-05-29 | 已核实 |
| STRICT text-rendering | arxiv.org ↗ | 2026-05-29 | 未知 |
| OpenAI 发布 ChatGPT Images 2.0 和 gpt-image-2 | openai.com ↗ | 2026-05-29 | 已核实 |
| OpenAI 发布 gpt-image-1.5,速度提升 4 倍 | techcrunch.com ↗ | 2026-05-29 | 已核实 |
| OpenAI 将 gpt-image-1 引入 API | openai.com ↗ | 2026-05-29 | 已核实 |
| gpt-image-1 与 DALL·E 3 有什么不同? | openai.com ↗ | 2026-05-29 | 待核实 |
| gpt-image-1 有更便宜的替代方案吗? | en.wikipedia.org ↗ | 2026-05-29 | 待核实 |
| gpt-image-1 有哪些安全功能? | openai.com ↗ | 2026-05-29 | 待核实 |