返回模型列表

CogView 4

zhipuzhipu/cogview-4

Zhipu AI CogView 4 — text-to-image generation with strong bilingual prompt understanding.

CogView-4 是智谱 AI 首个支持在图像中原生生成汉字的开源文生图模型。它基于 60 亿参数的扩散 Transformer(DiT)架构,使用 GLM-4-9B 作为双语文本编码器(取代前代 CogView-3-Plus 所用的 T5-XXL),于 2025 年 3 月 4 日开源。发布时,CogView-4 在开源文生图模型中,在 DPG-Bench(密集提示词图评估基准)综合评分排名第一,超越 Flux.1-dev、Janus-Pro-7B、DALL·E 3 和 SD3-Medium。通过智谱 AI MaaS API 及 TheRouter.ai,可使用模型标识符 cogview-4(稳定别名)和 cogview-4-250304(版本快照)访问。

对 TheRouter 路由层用户,CogView-4 通过 api.therouter.ai 的 OpenAI 兼容 /v1/images/generations 端点以每张图像 ¥0.06(按标准汇率约 $0.0104)访问。支持任意长度的中英文提示词(最多 1024 个 token)、512px–2048px 范围内以 16px 为整数倍的任意分辨率(最大总像素数 2²¹),以及 standard 和 hd 质量模式。推荐在生成前使用 GLM-4-Plus 等大语言模型优化提示词,因为该模型是在较长的合成图像描述上训练的。生成的图像 URL 有效期为 30 天,调用方应及时转存。

适合使用
  • • 中文创意工作流:CogView-4 是首个能在图像内部渲染汉字的开源文生图模型,是广告、电商横幅、餐饮宣传、短视频缩略图等需要在画面中嵌入中文文字场景的天然选择
  • • 双语提示词驱动的生产场景:GLM-4-9B 编码器原生等质量处理中英文;团队可用任一语言编写提示词,无需翻译开销
  • • 高分辨率商业素材:支持最高 1920×1280 的输出和 2²¹ 像素预算内的任意宽高比;适合游戏素材、教育插图和文旅宣传图像
  • • 自托管 / 微调部署:60 亿参数模型已通过 CogKit(THUDM/CogKit)开源,支持 BF16/FP32 精度、BNB int4 量化,以及通过 CogKit 工具包进行 LoRA 微调
不适合使用
  • • 成本敏感的大批量生成:每张 ¥0.06,成本线性增长;免费原型开发请用 CogView-3-Flash(¥0),超高批量场景需评估自托管 6B 权重是否更划算
  • • 图像编辑、局部重绘或图生图:API 端点仅支持文生图,MaaS API 不提供图像条件输入或编辑模式
  • • 需要最高商业质量的任务:GLM-Image(hd 模式,最高 2048×2048,¥0.12/张)是智谱的高端图像模型;对西方写实风格,DALL·E 3 或 Flux.1 可能产生不同的美学效果
上下文长度
--
最大输出
--
请求价格按次
$0.009每次请求
图片价格按次
$0.0108每张图片

模态能力

文本→图像

能力

图像生成

媒体生成能力

image_generation
sizes
  • 1024x1024
  • 768x1344
  • 864x1152
  • 1344x768
  • 1152x864
  • 1440x720
  • 720x1440
defaults
size
1024x1024

价格明细

类型费率
请求$0.009 每次请求
图片$0.0108 每张图片
Per image$0.0108 每张图片

Per-image flat fee

支持参数

promptsizequalitynuser

模型规格

价格每张生成图像 ¥0.06(约 $0.0104)docs.bigmodel.cn ↗已核实
架构60 亿参数扩散 Transformer(DiT),GLM-4-9B 双语文本编码器github.com/zai-org/CogView4 ↗已核实
开源日期2025 年 3 月 4 日(diffusers 兼容版本)github.com/zai-org/CogView4 ↗已核实
支持的提示词语言中文和英文(双语;可在输出图像中原生生成汉字)github.com/zai-org/CogView4 ↗已核实
提示词长度限制1024 个 token(支持任意长度;建议使用大语言模型优化长描述以获得最佳效果)github.com/zai-org/CogView4 ↗已核实
支持的输出分辨率预设:1024×1024(默认)、768×1344、864×1152、1344×768、1152×864、1440×720、720×1440。自定义:每边 512–2048 px,需被 16 整除,总像素数 ≤ 2²¹docs.bigmodel.cn ↗已核实
质量模式standard(快速,约 5–10 秒)和 hd(更高细节和一致性,约 20 秒);默认为 standarddocs.bigmodel.cn ↗已核实
支持的 API 参数prompt、size、quality、n、user、watermark_enableddocs.bigmodel.cn ↗已核实
模型标识符cogview-4(稳定别名)和 cogview-4-250304(版本快照,2025 年 3 月 4 日版本)docs.bigmodel.cn ↗已核实
输出 URL 有效期生成后 30 天有效;调用方需及时将图像转存至持久化存储docs.bigmodel.cn ↗已核实
水印默认启用 AI 水印(显式水印 + 隐式数字水印);已签署智谱 AI 去水印免责声明的账户可关闭docs.bigmodel.cn ↗已核实
自托管推理精度支持 BF16 和 FP32;可使用 BNB int4 和 TorchAO int8/int4 量化降低显存占用github.com/zai-org/CogView4 ↗已核实

基准成绩

BenchmarkDistributionScoreSource
DPG-Bench (Dense Prompt Graph Benchmark) — Overall
发布时在开源文生图模型中综合评分排名第一。对比基线:Flux.1-dev 83.79,Janus-Pro-7B 84.19,DALL·E 3 83.50,SD3-Medium 84.08。
85.13github.com/zai-org/CogView4 ↗
GenAI-Bench — Overall
与 Flux.1-dev(0.66)和 DALL·E 3(0.67)相近。SD3-Medium 以 0.74 领先。计数(0.66)和颜色(0.79)表现强劲。
0.73github.com/zai-org/CogView4 ↗

API 使用示例

所有新集成都应使用下方示例中的全球端点 api.therouter.ai;旧中国加速端点已下线。

建议使用异步 API

图像生成通常需要 30–180 秒,超过同步请求的边缘超时。下方示例已使用 ?async=true + 轮询模式。 查看异步图像生成 / 编辑完整指南 →

cURL
# 1) Submit job (returns 202 immediately with a polling URL).
# Image generation takes 30-180s — always use the async path in production.
JOB=$(curl -s -X POST "https://api.therouter.ai/v1/images/generations?async=true"   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "zhipu/cogview-4",
    "prompt": "A cinematic product render with soft studio lighting"
  }' | python3 -c "import sys,json;print(json.load(sys.stdin)['id'])")
echo "submitted: $JOB"

# 2) Poll until terminal (succeeded / failed / cancelled / expired).
while :; do
  R=$(curl -s "https://api.therouter.ai/v1/jobs/$JOB"     -H "Authorization: Bearer $THE_ROUTER_API_KEY")
  S=$(echo "$R" | python3 -c "import sys,json;print(json.load(sys.stdin)['status'])")
  echo "status: $S"
  case "$S" in
    succeeded) echo "$R" | python3 -c "import sys,json;print(json.load(sys.stdin)['unsigned_urls'][0])"; break ;;
    failed|cancelled|expired) echo "$R"; exit 1 ;;
  esac
  sleep 5
done

API 使用指南

图像生成(OpenAI 兼容)

通过 api.therouter.ai 的标准 OpenAI /v1/images/generations 端点访问 CogView-4。使用 cogview-4 作为模型标识符(或 cogview-4-250304 锁定版本快照)。size 可传预设字符串(如 1024x1024)或 512–2048 px 范围内 16 整除的自定义 宽x高。将 quality 设为 hd 以获得最高保真度(约 20 秒),或省略使用 standard 模式(约 5–10 秒)。生成的 URL 30 天后过期——请立即存储图像。

cURL
curl https://api.therouter.ai/v1/images/generations \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "zhipu/cogview-4",
    "prompt": "一只可爱的小猫咪,坐在阳光明媚的窗台上,背景是蓝天白云",
    "size": "1024x1024",
    "quality": "hd",
    "n": 1
  }'

zhipu 其他模型

同类模型

跨供应商的相似能力档位

常见问题

cogview-4 和 cogview-4-250304 有什么区别?

cogview-4 是稳定别名,始终路由到当前推荐的 CogView-4 版本。cogview-4-250304 是版本快照,锁定至 2025 年 3 月 4 日的开源版本,不会随智谱 AI 发布改进而更新。生产工作负载如需自动获得质量改进,请使用稳定别名;如需输出可复现并锁定到特定检查点,请使用版本快照。

CogView-4 能在图像中生成中文文字吗?

可以——这是 CogView-4 最显著的能力,也是从 CogView-3-Flash 免费层迁移的主要原因。GLM-4-9B 编码器提供了真正的双语理解能力,且模型经专门训练以在输出图像中正确渲染汉字。这使其非常适合需要在画面中嵌入文字的中文广告文案、电商横幅、餐厅菜单和短视频缩略图场景。

何时应该使用 hd 质量模式而非 standard?

当输出将出现在面向客户的场景(商业图像、印刷物料或任何细节和整体一致性重要的场合)时,使用 quality: hd,生成约 20 秒。对于迭代、内部预览、数据集扩增,或任何延迟比保真度更重要的工作流,使用 standard(默认)——约 5–10 秒生成。注意 GLM-Image(智谱的高端模型)只支持 hd,每张 ¥0.12;如果您经常需要最高质量,建议在确定之前对两个模型进行基准测试。

如何从 CogView-4 获得最佳结果?

智谱 AI 明确建议在将提示词发送给 CogView-4 之前,先用大语言模型(如 GLM-4-Plus)对其进行优化,因为该模型是在详细的长篇合成图像描述上训练的。一句话提示词也能用,但指定了光线、风格、构图和主体细节的多句精炼描述将产生显著更好的结果。开源仓库的 inference/prompt_optimize.py 提供了示例提示词优化脚本。注意 CogView-3 和 CogView-4 使用不同的少样本示例进行优化——调用脚本时请使用 cogview4 标志。

我可以自托管或微调 CogView-4 吗?

可以。60 亿参数模型权重可在 HuggingFace(THUDM/CogView4-6B)、ModelScope 和 WiseModel 上获取。在 BF16 精度、batch size 4 下,1024×1024 分辨率需要至少 32 GB RAM 和约 33–39 GB 显存;启用 enable_model_cpu_offload 后,显存降至约 20 GB;对文本编码器应用 BNB int4 量化后约 13 GB。微调通过 CogKit(github.com/THUDM/CogKit)支持,这是 THUDM 实验室的工具包,涵盖 CogView4 和 CogVideoX 模型的 LoRA 微调。ComfyUI 支持可通过社区插件 ComfyUI_CogView4_Wrapper 实现。

事实档案 — 本页每条断言可在此回溯来源
来源URL采集于
价格docs.bigmodel.cn ↗2026-06-09已核实
架构github.com/zai-org/CogView4 ↗2026-06-09已核实
开源日期github.com/zai-org/CogView4 ↗2026-06-09已核实
支持的提示词语言github.com/zai-org/CogView4 ↗2026-06-09已核实
提示词长度限制github.com/zai-org/CogView4 ↗2026-06-09已核实
支持的输出分辨率docs.bigmodel.cn ↗2026-06-09已核实
质量模式docs.bigmodel.cn ↗2026-06-09已核实
支持的 API 参数docs.bigmodel.cn ↗2026-06-09已核实
模型标识符docs.bigmodel.cn ↗2026-06-09已核实
输出 URL 有效期docs.bigmodel.cn ↗2026-06-09已核实
水印docs.bigmodel.cn ↗2026-06-09已核实
自托管推理精度github.com/zai-org/CogView4 ↗2026-06-09已核实
DPG-Bench (Dense Prompt Graph Benchmark) — Overallgithub.com/zai-org/CogView4 ↗2026-06-09待核实
GenAI-Bench — Overallgithub.com/zai-org/CogView4 ↗2026-06-09待核实
帮助与联系