Назад к моделям

CogView-4 — первая open-source модель Zhipu AI для генерации изображений, способная нативно воспроизводить китайские иероглифы на изображениях. Архитектура основана на Diffusion Transformer (DiT) с 6 миллиардами параметров; в качестве двуязычного текстового энкодера используется GLM-4-9B вместо T5-XXL, применявшегося в CogView-3-Plus. Открытый исходный код появился 4 марта 2025 года. На момент выпуска модель заняла первое место на DPG-Bench среди open-source text-to-image моделей, опередив Flux.1-dev, Janus-Pro-7B, DALL·E 3 и SD3-Medium по общему семантическому выравниванию. Через MaaS API Zhipu AI и TheRouter.ai доступна под идентификаторами cogview-4 (стабильный псевдоним) и cogview-4-250304 (версионный снимок).

Для операторов TheRouter CogView-4 доступна по цене ¥0.06 за изображение ($0.0104 USD по стандартному курсу) через OpenAI-совместимый эндпоинт /v1/images/generations на api.therouter.ai. Принимает произвольно длинные китайские и английские подсказки (до 1024 токенов), генерирует изображения с любым разрешением в диапазоне 512–2048 пк с выравниванием по 16 пикселей (макс. 2²¹ пикселей), поддерживает режимы качества standard и hd. Рекомендуется обрабатывать подсказки через большую языковую модель, например GLM-4-Plus, перед генерацией — модель обучена на длинных синтетических описаниях изображений. URL сгенерированных изображений действительны 30 дней.

Когда выбирать
  • • Творческие рабочие процессы на китайском языке: CogView-4 — первая open-source T2I-модель, способная рендерить китайские иероглифы внутри изображения, что делает её естественным выбором для рекламы, баннеров e-commerce, продвижения еды и напитков, а также обложек для коротких видео
  • • Двуязычное производство на основе подсказок: энкодер GLM-4-9B нативно обрабатывает китайский и английский языки с одинаковым качеством; команды могут писать подсказки на любом языке без потерь на перевод
  • • Коммерческие материалы высокого разрешения: поддерживает вывод до 1920×1280 и произвольные соотношения сторон в пределах бюджета 2²¹ пикселей; подходит для игровых ресурсов, образовательных иллюстраций и туристических промо-материалов
  • • Самостоятельное размещение / дообучение: 6B-параметровая модель с открытым кодом через CogKit (THUDM/CogKit) поддерживает BF16/FP32, квантизацию BNB int4 и LoRA fine-tuning через инструментарий CogKit
Когда не выбирать
  • • Экономичная высокообъёмная генерация: при ¥0.06/изображение затраты растут линейно; для бесплатного прототипирования используйте CogView-3-Flash (¥0), а при очень больших объёмах оцените, выгоднее ли самостоятельный хостинг 6B-весов
  • • Редактирование изображений, inpainting или image-to-image: API-эндпоинт поддерживает только text-to-image; image conditioning и режимы редактирования в MaaS API недоступны
  • • Задачи с максимальными требованиями к коммерческому качеству: GLM-Image (режим hd, до 2048×2048, ¥0.12/изображение) — премиальная модель Zhipu; для западных фотореалистичных стилей DALL·E 3 или Flux.1 могут давать иной эстетический результат
Размер контекста
--
Максимальный вывод
--
Цена Запросза запрос
$0.009за запрос
Цена Изображениеза запрос
$0.0108за изображение

Модальности

Текст→Изображение

Возможности

Генерация изображений

Возможности генерации медиа

image_generation
sizes
  • 1024x1024
  • 768x1344
  • 864x1152
  • 1344x768
  • 1152x864
  • 1440x720
  • 720x1440
defaults
size
1024x1024

Разбивка цен

ТипСтавка
Запрос$0.009 за запрос
Изображение$0.0108 за изображение
Per image$0.0108 за изображение

Per-image flat fee

Поддерживаемые параметры

promptsizequalitynuser

Характеристики

Стоимость¥0.06 за сгенерированное изображение (~$0.0104 USD)docs.bigmodel.cn ↗проверено
АрхитектураDiffusion Transformer (DiT) с 6B параметрами и двуязычным текстовым энкодером GLM-4-9Bgithub.com/zai-org/CogView4 ↗проверено
Дата открытия исходного кода4 марта 2025 года (версия для diffusers)github.com/zai-org/CogView4 ↗проверено
Языки подсказокКитайский и английский (двуязычный; нативная генерация китайских иероглифов на выходных изображениях)github.com/zai-org/CogView4 ↗проверено
Ограничение длины подсказки1024 токена (произвольная длина; для лучших результатов рекомендуется уточнять длинные описания через большую языковую модель)github.com/zai-org/CogView4 ↗проверено
Поддерживаемые разрешения выводаГотовые: 1024×1024 (по умолчанию), 768×1344, 864×1152, 1344×768, 1152×864, 1440×720, 720×1440. Пользовательские: 512–2048 пк на сторону, кратно 16, суммарно ≤ 2²¹ пикселейdocs.bigmodel.cn ↗проверено
Режимы качестваstandard (быстро, ~5–10 с) и hd (более высокая детализация и согласованность, ~20 с); по умолчанию standarddocs.bigmodel.cn ↗проверено
Поддерживаемые параметры APIprompt, size, quality, n, user, watermark_enableddocs.bigmodel.cn ↗проверено
Идентификаторы моделиcogview-4 (стабильный псевдоним) и cogview-4-250304 (версионный снимок, выпуск 4 марта 2025 г.)docs.bigmodel.cn ↗проверено
Срок действия URL вывода30 дней с момента генерации; необходимо переносить изображения в постоянное хранилищеdocs.bigmodel.cn ↗проверено
Водяной знакAI-водяной знак включён по умолчанию (явный + скрытый цифровой водяной знак); можно отключить для аккаунтов, подписавших соглашение Zhipu AIdocs.bigmodel.cn ↗проверено
Точность при самостоятельном хостингеПоддерживается BF16 и FP32; квантизация BNB int4 и TorchAO int8/int4 для уменьшения VRAMgithub.com/zai-org/CogView4 ↗проверено

Бенчмарки

BenchmarkDistributionScoreSource
DPG-Bench (Dense Prompt Graph Benchmark) — Overall
Занял 1-е место среди open-source T2I-моделей на момент выпуска. Сравнение: Flux.1-dev 83.79, Janus-Pro-7B 84.19, DALL·E 3 83.50, SD3-Medium 84.08.
85.13github.com/zai-org/CogView4 ↗
GenAI-Bench — Overall
Сопоставимо с Flux.1-dev (0.66) и DALL·E 3 (0.67). SD3-Medium лидирует с 0.74. Хорошие результаты по счёту (0.66) и цветам (0.79).
0.73github.com/zai-org/CogView4 ↗

Примеры API

Для новых интеграций используйте глобальный endpoint api.therouter.ai из примеров ниже; старый China accelerated endpoint выведен из эксплуатации.

Рекомендуется асинхронный API

Генерация изображений обычно занимает 30–180 секунд и не укладывается в edge timeout синхронного запроса. Ниже используется схема ?async=true + polling. Открыть полный гид по асинхронной генерации и редактированию изображений →

cURL
# 1) Submit job (returns 202 immediately with a polling URL).
# Image generation takes 30-180s — always use the async path in production.
JOB=$(curl -s -X POST "https://api.therouter.ai/v1/images/generations?async=true"   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "zhipu/cogview-4",
    "prompt": "A cinematic product render with soft studio lighting"
  }' | python3 -c "import sys,json;print(json.load(sys.stdin)['id'])")
echo "submitted: $JOB"

# 2) Poll until terminal (succeeded / failed / cancelled / expired).
while :; do
  R=$(curl -s "https://api.therouter.ai/v1/jobs/$JOB"     -H "Authorization: Bearer $THE_ROUTER_API_KEY")
  S=$(echo "$R" | python3 -c "import sys,json;print(json.load(sys.stdin)['status'])")
  echo "status: $S"
  case "$S" in
    succeeded) echo "$R" | python3 -c "import sys,json;print(json.load(sys.stdin)['unsigned_urls'][0])"; break ;;
    failed|cancelled|expired) echo "$R"; exit 1 ;;
  esac
  sleep 5
done

Гид по API

Генерация изображений (совместимость с OpenAI)

Доступ к CogView-4 через стандартный OpenAI-совместимый эндпоинт /v1/images/generations на api.therouter.ai. Используйте cogview-4 в качестве идентификатора модели (или cogview-4-250304 для фиксации версионного снимка). size — готовая строка (например 1024x1024) или ШxВ в диапазоне 512–2048 пк с кратностью 16. Установите quality: hd для максимального качества (~20 с) или опустите для режима standard (~5–10 с). URL истекают через 30 дней — сохраняйте изображения сразу.

cURL
curl https://api.therouter.ai/v1/images/generations \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "zhipu/cogview-4",
    "prompt": "一只可爱的小猫咪,坐在阳光明媚的窗台上,背景是蓝天白云",
    "size": "1024x1024",
    "quality": "hd",
    "n": 1
  }'

Ещё от zhipu

Похожие модели

Аналоги в других провайдерах

Частые вопросы

В чём разница между cogview-4 и cogview-4-250304?

cogview-4 — стабильный псевдоним, всегда направляющий на текущий рекомендуемый релиз CogView-4. cogview-4-250304 — версионный снимок, зафиксированный на выпуске с открытым кодом от 4 марта 2025 года, который не будет обновляться по мере выхода улучшений от Zhipu AI. Используйте стабильный псевдоним для продакшн-нагрузок, которым нужны автоматические улучшения качества; используйте версионный снимок, когда нужна воспроизводимость вывода, привязанная к конкретному чекпоинту.

Может ли CogView-4 генерировать китайский текст внутри изображений?

Да — это наиболее отличительная способность CogView-4 и главная причина перехода с бесплатного уровня CogView-3-Flash. Энкодер GLM-4-9B обеспечивает подлинное двуязычное понимание, а модель специально обучена корректно воспроизводить китайские иероглифы на выходных изображениях. Это делает её отличным выбором для китайских рекламных текстов, баннеров e-commerce, ресторанных меню и обложек коротких видео, где текст должен быть встроен в изображение.

Когда использовать режим качества hd вместо standard?

Используйте quality: hd, когда результат будет показываться клиентам — коммерческие изображения, печатные материалы или всё, где важна детализация и общая согласованность. Генерация занимает около 20 секунд. Используйте standard (по умолчанию) для итераций, внутренних превью, аугментации датасетов или любых процессов, где задержка важнее качества — ~5–10 секунд. Заметьте, что glm-image (премиальная модель Zhipu) поддерживает только hd и стоит ¥0.12/изображение; если вам регулярно нужно максимальное качество, протестируйте обе модели перед окончательным выбором.

Как получить лучшие результаты от CogView-4?

Zhipu AI явно рекомендует уточнять подсказки с помощью большой языковой модели (например GLM-4-Plus) перед отправкой в CogView-4, поскольку модель обучена на длинных, детализированных синтетических описаниях изображений. Однофразная подсказка будет работать, но уточнённое многопредложное описание с указанием освещения, стиля, композиции и деталей объекта даст значительно лучшие результаты. Пример скрипта оптимизации подсказок находится в репозитории по адресу inference/prompt_optimize.py. CogView-3 и CogView-4 используют разные примеры для оптимизации — при вызове скрипта укажите флаг cogview4.

Можно ли самостоятельно разместить или дообучить CogView-4?

Да. Веса 6B-параметровой модели доступны на HuggingFace (THUDM/CogView4-6B), ModelScope и WiseModel. Требуется не менее 32 ГБ оперативной памяти и около 33–39 ГБ VRAM в BF16 при размере пакета 4 (1024×1024); с enable_model_cpu_offload потребление VRAM снижается до ~20 ГБ; при BNB int4 квантизации текстового энкодера — ~13 ГБ. Дообучение поддерживается через CogKit (github.com/THUDM/CogKit) — инструментарий от лаборатории THUDM для LoRA fine-tuning CogView4 и CogVideoX. Поддержка ComfyUI доступна через сообщественный плагин ComfyUI_CogView4_Wrapper.

Реестр фактов — каждая утверждаемая величина имеет источник
источникURLполучено
Стоимостьdocs.bigmodel.cn ↗2026-06-09проверено
Архитектураgithub.com/zai-org/CogView4 ↗2026-06-09проверено
Дата открытия исходного кодаgithub.com/zai-org/CogView4 ↗2026-06-09проверено
Языки подсказокgithub.com/zai-org/CogView4 ↗2026-06-09проверено
Ограничение длины подсказкиgithub.com/zai-org/CogView4 ↗2026-06-09проверено
Поддерживаемые разрешения выводаdocs.bigmodel.cn ↗2026-06-09проверено
Режимы качестваdocs.bigmodel.cn ↗2026-06-09проверено
Поддерживаемые параметры APIdocs.bigmodel.cn ↗2026-06-09проверено
Идентификаторы моделиdocs.bigmodel.cn ↗2026-06-09проверено
Срок действия URL выводаdocs.bigmodel.cn ↗2026-06-09проверено
Водяной знакdocs.bigmodel.cn ↗2026-06-09проверено
Точность при самостоятельном хостингеgithub.com/zai-org/CogView4 ↗2026-06-09проверено
DPG-Bench (Dense Prompt Graph Benchmark) — Overallgithub.com/zai-org/CogView4 ↗2026-06-09к проверке
GenAI-Bench — Overallgithub.com/zai-org/CogView4 ↗2026-06-09к проверке
Помощь и контакты