CogView 4
Zhipu AI CogView 4 — text-to-image generation with strong bilingual prompt understanding.
CogView-4 — первая open-source модель Zhipu AI для генерации изображений, способная нативно воспроизводить китайские иероглифы на изображениях. Архитектура основана на Diffusion Transformer (DiT) с 6 миллиардами параметров; в качестве двуязычного текстового энкодера используется GLM-4-9B вместо T5-XXL, применявшегося в CogView-3-Plus. Открытый исходный код появился 4 марта 2025 года. На момент выпуска модель заняла первое место на DPG-Bench среди open-source text-to-image моделей, опередив Flux.1-dev, Janus-Pro-7B, DALL·E 3 и SD3-Medium по общему семантическому выравниванию. Через MaaS API Zhipu AI и TheRouter.ai доступна под идентификаторами cogview-4 (стабильный псевдоним) и cogview-4-250304 (версионный снимок).
Для операторов TheRouter CogView-4 доступна по цене ¥0.06 за изображение ($0.0104 USD по стандартному курсу) через OpenAI-совместимый эндпоинт /v1/images/generations на api.therouter.ai. Принимает произвольно длинные китайские и английские подсказки (до 1024 токенов), генерирует изображения с любым разрешением в диапазоне 512–2048 пк с выравниванием по 16 пикселей (макс. 2²¹ пикселей), поддерживает режимы качества standard и hd. Рекомендуется обрабатывать подсказки через большую языковую модель, например GLM-4-Plus, перед генерацией — модель обучена на длинных синтетических описаниях изображений. URL сгенерированных изображений действительны 30 дней.
- • Творческие рабочие процессы на китайском языке: CogView-4 — первая open-source T2I-модель, способная рендерить китайские иероглифы внутри изображения, что делает её естественным выбором для рекламы, баннеров e-commerce, продвижения еды и напитков, а также обложек для коротких видео
- • Двуязычное производство на основе подсказок: энкодер GLM-4-9B нативно обрабатывает китайский и английский языки с одинаковым качеством; команды могут писать подсказки на любом языке без потерь на перевод
- • Коммерческие материалы высокого разрешения: поддерживает вывод до 1920×1280 и произвольные соотношения сторон в пределах бюджета 2²¹ пикселей; подходит для игровых ресурсов, образовательных иллюстраций и туристических промо-материалов
- • Самостоятельное размещение / дообучение: 6B-параметровая модель с открытым кодом через CogKit (THUDM/CogKit) поддерживает BF16/FP32, квантизацию BNB int4 и LoRA fine-tuning через инструментарий CogKit
- • Экономичная высокообъёмная генерация: при ¥0.06/изображение затраты растут линейно; для бесплатного прототипирования используйте CogView-3-Flash (¥0), а при очень больших объёмах оцените, выгоднее ли самостоятельный хостинг 6B-весов
- • Редактирование изображений, inpainting или image-to-image: API-эндпоинт поддерживает только text-to-image; image conditioning и режимы редактирования в MaaS API недоступны
- • Задачи с максимальными требованиями к коммерческому качеству: GLM-Image (режим hd, до 2048×2048, ¥0.12/изображение) — премиальная модель Zhipu; для западных фотореалистичных стилей DALL·E 3 или Flux.1 могут давать иной эстетический результат
Модальности
Возможности
Возможности генерации медиа
- sizes
- 1024x1024
- 768x1344
- 864x1152
- 1344x768
- 1152x864
- 1440x720
- 720x1440
- defaults
- size
- 1024x1024
Разбивка цен
| Тип | Ставка |
|---|---|
| Запрос | $0.009 за запрос |
| Изображение | $0.0108 за изображение |
| Per image | $0.0108 за изображение |
Per-image flat fee
Поддерживаемые параметры
Характеристики
| Стоимость | ¥0.06 за сгенерированное изображение (~$0.0104 USD)docs.bigmodel.cn ↗ | проверено |
| Архитектура | Diffusion Transformer (DiT) с 6B параметрами и двуязычным текстовым энкодером GLM-4-9Bgithub.com/zai-org/CogView4 ↗ | проверено |
| Дата открытия исходного кода | 4 марта 2025 года (версия для diffusers)github.com/zai-org/CogView4 ↗ | проверено |
| Языки подсказок | Китайский и английский (двуязычный; нативная генерация китайских иероглифов на выходных изображениях)github.com/zai-org/CogView4 ↗ | проверено |
| Ограничение длины подсказки | 1024 токена (произвольная длина; для лучших результатов рекомендуется уточнять длинные описания через большую языковую модель)github.com/zai-org/CogView4 ↗ | проверено |
| Поддерживаемые разрешения вывода | Готовые: 1024×1024 (по умолчанию), 768×1344, 864×1152, 1344×768, 1152×864, 1440×720, 720×1440. Пользовательские: 512–2048 пк на сторону, кратно 16, суммарно ≤ 2²¹ пикселейdocs.bigmodel.cn ↗ | проверено |
| Режимы качества | standard (быстро, ~5–10 с) и hd (более высокая детализация и согласованность, ~20 с); по умолчанию standarddocs.bigmodel.cn ↗ | проверено |
| Поддерживаемые параметры API | prompt, size, quality, n, user, watermark_enableddocs.bigmodel.cn ↗ | проверено |
| Идентификаторы модели | cogview-4 (стабильный псевдоним) и cogview-4-250304 (версионный снимок, выпуск 4 марта 2025 г.)docs.bigmodel.cn ↗ | проверено |
| Срок действия URL вывода | 30 дней с момента генерации; необходимо переносить изображения в постоянное хранилищеdocs.bigmodel.cn ↗ | проверено |
| Водяной знак | AI-водяной знак включён по умолчанию (явный + скрытый цифровой водяной знак); можно отключить для аккаунтов, подписавших соглашение Zhipu AIdocs.bigmodel.cn ↗ | проверено |
| Точность при самостоятельном хостинге | Поддерживается BF16 и FP32; квантизация BNB int4 и TorchAO int8/int4 для уменьшения VRAMgithub.com/zai-org/CogView4 ↗ | проверено |
Бенчмарки
| Benchmark | Distribution | Score | Source |
|---|---|---|---|
DPG-Bench (Dense Prompt Graph Benchmark) — Overall Занял 1-е место среди open-source T2I-моделей на момент выпуска. Сравнение: Flux.1-dev 83.79, Janus-Pro-7B 84.19, DALL·E 3 83.50, SD3-Medium 84.08. | 85.13 | github.com/zai-org/CogView4 ↗ | |
GenAI-Bench — Overall Сопоставимо с Flux.1-dev (0.66) и DALL·E 3 (0.67). SD3-Medium лидирует с 0.74. Хорошие результаты по счёту (0.66) и цветам (0.79). | 0.73 | github.com/zai-org/CogView4 ↗ |
Примеры API
Для новых интеграций используйте глобальный endpoint api.therouter.ai из примеров ниже; старый China accelerated endpoint выведен из эксплуатации.
Рекомендуется асинхронный API
Генерация изображений обычно занимает 30–180 секунд и не укладывается в edge timeout синхронного запроса. Ниже используется схема ?async=true + polling. Открыть полный гид по асинхронной генерации и редактированию изображений →
# 1) Submit job (returns 202 immediately with a polling URL).
# Image generation takes 30-180s — always use the async path in production.
JOB=$(curl -s -X POST "https://api.therouter.ai/v1/images/generations?async=true" -H "Content-Type: application/json" -H "Authorization: Bearer $THE_ROUTER_API_KEY" -d '{
"model": "zhipu/cogview-4",
"prompt": "A cinematic product render with soft studio lighting"
}' | python3 -c "import sys,json;print(json.load(sys.stdin)['id'])")
echo "submitted: $JOB"
# 2) Poll until terminal (succeeded / failed / cancelled / expired).
while :; do
R=$(curl -s "https://api.therouter.ai/v1/jobs/$JOB" -H "Authorization: Bearer $THE_ROUTER_API_KEY")
S=$(echo "$R" | python3 -c "import sys,json;print(json.load(sys.stdin)['status'])")
echo "status: $S"
case "$S" in
succeeded) echo "$R" | python3 -c "import sys,json;print(json.load(sys.stdin)['unsigned_urls'][0])"; break ;;
failed|cancelled|expired) echo "$R"; exit 1 ;;
esac
sleep 5
doneГид по API
Генерация изображений (совместимость с OpenAI)
Доступ к CogView-4 через стандартный OpenAI-совместимый эндпоинт /v1/images/generations на api.therouter.ai. Используйте cogview-4 в качестве идентификатора модели (или cogview-4-250304 для фиксации версионного снимка). size — готовая строка (например 1024x1024) или ШxВ в диапазоне 512–2048 пк с кратностью 16. Установите quality: hd для максимального качества (~20 с) или опустите для режима standard (~5–10 с). URL истекают через 30 дней — сохраняйте изображения сразу.
curl https://api.therouter.ai/v1/images/generations \
-H "Authorization: Bearer $THEROUTER_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "zhipu/cogview-4",
"prompt": "一只可爱的小猫咪,坐在阳光明媚的窗台上,背景是蓝天白云",
"size": "1024x1024",
"quality": "hd",
"n": 1
}'Ещё от zhipu
Похожие модели
Аналоги в других провайдерахЧастые вопросы
В чём разница между cogview-4 и cogview-4-250304?
cogview-4 — стабильный псевдоним, всегда направляющий на текущий рекомендуемый релиз CogView-4. cogview-4-250304 — версионный снимок, зафиксированный на выпуске с открытым кодом от 4 марта 2025 года, который не будет обновляться по мере выхода улучшений от Zhipu AI. Используйте стабильный псевдоним для продакшн-нагрузок, которым нужны автоматические улучшения качества; используйте версионный снимок, когда нужна воспроизводимость вывода, привязанная к конкретному чекпоинту.
Может ли CogView-4 генерировать китайский текст внутри изображений?
Да — это наиболее отличительная способность CogView-4 и главная причина перехода с бесплатного уровня CogView-3-Flash. Энкодер GLM-4-9B обеспечивает подлинное двуязычное понимание, а модель специально обучена корректно воспроизводить китайские иероглифы на выходных изображениях. Это делает её отличным выбором для китайских рекламных текстов, баннеров e-commerce, ресторанных меню и обложек коротких видео, где текст должен быть встроен в изображение.
Когда использовать режим качества hd вместо standard?
Используйте quality: hd, когда результат будет показываться клиентам — коммерческие изображения, печатные материалы или всё, где важна детализация и общая согласованность. Генерация занимает около 20 секунд. Используйте standard (по умолчанию) для итераций, внутренних превью, аугментации датасетов или любых процессов, где задержка важнее качества — ~5–10 секунд. Заметьте, что glm-image (премиальная модель Zhipu) поддерживает только hd и стоит ¥0.12/изображение; если вам регулярно нужно максимальное качество, протестируйте обе модели перед окончательным выбором.
Как получить лучшие результаты от CogView-4?
Zhipu AI явно рекомендует уточнять подсказки с помощью большой языковой модели (например GLM-4-Plus) перед отправкой в CogView-4, поскольку модель обучена на длинных, детализированных синтетических описаниях изображений. Однофразная подсказка будет работать, но уточнённое многопредложное описание с указанием освещения, стиля, композиции и деталей объекта даст значительно лучшие результаты. Пример скрипта оптимизации подсказок находится в репозитории по адресу inference/prompt_optimize.py. CogView-3 и CogView-4 используют разные примеры для оптимизации — при вызове скрипта укажите флаг cogview4.
Можно ли самостоятельно разместить или дообучить CogView-4?
Да. Веса 6B-параметровой модели доступны на HuggingFace (THUDM/CogView4-6B), ModelScope и WiseModel. Требуется не менее 32 ГБ оперативной памяти и около 33–39 ГБ VRAM в BF16 при размере пакета 4 (1024×1024); с enable_model_cpu_offload потребление VRAM снижается до ~20 ГБ; при BNB int4 квантизации текстового энкодера — ~13 ГБ. Дообучение поддерживается через CogKit (github.com/THUDM/CogKit) — инструментарий от лаборатории THUDM для LoRA fine-tuning CogView4 и CogVideoX. Поддержка ComfyUI доступна через сообщественный плагин ComfyUI_CogView4_Wrapper.
Реестр фактов — каждая утверждаемая величина имеет источник
| источник | URL | получено | |
|---|---|---|---|
| Стоимость | docs.bigmodel.cn ↗ | 2026-06-09 | проверено |
| Архитектура | github.com/zai-org/CogView4 ↗ | 2026-06-09 | проверено |
| Дата открытия исходного кода | github.com/zai-org/CogView4 ↗ | 2026-06-09 | проверено |
| Языки подсказок | github.com/zai-org/CogView4 ↗ | 2026-06-09 | проверено |
| Ограничение длины подсказки | github.com/zai-org/CogView4 ↗ | 2026-06-09 | проверено |
| Поддерживаемые разрешения вывода | docs.bigmodel.cn ↗ | 2026-06-09 | проверено |
| Режимы качества | docs.bigmodel.cn ↗ | 2026-06-09 | проверено |
| Поддерживаемые параметры API | docs.bigmodel.cn ↗ | 2026-06-09 | проверено |
| Идентификаторы модели | docs.bigmodel.cn ↗ | 2026-06-09 | проверено |
| Срок действия URL вывода | docs.bigmodel.cn ↗ | 2026-06-09 | проверено |
| Водяной знак | docs.bigmodel.cn ↗ | 2026-06-09 | проверено |
| Точность при самостоятельном хостинге | github.com/zai-org/CogView4 ↗ | 2026-06-09 | проверено |
| DPG-Bench (Dense Prompt Graph Benchmark) — Overall | github.com/zai-org/CogView4 ↗ | 2026-06-09 | к проверке |
| GenAI-Bench — Overall | github.com/zai-org/CogView4 ↗ | 2026-06-09 | к проверке |