Теги

Новости по тегу "pricing"

RSS-лента
Диаграмма маршрутизации с двумя активными API-эндпоинтами deepseek-v4-pro и deepseek-flash с разными лимитами конкурентности и ценовыми уровнями

DeepSeek V4 Pro пережил собственный дедлайн: что разворот означает для вашей политики маршрутизации

DeepSeek объявил 10 сентября, что V4 Pro будет отключён сегодня в 04:00 UTC. Вместо этого они отыграли назад под давлением пользователей, сохранив V4 Pro на прежних ценах. Разбираем актуальные параметры двух моделей и решения для routing-операторов.

источник DeepSeek
Abstract API routing diagram showing deepseek-v4-pro requests being silently redirected to V4.1-Flash with a September 14 deadline

DeepSeek V4.1-Flash выходит с нативным зрением — и через четыре дня убивает deepseek-v4-pro

DeepSeek запустил V4.1-Flash с новым именем deepseek-flash и нативным зрением. 14 сентября в 12:00 по Пекину все запросы к deepseek-v4-pro уйдут на V4.1-Flash по ценам Flash. Имя и URL не меняются, код 200 — но модель другая. Дельта возможностей и что изменить до дедлайна.

источник DeepSeek
Абстрактная схема маршрутизации, показывающая компромиссы между стоимостью и скоростью при выборе API service tier

OpenAI Fast Mode и снижение цен на GPT-5.6: что должны изменить команды маршрутизации

Priority Processing переименован в Fast mode, GPT-5.6 Luna подешевел на 80%, Terra на 20% — и лимит скорости роста трафика означает, что batch-задачи могут незаметно деградировать до стандартной скорости.

источник OpenAI API Changelog
Абстрактная иллюстрация многоуровневой архитектуры маршрутизации с градиентами стоимости и скорости для выбора AI-моделей

GPT-5.6 Luna дешевеет на 80%: ценовой каскад, который пересматривает решения о выборе тиров маршрутизации

OpenAI снизил цену GPT-5.6 Luna на 80% и Terra на 20% 30 июля, переименовав Priority Processing в Fast mode. Luna по $0.20/$1.20 за 1M токенов конкурирует с DeepSeek V4 Flash и Qwen. Разбираем расчёт стоимости, который каждый оператор должен пересчитать.

источник OpenAI
Чёткая схема routing с уровнями стоимости и выбором между GLM-5.2 Fast и Full на DashScope

GLM-5.2 Fast Mode на DashScope подешевел на 20%: что изменилось в вашей модели routing-затрат

Alibaba Cloud Bailian снизила цену токенов для GLM-5.2 Fast mode на 20% с 15 июля. Для операторов, маршрутизирующих нагрузки через OpenAI-совместимый endpoint DashScope, формула стоимости изменилась.

источник Alibaba Cloud Model Studio
Абстрактная схема маршрутизации, показывающая выбор между Sonnet 5 и Opus 4.8 по кривым стоимости в зависимости от уровня усилий

Claude Sonnet 5: самая агентивная модель Sonnet от Anthropic — что вводное окно ценообразования означает для команд по маршрутизации

Claude Sonnet 5 запускается по $2/$10 за миллион токенов до 31 августа — затем цена возвращается к $3/$15. Модель заменяет Sonnet 4.6 в качестве дефолтной у Anthropic и приносит агентивные возможности уровня Opus по ценам Sonnet. Вот как реагировать командам по маршрутизации.

источник Anthropic
Редакционная иллюстрация глобуса с разделёнными региональными и глобальными маршрутами передачи данных и индикаторами стоимости

Ценообразование Gemini для не-глобальных эндпоинтов вступает в силу 1 июля: 10% региональная надбавка, которую каждая команда должна учесть в роутинге

С 1 июля 2026 года Gemini 3 и последующие модели получают 10% надбавку для не-глобальных (региональных) эндпоинтов. Командам, направляющим трафик в eu-west1, asia-northeast1 и аналогичные регионы, необходимо немедленно пересмотреть модели расходов.

источник Google Cloud
Abstract editorial illustration of a restored but gated AI endpoint with security controls and a pricing clock showing the June 23 deadline

Claude Fable 5 вернулся — с национальными ограничениями, усиленными классификаторами и кредитным ценовым порогом с завтрашнего дня

Fable 5 восстановлен 18 июня с национальными ограничениями доступа, более строгими классификаторами безопасности и обязательным хранением данных. Сегодня последний день бесплатного включения в подписки — с 23 июня требуются usage credits по $10/M входных и $50/M выходных токенов.

источник Anthropic
График, показывающий разрыв между объявленными ставками AI-моделей и реальными счетами при разных tokenizer и паттернах использования

Anthropic pricing changes, OpenAI API price increase 2026: рост стоимости AI

Anthropic pricing changes и OpenAI API price increase в мае 2026: реальный рост AI расходов до 92%. FairMind/OpenRouter данные по продакшен-трафику. Четыре рычага контроля: cache-aware контекст, model routing, дисциплина промпта, completion control.

источник FairMind / OpenRouter data
Постоянное снижение цены DeepSeek V4 Pro: схема выбора routing-уровней для AI-инженерных команд

DeepSeek закрепляет снижение цены на V4 Pro: что ценовая война в AI значит для вашей routing-политики

DeepSeek подтвердила, что 75% скидка на V4 Pro теперь постоянная. При цене «$0,87/M» за output-токены и результатах SWE-bench выше 80% модель переписывает карту routing-уровней — V4 Pro больше не премиальный fallback, а основная reasoning-модель.

источник DeepSeek
Абстрактная редакционная иллюстрация обратного отсчёта таймлайна с переходом жизненного цикла моделей и решениями по routing-путям

Gemini 2.0 Flash отключена (EOL, июнь 2026): что заменило и что делать сейчас

Gemini 2.0 Flash и Flash-Lite достигли конца жизненного цикла 1 июня 2026 года — отключение завершено. Здесь: какие model ID удалены, какие замены (gemini-2.5-flash-lite, gemini-3.1-flash-lite) реально работают как альтернатива, реальная разница в стоимости и быстрый…

источник Google AI for Developers
Абстрактная редакционная иллюстрация: многоуровневые routing-решения и cost-aware политика AI-provider-ов

Gemini 3.5 Flash — это уже не Flash-модель: что ценовая перестройка Google значит для вашей routing-политики

Google запустила Gemini 3.5 Flash по «$1,50»/«$9» за миллион токенов — в 3–6 раз дороже предыдущих Flash-уровней. В связке с новым серверным Interactions API это переписывает то, что routing-команды должны считать про Gemini Flash.

источник Google AI Blog
Помощь и контакты