Теги

Новости по тегу "cost-control"

RSS-лента
Чёткая схема routing с уровнями стоимости и выбором между GLM-5.2 Fast и Full на DashScope

GLM-5.2 Fast Mode на DashScope подешевел на 20%: что изменилось в вашей модели routing-затрат

Alibaba Cloud Bailian снизила цену токенов для GLM-5.2 Fast mode на 20% с 15 июля. Для операторов, маршрутизирующих нагрузки через OpenAI-совместимый endpoint DashScope, формула стоимости изменилась.

источник Alibaba Cloud Model Studio
Абстрактная схема потока токенов в API-ответе с фильтрующим шлюзом, который выборочно отбрасывает уже обработанные блоки результатов поиска — иллюстрация параметра response_inclusion для контроля затрат

Claude API снижает затраты на поиск в агентных пайплайнах: параметр response_inclusion, который должен знать каждый оператор

Обновление платформы Anthropic от 11 июня добавляет response_inclusion к web_search_20260318 и web_fetch_20260318, позволяя операторам исключать уже обработанные блоки результатов поиска из API-ответа и снижать расходы на output-токены в многошаговых агентных воркфлоу.

источник Anthropic
Схема миграции биллинга GitHub Copilot: от Premium Request Units к токеновой тарификации AI Credits

GitHub Copilot AI Credits июнь 2026: токеновая тарификация запущена, автоматический downgrade отменён

GitHub Copilot AI Credits запущены в июне 2026 года: Premium Request Units заменены токеновой тарификацией, механизм автоматического даунгрейда при исчерпании квоты убран. Agentic-сессии теперь останавливаются, когда кредиты заканчиваются.

источник GitHub
Постоянное снижение цены DeepSeek V4 Pro: схема выбора routing-уровней для AI-инженерных команд

DeepSeek закрепляет снижение цены на V4 Pro: что ценовая война в AI значит для вашей routing-политики

DeepSeek подтвердила, что 75% скидка на V4 Pro теперь постоянная. При цене «$0,87/M» за output-токены и результатах SWE-bench выше 80% модель переписывает карту routing-уровней — V4 Pro больше не премиальный fallback, а основная reasoning-модель.

источник DeepSeek
Помощь и контакты