Теги

Новости по тегу "billing"

RSS-лента
Абстрактная схема уровня управления API-ключами организации над многопровайдерным маршрутизирующим gateway

Управление созданием API-ключей в OpenAI: как режим «только service account» закрывает дыру теневой маршрутизации

Новые орг-контроли OpenAI позволяют запретить создание личных API-ключей — первый механизм, структурно закрывающий теневую маршрутизацию в администрируемых организациях.

источник OpenAI
Абстрактная схема ротации и политики истечения API-ключей в multi-provider routing gateway

OpenAI теперь принудительно устанавливает срок действия API-ключей на уровне организации: что должны проверить операторы шлюзов

OpenAI теперь позволяет задавать максимальный срок жизни ключей на уровне организации или проекта. Существующие ключи не укорачиваются, но все новые обязаны истекать в рамках лимита — а ваш шлюз, вероятно, самое рискованное место хранения долгоживущих ключей.

источник OpenAI
Редакционная иллюстрация с разветвляющимися путями API-маршрутизации, где ветвь agents sessions уходит в сторону от основного шлюза на тёмном приглушённом фоне

OpenAI Agents API Beta: Новый обход шлюза, который операторам необходимо учесть

Публичная бета Agents API от OpenAI вводит отдельное пространство имён client.beta.agents, не проходящее через /v1/chat/completions. Для команд с AI-шлюзами: слепые зоны в биллинге, пробелы в аудите и новый scope API key.

источник OpenAI
Абстрактная схема маршрутизации с ветвлением коэффициентов стоимости по путям облачных провайдеров

Claude Code: рабочие пространства с data residency теперь несут надбавку 1,1× — это влияет на выбор provider

Claude Code 2.1.239 начал учитывать надбавку 1,1× за US-only inference в оценках /cost и строке статуса для data-residency workspace. Команды, маршрутизирующие через Bedrock или Vertex, обходят эту надбавку — разбираем, что это значит для выбора provider.

источник Claude Code Changelog
Абстрактная редакционная иллюстрация: классификатор биологии перенаправляет запросы на резервную модель в узле маршрутизации, представляя управляемый провайдером fallback в инфраструктуре AI API

Исправление классификатора биологии Fable 5: тихая замена модели, о которой ваш биллинг не предупредил

Fable 5 сократил fallback по биологическим запросам на 85%. Для API-операторов это обнажило скрытый риск: запросы к Fable 5 обслуживал Opus 5 без каких-либо предупреждений. Что нужно проверить, прежде чем считать, что паритет модели восстановлен.

источник Anthropic
Дашборд атрибуции затрат по API-ключам с разбивкой по путям маршрутизации

Атрибуция затрат по API-ключам OpenAI теперь программируема: что должен изменить каждый оператор маршрутизации

4 августа OpenAI добавила измерение api_key в API использования и затрат. Для команд, использующих несколько ключей в одной организации, это закрывает главный пробел в атрибуции затрат по пути запроса — без создания отдельных организаций.

источник OpenAI
Редакционная диаграмма: иерархия проектов OpenAI, объявленная в файлах Terraform; ресурсы rate limit и model controls соединяются с routing-слоем шлюза

OpenAI выпускает официальный Terraform provider: IaC-управление платформой для команд AI-шлюзов

Официальный Terraform provider от OpenAI, выпущенный 29 июля, позволяет управлять проектами, сервисными аккаунтами, rate limit, контролем моделей и spend-алертами через код. Разбираем topology-паттерн для routing-слоя.

источник OpenAI
Абстрактная схема маршрутизации: одна ветка с меткой speed fast упирается в жёсткую остановку, другая с меткой fallbacks default сходится в единый чистый ответ

Режим fallbacks "default" доступен на Opus 5 — а speed: fast для Opus 4.7 теперь возвращает жёсткую ошибку 400

Обновление Anthropic API от 24 июля добавило fallbacks: "default" на Opus 5 и Opus 4.8 и превратило speed: "fast" для Opus 4.7 в жёсткую ошибку 400. Разбираем, что это значит для routing-политики прямо сейчас.

источник Anthropic
Абстрактная схема разрешения ARN-путей AWS Bedrock в отдельные уровни моделей с исправленным биллинговым реестром

Claude Code 2.1.218 устраняет скрытую ошибку биллинга Bedrock: операторы с ARN-маппингом моделей должны проверить исторические логи расходов

С февраля 2026 года Claude Code приписывал трафик Bedrock ARN к одному model ID, фиксируя ~$0.23 для Haiku и Opus одинаково. Версия 2.1.218 исправляет разрешение ARN, но исторические логи расходов gateway недостоверны.

источник Claude Code CHANGELOG
Дашборд маршрутизации, показывающий достижение жёсткого лимита расходов: API-запрос заблокирован, сигнал 429 insufficient_quota отображён в панели управления оператора

Жёсткие лимиты расходов OpenAI теперь блокируют API-запросы: что должен проверить каждый оператор шлюза

OpenAI добавил жёсткие месячные лимиты расходов: при превышении порога запросы возвращают 429 insufficient_quota. Для шлюзов это новый режим отказа — стандартная логика повторных попыток не справляется. Чек-лист для операторов.

источник OpenAI
Абстрактная схема роутинга с уровнями выбора модели по соотношению стоимости и результата, проходящими через AI-шлюз

Скорбалл OpenAI «Полезный интеллект на доллар»: чек-лист роутинговой политики для каждого оператора AI-шлюза

OpenAI опубликовала четырёхмерный фреймворк — «Useful Intelligence per Dollar» — который переосмысляет оценку моделей: вместо стоимости токена — стоимость успешно выполненной задачи. Вот что должен изменить каждый оператор роутинга уже сегодня.

источник OpenAI
DashScope Managed Agents API workspace-скопированная архитектура роутинга

DashScope Managed Agents API выходит на коммерческий рынок: что новый workspace-скопированный агентный runtime означает для вашей архитектуры роутинга

Alibaba Cloud запускает коммерческий биллинг Managed Agents API 17 августа. Новый workspace-скопированный агентный runtime вводит отдельное пространство имён endpoint и версионные требования к SDK, которые каждый оператор DashScope должен проверить прямо сейчас.

источник Alibaba Cloud Model Studio
Чистая редакционная диаграмма с деревом проектов, в каждом узле которого — service account со своим scoped API-ключом, соединённым с routing-шлюзом.

OpenAI теперь позволяет создавать API-ключи с областью видимости для каждого service account — что должен знать каждый оператор нескольких проектов

OpenAI Python SDK v2.46.0 добавляет endpoint для создания API-ключей с scopes для отдельных service account. Для многопроектных операторов это закрывает credential sprawl, из-за которого CI/CD-пайплайны вынуждены были использовать ключи уровня организации.

источник OpenAI
Абстрактная диаграмма жизненного цикла API ключей с таймерами истечения и мониторингом через Admin API на тёмном техническом фоне

Anthropic теперь требует срок истечения при создании API ключа: что операторы должны проверить до первого сбоя

Anthropic теперь требует решения о сроке истечения при создании API ключа. Admin API раскрывает поле expires_at для каждого ключа. Если ваша команда использует бессрочные ключи в production, изменение от 8 июля сбрасывает базовый уровень управления учётными данными.

источник Anthropic
Абстрактная схема облачного gateway с биллинговыми счётчиками и подсвеченными индикаторами промахов кеша на тёмном фоне

Claude Code переплачивал за Bedrock, Vertex, Mantle и Foundry: чеклист аудита для операторов gateway

Claude Code 2.1.211 исправляет регрессию prompt caching: завершающий блок системного контекста молча выставлялся как свежие input-токены при каждом запросе через Bedrock, Vertex AI, Mantle и Foundry. Операторам gateway необходим аудит счетов.

источник Anthropic Claude Code
Семь путей маршрутизации сходятся в единый узел пропускной способности, иллюстрируя новую поддержку очереди заказов Gemini

Gemini Provisioned Throughput теперь поддерживает очередь из 7 заказов: что GA-релиз мультизаказов меняет для команд маршрутизации

1 июля Google перевёл поддержку нескольких ожидающих заказов Provisioned Throughput в статус GA — теперь можно одновременно ставить в очередь до 7 заказов на одну модель и регион, устраняя последовательный 10-дневный цикл активации.

источник Google
Схема двухуровневого контроля доступа к моделям: потолок на уровне организации и ограничения effort на уровне роли, модели Claude скрыты за шлюзами доступа

Claude Enterprise Model Entitlements: ролевые ограничения доступа к моделям и уровней effort вышли в бета

Новая функция Anthropic позволяет администраторам ограничивать доступ к конкретным моделям Claude по ролям и устанавливать максимальный уровень effort на роль — тем самым напрямую ограничивая расход токенов. Разбираем, что нужно настроить AI-командам.

источник Anthropic
Архитектурная схема потока переопределения конфигурации агента на уровне сессии в платформе Claude Managed Agents

Claude Managed Agents: пересессионные переопределения конфигурации и event deltas — что меняется в архитектуре маршрутизации агентов

Обновление Anthropic от 30 июня добавляет в Claude Managed Agents переопределения конфигурации на уровне сессии, streaming event deltas, lifecycle webhooks и управление инъекцией vault-учётных данных — меняя подход к runtime-маршрутизации.

источник Anthropic
Абстрактная схема разветвлённой архитектуры маршрутизации с двумя путями инференса — один работает на инфраструктуре Azure, другой на инфраструктуре Anthropic — объединяющимися в enterprise API-шлюзе

Claude в Azure Foundry — официальный релиз: что новая архитектура хостинга означает для enterprise-маршрутизации

Claude в Microsoft Foundry теперь в статусе GA с двумя режимами хостинга: инференс на Azure или на Anthropic, нативный биллинг CCU, MACC-drawdown, аутентификация Entra ID и US Data Zone для enterprise-команд.

источник Anthropic / Microsoft Azure
Anthropic Claude API унификация лимитов уровней маршрутизация — консолидация Start Build Scale editorial

Anthropic унифицирует лимиты API Claude: что означает паритет Sonnet/Haiku/Opus для команд маршрутизации

26 июня Anthropic выровняла RPM, ITPM и OTPM для Sonnet и Haiku до уровня Opus и консолидировала пять уровней использования в три. Что новая структура Start/Build/Scale означает для политики fallback-маршрутизации и управления лимитами расходов.

источник Anthropic Platform Docs
Диаграмма роутинга Claude API через AWS Bedrock в регионе Азиатско-Тихоокеанский для соответствия корпоративным требованиям хранения данных

Anthropic открывает офис в Сеуле — что волна корейских корпоративных внедрений говорит об архитектуре регионального роутинга

Открытие офиса Anthropic в Сеуле и корпоративные развёртывания в Корее обнажают ограничение, с которым сталкиваются AI-команды по всему миру: регулируемые отрасли не могут использовать прямой API Claude — им нужен роутинг через AWS Bedrock.

источник Anthropic
Абстрактная схема управляемых token-бюджетных потоков и шлюзов политики делегирования для мультиагентного управления Codex

OpenAI Codex 0.143: Token-бюджеты и политика делегирования мультиагентов закрывают пробел в управлении для операторов

Codex 0.143.0 добавляет настраиваемые rollout token-бюджеты, политику многоагентного делегирования на уровне потока и ограниченный веб-поиск по белому списку URL — три механизма управления, которых операторам не хватало с момента перехода Codex в мультиагентный режим.

источник OpenAI Codex
Приостановленный счётчик биллинга над двумя разветвлёнными полосами маршрутизации — пулом подписки и прямым API key — символизирующий паузу разделения биллинга Anthropic Agent SDK

Anthropic отменил разделение биллинга Claude Agent SDK: что означает отказ для стратегии маршрутизации

"Мы приостанавливаем изменения в использовании Claude Agent SDK" — 15 июня Anthropic отменил разделение биллинга в день запуска. Что означает отказ от кредитной системы для маршрутизации через подписку или API-ключ, и как подготовиться к следующему изменению биллинга.

источник Anthropic
Панель управления с аналитикой кредитов по моделям и spend controls на уровне enterprise AI routing

OpenAI Spend Controls и Cost API: лимиты кредитов по моделям для enterprise AI routing

Spend controls в ChatGPT Enterprise добавляют лимиты кредитов по моделям, переопределения для групп и пользователей и экспорт через Cost API — полезные сигналы для routing-команд, которые сверяют API-биллинг, fallback и chargeback.

источник OpenAI
Схема разделённого billing: кредитный канал подписки Claude и канал прямой маршрутизации через API key для агентных нагрузок

Раздельный billing для Claude Agent SDK с 15 июня: когда хватает кредита подписки, а когда нужен прямой API key

Anthropic разделила billing для Agent SDK с 15 июня 2026 г. Новый ежемесячный кредит на пользователя ($20–$200 в зависимости от тарифа) работает на отдельном счётчике — и его потолок меняет логику маршрутизации для каждой production-команды.

источник Anthropic
Схема request flow: ранний отказ выходит с нулевой стоимостью, advisor-вызов имеет настраиваемый потолок токенов

Claude API stop_reason=refusal: нулевые расходы на ранние refusal и ограничение advisor max_tokens

Claude API теперь не биллирует stop_reason=refusal без output-токенов; advisor поддерживает max_tokens на вызов. Чеклист операторов: исправьте billing для ранних refusal, добавьте advisor max_tokens в routing config, используйте stop_details.category для триажа refusal.

источник Anthropic
Редакционная иллюстрация потоков метрик с OTEL метками команд, маршрутизируемых через конвейер cost allocation для операторов

Claude Code теперь маркирует OTEL-метрики по командам: что изменит релиз от 2 июня для операторской тарификации

Релиз Claude Code от 2 июня передаёт значения OTEL_RESOURCE_ATTRIBUTES как метки на каждую точку данных метрики, обеспечивая распределение затрат по командам на уровне Prometheus без кастомной инструментации на стороне gateway.

источник Anthropic
Абстрактная редакционная иллюстрация счётчика тарификации и ветвящихся путей маршрутизации агентов на нейтральном фоне

Контейнерные сессии OpenAI: поминутная тарификация, минимум 5 минут и модель стоимости для Hosted Shell

Контейнерные сессии OpenAI для Hosted Shell и Code Interpreter теперь тарифицируются поминутно с минимумом 5 минут. Разбираем модель стоимости для routing-команд: когда повторно использовать container_reference, избегать новых container_auto-сессий и выбирать уровень памяти.

источник OpenAI
Чистая редакционная диаграмма: безопасный обмен токенами между внешним identity provider и API gateway — keyless-аутентификация рабочих нагрузок.

OpenAI Workload Identity Federation: Keyless API Auth for CI/CD & Coding Agents — Plus Admin API Model Allowlists & Spend Alerts

OpenAI Workload Identity Federation позволяет CI/CD-пайплайнам обменивать OIDC-токены на краткосрочные API-ключи — без хранения credentials. Admin API добавил model allowlists, spend alerts и детализацию billing. Checklist оператора внутри.

источник OpenAI
Абстрактная редакционная иллюстрация: инфраструктура multi-model AI routing с узлами provider и потоками трафика

OpenRouter привлекает $113 млн и обрабатывает 25 трлн токенов в неделю: что взрыв multi-model трафика означает для вашей routing-архитектуры

OpenRouter закрыл Series B на $113 млн и фиксирует 25 трлн токенов в неделю — пятикратный рост за полгода. Этот сигнал требует конкретных выводов о routing-политике, governance и рисках lock-in на единственного provider.

источник OpenRouter
Схема миграции биллинга GitHub Copilot: от Premium Request Units к токеновой тарификации AI Credits

GitHub Copilot AI Credits июнь 2026: токеновая тарификация запущена, автоматический downgrade отменён

GitHub Copilot AI Credits запущены в июне 2026 года: Premium Request Units заменены токеновой тарификацией, механизм автоматического даунгрейда при исчерпании квоты убран. Agentic-сессии теперь останавливаются, когда кредиты заканчиваются.

источник GitHub
Помощь и контакты