Чип Jalapeño от OpenAI: что означает собственный ASIC для пропускной способности API и маршрутизации

OpenAI и Broadcom представили Jalapeño — первый собственный ускоритель вывода LLM от OpenAI. Разбираем, что переход на проприетарный кремний означает для пропускной способности API, ценового тренда и решений по маршрутизации у AI-команд.

TheRouter Newsroomисточник OpenAI
Техническая схема архитектуры чипа OpenAI Jalapeño с уровнями вычислений, памяти и сети, отражающая новый уровень инфраструктуры провайдера для команд маршрутизации AI

24 июня 2026 года OpenAI и Broadcom представили Jalapeño — первый собственный ускоритель вывода LLM от OpenAI. Чип спроектирован с нуля под задачи вывода LLM, а не адаптирован из универсального AI-железа. Ранние тесты показывают производительность на ватт, существенно превосходящую современный уровень. Первоначальное развёртывание запланировано на конец 2026 года в масштабе гигаватт совместно с партнёрами по дата-центрам, включая Microsoft.

Что произошло

Jalapeño — это специализированный ASIC, спроектированный OpenAI с использованием глубоких знаний о собственных kernel-функциях моделей, паттернах перемещения данных в памяти и архитектуре обслуживания. Ключевые факты из анонса:

  • Тейп-аут за девять месяцев: от начального проектирования до производственного тейп-аута — то, что OpenAI называет самым быстрым циклом разработки ASIC в высокопроизводительной полупроводниковой отрасли.
  • Инженерные образцы уже выполняют рабочие нагрузки: включая GPT-5.3-Codex-Spark на целевых частоте и мощности.
  • Архитектурная цель: сочетать пропускную способность современных AI-ускорителей с задержкой, близкой к специализированным inference-системам.
  • Платформа нескольких поколений: Jalapeño — первое поколение; Broadcom отвечает за реализацию кремния и сеть (включая Tomahawk); Celestica — за платы, стойки и системную интеграцию.
  • Сроки развёртывания: начало в конце 2026 года, масштабирование до гигаваттных дата-центров с Microsoft и другими партнёрами в рамках нескольких поколений.

Чип не ограничен моделями OpenAI — компания позиционирует его как предназначенный для «текущих и будущих LLM в отрасли», что отражает намерение предлагать inference-услуги за пределами собственной линейки моделей.

Почему это важно для AI-инженерных команд

Собственный кремний фундаментально меняет экономику провайдера. Когда провайдер зависит от сторонних GPU-квот, его потолок мощности определяется графиком производства и ценообразованием поставщика. Собственные ASIC разрывают эту зависимость — что имеет три нисходящих эффекта для операторов, маршрутизирующих к OpenAI:

1. Потолок мощности растёт. Развёртывание Jalapeño в гигаваттном масштабе с партнёрами по дата-центрам означает скачкообразный рост доступных inference-мощностей. Запас rate limit — наиболее частая причина, по которой команды добавляют fallback-маршруты от OpenAI, — должен расширяться по мере зрелости платформы. Команды с гибридными routing-политиками, переключающимися на альтернативных провайдеров при достижении лимитов OpenAI, в перспективе могут пересмотреть, остаётся ли этот fallback необходимым.

2. Ценовой тренд меняется. Цены на семейство GPT-5 уже резко снизились по сравнению с GPT-4. Лучшая производительность на ватт от собственного кремния усиливает этот тренд. Маховик, описанный OpenAI, — лучшая инфраструктура → эффективность вычислений → снижение стоимости обслуживания → снижение цен API → больший спрос — является реальным механизмом. Команды с долгосрочными моделями затрат, построенными на текущем ценообразовании, могут пересмотреть свои допущения.

3. Нижняя граница задержки смещается. Jalapeño нацелен на реальную утилизацию, близкую к теоретическому пику. Архитектура сокращает перемещение данных и балансирует вычисления, память и сеть, чтобы минимизировать разрыв между номинальной и фактической пропускной способностью. Для интерактивных продуктов, где важно время до первого токена, специализированный inference ASIC, оптимизированный под реальные kernel'ы OpenAI, представляет принципиально иную операционную среду по сравнению с пулами общих GPU.

Что пока не изменилось

Анонс — это предварительный показ железа, а не live-событие API. Jalapeño находится в стадии инженерных образцов; развёртывание начнётся «в конце 2026 года». Команды не должны предполагать, что перечисленные эффекты уже действуют в API OpenAI.

Для routing-команд этот анонс указывает направление, но пока не меняет операционных параметров:

  • Текущие rate limit остаются без изменений до их корректировки OpenAI.
  • Текущее ценообразование остаётся без изменений до публикации новых цен.
  • Fallback-политики маршрутизации, созданные по причинам мощности и надёжности, остаются оправданными для планирования на 2026 год.

Более непосредственный routing-сигнал из инфраструктурного roadmap OpenAI — подтверждает ли многопоколенное платформенное обязательство с Broadcom и Microsoft OpenAI как устойчивого высокомощного провайдера первого уровня для корпоративной маршрутизации.

На что обратить внимание

Анонсы развёртывания в конце 2026 года: первые Jalapeño-мощности, вводимые в производство, вероятно, проявятся в виде увеличения rate limit или новых тиров пропускной способности ещё до явных заявлений. Следите за журналом изменений платформы OpenAI.

Изменения ценообразования вслед за расширением мощностей: по мере масштабирования развёртывания Jalapeño ожидается новая волна ценовой конкуренции в API. Провайдеры без сопоставимой эффективности кремния окажутся под давлением на маржу — что может влиять на то, какие провайдеры остаются конкурентоспособными по стоимости в вашей routing-политике.

Позиционирование «inference для отрасли»: если OpenAI предложит inference на базе Jalapeño третьим сторонам, это создаст новый уровень провайдера — не просто model API, а вычислительный сервис. Это изменит матрицу выбора провайдеров для routing-команд, которые сейчас получают inference от отдельных аппаратных провайдеров.

Последствия для routing-политики

Командам, работающим с multi-provider routing сегодня:

  • Сохраняйте существующие fallback-маршруты — Jalapeño ещё не в производстве, текущие лимиты не изменились.
  • Логируйте ошибки OpenAI, связанные с мощностью, отдельно от ошибок качества в вашем routing-слое, чтобы измерить, изменится ли давление на мощность после ввода Jalapeño в строй.
  • Пересматривайте статус провайдеров первого уровня ежегодно: если собственный кремний OpenAI обеспечит описанные улучшения мощности и задержки, экономическое обоснование подмешивания альтернативных провайдеров исключительно ради мощности может ослабнуть. Отслеживайте это параллельно с реальными изменениями цен API. См. модели OpenAI на TheRouter.

Временны́е рамки развёртывания чипа охватывают остаток 2026 года и в гигаваттном масштабе выходят за 2027 год. У AI-инженерных команд есть время наблюдать за сигналом, прежде чем пересматривать долгосрочную routing-архитектуру.

Редакционная иллюстрация с разветвляющимися путями API-маршрутизации, где ветвь agents sessions уходит в сторону от основного шлюза на тёмном приглушённом фоне

OpenAI Agents API Beta: Новый обход шлюза, который операторам необходимо учесть

Публичная бета Agents API от OpenAI вводит отдельное пространство имён client.beta.agents, не проходящее через /v1/chat/completions. Для команд с AI-шлюзами: слепые зоны в биллинге, пробелы в аудите и новый scope API key.

источник OpenAI
Абстрактная схема, показывающая слои eval harness между моделью и benchmark-баллом, с ветвями routing-решений

Руководство OpenAI по eval harness: почему benchmark-баллы нельзя напрямую использовать для routing-решений

OpenAI опубликовала подробное руководство по проектированию надёжных сторонних оценок моделей. Главный вывод для операторов: выбор harness меняет измеренные возможности модели, поэтому benchmark-баллы требуют контекста перед применением в routing-политике.

источник OpenAI
Абстрактная схема ротации и политики истечения API-ключей в multi-provider routing gateway

OpenAI теперь принудительно устанавливает срок действия API-ключей на уровне организации: что должны проверить операторы шлюзов

OpenAI теперь позволяет задавать максимальный срок жизни ключей на уровне организации или проекта. Существующие ключи не укорачиваются, но все новые обязаны истекать в рамках лимита — а ваш шлюз, вероятно, самое рискованное место хранения долгоживущих ключей.

источник OpenAI
Помощь и контакты