Чип Jalapeño от OpenAI: что означает собственный ASIC для пропускной способности API и маршрутизации
OpenAI и Broadcom представили Jalapeño — первый собственный ускоритель вывода LLM от OpenAI. Разбираем, что переход на проприетарный кремний означает для пропускной способности API, ценового тренда и решений по маршрутизации у AI-команд.

24 июня 2026 года OpenAI и Broadcom представили Jalapeño — первый собственный ускоритель вывода LLM от OpenAI. Чип спроектирован с нуля под задачи вывода LLM, а не адаптирован из универсального AI-железа. Ранние тесты показывают производительность на ватт, существенно превосходящую современный уровень. Первоначальное развёртывание запланировано на конец 2026 года в масштабе гигаватт совместно с партнёрами по дата-центрам, включая Microsoft.
Что произошло
Jalapeño — это специализированный ASIC, спроектированный OpenAI с использованием глубоких знаний о собственных kernel-функциях моделей, паттернах перемещения данных в памяти и архитектуре обслуживания. Ключевые факты из анонса:
- Тейп-аут за девять месяцев: от начального проектирования до производственного тейп-аута — то, что OpenAI называет самым быстрым циклом разработки ASIC в высокопроизводительной полупроводниковой отрасли.
- Инженерные образцы уже выполняют рабочие нагрузки: включая GPT-5.3-Codex-Spark на целевых частоте и мощности.
- Архитектурная цель: сочетать пропускную способность современных AI-ускорителей с задержкой, близкой к специализированным inference-системам.
- Платформа нескольких поколений: Jalapeño — первое поколение; Broadcom отвечает за реализацию кремния и сеть (включая Tomahawk); Celestica — за платы, стойки и системную интеграцию.
- Сроки развёртывания: начало в конце 2026 года, масштабирование до гигаваттных дата-центров с Microsoft и другими партнёрами в рамках нескольких поколений.
Чип не ограничен моделями OpenAI — компания позиционирует его как предназначенный для «текущих и будущих LLM в отрасли», что отражает намерение предлагать inference-услуги за пределами собственной линейки моделей.
Почему это важно для AI-инженерных команд
Собственный кремний фундаментально меняет экономику провайдера. Когда провайдер зависит от сторонних GPU-квот, его потолок мощности определяется графиком производства и ценообразованием поставщика. Собственные ASIC разрывают эту зависимость — что имеет три нисходящих эффекта для операторов, маршрутизирующих к OpenAI:
1. Потолок мощности растёт. Развёртывание Jalapeño в гигаваттном масштабе с партнёрами по дата-центрам означает скачкообразный рост доступных inference-мощностей. Запас rate limit — наиболее частая причина, по которой команды добавляют fallback-маршруты от OpenAI, — должен расширяться по мере зрелости платформы. Команды с гибридными routing-политиками, переключающимися на альтернативных провайдеров при достижении лимитов OpenAI, в перспективе могут пересмотреть, остаётся ли этот fallback необходимым.
2. Ценовой тренд меняется. Цены на семейство GPT-5 уже резко снизились по сравнению с GPT-4. Лучшая производительность на ватт от собственного кремния усиливает этот тренд. Маховик, описанный OpenAI, — лучшая инфраструктура → эффективность вычислений → снижение стоимости обслуживания → снижение цен API → больший спрос — является реальным механизмом. Команды с долгосрочными моделями затрат, построенными на текущем ценообразовании, могут пересмотреть свои допущения.
3. Нижняя граница задержки смещается. Jalapeño нацелен на реальную утилизацию, близкую к теоретическому пику. Архитектура сокращает перемещение данных и балансирует вычисления, память и сеть, чтобы минимизировать разрыв между номинальной и фактической пропускной способностью. Для интерактивных продуктов, где важно время до первого токена, специализированный inference ASIC, оптимизированный под реальные kernel'ы OpenAI, представляет принципиально иную операционную среду по сравнению с пулами общих GPU.
Что пока не изменилось
Анонс — это предварительный показ железа, а не live-событие API. Jalapeño находится в стадии инженерных образцов; развёртывание начнётся «в конце 2026 года». Команды не должны предполагать, что перечисленные эффекты уже действуют в API OpenAI.
Для routing-команд этот анонс указывает направление, но пока не меняет операционных параметров:
- Текущие rate limit остаются без изменений до их корректировки OpenAI.
- Текущее ценообразование остаётся без изменений до публикации новых цен.
- Fallback-политики маршрутизации, созданные по причинам мощности и надёжности, остаются оправданными для планирования на 2026 год.
Более непосредственный routing-сигнал из инфраструктурного roadmap OpenAI — подтверждает ли многопоколенное платформенное обязательство с Broadcom и Microsoft OpenAI как устойчивого высокомощного провайдера первого уровня для корпоративной маршрутизации.
На что обратить внимание
Анонсы развёртывания в конце 2026 года: первые Jalapeño-мощности, вводимые в производство, вероятно, проявятся в виде увеличения rate limit или новых тиров пропускной способности ещё до явных заявлений. Следите за журналом изменений платформы OpenAI.
Изменения ценообразования вслед за расширением мощностей: по мере масштабирования развёртывания Jalapeño ожидается новая волна ценовой конкуренции в API. Провайдеры без сопоставимой эффективности кремния окажутся под давлением на маржу — что может влиять на то, какие провайдеры остаются конкурентоспособными по стоимости в вашей routing-политике.
Позиционирование «inference для отрасли»: если OpenAI предложит inference на базе Jalapeño третьим сторонам, это создаст новый уровень провайдера — не просто model API, а вычислительный сервис. Это изменит матрицу выбора провайдеров для routing-команд, которые сейчас получают inference от отдельных аппаратных провайдеров.
Последствия для routing-политики
Командам, работающим с multi-provider routing сегодня:
- Сохраняйте существующие fallback-маршруты — Jalapeño ещё не в производстве, текущие лимиты не изменились.
- Логируйте ошибки OpenAI, связанные с мощностью, отдельно от ошибок качества в вашем routing-слое, чтобы измерить, изменится ли давление на мощность после ввода Jalapeño в строй.
- Пересматривайте статус провайдеров первого уровня ежегодно: если собственный кремний OpenAI обеспечит описанные улучшения мощности и задержки, экономическое обоснование подмешивания альтернативных провайдеров исключительно ради мощности может ослабнуть. Отслеживайте это параллельно с реальными изменениями цен API. См. модели OpenAI на TheRouter.
Временны́е рамки развёртывания чипа охватывают остаток 2026 года и в гигаваттном масштабе выходят за 2027 год. У AI-инженерных команд есть время наблюдать за сигналом, прежде чем пересматривать долгосрочную routing-архитектуру.
Похожие материалы
Новости AI-роутинга и провайдеров →
OpenAI Agents API Beta: Новый обход шлюза, который операторам необходимо учесть
Публичная бета Agents API от OpenAI вводит отдельное пространство имён client.beta.agents, не проходящее через /v1/chat/completions. Для команд с AI-шлюзами: слепые зоны в биллинге, пробелы в аудите и новый scope API key.

Руководство OpenAI по eval harness: почему benchmark-баллы нельзя напрямую использовать для routing-решений
OpenAI опубликовала подробное руководство по проектированию надёжных сторонних оценок моделей. Главный вывод для операторов: выбор harness меняет измеренные возможности модели, поэтому benchmark-баллы требуют контекста перед применением в routing-политике.

OpenAI теперь принудительно устанавливает срок действия API-ключей на уровне организации: что должны проверить операторы шлюзов
OpenAI теперь позволяет задавать максимальный срок жизни ключей на уровне организации или проекта. Существующие ключи не укорачиваются, но все новые обязаны истекать в рамках лимита — а ваш шлюз, вероятно, самое рискованное место хранения долгоживущих ключей.