Qwen3.7-Max benchmarks: Terminal Bench 69.7, SWE-Pro лидерство и T-Head ZW-M890 PPU — 35 часов автономного запуска

Qwen3.7-Max benchmarks: Terminal Bench 2.0 → 69.7 (лидер), GPQA Diamond → 92.4, SWE-Pro и SWE-Multilingual лучшие оценки, KernelBench GPU 1.98×. T-Head ZW-M890 PPU — 35 часов непрерывной автономной работы агента. Routing-импликации для команд.

Опубликовано источник Alibaba Cloud

Архивный материал, подготовленный с помощью ИИ по указанному источнику и опубликованный без индивидуальной проверки. Ответственный редактор: Joe Werner.

Абстрактная тёмная визуализация нейронной сети с расходящимися потоками данных, сходящимися к центральному вычислительному ядру, символизирующая работу автономного AI-агента
Машинный перевод с английского оригинала — читать оригинал

Alibaba Cloud выпустил Qwen3.7-Max и Qwen3.7-Plus на Alibaba Cloud Summit 20 мая 2026 г. — всего через месяц после Qwen3.6. Preview-версии тихо появились на Arena AI и Qwen Chat днём ранее, продолжая обычную для команды практику «мягкого запуска» до официального анонса. Релиз примечателен не только цифрами бенчмарков, но и операционной моделью, которую продвигает Alibaba: позиционирование Qwen как инфраструктурного решения эпохи агентов, а не как погони за единственным показателем в leaderboard-е.

Что говорят бенчмарки

Цифры, которые имеют значение для решений о маршрутизации:

  • GPQA Diamond: 92,4 — выше Claude Opus 4.6 (91,3). Это мера точности рассуждения на уровне PhD, актуальная для исследований, code review и сложных agent-подзадач.
  • Terminal Bench 2.0-Terminus: 69,7 — сообщается как один из самых высоких публичных результатов, выше DeepSeek-v4-pro-Max и Claude Opus 4.6. Этот бенчмарк напрямую измеряет способность coding-агента работать на длинном горизонте: реальные терминальные сессии, файловые операции, многошаговый debug.
  • HLE: 41,4 и HMMT 2026 февраль: 97,1 — сильные результаты на сложном математическом рассуждении.
  • SWE-Pro и SWE-Multilingual: ведущие позиции на обоих. Бенчмарки SWE измеряют способность решать реальные issue в GitHub — метрика, наиболее напрямую связанная с Cursor, Claude Code и OpenAI-совместимыми coding-сценариями.
  • Kernel Bench GPU: ускорение в 1,98 раза на задачах оптимизации GPU-ядер.
  • Слепая оценка Arena AI: ранжируется выше Kimi-K2.6, DeepSeek-v4-pro и GLM-5.1 среди китайских моделей.

Одна конкретная демонстрация выделилась: Qwen3.7-Max выполнил непрерывную автономную задачу длиной 35 часов на T-Head ZW-M890 PPU — железе, с которым модель раньше никогда не сталкивалась. Это не игрушечное демо. Оно представляет ту самую долгогоризонтную, адаптирующуюся к железу agent-логику, которая важна, когда вы запускаете coding-агентов на внутренней или нестандартной инфраструктуре.

Почему это важно для AI-инженерных команд

Каденция «релиз раз в месяц» — это сигнал, а не просто маркетинговое решение. Qwen3.6 вышел в апреле. Qwen3.7-Max — в мае. Для команд, строящих routing-политики вокруг Qwen, такой темп означает, что стратегия пиннинга версий должна быть явной. Если вы шлёте трафик на qwen-plus или qwen-max по семейству модели, а не по конкретной версии, ваш базовый уровень качества может смещаться от прогона к прогону. Если продукт зависит от стабильного поведения в SWE или reasoning, пиннинг версии через routing-конфиг — правильный ответ.

Agent-способности теперь — главная ось дифференциации. Результаты Terminal Bench и SWE операционно значительнее традиционных NLP-бенчмарков. Командам, запускающим Cursor, Claude Code или собственные agent-пайплайны, которые используют Qwen через OpenAI-совместимую маршрутизацию, стоит оценить, меняет ли Qwen3.7-Max выбор модели по умолчанию для agent-задач — особенно долгогоризонтных, где разница 69,7 против более низкого Terminal Bench накапливается на множестве шагов.

Надёжность китайских моделей — это вопрос проектирования маршрутизации. Qwen, GLM, DeepSeek и Kimi выпускают значительные обновления моделей с месячным или даже более коротким циклом. Результат Arena AI — где Qwen3.7-Max первый среди китайских моделей — важен, если вы принимаете routing-решения, в которых китайские провайдеры — основной или fallback-путь. Конкурентный порядок меняется часто, и статичная конфигурация маршрутизации, оптимальная в апреле, в мае может маршрутизировать субоптимально.

Угол зрения router/operator

Маршрутизация по версии модели, а не только по семейству. OpenAI-совместимый endpoint DashScope от Alibaba (dashscope-intl.aliyuncs.com/compatible-mode/v1) обычно показывает имена моделей вроде qwen-max, qwen-plus и qwen-turbo. С ежемесячными обновлениями моделей реальная capability за именем qwen-max меняется без смены названия. Если вам нужно воспроизводимое поведение агента — особенно для SWE-задач — маршрутизируйте на явное версионированное имя модели там, где Alibaba его предоставляет, или относитесь к каждому ежемесячному релизу как к событию провайдера, запускающему пересмотр routing-весов.

Дизайн fallback-цепочки для долгогоризонтных agent-задач. Результаты Terminal Bench меряют автономные сессии в 35+ шагов. Если ваша routing-политика откатывается на более слабую модель посреди сессии (например, по таймауту или событию квоты), более низкая agent-способность fallback-модели может вызвать каскадные сбои — чего не происходит с одношаговыми задачами. Имеет смысл держать долгогоризонтные agent-вызовы на выделенном routing-пути с качественным fallback (Qwen3.7-Max → Qwen3.7-Plus, а не → лёгкая модель), а агрессивную оптимизацию по стоимости оставить для коротких задач.

SWE-Multilingual как сигнал выбора провайдера для полиязычных кодовых баз. Если ваша кодовая база полиязычна (Python + Go + Rust или китайская + английская документация), производительность SWE-Multilingual имеет значение. Лидирующая позиция Qwen3.7-Max в этом бенчмарке предполагает, что он может обгонять альтернативы на смешанных по языкам файловых операциях и кросс-языковых рефакторингах — стоит прогнать собственный бенчмарк на реальной кодовой базе, прежде чем фиксировать routing-бюджет.

Соображения по маршрутизации между китайскими провайдерами. Слепая оценка Arena AI ставит Qwen3.7-Max выше Kimi-K2.6, DeepSeek-v4-pro и GLM-5.1. Для команд с мульти-китайской routing-схемой это данные для корректировки routing-весов по качеству — хотя самоотчётные ранги Arena стоит верифицировать на собственном распределении задач, прежде чем менять production-политику.

За чем следить или что попробовать

  • Пересмотрите слот Qwen в маршрутизации: если вы сейчас маршрутизируете agent-задачи на DeepSeek или GLM как на основного китайского провайдера, результаты Terminal Bench и SWE делают Qwen3.7-Max достойным сравнительной оценки на вашей реальной нагрузке.
  • Проверьте пиннинг версии модели: определите, шлёт ли текущая routing-конфигурация трафик на версионированный Qwen ID или на плавающий alias qwen-max. Если последнее — задокументируйте, что базовый уровень качества может смещаться при будущих обновлениях Alibaba.
  • Явно тестируйте долгогоризонтные agent-прогоны: 35-часовой автономный результат — это заявленная capability. Протестируйте её на собственной agent-обвязке с бенчмарком в 20–50 шагов, прежде чем полагаться на это в production agent-нагрузках.
  • Следите за каденцией: Qwen3.8 или эквивалент вероятен в течение 4–6 недель с учётом текущего темпа релизов. Если вы проектируете routing-политику сейчас — закладывайте, что обновления версии моделей не должны требовать ручного вмешательства.

Модели, упомянутые в статье

Чёткая редакционная визуализация диаграммы маршрутизации моделей с qwen3.8-max в качестве узла верхнего уровня, абстрактные линии на матовом тёмном фоне

Qwen3.8-Max — теперь топовая модель DashScope: что смена флагмана меняет в вашей routing-политике

qwen3.8-max появился на DashScope: 2.4T параметров, 1M контекст и режим размышлений — а qwen3.7-max переведён в legacy. Что меняется для команд, маршрутизирующих трафик на флагманский уровень Qwen.

источник Alibaba Cloud
Абстрактная диаграмма маршрутизации с многоязычными потоками текста, сходящимися через центральный gateway-узел

Qwen-MT Turbo: специализированный translation API от Alibaba и параметры extra_body, которые стандартные прокси могут терять

Новый qwen-mt-turbo от Alibaba Cloud приходит через OpenAI-совместимые endpoint, но его translation-контроли живут внутри extra_body — паттерн, который ломается на любом middleware, отрезающем нестандартные поля. Что нужно держать в голове routing-командам.

источник Qwen Blog
Абстрактная редакционная иллюстрация с развилкой маршрутизации, символизирующей совместимость OpenAI Responses API с эндпоинтами DashScope Qwen

DashScope OpenAI Responses API — compatible-mode/v1 теперь поддерживает Qwen с сохранением контекста и встроенными инструментами

DashScope OpenAI Responses API запущен на compatible-mode/v1 для моделей Qwen3.7-max, qwen3.6-plus, qwen3-coder-plus и др. Состоятельный previous_response_id, встроенный веб-поиск и интерпретатор кода, управление глубиной reasoning.effort, четыре глобальных региона.

источник Alibaba Cloud Model Studio
Помощь и контакты