Назад к моделям

Qwen Long

qwenqwen/qwen-long

Qwen с контекстом 10M — для анализа документов целиком.

Чем обслуживание в TheRouter отличается от вендорского

Как её эксплуатирует вендор

Alibaba Bailian описывает qwen-long как CN-hosted длинноконтекстную модель: 10M токенов контекста, 8 192 токена вывода, text-in/text-out; прямой HTTP рекомендован до 1M токенов, выше — файловая отправка.

На TheRouter

TheRouter предоставляет qwen/qwen-long через OpenAI-compatible chat path с catalog context length 10 485 760 токенов и обслуживанием в CN-регионе Bailian. Поэтому страница считает 10M vendor contract, 10 485 760 — operational catalog value TheRouter, и предупреждает, что прямые длинные промпты надо валидировать.

qwen-long — специалист по длинному контексту в семействе Qwen. Окно в 10M токенов позволяет за один запрос проглотить целые книги, сотни страниц юридических документов, целые кодовые базы или недели чат-истории — и затем отвечать, резюмировать или извлекать поверх всего входа.

Модель развёрнута только на материковом эндпоинте Bailian (bailian-cn). Singapore-фолбэка нет — если bailian-cn недоступен, модель недоступна. Учитывайте это в стратегии retry.

Контекст 10M
Самый большой коммерческий контекст в семействе Qwen. Для большинства задач уровня документа не нужны ни чанкование, ни map-reduce.
Анализ документов
Силён в межсекционном reasoning, full-text Q&A, ревью контрактов и суммаризации многофайлового кода.
Дёшево на токен
$0.12 input / $0.45 output per MTok — отличная цена для такого окна.
Только CN
Живёт на bailian-cn. Singapore-фолбэка нет — регион зафиксирован на материке.
Когда выбирать
Анализ целого документа, ревью контрактов / регуляторики, репо-уровневая суммаризация кода, Q&A по длинным транскриптам — везде, где чанкование убьёт межсекционный контекст.
Когда не выбирать
Латентно-критичный чат или нагрузки, требующие доступности Singapore (bailian-sg) — qwen-long только CN и оптимизирована под пропускную способность на длинных входах, а не под быстрые тёрновые ответы.
Тарификация: $0.12 input / $0.45 output per MTok. Только CN — без Singapore-фолбэка.
Размер контекста
10.5M
Максимальный вывод
8K
Цена Входза 1M токенов
$0.1296за 1 млн токенов
Цена Выходза 1M токенов
$0.486за 1 млн токенов

Модальности

Текст→Текст

Разбивка цен

ТипСтавка
Вход$0.1296 за 1 млн токенов
Выход$0.486 за 1 млн токенов

Поддерживаемые параметры

temperaturemax_tokenstop_presponse_formatstop

Характеристики

Длина контекстаAlibaba документирует 10 000 000 токенов; каталог TheRouter показывает 10 485 760 токеновhelp.aliyun.com ↗проверено
Лимит прямого HTTP-ввода1 000 000 токенов; для большей длины Alibaba рекомендует файловую отправкуhelp.aliyun.com ↗проверено
Максимальный вывод8 192 токенаhelp.aliyun.com ↗проверено
МодальностиТекстовый ввод → текстовый выводhelp.aliyun.com ↗проверено
Неподдерживаемые upstream-функцииFunction calling, structured output, web search, prefix completion, context cache, batch inference и fine-tuninghelp.aliyun.com ↗проверено
Опубликованные лимиты материкового Китаяqwen-long: 1 200 RPM и 3 000 000 TPM в cn-beijinghelp.aliyun.com ↗проверено

Бенчмарки

BenchmarkDistributionScoreSource
Public long-context benchmark suite
Страница Alibaba qwen-long описывает целевые задачи и лимиты, но не публикует таблицу бенчмарков для этой модели.
—Не раскрыто—
Document QA benchmark
Перед заменой chunked retrieval pipeline проверьте модель на собственном long-document acceptance set.
—Не раскрыто—
Latency / throughput benchmark
Модель рассчитана на очень большие контексты; измеряйте TTFT и latency генерации на вашем целевом размере промпта.
—Не раскрыто—

Примеры API

Для новых интеграций используйте глобальный endpoint api.therouter.ai из примеров ниже; старый China accelerated endpoint выведен из эксплуатации.

cURL
curl https://api.therouter.ai/v1/chat/completions   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "qwen/qwen-long",
    "messages": [
      {"role": "user", "content": "Summarize the key points from this input."}
    ]
  }'

Long-document chat

Используйте OpenAI-compatible chat endpoint для длинных текстовых промптов. Держите прямые HTTP-запросы в рамках upstream-рекомендации 1M токенов, если в интеграции нет утверждённого файлового маршрута.

cURL
curl https://api.therouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"qwen/qwen-long","messages":[{"role":"user","content":"Summarize the attached long document text: ..."}],"max_tokens":1200}'

Ещё от qwen

Похожие модели

Аналоги в других провайдерах

Новости и изменения

2025-01-25

Alibaba перечисляет snapshot qwen-long и qwen-long-latest рядом с базовым маршрутом

Документация qwen-long перечисляет стабильный маршрут qwen-long, динамически обновляемый qwen-long-latest и snapshot qwen-long-2025-01-25. Все три имеют headline 10M context и 8 192 токена вывода, но опубликованные квоты отличаются между stable/latest и snapshot route.

переработано TheRouterhelp.aliyun.com ↗

Частые вопросы

qwen/qwen-long действительно модель на 10M токенов?

Alibaba документирует qwen-long с максимальным вводом и длиной контекста 10 000 000 токенов. На той же странице сказано, что прямой HTTP поддерживает 1M токенов, а выше рекомендуется файловая отправка. Каталог TheRouter показывает 10 485 760 токенов, поэтому считайте 10M vendor-published contract и проверяйте конкретную форму запроса, которую собираетесь запускать.

Поддерживает ли qwen-long function calling или structured output?

В capability table Alibaba для qwen-long указано, что function calling и structured output не поддерживаются; также не поддерживаются web search, prefix completion, context cache, batch inference и fine-tuning. Через TheRouter используйте обычные chat-промпты и считайте JSON output best-effort следованием инструкциям.

Когда выбирать qwen-long вместо qwen-plus?

Выбирайте qwen-long только когда ограничение — размер контекста: ревью целого документа, Q&A по очень длинным транскриптам, cross-section extraction или archive-level summarisation. Для обычного чата, короткой классификации или latency-sensitive flows qwen-plus обычно проще и быстрее.

Реестр фактов — каждая утверждаемая величина имеет источник
источникURLполучено
Длина контекстаhelp.aliyun.com ↗2026-08-01проверено
Лимит прямого HTTP-вводаhelp.aliyun.com ↗2026-08-01проверено
Максимальный выводhelp.aliyun.com ↗2026-08-01проверено
Модальностиhelp.aliyun.com ↗2026-08-01проверено
Неподдерживаемые upstream-функцииhelp.aliyun.com ↗2026-08-01проверено
Опубликованные лимиты материкового Китаяhelp.aliyun.com ↗2026-08-01проверено
Public long-context benchmark suitehelp.aliyun.com ↗2026-08-01неизвестно
Document QA benchmarkhelp.aliyun.com ↗2026-08-01неизвестно
Latency / throughput benchmarkhelp.aliyun.com ↗2026-08-01неизвестно
Alibaba перечисляет snapshot qwen-long и qwen-long-latest рядом с базовым маршрутомhelp.aliyun.com ↗2026-08-01проверено
qwen/qwen-long действительно модель на 10M токенов?help.aliyun.com ↗2026-08-01к проверке
Поддерживает ли qwen-long function calling или structured output?help.aliyun.com ↗2026-08-01к проверке
Когда выбирать qwen-long вместо qwen-plus?help.aliyun.com ↗2026-08-01к проверке
Помощь и контакты