Назад к моделям

Ling Flash 2.0

inclusionaiinclusionai/ling-flash-2

InclusionAI Ling Flash 2.0 — fast inference model for general-purpose tasks.

Ling Flash 2.0 — это модель смеси экспертов (MoE) от InclusionAI, открытая в июле 2025 года. При 100B общих параметрах активируется лишь 6.1B на токен (4.8B без эмбеддингов). Архитектура разработана по принципам Ling Scaling Laws (arxiv 2507.17702). Модель обучена на 20T+ токенов и доработана через SFT и многоуровневый RL.

Благодаря соотношению активации 1/32 модель даёт около 7× прироста эффективности по сравнению с плотной архитектурой аналогичного масштаба и достигает 200+ токенов/с на GPU H20 — это в 3× быстрее 36B-плотных конкурентов. С YaRN контекстное окно расширяется до 128K токенов. Основные применения: сложные рассуждения, многошаговая генерация кода, фронтенд-разработка, а также задачи в регулируемых отраслях (финансы, медицина).

Когда выбирать
  • • Комплексные многошаговые задачи рассуждений (уровень GPQA-Diamond, MMLU-Pro), где важна пропускная способность — MoE-активация снижает стоимость токена, сохраняя качество ~40B-плотных моделей.
  • • Генерация кода и фронтенд-разработка — высокие результаты LiveCodeBench v6 и CodeForces делают модель хорошим выбором для агентных coding-пайплайнов через TheRouter.
  • • Профессиональные рассуждения в финансовой и медицинской сферах (FinanceReasoning, HealthBench): открытая SOTA-модель с низкой стоимостью токена предпочтительнее закрытого API.
Когда не выбирать
  • • Мультимодальные задачи и работа с изображениями — Ling Flash 2.0 поддерживает только текст; используйте google/gemini-2.5-flash или meta/llama-4-scout.
  • • Приложения с ультранизкой задержкой (TTFT < 50 мс) — несмотря на высокую пропускную способность, MoE требует загрузки весов экспертов; для таких случаев выберите openai/gpt-4o-mini или google/gemini-2.0-flash-001.

Чем обслуживание в TheRouter отличается от вендорского

Как её эксплуатирует вендор

InclusionAI публикует Ling Flash 2.0 как MIT-licensed open-weight модель Hugging Face с инструкциями для локального запуска, 32K native context и optional 128K YaRN extrapolation.

На TheRouter

TheRouter предоставляет inclusionai/ling-flash-2 через OpenAI-compatible chat route. Operational pricing, context length, regions и supported parameters берутся из live каталога TheRouter, а не из карточки checkpoint на Hugging Face.

Размер контекста
131K
Максимальный вывод
33K
Цена Входза 1M токенов
$0.1512за 1 млн токенов
Цена Выходза 1M токенов
$0.6156за 1 млн токенов

Модальности

Текст→Текст

Разбивка цен

ТипСтавка
Вход$0.1512 за 1 млн токенов
Выход$0.6156 за 1 млн токенов

Поддерживаемые параметры

temperaturemax_tokenstop_pstop

Характеристики

Дата релиза2025-07-23huggingface.co ↗проверено
АрхитектураMoE — 100B всего / 6.1B активированных (4.8B без эмбеддингов), соотношение активации 1/32huggingface.co ↗проверено
Объём обучающих данных20T+ токенов высококачественных данныхhuggingface.co ↗проверено
Дата отсечения данныхНе раскрытонеизвестно
ЛицензияMIThuggingface.co ↗проверено
Пропускная способность (H20)200+ токенов/с — в 3× быстрее 36B-плотных моделей в типичных сценарияхhuggingface.co ↗проверено
Длина контекста32K нативно; 128K с YaRN-экстраполяциейhuggingface.co ↗проверено

Бенчмарки

BenchmarkDistributionScoreSource
MMLU-Pro
SOTA vs dense <40B at launchhuggingface.co ↗
GPQA-Diamond
Competitive vs Qwen3-32B-Non-Thinking and GPT-OSS-120B/lowhuggingface.co ↗
LiveCodeBench v6
Strong — outperforms 36B dense modelshuggingface.co ↗
AIME 2025
Strong advanced math performancehuggingface.co ↗
ARC-Prize
Reported competitive on logical reasoning trackhuggingface.co ↗

Примеры API

Для новых интеграций используйте глобальный endpoint api.therouter.ai из примеров ниже; старый China accelerated endpoint выведен из эксплуатации.

cURL
curl https://api.therouter.ai/v1/chat/completions   -H "Content-Type: application/json"   -H "Authorization: Bearer $THE_ROUTER_API_KEY"   -d '{
    "model": "inclusionai/ling-flash-2",
    "messages": [
      {"role": "user", "content": "Summarize the key points from this input."}
    ]
  }'

Гид по API

Chat completion

cURL
curl https://api.therouter.ai/v1/chat/completions \
  -H "Authorization: Bearer $THEROUTER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"inclusionai/ling-flash-2","messages":[{"role":"user","content":"Explain the Ling 2.0 MoE architecture in one paragraph."}]}'

Ещё от inclusionai

Похожие модели

Аналоги в других провайдерах

Новости и изменения

2025-07-23

InclusionAI открывает Ling Flash 2.0 — 100B MoE с качеством 40B-плотной и скоростью в 3×

InclusionAI выпустила Ling Flash 2.0 на HuggingFace под лицензией MIT. Модель активирует лишь 6.1B из 100B параметров за шаг инференса, обеспечивая 200+ токенов/с на H20 и превосходя или сравниваясь с плотными моделями до 40B на GPQA-Diamond, LiveCodeBench v6, AIME 2025 и FinanceReasoning.

переработано TheRouterhuggingface.co ↗

Частые вопросы

Как Ling Flash 2.0 достигает качества 40B-плотной при всего 6B активных параметрах?

Модель использует MoE-архитектуру с соотношением активации 1/32, спроектированную в рамках исследовательской программы Ling Scaling Laws. Ключевые архитектурные решения — гранулярность экспертов, доля общих экспертов, безлоссовая sigmoid-маршрутизация, MTP-слои, QK-Norm и Partial-RoPE — позволяют малому активному срезу использовать гораздо больший пул параметров. По данным InclusionAI, это даёт около 7× выигрыша в эффективности по сравнению с плотной моделью аналогичного качества.

переработано TheRouterhuggingface.co ↗
Какова максимальная длина контекста?

32K токенов нативно. С YaRN-экстраполяцией (добавьте поле rope_scaling в config.json) окно расширяется до 128K токенов. При увеличении длины вывода преимущество в скорости перед плотными моделями возрастает до 7× и более — благодаря малому числу активных параметров.

Реестр фактов — каждая утверждаемая величина имеет источник
источникURLполучено
Дата релизаhuggingface.co ↗2026-08-13проверено
Архитектураhuggingface.co ↗2026-08-13проверено
Объём обучающих данныхhuggingface.co ↗2026-08-13проверено
Дата отсечения данных——неизвестно
Лицензияhuggingface.co ↗2026-08-13проверено
Пропускная способность (H20)huggingface.co ↗2026-08-13проверено
Длина контекстаhuggingface.co ↗2026-08-13проверено
MMLU-Prohuggingface.co ↗2026-08-13проверено
GPQA-Diamondhuggingface.co ↗2026-08-13проверено
LiveCodeBench v6huggingface.co ↗2026-08-13проверено
AIME 2025huggingface.co ↗2026-08-13проверено
ARC-Prizehuggingface.co ↗2026-08-13проверено
InclusionAI открывает Ling Flash 2.0 — 100B MoE с качеством 40B-плотной и скоростью в 3×huggingface.co ↗2026-08-13проверено
Как Ling Flash 2.0 достигает качества 40B-плотной при всего 6B активных параметрах?huggingface.co ↗2026-08-13к проверке
Какова максимальная длина контекста?huggingface.co ↗2026-08-13к проверке
Помощь и контакты