Qwen GSPO: стабильный RL для MoE без Routing Replay

Новый алгоритм GSPO от Qwen снимает нестабильность RL-обучения MoE-моделей: sequence-level оптимизация вместо token-level, без Routing Replay. Результат — стабильное крупномасштабное RL-обучение Qwen3.

Опубликовано источник Qwen

Архивный материал, подготовленный с помощью ИИ по указанному источнику и опубликованный без индивидуальной проверки. Ответственный редактор: Joe Werner.

Абстрактная визуализация кривых оптимизации sequence-level reinforcement learning со стабильной динамикой обучения
Машинный перевод с английского оригинала — читать оригинал

AI-инженерные команды, гоняющие у себя reinforcement learning from human feedback (RLHF), сталкиваются с фундаментальной проблемой стабильности: token-level цели оптимизации в алгоритмах вроде GRPO порождают дисперсию, способную обрушить обучение, особенно для моделей Mixture-of-Experts (MoE). Новый алгоритм Qwen — Group Sequence Policy Optimization (GSPO) — решает её, перенося оптимизацию с уровня токенов на уровень последовательностей и делая крупномасштабный RL-тренинг устойчивее и дружелюбнее к инфраструктуре.

Что произошло

Исследователи Qwen опубликовали GSPO (Group Sequence Policy Optimization) — новый RL-алгоритм для обучения языковых моделей. В отличие от предыдущих подходов вроде GRPO, оптимизирующих токен за токеном, GSPO определяет importance ratio на основе правдоподобия всей последовательности и выполняет clipping, награждение и оптимизацию на уровне последовательностей.

Алгоритм избавляет от необходимости в Routing Replay — обходном решении, которое требовалось GRPO для корректной сходимости на MoE-моделях из-за волатильности активации экспертов. Routing Replay кеширует активированных экспертов из старой policy и проигрывает эти routing-паттерны при оптимизации, что добавляет накладные расходы по памяти и коммуникации и ограничивает практическую ёмкость MoE-моделей.

GSPO успешно применили к крупномасштабному RL-обучению свежих моделей Qwen3 (Instruct, Coder, Thinking) — модели демонстрируют непрерывное улучшение качества с ростом вычислительного бюджета.

Почему это важно для AI-инженерных команд

Командам, строящим и дообучающим собственные модели, GSPO даёт инфраструктурное улучшение, которое бьёт по трём ключевым операционным вопросам:

Стабильность обучения: GSPO держит процесс обучения стабильным и снимает проблемы устойчивости, которыми страдал RL-тренинг на MoE. Это значит, что команды могут масштабировать RLHF-усилия, не рискуя обрушением модели, которое съедает compute и время.

Накладные расходы инфраструктуры: Уйдя от зависимости от Routing Replay, GSPO устраняет необходимость кешировать и проигрывать routing-паттерны. Это снижает потребление памяти, стоимость коммуникации и сложность реализации для команд, разворачивающих MoE-модели с RLHF-пайплайнами.

Толерантность к точности: Sequence-level оптимизация GSPO принципиально устойчивее к расхождениям точности, чем token-level подходы. Отсюда интересная возможность: использовать правдоподобия, возвращаемые inference engine, напрямую в оптимизации, а не пересчитывать их обучающим движком. Для архитектур с разделением training и inference или для сценариев partial rollout это может существенно упростить инфраструктуру.

Угол router/operator

Сам TheRouter не занимается обучением моделей, но следствия GSPO влияют на то, как AI-инженерные команды думают о выборе провайдера и планировании инфраструктуры:

Решения о тренинге с учётом стоимости: Командам, рассматривающим in-house RLHF, стоит закладывать в расчёт инфраструктурную экономию от sequence-level оптимизации. Отказ от Routing Replay снижает требования к железу и эффективнее использует существующий compute. При сравнении стоимости дообучения с покупкой более крупных предобученных моделей эта экономия может перевесить чашу весов.

Прозрачность провайдеров по методам обучения: По мере того как провайдеры всё активнее применяют RLHF для улучшения reasoning и следования инструкциям, командам стоит спрашивать про стабильность обучения и инфраструктурные практики за этими улучшениями. Обучение на GSPO намекает на более надёжный и предсказуемый по поведению fine-tuning — что важно для приложений, требующих стабильных выходных паттернов.

Жизнеспособность MoE-архитектур: Стабильность MoE RL с GSPO снимает ключевой барьер к использованию MoE-архитектур в продакшен-RLHF. Команды, ранее избегавшие MoE из-за нестабильности RL, теперь могут рассматривать эти архитектуры для parameter-efficient дообучения.

За чем стоит следить пользователям TheRouter

Отслеживайте принятие GSPO или похожих sequence-level RL-алгоритмов крупными провайдерами моделей. Широкое распространение может означать появление большего числа дообученных моделей со стабильными reasoning-характеристиками — это влияет на решения маршрутизации при выборе fine-tuned вариантов под конкретные задачи.

Если ваша команда оценивает in-house RLHF, прогоните бенчмарк GSPO-реализаций против token-level RL, чтобы измерить прирост стабильности и экономию инфраструктуры. Фреймворк принятия решений по RLHF теперь должен включать sequence-level оптимизацию как ключевое техническое измерение наравне с бюджетом на compute и качеством данных.

Для production-систем, опирающихся на дообученные модели, оцените, демонстрируют ли провайдеры с sequence-level RL более предсказуемое поведение между запусками обучения. Консистентность результатов fine-tuning упрощает процессы квалификации моделей и снижает необходимость частой ревалидации.

Читать техническую статью про GSPO — там детали алгоритма и сравнительные бенчмарки против GRPO.

Чёткая редакционная визуализация диаграммы маршрутизации моделей с qwen3.8-max в качестве узла верхнего уровня, абстрактные линии на матовом тёмном фоне

Qwen3.8-Max — теперь топовая модель DashScope: что смена флагмана меняет в вашей routing-политике

qwen3.8-max появился на DashScope: 2.4T параметров, 1M контекст и режим размышлений — а qwen3.7-max переведён в legacy. Что меняется для команд, маршрутизирующих трафик на флагманский уровень Qwen.

источник Alibaba Cloud
Помощь и контакты