
Qwen GSPO: стабильный RL для MoE без Routing Replay
Новый алгоритм GSPO от Qwen снимает нестабильность RL-обучения MoE-моделей: sequence-level оптимизация вместо token-level, без Routing Replay. Результат — стабильное крупномасштабное RL-обучение Qwen3.
источник Qwen