reinforcement-learningGSPO:无 Routing Replay 的稳定 MoE RL 训练Qwen 的 GSPO 将优化从 token 级别转移到序列级别,消除 Routing Replay 开销,为 Qwen3 模型提供稳定的大规模 RLHF 训练。2026年5月19日·来源 Qwen