Теги

Новости по тегу "training-infrastructure"

RSS-лента
Абстрактная визуализация кривых оптимизации sequence-level reinforcement learning со стабильной динамикой обучения

Qwen GSPO: стабильный RL для MoE без Routing Replay

Новый алгоритм GSPO от Qwen снимает нестабильность RL-обучения MoE-моделей: sequence-level оптимизация вместо token-level, без Routing Replay. Результат — стабильное крупномасштабное RL-обучение Qwen3.

источник Qwen
Помощь и контакты