Artificial Intelligence #artificial intelligence#reinforcement learning
RollArt: Disaggregated Multi-Task Agentic RL Training at Scale on Alibaba's 3,000-GPU Cluster
A new system called RollArt, designed for multi-task agentic reinforcement learning training, decouples workload stages onto optimized hardware and achieves 1.31–2.05× training time reduction. It was validated on Alibaba's cluster with over 3,000 GPUs training a hundreds-of-billions-parameter MoE model.
Jun 17, 2026 1 source