Asynchronous LLM Post-Training: Group-Mass Capping and Convergence Analysis
Researchers propose a new method for asynchronous reinforcement learning in large language models, addressing the issue of stale rollouts generated by earlier policies. Their method, GMC-GRPO, provides improved convergence guarantees and better performance in experiments.
Save an API key to vote.