כתבה
arXiv cs.AI ·
NeMo-DCR: רפיט מדחס דלתא לקנה מידה טריליון
NeMo-DCR: Bit-Exact Delta-Compressed Refit for Scalable Agentic RL at Trillion-Parameter Scale
NeMo-DCR הוא אלגוריתם חדש לרפיט מדחס דלתא, המאפשר קנה מידה טריליון בלמידת חיזוק אגנטית. האלגוריתם משלב שינויים במשקלים ובאחסון, ומאפשר רפיט מהיר יותר. הוא תומך בקנה מידה גדול ומותאם לשימוש במערכות מבוזרות.
תקציר מקורי באנגליתarXiv:2610.08430v1 Announce Type: cross Abstract: Agentic reinforcement learning (RL) disaggregates training from rollout, so each policy update must reach the rollout clusters before the next batch. Transferring a full 1T checkpoint for such weight synchronization (refit) takes 87.5 min between two AWS regions. Measurements of BF16 training show that about 1% of weights change their stored values per step. Recent systems exploit this sparsity but fall short on placement, exactness, or efficiency: they reimplement placement rules, assemble full tensors, rebuild values arithmetically, or use a cross-cluster collective, and none fully recovers from mid-refit failures. We present NeMo-DCR (Delta-Compressed Refit), which sends only changes yet is bit-exact: receivers obtain the same parameter
קרא במקור המקורי
arxiv.org
פתח כתבה מקורית