RL 訓練系統的效率框架與吞吐量匹配
- —RL 訓練系統可視為生產者-消費者模型,Generator 生產 rollout 進入隊列,Trainer 從中消費。
- —系統效率指標包含 Training step time、FLOP/s per GPU 及 MFU,受限於推理吞吐量與沙盒延遲。
- —理想系統應使 Trainer 消費率大致等於有效 Generator 生產率,以最小化閒置時間與策略陳舊度
異步 RL、Partial Rollout 與策略陳舊度權衡
- —PipelineRL 引入異步機制提升吞吐量,但權重在 rollout 進行中更新會導致 Policy Staleness。
- —Slime 框架的 Partial Rollout 可緩解長尾延遲,但環境狀態的陳舊度(State Gap)可能損害訓練信號。
- —異步優化需在提升吞吐量與維持訓練穩定性之間設定 Staleness Budget,以平衡效率與收斂質量
案例分析:Qwen3 與 GLM-5 的 RL 訓練動態
- —Qwen3 實驗顯示長思考鏈會使系統進入 Generation-bound 狀態,迫使系統必須透過 oversampling 應對。
- —GLM-5 案例反映課程難度過低會導致優勢信號消失,模型能力提升引發的行為偏移會顯著改變沙盒負載。
- —模型能力與行為是動態變量,訓練系統必須具備適應推理長度增加與工具調用頻率變化的彈性
沙盒基礎設施的擴展挑戰
- —擴展併發 rollout 數量(如 960 個)會直接挑戰沙盒基礎設施的可靠性與冷啟動延遲。
- —Modal 在高併發下曾出現初始化錯誤,反映出帳號資源配額與 API 觀測工具的重要性。
- —沙盒服務的資源隔離與故障恢復能力,已成為決定 agentic 任務 RL 訓練整體吞吐量的關鍵因素