KOL Digest
Semianalysis · 2026.06.16 週二 · Substack

RL Systems Mind the Gap: Matching Trainer and Generator Throughput

看原始內容 4 個主題 · 4 個標的/題材

RL 訓練系統的效率框架與吞吐量匹配

  • RL 訓練系統可視為生產者-消費者模型,Generator 生產 rollout 進入隊列,Trainer 從中消費。
  • 系統效率指標包含 Training step time、FLOP/s per GPU 及 MFU,受限於推理吞吐量與沙盒延遲。
  • 理想系統應使 Trainer 消費率大致等於有效 Generator 生產率,以最小化閒置時間與策略陳舊度
AI算力 長期

RL 訓練需求呈現 log-linear 擴展特性,對算力效率的要求極高。系統效率決定了模型能力的上限,透過吞吐量匹配框架可優化昂貴的 H200/GB300 資源利用率

異步 RL、Partial Rollout 與策略陳舊度權衡

  • PipelineRL 引入異步機制提升吞吐量,但權重在 rollout 進行中更新會導致 Policy Staleness。
  • Slime 框架的 Partial Rollout 可緩解長尾延遲,但環境狀態的陳舊度(State Gap)可能損害訓練信號。
  • 異步優化需在提升吞吐量與維持訓練穩定性之間設定 Staleness Budget,以平衡效率與收斂質量
AI基建 中期

RL 框架如 Prime RL 與 slime 正快速優化異步調度機制。軟體層面的 Prefill/Decode 分離與異步權重推送,已成為決定 AI 模型訓練效率的核心基建競爭力

案例分析:Qwen3 與 GLM-5 的 RL 訓練動態

  • Qwen3 實驗顯示長思考鏈會使系統進入 Generation-bound 狀態,迫使系統必須透過 oversampling 應對。
  • GLM-5 案例反映課程難度過低會導致優勢信號消失,模型能力提升引發的行為偏移會顯著改變沙盒負載。
  • 模型能力與行為是動態變量,訓練系統必須具備適應推理長度增加與工具調用頻率變化的彈性
半導體 中期

大型 MoE 模型(如 Qwen3 235B)的 RL 訓練對 GPU 顯存與 KV Cache 壓力極大。MoE 架構與推理分離技術的結合,是目前大規模 agentic RL 訓練的硬體基準配置

沙盒基礎設施的擴展挑戰

  • 擴展併發 rollout 數量(如 960 個)會直接挑戰沙盒基礎設施的可靠性與冷啟動延遲。
  • Modal 在高併發下曾出現初始化錯誤,反映出帳號資源配額與 API 觀測工具的重要性。
  • 沙盒服務的資源隔離與故障恢復能力,已成為決定 agentic 任務 RL 訓練整體吞吐量的關鍵因素
AI基建 長期

Agentic RL 需要高度穩定且可快速擴展的容器化環境。沙盒設施的冷啟動優化與內容尋址快取,是目前算力以外最重要的 Agent 訓練基礎設施瓶頸