Prime Intellect 發布分布式強化學習訓練框架 prime-rl 0.6.0 版本,攻克了萬億參數混合專家模型 MoE 在超長上下文智能體任務下的強化學習 RL 訓練門檻。 大模型能讀完 256k 的超長文本並不罕見,但在強化學習訓練中,為了讓模型通過自主試錯進行推理演練,顯卡必須全程保存 131k 長度下龐大的中間激活值 Intermediate Activations,顯存開銷呈成百上千倍暴漲。此前這需要數千張顯卡構成的龐大集群,而 prime-rl 0.6.0 僅用 28 台 H200 服務器就跑通了 GLM-5 的 131k 上下文強化學習訓練,單步耗時控制在 5 分鐘內。 為解決複雜代碼生成等試錯任務中,極少數長尾耗時任務阻塞全局步調導致顯卡資源長期閒置的問題,框架打破了傳統的同步等待機制,採用完全解耦的異步 RL 架構。後台訓練器在計算出新權重後,無須等待正在進行的試錯任務結束,直接在模型生成文本期間實時下發更新。已分發的任務繼續使用舊策略以保證速度,新任務則注入 KV-cache 鹽強行重建緩存。 針對異步更新中訓練與推理步調不一致容易導致模型邏輯混亂的問題,框架引入路由重放 R3 技術,直接在底層處理專家分發數據,規避了數據轉換帶來的系統延遲,將兩端的不匹配度降低至十分之一,極大穩定了異步訓練。 在底層資源壓榨上,框架通過精細設計徹底解決了顯卡顯存被長文本撐爆的痛點。推理端採用讀與寫計算分離的架構,防止大模型因閱讀大量前情提示而卡死後續的文本生成;同時聯合多張顯卡共享專家知識,並利用 Mooncake 技術把多台服務器的閒置內存和硬盤拼成一個共享緩存池。 在超長文本的並行計算上,針對 GLM-5 採用的 DSA 稀疏注意力機制,框架定製了專屬的並行方案,在確保模型能縱覽全局的同時,將每層顯卡間的數據通信開銷縮減至僅有一次。 在精度對齊上,訓練端與推理端被統一接入 DeepGEMM 算子庫,運行 DeepSeek V3 提出的塊縮放 FP8 方案。兩端統一的精度標準與部分共享的計算內核,大幅降低了訓練與推理間的 KL 散度不匹配,極大緩解了由精度偏差引發的訓練崩潰風險。
|