OpenRLHF

中文 Tutorial 入门书 · 千亿模型 PPO/GRPO 工业级 RLHF

📌 OpenRLHF/OpenRLHF · main · commit 6c6056daa522 (2026-05-26) · v0.10.3 · 详见 版本基线表

OpenRLHF 是开源社区维护的、主打"千亿模型 PPO/GRPO 工业级 RLHF"的高性能分布式框架。 把 Ray + DeepSpeed + vLLM 三件套拼成统一架构,让 RLHF 中最慢的 rollout 阶段跑在 vLLM 上,吞吐 2-10× 提升。

面向:想做"千亿模型 PPO/GRPO 工业级 RLHF"的工程师;对 Ray + vLLM 异构架构感兴趣的研究者。

前置:理解 RLHF 基本三阶段(SFT/RM/PPO);用过 Ray 或愿意学。

·完整目录

章节标题状态
序 千亿模型 PPO 怎么训得动✅
第 1 章 项目背景与定位✅
第 2 章 安装与依赖(Ray / DeepSpeed / vLLM 三件套)✅
第 3 章 快速上手:单机 PPO demo✅
第 4 章 核心概念:Actor / Critic / Reference / Reward 四个角色✅
第 5 章 Ray 在 OpenRLHF 里做什么✅
第 6 章 vLLM rollout:采样为什么放在 vLLM✅
第 7 章 DeepSpeed 训练后端配置✅
第 8 章 三种部署模式:colocated / hybrid / fully distributed✅
第 9 章 算法:PPO / GRPO / RLOO / REINFORCE++ / DAPO✅
第 10 章自定义 Reward 函数与数据✅
第 11 章常见错误:Ray 死锁、显存爆、KL 失控✅
第 12 章案例:从 SFT 模型到 70B PPO✅
第 13 章源码导读:Trainer / Strategy / Engine✅

·怎么读这本书

配套源码

../../repos/openrlhf/ 已克隆好(commit 6c6056daa522),书中所有源码引用都基于该 commit 精确成立。