事件概述

字节跳动 Seed 与清华大学 AIR 联合开源了一个面向大规模 LLM 强化学习的系统 DAPO(GitHub 仓库:BytedTsinghua-SIA/DAPO)。按照仓库首页的自我介绍,这是一套”完全开源”的大规模 LLM RL 系统,开源范围包括算法、代码基础设施与数据集三部分,目标是让更广泛的研究社区能够实际获得可扩展强化学习的实践入口。

算法层面,作者提出了名为 DAPO 的方法,全称是 Decoupled Clip and Dynamic sAmpling Policy Optimization(解耦裁剪与动态采样策略优化)。整个系统构建在开源 RL 框架 verl 之上,仓库中也专门致谢了 verl 提供的基础设施。

从仓库元信息看,该项目已有 23 次提交、1.9k star、89 fork,属于热度较高的开源项目。仓库中包含 eval、img 两个目录,以及 README.md、dapo_paper.pdf、requirements.txt 等文件。

关键结果与技术点

AIME 2024 上的表现

仓库给出的核心结果非常直白:DAPO 基于 Qwen2.5-32B 基座模型,在 AIME 2024 上取得 50 points,据称超过了此前的 SoTA(DeepSeek-R1-Zero-Qwen-32B),并且只用了 50% 的训练步数。

仓库的 News 部分还记录了两个时间节点:

  • 2025/05:更新了完整版 DAPO 的 wandb 训练记录,以及达到 AIME 2024 50%+ 的 checkpoint,同时提供了 AIME 2024 的评测说明。
  • 2025/03:释放了早期版本(不含 Token-level PG Loss 与 Dynamic Sampling)的训练记录,该版本在 AIME 2024 上取得 44%。

训练过程中的指标监控

README 特别强调了训练过程中三类指标的稳定性,这基本对应了大规模 RL 训练最容易翻车的地方:

  1. 长度稳定性与增长:响应长度稳步增加,意味着模型有更大的探索空间,有助于学习更复杂的推理行为,并最终贡献于训练稳定性与性能提升。
  2. 奖励分数稳定性:奖励信号稳定上升,说明模型正在成功拟合训练分布,学习过程稳健一致、没有剧烈波动。
  3. 熵与平均概率趋势:熵在初期下降后出现受控的回升,保证探索与利用之间的健康平衡,避免过拟合或过度随机,从而支撑性能的持续提升。

使用与复现

仓库提供了模型权重 DAPO-Qwen-32B,并给出了完整的推理与评测路径:

  • 环境:推荐用 conda 创建 Python 3.10 环境,然后 pip3 install -r requirements.txt。
  • 推理:基于 vLLM + transformers 的推理示例,示例参数为 temperature=1.0、top_p=0.7、max_tokens=20480、tensor_parallel_size=8、gpu_memory_utilization=0.95,输出格式要求模型以 Answer: 结尾行给出答案。
  • AIME 2024 评测:用 Ray Serve + vLLM 部署模型,然后执行 python eval/eval_aime24.py --temperature 1.0 --top_p 0.7 --max_tokens 20480 --model ... --test_file eval/aime-2024.parquet。
  • 数据集:训练集为 DAPO-Math-17k(一个经过整理与处理的数据集说明为 math dataset),验证集为 AIME 2024。
  • 训练脚本:提供开箱即用脚本,分为两档——DAPO w/o Token-level PG Loss & Dynamic Sampling -- AIME 44 与 DAPO Full -- AIME 50,两者都已在最新版本 verl 上验证,并附有对应的 wandb 训练记录。

此外,仓库说明其开源实验是在 火山引擎机器学习平台(Volcano Engine Machine Learning Platform) 上完成的,并预告后续会提供该平台上的完整复现指南。

对数据科学与 AI Agent 落地的意义

第一,可复现的 RL 配方比单个模型权重更稀缺。 这两年在推理模型上的公开讨论很多,但真正把”算法 + 基础设施 + 数据集 + 训练脚本 + 训练曲线”一次性交出来的项目并不多。DAPO 明确提供 DAPO-Math-17k、AIME 2024 验证集和两个可直接跑的脚本,这意味着团队可以在自己的算力上复现一遍 44 → 50 的跃迁,而不是只能读论文、猜超参。

第二,训练过程的稳定性指标具有工程借鉴价值。 长度、奖励、熵这三条曲线,本质上是 RL 训练的健康度仪表盘。对于任何准备做后训练(post-training)或 RLHF/RLVR 的团队来说,这套观测口径可以直接迁移到自己的训练看板上,用于早期发现探索塌缩、奖励作弊(reward hacking)或熵爆炸等问题。

第三,对 Agent 场景是间接但重要的利好。 DAPO 本身展示的是数学推理任务上的结果,而长链条数学推理正是 Agent 中”规划—反思—纠错”能力的底层技能。一个在 32B 规模上可复现、训练步数更省的开源 RL 方案,意味着中小团队也能尝试用 RL 强化自家 Agent 的推理内核,而不必完全依赖闭源 API。不过需要说明的是,原文未说明该方案在工具调用、多轮交互、代码执行等典型 Agent 任务上的效果,因此向 Agent 场景迁移仍需自行验证。

我的技术点评

从公开信息看,DAPO 最有意思的一点不是”50 分”这个数字,而是它的消融路径被完整摊开了:仓库同时给出了不含 Token-level PG Loss 与 Dynamic Sampling 的 44 分版本,以及完整版本的 50 分版本,两条训练记录都在 wandb 上。这相当于把”算法里哪一块真正在起作用”变成了可检验的实验,而不是论文里一句轻描淡写的 ablation。对于强化学习这种方差大、噪声重、超参敏感的方向,这种透明度比性能本身更值钱。

其次,选择基于 verl 并配套 Ray Serve + vLLM 的评测链路,说明它瞄准的是”能跑起来的大规模训练”而不是玩具 demo。”50% 训练步数达到超越前 SoTA”的说法在算力成本上是很有吸引力的,但需要注意,原文未说明这一对比的具体训练配置、硬件规模与总 token 预算,因此”步数减半”到底等价于多少实际算力节省,还需要复现才能确认。

几个我比较谨慎的地方:

  • 评测面偏窄。目前公开的结果集中在 AIME 2024 这一个数学竞赛基准上,训练数据也是纯数学的 DAPO-Math-17k。一个只在数学上验证过的 RL 配方,能否泛化到通用推理、代码、Agent 任务,原文未说明。
  • 算法细节在 README 中并未展开。”Decoupled Clip”到底如何解耦、”Dynamic Sampling”的采样判据是什么,README 只给了名字和效果,具体定义需要看随仓库提供的 dapo_paper.pdf。此外,完整训练的成本门槛、许可证类型、以及除 32B 之外的模型规模支持情况,原文未说明。
  • 复现指南是”进行中”状态。火山引擎平台上的完整复现指南目前只是预告,对多数不在该平台上的团队来说,参考价值要等文档落地后才能评估。

总的来说,DAPO 是一次诚意很足的开源:它把大规模 LLM 强化学习这件”看起来只有大厂能做的事”拆成了别人可以照着跑的一套东西。短期它的价值在复现与教学,长期的价值则取决于这套配方能否走出数学竞赛、在更泛化的推理与 Agent 任务上站住脚。

原文链接