训练配置
Table with columns: 项, 值| 项 | 值 |
|---|
| 实验名 | exp_rl_v5_v13_gdpo_dim_scoring_stage3 |
| 算法 | GDPO |
| 变体 | 启用 rubric overlay + 分维度打分 (CLAW_RL_DIM_SCORING=1,env 换为 claw_rl.claw_env_dim_scoring,reward 后处理换为 claw_rl.group_filter_dim)。 |
| 起点 | stage3 SFT checkpoint (exp_stage3_v2_merged),其上游为 Qwen3-VL-8B-Instruct |
| 最终 checkpoint | iter_0000560 |
| 训练量 | 561 个 rollout step,约 3 个 epoch,187 条 prompt |
| samples / prompt | 8 |
| rollout batch | 1 |
| global batch | 8 |
| 硬件 | 8xH800,TP=8,colocate |
| 奖励 judge | qwen/qwen-2.5-72b-instruct (OpenRouter) |
学习率、KL 系数等由 slime 的 formal profile 提供,未在启动脚本中显式设置,
故此处不列出,以免给出未经核实的数值。
评测状态
目前没有可信的 held-out 评测数字。 不要把本模型当作已验证优于其起点。
原因:
- cold-start 基线作业(373736)因 sglang JIT 缺
ninja 未能启动,缺少可比基线。
- held-out 驱动脚本会主动拒绝一部分任务(沙箱快照类、多模态输入类),
覆盖率不足 30 题全集,其总分不能当作全集分数引用。
起点 SFT checkpoint 记录的 eval=0.506 是起点的分数,不是本模型的分数。
用法
from transformers import Qwen3VLForConditionalGeneration, AutoProcessor
model = Qwen3VLForConditionalGeneration.from_pretrained(
"zhongweixie/qwen3vl-8b-claw-rl-gdpo-dim-scoring-stage3-iter560", dtype="auto", device_map="auto"
)
processor = AutoProcessor.from_pretrained("zhongweixie/qwen3vl-8b-claw-rl-gdpo-dim-scoring-stage3-iter560")
来源
由 slime/tools/convert_torch_dist_to_hf.py 从 Megatron 分布式 checkpoint
/aifs4su/hansirui_3rd/rl-checkpoints/exp_rl_v5_v13_gdpo_dim_scoring_stage3/iter_0000560 转换而来,缺失权重与 tokenizer/config 取自
exp_stage3_v2_merged_sharded(即该次 RL 训练实际使用的基座)。