Table with columns: Dataset, Method, Base model, Train batch size, Best val mean@16, Best checkpoint, Final val mean@16, Final checkpoint| Dataset | Method | Base model | Train batch size | Best val mean@16 | Best checkpoint | Final val mean@16 | Final checkpoint |
|---|
| Tool-use / tooluse | RLSD_TR | Qwen3-8B | 32 | 63.42% | 100 | 63.42% | 100 |
Validation Mean@16
| step | val_mean16 | percent |
|---:|---:|---:|---:|
| 10 | 0.572610294118 | 57.26% |
| 20 | 0.600183823529 | 60.02% |
| 30 | 0.588235294118 | 58.82% |
| 40 | 0.605698529412 | 60.57% |
| 50 | 0.619485294118 | 61.95% |
| 60 | 0.614889705882 | 61.49% |
| 70 | 0.602022058824 | 60.20% |
| 80 | 0.610294117647 | 61.03% |
| 90 | 0.625919117647 | 62.59% |
| 100 | 0.634191176471 | 63.42% |
Source
- Checkpoint:
/mnt/mole/SDPO/L2T/checkpoints/datasets/tooluse/qwen3gen-tooluse-RLSD_TR-Qwen-Qwen3-8B-mbs8-decay0-tr0.1-train32-rollout8-lr1e-6-vllm0.8/global_step_100/actor
- W&B run:
run-20260703_141322-che709vc