Architecture
Table | |
|---|
| Layers | 24 |
| Hidden | 1536 |
| Heads | 12 (MHA) |
| FFN | 4096 (SwiGLU / silu) |
| Pos. enc. | RoPE (θ=10000) |
| Norm | RMSNorm |
| Embeddings | tied |
| Vocab | 50304 (gpt2 tokenizer) |
| Seq len | 2048 |
| Dtype | bf16 |
Midtrain hyperparameters
Global batch 1024 · seq 2048 · 47,684 steps (~100B tokens) · AdamW β(0.9, 0.95), wd 0.1, grad-clip 1.0 ·
peak LR 3e-4 → min 3e-5, cosine · warmup 2000 steps. Peak LR validated stable via an LR-ablation smoke.
Usage
import torchfrom transformers import AutoModelForCausalLM, AutoTokenizermid = "ftajwar/d24-climbmix-dolmino-midtrain-100b"tok = AutoTokenizer.from_pretrained(mid)model = AutoModelForCausalLM.from_pretrained(mid, torch_dtype=torch.bfloat16).cuda().eval()ids = tok("The first three prime numbers are", return_tensors="pt").to("cuda")print(tok.decode(model.generate(**ids, max_new_tokens=40)[0], skip_special_tokens=True))
Tokenizer
gpt2 BPE (vocab padded to 50304), --append-eod during data prep. It is a base completion model —
prompt it with plain text, not chat turns.