Đã làm gì
ESFT (arXiv 2407.01906): chấm điểm expert trên dữ liệu task, chọn nhóm expert mà router thực sự
gửi token tới, rồi train thẳng trọng số gốc của nhóm đó — đóng băng mọi thứ còn lại, kể cả router.
Table | |
|---|
| base | deepreinforce-ai/Ornith-1.0-35B (qwen3_5_moe, 40 layer × 256 expert, top-8) |
| dữ liệu | ianncity/GLM-5.2-Conversation — 6000 mẫu ≤2048 token (CoT science/math/code) |
| chấm điểm | 96 mẫu, token-selection ratio, hook trên Qwen3_5MoeTopKRouter |
| chọn | top_p=0.20 → 19.1 expert/layer; cắt theo trần 1.5B → 444 expert (11.1/layer) |
| train | 1 522 532 352 tham số (4.4%) + shared_expert; router và attention đóng băng |
| optimizer | AdamW, lr 1e-5, wd 0.1, betas (0.9, 0.95), grad-clip 1.0, cosine + warmup 3% |
| batch | 1 chuỗi × grad-accum 8 |
| đã chạy | 63 step / 750 (dừng theo hạn thời gian), 647 997 token |
| phần cứng | 1× GB10, bf16, grad-checkpointing, 207 tok/s |
top_p=0.20 chỉ cần 19.1/256 expert mỗi layer — nếu router rải đều thì phải cần 51.2, tức
routing tập trung gấp 2.7 lần ngẫu nhiên. Đây là số đo xác nhận tiền đề của ESFT trên model này.
Kiểm chứng phép ghép
Trọng số expert đã train được ghép trở lại checkpoint gốc ở mức shard safetensors:
- expert được chọn:
||ΔW||/||W₀|| = 1.95e-3 … 5.87e-3 (trung bình 2.88e-3), không tensor nào = 0
- expert không chọn:
||ΔW||/||W₀|| = 0.000 (bit-for-bit như gốc)
Ghi công & giấy phép
Model gốc deepreinforce-ai/Ornith-1.0-35B, MIT. Bản này giữ nguyên MIT.
Phương pháp: Wang et al., Let the Expert Stick to His Last: Expert-Specialized Fine-Tuning for
Sparse Architectural Large Language Models, EMNLP 2024 — https://arxiv.org/abs/2407.01906